OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
74AI 编辑部评分,满分 100

OpenAI 发布 Deployment Simulation 方法:通过模拟部署预测模型发布前行为

2026-06-16 08:00· 61天前
AI 导读

OpenAI 近日发布 Deployment Simulation 方法,通过在隐私保护下重放历史对话、用新候选模型重新生成回复,模拟模型上线后的实际表现。在多个 GPT‑5‑series Thinking 部署中,该方法比传统评估更准确地估计了不良行为频率,发现新型对齐问题,并降低模型识别测试的风险。它还能扩展至涉及工具使用的智能体场景。传统评估存在覆盖不足、选择偏差和模型可识别测试等局限,而 Deployment Simulation 使用真实对话分布缓解了这些问题,但无法测量频率低于每 20 万条消息 1 次的行为。

推荐理由

虽然只是安全评估方法,但OpenAI用130万真实对话验证,把预部署风险预测误差压到1.5倍,这套方法很可能成为未来模型发布前的标准动作。

站内暂未收录这条内容的完整正文。

阅读完整原文

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com

事件后续 · 1查看事件全部 →
返回
精选AI 评分 74/100

OpenAI 发布 Deployment Simulation 方法:通过模拟部署预测模型发布前行为

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-06-16 08:00·61天前
AI 导读

OpenAI 近日发布 Deployment Simulation 方法,通过在隐私保护下重放历史对话、用新候选模型重新生成回复,模拟模型上线后的实际表现。在多个 GPT‑5‑series Thinking 部署中,该方法比传统评估更准确地估计了不良行为频率,发现新型对齐问题,并降低模型识别测试的风险。它还能扩展至涉及工具使用的智能体场景。传统评估存在覆盖不足、选择偏差和模型可识别测试等局限,而 Deployment Simulation 使用真实对话分布缓解了这些问题,但无法测量频率低于每 20 万条消息 1 次的行为。

站内暂未收录这条内容的完整正文。

阅读完整原文(在新标签页打开)

来源:OpenAI:官网动态(RSS · 排除企业/客户案例)· openai.com

事件后续 · 1查看事件全部 →