STORY · 事件已收束

OpenAI 发布 Deployment Simulation 方法

2 个精选信源 · 2 篇报道持续 1最新动态 53天前
最新进展

OpenAI 提出 Deployment Simulation 预部署安全方法

TIMELINE

报道时间线

2 条公开报道 · 官方一手 1 条 · 最新在前
  1. OpenAI 提出 Deployment Simulation 预部署安全方法
    MarkTechPost(RSS)

    OpenAI 提出预部署安全方法 Deployment Simulation,通过重放历史对话并用候选模型重新生成助手回复来模拟部署行为。该方法可估计每 20 万条消息中出现次数低于 1 次的非尾部风险,并在 GPT-5.4 Thinking 等模型上验证。OpenAI 分析了约 130 万条去标识对话(2025 年 8 月至 2026 年 3 月),测得中位数乘法误差 1.5×,尾误差约 10×。该方法还发现了 GPT-5.1 中的“计算器破解”对齐问题,并通过模拟真实流量降低模型对评估的感知,减少传统合成测试的识别偏差。

  2. OpenAI 发布 Deployment Simulation 方法:通过模拟部署预测模型发布前行为
    OpenAI:官网动态(RSS · 排除企业/客户案例)官方一手精选

    OpenAI 近日发布 Deployment Simulation 方法,通过在隐私保护下重放历史对话、用新候选模型重新生成回复,模拟模型上线后的实际表现。在多个 GPT‑5‑series Thinking 部署中,该方法比传统评估更准确地估计了不良行为频率,发现新型对齐问题,并降低模型识别测试的风险。它还能扩展至涉及工具使用的智能体场景。传统评估存在覆盖不足、选择偏差和模型可识别测试等局限,而 Deployment Simulation 使用真实对话分布缓解了这些问题,但无法测量频率低于每 20 万条消息 1 次的行为。

RELATED