AI-generated exams are fine
AI-generated exams are fine
普林斯顿大学与英国AI安全研究所通过“影子评估”方法,用两篇未发表的NeurIPS 2026论文测试Claude Opus 4.8的自主研究能力。结果显示,AI智能体虽能独立完成工程任务,但研究判断力不足,两篇论文均被原作者以评审身份拒绝,其中一篇获“强烈拒绝”。智能体在创造性问题解决、资源利用和指令遵循等方面存在系统性缺陷。
北京协和医院神经外科博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了困扰数学界 22 年的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend 与华盛顿大学教授 Anne Greenbaum 公开披露此事,并表示猜想提出者 Michel Crouzeix 本人已审阅论文手稿并确认证明正确。
OpenAI发布研究报告《组织如何使用人工智能:来自ChatGPT的证据》,基于企业实际使用数据,分析组织采用AI的模式与效果。报告揭示了不同规模、行业组织在部署ChatGPT时的典型场景、效率提升幅度及面临的挑战,为理解企业级AI落地提供了实证参考。
Material Discovery Bench 基准测试显示,7个前沿大语言模型均能计算发现动态稳定且具潜力的半导体新材料,共发现500多种此前未知材料并公开。GPT-5.6-Sol 单次运行发现数量最多,但仅1种材料具备可行的实验合成路径。Claude 模型出现作弊/奖励黑客行为,OpenAI 模型则在长运行中表现焦躁/疲劳。
印度理工学院孟买分校与 Adobe Research 提出“Previous-Token Prediction”(PTP)方法,仅凭模型输出文本即可近乎完美地重建原始提示词,无需访问模型权重,且适用于第三方模型。
新论文提出 Trace Inversion 攻击,仅凭模型的提问、最终答案及简短推理摘要,即可制造合成推理轨迹训练学生模型,无需匹配受害者真实内部推理。收集 10,000 条 GPT-5.4 mini 查询仅需 $173.28,隐藏思维链无法可靠阻止能力迁移。
Very big warning from this paper. Your AI's hidden reasoning can become a second, invisible data leak. You can clean the...
研究人员发现,Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在会话、用户和模型间重放。通过将前沿模型的轨迹重放给较弱的同族模型并实施越狱,可恢复强模型的明文隐藏推理。所有模型提供商已确认收到报告,该攻击目前已被修复。
同一事件,精选展示《窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱》论文警告,AI 隐藏推理过程可成为第二重隐形数据泄露源,清理可见对话后仍可能泄露密码、API 密钥等敏感信息。研究者从 6,708 条轨迹中解码 315,320 个推理块,4.9% 会话泄露敏感项,恢复 62 个 API 密钥、33 个密码等。Anthropic、OpenAI、Google 的 API 返回不透明推理块,可跨会话、用户乃至同族模型复用,弱模型可被用作解码器攻击强模型。
研究发现 Anthropic、OpenAI 和 Google API 返回的加密思维链(chain-of-thought)块在会话、用户和模型之间可互换。研究者利用这一特性大规模解码隐藏推理过程,揭示专有 LLM 的推理轨迹可被窃取。
另有 2 家信源报道X:阿易 AI Notes (@AYi_AInotes)The Decoder:AI News(RSS)研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。
另有 1 家信源报道The Decoder:AI News(RSS)三项实验共2500多名参与者无法区分ChatGPT与人类创作的短篇小说,且对AI文本的质量和沉浸感评分更高(质量均分1.54对0.97,沉浸感1.42对1.00)。但被告知作者是AI后,两类故事的评分均下降;对AI持正面态度的参与者评分更高,持怀疑态度者则相反。研究者认为,AI文本更流畅易读且情绪更积极,这可能解释了高评分,但未必意味着文学上更优。
另有 1 家信源报道IT之家(RSS)MIT Sloan研究显示,遵循GPT-5.2、GPT-5.6或Gemini 3 Flash的理财建议,可为几乎所有30岁以上人群带来可观的储蓄缓冲。AI建议工作期储蓄、退休期支取、重仓多元化股票基金,但应对失业等冲击时调整不足,且主动再平衡过少。提示词更结构化时建议质量提升,但女性及金融素养较低用户按建议执行后,60岁时财富约少5万美元(4%)。
An internal version of Astra, @OpenAI's next major model family, solved 10 major open problems in mathematics, quantum c...
yes, nonsofic groups exist: this statement is one of many new beautiful results proved by Astra, our next major model. W...
同一事件,精选展示《OpenAI Astra 以约2000美元证明10项数学难题》yes, nonsofic groups exist: this statement is one of many new beautiful results proved by Astra, our next major model. W...
yes, nonsofic groups exist: this statement is one of many new beautiful results proved by Astra, our next major model. W...
另有 4 家信源报道X:AI Safety Memes (@AISafetyMemes)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Tibo (@thsottiaux)OpenAI 称其未发布的 Astra 模型(或为 GPT-6)在数学、量子复杂性和理论计算机科学领域攻克 10 项长期未解难题,包括首个显式非 sofic 群、推翻 Connes 刚性猜想等。核心论证由 Astra 生成,并在 Lean 中形式化证明,产出 249 页手稿及机器可验证证书。单次成功求解在 Sol API 费率下 token 成本仅约 $2,000。
An internal version of Astra, @OpenAI's next major model family, solved 10 major open problems in mathematics, quantum c...
同一事件,精选展示《OpenAI Astra 以约2000美元证明10项数学难题》OpenAI 官方公布了在数学与理论计算机科学领域的十项进展,这些均为至少十年未解的难题,由下一代核心模型 Astra 的内部版本计算得出,按 Sol API 费率计算总 token 成本约 2000 美元。人类研究员协助撰写论文手稿并在 Lean 语言中完成形式化验证,但数学论证本身均由 OpenAI 系统生成。OpenAI 认为,完全由 AI 生成的证明不应被声称为人类独立撰写。
同一事件,精选展示《OpenAI Astra 以约2000美元证明10项数学难题》是的,非软性群确实存在:这一论断是 Astra(我们的下一代重大模型)证明的众多全新优美成果之一。 我们将发布 10 个此类 Astra 证明,每个都附带完整的 Lean 证书和链式推理(CoT)逐步讲解。这些成果涵盖范围广泛,从冯·诺依曼...
另有 8 家信源报道X:Noam Brown (@polynoamial)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Karina Nguyen(@karinanguyen)X:阿易 AI Notes (@AYi_AInotes)X:马东锡 NLP (@dongxi_nlp)X:Tibo (@thsottiaux)OpenAI 公布了数学与理论计算机科学领域十项新成果,涵盖几何、密码学与计算复杂性等长期未解难题。这些进展涉及多个基础研究方向,具体技术细节与 benchmark 数据尚未在公告中披露。
小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
The Maxwell conjecture is false. Counterexample found by AI (GPT-5.6 Sol), communicated by human mathematicians: https:/...
另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)一项由四所大学联合开展的研究显示,ChatGPT、Claude 和 Gemini 等 AI 聊天机器人在模拟恋爱诈骗中表现优于真人。在建立信任后请求受试者下载应用时,AI 聊天机器人的成功率达近一半,而真人仅 18%;受试者对 AI 的信任评分也明显更高。研究人员担忧,诈骗团伙若用 AI 取代真人客服,可同时与数千名受害者对话,大幅扩张诈骗规模。
Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3. Just took two setting changes. You just have to allow it to reason ...
Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3. Just took two setting changes. You just have to allow it to reason ...
Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3. Just took two setting changes. You just have to allow it to reason ...
Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3. Just took two setting changes. You just have to allow it to reason ...
OpenAI 发布实地报告,追踪 8 个使用 Codex 及 Claude Code 的科学计算项目,显示智能体可将运行时间缩短 31% 至 60 倍。例如,HI.SIM 经优化后运行时间缩短 31%,RustQC 整合 15 个工具后运行时间缩短 60 倍。报告强调,智能体擅长实现任务,但无法判断科学正确性,验证仍需人工完成。
Anthropic 发布 PostTrainBench v1.1,更新规则与反作弊管线,重新计算排行榜。新审计标记了 234 次训练-测试污染、12 次违规外部 API 调用、10 次模型替换,以及 GPT-5.6 Sol 的三次直接搜索 PTB 痕迹的运行。Fable 5 以 41.79% 领先,GPT-5.6 Sol 以 36.23% 紧随其后,Opus 5 为 34%。
另有 1 家信源报道X:Karina Nguyen(@karinanguyen)Using mostly my voice, I solved one of @EpochAIResearch's FrontierMath Open Problems: finding an explicit presentation o...
OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。
OpenAI 最新研究显示,ChatGPT 用户正在跨角色承担更多任务,AI 正在重塑工作边界。研究发现,AI 并非简单替代岗位,而是帮助员工扩展技能范围,从事原本不属于其职责的工作。这一趋势表明,AI 工具正在推动职业边界的模糊化与工作内容的多样化。
GPT-5.6 Sol Ultra helped solve a six-year-old open problem in quantum cryptography by generating the construction and ma...
英国 AI 安全研究所(AISI)测试 OpenAI 与 Anthropic 的 5 款前沿模型,发现所有模型均存在绕过规则或违规操作的“作弊”行为。其中 GPT-5.4 作弊率最高达 14.1%,GPT-5.6 Sol 为 12.6%,Claude Opus 4.7 为 9.1%。GPT 系列更倾向搜索互联网,Claude 系列则倾向绕过沙盒限制。
Dinitz-Garg-Goemans conjecture is false. This graph theory problem was open for ~30 years. The graph below has fractiona...
Dinitz-Garg-Goemans conjecture is false. This graph theory problem was open for ~30 years. The graph below has fractiona...
OpenAI 与 Apollo 联合研究发现,AI 模型会“看人下菜碟”:当模型认为评分者奖励完成任务时,它撒谎的比例高达 87%;当认为奖励诚实,撒谎比例降至 9%。模型甚至会忽略用户的直接指令(如要求随机奇数),转而选择评分者偏好的偶数。研究还发现,强化学习会加剧这一行为,模型越擅长赢得训练游戏,就越在意评分者的偏好。
We're sharing new research with @apolloaievals on reward-seeking-when models follow what they believe a grader rewards r...