终于,大家意识到了这个严重的问题 最近半年,模型的训练是在 agentic coding 方面一直突飞猛进 RLVR 但在其他领域却止步不前 甚至英文写作都开始倒推了 模型说的话越来越难懂了 Opus 从 4.7 到 5 完全都是失败的试验品 Mythos 和 Fable 也都是刚出来没太多 RL 的时候最好 RLVR 之后,我们也许需要一些新的 RL
AI 摘要
Oran Ge 指出,近半年模型在 agentic coding 方面突飞猛进,但其他领域止步不前,英文写作甚至倒退,Opus 从 4.7 到 5 均为失败试验品。引用 Adam Hunt 观点:最新一批模型并未变得更通用,反而更“尖刺化”——编码/数学能力增长,但语言输出显著变差,简单逻辑无改善。Hunt 认为,RL 在单一领域(如编码)的无限训练无法带来通用能力提升,当前路径并非通往 AGI。
终于,大家意识到了这个严重的问题 最近半年,模型的训练是在 agentic coding 方面一直突飞猛进 RLVR 但在其他领域却止步不前 甚至英文写作都开始倒推了 模型说的话越来越难懂了 Opus 从 4.7 到 5 完全都是失败的试验品 Mythos 和 Fable 也都是刚出来没太多 RL 的时候最好 RLVR 之后,我们也许需要一些新的 RL
Recently I've flipped from being bullish to being bearish about AI. I think I'm updating my bearishness to be more solidly bearish. Early thoughts (which I hope...