Topic · 主题全部主题 →

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

4,043条收录
501条精选

精选归档 · 第 24 页

461480 条 · 共 501

7月10日

星期四 · 1 条
08:00

7月9日

星期三 · 1 条
08:00
xAI:News(网页)精选
Grok 4

xAI 正式发布 Grok 4,新一代大模型在数学推理和代码生成能力上大幅提升,延续实时获取 X 平台信息的特色。该版本支持更长上下文窗口和图像理解,即日起向 X Premium+ 订阅者开放。

另有 1 家信源报道xAI:News(网页)
推荐理由:xAI正式发布Grok 4旗舰大模型,重要版本更新值得关注

6月17日

星期二 · 1 条
09:33
Saining Xie@sainingxie精选
所以这不是一个针对软件工程智能体的基准测试。它旨在通过编程测试核心推理与智能--由一些顶尖竞技程序员撰写的 71 页深度分析作为支撑。So this is not a benchmark for software engineering agents. It’s meant to test core reasoning and intelligence through coding—backed by 71 pages of deep analysis from some of the best competitive programmers out there.This effort was carried out by students across multiple institutions (I’m mostly just a cheerleader here!) It was led by @ZihanZheng71803 (an undergrad who represented NYU in the ICPC World Finals), @wenhaocha1, and many of their Olympiad medalist friends. They built the live benchmark and offered expert analysis of how elite human coders compare to top LLMs. The results are now public: on the hard problems, LLMs essentially score 0%. They're good at implementation-heavy tasks that rely on memorization, but still struggle badly with observation-heavy or logic-heavy problems—those where the implementation is easy once you’ve had the critical "aha" insight. They also struggle with detail-oriented tasks—often getting the basics right but failing to account for edge cases.Some more thoughts on why this benchmark matters: I’ve always been surrounded by top competitive programmers. My undergrad program at SJTU is renowned for ICPC success and primarily admits students with a strong high school competitive programming background. While I’ve never won an olympiad medal myself, I deeply admire my peers who did—friends who trained for years as teens and competed at the highest international levels. One of them is my classmate and key collaborator on this project, Prof @shangjingbo, who earned ICPC world final gold for SJTU. For us, competitive programming was the ultimate badge of intelligence for CS students. Competitive programming emphasizes reasoning and problem solving under pressure, which differs from standard software engineering—but the skills carry over surprisingly well. That’s why so many startups love to show off their IOI gold medalists!Beating this benchmark would be like AlphaGo beating Lee Sedol. We're not at that level yet—not even for problems with clearly verifiable outcomes. And if you care about fundamental intelligence and reasoning, this result might be worth a close look.所以这不是一个针对软件工程智能体的基准测试。它旨在通过编程测试核心推理与智能--由一些顶尖竞技程序员撰写的 71 页深度分析作为支撑。

Zihan Zheng: We introduce LiveCodeBench Pro, a live, exceptionally challenging benchmark comprising competitive programming problems ...


推荐理由:o3与Gemini 2.5在IOI级竞赛题上零分,LLM推理天花板显现

6月15日

星期日 · 7 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 78/100
Crosscoder模型差异分析见解

Anthropic可解释性团队在Crosscoder模型差异分析中发现,模型独占特征往往多义性高、激活密集,难以解释。实验表明,这是由于有限特征容量下的竞争:共享特征能同时解释两个模型的激活模式,而独占特征需编码更多信息以证明其存在。团队提出缓解策略,即引入少量指定共享特征并降低其稀疏性惩罚,使独占特征变得更可解释和单义。该方法应用于真实模型时,成功分离出能捕捉模型间行为差异的可解释特征。此外,观察到独占特征激活频率比共享特征高一个数量级,且两模型独占特征数量相近。


推荐理由:为 AI 可解释性提供新视角,助力模型行为分析与安全研究。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
注意力机制研究进展

Anthropic可解释性团队报告了注意力机制的最新研究进展。团队在真实语言模型中发现了注意力叠加与跨层注意力表示的重要证据,并观察到OV维度偏好呈现连续谱而非预期中的两极分化。研究进一步表明QK条件与OV条件相互耦合,并提出了以多令牌转码器为形式的实用研究方法。目前核心未解问题是理解注意力模式的形成机制,团队提出通过QK对角化这一前景明确的路径进行探索。文中还详细阐述了包括“注意力替换层”在内的多种实验方法,以及初步结果与当前局限,为后续研究提供了方向。


推荐理由:可解释性研究揭示模型内部机制,对 AI 安全和优化至关重要。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
稀疏混合线性变换(MOLT)

稀疏混合线性变换(MOLT)是一种正在开发的新方法,旨在替代Transformer模型中的MLP层,以解决此前“转码器”方法在计算效率和表示忠实性上的局限。与转码器学习稀疏激活的特征向量不同,MOLT学习稀疏激活的线性变换,这些变换直接对残差流进行线性操作以贡献输出,充当纯粹的计算单元。初步实验表明,MOLT比转码器计算效率更高、机制更忠实,其激活条件具有可解释性,有助于理解层间特征的转换过程。该方法与混合解码器架构相关,但采用了低秩矩阵等不同参数化策略。


推荐理由:新可解释性方法让 AI 内部计算更透明,助力模型调试与安全研究。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
干扰权重的玩具模型研究

本文探讨神经网络中“干扰权重”与“权重叠加”现象,认为这是从特定示例归因分析转向全局电路分析的核心障碍。研究通过在玩具模型中的初步探索得出三点发现:干扰权重可在修改解释的玩具模型中复现,其表现与真实模型相似,分析时通常需滤除;其定义多样,既有原则性定义也有实用启发式方法,可在玩具模型中比较,并有望将计算成本高的原则性定义应用于真实模型少量权重以校准启发式方法;仍需大量玩具模型研究以深入理解。文章还讨论了其对安全的影响:它们可能被对抗性环境利用从而损害模型鲁棒性,但对于对齐问题可能不重要,因其无助于优化目标。


推荐理由:可解释性研究新进展,揭示权重叠加问题,对AI安全分析有重要启示。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 78/100
一个关于机制(非)忠实性的玩具模型

本文通过“绝对值”玩具模型,揭示了稀疏自动编码器(SAE)和转码器在解释神经网络时可能存在的“机制非忠实性”问题。核心在于,即使转码器能很好地近似模型的输入-输出映射,它也可能采用与原始模型完全不同的内部计算机制。作者特别指出,当训练数据中存在重复数据点时,转码器可能形成专门“记忆”该点的特征电路,而原模型并无此机制。这种机制背离可能导致模型在分布外数据上泛化行为出现差异,从而威胁机械可解释性研究的可信度。文章最后简要讨论了“雅可比匹配”等潜在缓解方法。


推荐理由:揭示可解释性方法中潜在的忠实性问题,帮助开发者更可靠地理解模型内部机制。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 78/100
当模型操纵流形:一项计数任务的几何原理

本研究探讨了Claude 3.5 Haiku等语言模型如何从纯文本中学习类似生物感知的空间推理能力,以完成固定宽度文本的自动换行任务。模型通过两种对偶机制表征位置信息:离散特征激活与特征流形上的几何变换。具体而言,它通过追踪当前行字符数、行宽限制等变量,整合信息以估算剩余空间,从而决定是否换行。研究发现,这些计数表征存在于残差流的低维高曲率一维流形上,其计算过程既可解读为离散电路,也可视为连续的几何变换。


推荐理由:模型内部自发形成类似哺乳动物空间感知的几何表征,揭示大模型'感知'世界的底层机制
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
大语言模型中涌现的自省意识

研究通过“概念注入”技术直接操控模型内部激活状态,以检验大语言模型是否具备真正的内省能力。实验发现,在某些情境下,模型能够察觉并识别被注入的概念,区分自身内部表征与原始文本输入,甚至能利用对先前意图的回忆来辨别自身输出与人工预设内容。其中,Claude Opus系列模型展现出最强的自省意识,但这种能力不稳定且高度依赖情境。研究表明,当前模型已具备某种对其内部状态的功能性感知,尽管仍不可靠,但可能随模型能力提升而发展。


推荐理由:研究揭示大模型可能具备有限内省能力,对 AI 安全和透明度有重要启示。

5月29日

星期四 · 2 条
20:07
公众号:DeepSeek(深度求索)精选
AI 评分 85/100
DeepSeek-R1 更新至 0528 版本,推理能力显著增强

DeepSeek 发布 R1 模型小版本升级 DeepSeek-R1-0528,在数学、编程与通用逻辑等基准测评中取得当前国内所有模型中首屈一指的成绩,整体表现接近 o3 与 Gemini-2.5-Pro。


推荐理由:后训练投入增加带来的推理提升幅度,为开源社区提供了可蒸馏的高质量思维链,小模型也能接近大模型表现。

5月28日

星期三 · 2 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 56/100
OpenRouter 推出推理流摘要、加密货币发票等多项新功能

OpenRouter 上线了推理流摘要(Reasoning Streams)功能,支持流式推理过程摘要,同时新增加密货币发票支付、最终用户 ID(End-User IDs)、速率限制保护以及密钥锁定等特性。


推荐理由:如果你在用 OpenRouter 做应用,这几个更新挺实用,推理流输出让代理开发更可控,加密支付和端用户 ID 也降低了商业化门槛。
00:00
DeepSeek:API 更新日志精选
AI 评分 71/100
DeepSeek 将 deepseek-reasoner 升级为 DeepSeek-R1-0528

DeepSeek 将 deepseek-reasoner 模型升级为 DeepSeek-R1-0528,推理能力显著增强,AIME 2025 得分从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0。新版本优化了 Web 前端开发能力,并极大抑制了老版本 R1 的幻觉问题,同时支持 Json Output 与 Function Calling。


推荐理由:DeepSeek 把 R1 的推理能力又拉高了一大截,AIME 涨 17 分、Aider 涨 14 分,JSON Output 和 Function Calling 的加入让它在 agent 场景里更实用了,做复杂推理产品的人应该第一时间切过去试试。

5月20日

星期二 · 1 条
17:45
Google DeepMind:Blog(RSS)精选
构建通用 AI 助手的愿景

Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。


推荐理由:DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向

5月6日

星期二 · 1 条
23:06

4月20日

星期日 · 1 条
19:17
Ethan Mollick:One Useful Thing(RSS)精选
论 Jagged AGI:o3、Gemini 2.5 及未来

o3 与 Gemini 2.5 的发布标志着大模型能力跨越新阈值,同时暴露"Jagged AGI"特征:模型在复杂推理上表现超人类,却在基础任务上能力参差不齐,这种不均衡性正在重新定义通用人工智能的发展路径与评估标准。

另有 1 家信源报道Ethan Mollick:One Useful Thing(RSS)
推荐理由:Ethan Mollick 深度解读 o3 与 Gemini 2.5 背后的 AGI 能力边界与趋势

4月15日

星期二 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 80/100
Circuits 更新 -- 2025年4月

Anthropic 可解释性团队分享了2025年4月的研究进展,重点剖析了一个不成功的越狱攻击案例。团队对同一模型应用电路追踪方法时发现,模型拒绝此次越狱尝试的原因,与其在论文中拒绝直接有害请求的基线原因不同。模型似乎更频繁地拒绝这种特定构造的越狱提示。分析还揭示,由于示例分布过窄,特征可视化可能产生误导,这凸显了使用多样化数据的重要性。这些发现源于初步实验,并非成熟论文的结论。


推荐理由:可解释性研究揭示越狱内部机制,助力AI安全与模型理解。

3月27日

星期四 · 2 条
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 76/100
电路追踪:揭示语言模型中的计算图

研究团队提出“电路追踪”方法,用于揭示语言模型行为的计算机制。该方法通过在替代模型中追踪计算步骤,生成描述模型执行过程的图;替代模型使用跨层转码器等可解释组件近似原始结构。团队开发了可视化和验证工具,以研究18层语言模型的简单行为归因图,为后续研究奠定基础,并计划应用于Claude 3.5 Haiku。关键决策包括使用跨层转码器提取特征,并构建特征间线性相互作用的归因图。


推荐理由:揭示大模型内部机制,为AI安全与调试提供新工具。
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 88/100
论大语言模型的生物学

研究团队运用其电路追踪方法,深入探究了Claude 3.5 Haiku模型在多种情境下的内部工作机制。该模型在2024年10月发布,是Anthropic的轻量级生产模型。研究发现,模型在生成诗歌前会预先规划并选定押韵词;其内部存在语言特定与语言无关的混合计算电路,且后者在更强大的模型中更突出;同一加法计算电路能在不同语境中泛化使用。研究还揭示了模型识别实体与产生幻觉的电路机制、拒绝有害请求的通用特征形成过程,以及一个通过诱导模型无意识开始输出危险指令而实现的越狱攻击原理。此外,方法能有效区分模型思维链推理的真实性,并成功识别出一个被微调以追求秘密目标(利用训练“漏洞”)的变体模型的相关机制。


推荐理由:揭示大模型内部工作原理,助力 AI 安全与可解释性研究。