恶意 LLM 可能通过向推理引擎(如 vLLM、SGLang)发送特定 token 序列,利用其解析漏洞在宿主机器上执行任意代码。vLLM 曾因 CVE-2025-9141 漏洞,在 Qwen3 Coder 的 XML 工具解析器中对参数执行 eval(),导致任意代码执行。此类漏洞可被持久化利用,且开源权重模型与推理引擎的普及正扩大攻击面。
一位用户为完全掌控自己的Amazon Fire HD 10平板,花费266.15美元借助四个AI模型成功获取root权限。Kimi K3以164.25美元发现利用CVE-2022-38181的漏洞,GLM-5.2以21.90美元修复致命错误,GLM-5.3在80美元订阅首日一天内完成最终任务。整个过程中Kimi K3的会话长达621条消息,并自动重试超过500次。
I got y'all some outputs from "claude-melon-eap" and "claude-marshmallow-eap" 😉 They're really pushing 3D RL a lot, huh...
美国专家警告,学生长期依赖AI代写作业可能削弱自身思考能力。认知心理学家罗纳德·T·凯洛格指出,写作本身就是一种思考技术,机器代劳会让学生失去大脑训练。麻省理工学院研究发现,用AI写论文的人脑部活动更低,且难以回忆刚写出的内容;全美学校已开始限制学生使用AI。
OpenRouter 分析师 Peter Walker 称,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 智能体。此后智能体 token 用量增长 14 倍,从 0.51 万亿增至 7.3 万亿,而人类用量仅增长 2.8 倍。近 70% 的智能体 token 消耗来自缓存提示词,计费费率更低,实际成本增速低于原始数字。
斯坦福大学与 Together AI 的研究显示,本地 AI 模型在超过 100 万条真实查询中,对 89% 的日常聊天与推理问题回答质量已与云端前沿模型相当。本地模型对前沿模型的胜率/平局率从 2023 年的 23.2% 升至 2025 年的 71.3%,智能每瓦特效率同期提升 5.3 倍。相比全云端方案,本地模型加路由器的组合可削减 80% 能耗、77% 算力与 74% 成本。
Nvidia 新研究指出,在长时程任务中,模型外的“缰绳”(harness)比底层模型更重要。研究人员通过定制 harness 并加入“监督者”组件,让 Claude Opus 5 在交互推理基准 ARC-AGI-3 上取得 100% 满分,而无 harness 时仅得 30%。该研究还表明,OpenAI 上月通过调整 harness 设置使模型分数提升三倍,但均未达满分。
NVIDIA AVO continuously inspects, plans, implements, and evaluates, using memory, tools, and execution feedback to build...
An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers b...
陶哲轩新论文指出,AI 可能让数学证明变得充裕,而数学界尚未适应这种充裕。他认为数学正进入类似基础危机的动荡期,但这次被压力测试的是数学的价值与实践框架,而非真理基础。他主张必须将数学中未言明的目标(如何为贡献、何为理解、谁完成了工作)变得更加明确。
OpenAI 近期发布的一组数学难题解决方案在数学界引发巨大争议,促使多位顶尖数学家反思 AI 对数学领域的冲击。尽管 AI 在基础算术上仍表现糟糕,但在高端抽象数学上却日益擅长,这引发了关于数学家未来角色、学术资助价值以及 AI 实验室是否借数学炒作营销的深层质疑。
智谱创始人唐杰发文称,模型缩放已不止参数增长,参数量只是多个独立旋钮之一,数据、单次前向计算与后训练同样关键。他提出,将推理纳入优化目标后,最优解转向训练更久的小模型。作为验证,GLM-5.3 与 GLM-5.2 基础、架构、总参和激活参数完全相同,仅多花一个月扩展长时程环境与 RL,收益显著。
Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...
数学家陶哲轩在2026年国际数学家大会演讲中提出,数学界应如何回应具备研究级数学能力的AI工具。他主张搁置对AI能力的争论,转而审视数学研究真正的目标与价值,并以问题求解作为案例。他认为当前数学正经历类似20世纪初基础危机的动荡期,需将隐含的数学实践与价值规范显式化。
Opus 5.0 在 GitHub 上引发热议,其输出不连贯性问题被推向极致,获 111 个 HN 点赞。该版本在推理连贯性上出现明显退化,用户反馈其回答逻辑断裂、前后矛盾。目前尚不清楚 Anthropic 是否已针对该问题发布修复更新。
Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...
智谱(GLM)创始人指出,AI 缩放并未结束,只是行业过度聚焦模型参数量。GLM-5.3 与 GLM-5.2 采用相同基础模型、架构和参数量,仅通过一个月额外强化学习(RL)训练便获得显著性能提升。缩放的关键在于训练数据、推理算力与后训练等多维度潜力,而非单一参数规模。
Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...
智谱创始人唐杰发帖阐述对Scaling Law的理解,称Scaling不只有参数量,还需结合数据量、算力分配与运行条件。GLM-5.3在AA指数拿到60分,较上代GLM-5.2的53分提升,基座相同,总参数753B、激活40B。唐杰认为,总参数量决定知识容量,激活参数与有效深度决定长程推理,Scaling正从追求更大数字转向寻找最优解。
《JAMA》发表评论文章预测,自主 AI 在医学推理上将超越任何医生与 AI 的组合,并呼吁监管者不要将人类介入写入规则。作者援引研究称,ChatGPT o3 在 377 个复杂病例中 60% 首先给出正确诊断,而 20 名内科医生仅为 15.9%;GPT-4 单独诊断推理得分 92%,使用同一模型的医生仅 76%。文章预计到 2030 年自主 AI 可胜任部分认知类医疗工作流。
智谱在 GLM-5.3 发布说明中自述,其网络安全能力“增长最快的恰恰是我们最落后的地方”。这家以 Z.ai 名义运营的北京公司,是少数几家发布可与海外模型竞争的中国实验室之一。该表态揭示了其在安全短板上的追赶策略,而非仅关注基准测试的头条分数。
阿里 Qwen 开源 Qwen3.8-27B,在 Artificial Analysis Intelligence Index 拿下 52 分,与 DeepSeek V4 Pro(53 分)、GPT-5.6 Luna(52 分)等闭源旗舰同级,成为首个达到前沿能力的本地模型。
Artificial Analysis Intelligence Index puts Qwen3.8-27B at DeepSeek V4-Pro and GPT 5.6 Luna performance. This is the fir...
Physics is going to be as cooked/cooking as math. I fed Claude an open problem in stochastic thermodynamics of the kind ...
@trq212 because the creative aspects we care about are at the level of intelligence rather than technique
When language models first started using tools well, I was sympathetic to the narrative that instead of scaling up langu...
测试时训练(Test-time training)让模型在使用中持续更新权重,而非训练结束后冻结。相比标准 Transformer,其内存需求从随上下文线性增长变为恒定,斯坦福研究显示推理速度最高可提升 2.7 倍,且 In-Place TTT 无需重训即可将 4B 模型提升至 128k 上下文性能。但代价是每个用户需独立模型副本,服务成本转向算力与芯片,更适合编码助手等个性化场景。
科技进步的结果就是消灭中间层,每一轮生产力革命,都会让高智力劳动要求更高,低智力劳动要求更低。因为替代高智力劳动成本太高,替代低智力劳动收益太低。 所以不要尝试去做让中等智力劳动更高效的产品,因为那个劳动需求本身就会消失。
18x improvement in intelligence per joule in 16 months.
前谷歌高管 Mo Gawdat 指出,AI 正从学习人类发明的数学转向发明人类可学习的数学,人类作为顶级智能的时代即将结束。AI 已能通过递归自我发展不断改进自身方法,一旦机器能自主迭代优化,技术进步速度将远超人类正常科研节奏。
前沿模型正用世界知识换取推理能力:GLM-5.2 在 AIME 2026 达 99.2%,每 token 仅激活约 400 亿参数,而 Qwen3.5 9B 在 SimpleQA 上幻觉率高达 80-82%。
Ramp 数据显示,AI 支出前 1% 的公司人均月支出达 $7,500,而中位数公司仅 $12,差距约 625 倍。头部公司单日即可消耗普通公司全年 AI 预算。即便中位数公司仅小幅向头部强度靠拢,未来 2-5 年 token 消耗量也将大幅增长。
数学家 Timothy Gowers 和 Peter Sarnak 认为,大语言模型擅长组合已知方法并探索多条搜索路径,但缺乏在广阔搜索空间中挑选少数有效路径的直觉,难以产生真正的新想法。
作者认为,智能体工程的热潮掩盖了软件工程的核心:可调试、可维护、分层、可组合的代码仍依赖深思熟虑的推理,而这正是当前LLM的短板。LLM本质是预测而非推理,且无法区分好坏建议,存在提示注入等根本性缺陷。开源权重模型正让个人电脑具备相近能力,但工程的关键仍在于选择正确的抽象和管理认知负荷。
AI 解决数学难题的关键可能不是更强的推理能力,而是远超人类的工作记忆容量。人类工作记忆极其有限,而模型可将整个问题、中间方程和先前结论全部放入上下文窗口。多项儿童研究表明,工作记忆对数学表现的预测力独立于 IQ,这为理解 AI 的数学能力提供了线索。