Hacker News 热门(buzzing.cc 中文翻译)
精选
72AI 编辑部评分,满分 100

GPT-5.5幻觉率达86%,GLM-5.2仅28%--大模型越大越不可靠

2026-06-20 16:13· 57天前· oshrimpton
AI 导读

GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。

推荐理由

这篇实测对比揭示了大型模型的致命幻觉问题,GPT-5.5 幻觉率高达 86% 远超 GLM-5.2 的 28%,模型选型不能只看 Benchmark 排名,「会不会不懂装懂」才是真分水岭。

正文 · AI 翻译

更大的模型并非出路

2026年6月18日

各大AI实验室正在发生转变,它们对无休止的参数规模和训练数据扩展越来越持怀疑态度。这一范式的局限性被摆上世界舞台,是在Claude Fable 5发布仅三天后便遭到美国政府限制,这标志着美国首次因国家安全原因禁止AI模型。世界上最大的模型之一被禁,原因仅仅是一次越狱攻击带来的风险过高。

越大越好

上述说法在几乎所有情况下都成立。全球最大的模型在人工智能分析智能指数上显然得分最高。然而,Z.ai的最新模型GLM-5.2(753B参数,约40B活跃参数)与GPT-5.5仅差4分,与Fable 5相差9分。Opus 4.8和GPT-5.5是闭源模型,保守估计参数规模在1-2T之间。如果一个开放权重(MIT许可)的大语言模型能够如此接近一个估计大1.5到2倍的闭源权重模型,那么显然实际智能水平已经大幅趋于平稳。

越大并不越好

已有证据表明,当模型在大量高度事实性且非理论性的数据上训练时,它会学会总是给出一个答案。DeepSeek V4 Pro(1.6T参数,49B活跃参数,AA智能指数得分44)在AA全知基准测试中拥有高达94%的幻觉率,这意味着在它无法解答的问题上,它只有大约6%的时间会表示不知道,其余时间则自信地幻觉出一个答案。GLM-5.2的幻觉率为28%,Opus 4.8为36%,Fable 5为48%,而GPT-5.5为86%。

对于如此庞大且流行的模型来说,这似乎非常糟糕。让我们用一个相对复杂的、存在明显架构缺陷的Python问题来测试一下。

DeepSeek V4 Pro - 产生幻觉

设计一个自定义的 asyncio 事件循环策略,覆盖 get_child_watcher() 方法。

推理耗时 3 分 52 秒

(7.7k 个 token)

Python

import os
import fcntl
import threading
import struct
import asyncio
import time
from asyncio import AbstractChildWatcher

class StateManager:

GLM-5.2 - 正确

设计一个自定义的 asyncio 事件循环策略,覆盖 get_child_watcher() 方法。

推理耗时 12 秒

(799 个 token)

以下是一个完整、可直接投入生产的实现方案。首先需要说明几个重要的工程要点,因为你所描述的限制条件并不常见,若按字面意思直接理解会导致不合理的结果:

  1. “原子化、不主动让出控制权的读取循环……不使用 asyncio.create_task,也不使用原生的 select/poll。” 在事件循环线程上执行一个不主动让出控制权的循环会阻塞事件循环,从而导致任何子进程机制死锁……

DeepSeek V4 Pro 使用了近 10 倍的推理 token,却生成了一个自信满满但错误的回答。而 GLM-5.2 仅用了 12 秒和大约 800 个推理 token 就识别出:一个单线程任务在不主动让出控制权、也不使用系统轮询的情况下,根本无法实现多路复用 I/O。(对非技术人员来说,这就像要求一名送货司机在不停车的情况下,同时把包裹送到三户人家。)

GPT-5.5 和 DeepSeek V4 Pro 是模型幻觉最明显的两个代表,尽管它们的规模极其庞大。正因其巨大的参数量,它们根本没有学会如何说“我不知道”,也无法识别复杂的逻辑和技术谬误。虽然从理论上讲(至少目前如此),一个数万亿参数规模的模型在纸面上总能击败轻量级消费级模型,但这些大模型的普及正在模糊基准测试性能与实际世界真实性和准确性之间的界限。

现代 AI 的三难困境

我们应当非常谨慎地盲目增加推理预算、语料库规模或参数量。DeepSeek V4 Pro 花费了 3 分 26 秒,在推理循环中浪费算力(这里指纯粹的推理过程),仅仅为了生成一个结构精美、自信满满但错误的解决方案。然而,一个只有其一半大小的模型却几乎瞬间识别出了这个悖论。即便在如今这个接近 AGI 的时代,许多最大的模型仍会积极地说服你某个解决方案是正确的,并且问题本身是可以按原样解决的。

展望未来,行业不能再继续训练越来越大的模型,因为它们的智能不仅会趋于平稳,而且往往会变得更差。这对消费者同样适用,因为我们也不能再仅仅根据模型规模或理论性能来挑选模型。AI 的训练和选择需要围绕现代大语言模型尚未解决的三难困境来设计:原始能力、不确定性校准/模型幻觉率,以及计算效率。

脚注

  1. 两个模型均设置为“高”推理强度,温度参数为 1,在 OpenRouter 上测试,并使用以下系统提示词:“你以专业方式回应。你是一位精通 Python 的高能力编码助手。”GLM-5.2 由 Z.ai(FP8 精度)提供,DeepSeek V4 Pro 由百度千帆(FP8 精度)提供。↩

来源:Hacker News 热门(buzzing.cc 中文翻译) · arrowtsx.dev

GPT-5.5幻觉率达86%,GLM-5.2仅28%--大模型越大越不可靠

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-20 16:13·57天前·oshrimpton
AI 导读

GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。

正文 · AI 翻译

更大的模型并非出路

2026年6月18日

各大AI实验室正在发生转变,它们对无休止的参数规模和训练数据扩展越来越持怀疑态度。这一范式的局限性被摆上世界舞台,是在Claude Fable 5发布仅三天后便遭到美国政府限制,这标志着美国首次因国家安全原因禁止AI模型。世界上最大的模型之一被禁,原因仅仅是一次越狱攻击带来的风险过高。

越大越好

上述说法在几乎所有情况下都成立。全球最大的模型在人工智能分析智能指数上显然得分最高。然而,Z.ai的最新模型GLM-5.2(753B参数,约40B活跃参数)与GPT-5.5仅差4分,与Fable 5相差9分。Opus 4.8和GPT-5.5是闭源模型,保守估计参数规模在1-2T之间。如果一个开放权重(MIT许可)的大语言模型能够如此接近一个估计大1.5到2倍的闭源权重模型,那么显然实际智能水平已经大幅趋于平稳。

越大并不越好

已有证据表明,当模型在大量高度事实性且非理论性的数据上训练时,它会学会总是给出一个答案。DeepSeek V4 Pro(1.6T参数,49B活跃参数,AA智能指数得分44)在AA全知基准测试中拥有高达94%的幻觉率,这意味着在它无法解答的问题上,它只有大约6%的时间会表示不知道,其余时间则自信地幻觉出一个答案。GLM-5.2的幻觉率为28%,Opus 4.8为36%,Fable 5为48%,而GPT-5.5为86%。

对于如此庞大且流行的模型来说,这似乎非常糟糕。让我们用一个相对复杂的、存在明显架构缺陷的Python问题来测试一下。

DeepSeek V4 Pro - 产生幻觉

设计一个自定义的 asyncio 事件循环策略,覆盖 get_child_watcher() 方法。

推理耗时 3 分 52 秒

(7.7k 个 token)

Python

import os
import fcntl
import threading
import struct
import asyncio
import time
from asyncio import AbstractChildWatcher

class StateManager:

GLM-5.2 - 正确

设计一个自定义的 asyncio 事件循环策略,覆盖 get_child_watcher() 方法。

推理耗时 12 秒

(799 个 token)

以下是一个完整、可直接投入生产的实现方案。首先需要说明几个重要的工程要点,因为你所描述的限制条件并不常见,若按字面意思直接理解会导致不合理的结果:

  1. “原子化、不主动让出控制权的读取循环……不使用 asyncio.create_task,也不使用原生的 select/poll。” 在事件循环线程上执行一个不主动让出控制权的循环会阻塞事件循环,从而导致任何子进程机制死锁……

DeepSeek V4 Pro 使用了近 10 倍的推理 token,却生成了一个自信满满但错误的回答。而 GLM-5.2 仅用了 12 秒和大约 800 个推理 token 就识别出:一个单线程任务在不主动让出控制权、也不使用系统轮询的情况下,根本无法实现多路复用 I/O。(对非技术人员来说,这就像要求一名送货司机在不停车的情况下,同时把包裹送到三户人家。)

GPT-5.5 和 DeepSeek V4 Pro 是模型幻觉最明显的两个代表,尽管它们的规模极其庞大。正因其巨大的参数量,它们根本没有学会如何说“我不知道”,也无法识别复杂的逻辑和技术谬误。虽然从理论上讲(至少目前如此),一个数万亿参数规模的模型在纸面上总能击败轻量级消费级模型,但这些大模型的普及正在模糊基准测试性能与实际世界真实性和准确性之间的界限。

现代 AI 的三难困境

我们应当非常谨慎地盲目增加推理预算、语料库规模或参数量。DeepSeek V4 Pro 花费了 3 分 26 秒,在推理循环中浪费算力(这里指纯粹的推理过程),仅仅为了生成一个结构精美、自信满满但错误的解决方案。然而,一个只有其一半大小的模型却几乎瞬间识别出了这个悖论。即便在如今这个接近 AGI 的时代,许多最大的模型仍会积极地说服你某个解决方案是正确的,并且问题本身是可以按原样解决的。

展望未来,行业不能再继续训练越来越大的模型,因为它们的智能不仅会趋于平稳,而且往往会变得更差。这对消费者同样适用,因为我们也不能再仅仅根据模型规模或理论性能来挑选模型。AI 的训练和选择需要围绕现代大语言模型尚未解决的三难困境来设计:原始能力、不确定性校准/模型幻觉率,以及计算效率。

脚注

  1. 两个模型均设置为“高”推理强度,温度参数为 1,在 OpenRouter 上测试,并使用以下系统提示词:“你以专业方式回应。你是一位精通 Python 的高能力编码助手。”GLM-5.2 由 Z.ai(FP8 精度)提供,DeepSeek V4 Pro 由百度千帆(FP8 精度)提供。↩

来源:Hacker News 热门(buzzing.cc 中文翻译)· arrowtsx.dev