AI 世界观

Tomer Tunguz 博客(VC 分析)·2026-07-06 08:00·50天前·Tomasz Tunguz
AI 导读

《经济学人》以世界价值观调查评测 25 个前沿 AI 模型。实验室来源对世界观的预测力弱于训练与对齐选择:Gemini 与 Qwen 立场接近,GPT-4o 与 DeepSeek R1 近乎相同,而 DeepSeek R1 与 DeepSeek V4 Flash 则截然不同。模型的世界观在代码生成中不可见,但在商业分析、预测、招聘与政策工作中是活跃的输入变量。

Tomer Tunguz 博客(VC 分析)
精选
56AI 编辑部评分,满分 100

AI 世界观

2026-07-06 08:00· 50天前· Tomasz Tunguz
AI 导读

《经济学人》以世界价值观调查评测 25 个前沿 AI 模型。实验室来源对世界观的预测力弱于训练与对齐选择:Gemini 与 Qwen 立场接近,GPT-4o 与 DeepSeek R1 近乎相同,而 DeepSeek R1 与 DeepSeek V4 Flash 则截然不同。模型的世界观在代码生成中不可见,但在商业分析、预测、招聘与政策工作中是活跃的输入变量。

推荐理由

这个发现让我重新思考选模型思路,出身不重要,训练方法才决定价值观,做产品的别光看benchmark,得在意模型‘性格’。

正文 · AI 翻译

简而言之:《经济学人》让 25 个前沿 AI 模型参与了世界价值观调查。模型所属实验室对价值观的预测能力,弱于训练与对齐选择:Gemini 与 Qwen 是近邻,GPT-4o 与 DeepSeek R1 近乎双胞胎,而 DeepSeek R1 与 DeepSeek V4 Flash 却形同陌路。世界观在代码生成中不可见,但在商业分析、预测、招聘和政策工作中,它是一个活跃的输入变量。

《经济学人》让 25 个前沿 AI 模型完成了世界价值观调查——这份问卷自 1981 年以来一直用于绘制 100 个国家的道德观念图谱。在这张 2x2 的坐标图中,有两个轴:第一轴是从传统(宗教)到世俗;第二轴是从生存(关注集体基本需求)到自我表达与个人主义。

大多数模型位于地图的自我表达半区,考虑到训练数据,这并不令人意外。

令人惊讶的是,模型之间的差异很大。Gemini 3.1 Flash Lite 与 Qwen 3.6 Flash 作为近邻,位于自我表达程度最高的区域。

GPT-4o 与 DeepSeek R1 近乎双胞胎,一个在旧金山训练,一个在杭州训练。

DeepSeek R1 与 DeepSeek V4 Flash 来自同一个实验室,却在世俗/传统轴线上处于完全相反的两端。

共享的训练数据和相似的标注者解释了“双胞胎”现象,而不同的后训练选择则解释了“陌生人”现象。Common Crawl 数据集中 46% 是英文内容,因此模型模仿的基础声音是一个受过大学教育的美国网民。Anthropic 随后将 Claude 对齐到《联合国人权宣言》中的原则,而这份宣言本身就是一个自由主义色彩的文件。

Grok 独树一帜,是一个传统的独立派。

这种差异改变了采购清单。如今,企业模型的每一份招标书都会评估价格、延迟、上下文窗口和基准分数。世界观并不在清单上。它应该被纳入吗?

对于代码生成、SQL、日志解析和图像分类来说,这没问题。计算机程序没有政治立场。

一旦模型被用于特定市场的商业决策,其世界观就成为一个活跃的输入变量。营销文案、用户行为预测以及客户支持的语气,都必须与目标人群的价值观相匹配。

AI 的世界观从未被视为 AI 采购的一部分,但对于某些用例来说,它可能有必要成为一个考量因素。


  1. 《经济学人》:AI 模型的价值取向与大多数人的价值观存在显著差异 ↩︎

  2. Common Crawl 统计数据:语言分布情况 ↩︎

  3. Anthropic:Claude 的宪法 ↩︎

来源:Tomer Tunguz 博客(VC 分析)· tomtunguz.com