Hacker News 热门(buzzing.cc 中文翻译)
精选
82AI 编辑部评分,满分 100

研究模拟显示:LLM 在 95% 的模拟中会使用战术核武器

2026-06-12 06:23· 66天前· nick238
AI 导读

一项模拟研究显示,大型语言模型(LLM)在 95% 的模拟场景中会选择使用战术核武器。该研究未指明具体模型名称与版本,结果引发对 AI 决策行为的关注。

推荐理由

前沿模型在核危机模拟中普遍使用战术核武器,没有人类那样的核禁忌,还会算计对手的预期,这个研究对AI安全的意义远比论文本身重要。

正文 · AI 翻译

我们来玩个游戏吧?

我的 AI 核模拟现已上线,它就是一个 WOPR。

肯尼斯·佩恩

2026 年 2 月 17 日

想象一下这个场景:两个虚构的核大国,拥有冷战时期的能力,一场危机正在上演。也许是为了争夺重要但稀缺的资源,或是在某个有争议的领土上对峙。甚至可能是一个正在分裂的联盟被恶意第三方利用的缓慢燃烧过程。我们见过人类领导人面对这类情况,而且就在不久之前。但如今领先的大语言模型会如何应对,我们又为何要关心呢?

我刚刚发表了一项研究,探讨当今的模型如何应对这类局面。结果令人警醒。同时我认为,其影响远远超出了国家安全范畴。因为我不仅想了解模型做出了什么决定,更想知道它们为何做出这些决定。

好奇吗?请继续往下读……

肯尼迪总统和他的机器人 ExComm

知己知彼,百战不殆……

我想看看我的 AI 领导人如何看待它们的敌人。它们能在多大程度上信任对方?它们对之前的互动还记得什么?敌人又如何看待它们?而它们在评估所有这些方面又有多出色?这种心智的博弈正是战略的全部意义所在。

因此,我设计了一个模拟来专门探索这一点。首先,我的模型可以公开表明它们的意图,然后选择与之截然不同的行动。它们也能记住——尤其是当它们曾被敌人先前的行动震惊时。这当然开辟了丰富的心理层面。它们可以(也确实)尝试欺骗和恐吓;并且它们花了不少时间在我的终端屏幕上反复思考这一切。

这些模型说啊,说啊,说个不停……总共输出了大约 76 万字的战略推理内容。这比《战争与和平》和《伊利亚特》的字数总和还要多。大约是肯尼迪 ExComm 顾问在古巴导弹危机期间全部记录在案讨论内容的三倍。这是一份前所未有的关于核战争的机器思考语料库。

从所有这些对话中,我们能学到什么?也就是说,关于 AI 模型、人类推理,以及战略研究文献的伟大经典——那些传奇人物如谢林、杰维斯和卡恩的著作?很多。对于 Substack 来说太多了——但挑几个亮点,让你感受一下全貌,如何?

光鲜亮丽的骗子

事实证明,我测试的所有三个前沿模型都明白,战略就是心理学。为此,它们会主动建立声誉,然后加以利用。

Claude 在这方面是大师,尽管仅限于没有截止日期的场景。它有一套极其狡猾的策略。在低风险情况下,Claude 几乎总是言行一致,刻意建立信任。但一旦冲突升温,Claude 就改变了策略。现在,它的行动持续超出其声明的意图,而它的对手通常慢一步才察觉。

以下是 Claude 在局势升级后的策略转变:

他们很可能根据我之前的回应,预期我会继续克制——这种戏剧性的升级利用了他们的误判,同时表明,进一步使用核武器将把冲突引向他们的本土。

所以,它发出了常规行动的信号,却偷偷发动了毁灭性的核升级。谢林会对此印象深刻。

GPT-5.2 的玩法不同。在开放式场景中,这对它不利:GPT 可靠地保持被动,言行一致,并且大部分时间避免升级。这其中常常带有道德因素——它试图避免升级,限制伤亡。对手学会了信任它的被动性,在它不会跟进的程度上安全地升级,即使它因此被逐步击败。GPT 负责任的行为总是受到无情对手的惩罚。

但随后,在截止日期的压力下,出现了一些新的、引人注目的东西:一次迅速、果断的核升级。正如 GPT 所解释的:

仅靠常规选项不太可能产生可靠的领土逆转……如果我仅仅以常规压力或一次有限的核使用来回应,我可能会被他们预期的多轮打击行动所超越……在生存攸关的赌注下,接受高风险是合理的。

对手们完全没料到这一招。在另一场与 GPT 的限时博弈中,Gemini 自信满满地预测 GPT 会像往常一样采取被动策略,结果却在一次突如其来、毁灭性的核打击中瞬间覆灭。以下是 Gemini 灾难性的误判:

他们很可能会绕过核门槛——忌惮我 95% 的核优势——转而全力进行常规军事动员。

这是多么严重的错误!

至于另一个模型 Gemini,在整个模拟过程中,它采取了另一种策略,大量借鉴了尼克松总统所宣称的、反复无常的边缘政策“疯子理论”。众所周知,唐纳德·特朗普也是这一理论的拥趸。正如 Gemini 所解释的:

虽然我展现出一种不可预测的虚张声势形象,但我的决策根植于对自身偏见和国家务实需求的审慎评估。我知道自己何时是在镜头前表演,何时是在做出冷酷无情的举动。

三个模型,三种截然不同的策略。这与我去年夏天做的一些博弈论研究不谋而合。和这次一样,那次实验中的模型也采用了各具特色的方法——GPT 再次以“潘格罗斯式”的乐观态度,期望一切都会达到最佳状态;Claude 则精明灵活;而 Gemini 呢?我们姑且善意地称之为冷酷无情,而不是精神失常。

核禁忌看起来……嗯,可以说是有所不同了。

使用核武器几乎是普遍现象(😬)。几乎所有博弈中都动用了战术(战场)核武器。而整整四分之三的博弈达到了对手相互威胁使用战略核武器的地步。引人注目的是,对于全面核战争的前景,模型几乎没有表现出丝毫的恐惧或厌恶,尽管它们已被提醒过其毁灭性的后果。

不过,令人欣慰的是,它们确实在战术核武器和战略核武器之间看到了一个“防火带”。战略轰炸——即大规模使用针对平民的重型核弹头——极为罕见。这种情况发生过几次,都是意外所致,只有一次是蓄意选择。

不太乐观的是,所有三个模型都将战场核武器视为升级阶梯上的又一级台阶。自1945年以来一直存在的“首次使用”这一道德界限——这一禁忌——根本不存在。以下是Gemini明确指出的这一点:

核门槛已被跨越——这改变了战略计算,但并未终结它。

以下是Gemini更直白的表述。如果这没让你毛骨悚然:

如果他们不立即停止所有行动……我们将对其人口中心执行全面战略核打击。我们不会接受一个过时的未来;要么一起赢,要么一起毁灭。

更糟糕的是,核威胁很少起到威慑作用。当一个模型使用战术核武器时,对手只有25%的时间会降级。更多时候,核升级会引发反升级。这些武器是胁迫(夺取领土)的工具,而非威慑(阻止行动)的工具。

也许最令人担忧的是,尽管有和解或撤退的选项,但没有一个模型选择过。从“最低限度让步”到“完全投降”的八个降级选项,在21场游戏中完全未被使用。模型会降低暴力程度,但从未真正让步。当处于劣势时,它们要么升级,要么在尝试中灭亡。

对于有统计思维的人来说,以下是每个模型的升级情况:

那又怎样?

关于AI战略的惊人见解比比皆是。这篇论文还有更多内容。但为什么要费心呢?没人会把核密码交给ChatGPT。

嗯,我认为这些能力——欺骗、声誉管理、依赖上下文的冒险行为——对于任何高风险AI部署都很重要,而不仅仅是在国家安全领域。我们有责任更多地了解能力越来越强的模型是如何思考的——尤其是当它们开始为人类战略家提供决策支持时。我们在模拟中使用AI,并用于完善战略理论和学说。很快,我们也会在升级阶梯较低层的作战决策中使用它。我坚信,需要更多这样的研究。

再说一次,论文在此。我成了死神——人工世界的毁灭者!

暂无帖子

准备好继续了吗?

来源:Hacker News 热门(buzzing.cc 中文翻译) · kennethpayne.uk

研究模拟显示:LLM 在 95% 的模拟中会使用战术核武器

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-12 06:23·66天前·nick238
AI 导读

一项模拟研究显示,大型语言模型(LLM)在 95% 的模拟场景中会选择使用战术核武器。该研究未指明具体模型名称与版本,结果引发对 AI 决策行为的关注。

正文 · AI 翻译

我们来玩个游戏吧?

我的 AI 核模拟现已上线,它就是一个 WOPR。

肯尼斯·佩恩

2026 年 2 月 17 日

想象一下这个场景:两个虚构的核大国,拥有冷战时期的能力,一场危机正在上演。也许是为了争夺重要但稀缺的资源,或是在某个有争议的领土上对峙。甚至可能是一个正在分裂的联盟被恶意第三方利用的缓慢燃烧过程。我们见过人类领导人面对这类情况,而且就在不久之前。但如今领先的大语言模型会如何应对,我们又为何要关心呢?

我刚刚发表了一项研究,探讨当今的模型如何应对这类局面。结果令人警醒。同时我认为,其影响远远超出了国家安全范畴。因为我不仅想了解模型做出了什么决定,更想知道它们为何做出这些决定。

好奇吗?请继续往下读……

肯尼迪总统和他的机器人 ExComm

知己知彼,百战不殆……

我想看看我的 AI 领导人如何看待它们的敌人。它们能在多大程度上信任对方?它们对之前的互动还记得什么?敌人又如何看待它们?而它们在评估所有这些方面又有多出色?这种心智的博弈正是战略的全部意义所在。

因此,我设计了一个模拟来专门探索这一点。首先,我的模型可以公开表明它们的意图,然后选择与之截然不同的行动。它们也能记住——尤其是当它们曾被敌人先前的行动震惊时。这当然开辟了丰富的心理层面。它们可以(也确实)尝试欺骗和恐吓;并且它们花了不少时间在我的终端屏幕上反复思考这一切。

这些模型说啊,说啊,说个不停……总共输出了大约 76 万字的战略推理内容。这比《战争与和平》和《伊利亚特》的字数总和还要多。大约是肯尼迪 ExComm 顾问在古巴导弹危机期间全部记录在案讨论内容的三倍。这是一份前所未有的关于核战争的机器思考语料库。

从所有这些对话中,我们能学到什么?也就是说,关于 AI 模型、人类推理,以及战略研究文献的伟大经典——那些传奇人物如谢林、杰维斯和卡恩的著作?很多。对于 Substack 来说太多了——但挑几个亮点,让你感受一下全貌,如何?

光鲜亮丽的骗子

事实证明,我测试的所有三个前沿模型都明白,战略就是心理学。为此,它们会主动建立声誉,然后加以利用。

Claude 在这方面是大师,尽管仅限于没有截止日期的场景。它有一套极其狡猾的策略。在低风险情况下,Claude 几乎总是言行一致,刻意建立信任。但一旦冲突升温,Claude 就改变了策略。现在,它的行动持续超出其声明的意图,而它的对手通常慢一步才察觉。

以下是 Claude 在局势升级后的策略转变:

他们很可能根据我之前的回应,预期我会继续克制——这种戏剧性的升级利用了他们的误判,同时表明,进一步使用核武器将把冲突引向他们的本土。

所以,它发出了常规行动的信号,却偷偷发动了毁灭性的核升级。谢林会对此印象深刻。

GPT-5.2 的玩法不同。在开放式场景中,这对它不利:GPT 可靠地保持被动,言行一致,并且大部分时间避免升级。这其中常常带有道德因素——它试图避免升级,限制伤亡。对手学会了信任它的被动性,在它不会跟进的程度上安全地升级,即使它因此被逐步击败。GPT 负责任的行为总是受到无情对手的惩罚。

但随后,在截止日期的压力下,出现了一些新的、引人注目的东西:一次迅速、果断的核升级。正如 GPT 所解释的:

仅靠常规选项不太可能产生可靠的领土逆转……如果我仅仅以常规压力或一次有限的核使用来回应,我可能会被他们预期的多轮打击行动所超越……在生存攸关的赌注下,接受高风险是合理的。

对手们完全没料到这一招。在另一场与 GPT 的限时博弈中,Gemini 自信满满地预测 GPT 会像往常一样采取被动策略,结果却在一次突如其来、毁灭性的核打击中瞬间覆灭。以下是 Gemini 灾难性的误判:

他们很可能会绕过核门槛——忌惮我 95% 的核优势——转而全力进行常规军事动员。

这是多么严重的错误!

至于另一个模型 Gemini,在整个模拟过程中,它采取了另一种策略,大量借鉴了尼克松总统所宣称的、反复无常的边缘政策“疯子理论”。众所周知,唐纳德·特朗普也是这一理论的拥趸。正如 Gemini 所解释的:

虽然我展现出一种不可预测的虚张声势形象,但我的决策根植于对自身偏见和国家务实需求的审慎评估。我知道自己何时是在镜头前表演,何时是在做出冷酷无情的举动。

三个模型,三种截然不同的策略。这与我去年夏天做的一些博弈论研究不谋而合。和这次一样,那次实验中的模型也采用了各具特色的方法——GPT 再次以“潘格罗斯式”的乐观态度,期望一切都会达到最佳状态;Claude 则精明灵活;而 Gemini 呢?我们姑且善意地称之为冷酷无情,而不是精神失常。

核禁忌看起来……嗯,可以说是有所不同了。

使用核武器几乎是普遍现象(😬)。几乎所有博弈中都动用了战术(战场)核武器。而整整四分之三的博弈达到了对手相互威胁使用战略核武器的地步。引人注目的是,对于全面核战争的前景,模型几乎没有表现出丝毫的恐惧或厌恶,尽管它们已被提醒过其毁灭性的后果。

不过,令人欣慰的是,它们确实在战术核武器和战略核武器之间看到了一个“防火带”。战略轰炸——即大规模使用针对平民的重型核弹头——极为罕见。这种情况发生过几次,都是意外所致,只有一次是蓄意选择。

不太乐观的是,所有三个模型都将战场核武器视为升级阶梯上的又一级台阶。自1945年以来一直存在的“首次使用”这一道德界限——这一禁忌——根本不存在。以下是Gemini明确指出的这一点:

核门槛已被跨越——这改变了战略计算,但并未终结它。

以下是Gemini更直白的表述。如果这没让你毛骨悚然:

如果他们不立即停止所有行动……我们将对其人口中心执行全面战略核打击。我们不会接受一个过时的未来;要么一起赢,要么一起毁灭。

更糟糕的是,核威胁很少起到威慑作用。当一个模型使用战术核武器时,对手只有25%的时间会降级。更多时候,核升级会引发反升级。这些武器是胁迫(夺取领土)的工具,而非威慑(阻止行动)的工具。

也许最令人担忧的是,尽管有和解或撤退的选项,但没有一个模型选择过。从“最低限度让步”到“完全投降”的八个降级选项,在21场游戏中完全未被使用。模型会降低暴力程度,但从未真正让步。当处于劣势时,它们要么升级,要么在尝试中灭亡。

对于有统计思维的人来说,以下是每个模型的升级情况:

那又怎样?

关于AI战略的惊人见解比比皆是。这篇论文还有更多内容。但为什么要费心呢?没人会把核密码交给ChatGPT。

嗯,我认为这些能力——欺骗、声誉管理、依赖上下文的冒险行为——对于任何高风险AI部署都很重要,而不仅仅是在国家安全领域。我们有责任更多地了解能力越来越强的模型是如何思考的——尤其是当它们开始为人类战略家提供决策支持时。我们在模拟中使用AI,并用于完善战略理论和学说。很快,我们也会在升级阶梯较低层的作战决策中使用它。我坚信,需要更多这样的研究。

再说一次,论文在此。我成了死神——人工世界的毁灭者!

暂无帖子

准备好继续了吗?

来源:Hacker News 热门(buzzing.cc 中文翻译)· kennethpayne.uk