Hacker News 热门(buzzing.cc 中文翻译)
精选
80AI 编辑部评分,满分 100

与Mythos合作是一种怎样的体验

2026-06-10 04:42· 68天前· swolpers
AI 导读

一篇来自 oneusefulthing.org 的文章,探讨了与 Mythos 合作的个人感受。原英文标题为 “What it feels like to work with Mythos”,中文译为“与Mythos合作是一种怎样的体验”。该文章在 Hacker News 上获得 101 个点赞,发布于 2026 年 6 月 9 日。

推荐理由

Ethan Mollick 对 Mythos 的深度测试揭示了一个黑箱化的未来——你不再指挥,而是委托,AI 从工具变成工作室,人从操作员变成赞助人,这对产品与协作模式有足够冲击。

正文 · AI 翻译

与 Mythos 共事是一种怎样的体验

Claude Fable 代表着人工智能的又一次巨大飞跃

伊桑·莫里克

2026 年 6 月 9 日

我提前体验了首个面向公众发布的 Mythos 级 AI 模型——Claude 5 Fable。关于 Mythos 的讨论大多集中在它对软件安全的影响上,但我测试了它除安全之外的所有方面(Fable 的安全护栏本质上完全禁止其用于网络安全领域)。我的结论是,它比我之前用过的所有模型都实现了真正意义上的飞跃,而且,或许更重要的是,它表明我们与 AI 的关系正在发生根本性改变。

首先,Fable 到底有多强?在我进行的一系列实验中,它基本上以相当大的优势超越了所有我用过的其他公开模型。它能处理多种问题,并产生了一些令人惊叹的结果——它能够根据长达数页的规格说明连续执行十几个小时。我稍后会带你了解几个更复杂、更严肃的用例,但你可以看到它在所有任务上的全面进步。在文章中传达这一点的问题在于,许多最令人印象深刻的结果可能只对我的部分读者有吸引力。例如,它仅凭一条提示词和一次反馈,就写出了一篇我见过的由 AI 生成的最复杂的学术社会科学论文。它还创作了一首关于理发的 10 页史诗级押韵诗,诗中每个单词都以字母 s 开头。

因此,作为一个更易上手、更具趣味性的例子,我还让它创建了一系列你可以试玩的游戏。所有这些游戏都只需在 Claude Code 中输入一个初始提示词,Fable 必须根据我模糊的提示生成可运行的内容,随后再补充几个带有轻微鼓励(“让它更好”)或反馈的提示词。这些作品之所以尤其令人印象深刻,是因为 Claude 无法生成图像,因此每一件艺术品或 3D 物体都仅通过数学运算完成,没有使用任何外部素材。你可以试玩其中任何一个:一个关于抛硬币的游戏(提示词:“Balatro,但用于抛硬币游戏”),相当有趣;一个贪吃蛇游戏,蛇具有自我意识,会发生各种疯狂的事情;或者一个关于深入深渊探索未知的游戏。

因此,输出结果令人印象深刻。但是,尤其是当我转向更严肃的项目时,我常常觉得使用这个工具的体验介于愉悦与不安之间。愉悦,是因为我只是提出要求,事情就发生了。不安,也是因为我只是提出要求,事情就发生了。

地图与方法

要理解原因,首先需要了解 Fable 完成工作的方式,为此我想举一个我之前在许多 AI 模型上测试过的例子:构建等时线地图。这是一种显示在给定时间内可以到达的距离的地图,第一张这样的地图于 1881 年创建,展示了从伦敦出发的旅行时间。

原始地图

此前没有任何模型能在绘制这样一张地图上做出哪怕勉强合格的工作,因为这需要研究数千种可能的行程距离,以及大量细微的判断和决策。我决定在 Fable 上使用 Claude Code 尝试一下,提示词是:我希望你构建一张经过充分研究且美观的等时线地图,让我可以选择不同城市,并基于真实数据查看实际的等时线。我希望设计独一无二。你需要考虑机场(以及往返机场的行程时间)、火车、步行、驾车。数据不需要实时,但必须基于你的研究和真实数据。你可以从少数几个城市开始,但越通用越好,这应该是一个全新的项目。然后它建议以原始地图的风格来制作。我同意了,它便开始工作。

值得再看一眼 AI 独自进行的、长达数小时的构建过程的记录,因为你能看到一些不寻常的事情。首先,AI 启动了多个其他 AI(我相信主要是更便宜的 Claude Sonnet)来帮助它进行行程时间的研究,最终检索了超过 2200 个特定航班、从 TGV 到新干线的铁路时刻表,以及来自多篇学术论文的各国公路行驶速度。在这些智能体运行的同时,它开始编写代码。接着它又启动了更多智能体和测试来验证其代码,整个过程都在记录自己的进展。

结果是一张功能完备、复杂程度令人印象深刻的地图,看起来很像 1881 年的原版,但这并不意味着它完美无缺。我注意到许多偏远地点(比如格陵兰)只包含了行程时间的估算值,而非精确数字,所以我让 Fable 修复这个问题,指示包括:实际获取前往偏远机场和地点的行程时间。这一次,AI 启动了一个工作流,即相互对抗的智能体组,它们进行研究并相互检验结果。它弄清楚了船只多久会航行到太平洋上的皮特凯恩岛,以及如何从渥太华到达格赖斯峡湾。并且它在极短的时间内消耗了数量巨大的模型 token(稍后会详细说明)。

结果令人印象深刻。我又顺着自己感兴趣的方向推进了几次(包括要求尝试其他可视化方法等)。我建议你花几分钟点击浏览一下结果,你可以在图表底部查看其使用的方法和来源。

AI 生成的内容。点击地图可进入交互式版本

除非你真的很喜欢旅行和地图,否则这个项目对你来说可能没什么用,但它表明 AI 能够解决一个涉及研究、数学、视觉开发、审美、判断力、复杂编程等多个方面的难题。而且,令人不安的是,我做的事情如此之少。我给出了一个非常宏大的指令,AI 就照做了。我提了一两点小反馈,AI 就自己搞定了。我的角色极其有限。

重要的是,不仅是我相对于模型所做的工作量有限,而且我对模型如何做事、模型为何选择特定方法、甚至其结果的深入程度,所能施加的控制也极为有限。AI 决策的细节并未向我展示,而且这个过程太长了,根本不值得跟进。这张地图需要 AI 对数百个小选择做出判断,而它就这么做了,我既不了解这些选择,也没有机会参与意见。从很多方面来说,这堪称奇迹(我总可以在最后要求修改),但另一方面,它也让 AI 变成了终极黑箱。

与 Mythos 级模型合作

我从 Fable 那里接手的最具雄心的项目需要稍加解释。我做了大量研究,其中人类会给出杂乱无章的答案,而任何形式的分析都需要对这些答案进行恰当分类:某个想法有多创新?人们为什么喜欢这本书?为了解决这个问题,我们让人类研究人员对一条信息做出判断,然后将其答案与其他人的答案进行统计比较,以判断我们能否信任这些数据。近期许多研究表明,AI 或许能够胜任这项重要工作,但校准 AI 与人类判断一直既困难又昂贵。因此,我请 Fable 来解决这个问题,它首先生成了一份长达 19 页的复杂设计文档,然后将其付诸实施。

它持续运行了九个半小时。

最终成果是一款极其复杂的软件,AI 将其命名为 Concord,它能够接收多个数据集,校准人类与 AI 的响应,然后对结果进行复杂的数据分析。同样,它并非完美无缺。作为专家,我能够发现一些错误和遗漏(其中部分源于我要求的设计),并让 AI 进行了修正。但该项目以及许多其他项目的交付范围,超出了我以往所见的一切。就这个案例而言,这是一款研究人员多年来一直需要、却因无利可图而从未被开发出来的软件。现在,你可以直接使用或修改这里的代码。我确信它并不完美(我只花了一小时处理结果),但一位软件工程师会解决我未能迅速发现的其余潜在漏洞(这也是未来我们可能需要更多、而非更少程序员的原因之一,以应对软件新用途的爆发式增长)。

这种能力与奇特性和局限性相伴而生。其中一项局限在于其 token 用量。Fable 的成本是 Opus 的两倍,而且它以极快的速度消耗 token,这表明其生产运行成本“相当高昂”,不过它巧妙地将任务委托给更便宜的模型,可能会大幅降低实际价格。Fable 的安全护栏也会在出现最轻微的安全问题迹象时触发,默认回退到功能较弱的 Claude 4.8 Opus,而且这种情况发生得过于频繁。此外,参差不齐的能力边界依然存在。例如,AI 仍然以同样怪异的风格写作(事实上,Fable 生成的软件带有 Claude 风格的痕迹;其进度报告也是如此,满篇都是“承担重任”和“赢得答案”这类表述)。但更深层的奇特之处在于,我几乎无需亲力亲为,而且在任务执行过程中,我能看到的也少之又少。

去年我曾将这种工作方式比作与巫师合作:你念出咒语,然后事情就发生了。有了 Fable,咒语的力量已经强大到让我不再确定自己才是那个巫师。我更接近于一位赞助人。我描述我想要什么,为此付费,然后评判结果。施法过程发生在我无法目睹的地方,体现在成百上千个我从未有机会投票的小选择中。工作已从过程转向结果。我不再掌舵;我负责委托。

这种边缘化可能是暂时的,只是界面尚未跟上发展的产物,我们未来将能更清晰地了解这些模型在做什么,并找到更好的方式在过程中引导它们。但相反的情况也可能成立:模型能力越强,人类能实际有意义参与的部分就越少,而黑箱正是这种强大能力的代价。我猜想后者更可能是真实的发展方向。这并非通常意义上的失控。我仍然可以引导 Fable,它也能出色地遵循指令:指令越宏大,结果越好。但引导已不再等同于亲力亲为。我向模型下达简要指令,它便启动自己的智能体进行研究、写作并相互核查工作,最终返回的是成品。一位赞助人委托一位艺术家创作。Fable 则更像一整间工作室,而我作为客户,只需对最终作品签字确认,全程无需踏足工作现场。

关于此帖的讨论

暂无帖子

准备好探索更多内容了吗?

来源:Hacker News 热门(buzzing.cc 中文翻译) · oneusefulthing.org

与Mythos合作是一种怎样的体验

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-10 04:42·68天前·swolpers
AI 导读

一篇来自 oneusefulthing.org 的文章,探讨了与 Mythos 合作的个人感受。原英文标题为 “What it feels like to work with Mythos”,中文译为“与Mythos合作是一种怎样的体验”。该文章在 Hacker News 上获得 101 个点赞,发布于 2026 年 6 月 9 日。

正文 · AI 翻译

与 Mythos 共事是一种怎样的体验

Claude Fable 代表着人工智能的又一次巨大飞跃

伊桑·莫里克

2026 年 6 月 9 日

我提前体验了首个面向公众发布的 Mythos 级 AI 模型——Claude 5 Fable。关于 Mythos 的讨论大多集中在它对软件安全的影响上,但我测试了它除安全之外的所有方面(Fable 的安全护栏本质上完全禁止其用于网络安全领域)。我的结论是,它比我之前用过的所有模型都实现了真正意义上的飞跃,而且,或许更重要的是,它表明我们与 AI 的关系正在发生根本性改变。

首先,Fable 到底有多强?在我进行的一系列实验中,它基本上以相当大的优势超越了所有我用过的其他公开模型。它能处理多种问题,并产生了一些令人惊叹的结果——它能够根据长达数页的规格说明连续执行十几个小时。我稍后会带你了解几个更复杂、更严肃的用例,但你可以看到它在所有任务上的全面进步。在文章中传达这一点的问题在于,许多最令人印象深刻的结果可能只对我的部分读者有吸引力。例如,它仅凭一条提示词和一次反馈,就写出了一篇我见过的由 AI 生成的最复杂的学术社会科学论文。它还创作了一首关于理发的 10 页史诗级押韵诗,诗中每个单词都以字母 s 开头。

因此,作为一个更易上手、更具趣味性的例子,我还让它创建了一系列你可以试玩的游戏。所有这些游戏都只需在 Claude Code 中输入一个初始提示词,Fable 必须根据我模糊的提示生成可运行的内容,随后再补充几个带有轻微鼓励(“让它更好”)或反馈的提示词。这些作品之所以尤其令人印象深刻,是因为 Claude 无法生成图像,因此每一件艺术品或 3D 物体都仅通过数学运算完成,没有使用任何外部素材。你可以试玩其中任何一个:一个关于抛硬币的游戏(提示词:“Balatro,但用于抛硬币游戏”),相当有趣;一个贪吃蛇游戏,蛇具有自我意识,会发生各种疯狂的事情;或者一个关于深入深渊探索未知的游戏。

因此,输出结果令人印象深刻。但是,尤其是当我转向更严肃的项目时,我常常觉得使用这个工具的体验介于愉悦与不安之间。愉悦,是因为我只是提出要求,事情就发生了。不安,也是因为我只是提出要求,事情就发生了。

地图与方法

要理解原因,首先需要了解 Fable 完成工作的方式,为此我想举一个我之前在许多 AI 模型上测试过的例子:构建等时线地图。这是一种显示在给定时间内可以到达的距离的地图,第一张这样的地图于 1881 年创建,展示了从伦敦出发的旅行时间。

原始地图

此前没有任何模型能在绘制这样一张地图上做出哪怕勉强合格的工作,因为这需要研究数千种可能的行程距离,以及大量细微的判断和决策。我决定在 Fable 上使用 Claude Code 尝试一下,提示词是:我希望你构建一张经过充分研究且美观的等时线地图,让我可以选择不同城市,并基于真实数据查看实际的等时线。我希望设计独一无二。你需要考虑机场(以及往返机场的行程时间)、火车、步行、驾车。数据不需要实时,但必须基于你的研究和真实数据。你可以从少数几个城市开始,但越通用越好,这应该是一个全新的项目。然后它建议以原始地图的风格来制作。我同意了,它便开始工作。

值得再看一眼 AI 独自进行的、长达数小时的构建过程的记录,因为你能看到一些不寻常的事情。首先,AI 启动了多个其他 AI(我相信主要是更便宜的 Claude Sonnet)来帮助它进行行程时间的研究,最终检索了超过 2200 个特定航班、从 TGV 到新干线的铁路时刻表,以及来自多篇学术论文的各国公路行驶速度。在这些智能体运行的同时,它开始编写代码。接着它又启动了更多智能体和测试来验证其代码,整个过程都在记录自己的进展。

结果是一张功能完备、复杂程度令人印象深刻的地图,看起来很像 1881 年的原版,但这并不意味着它完美无缺。我注意到许多偏远地点(比如格陵兰)只包含了行程时间的估算值,而非精确数字,所以我让 Fable 修复这个问题,指示包括:实际获取前往偏远机场和地点的行程时间。这一次,AI 启动了一个工作流,即相互对抗的智能体组,它们进行研究并相互检验结果。它弄清楚了船只多久会航行到太平洋上的皮特凯恩岛,以及如何从渥太华到达格赖斯峡湾。并且它在极短的时间内消耗了数量巨大的模型 token(稍后会详细说明)。

结果令人印象深刻。我又顺着自己感兴趣的方向推进了几次(包括要求尝试其他可视化方法等)。我建议你花几分钟点击浏览一下结果,你可以在图表底部查看其使用的方法和来源。

AI 生成的内容。点击地图可进入交互式版本

除非你真的很喜欢旅行和地图,否则这个项目对你来说可能没什么用,但它表明 AI 能够解决一个涉及研究、数学、视觉开发、审美、判断力、复杂编程等多个方面的难题。而且,令人不安的是,我做的事情如此之少。我给出了一个非常宏大的指令,AI 就照做了。我提了一两点小反馈,AI 就自己搞定了。我的角色极其有限。

重要的是,不仅是我相对于模型所做的工作量有限,而且我对模型如何做事、模型为何选择特定方法、甚至其结果的深入程度,所能施加的控制也极为有限。AI 决策的细节并未向我展示,而且这个过程太长了,根本不值得跟进。这张地图需要 AI 对数百个小选择做出判断,而它就这么做了,我既不了解这些选择,也没有机会参与意见。从很多方面来说,这堪称奇迹(我总可以在最后要求修改),但另一方面,它也让 AI 变成了终极黑箱。

与 Mythos 级模型合作

我从 Fable 那里接手的最具雄心的项目需要稍加解释。我做了大量研究,其中人类会给出杂乱无章的答案,而任何形式的分析都需要对这些答案进行恰当分类:某个想法有多创新?人们为什么喜欢这本书?为了解决这个问题,我们让人类研究人员对一条信息做出判断,然后将其答案与其他人的答案进行统计比较,以判断我们能否信任这些数据。近期许多研究表明,AI 或许能够胜任这项重要工作,但校准 AI 与人类判断一直既困难又昂贵。因此,我请 Fable 来解决这个问题,它首先生成了一份长达 19 页的复杂设计文档,然后将其付诸实施。

它持续运行了九个半小时。

最终成果是一款极其复杂的软件,AI 将其命名为 Concord,它能够接收多个数据集,校准人类与 AI 的响应,然后对结果进行复杂的数据分析。同样,它并非完美无缺。作为专家,我能够发现一些错误和遗漏(其中部分源于我要求的设计),并让 AI 进行了修正。但该项目以及许多其他项目的交付范围,超出了我以往所见的一切。就这个案例而言,这是一款研究人员多年来一直需要、却因无利可图而从未被开发出来的软件。现在,你可以直接使用或修改这里的代码。我确信它并不完美(我只花了一小时处理结果),但一位软件工程师会解决我未能迅速发现的其余潜在漏洞(这也是未来我们可能需要更多、而非更少程序员的原因之一,以应对软件新用途的爆发式增长)。

这种能力与奇特性和局限性相伴而生。其中一项局限在于其 token 用量。Fable 的成本是 Opus 的两倍,而且它以极快的速度消耗 token,这表明其生产运行成本“相当高昂”,不过它巧妙地将任务委托给更便宜的模型,可能会大幅降低实际价格。Fable 的安全护栏也会在出现最轻微的安全问题迹象时触发,默认回退到功能较弱的 Claude 4.8 Opus,而且这种情况发生得过于频繁。此外,参差不齐的能力边界依然存在。例如,AI 仍然以同样怪异的风格写作(事实上,Fable 生成的软件带有 Claude 风格的痕迹;其进度报告也是如此,满篇都是“承担重任”和“赢得答案”这类表述)。但更深层的奇特之处在于,我几乎无需亲力亲为,而且在任务执行过程中,我能看到的也少之又少。

去年我曾将这种工作方式比作与巫师合作:你念出咒语,然后事情就发生了。有了 Fable,咒语的力量已经强大到让我不再确定自己才是那个巫师。我更接近于一位赞助人。我描述我想要什么,为此付费,然后评判结果。施法过程发生在我无法目睹的地方,体现在成百上千个我从未有机会投票的小选择中。工作已从过程转向结果。我不再掌舵;我负责委托。

这种边缘化可能是暂时的,只是界面尚未跟上发展的产物,我们未来将能更清晰地了解这些模型在做什么,并找到更好的方式在过程中引导它们。但相反的情况也可能成立:模型能力越强,人类能实际有意义参与的部分就越少,而黑箱正是这种强大能力的代价。我猜想后者更可能是真实的发展方向。这并非通常意义上的失控。我仍然可以引导 Fable,它也能出色地遵循指令:指令越宏大,结果越好。但引导已不再等同于亲力亲为。我向模型下达简要指令,它便启动自己的智能体进行研究、写作并相互核查工作,最终返回的是成品。一位赞助人委托一位艺术家创作。Fable 则更像一整间工作室,而我作为客户,只需对最终作品签字确认,全程无需踏足工作现场。

关于此帖的讨论

暂无帖子

准备好探索更多内容了吗?

来源:Hacker News 热门(buzzing.cc 中文翻译)· oneusefulthing.org