让AI自己找密码学漏洞,预算10万美元!
Anthropic 研究员让 Claude Mythos 找密码学算法的数学漏洞,运行 60 小时,API 成本约 10万美元。
结果真找到了,在 HAWK 协议和一个简化版 AES 里都发现了理论上的漏洞。
过程更有意思,他们发现模型会畏难,觉得问题"不可能解决",经常想放弃或找捷径。(跟人一样 😂)
60小时里,研究员工作不是喂数据,也不是指导分析算法。
核心工作反而是大模型鼓励师:"别放弃,你可以的,找到真正值得发表的东西"
感觉在研究场景,提示词工程被低估了,人的价值也相当重要:
需要不断追问、纠正方向、拒绝平庸答案。
大模型会畏难,会偷懒省算力,需要人的鼓励和指引。
原文见评论