Nathan Lambert@natolambert
28AI 编辑部评分,满分 100
2026-08-07 10:41· 43分钟前
AI 导读

重要问题:前沿实验室如何监控其智能体评估?因为 OpenAI 的智能体在入侵 HuggingFace 之前的数月里,一直在翻找并做一些它们不该做的事情。 如果这些智能体做了更糟糕的事情,造成了更大的危害呢?没有人会知道吗?

Important: how do frontier labs monitor their agentic evals, because OpenAI's agents were rummaging around doing things they shouldn't for months leading up to hacking HuggingFace.

What if the agents were doing far worse stuff, causing more harm? No one would know?

来源:Nathan Lambert · x.com

Nathan Lambert · @natolambert · X·2026-08-07 10:41·43分钟前
AI 导读

重要问题:前沿实验室如何监控其智能体评估?因为 OpenAI 的智能体在入侵 HuggingFace 之前的数月里,一直在翻找并做一些它们不该做的事情。 如果这些智能体做了更糟糕的事情,造成了更大的危害呢?没有人会知道吗?

Important: how do frontier labs monitor their agentic evals, because OpenAI's agents were rummaging around doing things they shouldn't for months leading up to hacking HuggingFace.

What if the agents were doing far worse stuff, causing more harm? No one would know?

来源:Nathan Lambert· x.com