# Hark发布Handoff：上网办事AI，97.7分超GPT-5.4

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-08-06 00:42
- AIHOT 分数：50
- AIHOT 链接：https://aihot.virxact.com/items/cmsgc4ff50187ro5q9txi5r75
- 原文链接：https://x.com/AYi_AInotes/status/2085043731632202226

## AI 摘要

Hark推出首个产品Handoff，一个像真人一样操作浏览器帮你办事的AI，可点外卖、订票、招人，不依赖网站API。在网页Agent测试Online-Mind2Web上获97.7分，超GPT-5.4（92.8）和Claude Opus 4.8（84.1），成本仅为这些模型的十分之一。研究预览版已发布，今年夏天晚些时候正式开放。

## 正文

哇偶,我觉得Handoff可能是今年最实用的AI产品了,

当所有AI大模型都在卷AI写代码,卷前端技术栈的时候,
@Figure_robot 的创始人@adcock_brett 突然扔出来个王炸,

他的新公司Hark昨天发布了第一个产品叫Handoff,

简单说就是,
这是一个专门帮你上网办事的AI。

不是跟你聊天,
也不是帮你写代码,

是真的像人一样,
打开浏览器,动鼠标,点按钮,打字,滚页面,
帮你把事办完。

点外卖,买东西,订餐厅,订机票酒店,
上LinkedIn招人发消息约面试,
跨好几个网站查资料做对比,
这些你每天在浏览器里磨磨唧唧干的事,
以后跟它说一声就行。

它不依赖任何网站的API,
也不需要网站专门给它做什么接口,
它就像真人一样看屏幕,
哪里有按钮就点哪里,

跳出弹窗就关,
遇到验证码就处理,
页面改版了它也能认出来。

每个任务单独开一台虚拟电脑,
可以登你自己的账号,
用你存好的地址和支付方式,
办完了就关掉。

基准测试更夸张,
在最权威的网页Agent测试Online-Mind2Web上,
它拿了97.7分,
GPT-5.4是92.8,Claude Opus 4.8是84.1,
成本还只有这些大模型的十分之一。

很多人没反应过来这意味着什么,

现在所有的Agent公司都在卷程序员,
卷帮你写代码、改bug、提PR,

但普通人每天75%的屏幕时间,
根本不是在写代码,
是在各个网站之间跳来跳去办那些破事。
填表格,比价,下单,预约,回复消息,
这些事没什么技术含量,
但就是耗时间,就是烦。

Handoff瞄准的就是这个最大的市场。

最有意思的是Brett Adcock这个人,
他一边做着Figure人形机器人,
已经在宝马工厂里干活了,

一边又做了这个数字助手。
你仔细想会发现这俩本质是同一个技术:
都是给AI一个眼睛(屏幕或者摄像头),
让它在一个不可预测的环境里,
自己做决定,自己动手完成任务。

一个在物理世界里搬东西拧螺丝,
一个在数字世界里点鼠标下单,
底层能力是通的。

当然现在还是研究预览版,
真实网站比基准测试脏多了,
反爬、验证码、风控、奇怪的弹窗,
这些东西能不能稳定处理还要看正式开放后的表现,
但方向肯定是对的。

我们用了这么多年互联网,
一直都是我们自己去适应网站,
记哪个按钮在哪,
一步一步点过去。

从这个东西开始,
要反过来了,

你只要说你要什么,
AI去适应所有的网站,
帮你把事办了。

今年夏天晚些时候正式开放,
我要先去排队了,到时候第一时间给你们测真实体验hh

### 引用推文

> Brett Adcock：Today we're introducing Hark Handoff Handoff has been independently verified as the best internet-use model ever built, outperforming ChatGPT 5.4 & Opus 4.8 Whi...
