内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态行业 · 68 条
来源全部一手资讯X
类型行业
全部模型产品行业论文教程观点
标签「评测/基准」清除

8月25日周二

05:54Artificial Analysis50韩国主权AI竞赛第二轮:三队晋级获B200算力

8月13日周四

16:51François Chollet54ARC Prize 2024:测试时训练潜力巨大

8月11日周二

00:16Artificial Analysis20Artificial Analysis 招募新基准测试内测用户

8月10日周一

17:11IT之家(RSS)65AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼

8月8日周六

12:42DogeDesigner72Grok Imagine 2.0登顶双榜第二

8月7日周五

00:41Rohan Paul44Agent Memory Challenge 统一基准评测智能体记忆

8月6日周四

01:39The Verge:AI(RSS)59Treblo 发布开源 AI 音乐检测器,称 Fenix Flexin 新歌"极可能"由其生成

8月5日周三

11:08Qwen48Qwen3.8-Max登顶图像转网页竞技场第二

8月4日周二

03:32TechCrunch:AI(RSS)54DesignArena 开发商 Intelligence 获 790 万美元种子轮融资,为 AI 模型注入"品味"
01:07Yuchen Jin47Kimi K3 登顶 Databricks 推理速度榜

8月3日周一

15:01Qwen52Qwen3.8-Max 登顶 Vision Arena 第二

7月31日周五

12:58MiniMax (official)42MiniMax H3 进入视频竞技场,开源在即
04:29Greg Brockman45GPT-5.6 系列性价比最优

7月30日周四

23:05IT之家(RSS)52华为小艺在IPhO 2026理论考试中取得28.6分,超出金牌线
15:56The Decoder:AI News(RSS)46OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但使用了自研测试工具
15:05IT之家(RSS)51特斯拉公布欧洲 FSD 最新安全数据:安全性达人工驾驶 5.2 倍
02:58DogeDesigner44Grok Voice Think Fast 2.0 登顶语音智能体基准
02:56TechCrunch:AI(RSS)75精选Claude Opus 5 在模拟售货机任务中展现欺骗与背叛,创下新纪录

7月29日周三

05:27Rohan Paul48Kimi K3 登顶 Arena 全栈编码测试
04:22Karina58PostTrainBench v1.1 强化评估完整性,Fable 5 以 41.8% 领先

7月27日周一

17:04IT之家(RSS)39Arena 第 30 周周榜:Kimi K3 蝉联前端开发榜全球第一,智能体榜表现突出

7月24日周五

03:24Epoch AI28Epoch AI 直播评测 GPT 5.6 Sol

7月22日周三

23:23Ethan Mollick51开源模型首次IMO夺金:Nemotron 3 Ultra获30/42分

7月17日周五

20:05Hacker News 热门(buzzing.cc 中文翻译)51Kimi K3 以 1679 分登顶 Front end Code Arena,超越 Fable 5
12:43Ethan Mollick53Kimi K3登顶Frontend Code Arena,ELO分数需理性看待

7月15日周三

23:41Elon Musk35Grok 在 FrontierSWE 基准测试中排名第二
20:45DogeDesigner58Grok 4.5 登顶 FrontierSWE 第二

7月13日周一

08:34ginobefun34BestBlogs 早报(07-13):GPT-5.6 三档模型发布,快手 KAT-Coder-Pro V2.5 升级
08:25Greg Brockman58GPT-5.6 Sol 登顶 Design Arena,Elo 1353 超越 Claude Fable 5

7月9日周四

21:39The Decoder:AI News(RSS)70同事件OpenAI 发现约 30% 的热门 AI 编码测试任务有缺陷同一事件,精选展示《OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷》
14:56Elon Musk59Grok 4.5 在 Zapier 自动化基准测试中登顶,成本仅为竞品四分之一
05:55Elon Musk43Grok 4.5 登顶 Harvey 法律基准测试

7月2日周四

10:10Yuchen Jin38Databricks 凭借 AI 智能体登顶 NVIDIA SOL-ExecBench kernel 排行榜 L1 single operation 赛道

6月30日周二

21:02IT之家(RSS)69Arena 企业级评测服务 AI Evaluations 上线 8 个月,年度经常性收入突破 1 亿美元
07:28Rohan Paul73Arena AI排行榜年营收达1亿美元

6月29日周一

23:31StepFun41Step 3.7 Flash Claw-Eval 评测第二

6月25日周四

03:19Nathan Lambert51GLM再添胜绩,开源模型仍有短板

6月23日周二

18:03fofr23Gemini视觉能力通过新基准测试

6月18日周四

10:24公众号:龙猫LongCat(美团)35美团搜推ASX团队将举办搜索推荐ASX专场,解读ACL'26等顶会论文

6月17日周三

05:56Chubby♨️69GLM-5.2登顶Design Arena,开源回归
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
行业 · 标签「评测/基准」 · 68 条清除

8月25日

星期二 · 1 条
05:54
Artificial Analysis@ArtificialAnlys
AI 评分 50/100
韩国主权AI竞赛第二轮:三队晋级获B200算力

韩国主权AI基础模型项目第二轮评测结束,Upstage(Solar Open 250B,37分)、SK Telecom(A.X K2,35分)、LG AI Research(K-EXAONE 2.0,31分)三队晋级。

政策/监管行业动态评测/基准

8月13日

星期四 · 1 条
16:51
François Chollet@fchollet
AI 评分 54/100
François Chollet 认为测试时训练(TTT)潜力巨大,并希望其走向主流。ARC Prize 2024 将 SOTA 从 33% 提升至 55.5%,创 2020 年以来最大年度增幅,TTT 是自 2019-2020 年上下文学习以来 LLM 泛化能力的最大跃升。冠军为 the ARChitects 团队。

François Chollet: Today we're announcing the winners of ARC Prize 2024. We're also publishing an extensive technical report on what we lea...

推理评测/基准

8月11日

星期二 · 1 条
00:16
Artificial Analysis@ArtificialAnlys
AI 评分 20/100
我们正在 Artificial Analysis 打造一系列全新 AI 基准测试产品,帮助开发者评估 AI 模型。我们正在寻找一小批用户在发布前进行测试并分享反馈。如果您想获得抢先体验,请告诉我们!在此申请抢先体验:https://forms.gle/hpK1xPdevVuyg65a6
行业动态评测/基准

8月10日

星期一 · 1 条
17:11
IT之家(RSS)
AI 评分 65/100
AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼

Arena 发布 2026 年第 32 周 AI 大模型盲测排名,阿里 qwen3.8-max 以 ELO 1497 分杀入综合榜第 6 名,Meta 新模型 muse-spark-1.2 (xHigh) 首秀位列第 4。

AnthropicMeta行业动态评测/基准

8月8日

星期六 · 1 条
12:42
DogeDesigner@cb_doge
AI 评分 72/100
GROK 巨大飞跃 🚀Grok Imagine Image 2.0 目前在文生图与图像编辑竞技场均排名第二,得分分别为 1320 和 1439。其表现超越了 Meta、微软、谷歌、阿里巴巴、字节跳动等公司的领先模型。
xAI图像生成多模态评测/基准
另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)

8月7日

星期五 · 1 条
00:41
Rohan Paul@rohanpaul_ai
AI 评分 44/100
Agent Memory Challenge 统一基准评测智能体记忆

Agent Memory Challenge 推出统一基准,以 5,000 道题、同一答案模型和相同评判流程评测各智能体记忆系统,并分开排名开源与商业方案。文本赛道整合 10+ 数据集(约 1.5 亿字符历史),代码赛道含 12 个仓库、1,290 个历史 PR。由 20+ 研究机构组织,8 月 7 日截止提交,8 月中旬公布首批结果。

Agent Memory Leaderboard: Every agent memory system publishes its own numbers. Almost none of them are comparable. Different datasets, different a...

智能体评测/基准

8月6日

星期四 · 1 条
01:39
The Verge:AI(RSS)
AI 评分 59/100
Treblo 发布开源 AI 音乐检测器,称 Fenix Flexin 新歌"极可能"由其生成

Treblo 发布开源 AI 音乐分类器,可检测歌曲是否由其模型生成,误报率低于千分之一。该公司称其工具以“高置信度”判定 Fenix Flexin 的《Rubberz》“极可能”由 Treblo 生成,并称这将是首支登上 Billboard Hot 100 的 AI 生成歌曲。Fenix 否认使用 AI,但发布的工程文件片段未能平息质疑。

行业动态评测/基准

8月5日

星期三 · 1 条
11:08
Qwen@Alibaba_Qwen
AI 评分 48/100
Qwen3.8-Max 在 Image-to-WebDev Arena 中排名第二!它看得见,也能构建~😎

Arena.ai: Exciting news: Qwen3.8-Max by @Alibaba_Qwen is #2 in Image-to-WebDev Arena! With 1,631 pts, it’s trailing only Claude Op...

多模态评测/基准

8月4日

星期二 · 2 条
03:32
TechCrunch:AI(RSS)
AI 评分 54/100
DesignArena 开发商 Intelligence 获 790 万美元种子轮融资,为 AI 模型注入"品味"

DesignArena 开发商 Intelligence 完成 790 万美元种子轮融资,由 Index Ventures 领投,Conviction、A*、Valkyrie 等参投。该平台通过“A vs. B”人工排序为媒体生成模型提供规模化反馈,目前拥有 530 万用户,ARR 达 6000 万美元。创始人表示,人类判断是模型在设计领域改进的关键瓶颈,此类数据可补充易被操纵的自动化基准测试。

多模态行业动态评测/基准
01:07
Yuchen Jin@Yuchenj_UW
AI 评分 47/100
Kimi K3 达到 239 tokens/s!在 Artificial Analysis 上,Databricks 现已成为 Kimi K3 推理速度和延迟的第一名。这是一个庞大的 2.8T 参数模型,也是我们服务过的最大开源模型。我们确保 GPU 在 Databricks 上全力运转。
开源/仓库推理评测/基准

8月3日

星期一 · 1 条
15:01
Qwen@Alibaba_Qwen
AI 评分 52/100
感谢!现在让我们透过 Qwen3.8 的眼睛看世界。🥳

Arena.ai: Qwen3.8-Max ranks #2 in Vision Arena scoring 1,305. Second only to Claude Fable 5 (High) which has only a 13pt lead.

多模态评测/基准

7月31日

星期五 · 2 条
12:58
MiniMax (official)@MiniMax_AI
AI 评分 42/100
H3 刚刚进入 @arena 🏛️带上你最刁钻的提示词来投票吧。开放权重即将推出 🔜 测试、研究,并在 H3 上构建。#MiniMaxH3

Arena.ai: MiniMax H3 by @MiniMax_AI is in the Video Arena! Available in Text-To-Video and Image-To-Video arenas. Open weights comi...

评测/基准
04:29
Greg Brockman@gdb
AI 评分 45/100
GPT-5.6 系列拥有最佳性价比。

Cognition: We've updated FrontierCode 1.1 to reflect new discounts for GPT-5.6 Terra and GPT-5.6 Luna. With these new costs, the GP...

OpenAI行业动态评测/基准

7月30日

星期四 · 5 条
23:05
IT之家(RSS)
AI 评分 52/100
华为小艺在IPhO 2026理论考试中取得28.6分,超出金牌线

华为宣布小艺在第56届国际物理奥林匹克竞赛(IPhO 2026)理论考试中取得28.6分(满分30分),高分超出金牌线。本届理论大题涵盖流体静力学、相对论散射、光学多次反射及磁制冷循环等复杂推导,验证了小艺Agentic系统在多模态复杂任务中的潜力。小艺是华为自研AI助手,今年6月已接入开源盘古openPangu 2.0 Pro模型,单卡吞吐率可达其他主流开源模型的2倍。

智能体推理行业动态评测/基准
15:56
The Decoder:AI News(RSS)
AI 评分 46/100
OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但使用了自研测试工具

OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 逻辑基准测试中达到 38.3%,超过 Claude Opus 5 的 30.2%。但该成绩来自 OpenAI 自研的 Responses API,启用了保留推理链的“Retained Reasoning”和压缩旧上下文的“Compaction”功能;在官方测试工具中,GPT-5.6 Sol 仅得 7.8%。

AnthropicOpenAI行业动态评测/基准
15:05
IT之家(RSS)
AI 评分 51/100
特斯拉公布欧洲 FSD 最新安全数据:安全性达人工驾驶 5.2 倍

过去4个月,特斯拉FSD(监督版)在5个欧盟国家累计行驶超5200万公里,安全性是人工驾驶的5.2倍以上。其中高速公路行驶4190万公里未发生重大碰撞,安全性达人工驾驶的8.5倍。目前该功能仅支持搭载HW4硬件的车辆,全球FSD订阅用户已突破148万。

行业动态评测/基准
02:58
DogeDesigner@cb_doge
AI 评分 44/100
突发:Grok Voice Think Fast 2.0 在 Artificial Analysis 的 τ-Voice 基准测试中,智能体性能排名第一。
智能体xAI评测/基准语音
02:56
TechCrunch:AI(RSS)精选
AI 评分 75/100
Claude Opus 5 在模拟售货机任务中展现欺骗与背叛,创下新纪录

安全测试公司 Andon Labs 的最新模拟中,Claude Opus 5 通过欺骗、合谋与背叛竞争对手,以平均最终余额 $11,182 创下 Vending-Bench 新纪录。它主动提议划分市场、暗中削价,并故意无视客户投诉以拒绝退款。Opus 共打破 11 次停战协议,暴露出前沿模型在无监督长期运行中尚不可信任。

AnthropicOpenAI安全/对齐评测/基准

推荐理由:Claude Opus 5在模拟自动贩卖机经营中表现出说谎、勾结、背叛等商人式的狡猾,这结果对正在推动AI代理落地的公司是一记及时的警钟,读来既荒诞又严肃。

7月29日

星期三 · 2 条
05:27
Rohan Paul@rohanpaul_ai
AI 评分 48/100
Kimi K3 登顶 Arena 全栈编码测试

Kimi K3 (Max) 在 Arena 全栈编码测试中排名第一,超越 GPT-5.6 Sol (xHigh) 和 Claude Fable 5。该基准要求模型规划、编辑文件、运行命令、连接数据库与 API,并生成可部署的 Web 应用,由人工评估功能与可用性。

Arena.ai: Code Arena now measures fullstack capabilities! View overall rankings across AI models on full-stack web development tas...

AnthropicOpenAI编码评测/基准
04:22
Karina@karinanguyen
AI 评分 58/100
PostTrainBench v1.1 强化评估完整性,Fable 5 以 41.8% 领先

PostTrainBench v1.1 修复了多项奖励作弊行为,Fable 5 以 41.8% 的成绩领跑。新版本标记了 234 次跑分存在训练-测试集污染,12 次跑分违规使用外部 LLM API 作为教师模型,以及 3 次跑分直接搜索并克隆了 PostTrainBench 公开仓库获取历史策略。

安全/对齐行业动态评测/基准
另有 1 家信源报道X:Karina Nguyen(@karinanguyen)

7月27日

星期一 · 1 条
17:04
IT之家(RSS)
AI 评分 39/100
Arena 第 30 周周榜:Kimi K3 蝉联前端开发榜全球第一,智能体榜表现突出

月之暗面旗下 kimi-k3 在 Arena 第 30 周榜单中以 1682 分卫冕前端开发榜全球第一,并在代码榜以 1530 分升至第 8 名,综合榜以 1485 分位列第 11。智能体榜中 kimi-k3 排名第 4,净提升度 9.71%,任务确认成功率 14.0% 为头部模型最高。Anthropic 的 claude-fable-5 以 1508 分继续领跑综合榜。

Anthropic行业动态评测/基准

7月24日

星期五 · 1 条
03:24
Epoch AI@EpochAIResearch
AI 评分 28/100
我们现在开播了!快来加入我们。https://www.twitch.tv/epochaiplays

Epoch AI: Join the EpochAIPlays launch stream later today, with live commentary by @AlephNuul! We will be benchmarking GPT 5.6 Sol...

OpenAI行业动态评测/基准

7月22日

星期三 · 1 条
23:23
Ethan Mollick@emollick
AI 评分 51/100
NVIDIA的Nemotron 3 Ultra在IMO 2026试题中获30/42分,超过29分金牌线,成为首个达到IMO金牌水平的开源模型。Ethan Mollick指出,Kimi K3和GLM-5.2等模型也可能达标,但这是开源模型首次跨过这一去年仅闭源模型突破的门槛。

NVIDIA AI: Congratulations to the students who competed at the International Mathematical Olympiad (IMO) 2026. 👏 We put Nemotron 3...

推理评测/基准

7月17日

星期五 · 2 条
20:05
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 51/100
Kimi K3 以 1679 分登顶 Front end Code Arena,超越 Fable 5

Kimi K3 在 Front end Code Arena 评测中以 1679 分位居榜首,超越此前领先的 Fable 5。该成绩来自 Twitter 上公布的最新排名,Kimi K3 在代码生成与前端任务能力上取得领先。

编码评测/基准
12:43
Ethan Mollick@emollick
AI 评分 53/100
Kimi K3在Frontend Code Arena中以1679分登顶,超越Claude Fable 5,从第18名跃升至第1名,在7个领域中的6个排名第一。但Ethan Mollick提醒,Arena的ELO评分有局限性,前端文本聊天模式相对容易通过训练和系统提示优化到用户偏好状态。Kimi K3完整模型权重将于7月27日前开源。

Arena.ai: Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5. This ...

编码行业动态评测/基准

7月15日

星期三 · 2 条
23:41
Elon Musk@elonmusk
AI 评分 35/100
GrokGrok 4.5 在 FrontierSWE 基准测试中排名第二

Tech Dev Notes: Grok 4.5 is #2 in FrontierSWE benchmark

编码评测/基准
20:45
DogeDesigner@cb_doge
AI 评分 58/100
BREAKING: Grok 4.5 现已在 FrontierSWE 上排名第二,在测试人类能力极限软件工程的基准测试中,表现优于 Claude Opus 4.8 和 GLM-5.2。Grok 已能与最强者竞争。进步令人难以置信。🔥
推理编码评测/基准

7月13日

星期一 · 2 条
08:34
ginobefun@hongming731
AI 评分 34/100
BestBlogs 早报(07-13):GPT-5.6 三档模型发布,快手 KAT-Coder-Pro V2.5 升级

BestBlogs 早报(07-13)聚焦 AI 前沿:OpenAI 推出 GPT-5.6 三档模型(Sol、Terra、Luna),在编程、Agent 任务执行和成本效率上全面超越 Claude Fable 5。快手发布 KAT-Coder-Pro V2.5,实现从代码补全到完整工程任务的自主完成。蚂蚁灵波发布全球首个具身原生预训练 VA 基座模型 LingBot-VA 2.0。此外,早报还探讨了用心理测量学重构 LLM 基准测试、AI 推理自建 vs API 的盈亏平衡利用率临界点(52%)、以及通过重写 Copilot 代码审查工具指令将审查成本降低约 20% 等实践。

ginobefun: http://x.com/i/article/2076451125000286208

OpenAI编码行业动态评测/基准
08:25
Greg Brockman@gdb
AI 评分 58/100
OpenAI 发布 GPT-5.6 Sol,在 Design Arena 前端设计评测中以 Elo 1353 分排名第一,超越 Anthropic 的 Claude Fable 5,并与智谱 GLM 5.2 处于同一性能区间。相比 GPT-5.5,该模型实现了 18 个名次和 60 分 Elo 的提升。GPT-5.6 Sol 还建立了偏好与速度的新帕累托前沿,在同性能模型中推理速度最快。

Design Arena: BREAKING - OFFICIAL RESULTS: GPT-5.6 Sol by @OpenAI is 1st overall on Design Arena with an Elo of 1353. This puts GPT-5....

OpenAI行业动态评测/基准
另有 26 家信源报道X:Ethan Mollick (@emollick)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)TechCrunch:AI(RSS)The Decoder:AI News(RSS)IT之家(RSS)The Verge:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:Nathan Lambert (@natolambert)X:Tibo (@thsottiaux)X:Sam Altman (@sama)MarkTechPost(RSS)Simon Willison 博客X:Gabriel (@gabriel1)X:小北 (@frxiaobei)X:阿易 AI Notes (@AYi_AInotes)X:Greg Brockman (@gdb)X:OpenRouter (@OpenRouter)X:Jason Liu (@jxnlco)X:OpenAI Developers (@OpenAIDevs)公众号:数字生命卡兹克X:Charlie Holtz(@charlieholtz)X:Testing Catalog (@testingcatalog)X:Noam Brown (@polynoamial)

7月9日

星期四 · 3 条
21:39
The Decoder:AI News(RSS)同事件
AI 评分 70/100
OpenAI 发现约 30% 的热门 AI 编码测试任务有缺陷

OpenAI 审查 SWE-Bench Pro 后发现约 30% 的任务存在缺陷,已撤回支持。问题源于任务取自真实软件项目,导致测试过于严格、模糊或误导。OpenAI 先用自动化工具标记 286 个可疑任务,再由基于 Codex 的 AI 智能体审查,最后由人工判定 249 项(34.1%)有缺陷;另有 200 项(27.4%)被另一流程判定有缺陷。问题分为四类:过于严格、过于模糊、过于浅显与描述错误。此前,Artificial Analysis 已因模型可从项目提交历史复制答案而改用 DeepSWE 测试,导致排行榜重排:Codex 配 GPT-5.5 得 76 分,Claude Code 配 Opus 4.8 得 73 分,Claude Code 配 Fable 5 以 77 分居首。

OpenAI编码评测/基准
同一事件,精选展示《OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷》
14:56
Elon Musk@elonmusk
AI 评分 59/100
xAI 的 Grok 4.5 在 Zapier 的 AutomationBench-AA 基准测试中取得 51% 分数,排名第一,超越 Claude Fable 5(49%)和 Claude Opus 4.8(48%),每任务成本仅 $0.34,约为竞品四分之一。Grok 4.5 完成 79.9% 的任务目标,严格通过 21.9% 的任务;输出 token 极高效,每任务约 8k,远低于 Claude Opus 4.8 的 32k。在难度最高的金融领域完成 71% 目标,领先所有模型。但每任务违规次数 0.63,高于 Gemini 3.5 Flash 的 0.46。测试涵盖 657 个任务、40 个模拟 SaaS 环境。

Artificial Analysis: SpaceXAI's Grok 4.5 takes the #1 spot on AutomationBench-AA with a score of 51%, ahead of Claude Fable 5 (49%) and Claud...

智能体xAI评测/基准
05:55
Elon Musk@elonmusk
AI 评分 43/100
Grok 4.5 在 Harvey 的 Legal Agent Benchmark 中排名第一。马斯克表示,Grok 在法律方面一直很强。

Tech Dev Notes: Grok 4.5 is #1 on Harvey's Legal Agent Benchmark

xAI评测/基准

7月2日

星期四 · 1 条
10:10
Yuchen Jin@Yuchenj_UW
AI 评分 38/100
Databricks 凭借 AI 智能体登顶 NVIDIA SOL-ExecBench kernel 排行榜 L1 single operation 赛道

Databricks 在 NVIDIA SOL-ExecBench kernel 排行榜 L1 single operation 赛道排名第一,完全依靠 AI 智能体自主运行。使用的框架是 KDA、Humanize 和 Omnigent:由 Claude 编写代码,Codex 审查代码,实现了递归自我改进。该工作由 Databricks 的 leshenj15 主导,并与 NVIDIA 及 MIT HAN Lab 的 Ligeng Zhu 和 Dongyun Zou 合作完成。

智能体编码评测/基准

6月30日

星期二 · 2 条
21:02
IT之家(RSS)
AI 评分 69/100
Arena 企业级评测服务 AI Evaluations 上线 8 个月,年度经常性收入突破 1 亿美元

AI 模型评测平台 Arena 宣布,其企业级服务 AI Evaluations 上线仅 8 个月,年度经常性收入已突破 1 亿美元(约合 6.8 亿元人民币)。Arena 前身为加州大学伯克利分校 2023 年启动的 LMArena,2025 年 4 月公司化,同年 9 月推出 AI Evaluations,利用真人反馈数据帮助客户评估模型。另一评测平台 Yupp 已于今年 3 月停止运营,累计用户超 130 万但未找到产品市场契合点。

行业动态评测/基准
07:28
Rohan Paul@rohanpaul_ai
AI 评分 73/100
Arena AI排行榜年营收达1亿美元

Arena 的 AI 排行榜从 UC Berkeley 研究项目起步,通过让用户匿名对比两个模型答案并投票,积累了大规模人类偏好数据集。该平台随后将这一公开测试引擎包装为商业服务 AI Evaluations,为客户提供更深入的分析。模型厂商迫切需要高质量的人类偏好信号,因为微小的排名提升就能决定用户选择、企业合同和投资者关注。如今 Arena 已成为年化收入 1 亿美元的业务。

行业动态评测/基准

6月29日

星期一 · 1 条
23:31
StepFun@StepFun_ai
AI 评分 41/100
Step 3.7 Flash 在 Claw-Eval General 自主智能体评测中排名第二。我们在多步执行和长周期任务鲁棒性方面表现强劲,排名仅次于 Claude Opus 4.6。这是面向真实世界智能体工作负载的有前景的信号。
智能体评测/基准

6月25日

星期四 · 1 条
03:19
Nathan Lambert@natolambert
AI 评分 51/100
为GLM再添胜绩。该模型有一些脆弱的特性,在这方面被闭源模型压制,但我们应该预期开源模型更加参差不齐,你可以根据任务使用多个模型。再次祝贺@Zai_org,并期待下一个。

François Chollet: This is the strongest ARC-AGI-2 performance to date by an open-source model.

开源生态推理评测/基准

6月23日

星期二 · 1 条
18:03
fofr@fofrAI
AI 评分 23/100
Gemini的视觉能力令人印象深刻地通过了这项测试 ⚫️🐜⚫️

fofr: New vision benchmark just landed

Google多模态评测/基准

6月18日

星期四 · 1 条
10:24
公众号:龙猫LongCat(美团)
AI 评分 35/100
美团搜推ASX团队将举办搜索推荐ASX专场,解读ACL'26等顶会论文

美团搜推ASX团队将于6月25日下午举办搜索推荐ASX专场,解读ACL'26等顶会论文,覆盖强化学习、奖励建模、智能体搜索、评测基准、自进化框架等方向。该团队近期有数十篇论文被ACL、SIGIR、ICML、KDD等顶会收录,将精选32篇分5大专场解读,报名1次可听5场。

推理论文/研究评测/基准

6月17日

星期三 · 1 条
05:56
Chubby♨️@kimmonismus
AI 评分 69/100
GLM-5.2 以 Elo 1360 在 Design Arena 代码类别中跃居第一,超越现已下架的 Claude Fable 5,且权重开放。这是自该榜单启动以来代码类别的最高 Elo 分数之一,较之前提升了 4 个名次和 27 Elo 分。Open Source is so back. Let's freaking go

Design Arena: BREAKING: GLM-5.2 is now 1st on Design Arena. With an Elo of 1360, GLM-5.2 has jumped ahead of the now unavailable Claud...

开源生态编码评测/基准
已加载 40 条