内容
精选全部 AI 动态热点榜AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「评测/基准」清除

8月8日周六

13:42Rohan Paul50Meta Muse Spark 1.2 登顶 Text Arena 性价比前沿
13:05elsewhere:文章(RSS)26葬AI发布 meme bench 视频模型评测基准
12:42DogeDesigner72Grok Imagine 2.0登顶双榜第二
12:12DogeDesigner40Grok Imagine 2.0 登顶图像编辑榜第二
11:42Greg Brockman39GPT-5.6 Luna降价80%后ARC-AGI成绩持平
11:42DogeDesigner49Grok Imagine 2.0 登顶文生图榜第二
05:57Dongxi 东锡 NLP52DeepSeek V4 Flash 低推理预算下仍近满分
03:55Simon Willison 博客54Moonlight & Mayhem:Codex 与 GPT-5.6 Sol Ultra 一次生成完整游戏
03:42Hacker News 热门(buzzing.cc 中文翻译)49DeepSeek V4 Flash 0731 在 ARC-AGI 基准上公布验证得分
01:12Artificial Analysis65文生图竞技场更新:GPT Image 2 全项第一
00:45Alexandr Wang46Meta Muse Spark 1.2 登顶文本竞技场第四
00:41dex38SlopCodeBench 新基准:最强模型通过率仅 33%

8月7日周五

16:12Qwen23Qwen3.8-Max 细节观察力领先 Gemini 3.5 Flash
15:10IT之家(RSS)51Composio 测试 4 个 AI 编程智能体框架:谁是 DeepSeek V4 Flash 最佳搭档?
09:44Alexandr Wang41Muse Spark 1.2 登顶金融智能体评测
09:41Rohan Paul44Muse Spark 1.2 登顶帕累托前沿,成本仅为 Opus 4.8 五分之一
08:11Rohan Paul34Grok 4.5 以 13 倍低成本击败 Kimi K3
07:40Artificial Analysis52Muse Spark 1.2 登顶 Meta 成本效益前沿
05:10Hacker News 热门(buzzing.cc 中文翻译)59Qwen3.8 Max 登顶 Artificial Analysis 智能指数综合榜首
04:40Epoch AI26Epoch AI 新基准测试 Opus 5 得分 59%
04:10Artificial Analysis43Artificial Analysis 智能指数更新至 v4.1.1
03:40Chubby♨️57Dreamina Seedance 2.5 全球首发评测
02:44Alexandr Wang29Muse-Spark 1.2登SideQuest榜第二
01:41AK36迈向技能原生大模型:长程推理基准新方法
00:41Rohan Paul44Agent Memory Challenge 统一基准评测智能体记忆
00:41The Decoder:AI News(RSS)47Claude Code 是最快智能体框架,但成本比最便宜对手高近三倍

8月6日周四

23:41AI at Meta42Meta AI 模型五科奥赛夺金
22:31Databricks:Blog(RSS)46Databricks 发布 OfficeQA Pro V2:面向企业落地推理的新基准
21:40The Decoder:AI News(RSS)54Qwen3.8 Max 追平 Claude Opus 4.8,但 Kimi K3 以低 25% 成本得分更高
21:11Rohan Paul37Primer 智能体框架让 GPT-5.5 金融评测得分跃升
20:41Rohan Paul27Kimi K3 全模型 16×GB10 集群跑出 20+tps
17:40Qwen46Qwen3.8-Max登顶智能体指数第一
16:40Rohan Paul44Kimi K3 与 Qwen3.8 Max 能力持平,成本成关键
15:44Alexandr Wang31Muse Spark 1.2 登顶 Vals 前五
15:44Alexandr Wang30Pelican 基准仍可直观展示模型进步
13:13karminski-牙医62Qwen3.8-Max 实测:前端第一梯队,Agent 分工明确
12:01公众号:龙猫LongCat(美团)57Agent评测漫谈:从打分动作走向基础设施能力
11:08IT之家(RSS)44雷神水冷迷你 AI 工作站体验:176W 峰值性能,AI 创作的得力助手
10:08IT之家(RSS)42雷神水冷迷你 AI 工作站开箱图赏:桌面 Agent"小黑匣"
05:39Artificial Analysis68Meta 发布 Muse Spark 1.2,智能指数升至 54
已加载 40 条
全部 AI 动态
2026年8月9日星期日 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
标签「评测/基准」 · 1364 条清除

8月8日

星期六 · 12 条
13:42
Rohan Paul@rohanpaul_ai
50
Meta 的 Muse Spark 1.2 (xHigh) 在 Text Arena 排名第 4(1498 分),重塑了该榜单的成本-质量帕累托前沿。相比榜首 Claude Fable 5(1507 分/$40M),其评分仅低 9 分,但标准化价格降低约 91%,按混合费率计为 $3.50M。该模型定价 $1.25/$4.25 每百万 token。

Arena.ai: Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...

Meta评测/基准
13:05
elsewhere:文章(RSS)
26
葬AI发布 meme bench 视频模型评测基准

葬AI发布 meme bench,用于评测视频模型能力。该基准历时半个月打造,旨在更全面地衡量视频模型表现。

图像生成视频评测/基准
12:42
DogeDesigner@cb_doge
72
GROK 巨大飞跃 🚀Grok Imagine Image 2.0 目前在文生图与图像编辑竞技场均排名第二,得分分别为 1320 和 1439。其表现超越了 Meta、微软、谷歌、阿里巴巴、字节跳动等公司的领先模型。
xAI图像生成多模态评测/基准
另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)
12:12
DogeDesigner@cb_doge
40
突发:Grok Imagine Image 2.0 以 1439 分的 Arena 评分位列图像编辑模型第二名,超越 Meta、微软、谷歌和字节跳动的模型。
xAI图像生成评测/基准
11:42
Greg Brockman@gdb
39
luna 是个非常特别的模型,性价比惊人。

ARC Prize: We re-tested GPT-5.6 Luna from @OpenAI on ARC-AGI (Verified) following its recent 80% price reduction: - ARC-AGI-2: 59.6...

OpenAI推理评测/基准
11:42
DogeDesigner@cb_doge
49
突发:Grok Imagine Image 2.0 以 1320 分的 Arena 评分位列文生图模型第二名,超越 Meta、Google、阿里巴巴、字节跳动等公司的模型。
xAI图像生成评测/基准
05:57
Dongxi 东锡 NLP@dongxi_nlp
52
DeepSeek V4 Flash 在 ARC-AGI-1 上以低推理预算即得约 84 分,最高约 89 分,额外推理仅多解 5 题,表明其后训练产生了异常高效的抽象推理。该模型 ARC-AGI-2 得分 61.4%($0.04/任务),ARC-AGI-1 得分 89.0%($0.02/任务),树立了性价比帕累托前沿新标准。

ARC Prize: DeepSeek V4 Flash from @deepseek_ai on ARC-AGI (Verified): - ARC-AGI-2: 61.4%, $0.04/task - ARC-AGI-1: 89.0%, $0.02/task...

DeepSeek推理评测/基准
03:55
Simon Willison 博客
54
Moonlight & Mayhem:Codex 与 GPT-5.6 Sol Ultra 一次生成完整游戏

Simon Willison 用同一提示词让 Codex Desktop 上的 GPT-5.6 Sol Ultra 生成游戏,效果优于此前 Claude Fable 5 的版本。新作《Moonlight & Mayhem》设定在博物馆,玩家需解救同伴以盗取金沙丁鱼。Codex 用时 52 分钟完成项目,但未能发现角色眼球异常放大的 bug,经提示后修复。

智能体AnthropicOpenAI编码
03:42
Hacker News 热门(buzzing.cc 中文翻译)
49
DeepSeek V4 Flash 0731 在 ARC-AGI 基准上公布验证得分

DeepSeek V4 Flash 0731 在最大推理强度下,ARC-AGI-1 Semi-Private 得分 89.0%,每任务成本 $0.02;ARC-AGI-2 Semi-Private 得分 61.4%,每任务成本 $0.04。该模型在 ARC-AGI-1 和 ARC-AGI-2 上均提供 Max、High、Low 三档推理强度下的验证分数。

DeepSeek推理评测/基准
01:12
Artificial Analysis@ArtificialAnlys
65
文生图竞技场更新:GPT Image 2 全项第一

Artificial Analysis 更新文生图竞技场,按 10 类真实用例与 9 项能力评测模型,覆盖营销、电商、UI/UX 设计等场景。GPT Image 2 在所有用例和能力榜单均列第一;Nano Banana 2 以 $67/千图成为性价比之选,MAI-Image-2.5 是电商领域最佳廉价选项,Nano Banana Pro 则在真人电影领域表现突出。

OpenAI图像生成评测/基准
00:45
Alexandr Wang@alexandr_wang
46
nice(注:主推文仅为"nice"一词,无实质内容。根据引用式 teaser 例外规则,正文概括引用推文核心要点。)Meta 的 Muse Spark 1.2 (xHigh) 在文本竞技场中位列第四(1498 分),重塑了帕累托前沿。定价为每百万 token $1.25/$4.25。再次祝贺 @AIatMeta 团队发布此版本!

Arena.ai: Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...

Meta模型发布评测/基准
00:41
dex@dexhorthy
38
SlopCodeBench 新基准:最强模型通过率仅 33%

新一期播客深入解析华盛顿大学推出的 SlopCodeBench 基准,该基准要求模型随时间演化代码库,并衡量代码复杂度增长。目前最强模型(Fable、Sol、Kimi K3)通过率仅 33%。主持人 Dex Horthy 与 Vaib 探讨了基准机制及前沿模型测试发现。

编码评测/基准

8月7日

星期五 · 14 条
16:12
Qwen@Alibaba_Qwen
23
感谢 thorough 的测试!有了 Qwen3.8-Max,每个人都能细致地观察世界。👀

SkalskiP: 8.5 percentage points ahead of Gemini 3.5 Flash congrats to @Alibaba_Qwen !

评测/基准
15:10
IT之家(RSS)
51
Composio 测试 4 个 AI 编程智能体框架:谁是 DeepSeek V4 Flash 最佳搭档?

Composio 用 30 项真实工具任务测试 4 个 AI 编程智能体框架,统一调用 DeepSeek V4 Flash 正式版。Oh My Pi 成功率最高(17/30),但速度最慢(每任务 272 秒);Claude Code 速度最快(122 秒)但成本最高(每任务 0.195 美元),OpenCode 成本最低(每成功任务 0.073 美元)。

DeepSeekMCP/工具编码评测/基准
09:44
Alexandr Wang@alexandr_wang
41
muse spark 1.2 在 finance agent v2 上达到 SOTA!【引用 @ValsAI】:Muse Spark 1.2 是首个在 Finance Agent v2 上突破 60% 的模型,该基准测试让模型担任金融分析师的工作。每次测试成本 $0.77,比此前的第一名 Opus 5($5.12)便宜 6.7 倍,速度是其两倍。

Vals AI: Muse Spark 1.2 is the first model to crack 60% on Finance Agent v2, our benchmark that gives models the job of a financi...

智能体评测/基准
09:41
Rohan Paul@rohanpaul_ai
44
Muse Spark 1.2 登顶帕累托前沿,成本仅为 Opus 4.8 五分之一

Meta 的 Muse Spark 1.2 以每任务 $0.40 的成本登上 Artificial Analysis 帕累托前沿,在同等成本下无模型智能指数更高。

Artificial Analysis: Muse Spark 1.2 places Meta on the Cost per Task Pareto frontier, scoring 6 points below Claude Opus 5 at ~1/6th of the c...

智能体Meta评测/基准
08:11
Rohan Paul@rohanpaul_ai
34
AI/ML API 用同一提示词、一次性任务对比四款模型生成 3D 玩偶的成本:Grok 4.5 仅 $0.15,GPT 5.6 Sol 为 $0.60,Qwen 3.8 Max 为 $0.67,而 Kimi K3 高达 $1.98。Kimi 思考约 19 分钟,费用是 Grok 的 13 倍。对生产级智能体而言,单次任务完成成本正变得比单 token 价格更重要。

AI/ML API: Grok 4.5 just beat Kimi K3 at 13x cheaper price! $0.15 vs $1.98 - same task, same prompt, one shot. We'll miss Nikita Bi...

xAI评测/基准
07:40
Artificial Analysis@ArtificialAnlys
52
Muse Spark 1.2 登顶 Meta 成本效益前沿

Muse Spark 1.2 以 $1.25/$4.25 每百万 token 定价,登上 Meta 智能指数与单任务成本帕累托前沿,智能水平接近 Claude Opus 4.8(max,$2.03),单任务成本仅为后者五分之一。相比 Muse Spark 1.1($0.29/任务),1.2 版每 token 定价不变,成本上升源于智能体任务更重的 token 消耗。

Meta评测/基准
另有 1 家信源报道The Decoder:AI News(RSS)
05:10
Hacker News 热门(buzzing.cc 中文翻译)
59
Qwen3.8 Max 登顶 Artificial Analysis 智能指数综合榜首

Artificial Analysis 智能指数 v4.1.1 将 Qwen3.8 Max 评为综合表现最佳模型。该指数整合 9 项评测,并将 HLE、AA-LCR 和 AA-Omniscience 的评分器升级为 GPT-5.6 Luna (medium)。

智能体评测/基准
04:40
Epoch AI@EpochAIResearch
26
我们推出了一项新的"游戏谜题"基准测试,与我们的国际象棋谜题基准类似,但使用的是另一款未公开游戏的谜题。这有助于我们在推理密集型任务上测试 AI,而这些任务中的内容模型可能并未经过后训练。目前的最高纪录保持者是 Opus 5,得分 59%。
推理评测/基准
04:10
Artificial Analysis@ArtificialAnlys
43
Artificial Analysis 智能指数更新至 v4.1.1

Artificial Analysis 将智能指数更新至 v4.1.1,升级了评分模型并引入 Sierra 的 𝜏³-Banking v1.0.1。HLE、AA-LCR 和 AA-Omniscience 现由 GPT-5.6 Luna (medium) 评分。Claude Opus 5 以 63 分保持第一,多数模型分数变动小于 1 分,Muse Spark 1.2 涨幅最大(+2.7 分)。

OpenAI评测/基准
03:40
Chubby♨️@kimmonismus
57
1/ 我一直在测试 Dreamina Seedance 2.5,不出所料:这是目前最好的文生视频模型。没有之一。它也是美国区域支持 Seedance 2.5 模型的最快平台。这是 Seedance 2.5 的全球首发,Dreamina 专为充分发挥其性能而打造,无需再切换到其他工具。以下是我制作的两段视频片段:
图像生成视频评测/基准
02:44
Alexandr Wang@alexandr_wang
29
显然,muse-spark 1.2 非常擅长处理支线任务。

Zachi: We've got a change at the top. Meta's muse-spark 1.2 reaches 2nd place in the sidequest-bench.

Meta评测/基准
01:41
AK@_akhaliq
36
迈向技能原生大语言模型用于基准测试与训练长程推理的技能熵论文:https://huggingface.co/papers/2608.05139
Hugging Face推理论文/研究评测/基准
00:41
Rohan Paul@rohanpaul_ai
44
Agent Memory Challenge 统一基准评测智能体记忆

Agent Memory Challenge 推出统一基准,以 5,000 道题、同一答案模型和相同评判流程评测各智能体记忆系统,并分开排名开源与商业方案。文本赛道整合 10+ 数据集(约 1.5 亿字符历史),代码赛道含 12 个仓库、1,290 个历史 PR。由 20+ 研究机构组织,8 月 7 日截止提交,8 月中旬公布首批结果。

Agent Memory Leaderboard: Every agent memory system publishes its own numbers. Almost none of them are comparable. Different datasets, different a...

智能体评测/基准
00:41
The Decoder:AI News(RSS)
47
Claude Code 是最快智能体框架,但成本比最便宜对手高近三倍

Composio 用 DeepSeek V4 Flash 在 Gmail、GitHub 等真实工具上测试了四个智能体框架的 30 项任务。Claude Code 速度最快(122 秒/任务)但成本最高($0.195/成功任务),OpenCode 最便宜($0.073),Oh My Pi 成功率最高(17/30)但最慢(272 秒/任务)。

智能体DeepSeek评测/基准

8月6日

星期四 · 14 条
23:41
AI at Meta@AIatMeta
42
Meta AI 模型五科奥赛夺金

Meta 将其 AI 模型送入五项 STEM 奥赛以检验推理能力,在亚洲物理奥赛(APhO)和国际物理奥赛(IPhO)理论考试中获满分,并在国际数学奥赛(IMO)摘金,国际化学奥赛(IChO)与罗马尼亚数学大师赛(RMM)达金牌水平。测试禁用一切工具(无搜索、无编程、无计算器),以纯推理应对高难度题目。

Meta推理评测/基准
22:31
Databricks:Blog(RSS)
46
Databricks 发布 OfficeQA Pro V2:面向企业落地推理的新基准

Databricks 发布 OfficeQA Pro V2,一个用于评估企业落地推理能力的新基准。该基准旨在检验模型在真实办公场景中基于给定资料进行推理的准确性与可靠性,为企业级 AI 应用选型提供参考依据。

推理评测/基准
21:40
The Decoder:AI News(RSS)
54
Qwen3.8 Max 追平 Claude Opus 4.8,但 Kimi K3 以低 25% 成本得分更高

阿里 Qwen3.8 Max 在 Artificial Analysis Intelligence Index 上得 56 分,较前代跃升 10 分,与 Claude Opus 4.8 持平,但落后于 Kimi K3(57 分),后者单任务成本还低 25%。

推理评测/基准
另有 1 家信源报道X:Artificial Analysis (@ArtificialAnlys)
21:11
Rohan Paul@rohanpaul_ai
37
Primer 智能体框架让 GPT-5.5 金融评测得分跃升

金融 AI 智能体系统 Primer 在 BigFinanceBench(928 道真实分析师任务题)上以 79.1% 的准确率登顶,而同一 GPT-5.5 模型裸测仅得 55.8%。16.3 分的提升来自检索(智能体从实际文件中定位数据),9.3 分来自计算(Primer 内置公司自定义指标逻辑)。该评测现已被列入 OpenAI GPT-5.6 发布页的唯一金融基准。

Al Smallwood: Primer tops BigFinanceBench. We ran @primerapp_ on @RogoAI's BigFinanceBench. Primer tops the leaderboard: 79.1% final-a...

智能体OpenAI评测/基准
20:41
Rohan Paul@rohanpaul_ai
27
有人在 16×GB10 集群上跑起了完整的 Kimi K3,平均 20+tps(llama-benchy 连贯语料),峰值 38tps,预填充 750tps。用的是 MikroTik Switch CRS804-4DDQ,配 4×400 转 4×100gbit 分支线缆,跑在 dspark 上。----reddit.com/r/LocalLLaMA/comments/1vfl525/kimi_k3_full_model_running_on_16x_gb10_cluster_at/
端侧评测/基准部署/工程
17:40
Qwen@Alibaba_Qwen
46
快速一览 Qwen3.8-Max 当前表现:Qwen3.8-Max 现已在 Artificial Analysis 智能指数中排名第 5,并在智能体指数中位列第 1!🥇我们将继续前行。🚀
智能体推理评测/基准
16:40
Rohan Paul@rohanpaul_ai
44
Kimi K3 与 Qwen3.8 Max 能力持平,成本成关键

Kimi K3 以 57 分继续领跑开源权重模型,仅领先 Qwen3.8 Max 一分,后者计划下周开源权重。Qwen3.8 Max 在 GDPval-AA 上以 1739 Elo 反超 Kimi K3(1685),且激活参数更小(95B vs 2.8T 总参数)。两者能力可视为持平,但 Kimi K3 单任务成本 $0.86,比 Qwen3.8 Max 的 $1.14 低 25%。

Artificial Analysis: Alibaba's Qwen3.8 Max scores 56 on the Artificial Analysis Intelligence Index at $1.14 per task, but open weights leader...

开源/仓库模型发布评测/基准
15:44
Alexandr Wang@alexandr_wang
31
Muse Spark 1.2 更新!Muse Spark 1.2 刚刚在 Vals Index 上闯入前五,每次测试仅需 $0.69。这比 Kimi 便宜 3 倍,比 Fable、Opus 和 5.6 Sol 便宜 10 倍甚至更多。

Vals AI: Muse Spark 1.2 just cracked the top 5 on the Vals Index, at just $0.69 per test. This is 3x cheaper than Kimi and 10x or...

评测/基准
15:44
Alexandr Wang@alexandr_wang
30
鹈鹕仍在进步。

Simon Willison: One of the things the pelican benchmark is still useful for is visually representing (to a tiny extent) the improvements...

Meta模型发布评测/基准
13:13
karminski-牙医@karminski3
62
Qwen3.8-Max 实测:前端第一梯队,Agent 分工明确

博主实测 Qwen3.8-Max,其前端能力达第一梯队,后端能力保持优势。Agent 能力上,Qwen3.8-Max 更适合串联或复合型任务(如项目重构、多智能体驱动),Qwen3.7-Max 则擅长大型单一任务(如拆解报告、DeepResearch)。此外,结合记忆框架让其玩卡牌游戏《苏丹的游戏》时翻车,博主在讨论中想出解决办法。

智能体推理评测/基准
12:01
公众号:龙猫LongCat(美团)
57
Agent评测漫谈:从打分动作走向基础设施能力

美团图灵Agent评测团队公开内部博客,系统讲解Agent评测方法论。评测核心是回答“Agent好不好”,需覆盖结果、过程、效率、风险四层,并以观测为基石。团队提出“人人一致、人机一致”对齐法,通过指标下钻与Rubric二元化,使数字站长人机一致率达99%,Beam从62%提升至92%。文章还探讨了长程Agent(如Claude Code)对观测评测带来的演进。

智能体教程/实践评测/基准
11:08
IT之家(RSS)
44
雷神水冷迷你 AI 工作站体验:176W 峰值性能,AI 创作的得力助手

雷神水冷迷你 AI 工作站搭载 AMD 锐龙 AI Max+ 395 处理器,配备 128GB LPDDR5X 统一内存,可分配 96GB 用作显存,实测 CPU 峰值功耗达 176W。

端侧评测/基准部署/工程
10:08
IT之家(RSS)
42
雷神水冷迷你 AI 工作站开箱图赏:桌面 Agent"小黑匣"

雷神科技今年 5 月发布的水冷迷你 AI 工作站迎来开箱图赏。该机搭载 AMD 锐龙 AI Max+ 395 处理器,最高 176W 性能释放,首发 26999 元。机身采用 199mm 正方体金属设计,重 6.5kg,内置 400W 12VO 白金电源,支持 Wi-Fi 7 与蓝牙 5.4,接口含双 USB4 Type-C 及 10G 有线网口。

端侧评测/基准
05:39
Artificial Analysis@ArtificialAnlys
68
Meta 发布 Muse Spark 1.2,智能指数升至 54

Meta 发布 Muse Spark 1.2,在 Artificial Analysis 智能指数中得分 54,较 1.1 版提升 3 分,与 Grok 4.5 并列美国实验室第三。

智能体Meta模型发布评测/基准
另有 1 家信源报道The Decoder:AI News(RSS)
已加载 40 条