Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...
Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...
We re-tested GPT-5.6 Luna from @OpenAI on ARC-AGI (Verified) following its recent 80% price reduction: - ARC-AGI-2: 59.6...
DeepSeek V4 Flash from @deepseek_ai on ARC-AGI (Verified): - ARC-AGI-2: 61.4%, $0.04/task - ARC-AGI-1: 89.0%, $0.02/task...
Simon Willison 用同一提示词让 Codex Desktop 上的 GPT-5.6 Sol Ultra 生成游戏,效果优于此前 Claude Fable 5 的版本。新作《Moonlight & Mayhem》设定在博物馆,玩家需解救同伴以盗取金沙丁鱼。Codex 用时 52 分钟完成项目,但未能发现角色眼球异常放大的 bug,经提示后修复。
DeepSeek V4 Flash 0731 在最大推理强度下,ARC-AGI-1 Semi-Private 得分 89.0%,每任务成本 $0.02;ARC-AGI-2 Semi-Private 得分 61.4%,每任务成本 $0.04。该模型在 ARC-AGI-1 和 ARC-AGI-2 上均提供 Max、High、Low 三档推理强度下的验证分数。
Artificial Analysis 更新文生图竞技场,按 10 类真实用例与 9 项能力评测模型,覆盖营销、电商、UI/UX 设计等场景。GPT Image 2 在所有用例和能力榜单均列第一;Nano Banana 2 以 $67/千图成为性价比之选,MAI-Image-2.5 是电商领域最佳廉价选项,Nano Banana Pro 则在真人电影领域表现突出。
Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...
新一期播客深入解析华盛顿大学推出的 SlopCodeBench 基准,该基准要求模型随时间演化代码库,并衡量代码复杂度增长。目前最强模型(Fable、Sol、Kimi K3)通过率仅 33%。主持人 Dex Horthy 与 Vaib 探讨了基准机制及前沿模型测试发现。
8.5 percentage points ahead of Gemini 3.5 Flash congrats to @Alibaba_Qwen !
Composio 用 30 项真实工具任务测试 4 个 AI 编程智能体框架,统一调用 DeepSeek V4 Flash 正式版。Oh My Pi 成功率最高(17/30),但速度最慢(每任务 272 秒);Claude Code 速度最快(122 秒)但成本最高(每任务 0.195 美元),OpenCode 成本最低(每成功任务 0.073 美元)。
Muse Spark 1.2 is the first model to crack 60% on Finance Agent v2, our benchmark that gives models the job of a financi...
Meta 的 Muse Spark 1.2 以每任务 $0.40 的成本登上 Artificial Analysis 帕累托前沿,在同等成本下无模型智能指数更高。
Muse Spark 1.2 places Meta on the Cost per Task Pareto frontier, scoring 6 points below Claude Opus 5 at ~1/6th of the c...
Grok 4.5 just beat Kimi K3 at 13x cheaper price! $0.15 vs $1.98 - same task, same prompt, one shot. We'll miss Nikita Bi...
Muse Spark 1.2 以 $1.25/$4.25 每百万 token 定价,登上 Meta 智能指数与单任务成本帕累托前沿,智能水平接近 Claude Opus 4.8(max,$2.03),单任务成本仅为后者五分之一。相比 Muse Spark 1.1($0.29/任务),1.2 版每 token 定价不变,成本上升源于智能体任务更重的 token 消耗。
另有 1 家信源报道The Decoder:AI News(RSS)Artificial Analysis 智能指数 v4.1.1 将 Qwen3.8 Max 评为综合表现最佳模型。该指数整合 9 项评测,并将 HLE、AA-LCR 和 AA-Omniscience 的评分器升级为 GPT-5.6 Luna (medium)。
Artificial Analysis 将智能指数更新至 v4.1.1,升级了评分模型并引入 Sierra 的 𝜏³-Banking v1.0.1。HLE、AA-LCR 和 AA-Omniscience 现由 GPT-5.6 Luna (medium) 评分。Claude Opus 5 以 63 分保持第一,多数模型分数变动小于 1 分,Muse Spark 1.2 涨幅最大(+2.7 分)。
We've got a change at the top. Meta's muse-spark 1.2 reaches 2nd place in the sidequest-bench.
Agent Memory Challenge 推出统一基准,以 5,000 道题、同一答案模型和相同评判流程评测各智能体记忆系统,并分开排名开源与商业方案。文本赛道整合 10+ 数据集(约 1.5 亿字符历史),代码赛道含 12 个仓库、1,290 个历史 PR。由 20+ 研究机构组织,8 月 7 日截止提交,8 月中旬公布首批结果。
Every agent memory system publishes its own numbers. Almost none of them are comparable. Different datasets, different a...
Composio 用 DeepSeek V4 Flash 在 Gmail、GitHub 等真实工具上测试了四个智能体框架的 30 项任务。Claude Code 速度最快(122 秒/任务)但成本最高($0.195/成功任务),OpenCode 最便宜($0.073),Oh My Pi 成功率最高(17/30)但最慢(272 秒/任务)。
Meta 将其 AI 模型送入五项 STEM 奥赛以检验推理能力,在亚洲物理奥赛(APhO)和国际物理奥赛(IPhO)理论考试中获满分,并在国际数学奥赛(IMO)摘金,国际化学奥赛(IChO)与罗马尼亚数学大师赛(RMM)达金牌水平。测试禁用一切工具(无搜索、无编程、无计算器),以纯推理应对高难度题目。
Databricks 发布 OfficeQA Pro V2,一个用于评估企业落地推理能力的新基准。该基准旨在检验模型在真实办公场景中基于给定资料进行推理的准确性与可靠性,为企业级 AI 应用选型提供参考依据。
阿里 Qwen3.8 Max 在 Artificial Analysis Intelligence Index 上得 56 分,较前代跃升 10 分,与 Claude Opus 4.8 持平,但落后于 Kimi K3(57 分),后者单任务成本还低 25%。
另有 1 家信源报道X:Artificial Analysis (@ArtificialAnlys)金融 AI 智能体系统 Primer 在 BigFinanceBench(928 道真实分析师任务题)上以 79.1% 的准确率登顶,而同一 GPT-5.5 模型裸测仅得 55.8%。16.3 分的提升来自检索(智能体从实际文件中定位数据),9.3 分来自计算(Primer 内置公司自定义指标逻辑)。该评测现已被列入 OpenAI GPT-5.6 发布页的唯一金融基准。
Primer tops BigFinanceBench. We ran @primerapp_ on @RogoAI's BigFinanceBench. Primer tops the leaderboard: 79.1% final-a...
Kimi K3 以 57 分继续领跑开源权重模型,仅领先 Qwen3.8 Max 一分,后者计划下周开源权重。Qwen3.8 Max 在 GDPval-AA 上以 1739 Elo 反超 Kimi K3(1685),且激活参数更小(95B vs 2.8T 总参数)。两者能力可视为持平,但 Kimi K3 单任务成本 $0.86,比 Qwen3.8 Max 的 $1.14 低 25%。
Alibaba's Qwen3.8 Max scores 56 on the Artificial Analysis Intelligence Index at $1.14 per task, but open weights leader...
Muse Spark 1.2 just cracked the top 5 on the Vals Index, at just $0.69 per test. This is 3x cheaper than Kimi and 10x or...
One of the things the pelican benchmark is still useful for is visually representing (to a tiny extent) the improvements...
博主实测 Qwen3.8-Max,其前端能力达第一梯队,后端能力保持优势。Agent 能力上,Qwen3.8-Max 更适合串联或复合型任务(如项目重构、多智能体驱动),Qwen3.7-Max 则擅长大型单一任务(如拆解报告、DeepResearch)。此外,结合记忆框架让其玩卡牌游戏《苏丹的游戏》时翻车,博主在讨论中想出解决办法。
美团图灵Agent评测团队公开内部博客,系统讲解Agent评测方法论。评测核心是回答“Agent好不好”,需覆盖结果、过程、效率、风险四层,并以观测为基石。团队提出“人人一致、人机一致”对齐法,通过指标下钻与Rubric二元化,使数字站长人机一致率达99%,Beam从62%提升至92%。文章还探讨了长程Agent(如Claude Code)对观测评测带来的演进。
雷神水冷迷你 AI 工作站搭载 AMD 锐龙 AI Max+ 395 处理器,配备 128GB LPDDR5X 统一内存,可分配 96GB 用作显存,实测 CPU 峰值功耗达 176W。
雷神科技今年 5 月发布的水冷迷你 AI 工作站迎来开箱图赏。该机搭载 AMD 锐龙 AI Max+ 395 处理器,最高 176W 性能释放,首发 26999 元。机身采用 199mm 正方体金属设计,重 6.5kg,内置 400W 12VO 白金电源,支持 Wi-Fi 7 与蓝牙 5.4,接口含双 USB4 Type-C 及 10G 有线网口。
Meta 发布 Muse Spark 1.2,在 Artificial Analysis 智能指数中得分 54,较 1.1 版提升 3 分,与 Grok 4.5 并列美国实验室第三。
另有 1 家信源报道The Decoder:AI News(RSS)