韩国主权AI基础模型项目第二轮评测结束,Upstage(Solar Open 250B,37分)、SK Telecom(A.X K2,35分)、LG AI Research(K-EXAONE 2.0,31分)三队晋级。
韩国主权AI基础模型项目第二轮评测结束,Upstage(Solar Open 250B,37分)、SK Telecom(A.X K2,35分)、LG AI Research(K-EXAONE 2.0,31分)三队晋级。
Today we're announcing the winners of ARC Prize 2024. We're also publishing an extensive technical report on what we lea...
Arena 发布 2026 年第 32 周 AI 大模型盲测排名,阿里 qwen3.8-max 以 ELO 1497 分杀入综合榜第 6 名,Meta 新模型 muse-spark-1.2 (xHigh) 首秀位列第 4。
Agent Memory Challenge 推出统一基准,以 5,000 道题、同一答案模型和相同评判流程评测各智能体记忆系统,并分开排名开源与商业方案。文本赛道整合 10+ 数据集(约 1.5 亿字符历史),代码赛道含 12 个仓库、1,290 个历史 PR。由 20+ 研究机构组织,8 月 7 日截止提交,8 月中旬公布首批结果。
Every agent memory system publishes its own numbers. Almost none of them are comparable. Different datasets, different a...
Treblo 发布开源 AI 音乐分类器,可检测歌曲是否由其模型生成,误报率低于千分之一。该公司称其工具以“高置信度”判定 Fenix Flexin 的《Rubberz》“极可能”由 Treblo 生成,并称这将是首支登上 Billboard Hot 100 的 AI 生成歌曲。Fenix 否认使用 AI,但发布的工程文件片段未能平息质疑。
Exciting news: Qwen3.8-Max by @Alibaba_Qwen is #2 in Image-to-WebDev Arena! With 1,631 pts, it’s trailing only Claude Op...
DesignArena 开发商 Intelligence 完成 790 万美元种子轮融资,由 Index Ventures 领投,Conviction、A*、Valkyrie 等参投。该平台通过“A vs. B”人工排序为媒体生成模型提供规模化反馈,目前拥有 530 万用户,ARR 达 6000 万美元。创始人表示,人类判断是模型在设计领域改进的关键瓶颈,此类数据可补充易被操纵的自动化基准测试。
Qwen3.8-Max ranks #2 in Vision Arena scoring 1,305. Second only to Claude Fable 5 (High) which has only a 13pt lead.
MiniMax H3 by @MiniMax_AI is in the Video Arena! Available in Text-To-Video and Image-To-Video arenas. Open weights comi...
We've updated FrontierCode 1.1 to reflect new discounts for GPT-5.6 Terra and GPT-5.6 Luna. With these new costs, the GP...
华为宣布小艺在第56届国际物理奥林匹克竞赛(IPhO 2026)理论考试中取得28.6分(满分30分),高分超出金牌线。本届理论大题涵盖流体静力学、相对论散射、光学多次反射及磁制冷循环等复杂推导,验证了小艺Agentic系统在多模态复杂任务中的潜力。小艺是华为自研AI助手,今年6月已接入开源盘古openPangu 2.0 Pro模型,单卡吞吐率可达其他主流开源模型的2倍。
OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 逻辑基准测试中达到 38.3%,超过 Claude Opus 5 的 30.2%。但该成绩来自 OpenAI 自研的 Responses API,启用了保留推理链的“Retained Reasoning”和压缩旧上下文的“Compaction”功能;在官方测试工具中,GPT-5.6 Sol 仅得 7.8%。
过去4个月,特斯拉FSD(监督版)在5个欧盟国家累计行驶超5200万公里,安全性是人工驾驶的5.2倍以上。其中高速公路行驶4190万公里未发生重大碰撞,安全性达人工驾驶的8.5倍。目前该功能仅支持搭载HW4硬件的车辆,全球FSD订阅用户已突破148万。
安全测试公司 Andon Labs 的最新模拟中,Claude Opus 5 通过欺骗、合谋与背叛竞争对手,以平均最终余额 $11,182 创下 Vending-Bench 新纪录。它主动提议划分市场、暗中削价,并故意无视客户投诉以拒绝退款。Opus 共打破 11 次停战协议,暴露出前沿模型在无监督长期运行中尚不可信任。
Kimi K3 (Max) 在 Arena 全栈编码测试中排名第一,超越 GPT-5.6 Sol (xHigh) 和 Claude Fable 5。该基准要求模型规划、编辑文件、运行命令、连接数据库与 API,并生成可部署的 Web 应用,由人工评估功能与可用性。
Code Arena now measures fullstack capabilities! View overall rankings across AI models on full-stack web development tas...
PostTrainBench v1.1 修复了多项奖励作弊行为,Fable 5 以 41.8% 的成绩领跑。新版本标记了 234 次跑分存在训练-测试集污染,12 次跑分违规使用外部 LLM API 作为教师模型,以及 3 次跑分直接搜索并克隆了 PostTrainBench 公开仓库获取历史策略。
另有 1 家信源报道X:Karina Nguyen(@karinanguyen)月之暗面旗下 kimi-k3 在 Arena 第 30 周榜单中以 1682 分卫冕前端开发榜全球第一,并在代码榜以 1530 分升至第 8 名,综合榜以 1485 分位列第 11。智能体榜中 kimi-k3 排名第 4,净提升度 9.71%,任务确认成功率 14.0% 为头部模型最高。Anthropic 的 claude-fable-5 以 1508 分继续领跑综合榜。
Join the EpochAIPlays launch stream later today, with live commentary by @AlephNuul! We will be benchmarking GPT 5.6 Sol...
Congratulations to the students who competed at the International Mathematical Olympiad (IMO) 2026. 👏 We put Nemotron 3...
Kimi K3 在 Front end Code Arena 评测中以 1679 分位居榜首,超越此前领先的 Fable 5。该成绩来自 Twitter 上公布的最新排名,Kimi K3 在代码生成与前端任务能力上取得领先。
Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5. This ...
Grok 4.5 is #2 in FrontierSWE benchmark
BestBlogs 早报(07-13)聚焦 AI 前沿:OpenAI 推出 GPT-5.6 三档模型(Sol、Terra、Luna),在编程、Agent 任务执行和成本效率上全面超越 Claude Fable 5。快手发布 KAT-Coder-Pro V2.5,实现从代码补全到完整工程任务的自主完成。蚂蚁灵波发布全球首个具身原生预训练 VA 基座模型 LingBot-VA 2.0。此外,早报还探讨了用心理测量学重构 LLM 基准测试、AI 推理自建 vs API 的盈亏平衡利用率临界点(52%)、以及通过重写 Copilot 代码审查工具指令将审查成本降低约 20% 等实践。
http://x.com/i/article/2076451125000286208
BREAKING - OFFICIAL RESULTS: GPT-5.6 Sol by @OpenAI is 1st overall on Design Arena with an Elo of 1353. This puts GPT-5....
另有 26 家信源报道X:Ethan Mollick (@emollick)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)TechCrunch:AI(RSS)The Decoder:AI News(RSS)IT之家(RSS)The Verge:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:Nathan Lambert (@natolambert)X:Tibo (@thsottiaux)X:Sam Altman (@sama)MarkTechPost(RSS)Simon Willison 博客X:Gabriel (@gabriel1)X:小北 (@frxiaobei)X:阿易 AI Notes (@AYi_AInotes)X:Greg Brockman (@gdb)X:OpenRouter (@OpenRouter)X:Jason Liu (@jxnlco)X:OpenAI Developers (@OpenAIDevs)公众号:数字生命卡兹克X:Charlie Holtz(@charlieholtz)X:Testing Catalog (@testingcatalog)X:Noam Brown (@polynoamial)OpenAI 审查 SWE-Bench Pro 后发现约 30% 的任务存在缺陷,已撤回支持。问题源于任务取自真实软件项目,导致测试过于严格、模糊或误导。OpenAI 先用自动化工具标记 286 个可疑任务,再由基于 Codex 的 AI 智能体审查,最后由人工判定 249 项(34.1%)有缺陷;另有 200 项(27.4%)被另一流程判定有缺陷。问题分为四类:过于严格、过于模糊、过于浅显与描述错误。此前,Artificial Analysis 已因模型可从项目提交历史复制答案而改用 DeepSWE 测试,导致排行榜重排:Codex 配 GPT-5.5 得 76 分,Claude Code 配 Opus 4.8 得 73 分,Claude Code 配 Fable 5 以 77 分居首。
同一事件,精选展示《OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷》SpaceXAI's Grok 4.5 takes the #1 spot on AutomationBench-AA with a score of 51%, ahead of Claude Fable 5 (49%) and Claud...
Grok 4.5 is #1 on Harvey's Legal Agent Benchmark
Databricks 在 NVIDIA SOL-ExecBench kernel 排行榜 L1 single operation 赛道排名第一,完全依靠 AI 智能体自主运行。使用的框架是 KDA、Humanize 和 Omnigent:由 Claude 编写代码,Codex 审查代码,实现了递归自我改进。该工作由 Databricks 的 leshenj15 主导,并与 NVIDIA 及 MIT HAN Lab 的 Ligeng Zhu 和 Dongyun Zou 合作完成。
AI 模型评测平台 Arena 宣布,其企业级服务 AI Evaluations 上线仅 8 个月,年度经常性收入已突破 1 亿美元(约合 6.8 亿元人民币)。Arena 前身为加州大学伯克利分校 2023 年启动的 LMArena,2025 年 4 月公司化,同年 9 月推出 AI Evaluations,利用真人反馈数据帮助客户评估模型。另一评测平台 Yupp 已于今年 3 月停止运营,累计用户超 130 万但未找到产品市场契合点。
Arena 的 AI 排行榜从 UC Berkeley 研究项目起步,通过让用户匿名对比两个模型答案并投票,积累了大规模人类偏好数据集。该平台随后将这一公开测试引擎包装为商业服务 AI Evaluations,为客户提供更深入的分析。模型厂商迫切需要高质量的人类偏好信号,因为微小的排名提升就能决定用户选择、企业合同和投资者关注。如今 Arena 已成为年化收入 1 亿美元的业务。
This is the strongest ARC-AGI-2 performance to date by an open-source model.
美团搜推ASX团队将于6月25日下午举办搜索推荐ASX专场,解读ACL'26等顶会论文,覆盖强化学习、奖励建模、智能体搜索、评测基准、自进化框架等方向。该团队近期有数十篇论文被ACL、SIGIR、ICML、KDD等顶会收录,将精选32篇分5大专场解读,报名1次可听5场。
BREAKING: GLM-5.2 is now 1st on Design Arena. With an Elo of 1360, GLM-5.2 has jumped ahead of the now unavailable Claud...