内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 100 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「评测/基准」清除

今天8月26日 周三

00:53Mustafa Suleyman40MAI-Image-2.6登顶图像编辑榜

8月25日周二

05:00SpaceXAI48Grok Voice Think Fast 2.0登顶语音指数榜首

8月22日周六

15:24IT之家(RSS)50神秘 Ox Alpha AI 模型限免上架:DeepSWE 跑分碾压 Claude Fable 5,线索指向智谱

8月21日周五

05:54Artificial Analysis63阿里 Qwen-Image-3.0-Pro 登顶图像编辑榜第六

8月14日周五

06:52Elon Musk34Grok 4.6 获赞媲美 Kimi K3
03:22Artificial Analysis72同事件Gemini 3.7 Flash 发布,登顶智能与速度帕累托前沿同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》

8月13日周四

01:50DogeDesigner58Grok 4.6登顶ARI Bench超越Claude与GPT
01:50Artificial Analysis67韩国Upstage发布Solar Pro 4,智能指数42分
00:18🚨 AI News | TestingCatalog56同事件Grok 4.6发布,多项基准比肩Fable 5与GPT 5.6同一事件,精选展示《xAI 发布 Grok 4.6,强化长时运行智能体能力》
00:18X.PIN52同事件DeepSeek V4 Pro 发布,基准对比预览版同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
00:02Emad34Emad 盛赞 GDPVal 基准,Grok 4.6 性价比登顶

8月12日周三

18:48The Decoder:AI News(RSS)52微软 MAI Code 1.1 Flash 发布,性能与价格均被 DeepSeek 碾压
11:17Artificial Analysis73同事件蚂蚁发布 Ling 3.0 Tiny,7.9B 参数登智能前沿同一事件,精选展示《Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务》

8月8日周六

00:45Alexandr Wang46Meta Muse Spark 1.2 登顶文本竞技场第四

8月7日周五

02:44Alexandr Wang29Muse-Spark 1.2登SideQuest榜第二

8月6日周四

16:40Rohan Paul44Kimi K3 与 Qwen3.8 Max 能力持平,成本成关键
15:44Alexandr Wang31Muse Spark 1.2 登顶 Vals 前五
15:44Alexandr Wang30Pelican 基准仍可直观展示模型进步
05:39Artificial Analysis68Meta 发布 Muse Spark 1.2,智能指数升至 54

8月4日周二

16:35Qwen28Qwen3.8-Max 更优更便宜
16:35Chubby♨️41Celeris-1 登顶输出速度榜,快 13-16 倍

8月3日周一

04:31Chubby♨️37DeepSeek 4 Flash 登顶性价比前沿

8月2日周日

05:42Aravind Srinivas58DeepSeek V4-Flash 成本降百倍引热议
05:29Chubby♨️54DeepSeek V4-Flash 总成本比 Fable 低 105 倍
01:29elvis42DeepSeek-V4-Flash-High前端能力惊艳

8月1日周六

09:05IT之家(RSS)63同事件DeepSeek-V4-Flash 正式版跑分报告:约 98% 缓存命中折扣打造 AI 极致性价比同一事件,精选展示《DeepSeek V4 Flash 0731 开源,登顶开源模型前三》
05:59Artificial Analysis78精选DeepSeek V4 Flash 0731 开源,登顶开源模型前三
04:59Artificial Analysis62Mureka V9登顶音乐榜第二,紧追Suno V5.5
03:59Elon Musk50Grok 4.5 发布,多项基准超越 GPT-5.6 Terra

7月31日周五

17:58Artificial Analysis76同事件DeepSeek V4 Flash 0731 发布,智能指数跃升 10 分同一事件,精选展示《DeepSeek V4 Flash 0731 开源,登顶开源模型前三》
17:58Chubby♨️64同事件DeepSeek v4 Flash 智能指数得分 50,单位任务价格无敌同一事件,精选展示《DeepSeek V4 Flash 0731 开源,登顶开源模型前三》
12:28Artificial Analysis69MiniMax H3登顶视频编辑榜,将开源权重

7月28日周二

03:25Chubby♨️46月之暗面开源Kimi K3,2.6T参数模型登顶开源榜首

7月25日周六

08:51Simon Willison 博客58Anthropic 发布 Claude Opus 5
07:40公众号:数字生命卡兹克64同事件Claude Opus 5 发布,以一半价格逼近 Fable 5同一事件,精选展示《Anthropic 发布 Claude Opus 5》
02:53The Decoder:AI News(RSS)67Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

7月22日周三

00:52Chubby♨️35Google DeepMind 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite
00:22Epoch AI73月之暗面Kimi K3创开源权重纪录

7月17日周五

07:40公众号:数字生命卡兹克75精选Kimi 正式发布 2.8 万亿参数大模型 K3,将于 7 月 27 日全面开源
03:10Chubby♨️49Kimi K3 登顶前端代码竞技场,超越 Claude Fable 5
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「评测/基准」 · 100 条清除

8月26日

星期三 · 1 条
00:53
Mustafa Suleyman@mustafasuleyman
AI 评分 40/100
Microsoft AI 发布 MAI-Image-2.6-Preview,在 Artificial Analysis 图像编辑排行榜登顶第一,文本生成图像位列第二(仅次于 OpenAI 的 GPT Image 2)。该模型在 19 个分类榜单中拿下 5 个第一,现已在 MAI Playground 和 Microsoft Foundry 私有预览中提供。

Artificial Analysis: Microsoft's MAI-Image-2.6-Preview lands at #1 on the Artificial Analysis Image Editing Leaderboard and takes #2 in Text ...

Microsoft图像生成模型发布评测/基准

8月25日

星期二 · 1 条
05:00
SpaceXAI@SpaceXAI
AI 评分 48/100
Grok Voice Think Fast 2.0 现已在 Artificial Analysis 语音到语音指数中排名第一。该指数衡量语音智能体能否对所听到的语音进行推理、解决真实客户问题,并使用智能体工具正确完成任务。
智能体xAI评测/基准语音

8月22日

星期六 · 1 条
15:24
IT之家(RSS)
AI 评分 50/100
神秘 Ox Alpha AI 模型限免上架:DeepSWE 跑分碾压 Claude Fable 5,线索指向智谱

OpenRouter 于 8 月 20 日上线匿名 AI 模型 Ox Alpha,免费开放 1 周。该模型在 DeepSWE 十项测试任务中得分约 80%,超过 Claude Fable 5 的 65% 和 GPT-5.6 Sol 的 52%。其上下文窗口达 1,048,576 个 token,支持文本、图像和视频多模态输入,分词器指纹与 GLM-5.3 高度吻合,线索指向智谱。

模型发布编码评测/基准

8月21日

星期五 · 1 条
05:54
Artificial Analysis@ArtificialAnlys
AI 评分 63/100
阿里 Qwen-Image-3.0-Pro 登顶图像编辑榜第六

阿里发布第三代图像模型 Qwen-Image-3.0 系列,旗舰版 Pro 在 Artificial Analysis 图像编辑榜位列第六、文生图榜第九,较上代分别提升 83 和 48 Elo 分。该系列支持 4.5k token 提示词、10 像素级精确文字渲染及 12 种语言,Pro 版定价 $0.04/张(1K 分辨率),已在阿里云 Model Studio 上线。

图像生成多模态评测/基准

8月14日

星期五 · 2 条
06:52
Elon Musk@elonmusk
AI 评分 34/100
Grok 4.6【引用 @MiaAI_lab】:我很高兴地报告,Grok 4.6 在与内核和 modding 相关的所有方面都跟 Kimi K3 一样出色。我几乎连续测试了 8 个小时,它在"低"努力模式下完成了所有任务。而且速度更快,消耗的 token 也明显更少。我现在将继续在其他领域进行测试。干得漂亮 @SpaceXAI 👏

Mia: I’m happy to report that Grok 4.6 is just as good as Kimi K3 for everything related to the kernel and modding. I was tes...

xAI模型发布评测/基准
03:22
Artificial Analysis@ArtificialAnlys同事件
AI 评分 72/100
Gemini 3.7 Flash 发布,登顶智能与速度帕累托前沿

Google 发布 Gemini 3.7 Flash,在 Artificial Analysis 智能指数上得分 56,较 3.6 Flash 提升 4 分,并登上智能 vs. 单任务耗时帕累托前沿。

Google推理模型发布评测/基准
同一事件,精选展示《Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型》

8月13日

星期四 · 5 条
01:50
DogeDesigner@cb_doge
AI 评分 58/100
Grok 4.6 在 ARI Bench 上夺得第一--该基准用于评测 AI 的递归式自我改进能力。🥇它显著超越 Grok 4.5,同时排名也领先于 Claude Opus 5 和 GPT-5.6。
xAI模型发布评测/基准
01:50
Artificial Analysis@ArtificialAnlys
AI 评分 67/100
韩国Upstage发布Solar Pro 4,智能指数42分

韩国AI实验室Upstage发布旗舰推理模型Solar Pro 4,Artificial Analysis智能指数达42分,较Solar Pro 3的14分大幅提升27分,与Inkling(xhigh,42分)持平。

推理模型发布评测/基准
另有 1 家信源报道IT之家(RSS)
00:18
🚨 AI News | TestingCatalog@testingcatalog同事件
AI 评分 56/100
BREAKING 🔥: SPACEXAI 发布 GROK 4.6,多项基准测试已与 FABLE 5 和 GPT 5.6 SOL 持平!同时以 1553 分位列 Frontend Arena 第 13 名。Grok 4.6 即日起在 Cursor 和 Grok Build 中可用,首周包含 2 倍用量。开测!👀

SpaceXAI: Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price...

模型发布评测/基准
同一事件,精选展示《xAI 发布 Grok 4.6,强化长时运行智能体能力》
00:18
X.PIN@thexpin同事件
AI 评分 52/100
最新消息:DeepSeek V4 Pro 刚刚发布。快速一览与 V4 预览版对比的最新基准测试结果。
DeepSeek模型发布评测/基准
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
00:02
Emad@EMostaque
AI 评分 34/100
imo GDPVal 可能是最重要的基准,它衡量模型在真实世界任务上的表现。性能上的一大飞跃,以极佳的价格登顶,祝贺 @SpaceXAI 团队,期待接下来更大的发布!https://openai.com/index/gdpval/

Elon Musk: Grok 4.6 is now out 🚀🚀🚀 Smart, fast & amazing bang for buck!

OpenAIxAI模型发布评测/基准

8月12日

星期三 · 2 条
18:48
The Decoder:AI News(RSS)
AI 评分 52/100
微软 MAI Code 1.1 Flash 发布,性能与价格均被 DeepSeek 碾压

微软发布面向 GitHub Copilot 的代码模型 MAI Code 1.1 Flash,称其代码质量更优、token 效率提升 25%、成本仅为 6 月前代的四分之一。

DeepSeekMicrosoft模型发布编码
另有 1 家信源报道IT之家(RSS)
11:17
Artificial Analysis@ArtificialAnlys同事件
AI 评分 73/100
蚂蚁发布 Ling 3.0 Tiny,7.9B 参数登智能前沿

蚂蚁集团发布开源推理模型 Ling 3.0 Tiny,在 Artificial Analysis 智能指数上得 25 分,以 7.9B 总参数和 1.3B 激活参数(MoE)扩展了智能与激活参数的帕累托前沿,性能接近 gpt-oss-120b(24 分)但参数少 15 倍。

开源/仓库推理模型发布评测/基准
同一事件,精选展示《Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务》

8月8日

星期六 · 1 条
00:45
Alexandr Wang@alexandr_wang
AI 评分 46/100
nice(注:主推文仅为"nice"一词,无实质内容。根据引用式 teaser 例外规则,正文概括引用推文核心要点。)Meta 的 Muse Spark 1.2 (xHigh) 在文本竞技场中位列第四(1498 分),重塑了帕累托前沿。定价为每百万 token $1.25/$4.25。再次祝贺 @AIatMeta 团队发布此版本!

Arena.ai: Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...

Meta模型发布评测/基准

8月7日

星期五 · 1 条
02:44
Alexandr Wang@alexandr_wang
AI 评分 29/100
显然,muse-spark 1.2 非常擅长处理支线任务。

Zachi: We've got a change at the top. Meta's muse-spark 1.2 reaches 2nd place in the sidequest-bench.

Meta评测/基准

8月6日

星期四 · 4 条
16:40
Rohan Paul@rohanpaul_ai
AI 评分 44/100
Kimi K3 与 Qwen3.8 Max 能力持平,成本成关键

Kimi K3 以 57 分继续领跑开源权重模型,仅领先 Qwen3.8 Max 一分,后者计划下周开源权重。Qwen3.8 Max 在 GDPval-AA 上以 1739 Elo 反超 Kimi K3(1685),且激活参数更小(95B vs 2.8T 总参数)。两者能力可视为持平,但 Kimi K3 单任务成本 $0.86,比 Qwen3.8 Max 的 $1.14 低 25%。

Artificial Analysis: Alibaba's Qwen3.8 Max scores 56 on the Artificial Analysis Intelligence Index at $1.14 per task, but open weights leader...

开源/仓库模型发布评测/基准
15:44
Alexandr Wang@alexandr_wang
AI 评分 31/100
Muse Spark 1.2 更新!Muse Spark 1.2 刚刚在 Vals Index 上闯入前五,每次测试仅需 $0.69。这比 Kimi 便宜 3 倍,比 Fable、Opus 和 5.6 Sol 便宜 10 倍甚至更多。

Vals AI: Muse Spark 1.2 just cracked the top 5 on the Vals Index, at just $0.69 per test. This is 3x cheaper than Kimi and 10x or...

评测/基准
15:44
Alexandr Wang@alexandr_wang
AI 评分 30/100
鹈鹕仍在进步。

Simon Willison: One of the things the pelican benchmark is still useful for is visually representing (to a tiny extent) the improvements...

Meta模型发布评测/基准
05:39
Artificial Analysis@ArtificialAnlys
AI 评分 68/100
Meta 发布 Muse Spark 1.2,智能指数升至 54

Meta 发布 Muse Spark 1.2,在 Artificial Analysis 智能指数中得分 54,较 1.1 版提升 3 分,与 Grok 4.5 并列美国实验室第三。

智能体Meta模型发布评测/基准
另有 2 家信源报道The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)

8月4日

星期二 · 2 条
16:35
Qwen@Alibaba_Qwen
AI 评分 28/100
Qwen3.8-Max,更好,更便宜。试试吧。👀

Command Code: We ran a test between the new Qwen3.8-Max, Opus 5 and GPT-5.6 Sol. 3 models. same prompt. one-shot with the /design comm...

模型发布评测/基准
16:35
Chubby♨️@kimmonismus
AI 评分 41/100
Celeris-1 被 Artificial Analysis 评为输出速度第一,约 2,086 tokens/秒,MMLU-Pro 得分 75.9%,且无需定制推理芯片。

Celeris: Celeris-1 is now ranked as the #1 fastest AI model according to @ArtificialAnlys. 2,038 output tokens per second, #1 of ...

推理评测/基准

8月3日

星期一 · 1 条
04:31
Chubby♨️@kimmonismus
AI 评分 37/100
DeepSeek 4 Flash 的新更新持续取胜,成为帕累托前沿上的性价比赢家。

Arena.ai: Exciting news: DeepSeek-V4-Flash-High by @deepseek_ai has reshaped the Pareto Frontier in the Frontend Code Arena, with ...

DeepSeek编码评测/基准

8月2日

星期日 · 3 条
05:42
Aravind Srinivas@AravSrinivas
AI 评分 58/100
两个数量级的改进相当罕见。这是件大事。

Chubby♨️: DeepSeek V4-Flash isn’t just cheaper per token. It reportedly completes the same benchmark tasks as Fable 5 at 105× lowe...

DeepSeek模型发布评测/基准
05:29
Chubby♨️@kimmonismus
AI 评分 54/100
DeepSeek V4-Flash 不仅单 token 价格更低,据 @ArtificialAnlys 报告,完成相同 benchmark 任务的总成本比 Fable 5 低 105 倍。尽管单 token 价格优势可能因任务轮次增加而失真,但总成本优势显著,作者称这是 DeepSeek 2.0 时刻,将引发巨大轰动。

Cline: While DeepSeek V4-Flash is significantly cheaper on price per token, this can be misleading if the overall cost per task...

DeepSeek推理模型发布评测/基准
01:29
elvis@omarsar0
AI 评分 42/100
DeepSeek-V4-Flash-High 模型在前端方面表现出色得离谱。我跑了一些测试,不得不反复确认自己没选错模型。这个价格能有这表现,太强了。哇!

Arena.ai: Exciting news: DeepSeek-V4-Flash-High by @deepseek_ai has reshaped the Pareto Frontier in the Frontend Code Arena, with ...

DeepSeek模型发布编码评测/基准

8月1日

星期六 · 4 条
09:05
IT之家(RSS)同事件
AI 评分 63/100
DeepSeek-V4-Flash 正式版跑分报告:约 98% 缓存命中折扣打造 AI 极致性价比

DeepSeek-V4-Flash 正式版 API 上线公测,在 Artificial Analysis 智能指数(AII)中获 50 分,较 4 月版提升 10 分,比 V4 Pro 高 6 分,仅比 GPT-5.6 Luna 低 1 分。

DeepSeekOpenAI模型发布评测/基准
同一事件,精选展示《DeepSeek V4 Flash 0731 开源,登顶开源模型前三》
05:59
Artificial Analysis@ArtificialAnlys精选
AI 评分 78/100
DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。

DeepSeek开源/仓库模型发布评测/基准
另有 14 家信源报道X:DeepSeek (@deepseek_ai)X:阿易 AI Notes (@AYi_AInotes)MarkTechPost(RSS)公众号:数字生命卡兹克X:Emad Mostaque (@EMostaque)X:Rohan Paul (@rohanpaul_ai)Simon Willison 博客IT之家(RSS)公众号:卡尔的AI沃茨X:硅基流动 SiliconFlow (@SiliconFlowAI)X:X.PIN (@thexpin)X:Kim (@kimmonismus)X:Elvis Saravia (@omarsar0, DAIR.AI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:DeepSeek 把 V4 Flash 的智能效率往前推了一步,MIT 许可让商业应用毫无顾虑,做轻量级部署的团队可以立刻换上。
04:59
Artificial Analysis@ArtificialAnlys
AI 评分 62/100
Mureka V9登顶音乐榜第二,紧追Suno V5.5

Mureka V9在Artificial Analysis音乐双榜均列第二,器乐榜距榜首Suno V5.5仅1 Elo分。该模型由Skywork AI推出,可生成2-4分钟全曲,支持多语言歌词及最多12音轨分离,现已在Mureka应用和API上线。

模型发布评测/基准
03:59
Elon Musk@elonmusk
AI 评分 50/100
试试 Grok 4.5 http://X.ai/cli

DogeDesigner: BREAKING: Grok 4.5 outperforms GPT-5.6 Terra across almost all shared benchmarks on AskClash, leading in ACB, GPQA, SWE-...

xAI模型发布评测/基准

7月31日

星期五 · 3 条
17:58
Artificial Analysis@ArtificialAnlys同事件
AI 评分 76/100
DeepSeek V4 Flash 0731 发布,智能指数跃升 10 分

DeepSeek V4 Flash 0731 在 Artificial Analysis 智能指数上得 50 分,较 4 月版提升 10 分,领先 V4 Pro 6 分,并进入智能与成本帕累托前沿。

智能体DeepSeek推理模型发布
同一事件,精选展示《DeepSeek V4 Flash 0731 开源,登顶开源模型前三》
17:58
Chubby♨️@kimmonismus同事件
AI 评分 64/100
DeepSeek v4 Flash 在 Artificial Analysis 智能指数上得分 50,较上代提升 10 分,单位任务价格目前无人能敌。其 DeepSWE 达 54.4%,超越 GLM-5.2 和 4 Pro,几乎持平 Opus 4.8;TerminalBench 82.7%,同样逼近 Opus 4.8。

Chubby♨️: This is insane! not kidding at all. DeepSeek v4 *Flash* super close to Opus 4.8, Insane upgrade - DeepSWE 54.4%, outperf...

DeepSeek模型发布评测/基准
同一事件,精选展示《DeepSeek V4 Flash 0731 开源,登顶开源模型前三》
12:28
Artificial Analysis@ArtificialAnlys
AI 评分 69/100
MiniMax H3登顶视频编辑榜,将开源权重

MiniMax H3在Artificial Analysis视频编辑排行榜位列第一,文生视频第二、图生视频第三。该模型支持多模态输入,可生成5-15秒24fps带原生音频的片段,2K定价$7.80/分钟。MiniMax计划以社区许可开源权重,允许年收入低于$20M的组织商用,若发布将成为最强开源视频模型。

开源/仓库模型发布视频评测/基准
另有 4 家信源报道X:MiniMax (@MiniMax_AI)MiniMax:Blog(网页)X:X.PIN (@thexpin)X:Testing Catalog (@testingcatalog)

7月28日

星期二 · 1 条
03:25
Chubby♨️@kimmonismus
AI 评分 46/100
月之暗面(Moonshot)正式开源其2.6T参数模型Kimi K3,在Artificial Analysis Intelligence Index中以57分成为领先的开源权重模型。

Artificial Analysis: Kimi K3 weights have been released! Kimi K3 is now the leading open weights model at 57 in the Artificial Analysis Intel...

开源生态模型发布评测/基准

7月25日

星期六 · 3 条
08:51
Simon Willison 博客
AI 评分 58/100
Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5,定位为接近 Claude Fable 5 前沿智能但价格减半的模型,目前在 Artificial Analysis 排行榜上领先所有模型。该模型定价与 Opus 4.8 相同,并提供成本翻倍的“快速模式”。因通用能力提升,Opus 5 在网络安全漏洞发现上接近 Mythos 5,但在漏洞利用上仍大幅落后。

Anthropic安全/对齐模型发布评测/基准
另有 16 家信源报道X:Claude (@claudeai)X:Thariq (@trq212)X:Yuchen Jin (@Yuchenj_UW)Anthropic:Newsroom(网页)X:Kim (@kimmonismus)MarkTechPost(RSS)TechCrunch:AI(RSS)公众号:卡尔的AI沃茨X:Boris Cherny (@bcherny)X:Rohan Paul (@rohanpaul_ai)X:小北 (@frxiaobei)X:AI Safety Memes (@AISafetyMemes)The Verge:AI(RSS)X:Claude Devs (@ClaudeDevs)X:Testing Catalog (@testingcatalog)IT之家(RSS)
07:40
公众号:数字生命卡兹克同事件
AI 评分 64/100
Claude Opus 5 发布,以一半价格逼近 Fable 5

Anthropic 发布 Claude Opus 5,已全量上线,支持 100 万上下文,知识截止至 2026 年 5 月。在 ARC-AGI-3 上得分 30.2%,接近 GPT-5.6 Sol(7.8%)的四倍;输入每百万 Token 5 美元、输出每百万 Token 25 美元,价格与 Opus 4.8 相同,仅为 Fable 5 的一半。

Anthropic模型发布评测/基准
同一事件,精选展示《Anthropic 发布 Claude Opus 5》
02:53
The Decoder:AI News(RSS)
AI 评分 67/100
Anthropic 发布 Claude Opus 5:以 Fable 5 一半的 token 价格实现接近其性能

Anthropic 推出旗舰模型 Claude Opus 5,在智能体编程和知识工作基准测试中领先,并在 ARC-AGI-3 上取得 30.2% 的分数,是 GPT-5.6 Sol 的近四倍。

Anthropic模型发布编码评测/基准
另有 16 家信源报道X:Claude (@claudeai)X:Thariq (@trq212)X:Yuchen Jin (@Yuchenj_UW)Anthropic:Newsroom(网页)X:Kim (@kimmonismus)MarkTechPost(RSS)TechCrunch:AI(RSS)公众号:卡尔的AI沃茨X:Boris Cherny (@bcherny)X:Rohan Paul (@rohanpaul_ai)X:小北 (@frxiaobei)X:AI Safety Memes (@AISafetyMemes)The Verge:AI(RSS)X:Claude Devs (@ClaudeDevs)X:Testing Catalog (@testingcatalog)IT之家(RSS)

7月22日

星期三 · 2 条
00:52
Chubby♨️@kimmonismus
AI 评分 35/100
Google DeepMind 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,两者任务耗时均减半。Gemini 3.6 Flash 智能评分 50 与 3.5 Flash 持平,输出速度达 304 tokens/秒,输入/输出定价降至 $1.50/$7.50 每百万 token。

Artificial Analysis: Google has released Gemini 3.6 Flash and Gemini 3.5 Flash-Lite. Both halve time per task relative to their predecessors ...

DeepMindGoogle模型发布评测/基准
00:22
Epoch AI@EpochAIResearch
AI 评分 73/100
Moonshot 的 Kimi K3 在 Epoch 能力指数(ECI)上获得 156 分,创下开源权重新纪录。这一成绩使其介于分别于 2026 年 2 月和 3 月发布的 Opus 4.6 与 GPT 5.4 之间,并略高于 GPT 5.6 Luna。
模型发布评测/基准
另有 1 家信源报道IT之家(RSS)

7月17日

星期五 · 2 条
07:40
公众号:数字生命卡兹克精选
AI 评分 75/100
Kimi 正式发布 2.8 万亿参数大模型 K3,将于 7 月 27 日全面开源

月之暗面发布 Kimi K3,参数量达 2.8 万亿,支持百万上下文,将于 7 月 27 日全面开源。该模型在 AA 智能分数中排名第三,并在 BrowseComp、Automation Bench 和 SpreadsheetBench 2 三项 Agent 评测中取得第一。

智能体多模态开源生态推理

推荐理由:国内首个 3 万亿参数开源模型,卡兹克的深度实测表明它在 Agent 和前端审美上表现惊艳,整体能力已能与 GPT-5.6 Sol 掰手腕,虽然推理成本可能不低,但值得开发者尽快体验。
03:10
Chubby♨️@kimmonismus
AI 评分 49/100
Kimi K3 在 Frontend Code Arena 中以 1679 分排名第一,超越 Claude Fable 5,较 Kimi-k2.6 跃升 17 位。它在 7 个前端领域中的 6 个(品牌营销、参考设计、数据分析、消费产品、模拟、内容创作工具)均获第一,仅游戏领域落后于 Fable 5。完整模型权重将于 7 月 27 日前开源。

Arena.ai: Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5. This ...

编码评测/基准
已加载 40 条