EleutherAI 在 Aletheia's Quest 项目中构建了黑盒与白盒两类 AI 欺骗检测器,并分享了过程中的关键经验。项目聚焦于识别模型输出中的不实信息,其方法覆盖了从外部行为观察到内部机制分析的不同路径。回顾总结了检测器在实际应用中的局限与未来改进方向。
医疗 AI 面临“预言机问题”:临床决策主观、底层数据不透明、评测易沦为营销,导致医院难以客观评估模型优劣。OpenAI 报告每周超 3 亿人用 ChatGPT 咨询健康问题,2026 年每百万条病历中约 1,686 条记录患者对模型回答的追问。a16z 正与 Protege 合作,试图通过追踪患者长期结局来解决这一评估难题。
用特定测试框架评测模型的方式已失效,应转向Pi、Hermes Agent等最小化标准框架,并保持长期稳定。模型未来或能按任务动态生成测试框架,使框架如同系统提示词般可调,评测将愈发复杂。
We need to normalize measuring and judging models against a standardized test harness "Oh but model X performs best in t...
You don't always need a frontier model. A recent benchmark found that Gemma 4 31B matches Sonnet 5 on answer quality at ...
I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset),...
国产大模型年中上新收官,Kimi K3与GLM-5.3以60分并列T1阵营,紧咬GPT-5.6和Claude Opus 5。GLM-5.3仅靠后训练迭代,不动基座架构。T2档为58分Qwen3.8 Max、53分DeepSeek-V4-Pro;Qwen全系今年在Hugging Face被下载超20亿次。
智谱在 GLM-5.3 发布说明中自述,其网络安全能力“增长最快的恰恰是我们最落后的地方”。这家以 Z.ai 名义运营的北京公司,是少数几家发布可与海外模型竞争的中国实验室之一。该表态揭示了其在安全短板上的追赶策略,而非仅关注基准测试的头条分数。
DeepSeek V4 Pro 果然是训歪了 便宜好几倍的 V4 Flash 比 Pro 强 推理强度更低的 V4 Pro High 比 Pro Max 强 不过目前写作能力方面文风还是 V4 Pro 好一些 但也跟 Opus 4.6 天壤...
阿里 Qwen 开源 Qwen3.8-27B,在 Artificial Analysis Intelligence Index 拿下 52 分,与 DeepSeek V4 Pro(53 分)、GPT-5.6 Luna(52 分)等闭源旗舰同级,成为首个达到前沿能力的本地模型。
Artificial Analysis Intelligence Index puts Qwen3.8-27B at DeepSeek V4-Pro and GPT 5.6 Luna performance. This is the fir...
GLM-5.3 在 Terminal Bench 3.0 测试中分数翻了6倍,引发关注。该基准测试任务难度高,如 exam-pdf-eval 需模型调用第三方 VLM 并自行编写 prompt 完成闭环验证。博主推测 GLM-5.3 在复杂真实环境下的架构规划能力将非常强,并预告稍后带来实测。
Kimi K3 (Max) 在 Code Arena: WebDev 中以 1674 分领先 DeepSeek-V4-Pro (Max) 的 1607 分,但后者输入/输出价格分别便宜约 6.9 倍和 17.2 倍。
Big news: DeepSeek-V4-Pro (Max) by @deepseek_ai is coming in around ~#8 overall (#2 among open models) in the Code Arena...
Absolute Pareto dominance for Grok and Cursor even after the OpenAI price cuts:
针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
LLM review weirdness... Just renaming an uploaded pdf from "paper.pdf" to "paper_final_draft_pdf_ready_for_review.pdf" b...
🦄New Ep alert - If you’ve been following along, I’m obsessed with a new benchmark out of UW called SlopCodeBench - the ...
Exciting news: Muse Spark 1.2 (xHigh) by @AIatMeta is #4 in the Text Arena (1498 pts), and has reshaped the Pareto front...
DeepSeek V4 Flash from @deepseek_ai on ARC-AGI (Verified): - ARC-AGI-2: 61.4%, $0.04/task - ARC-AGI-1: 89.0%, $0.02/task...
8.5 percentage points ahead of Gemini 3.5 Flash congrats to @Alibaba_Qwen !
Artificial Analysis 显示,任务耗时帕累托前沿仅由两家实验室占据:2 分钟内的前沿模型全部来自 OpenAI,而 2 分钟以上的 6 个模型中 4 个来自 Anthropic。Kimi K3(max)因 Moonshot AI 首方 API 输出速度低,单任务耗时约 11 分钟。该图仅展示智能指数超 25 分的模型。
I'm going to cancel Claude. It's just so bad, I can't believe it. It's just lazy. The most recent example: I have Claude...
Qwen 3.8 Max 升级为纯血力工模型,定位为适合执行实际任务的模型。此次升级聚焦于提升模型在具体工作场景中的实用性与执行能力。
阿易 AI Notes 认为 AI 大模型将形成开源与闭源两大阵营,且开源联盟进步飞速。Frontend Code Arena 最新排名显示,前四名中三个是闭源旗舰,第四名是即将开源的 Qwen 3.8-Max。他用该模型独立写出了物理正确的 GLSL 实时光追黑洞,21 个参数可实时调整,零依赖双击即可运行。
诺兰新片《奥德赛》下周就要在中国上映了, 我用今天刚正式发布的一个国产大模型, 把他《星际穿越》里最封神的 Gargantua 黑洞, 直接写进了网页里。 不是贴个黑圈加光晕的五毛特效,是真的用 GLSL 实时光追算出来的。 当年诺兰找诺贝...
Siri AI 已随 7 月发布的 iOS 27 消费者测试版上线,能理解个人上下文、调用世界知识回答问题,并支持自然对话、打字输入及独立应用。该功能由 Apple 与 Google 合作,利用 Gemini AI 模型训练自有 Apple Foundation Models,可在 Apple Silicon 和 Private Cloud Compute 上运行。
诺兰新片《奥德赛》下周就要在中国上映了, 我用今天刚正式发布的一个国产大模型, 把他《星际穿越》里最封神的 Gargantua 黑洞, 直接写进了网页里。 不是贴个黑圈加光晕的五毛特效,是真的用 GLSL 实时光追算出来的。 当年诺兰找诺贝...
Andrej Karpathy 让 Claude Opus 5 将《指环王》开头一段文字转化为 3D 浏览器场景,生成 5,500 行代码,耗时约两小时,花费约 10 美元。模型自主放置和动画化物体,但因只能通过截图检查视频输出而出现错误。Karpathy 认为这展示了按需生成廉价定制游戏世界的潜力,并称鹈鹕测试已接近上限,此类结果更多是氛围测试而非硬性基准。
Big news: Qwen3.8-Max by @Alibaba_Qwen just landed at #4 on the Frontend Code Arena leaderboard with a score of 1,668! W...
Karpathy 提出用《指环王》首段测试 LLM 长程生成能力:给 Opus 5 100 万 token 预算(约 $10),它耗时约 2 小时写出 5500 行 Three.js 代码,程序化渲染整个故事。该测试考验模型跨数千行代码的连贯性与自我审查能力,但暴露了 LLM 无法高效感知视频或游戏内反馈的短板。
We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle". As one id...