Dongxi 东锡 NLP@dongxi_nlp
52AI 编辑部评分,满分 100
2026-08-08 05:09· 1小时前
AI 导读

DeepSeek V4 Flash 在 ARC-AGI-1 上以低推理预算即得约 84 分,最高约 89 分,额外推理仅多解 5 题,表明其后训练产生了异常高效的抽象推理。该模型 ARC-AGI-2 得分 61.4%($0.04/任务),ARC-AGI-1 得分 89.0%($0.02/任务),树立了性价比帕累托前沿新标准。

DeepSeek reaches close to its best score even when given a smaller reasoning budget.

ARC-AGI-1: Low solves about 84. Max solves about 89.

Extra reasoning recovers only five additional puzzles.

This suggests DeepSeek's post-training produces unusually efficient abstract reasoning.

ARC PrizeDeepSeek V4 Flash from @deepseek_ai on ARC-AGI (Verified): - ARC-AGI-2: 61.4%, $0.04/task - ARC-AGI-1: 89.0%, $0.02/task DeepSeek V4 Flash sets the new standard...

来源:Dongxi 东锡 NLP · x.com

Dongxi 东锡 NLP · @dongxi_nlp · X·2026-08-08 05:09·1小时前
AI 导读

DeepSeek V4 Flash 在 ARC-AGI-1 上以低推理预算即得约 84 分,最高约 89 分,额外推理仅多解 5 题,表明其后训练产生了异常高效的抽象推理。该模型 ARC-AGI-2 得分 61.4%($0.04/任务),ARC-AGI-1 得分 89.0%($0.02/任务),树立了性价比帕累托前沿新标准。

DeepSeek reaches close to its best score even when given a smaller reasoning budget.

ARC-AGI-1: Low solves about 84. Max solves about 89.

Extra reasoning recovers only five additional puzzles.

This suggests DeepSeek's post-training produces unusually efficient abstract reasoning.

ARC PrizeDeepSeek V4 Flash from @deepseek_ai on ARC-AGI (Verified): - ARC-AGI-2: 61.4%, $0.04/task - ARC-AGI-1: 89.0%, $0.02/task DeepSeek V4 Flash sets the new standard...

来源:Dongxi 东锡 NLP· x.com