karminski-牙医@karminski3
45AI 编辑部评分,满分 100

DeepSeek-V4-Pro-0813 长程任务早停引质疑

2026-08-13 02:08· 15小时前
AI 导读

DeepSeek-V4-Pro-0813 在 reasoning_effort=max 时,长程 AgenticCoding 任务(50 轮代码优化)中 3 次测试有 2 次在 42-43 轮提前停止,未用完全部机会,且成绩未超过 GLM-5.1。作者推测可能与强化学习奖励机制或上下文窗口注意力衰减有关,将发布详细评测视频。

刚发的 DeepSeek-V4-Pro-0813 好像的确有问题, reasoning_effort=max 的时候模型在长程 AgenticCoding 任务下更倾向于早停.

我这个测试总计50轮, 让模型不断优化代码, 结果他在3次测试中, 2次都在42-43轮左右的情况下停止了. 并未用完全部机会. 而且目前成绩来看, 甚至没打过 GLM-5.1 (仅我这一个case, 我不对其它case负责).

目前还不确定这是强化学习阶段奖励机制弄得有问题,还是是上下文窗口注意力衰减的问题,一会放出详细评测视频给大家解析。

#deepseekv4pro0813 #deepseekv4pro正式版

来源:karminski-牙医 · x.com

DeepSeek-V4-Pro-0813 长程任务早停引质疑

karminski-牙医 · @karminski3 · X·2026-08-13 02:08·15小时前
AI 导读

DeepSeek-V4-Pro-0813 在 reasoning_effort=max 时,长程 AgenticCoding 任务(50 轮代码优化)中 3 次测试有 2 次在 42-43 轮提前停止,未用完全部机会,且成绩未超过 GLM-5.1。作者推测可能与强化学习奖励机制或上下文窗口注意力衰减有关,将发布详细评测视频。

刚发的 DeepSeek-V4-Pro-0813 好像的确有问题, reasoning_effort=max 的时候模型在长程 AgenticCoding 任务下更倾向于早停.

我这个测试总计50轮, 让模型不断优化代码, 结果他在3次测试中, 2次都在42-43轮左右的情况下停止了. 并未用完全部机会. 而且目前成绩来看, 甚至没打过 GLM-5.1 (仅我这一个case, 我不对其它case负责).

目前还不确定这是强化学习阶段奖励机制弄得有问题,还是是上下文窗口注意力衰减的问题,一会放出详细评测视频给大家解析。

#deepseekv4pro0813 #deepseekv4pro正式版

来源:karminski-牙医· x.com