注意到 V4 预览版论文里的 Table 6,V4 Pro (Preview) 和 Opus-4.6 的 SWE Verified 跑分, 80.6 比 80.8 正好差 0.3%。
这也不能说有些做中介的人写一句什么"性能跻身全球第一梯队,编程能力仅弱于 Claude 旗舰0.3%"是在纯瞎编是吧?
DeepSeek V4 预览版论文 Table 6 显示,V4 Pro (Preview) 的 SWE-bench Verified 跑分为 80.6,Claude Opus-4.6 为 80.8,两者仅差 0.3%。有中介据此称其“性能跻身全球第一梯队,编程能力仅弱于 Claude 旗舰 0.3%”,并非纯属瞎编。
注意到 V4 预览版论文里的 Table 6,V4 Pro (Preview) 和 Opus-4.6 的 SWE Verified 跑分, 80.6 比 80.8 正好差 0.3%。
这也不能说有些做中介的人写一句什么"性能跻身全球第一梯队,编程能力仅弱于 Claude 旗舰0.3%"是在纯瞎编是吧?
来源:Tianyi Cui · x.com
DeepSeek V4 预览版论文 Table 6 显示,V4 Pro (Preview) 的 SWE-bench Verified 跑分为 80.6,Claude Opus-4.6 为 80.8,两者仅差 0.3%。有中介据此称其“性能跻身全球第一梯队,编程能力仅弱于 Claude 旗舰 0.3%”,并非纯属瞎编。
注意到 V4 预览版论文里的 Table 6,V4 Pro (Preview) 和 Opus-4.6 的 SWE Verified 跑分, 80.6 比 80.8 正好差 0.3%。
这也不能说有些做中介的人写一句什么"性能跻身全球第一梯队,编程能力仅弱于 Claude 旗舰0.3%"是在纯瞎编是吧?
来源:Tianyi Cui· x.com