内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 20 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「DeepSeek」清除

8月20日周四

01:56LMSYS:Blog(Chatbot Arena 团队)73精选突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

8月19日周三

11:05HuggingFace Daily Papers(社区热门论文)54用A.I.G评估DeepSeek Harness对间接提示注入的抵抗能力

8月9日周日

08:00HuggingFace Daily Papers(社区热门论文)44分层自我改进:面向任务特定可进化智能体外壳的框架

7月31日周五

13:27Hacker News 热门(buzzing.cc 中文翻译)78精选Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

7月23日周四

21:56AK46DeepSeek-V4 在昇腾 SuperPOD 完成全参数后训练
10:49HuggingFace Daily Papers(社区热门论文)45SLAI T-Rex:在昇腾 SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练

7月19日周日

08:00HuggingFace Daily Papers(社区热门论文)53穷人的智能体建模:在笔记本电脑上模拟大型 LLM 智能体社会

7月11日周六

01:19LMSYS:Blog(Chatbot Arena 团队)61精选DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

7月6日周一

08:00HuggingFace Daily Papers(社区热门论文)55DSpark:基于置信度调度的半自回归推测解码框架
08:00HuggingFace Daily Papers(社区热门论文)55TREK:蒸馏探索与强化精炼方法

6月28日周日

02:55Rohan Paul54DeepSeek 发布 DSpark:半并行推测解码推理优化方法
02:00Yuchen Jin38DeepSeek 发布 DSpark 推测解码并开源 DeepSpec
01:06MarkTechPost(RSS)79精选DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60-85%

6月27日周六

18:32Hacker News 热门(buzzing.cc 中文翻译)51DeepSeek 开源推理优化方案 DeepSpec,生成速度提升 60% 至 85%

6月23日周二

13:13HuggingFace Daily Papers(社区热门论文)60Unlimited OCR:长序列OCR显存与速度问题的解决方案

6月16日周二

10:20Artificial Analysis60Artificial Analysis Intelligence Index v4.1 发布:转向智能体任务评测

6月9日周二

12:55HuggingFace Daily Papers(社区热门论文)68FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电索引超长上下文

5月29日周五

21:14The Decoder:AI News(RSS)61新综述论文认为:代码是AI智能体的思考与行动方式,而非仅仅是其产出

5月28日周四

08:00HuggingFace Daily Papers(社区热门论文)54ESPO: 早停近端策略优化

5月14日周四

08:00HuggingFace Daily Papers(社区热门论文)57GQLA:面向硬件自适应的大语言模型解码的分组查询潜在注意力
共 20 条,没有更多了
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「DeepSeek」 · 20 条清除

8月20日

星期四 · 1 条
01:56
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 73/100
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。

DeepSeek推理论文/研究部署/工程

推荐理由:文章提出按上下文长度与并发需求分场景选择 prefill/decode 配置,并用 Humming 压缩和 Online C128 释放 HBM,使 H20 也能服务 1M 上下文,为受限硬件上的大规模推理提供了可复用的工程思路。

8月19日

星期三 · 1 条
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
用A.I.G评估DeepSeek Harness对间接提示注入的抵抗能力

研究用AI-Infra-Guard(A.I.G)对DeepSeek Harness(DSH)开展间接提示注入评估,覆盖14,560次受控执行、16个间接内容渠道、35个载荷目标及12种攻击方法。最强攻击成功率分别为:文本模式伪造完成17.0%、文件模式隐藏Unicode 25.5%、文件模式技能渠道16.0%。语义LLM评判器比规则评判器更常判定部分合规(7.3%对2.0%)。

智能体DeepSeekGitHub论文/研究

8月9日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
分层自我改进:面向任务特定可进化智能体外壳的框架

该研究提出分层自我改进(HSI)框架,让单个冻结LLM在任务外壳、进化器与元进化器三个层级上协同运作,通过环境反馈持续重写外壳代码。

智能体DeepSeek论文/研究

7月31日

星期五 · 1 条
13:27
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。

DeepSeek安全/对齐开源/仓库数据/训练

推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。

7月23日

星期四 · 2 条
21:56
AK@_akhaliq
AI 评分 46/100
SLAI T-RexDeepSeek-V4 系列在昇腾 SuperPOD 上完成全参数后训练论文:https://huggingface.co/papers/2607.20145
DeepSeek数据/训练论文/研究
10:49
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
SLAI T-Rex:在昇腾 SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练

研究团队在昇腾 NPU SuperPOD 上对万亿参数级 MoE 模型 DeepSeek-V4 系列进行全参数后训练,通过层次化优化框架实现 34.22% 的模型算力利用率(MFU),较开源基线提升 2.93 倍。

DeepSeek论文/研究部署/工程

7月19日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
穷人的智能体建模:在笔记本电脑上模拟大型 LLM 智能体社会

用低参数模型替代每个 LLM 智能体,即可在笔记本电脑上以任意规模 N 运行智能体社会模拟,成本仅需数美元。该方法通过“交互顺序×记忆”分类法预测替代误差的 N 趋势,并在 EconAgent 等八个 LLM 模拟中验证,预测误差趋势逐格成立,仅两个被证伪的预测也由理论无自由参数定量匹配。

智能体DeepSeek数据/训练论文/研究

7月11日

星期六 · 1 条
01:19
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 61/100
DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。

DeepSeek推理论文/研究部署/工程

推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月6日

星期一 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
DSpark:基于置信度调度的半自回归推测解码框架

DSpark通过半自回归架构与自适应负载感知验证提升大语言模型推理效率。其半自回归模块在并行骨干中引入轻量级顺序组件,缓解因缺乏token间依赖导致的草稿接受率衰减;置信度调度机制基于前缀生存概率和引擎吞吐特性动态调整验证长度。在跨领域离线基准上,DSpark的接受长度优于当前自回归和并行草稿生成器。部署于DeepSeek-V4服务系统后,相同吞吐量下将单用户生成速度提升60%–85%,并在严格交互性约束下防止吞吐量严重下降,实现此前未达到的性能层级。

DeepSeek推理论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
TREK:蒸馏探索与强化精炼方法

Group Relative Policy Optimization(GRPO)在困难提示上因学生策略on-policy支持不足而停滞。TREK是一种分阶段流程:先识别通过率极低的提示,查询提案源生成已验证解,保留按当前学生似然排名前的解,经短前向KL阶段拉入学生支持,再返回on-policy GRPO精炼。TREK可使用外部教师或同一模型增加推理上下文。数学推理中,TREK配合DeepSeek-V4使Qwen3-8B在AIME 2025从36.9升至40.3,AIME 2024从47.9升至51.1(avg@16);自上下文变体达38.5和49.6。智能体任务中,ALFWorld成功率从75.8提至82.8,ScienceWorld从12.5提至26.7,且最难任务类型早期即达高成功率。

DeepSeek推理数据/训练论文/研究

6月28日

星期日 · 3 条
02:55
Rohan Paul@rohanpaul_ai
AI 评分 54/100
DeepSeek 发布 DSpark:半并行推测解码推理优化方法

DeepSeek 提出 DSpark,一种半并行推测解码系统,使 DeepSeek-V4 在相同吞吐量下每用户生成速度提升约 60% 至 85%。核心创新在于选择性验证:草稿模型并行生成多个候选 token,再由一个小型马尔可夫头根据前一个 token 微调每个猜测,弥补纯并行推测后段 token 组合质量下降的缺陷。置信度调度器基于接受概率和 GPU 负载,动态决定每个请求需验证的 token 数量,避免无效计算。

DeepSeek推理论文/研究
02:00
Yuchen Jin@Yuchenj_UW
AI 评分 38/100
DeepSeek 是 GOAT。🐳他们刚刚发布了 DSpark,一种新的推测解码方法,将吞吐量提升 51% 到 400%。他们还开源了背后的训练框架 DeepSpec。这才是真正的开放 AI。
DeepSeekGitHub开源生态推理
01:06
MarkTechPost(RSS)精选
AI 评分 79/100
DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60-85%

DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60–85% 和 57–78%。离线测试中,接受长度比 Eagle3 高 26–31%,比 DFlash 高 16–18%。配套 DeepSpec 训练代码库采用 MIT 许可证。

DeepSeek推理论文/研究部署/工程

推荐理由:DeepSeek 开源的这个投机解码框架让 V4 生成提速 60% 以上,关键在于不换模型就能加速,对用 API 做产品的人是立即可用的性能提升。代码和权重都给了,值得一试。

6月27日

星期六 · 1 条
18:32
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 51/100
DeepSeek 开源推理优化方案 DeepSpec,生成速度提升 60% 至 85%

DeepSeek 在 GitHub 上开源了推理优化方案 DeepSpec,并发布了配套论文 DSparkpaper.pdf。该方案可将模型生成速度提升 60% 至 85%,具体实现细节见论文。

DeepSeek开源生态推理论文/研究

6月23日

星期二 · 1 条
13:13
HuggingFace Daily Papers(社区热门论文)
AI 评分 60/100
Unlimited OCR:长序列OCR显存与速度问题的解决方案

针对长序列转录中KV缓存累积导致显存增加和速度下降的问题,研究团队提出Unlimited OCR。该模型以DeepSeek OCR为基线,用提出的Reference Sliding Window Attention(R-SWA)替换解码器所有注意力层,在保持恒定KV缓存的同时降低注意力计算成本。结合DeepSeek OCR编码器的高压缩率,Unlimited OCR在32K标准最大长度下单次前向可转录数十页文档。R-SWA是一种通用解析注意力机制,同样适用于ASR、翻译等任务。代码和模型权重已开源。

DeepSeek多模态论文/研究

6月16日

星期二 · 1 条
10:20
Artificial Analysis@ArtificialAnlys
AI 评分 60/100
Artificial Analysis Intelligence Index v4.1 发布:转向智能体任务评测

Artificial Analysis 发布 Intelligence Index v4.1,转向智能体任务。升级 Terminal-Bench 2.1、τ³-Bench Banking、GDPval-AA v2(Elo 重基线、引入前沿模型评审、回合上限增至250),移除饱和的 IFBench。新增每任务成本、时间、输出 token 指标及缓存 token 影响。关键结果:Claude Fable 5(60分)领先但不可用;可用模型中 Claude Opus 4.8(max)56分居首,GPT-5.5(xhigh)55分。开源 DeepSeek V4 Pro 与 MiniMax M3 均44分。成本方面,Opus 4.8 每任务 $1.78,GPT-5.5 $0.99,DeepSeek V4 Pro 仅 $0.04。时间方面,Grok 4.3 最快(1.5分钟),Opus 4.8 需6.4分钟,GPT-5.5 需3.7分钟,Gemini 3.1 Pro Preview 以1.6分钟得46分。

智能体AnthropicDeepSeek推理

6月9日

星期二 · 1 条
12:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 68/100
FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电索引超长上下文

FlashMemory-DeepSeek-V4(FM-DS-V4)提出Lookahead Sparse Attention(LSA)推理范式,基于DeepSeek-V4架构构建神经记忆索引器,主动预测未来上下文需求,仅保留查询关键KV块。采用解耦训练策略,索引器作为独立双编码器训练,无需加载主干模型。在LongBench-v2、LongMemEval、RULER等长上下文基准上,平均物理KV缓存压缩至全上下文基线的13.5%,下游精度平均提升0.6%;在500K极端长度下,物理KV开销减少超过90%,且不损害主干模型的核心推理能力。

DeepSeek推理论文/研究

5月29日

星期五 · 1 条
21:14
The Decoder:AI News(RSS)
AI 评分 61/100
新综述论文认为:代码是AI智能体的思考与行动方式,而非仅仅是其产出

一篇新综述论文提出,自主AI智能体的真正瓶颈并非语言模型本身,而是工具、内存、测试与权限边界等构成的软件层。这一“约束层”将无状态模型转化为能行动的工作智能体。DeepSeek已在北京组建专门的Harness团队,其“模型加约束层等于AI智能体”的公式印证了该观点。

智能体DeepSeekMCP/工具论文/研究

5月28日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
ESPO: 早停近端策略优化

ESPO(Early-Stopping Proximal Policy Optimization)是一种强化学习算法,它能在生成过程中实时检测失败轨迹并提前终止,以节省计算资源。该方法通过计算代理后悔值,当平滑后的累积后悔值显著超过预期时便停止生成。被截断的轨迹被视为吸收失败状态。在针对DeepSeek-R1-Distill-Qwen-7B模型的数学推理训练中,ESPO在AIME 2024、AMC 2023和MATH-500等基准上的表现均优于PPO,并累计节省了超过20%的回滚token。

arXivDeepSeek推理论文/研究

5月14日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 57/100
GQLA:面向硬件自适应的大语言模型解码的分组查询潜在注意力

本研究提出分组查询潜在注意力(GQLA),对DeepSeek-V2/V3中的多头潜在注意力(MLA)进行最小修改,使其在一套权重上暴露两种等效解码路径:与MLA相同的MQA吸收路径,以及带有每组扩展缓存的GQA路径。运行时可根据硬件自动选择路径,无需重新训练。单一的GQLA权重能同时适配H100(采用MQA吸收)与H20(采用GQA及多令牌预测)的硬件性能上限,并在GQA路径上支持高达8路的零冗余张量并行。通过扩展TransMLA为TransGQLA,可将预训练的GQA模型转换为GQLA模型。在LLaMA-3-8B上的实验表明,其MQA吸收路径将每令牌的KV缓存压缩至GQA基线的28.125%,同时在分组路径上结构性保留了GQA级别的流量效率。

DeepSeek推理论文/研究部署/工程
共 20 条,没有更多了