Topic · 主题全部主题 →

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

415条收录
74条精选
● 持续更新
近期焦点近 14 天 · 按多源报道热度

8月4日

星期二 · 1 条
21:03
Hacker News 热门(buzzing.cc 中文翻译)精选
76
在单颗 AMD MI300X 上运行 DeepSeek V4 Flash

一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。


推荐理由:为 MI300X 提供了可部署的生产栈,包含 FP8 格式修复、推测解码优化和混合 KV 缓存策略,单卡就能服务 256K 上下文。

8月1日

星期六 · 2 条
05:59
Artificial Analysis@ArtificialAnlys精选
78
DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。

另有 13 家信源报道IT之家(RSS)Simon Willison 博客X:Artificial Analysis (@ArtificialAnlys)X:Emad Mostaque (@EMostaque)X:Kim (@kimmonismus)MarkTechPost(RSS)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)X:X.PIN (@thexpin)X:硅基流动 SiliconFlow (@SiliconFlowAI)公众号:卡尔的AI沃茨X:Elvis Saravia (@omarsar0, DAIR.AI)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:DeepSeek 把 V4 Flash 的智能效率往前推了一步,MIT 许可让商业应用毫无顾虑,做轻量级部署的团队可以立刻换上。
00:59
AYi@AYi_AInotes精选
75
animated-voiceover 开源:一人干翻动画工作室

前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。

sida: 最近我在用 Codex 配合 LibTV CLI 制作动画科普视频(Animated Voiceover Video),同时运营一个小红书账号。目前小红书账号正在稳步起步,数据看起来相当健康。 现在我把这个 Skill 开源出来了: htt...


推荐理由:这个 Skill 把专业动画导演的制片流程封装成了 Agent 可执行的管道,首段锚定人声、风格图贯穿全片,工程化地解决了角色崩和声音飘的问题,个人创作者 40 块钱就能产出 2 分钟电影感科普视频,值得马上动手试。

7月31日

星期五 · 4 条
14:41
公众号:数字生命卡兹克精选
66
DeepSeek V4 Flash 正式版发布:后训练重做,九项 Agent 测试全面超越 V4 Pro Preview

DeepSeek V4 Flash 正式版发布,模型结构和参数规模不变,仅重做后训练,Terminal Bench 2.1 从 61.8 涨至 82.7,DeepSWE 从 7.3 涨至 54.4。

另有 12 家信源报道IT之家(RSS)Simon Willison 博客X:Artificial Analysis (@ArtificialAnlys)X:Emad Mostaque (@EMostaque)X:Kim (@kimmonismus)MarkTechPost(RSS)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)X:X.PIN (@thexpin)X:硅基流动 SiliconFlow (@SiliconFlowAI)公众号:卡尔的AI沃茨X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:把基准提升放进生产成本的尺度上衡量,Flash 的实质突破在于让高频 Agent 任务从「用不起」变成「用得起」。
14:05
DeepSeek@deepseek_ai精选
62
🚀 DeepSeek-V4-Flash 官方 API 现已上线公测!🔷 我们大幅升级了其 Agent 能力--基准测试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses API 格式,并已完全适配 Codex!查看我们官方 API 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
另有 13 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)Simon Willison 博客X:Artificial Analysis (@ArtificialAnlys)X:Emad Mostaque (@EMostaque)X:Kim (@kimmonismus)MarkTechPost(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Rohan Paul (@rohanpaul_ai)X:X.PIN (@thexpin)X:硅基流动 SiliconFlow (@SiliconFlowAI)公众号:卡尔的AI沃茨X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:DeepSeek 把 V4-Flash 的 Agent 能力拉到宣称超越 V4 Pro 的水平,对做智能体的团队是个值得马上验证的信号,但推文欠具体数据。
13:27
Hacker News 热门(buzzing.cc 中文翻译)精选
78
Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。


推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。
00:00
DeepSeek:API 更新日志精选
72
DeepSeek-V4-Flash 正式版 API 上线公测

DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。

另有 4 家信源报道IT之家(RSS)X:Emad Mostaque (@EMostaque)X:Rohan Paul (@rohanpaul_ai)X:阿易 AI Notes (@AYi_AInotes)
推荐理由:DeepSeek V4-Flash 正式版 Agent 能力大幅跃升,多个编码 agent 基准分数翻倍,对做代码助手的团队是个高性价比的生产力入口。虽然是 Flash 版,但后训练打磨的成果让人更期待 Pro 正式版。

7月11日

星期六 · 1 条
01:19
LMSYS:Blog(Chatbot Arena 团队)精选
61
DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。


推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

6月28日

星期日 · 1 条
01:06
MarkTechPost(RSS)精选
79
DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60-85%

DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60–85% 和 57–78%。离线测试中,接受长度比 Eagle3 高 26–31%,比 DFlash 高 16–18%。配套 DeepSpec 训练代码库采用 MIT 许可证。


推荐理由:DeepSeek 开源的这个投机解码框架让 V4 生成提速 60% 以上,关键在于不换模型就能加速,对用 API 做产品的人是立即可用的性能提升。代码和权重都给了,值得一试。

6月27日

星期六 · 1 条
16:59
IT之家(RSS)精选
70
AI 账单失控后 DeepSeek 成"香饽饽",部分美国企业已 100% 切换

美国企业面临 AI 账单失控,开始转向 Token 最小化策略。旧金山公司 Lindy 此前主要调用 Anthropic 的 Claude 模型,每月 AI 账单超支甚至超过员工工资。该公司 CEO 弗洛·克里维洛表示,本月初已将 100% 流量切换到 DeepSeek,预计未来几个月可节省数百万美元。企业开始采用按任务匹配模型的“模型路由”,不再将最贵的前沿模型用于所有场景。部分客户已决定暂停 AI 投入,待证明投资回报率后再继续。


推荐理由:一家初创把AI调用从Claude全切到DeepSeek,省下的钱超过工资总额,企业客户开始用模型路由压成本,这个趋势比任何benchmark都更能说明价格战的影响。

6月20日

星期六 · 2 条
16:27
Hacker News 热门(buzzing.cc 中文翻译)精选
72
GPT-5.5幻觉率达86%,GLM-5.2仅28%--大模型越大越不可靠

GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。


推荐理由:这篇实测对比揭示了大型模型的致命幻觉问题,GPT-5.5 幻觉率高达 86% 远超 GLM-5.2 的 28%,模型选型不能只看 Benchmark 排名,「会不会不懂装懂」才是真分水岭。
15:01
AYi@AYi_AInotes精选
75
微软双向转售GPT与DeepSeek成全球最大AI中间商

彭博社报道,微软已成为全球最大AI模型中转站,既将ChatGPT卖给中国企业,也反向将DeepSeek模型卖给西方客户。报道称微软正在测试DeepSeek-R1和DeepSeek-V4,计划向西方客户提供这些中国模型。这一模式构建起跨中美AI模型的双向贸易网络。


推荐理由:微软做起了跨中美模型的双向经销商,这事比表面看起来意义大——它可能绕过限制,把最先进的模型分发到原本接触不到的市场,全球 AI 供应链要改写了。

6月19日

星期五 · 2 条
12:19
AYi@AYi_AInotes精选
76
DeepSeek研究员开源AutoResearch:AI自主跑通285B模型RL研究闭环

DeepSeek研究员Deli Chen将AutoResearch协议开源,并发布Self-play综述论文。其AI智能体首次完全自主地在DeepSeek 285B模型上完成完整RL研究闭环——从实验设计、写代码、提交GPU任务、debug到结论总结,全程零人工干预。系统调用了GRPO工具,被视为持续学习研究的开端。

Deli Chen: 🧵 Deli AutoResearch SKILL 现已正式开源!🎉 https://victorchen96.github.io/auto_research/framework.html 与此同时,我们还发布了第四篇综述论文--这次的...


推荐理由:Deli Chen 开源的不是模型,是能让 AI 自己跑通 RL 研究全流程的「后厨系统」,从实验设计到 debug 全自动,五个工程思路可以直接抄作业。
08:00
OpenRouter:Announcements(RSS)精选
73
DeepSeek V4 智能体 token 份额持续增长

DeepSeek 于4月24日发布新一代旗舰模型 V4 系列。OpenRouter 数据显示,V4 发布后其 token 份额从年初的9%增长至6月初的18%,自5月中旬起成为 OpenRouter 最受欢迎模型。V4 是首个足以胜任智能体工作负载的 DeepSeek 模型,到5月底 V4-Flash 已占 DeepSeek 智能体 token 流量的70%。V4-Flash 最便宜端点价格为每百万 token 输入 $0.09、输出 $0.18,远低于 GPT-5.5 的 $5/$30。中国模型整体 token 份额于6月初超过美国模型,DeepSeek 是主要驱动力。


推荐理由:OpenRouter 独家数据展示了代际转折:DeepSeek V4 靠性价比吃下代理负载,中国模型 token 份额首次超过美国,这个信号比任何 benchmark 排名都真实,做应用选型的人该重新算账了。

6月18日

星期四 · 1 条
16:14
IT之家(RSS)精选
72
DeepSeek 识图模式正式上线 App 和网页端

DeepSeek 识图模式于6月18日在网页和 App 端正式上线,与快速模式、专家模式并列。开启后用户可直接上传图片让 DeepSeek 识别图像,能力超越简单文字提取。目前 App 端仍显示“图片理解功能内测中”,网页端无此提示。该模式背后的多模态模型技术细节于今年4月公开,核心框架为“Thinking with Visual Primitives(以视觉原语思考)”。


推荐理由:DeepSeek的识图模式终于从内测进了正式版,虽然是补课而非破圈,但对中文用户来说,让AI直接看图比打字描述常用太多,日常工作和内容处理都更顺手了。

6月17日

星期三 · 1 条
02:24
Chubby♨️@kimmonismus精选
75
微软考虑为 Copilot Cowork 集成 DeepSeek V4

微软正考虑为 Copilot Cowork 提供微软托管的 DeepSeek V4 版本,作为更便宜的模型选项。Copilot Cowork 将放弃无限定价,转向按使用量计费,原因是成本过高(用户每周执行数百项任务导致费用激增)。若采用 DeepSeek,该模型将是可选的、经过微调与安全防护,并完全托管于 Azure。Axios 报道称微软已微调了一个可用模型,最终决定待定。

Ina Fried: 新消息 @axios:微软正考虑将 DeepSeek 用于 Copilot Cowork,同时也在转向基于使用量的定价模式。消息称最终决定尚未确定,但微软已经微调了一个可供使用的模型。


推荐理由:微软考虑在 Copilot Cowork 中引入 DeepSeek V4 作为便宜选项,同时转向按用量计价。如果落地,这不仅是成本策略的转向,更可能打破企业 AI 对开源模型的信任壁垒,定价变革也会给全行业施加压力。

6月16日

星期二 · 1 条
17:57
The Decoder:AI News(RSS)精选
72
DeepSeek 完成首轮外部融资,估值超 500 亿美元

中国 AI 初创公司 DeepSeek 完成首轮外部融资,募资超 500 亿元人民币(约 74 亿美元),估值超 500 亿美元。投资结构特殊:多数投资者将资金投入 CEO 梁文锋管理的有限合伙企业,无投票权且锁定期五年;仅国资 AI 基金直接投资并保留投票权。创始人梁文锋个人投入约 200 亿元,腾讯和宁德时代为主要外部投资者。梁文锋表示优先基础 AI 研究与 AGI 开发,将继续开源。DeepSeek 去年初凭 V3、R1 模型获全球关注,今年 4 月发布运行于华为芯片的最大开源权重模型 V4,并将 V4 Pro 永久折扣 75%,输入价格约为 OpenAI GPT-5.5 的 1/11,输出价格约为 1/35。

另有 1 家信源报道IT之家(RSS)
推荐理由:DeepSeek 首次外部融资估值冲到 500 亿美元,交易结构却排除了投资人话语权,看得出梁文锋仍把控制权抓得很紧,开源路线和极致性价比是最大的筹码。

6月12日

星期五 · 1 条
01:17
Hacker News 热门(buzzing.cc 中文翻译)精选
72
DeepSeek-R1 的开源实现

DeepSeek-R1 的开源复现项目已在 GitHub 发布,在 Hacker News 上获得 101 个积分。该项目旨在以开源方式复现 DeepSeek-R1 模型。


推荐理由:Hugging Face 把 DeepSeek-R1 的完整训练管线拆解得清清楚楚,从数据蒸馏到 GRPO 强化学习都开源了,还放出了复现的模型和数据集。想理解或自己训练推理模型的开发者,这大概是目前最实用的路线图。

6月3日

星期三 · 1 条
13:09
IT之家(RSS)精选
70
消息称 DeepSeek 首轮融资拟筹集 500 亿元,腾讯、宁德时代等参投

DeepSeek 计划在首轮融资中从腾讯、宁德时代等投资方处筹集约 500 亿元人民币。融资落地后,其投后估值预计在 3500 亿至 4000 亿元。创始人梁文峰将出资 200 亿元,腾讯和宁德时代分别拟投资 100 亿元和 50 亿元,成为最大外部投资者。DeepSeek 去年凭借 V3 大模型与 R1 推理模型获得广泛认可。此次融资凸显了中国正打造从大模型到算力能源基建的全链条 AI 产业。

另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:DeepSeek 第一轮就 500 亿、估值直奔 4000 亿,腾讯和宁德时代入局,这已经不是一家公司的融资,而是中国 AI 产业链上下游的一次正式组队。

5月29日

星期五 · 1 条
08:21
IT之家(RSS)精选
71
IT早报 0529:估值 450 亿美元,曝大基金领投 DeepSeek 首轮融资;比亚迪发 4nm 璇玑 A3 芯片并推城市领航兜底;京沪联手指导美团、淘宝、京东三大外卖平台…

DeepSeek 获国家集成电路产业投资基金(国家大基金)领投的首轮融资,投前估值 450 亿美元。豆包官方就“新手父母听建议每顿只喂60ml奶”一事作出回应,称其建议符合国家喂养指南,指出原报道存在上下文缺失。微信 Win / Mac 4.1.10 正式版发布,新增“边写边译”功能。

另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:国家大基金领投DeepSeek首轮融资,估值450亿美元,这既是政治背书也是资本对国产大模型商业化的真金白银投票,意味着DeepSeek将加速从开源挑战者转向平台化扩张。

5月28日

星期四 · 1 条
19:06

5月27日

星期三 · 1 条
03:33
Chubby♨️@kimmonismus精选
78
小米MiMo-V2.5系列API价格永久下调,最高降幅达99%,现与DeepSeek V4 Pro同价。Token套餐同步升级,同等价格下可用token量增加5-8倍,计费规则更简单透明。所有现有用户套餐额度将全额重置。此次降价源于MiMo全栈推理优化与服务效率提升,后续将发布技术博客详述细节。MiMo-V2.5-TTS限时免费,新定价于5月26日生效。

Xiaomi MiMo: 🚀 Better inference efficiency, lower costs, broader access. MiMo-V2.5 Series API pricing is now permanently reduced - b...

另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:MiMo 2.5 Pro 降价 99%,API 成本直接拉到和 DeepSeek V4 Pro 一个水平,推理优化带来的价格战升级,用模型的可以闭眼切了。

5月25日

星期一 · 1 条
02:27

5月23日

星期六 · 1 条
01:56

5月22日

星期五 · 2 条
14:08
OpenRouter@OpenRouter精选
65
DeepSeek V4 Flash已登顶周排行榜
另有 1 家信源报道X:硅基流动 SiliconFlow (@SiliconFlowAI)
推荐理由:OpenRouter 周榜第一的 DeepSeek V4 Flash,跟风 benchmark 不如看真实使用量,开发者在推理任务上明显偏好它,追求性价比的团队可以跟进了。
13:09
IT之家(RSS)精选
78
DeepSeek 推进 700 亿元融资,梁文锋承诺坚持开发开源 AI 模型而非追求短期商业化目标

DeepSeek正推进700亿元人民币的巨额融资,估值约450亿美元。创始人梁文锋承诺将继续开源开发AI模型,不追求短期商业化,目标是技术升级与通用人工智能。腾讯、IDG资本等接近参投,梁文锋个人可能注资200亿元。若成功将创下中国科技初创公司首轮融资纪录。

另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:700 亿元首轮融资创下纪录,梁文锋明确表态不追求短期商业化、继续死磕开源,国家队和腾讯都在这轮里,对国内开源生态是个强心针。

5月8日

星期五 · 1 条
03:06
Hacker News 热门(buzzing.cc 中文翻译)精选
74
DeepSeek 4:适用于 Metal 的 Flash 本地推理引擎

DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。


推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。

5月2日

星期六 · 1 条
17:49
Hacker News 热门(buzzing.cc 中文翻译)精选
74
DeepSeek V4--性能几乎达到前沿水平,价格却仅为其一小部分

DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。


推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。

5月1日

星期五 · 1 条
03:14
karminski-牙医@karminski3精选
72
DeepSeek-V4 API推理内容字段缺失导致报错问题

用户在使用DeepSeek-V4 API或集成该模型的终端编码代理(如Claude Code、Kimi CLI)和AI IDE(如Cursor)时,频繁遇到HTTP 400报错。错误信息指出,在思考模式下必须将reasoning_content字段回传给API。核心问题在于,当任务步骤的tool_call过于简单直接时,DeepSeek-V4返回的reasoning_content可能为空字符串。许多开发工具默认会过滤掉空值字段,导致该字段未被回传,从而触发API报错,致使编码任务或代理中断。经测试,在特定场景下该字段返回空字符串的概率高达59%。解决方案是必须将空字符串值的字段原样回传,不能省略或改为空对象。目前需等待IDE官方修复或自行修改开源工具,使用DeepSeek-V4的代理项目也需注意此问题。


推荐理由:如果你在用 DeepSeek-V4 写代码,这个坑迟早会踩到,作者把问题和解法都讲清楚了,不用等 IDE 修,看完就能自己改。

4月30日

星期四 · 1 条
23:10
IT之家(RSS)精选
72
DeepSeek 公布多模态模型技术报告

DeepSeek发布了多模态大模型及技术报告,提出创新的“基于视觉原语的思考”框架。该框架将点、边界框等视觉元素作为推理的基本单元,旨在解决多模态模型在空间参照任务中存在的“参照鸿沟”核心问题,使模型能将抽象认知锚定到图像的具体坐标上。尽管模型规模紧凑且图像标记预算较低,其在多项挑战性计数和空间推理基准测试上的性能,可与GPT-5.4等前沿模型相媲美。


推荐理由:DeepSeek 把视觉概念直接变成推理单元,绕开了语言描述空间的先天模糊,在空间推理上把自家紧凑模型拉到和 GPT-5.4 一个水平,做多模态应用的人值得细读。

4月27日

星期一 · 1 条
00:53
DeepSeek@deepseek_ai精选
62
🔥DeepSeek 输入缓存价格下调!即刻起,整个 DeepSeek API 系列的输入缓存命中价格降至原价的十分之一!以更少成本,更高效地构建。📌提醒:DeepSeek-V4-Pro 七五折优惠活动持续有效至 2026 年 5 月 5 日 15:59(UTC 时间)。

推荐理由:输入缓存命中价格直接打一折,对高频调用 API 的开发者来说是实打实的成本减负,配合 V4-Pro 的七五折促销,DeepSeek 在用价格战抢开发者心智。

4月26日

星期日 · 1 条
03:51
swyx 🇸🇬@swyx精选
70
DeepSeek团队正式推出并开源了DeepSeek-V4预览版模型,标志着高性价比的百万上下文长度时代到来。该系列包含两个模型:DeepSeek-V4-Pro拥有1.6万亿总参数和490亿活跃参数,性能媲美顶级闭源模型;DeepSeek-V4-Flash则拥有2840亿总参数和130亿活跃参数,主打快速、高效与经济。模型现已在官方平台通过专家模式和即时模式开放试用,API也已同步更新。完整的技术报告和模型权重已在Hugging Face平台发布,供社区研究和应用。

DeepSeek: 🚀 DeepSeek-V4 Preview is officially live & open-sourced! Welcome to the era of cost-effective 1M context length. 🔹 Dee...


推荐理由:DeepSeek-V4 把 MoE 推到 1.6T 总参、49B 活跃,百万上下文 + 开源权重,这是开源阵营第一次在旗舰级闭源模型面前不落下风,做长上下文应用的团队该认真测一下了。

4月24日

星期五 · 2 条
10:56
公众号:DeepSeek(深度求索)精选
85
DeepSeek-V4 预览版上线,百万上下文成标配

DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。


推荐理由:百万上下文成为标配,长文档处理与多步 Agent 任务从实验走向生产,原先受限于输入长度的应用有了新的落地空间。
08:00
Hugging Face:Blog(RSS)精选
78
DeepSeek-V4:智能体可实际使用的百万token上下文

DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。

另有 3 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客
推荐理由:DeepSeek 把上下文窗口推到百万 token 不稀奇,关键是「agent 能实际用」这六个字。如果实测成立,RAG 的很多工程妥协可以扔掉了,做长文档和复杂 agent 的人该第一时间跑一遍。

2月3日

星期二 · 1 条
23:03
Hugging Face:Blog(RSS)精选
80
全球开源AI生态系统的未来:从 DeepSeek 到 AI+

Hugging Face 在其官方博客发布文章,展望了全球开源人工智能生态系统的发展路径与未来趋势。文章以 DeepSeek 等代表性开源模型为例,探讨了开源社区如何推动技术民主化与创新加速。核心观点指向一个更加开放、协作的“AI+”未来生态,其中开源框架、模型和工具将深度融入各行各业,降低开发门槛并促进多样化应用场景的涌现。


推荐理由:开源AI核心平台对生态走向的判断,直接影响开发者技术选型和投资方向

1月27日

星期二 · 1 条
23:01
Hugging Face:Blog(RSS)精选
83
中国开源AI生态中的架构选择:构建超越DeepSeek的未来

Hugging Face发布博客文章,探讨中国开源人工智能生态系统的核心架构选择与发展路径。文章聚焦于如何构建一个超越现有模型(如DeepSeek)的可持续技术体系,分析了中国开发者在模型架构、训练框架、部署工具和社区协作等方面的关键决策。文中指出,中国开源社区正致力于打造独立且互操作的技术栈,以应对大规模模型训练与推理的独特挑战,并推动全球AI生态的多元化发展。


推荐理由:揭示中国开源AI架构演进,帮助开发者把握生态趋势与选型方向。

12月1日

星期一 · 3 条
18:52
18:52
00:00
DeepSeek:API 更新日志精选
85
DeepSeek-V3.2 及 DeepSeek-V3.2-Speciale 发布

DeepSeek 将 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.2,分别对应非思考模式与思考模式。同时非正式部署 DeepSeek-V3.2-Speciale 的 API 服务,价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度默认 128K,服务截止至北京时间 2025-12-15 23:59。


推荐理由:我觉得DeepSeek V3.2的亮点不是参数,而是思考模式正式接入主力API,意味着推理能力常态化,Speciale那个128K输出更像压力测试,做长文档的可以抓住窗口期探上限。