2026年1至8月,Hugging Face公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD与NVIDIA各发布超200个新模型仓库,成为发布开源模型最多的机构。
开源生态
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
8月15日
8月14日
通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。
另有 8 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
另有 1 家信源报道X:Kim (@kimmonismus)智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。
另有 9 家信源报道X:智谱 Z.ai (@Zai_org)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)Nathan Lambert:Interconnects(RSS)MarkTechPost(RSS)The Decoder:AI News(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Kim (@kimmonismus)IT之家(RSS)蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
另有 2 家信源报道IT之家(RSS)X:MiniMax (@MiniMax_AI)8月13日
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
另有 2 家信源报道X:Tianyi Cui(@tianyi)IT之家(RSS)小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。
8月12日
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。
另有 1 家信源报道MarkTechPost(RSS)Mojo 语言正式发布 1.0 版本,提供稳定、可用于生产环境的语言基础,自 2023 年首次发布以来已发展成通用语言。自开源标准库以来,近 200 名贡献者合入超 1,100 个拉取请求,改动超 200,000 行代码。
另有 1 家信源报道IT之家(RSS)8月11日
英伟达正在研发新一代开源 AI 模型系列 Nemotron 4,规模最大的模型预计至少拥有 1 万亿个参数,旨在与全球最先进的开源模型竞争。英伟达尚未确定发布日期,最终训练也未完成,员工认为该模型最早可能在今年秋末准备就绪。此举意在通过开放模型生态扩大 AI 应用范围,并推动市场对其 GPU 算力的需求。
另有 1 家信源报道The Decoder:AI News(RSS)蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。
另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)8月10日
OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
8月9日
近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。作者认为需要更多透明度,并指出持久性强的模型更可能实施黑客行为,OpenAI的推理时扩展路径可能与此相关。
本教程基于Stanford IMDb数据集构建端到端情感分析流程,对比TF-IDF逻辑回归基线与LoRA微调的DistilBERT。模型评估涵盖准确率、macro-F1、ROC-AUC及期望校准误差,并分析置信错误、长度影响与词级遮挡显著性。最后利用未标注IMDb数据做置信度伪标注,比较半监督模型与基线,保存合并后的Transformer用于推理。
8月8日
Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。
腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。
8月7日
小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
8月6日
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
作者整理了10个提升vibe coding体验的开源App,涵盖Mac刘海屏改造(Atoll)、窗口预览(DockDoor)、极速启动器(Raycast)、彻底卸载(Pearcleaner)、菜单栏折叠(Thaw)等工具。这些工具均为免费开源,可将重复操作压缩为快捷指令,降低试错成本。作者还提到可用Codex随时为这些开源App添加自定义功能。
OpenAI 将安全插件 Codex Security 开源,外部 Agent 均可调用,并已支持通过 OpenRouter 和 Fireworks 接入第三方模型。
8月5日
NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。
另有 1 家信源报道IT之家(RSS)数字生命卡兹克开源「活人感写作.skill」(英文名 human Writing.skill),旨在去除AI味、帮用户写出有真实生活感的文字。该Skill鼓励用户提供真实案例与情感,并针对辞章端禁用AI常用口癖和黑话,同时适配Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3等模型,可直接用于WorkBuddy、千问办公等产品。
Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。
SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。
8月4日
NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。
另有 1 家信源报道MarkTechPost(RSS)Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
面壁智能联合 OpenBMB 开源全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,由 Kernel Agent 与 App Agent 闭环协作,实现从算子优化到应用集成的全自动流程。
另有 1 家信源报道X:面壁智能 OpenBMB (@OpenBMB)AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。