Topic · 主题全部主题 →

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

1,006条收录
71条精选

精选归档 · 第 4 页

6171 条 · 共 71

5月19日

星期二 · 1 条
00:52
Hugging Face:Blog(RSS)精选
AI 评分 67/100
NVIDIA Cosmos Predict 2.5 微调:使用 LoRA/DoRA 生成机器人视频

NVIDIA Cosmos Predict 2.5 是一个 2B 参数的世界模型,可根据文本、图像或视频片段生成物理合理的视频。通过 LoRA 或 DoRA 在 DiT 的注意力层(to_q, to_k, to_v, to_out.0)和前馈层注入可训练适配器,冻结全部基座权重,在单个 80GB GPU 上即可完成参数高效微调,避免了全量微调的高成本与灾难性遗忘。该流程使用 diffusers 和 accelerate 库,利用 92 个机器人操作视频训练集与 50 个 (prompt, image) 测试对进行微调,并展示如何用微调模型生成合成机器人轨迹以支持下游机器人学习任务。支持单 GPU 与多 GPU 训练,切换不同领域适配器无需重训。


推荐理由:这篇教程把微调Cosmos Predict 2.5的方法从头到尾讲清楚了,做机器人合成数据的同行可以直接抄作业,LoRA/DoRA切换也很方便,值得收藏。

4月29日

星期三 · 1 条
00:37
Hugging Face:Blog(RSS)精选
AI 评分 70/100
介绍 NVIDIA Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态模型

NVIDIA 发布了 Nemotron 3 Nano Omni 模型,这是一个专为处理长上下文多模态任务设计的轻量级模型。该模型能够同时理解并处理文档、音频和视频数据,旨在赋能新一代多模态智能体。其核心变化在于将长上下文能力与多模态理解结合到一个小型化模型中,提升了在复杂跨模态场景下的处理效率与应用灵活性。


推荐理由:NVIDIA 把多模态长上下文塞进 Nano 级别模型,文档、音频、视频 Agent 通吃,做端侧多模态应用的团队值得认真看看这个架构思路。

4月16日

星期四 · 1 条
00:46
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 79/100
黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河

黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。


推荐理由:Jensen首次承认没投Anthropic是错判,对华芯片禁运的态度也极其强硬,这期访谈是他近半年最坦诚的战略交底,做硬件和做政策的都该听一遍。

4月15日

星期三 · 1 条
11:04
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
Nemotron 3 Super:面向智能体推理的开放高效Mamba-Transformer混合专家模型

Nemotron 3 Super是1200亿参数(120亿激活)的Mamba-Attention混合专家模型,首创NVFP4预训练,集成LatentMoE架构与MTP推测解码层优化推理。模型基于25万亿token预训练,经监督微调和强化学习后训练,支持100万token长上下文。相比GPT-OSS-120B和Qwen3.5-122B,推理吞吐量分别提升2.2倍和7.5倍,同时保持相当精度。全系列数据集与模型检查点已在HuggingFace开源。

另有 1 家信源报道X:AK (@_akhaliq)
推荐理由:NVIDIA 用 LatentMoE 和 Mamba 混合架构,把 120B 参数的推理吞吐做到 GPT-OSS 的 2.2 倍,且 agent 能力不输主流前沿模型,对低成本部署智能体是个强信号。

4月13日

星期一 · 1 条
08:00
Tomer Tunguz 博客(VC 分析)精选
AI 评分 61/100
AI稀缺时代的开端

AI算力稀缺时代正式开启。Nvidia Blackwell芯片GPU租赁价格涨至每小时4.08美元,两月内涨幅达48%;云服务商CoreWeave涨价20%并将最低合同期从一年延长至三年。Anthropic已将最新模型限制给约40个组织使用,OpenAI因算力不足被迫放弃部分项目。这标志着AI充足时代结束,"价高者得"、关系型销售、被迫多元化成为行业新常态,初创公司面临更严峻挑战。


推荐理由:Tunguz 把 AI 算力短缺的五个特征讲得很透,关系销售与价格通胀对创业者是核心挑战,虽然文章有点旧,但判断框架仍然有效。

4月8日

星期三 · 1 条
08:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 66/100
cuLA:用 CUDA 重写线性注意力

cuLA是一套面向GLA、KDA等线性注意力变体的高性能CUDA内核库。它通过手工优化的CuTe DSL与CUTLASS C++实现,深度适配NVIDIA Hopper和Blackwell等新一代GPU架构,旨在将复杂算法转化为可直接调用的高性能算子。其接口与flash-linear-attention保持一致,开发者仅需修改一行import即可低成本接入。性能测试显示,其内核在Blackwell和Hopper GPU上相比Triton基线实现,平均加速比最高达1.52倍。该项目已开源,并计划未来集成至FLA的统一调度机制中。


推荐理由:蚂蚁百灵把线性注意力的 CUDA 内核做成了开箱即用的库,性能超过 Triton 基线,对于做长上下文推理优化的团队挺实用,但受众面比较窄。

2月5日

星期四 · 1 条
02:00
Nathan Lambert:Interconnects(RSS)精选
Nvidia 为何构建开源模型:对话 Bryan Catanzaro

Interconnects 第17期访谈中,Nvidia 副总裁 Bryan Catanzaro 系统回顾了 Nemotron 开源模型项目的技术演进与战略定位。访谈涵盖该系列模型从研发初期到当前版本的迭代历程,剖析了英伟达在开源 AI 领域的布局逻辑,并披露了 Nemotron 在合成数据生成与模型训练效率方面的最新进展及未来规划。


推荐理由:NVIDIA副总裁亲述开源模型战略,揭示芯片巨头如何通过开放生态锁定行业标准

1月6日

星期二 · 1 条
06:56
Hugging Face:Blog(RSS)精选
AI 评分 80/100
NVIDIA发布Cosmos Reason 2模型,增强物理AI推理能力

NVIDIA在Hugging Face上发布了Cosmos Reason 2模型,旨在提升物理AI系统的推理能力。该模型通过改进的推理架构,使AI能更准确地理解和预测物理世界的动态与交互,核心升级包括对复杂场景的多步推理、不确定性量化及时间序列数据的深度理解。这一进展将推动机器人、自动驾驶等领域的发展,使AI在现实环境中的决策更可靠、更符合物理规律。


推荐理由:物理AI推理能力升级,机器人和具身智能落地的关键拼图

12月24日

星期三 · 1 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 55/100
可蒸馏模型与合成数据管道:使用 NeMo Data Designer

介绍如何利用 NeMo Data Designer 构建许可安全的合成数据工作流,用于模型特化(model specialization)。该管道支持生成可蒸馏模型所需的高质量合成数据,确保数据来源合规,适用于下游微调与领域适配场景。


推荐理由:虽然发布快半年了,但教程讲的是如何用 NeMo Data Designer 构建 license-safe 的合成数据管道,对正在搞模型蒸馏和微调的开发者依然有参考价值,细节够实操。

8月5日

星期二 · 1 条
23:57
Jim Fan@DrJimFan精选
NVIDIA推出DreamGen引擎:让机器人在视频生成模型中"做梦"学习World modeling for robotics is incredibly hard because (1) control of humanoid robots & 5-finger hands is wayyy harder than ⬆️⬅️⬇️➡️ in games (Genie 3); and (2) object interaction is much more diverse than FSD, which needs to *avoid* coming into contact. Our GR00T Dreams work was a first attempt at building high-fidelity world simulator for humanoid robots. It's not only for evaluation but also for large-scale synthetic data generation. Time to move away from the "fossil fuel" of robotics (human teleoperation) and embrace clean energy (nuclear "diffusion")!GR00T Dreams kind of flew under the radar, so bringing it back to life on a cheerful day ;)NVIDIA发布DreamGen引擎(GR00T Dreams),将Sora/Veo等视频生成模型用作神经物理引擎,通过微调模型、模拟并行世界、恢复伪动作、训练基础模型四步流程,为机器人生成大规模合成训练数据。人形机器人仅凭单一拾放任务即可学会倾倒、折叠等22种新行为,在新动词和陌生环境中实现零样本泛化(成功率分别达43%和28%)。相比传统图形引擎,该方法以恒定计算成本处理可变形物体、流体等复杂交互,团队计划数周内完全开源。

Jim Fan: What if robots could dream inside a video generative model? Introducing DreamGen, a new engine that scales up robot lear...


推荐理由:NVIDIA提出用视频生成模型为机器人“造梦”合成训练数据,实现零样本技能泛化