@JensenHuang 老黄这是要把Agent的运行成本打骨折啊,新出的开源模型太懂开发者了。
NVIDIA刚发的Nemotron 3.5 Lightning,300亿总参数,每次只激活30亿,纯纯为24小时在线的AI Agent设计的执行层模型,速度是同级别模型的4倍,PinchBench准确率86%,跑1万个任务比Qwen3.6 35B还快30%。
现在做Agent最大的痛点是什么?90%的时间根本不需要大模型深度思考,就是调工具、验结果、跑代码、处理重复任务,拿GPT/Claude干这些活又贵又慢,一个Agent跑一天几十块token费,根本规模化不了。
配套还发了开源调度器NeMo Switchyard:复杂规划用大模型,重复执行用闪电模型,分工干活,成本直接降到原来的1/3。
最狠的是完全开源,权重数据训练方法全给,能自己微调,个人电脑边缘设备都能跑。
之前Agent都是Demo,现在执行层的成本速度瓶颈被打穿了,接下来真要批量落地干活了。
#AI #Agent #开源模型