OpenAI Jalapeño 芯片首批实测:能效与延迟双优

ginobefun · @hongming731 · X·2026-08-26 08:01·4天前
AI 导读

OpenAI 公布首颗自研推理芯片 Jalapeño 的首批实测结果:在公开基准 InferenceX 上,对比 GB200/GB300 系统,每瓦 AI 工作性能高 1.5-1.9 倍,端到端延迟低 1.7-3.6 倍,高交互负载性能高 2.1-4.1 倍。芯片额定 700W,实测持续功耗不超 550W,从设计到流片仅 9 个月,年底开始部署。

ginobefun@hongming731
40AI 编辑部评分,满分 100

OpenAI Jalapeño 芯片首批实测:能效与延迟双优

2026-08-26 08:01· 4天前
AI 导读

OpenAI 公布首颗自研推理芯片 Jalapeño 的首批实测结果:在公开基准 InferenceX 上,对比 GB200/GB300 系统,每瓦 AI 工作性能高 1.5-1.9 倍,端到端延迟低 1.7-3.6 倍,高交互负载性能高 2.1-4.1 倍。芯片额定 700W,实测持续功耗不超 550W,从设计到流片仅 9 个月,年底开始部署。

https://x.com/i/article/2092401184791527424

BestBlogs 早报|OpenAI 首批 Jalapeño 芯片实测,Claude 记忆打通 Cowork,雷鸟眼镜以减法换全天佩戴

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

一颗芯片每瓦功耗多扛 1.5 到 1.9 倍的 AI 工作,端到端延迟还低 1.7 到 3.6 倍,而且数字出自公开基准、跑在三个公开模型上。这是 OpenAI 第一颗自研推理芯片 Jalapeño 的首批实测,从初始设计到流片只用了 9 个月,自研算力第一次进入有公开数据可查的阶段。

今天的三条精讲各答一个问题:芯片的成色怎么核对,助理的记忆交给谁管,一副眼镜敢放弃什么。后两条在「AI 替人记忆」上有真实呼应,Claude 的记忆放在云端、由你逐条审定,雷鸟的记忆戴在脸上、被动记录,两者对敏感信息的默认策略方向恰好相反,放在一起看会更有意思。

三条之外还有 47 条精选内容,其中 LLM 生产前评估框架与 WebMCP 值得先看。昨天我们聊的是把验证环境交给 Agent,今天从算力、模型产品到硬件终端,各有一条值得展开的信号。

★ 精讲一:Jalapeño 首次结果展示 AI 推理领域领先的速度与效率

来源:OpenAI News · BestBlogs 评分:91

OpenAI 公布了第一颗自研推理芯片 Jalapeño 的首批实测结果。口径先摆清楚:测试跑在 SemiAnalysis 的公开基准 InferenceX 上,模型选了三个公开的,分别是 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T,对比对象是目前商用的 GB200 与 GB300 系统,功耗按各家标称值归一化,结果由 OpenAI 自测发布。

三个模型上的结论一致:峰值状态下每瓦完成的 AI 工作比对比系统高 1.5 到 1.9 倍,端到端延迟低 1.7 到 3.6 倍,高交互负载下性能高出 2.1 到 4.1 倍。最大的被测模型 Kimi K2.5 1T 上,每瓦峰值性能高约 1.5 倍、延迟低约 3.4 倍。以往硬件常在吞吐和延迟之间二选一,Jalapeño 用同一架构把两头都占了;芯片额定 700W,实测持续功耗不超过 550W。这组数字的口径是同等用户体验下的有用工作,不是单纯的峰值跑分。

机制上是围绕真实语言模型负载做协同设计。推理分两个阶段,处理输入的 prefill 吃算力,逐 token 生成的 decode 吃内存带宽,很多系统在某一阶段强,却在等数据搬运时空转。Jalapeño 把 KV cache 等模型状态显式放置并留在本地,按阶段切换算力、内存与网络的组合,尽量少搬数据、少等通信。对智能体这种多步串联的任务,延迟会顺着任务链累加,所以评测口径定在同等用户体验下每单位功耗完成的有用工作。

开发过程本身也有 AI 参与:从初始设计到流片仅 9 个月;团队用 Codex 配合 GPT-Astra,在两个月内把三个原本不在生产计划里的开源权重模型调到高性能。在 GPT-OSS 选定的注意力与混合专家模块上,AI 生成的实现比人工版本快 1.5 到 1.8 倍,这一数字仅限选定模块,不代表整个模型。OpenAI 另称内部测试显示在前沿模型上优势更大,但未附公开数据。

按计划,Jalapeño 年底开始在 OpenAI 自有算力中部署,第二代已在深度开发、第三代在规划中,它只是多代平台的第一代。对 OpenAI 来说,同样的电力和硬件产出更多有用工作,意味着收入增速有机会跑赢服务成本;原文同时强调,未来仍会大规模部署 NVIDIA 与其他伙伴的加速器,自研与外采并行。同一天 Meta 也发布了自研训练芯片 MTIA 300,大厂自研芯片正进入密集交货期。附录里有逐模型的对比数字,包括 85,448 对 44,960 的每千瓦混合吞吐,值得与年底部署规模、NVIDIA 的同口径回应一起持续观察。

★ 精讲二:Claude 的记忆随处生效,你决定其中包含什么内容 | Claude 由 Anthropic 打造

来源:Claude Blog · BestBlogs 评分:91

Anthropic 把 Claude 的记忆做了一次打通:从即日起,聊天与云端执行任务的 Cowork 共用同一份记忆,且双向互通。你交给 Cowork 一个任务,它读到的就是几个月聊天里攒下的背景;Cowork 里冒出的新信息,也会写回聊天。原文的例子很具体:在聊天里给一场会议头脑风暴议程,之后让 Cowork 做预算和后勤文档,人数、城市、讲师它都已经知道;解释一次团队指标怎么定义,之后的每份季度汇报都按这套来;让它给经理写进展更新,它连对方习惯的格式都记得。

记忆的写入方式同步改了:从过去对话结束后做总结,改为边聊边写,你提到的事下一轮对话即生效,不必再补一句记住这个。想停可以随时暂停或整体重置。

隐私默认策略是这次更新的另一重点。健康、种族、信仰、政治、性别认同等敏感主题默认不写入记忆,需要到设置里手动开启;开启后每次保存都有通知,且不回溯此前内容。社会保障号、政府证件号、犯罪记录、移民身份等,即便开启也永不写入,Claude 会告知无法更新记忆。如果你恰恰希望它记住健康禁忌,官方例子是开启后它能记住麸质过敏,推荐备菜食谱时直接用上。

可控性落在界面上:所有记忆按主题整理成文件列表,可逐条读取、编辑或删除,改对公司旧名称一处,之后所有对话都改对。Free、Pro 和 Max 计划在网页、桌面与移动端默认开启记忆,敏感主题存储默认关闭,手机端需更新到最新版本;Team 与 Enterprise 由管理员控制,个人默认关闭。

把时间线拉长看,上周 Anthropic 刚让 Claude 担任 CI/CD 故障的第一响应者,中位 14 分钟给出首份证据分析;今天补充内容里又有贝恩加入 Claude 合作网络的消息,上下文能力正在公司内外两条线同时推进。官方博客未提供记忆误存率或写入准确性数据,适合自己上手验证;记忆管长期背景、chat search 管检索历史对话,两条能力的分工后续也值得观察。

★ 精讲三:对话雷鸟创新李宏伟:智能眼镜的终局仍然是「AI + AR」,AI 是我们现在最重要的事

来源:爱范儿 · BestBlogs 评分:91

iO 眼镜发布前夕,爱范儿专访了雷鸟创新创始人兼 CEO 李宏伟与 AI 负责人程思婕。这款定位「人类增强」的眼镜,落点是补强知识、强化表达、留存记忆三件事:核心功能全天智记以极低功耗持续记录一天的沟通,晚间生成每日总结,内置千问 3.7 Max 与 DeepSeek V4 Pro 两个模型。形态上做到了无感显示,戴上去与普通眼镜基本无异,彩虹纹几乎没有;团队里还有一支四十多人的 AI 队伍,一边做 Agent 能力,一边自训一个理解物理世界的模型。

最有信息量的是取舍清单。雷鸟主动放弃了摄像头,理由有二:还没有足够好的多模态模型支撑杀手级应用,而全天佩戴的设备加上摄像头,隐私与功耗都扛不住。大芯片和 Android 系统同样放弃,换全天续航。扬声器纠结最久:能听歌音质的扬声器最小也要 7mm 直径,近视眼镜的细镜腿无法同时满足音质、续航与形态,一半是主动放弃,一半是技术上做不到。李宏伟的逻辑是,出发点是打造 AI 的杀手级应用,不是造一副时尚的智能眼镜,而杀手级应用的前提是全天候佩戴,形态由此反推回来。

机制细节来自程思婕。信息从原子到抽象分 L1、L2、L3 三层,最底层的单次行为不直接透传给用户,聚合并处理时间戳与冲突信息之后才呈现;主动提醒的置信度门槛超过 90% 才推送,宁可少推也要推得靠谱。她还点出这副眼镜与具身智能的关联:眼镜是最有机会像自动驾驶那样规模化采集第一视角数据的终端。

壁垒的判断落在数据上:眼镜第一人称视角看到的物理世界,是通用大模型拿不到的上下文,而互联网视频大多不连续,对训练第一视角多模态模型帮助有限;Meta 已用 Project Aria 专门采集数据,区别在于谁有用户、谁能处理数据。销量够大,就能转起采集、理解、训练的飞轮,团队甚至设想了为 AI 设计的低分辨率摄像头。

时间表也给得很明确:智能眼镜的 iPhone 时刻约在 2027 年,形态收敛要到 2029 年左右;显示方面,信息显示的视场角 30 度左右够用,未来做虚拟现实融合则要到 70 度。需要留意这是创始人的预判,2021 年他同样预计这一时刻约在 2025 年到来,实际推迟了;全天智记不存储录音、公司任何人都拿不到,也仍是厂商承诺,落地机制未披露。iO 正式发布后的真实续航与记录质量,是验证这份取舍清单的第一个观察点。

速览

一个 Skill 搞定服务重构:从链路分析到测试自动化

来源:腾讯云开发者 · BestBlogs 评分:90

腾讯云开发者社区这篇实践把服务重构做成一个可复用的 Skill,基于渐进式披露与 Harness Engineering,用五阶段流程把从链路分析到测试自动化的改造标准化。

做法上的关键是将重构经验固化进流程:每个阶段只暴露当前需要的信息,降低上下文负担,测试环节自动跟进,让老服务改造不再每次从零开始,沉淀下来的 Skill 可以直接复用到下一个服务。渐进式披露在这里同时服务模型与人,控制住上下文成本。

价值在于可靠性与可复用性的提升,适合正在还技术债的团队对照自己的重构流程。昨天刚聊过把验证环境交给 Agent,这条是同一方向上的具体落地。

Canva 联合创始人 Cliff Obrecht 与 Stripe CEO 对谈:AI 时代的成本结构

来源:Stripe · BestBlogs 评分:90

__XPOSTER_yilug_IMAGE_5__

Canva 联合创始人在这场与 Stripe CEO 的深度对谈里,讨论 AI 时代的设计、产品增长飞轮与全球化组织,核心议题是成本结构的变化。

他的主张是用快速原型替代冗长规划:先把东西做出来拿到真实反馈,比在规划文档上花数周更划算,增长飞轮的每一步都由快速验证驱动。

对做产品和增长的团队,这是一份一线创始人的判断样本;对谈整体偏经验分享,适合带着自己的成本问题去听。

84.49 家央企采买进场,史上最热 WRC:泡沫被挤压,具身行业进入实战阶段

来源:卫诗婕|漫谈Light the Star · BestBlogs 评分:92

播客主理人卫诗婕对话一位 14 年机器人从业者,从世界机器人大会现场出发,拆解人形机器人行业从概念展示转向实战落地的过程。

内容最实的部分是破除神话:出货量与预训练都被指出存在水分,展台演示该怎么鉴别、数据的底层痛点在哪里,嘉宾给了一线视角的答案。

两天前机器人打网球的视频刚刷过屏,这期播客把视角从展台热闹拉回采购清单与落地能力,对判断具身智能的真实进度有帮助;具体数字为嘉宾口述,听时可以自行核对。如果只记一个判断,就是行业重心正从概念展示转向交付能力。

如何在生产环境前评估 LLM

来源:The GitHub Blog · BestBlogs 评分:90

GitHub 工程博客给出了一套严谨、面向生产的 LLM 系统评估框架,四个支点是产品决策、集成式测试、贴近生产的数据与错误分析。

框架反复强调一点:实验室指标好看不等于上线可靠,评估数据必须贴近真实生产分布,错误分析要落到具体失败模式而不是只看聚合分。从失败样本反推评估集缺口,是这套框架里最容易被跳过、也最值得补的一步。

上周吴恩达的技能图谱也把评估驱动开发列为关键能力,这个主题的热度还在涨。准备把 LLM 从 demo 推向生产的团队,可以直接拿这套框架对照自查。

Granite 4.2 LLM:构建方式详解

来源:Hugging Face - Blog · BestBlogs 评分:90

IBM 发布 Granite 4.2 系列:一组从头开始在 15T token 上训练的密集、仅解码器推理 LLM,提供 3B、8B、30B 三个规模。

训练流程披露得很细:五阶段预训练,之后是 SFT 与多阶段 RL,其中包含面向工具使用的智能体 RL,整篇更像一份可对照的训练配方。从头训练而不是在旧底座上续训,是这一代的关键变化。

对需要在本地或自有环境跑推理的团队,这是一条值得跟的开源线;各基准数字为厂商自测,横向对比时注意口径。

用向量搜索设计模式减少 LLM 调用

来源:Spring I/O · BestBlogs 评分:89

这场 Spring 大会分享介绍了语义路由、语义缓存与语义护栏等向量搜索模式,目标是在智能体花费 token 或调用工具之前,减少不必要的 LLM 请求。

关键在于匹配靠语义而不是关键词:改写过的重复问题也能命中缓存,越界的请求在进入模型前被护栏拦下,成本和延迟一起降。三类模式可以单独用,也可以串成一道漏斗。

对已经上线智能体的团队,这是少数能直接落地的降本手段;分享配有具体模式与代码示例,适合工程侧同学观看。

用 WebMCP 构建面向智能体的网站

来源:OpenAI · BestBlogs 评分:87

OpenAI 发布 WebMCP 演示:网站可以暴露可被发现的工具,让 Codex 更高效地执行操作,并在丰富的交互体验中与人协作。

演示展示的方向是网站从纯给人看的页面,变成智能体可以直接操作的服务,人在同一个界面里参与协作与确认。对站点方来说,工具暴露的粒度与权限边界会是新的设计课题。

如果这个模式推开,前端的工作对象会从只有用户变成用户加智能体;目前还是早期演示,值得观察哪些站点率先接入。

补充阅读

冲刺“史上最大 IPO”,Anthropic 在补哪些课?

来源:腾讯科技 · BestBlogs 评分:89

Anthropic 在冲刺史上最大 IPO 的过程中,面临收入增长、算力成本控制与治理结构调整三大课题,高估值预期与可持续商业模式之间需要找到平衡。这篇分析的价值在于把商业化压力拆成了可讨论的三个具体问题。

瓦解俄罗斯新一轮秘密影响力行动

来源:OpenAI News · BestBlogs 评分:90

OpenAI 瓦解了俄罗斯一轮秘密影响力行动:涉案 ChatGPT 账号推广一个虚构的以色列智库,机构建立在抄袭的学术成果和一个亲俄的主权指数之上。平台侧的监测与披露机制,正在成为影响力行动研究的一手信源。

刚刚,新款 Mac mini 发布!价格大涨 2500 元,苹果第一次为 AI 造电脑

来源:APPSO · BestBlogs 评分:89

苹果发布搭载 M6、M5 Pro、M5 Max 与 M5 Ultra 芯片的新款 Mac mini 和 Mac Studio,起售价大幅上涨,产品定位首次从个人电脑转向面向 AI 与 Agent 的本地计算节点。价格与定位同时变化,值得对比自己的本地推理需求再看。

全球首个!10 万小时人类数据全开源,Hugging Face 罕见站台

来源:新智元 · BestBlogs 评分:88

光轮智能开源 10 万小时全模态人类行为数据集 EgoSuite-Open100K,获 Hugging Face 官方站台,为具身智能提供了可测量的数据基础。第一视角数据的稀缺昨天雷鸟专访里也提到,这批数据正好往缺口里填料。

我的 AI 原生开发流程:一个真实案例的完整复盘

来源:宝玉的分享 · BestBlogs 评分:91

宝玉完整复盘自己的 AI 原生开发流程:人从编码者转为指挥官,文档成为关键中介,瓶颈转移到设计与测试环节。一份少见的单人全流程账本,适合准备转向 AI 原生开发的工程师对照。

Headlong: a microharness for persistent agents // Laude Institute

来源:Hacker News · BestBlogs 评分:92

Headlong 是一个开源的代理微框架,用不到 10K 行 Bash 实现持续代理能力,代理在自导循环中持续思考,并自主诊断修复了自身回忆过程的 bug。极小实现换来可审计性,思路与重型框架正好相反。

行业首发|智能体安全能力图谱发布:企业可落地的建设路径

来源:字节跳动技术团队 · BestBlogs 评分:89

字节跳动技术团队首次提出智能体安全能力图谱,梳理 10 大能力维度与 60 项核心技术要素,给出基础防护、精细化管控、持续运营的三级建设路径。对正在规划 Agent 安全建设的团队,图谱可以直接当检查清单用。

我们从未看见彼此

来源:无人知晓 · BestBlogs 评分:93

这期播客从韩国电影《好朋友们》与《智能简史》的进化五层理论出发,揭示人类分别心的神经起源与认知局限,探讨算法时代如何真正看见他人。

Linux 是完美的操作系统吗?DHH 访谈 Omarchy

来源:NetworkChuck · BestBlogs 评分:90

DHH 介绍 Omarchy 如何将 Arch、Hyprland、QuickShell 与边界清晰的 AI 智能体工作流结合,打造一套键盘优先、让用户能塑造而不只是使用电脑的 Linux 系统。对想深度定制开发环境的人是一份现成路线。

在 OpenWiki 中构建自我纠正的记忆

来源:LangChain Blog · BestBlogs 评分:90

OpenWiki 的声明运行时把 wiki 声明与版本化的代码证据关联起来,让系统在源代码演进时检测过时知识并自我纠正。让文档跟着代码一起过期报警,这个方向与今天的记忆主题也有关。

延伸探索

补充内容里工程侧有一簇 LLM 与推理工程的新结果:Granite Speech 5.0 把转录速度推到新档位,量化感知修复让 4 位压缩模型在 9 项基准中的 7 项反超全精度原版,Qwen3-8B 在 Blackwell 工作站上跑了三套推理框架的对比,NVIDIA Dynamo 的影子引擎把推理故障转移从 283 秒压到 7.3 秒,还有人实测了 393 个模型的提示缓存,发现一个 JSON 字段背后藏着最多 90% 的输入折扣,微调战术手册与缓存评估的踩坑复盘也在这簇里。

落地侧与厂商动向是另一簇:得物把 AI Coding 扩成覆盖需求到反思的研发全链路,Calendly 用 Agent 在一周半写了 64 个 PR、完成约 30% 的项目重构,字节 AgentKit 提供 5 分钟部署的安全沙箱;产品侧有 Cursor 发布代码托管平台 Origin、Meta 自研训练芯片 MTIA 300、汤姆森路透推出自有前沿模型、阿里 Wan3.0 上线,贝恩加入 Claude 合作网络,另有 Tibo 访谈与中美研究者关于持续学习的对谈值得按兴趣深入。

今日阅读路径

时间有限的话,建议按这个顺序读:先看 Jalapeño 的原文附录,逐模型的对比数字都在那里,10 分钟能建立自己的判断;再花 5 分钟读 Claude 记忆的官方博客,顺手检查自己的记忆设置;最后读雷鸟专访的取舍清单部分,那是全文信息密度最高的几段。如果还有富余,把 WRC 那期播客加进队列,正好校正具身智能的进度感。

读完欢迎想一想:你会把敏感主题记忆手动打开吗?如果一副眼镜用砍掉摄像头换全天佩戴,你愿意戴吗?欢迎在评论区聊聊你的判断,也欢迎推荐你今天读到的其他好文章。

👉 近期早报

• BestBlogs 早报 · 2026-08-25

• BestBlogs 早报 · 2026-08-24

• BestBlogs 早报 · 2026-08-23

• BestBlogs.dev 第 109 期:程序员的职业未来

• BestBlogs.dev 第 108 期:智能的执行层

• BestBlogs.dev 第 107 期:个人 AGI

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。