# OpenAI 自研推理芯片 Jalapeño 首秀：能效与延迟双优

- 来源：ginobefun (@hongming731)
- 发布时间：2026-08-26 08:01
- AIHOT 分数：39
- AIHOT 链接：https://aihot.virxact.com/items/cmt9dfvnc0gwirolyxhmy7s2y
- 原文链接：https://x.com/hongming731/status/2092401983642870199

## AI 摘要

OpenAI 首颗自研推理芯片 Jalapeño 公布首批实测：在 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T 三个公开模型上，每瓦峰值算力提升 1.5 到 1.9 倍，端到端延迟降低 1.7 到 3.6 倍。

## 正文

BestBlogs 早报 · 08-26

OpenAI Jalapeño / Claude 记忆 / WebMCP / LLM 生产前评估 / Granite 4.2

[1] ★ 精讲｜Jalapeño 首次结果展示 AI 推理领域领先的速度与效率
OpenAI 首颗自研推理芯片 Jalapeño 公布首批实测：在 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T 三个公开模型上，每瓦峰值算力提升 1.5 到 1.9 倍，端到端延迟降低 1.7 到 3.6 倍，数据来自 SemiAnalysis 的 InferenceX 公开基准。芯片开发本身也有 AI 参与，从初始设计到流片仅 9 个月，部分 AI 生成算子比人工版本快 1.5 到 1.8 倍。评估推理成本与自研算力成色，可细读附录对比。
来源：OpenAI News
https://www.bestblogs.dev/article/570263b14d

[2] ★ 精讲｜Claude 的记忆随处生效，你决定其中包含什么内容 | Claude 由 Anthropic 打造
Anthropic 把 Claude 的记忆打通到 Cowork：日常聊天积累的项目背景，交给云端执行任务时直接可用，反向亦然。记忆更新改为边聊边写入，提到的事下一轮对话即生效，可随时暂停或重置。健康、信仰等敏感主题默认不存储，需手动开启；全部记忆按主题整理，可逐条查看、编辑或删除。对在多个界面切换的用户，省去的是反复交代背景。
来源：Claude Blog
https://www.bestblogs.dev/article/9597fb19a2

[3] ★ 精讲｜对话雷鸟创新李宏伟：智能眼镜的终局仍然是「AI + AR」，AI 是我们现在最重要的事
爱范儿在 iO 眼镜发布前夕专访雷鸟创新 CEO 李宏伟与 AI 负责人程思婕。这款定位「人类增强」的眼镜主动放弃摄像头与大芯片，换取全天佩戴和续航；核心功能全天智记持续记录沟通并生成每日总结。李宏伟判断智能眼镜的「iPhone 时刻」可能要到 2027 年，形态收敛要到 2029 年左右，最难的是第一视角多模态数据。取舍与时间表都给得很实。
来源：爱范儿
https://www.bestblogs.dev/article/66323035b8

[4] 一个 Skill 搞定服务重构：从链路分析到测试自动化
本文介绍一种基于渐进式披露和 Harness Engineering 的 Service Refactor Skill，通过五阶段流程标准化服务重构，提升可靠性与可复用性。
来源：腾讯云开发者
https://www.bestblogs.dev/article/c5565f2b28

[5] Canva 联合创始人 Cliff Obrecht 与 Stripe CEO 对谈：AI 时代的成本结构 [视频]
Canva 联合创始人 Cliff Obrecht 在这场深度对谈中讨论 AI 时代的设计、产品增长飞轮、全球化组织，以及为何应以快速原型替代冗长规划。
来源：Stripe
https://www.bestblogs.dev/video/8e12a79e1

[6] 84.49 家央企采买进场，史上最热 WRC：泡沫被挤压，具身行业进入实战阶段 [播客]
对话 14 年机器人从业者叶阳生，从 WRC 现场观察出发，拆解人形机器人行业从概念展示转向实战落地，破除出货量与预训练神话，给出展台 Demo 鉴别指南与数据底层痛点分析。
来源：卫诗婕｜漫谈 Light the Star
https://www.bestblogs.dev/podcast/d73fccff6

[7] 如何在生产环境前评估 LLM
本文介绍了一套严谨、面向生产的 LLM 系统评估框架，强调产品决策、集成式测试、贴近生产的数据以及错误分析。
来源：The GitHub Blog
https://www.bestblogs.dev/article/6d8f278466

[8] Granite 4.2 LLM：构建方式详解
Granite 4.2 推出了一系列从头开始在 15T 个 token 上训练的密集、仅解码器推理 LLM（3B/8B/30B），采用五阶段预训练、SFT 以及包含用于工具使用的智能体 RL 的多阶段 RL 流程。
来源：Hugging Face - Blog
https://www.bestblogs.dev/article/48e973ff11

[9] 用向量搜索设计模式减少 LLM 调用 [视频]
Raphael De Lio 介绍了语义路由、语义缓存与语义护栏等向量搜索模式，在智能体花费 Token 或调用工具之前减少不必要的 LLM 请求。
来源：Spring I/O
https://www.bestblogs.dev/video/ee1985f8d

[10] 用 WebMCP 构建面向智能体的网站 [视频]
视频介绍了 WebMCP：网站可暴露可发现的工具，让 Codex 更高效地执行操作，并在丰富的交互体验中与人协作。
来源：OpenAI
https://www.bestblogs.dev/video/5968b600b

---
http://BestBlogs.dev · 发现真正适合你的高质量内容
BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
在线阅读：https://www.bestblogs.dev/explore/brief/2026-08-26

### 引用推文

> ginobefun：https://x.com/i/article/2092401184791527424
