# AMD 携手 Cerebras 押注低时延 AI 推理：每瓦每秒 Token 吞吐提升 5 倍

- 来源：IT之家（RSS）
- 发布时间：2026-07-24 13:49
- AIHOT 分数：45
- AIHOT 链接：https://aihot.virxact.com/items/cmryitqwt01k1rolgn6566and
- 原文链接：https://www.ithome.com/0/981/112.htm

## AI 摘要

AMD 在 Advancing AI 2026 活动中宣布与 Cerebras 合作，联合开发针对超低延迟 AI 推理的解决方案。该方案整合 AMD 的 Helios 机架与 Cerebras 的 Wafer-Scale Engine，分别处理提示词与 Token 生成环节，预估可将每瓦每秒 token 数量提高 5 倍。

## 正文

IT之家 7 月 24 日消息，科技媒体 Wccftech 今天（7 月 24 日）发布博文，报道称在 Advancing AI 2026 活动中，AMD 宣布携手 Cerebras 公司，联合开发 AI 推理解决方案。

根据官方新闻稿，该方案主要针对超低延迟 AI 推理场景，将整合 AMD 的 Helios 机架级解决方案与 Cerebras 的晶圆级引擎，从而应对英伟达和 Groq 合作。

按照双方披露的路线，Helios 机架承担高性能、可扩展吞吐引擎角色，主要处理提示词与大上下文窗口。

Cerebras 的 Wafer-Scale Engine 则负责对内存带宽要求更高的 Token 生成与解码环节，强调超低时延表现，结合使用 2 个计算引擎，预估可以将每瓦每秒 token 数量提高 5 倍。IT之家附上相关截图如下：

Cerebras 介绍称，Wafer-Scale Engine 在单块互连硅片上无缝连接数十万个计算核心和数十 GB 的 SRAM，减少外部网络瓶颈对数据传输的影响。
