
AMD 與 Cerebras Systems 宣布達成技術合作夥伴關係,推出結合 AMD Helios機殼級解決方案與 Cerebras 晶圓級引擎 (Wafer-Scale Engine) 的全新解構式 AI 推論解決方案。此解決方案於 AMD Advancing AI 2026 大會上首次亮相,旨在提供最先進 AI 應用所需的超低延遲,同時大幅提升吞吐量與效率。
AMD 攜手 Cerebras 推出先進 AI 推論解決方案
AMD 與 Cerebras Systems 的聯合解決方案,將部署 AMD Helios 並整合 Cerebras 晶圓級引擎技術於單一推論工作流程中,以實現極致的效能與效率。AMD Helios 提供高效能且可擴展的吞吐量引擎,Cerebras 晶圓級引擎技術則提供超快速、超低延遲的 Token 生成能力。兩大運算引擎結合,預計可提供高達 5 倍的每瓦每秒 Token 數 (T/s/W) 註 1。
AI 推論工作負載在延遲、吞吐量、Token 容量、成本以及擴展規模方面的需求日益多元化。大量工作負載優先考量最大化 Token 生成量,而程式碼編寫、即時 Copilot、即時代理與代理式工作流程則需要更快的回應時間。這些差異正推動對異質基礎設施 (Heterogeneous Infrastructure) 的需求,使其能精準匹配運算技術與特定工作負載的需求。
AMD 與 Cerebras Systems 的解決方案透過解構式推論 (Disaggregated Inference) 解決這項挑戰,並針對工作流程中的兩個主要階段進行最佳化。AMD Helios 以超高吞吐量處理提示詞與大型上下文視窗;Cerebras 晶圓級引擎則加速記憶體頻寬密集型的解碼階段,以超低延遲生成 Token。透過將這兩項頂尖引擎整合於單一工作流程中,雙方打造出具差異化優勢的超低延遲推論平台,且無須犧牲吞吐量或擴展規模。
AMD 董事長暨執行長蘇姿丰博士表示:「AI 推論正成為 AI 領域中最大的基礎設施發展機會之一,而其日益增長的多樣性需要更具彈性的方案。AMD Helios 為最廣泛的推論工作負載提供領先業界的效能與擴展規模。透過與 Cerebras 合作,我們正將這項領先優勢延伸至對延遲極為敏感的應用領域,並為即時代理式 AI 打造強大的全新平台。」
Cerebras Systems 執行長暨共同創辦人 Andrew Feldman 表示:「超高速推論的需求正以前所未有的速度快速成長。Cerebras 提供全球最快速的超低延遲推論能力。與 AMD 合作,讓我們有絕佳機會將這項效能帶給更多客戶。」
隨著 AI 邁向軟體開發、自主代理、機器人技術、科學發現等回應時間直接影響使用者體驗與系統實用性的應用領域,快速的 Token 生成變得越來越重要。這項聯合解決方案整合了專為這些需求打造的互補架構。
AMD Helios 提供處理大量複雜請求所需的高吞吐量的提示詞引擎、機殼級效率與部署規模,Cerebras 晶圓級引擎技術則提供即時傳回 Token 所需的超低延遲效能。其成果是專為推論市場中超低延遲領域所設計的解決方案,並以 AMD Helios 作為整個資料中心高吞吐量與平衡推論工作負載的基礎。
Cerebras Systems 計劃在其資料中心部署 AMD Helios 系統,聯合解決方案預計將於 2026 年下半年率先透過 Cerebras Cloud 提供。



