● AMD 與 Cerebras Systems 展開合作,共同推進針對工作負載最佳化的超低延遲 AI 推論基礎設施。
● AMD Helios™與 Cerebras 晶圓級引擎將作為單一解構式推論工作流程運作,結合 AMD Instinct™ GPU 提供的高吞吐量以及 Cerebras 晶圓級引擎的超高速 Token 生成能力。
● Cerebras 計劃在其資料中心部署 AMD Helios,聯合解決方案預計於 2026 年下半年率先透過 Cerebras Cloud 提供。
AMD(NASDAQ: AMD)與 Cerebras Systems(NASDAQ: CBRS)宣布達成技術合作夥伴關係,推出結合 AMD Helios™機櫃級解決方案與 Cerebras 晶圓級引擎(Wafer-Scale Engine)的全新解構式 AI 推論解決方案。此解決方案於 AMD Advancing AI 2026 大會上首次亮相,旨在提供最先進 AI 應用所需的超低延遲,同時大幅提升吞吐量與效率。
AMD 與 Cerebras Systems 的聯合解決方案,將部署 AMD Helios 並整合 Cerebras 晶圓級引擎技術於單一推論工作流程中,以實現極致的效能與效率。AMD Helios 提供高效能且可擴展的吞吐量引擎,Cerebras 晶圓級引擎技術則提供超快速、超低延遲的 Token 生成能力。兩大運算引擎結合,預計可提供高達 5 倍的每瓦每秒 Token 數(T/s/W)註1。
AI 推論工作負載在延遲、吞吐量、Token 容量、成本以及擴展規模方面的需求日益多元化。大量工作負載優先考量最大化 Token 生成量,而程式碼編寫、即時 Copilot、即時代理與代理式工作流程則需要更快的回應時間。這些差異正推動對異質基礎設施(Heterogeneous Infrastructure)的需求,使其能精準匹配運算技術與特定工作負載的需求。
AMD 與 Cerebras Systems 的解決方案透過解構式推論(Disaggregated Inference)解決這項挑戰,並針對工作流程中的兩個主要階段進行最佳化。AMD Helios 以超高吞吐量處理提示詞與大型上下文視窗;Cerebras 晶圓級引擎則加速記憶體頻寬密集型的解碼階段,以超低延遲生成 Token。透過將這兩項頂尖引擎整合於單一工作流程中,雙方打造出具差異化優勢的超低延遲推論平台,且無須犧牲吞吐量或擴展規模。
AMD 董事長暨執行長蘇姿丰博士表示:「AI 推論正成為 AI 領域中最大的基礎設施發展機會之一,而其日益增長的多樣性需要更具彈性的方案。AMD Helios 為最廣泛的推論工作負載提供領先業界的效能與擴展規模。透過與 Cerebras 合作,我們正將這項領先優勢延伸至對延遲極為敏感的應用領域,並為即時代理式 AI 打造強大的全新平台。」
Cerebras Systems 執行長暨共同創辦人 Andrew Feldman 表示:「超高速推論的需求正以前所未有的速度快速成長。Cerebras提供全球最快速的超低延遲推論能力。與 AMD 合作,讓我們有絕佳機會將這項效能帶給更多客戶。」
隨著 AI 邁向軟體開發、自主代理、機器人技術、科學發現等回應時間直接影響使用者體驗與系統實用性的應用領域,快速的 Token 生成變得越來越重要。這項聯合解決方案整合了專為這些需求打造的互補架構。
AMD Helios 提供處理大量複雜請求所需的高吞吐量的提示詞引擎、機櫃級效率與部署規模,Cerebras 晶圓級引擎技術則提供即時傳回 Token 所需的超低延遲效能。其成果是專為推論市場中超低延遲領域所設計的解決方案,並以 AMD Helios 作為整個資料中心高吞吐量與平衡推論工作負載的基礎。
Cerebras Systems 計劃在其資料中心部署 AMD Helios 系統,聯合解決方案預計將於 2026 年下半年率先透過 Cerebras Cloud 提供。
註1:根據AMD效能實驗室(AMD Performance Labs)與Cerebras於2026年7月進行的模型推算,在相近的互動性基準(Interactivity Point)下,以Kimi 2.6 1T模型針對結合Cerebras WSE的AMD Helios機櫃級(Rack-scale)解決方案與僅採用Cerebras WSE的配置進行每千瓦每秒Token數(TPS/kW)比較。系統製造商可能會調整配置,進而產生不同的測試結果。MI400-021。
更多COMPUTEX 2026最新資訊就在 ioioTIME 專區中
現在就加入 ioioTIMES 臉書粉絲團 更多互動、更多好康攏抵加!!
我們有LINE TODAY頻道了,快來追踪我們吧!!--最新科技新聞 盡在你手