NVIDIA Groq 3 LPX 與 Vera Rubin NVL72 平台協同設計,協助人工智慧(AI)工廠以最低延遲為代理型工作負載生成詞元。
代理型 AI 正帶來一項新的效能挑戰:解碼延遲(decode latency)。當 AI 代理進行推理、使用工具並與其他系統互動時,它們會以逐個詞元的方式產生回應,因此即使是極微小的延遲,也會在複雜的工作鏈中不斷累積。為了讓代理能以使用者所期待的速度維持運作,NVIDIA Groq 3 LPX 為 Vera Rubin NVL72 平台加入專門針對詞元生成的加速能力。
NVIDIA Rubin GPU 負責處理大規模情境,LPX 則加速對延遲高度敏感的解碼工作負載。如此一來,可實現更快速且更可預測的詞元生成,有助於 AI 工廠實現反應更即時的推理、更流暢的代理互動,以及更高的基礎設施效率。
Rubin GPU 與 LPU 協同運作,旨在消除速度與輸送量之間的傳統取捨,協助 AI 供應商為下一代代理型應用提供反應靈敏且大規模的推論能力。
打造詞元工廠
隨著產業從模型訓練轉向大規模提供智慧服務,基礎設施也必須演進成 NVIDIA 所稱的「詞元工廠(token factory)」,同時兼顧效能、輸送量、智慧完整性與經濟效益。代理型 AI 系統日益需要與其他 AI 系統進行通訊、存取多重資料來源並維持大量情境,使市場對快速推論的需求達到前所未有的程度。
NVIDIA Groq 3 LPX 正是針對這類工作負載而設計。作為 Vera Rubin NVL72 的延伸,它即使面對龐大的情境視窗,仍可提供超高速回應,同時協助服務供應商最大化輸送量與基礎設施使用率。
用於推論的極致協同設計
有別於獨立加速器,NVIDIA Groq 3 LPX 透過極致協同設計,結合 GPU 與 LPU 的優勢。Rubin GPU 與 LPU 共同運算 AI 模型的每一層,為代理型工作負載帶來全新層級的推論效能。
在大規模部署下,LPU 叢集可如同一個針對確定性推論最佳化的巨型處理器運作。一套機架級的 NVIDIA Groq 3 LPX 部署可包含 256 個 LP30 加速器,並透過晶片對晶片直接互連,從而形成專為現代 AI 工廠打造的高效推論引擎。
專為代理型AI時代打造
隨著推理模型不斷擴展,代理型工作流程生成的詞元愈來愈多,支援這些需求的基礎設施必須隨之演進。NVIDIA Groq 3 LPX 為 Vera Rubin NVL72 平台加入專為推論打造的架構,旨在最大化回應速度、輸送量與效率,協助驅動下一代 AI 工廠。
而這只是開始。搭配 Vera Rubin NVL72 使用,NVIDIA Groq 3 LPX 未來將帶來更多最佳化、支援更多模型並實現更高效能,全新層級的輸送量與互動體驗即將到來,敬請期待。
更多COMPUTEX 2026最新資訊就在 ioioTIME 專區中
現在就加入 ioioTIMES 臉書粉絲團 更多互動、更多好康攏抵加!!
我們有LINE TODAY頻道了,快來追踪我們吧!!--最新科技新聞 盡在你手
















