下一個人工智慧(AI)推論時代,不會由單一突破性的晶片、網路或系統所定義,而是取決於 AI 工廠的每一層架構如何協同運作。正因如此,NVIDIA 正擴展 Vera Rubin NVL72,為代理型系統提供高速詞元生成能力。
NVIDIA 今日宣布,NVIDIA Vera Rubin 機架級系統 NVIDIA Groq 3 LPX,現已全面進入量產。在執行開源代理型模型 Gemma 4 31B 的 Artificial Analysis 基準測試中,NVIDIA Groq 3 LPX 針對代理型系統至關重要的 10 萬詞元長情境使用案例,每秒可輸出 3,400 個詞元,速度較最接近的替代平台快 4 倍。
全球產業合作夥伴正陸續採用 Vera Rubin 平台解決方案。SpaceXAI 宣布將採用 NVIDIA Vera CPU,驅動其下一代代理型 AI。CoreWeave 已在生產環境部署 Spectrum-X Multiplane,透過多組平行交換器連接 NVIDIA Vera Rubin 機架,打造高頻寬、扁平化且無損的 AI 網路。Nebius 則成為首家採用 NVIDIA Groq 3 LPX 的 AI 雲端。
隨著 AI 從訓練階段轉向推理與代理型應用,推論已成為新的技術前沿。代理型 AI 系統正生成更多詞元、處理規模大幅增加的情境視窗,並日益與其他 AI 系統協作以解決複雜問題。
這類工作負載需要新型的基礎設施,不僅針對效能進行最佳化,更須在前所未有的規模下兼顧資料輸送量、回應速度與經濟效益。
在本週於美國加州帕羅奧圖舉行的 Hot Chips 大會上,NVIDIA 將展示極致協同設計如何從端到端重塑 AI 工廠。透過將運算、網路與推論加速架構設計為單一系統,NVIDIA 協助客戶打造專為長情境推論與多代理系統等新興需求量身打造的基礎設施。
極致協同設計最佳化效能
極致協同設計是 NVIDIA 平台背後的核心設計原則。Vera Rubin 專為加速推論而打造,讓代理能針對日益增長的長序列進行推理。
NVIDIA Spectrum-X Ethernet 可在 AI 工廠間高效傳輸龐大的資料流,而 NVIDIA Groq 3 LPX 則專為超高速詞元生成而打造。兩者共同展現 NVIDIA 如何在單一、整合的 AI 工廠架構中,最佳化 AI 流程的每個階段,從情境處理、通訊到生成。
NVIDIA Groq 3 LPX 帶來全新的低延遲推論架構,可與最具靈活性的 AI 工廠平台 Vera Rubin NVL72 協同運作,協助企業與雲端服務供應商提供代理型應用所需的低延遲、極高輸送量與可擴展的經濟效益。
突破性的效能並非來自個別元件的獨立最佳化,而是源自對技術堆疊每一層的協同設計。從網路、情境處理到大規模推論,NVIDIA 全端平台將 AI 工廠轉變為整合式智慧引擎,讓持續增加的詞元產出轉化為營收。
NVIDIA合作夥伴採用Vera Rubin,實現最低詞元成本
領先的 AI 雲端服務供應商 Nebius 率先採用 NVIDIA Groq 3 LPX,讓開發者能運用業界領先的詞元生成速度,打造反應極為靈敏的代理型 AI 應用。
Nebius Token Factory 將 NVIDIA Groq 3 LPX 加入 NVIDIA Vera Rubin NVL72 後,可進一步提升推論效能,讓開發者能大規模打造高度互動的代理、程式設計系統及其他即時 AI 體驗。
CoreWeave 透過連接 NVIDIA Vera Rubin 機架,正在生產環境部署 Spectrum-X Multiplane,為其 AI 雲端基礎設施帶來突破性進展
SpaceXAI採用NVIDIA Vera CPU推動代理型AI
SpaceXAI 計畫以 NVIDIA Vera Rubin 為核心,建構並擴展其未來的 AI 架構,範圍從地球上的資料中心,一路延伸至軌道衛星。該公司計畫部署 NVIDIA Vera CPU,以加速代理型 AI 背後高度仰賴 CPU 的工作,包括協調管理、工具使用、程式碼執行、資料處理與模擬。
NVIDIA 與 SpaceXAI 的合作,將 NVIDIA 全端 AI 平台延伸至 SpaceXAI,整合 Vera CPU、NVIDIA 加速運算、網路與軟體,以前所未有的規模推動 AI 發展。
Vera Rubin 專為代理時代設計,具備業界領先的單核心效能、卓越的記憶體頻寬,以及在高負載下仍可預測的穩定效能,協助代理更快完成任務,同時讓高價值的 GPU 基礎設施維持充分利用。
更多COMPUTEX 2026最新資訊就在 ioioTIME 專區中
現在就加入 ioioTIMES 臉書粉絲團 更多互動、更多好康攏抵加!!
我們有LINE TODAY頻道了,快來追踪我們吧!!--最新科技新聞 盡在你手
















