Gemini Robotics ER 2代表著在賦予機器人視訊理解、任務編排和多機器人協作能力方面取得的重大變革——使機器人能夠在物理世界中發揮更大的作用
要讓機器人在日常環境中協助人類,光是具備精確的空間推理能力是不夠的。機器人還必須快速思考,使其決策和推理的速度與現實世界的即時速度保持一致。
因此,今天我們正式發布 Gemini Robotics ER 2,這是我們目前功能最強大的「具身推理」機器人模型。您可以將 Gemini Robotics ER 2 理解為機器人的高階大腦。它使機器人能夠與人類溝通、理解物理世界並規劃多步驟任務。之後,它會將運動執行交給任何指定的低階視覺-語言-動作 (VLA) 模型。 Gemini Robotics ER 2 還可以原生呼叫 Google 搜尋等工具來尋找訊息,或執行任何其他使用者自訂功能。 Gemini Robotics ER 2 的設計使其能夠在執行動作的同時「思考」下一步該做什麼。
Gemini Robotics ER 2 相較於 Gemini Robotics ER 1.6 實現了顯著升級。透過持續觀看視頻,機器人現在可以追蹤自身的運行進度,在出現問題時進行調整,並準確判斷何時進入下一步。此外,我們還引入了多機器人協作功能,使機器人能夠在共享空間中協同工作,完成單一機器人無法獨立完成的複雜工作流程。
Gemini Robotics ER 2 現已透過 Gemini API 和 Google AI Studio 向開發者公開開放,並在 Gemini 企業代理平台上提供私人預覽版。為了幫助您快速上手,我們分享了一些配置模型並使其能夠執行更實用的實體 AI 任務的範例。
提升物理代理能力
現實世界中的大多數任務都很複雜,需要多個步驟才能完成。 Gemini Robotics ER 2 是一款實體智能體,它能夠協調機器人執行各個步驟,使其能夠自我修正,並適應更多新的場景。為了建立智慧體系統,開發者可以將底層控制介面(例如視覺-語言-動作 (VLA) 模型或導航 API)聲明為工具,並將多模態視訊、音訊或文字直接傳輸到模型中。
Gemini Robotics ER 2 改進了這個工具編排工作流程。我們可以透過模擬環境評估其在機器人上的性能,也可以使用真實世界的機器人控制方法進行評估,甚至可以將其與遠端操控機器人的人員結合。
在機器人領域,高階推理取決於執行速度。 Gemini Robotics ER 2 整合到 Gemini Live API 中,使用針對延遲敏感型任務最佳化的雙向串流端點。結果是流暢的編排:Gemini Robotics ER 2 指揮動作模型和機器人 API 完成多步驟任務,避免了令人不適的「停下來思考」式停頓。為了展示這一點,我們使用來自合作夥伴 Boston Dynamics的 Spot 機器人建立了一個示範。
我們使用 Gemini Robotics ER 2 來編排 Spot API,例如導航和機械手臂運動,從而創建一個可以為您取物的互動式機器人。
Gemini Robotics ER 2 和 Boston Dynamic Spot 機器人能夠根據自然語言指示取來爆米花零食。程式碼和其他範例都可以在 Github上找到。
解鎖時間智能以實現穩健的任務完成
機器人技術面臨的最大挑戰之一是判斷任務何時完成。 Gemini Robotics ER 2 在視訊理解和進度追蹤方面實現了突破性進展,能夠驗證諸如擰緊燈泡或紮好垃圾袋等複雜任務是否已按規範完成,然後再切換到下一個任務。
在本次更新中,我們在理解任務進度的兩項基礎能力方面取得了進展:進度分類和關鍵時刻查找。
持續進展分類
進度分類是指機器人追蹤任務完成進度的能力。在我們的評估中,我們將視訊串流中的每一幀都分為五個進度等級(0-20%、20-40%、40-60%、60-80%、80-100%)。透過量化任務進度,Gemini Robotics ER 2 為機器人提供即時態勢感知能力,使其能夠動態調整操作或重試失敗的步驟,而無需重新啟動整個工作流程。
精確矩測量
關鍵時刻識別功能衡量模型識別關鍵事件發生的確切視訊畫面(例如,何時停止向杯子倒咖啡)的能力。 Gemini Robotics ER 2 在關鍵時刻辨識方面取得了顯著的效能提升,使機器人能夠精確地切換任務、驗證任務成功並提出修正建議。
多重機器人協作
沒有哪一款機器人能勝任所有任務——輪式漫遊車擅長室內作業,而人形機器人則可能在崎嶇地形上表現出色。 Gemini Robotics 2 支援多機器人協作,使不同的機器能夠透過共享的語義理解進行通信,從而交接並完成複雜的任務。
點擊此處了解 Gemini Robotics ER 2 如何協助 Apptronik 的 Apollo 2 和 Franka F3 Duo 合作。
提高一般空間智能
Gemini Robotics ER 2 提升了我們的核心空間推理能力,這體現在三個基準測試中:
- 成功/失敗檢測:現在使用原始視訊串流而不是靜態快照進行操作,以捕獲執行過程中的故障,例如溢出、滑移或錯位。
- 通用儀器讀數:不僅限於圓形刻度盤和視鏡,還包括數位顯示器、線性刻度、尺和液體溫度計。我們已在 10 種不同類型的儀器上進行了測試。
- 增強型空間 VQA:透過 Gemini 在多模態理解上的進步,改進視覺問答。
提升具身智能的安全保障
Gemini Robotics ER 2 是我們目前最安全的模型,在安全指令遵循和人機接近基準測試中取得了顯著進步。這些基準測試評估模型在推理任務中如何遵守物理約束以及空間感知能力(用於檢測人類)。我們發現,當有人靠近時,Gemini Robotics ER 2 能夠成功停止人形機器人的運行,並在區域無人後自主恢復工作。
為了進一步提升物理代理的安全性,我們引入了一項基準測試,該測試透過檢驗基礎模型執行安全約束、監控環境、評估物理可行性以及尋求人類澄清的能力,來評估其作為安全 VLA 協調器的能力。詳情請參閱我們的安全技術報告。
展望未來,我們的計劃是將這些模型推向更複雜的任務,以加速開發有用的機器人並支援機器人社群。
(作者:Steven Hansen、Peng Xu 資深軟體工程師)
更多COMPUTEX 2026最新資訊就在 ioioTIME 專區中
現在就加入 ioioTIMES 臉書粉絲團 更多互動、更多好康攏抵加!!
我們有LINE TODAY頻道了,快來追踪我們吧!!--最新科技新聞 盡在你手









