事件總覽:Google DeepMind 推出 Gemini Robotics ER 2,標誌著機器人在真實物理世界中的應用進入新階段,從停頓思考到即時反應的轉變。
📅 2023年10月:Gemini Robotics ER 2 正式亮相
在此之前,機器人在執行任務時經常需要停頓來進行思考,這大大限制了其應用範圍。Google DeepMind 推出的 Gemini Robotics ER 2,旨在打破這一局限。這款「具身推理」(embodied reasoning)模型不僅具備升級的空間與影片理解能力,還主打即時決策與多機器人協作,為實體 AI 的應用開創新篇章。
📅 2023年11月:Gemini Robotics ER 2 的高階大腦功能
隨後,Google DeepMind 將 Gemini Robotics ER 2 定位為機器人的「高階大腦」,專門負責對話、理解物理世界以及規劃多步驟任務,而低階的動作執行則交由視覺-語言-動作(VLA)模型處理。新一代模型整合了 Gemini Live API,透過雙向串流端點大幅降低延遲,使機器人在執行動作的同時能夠同步進行思考。
📅 2023年12月:展示 Gemini Robotics ER 2 的實用性
這直接導致了機器人在實際應用中的突破。Google DeepMind 與波士頓動力(Boston Dynamics)合作,通過 Spot APIs 指揮 Spot 機器人執行拿取爆米花等互動任務,展示了 Gemini Robotics ER 2 的高效能。此外,Gemini Robotics ER 2 在影片理解與進度追蹤上有顯著躍升,帶來兩大核心能力:連續進度分類和精准時刻尋找。
📅 2024年1月:多機協作與安全機制
單一機器人難以應付所有環境需求,因此 Gemini Robotics ER 2 支援多機器人協作,讓不同型態的機器人(如輪式機器人與雙足人形機器人)通過共用的語意理解來互相交接並完成複雜任務。此外,新模型在「安全指令遵循」與「人類鄰近度」評測中表現優異,當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
至今影響與未來展望
Gemini Robotics ER 2 已透過 Gemini API 與 Google AI Studio 向開發者全面開放,並在 Gemini Enterprise Agent Platform 提供私人預覽。這標誌著機器人在真實物理世界中的應用進入了一個全新的時代,未來有望在更多領域實現智能化和自主化。
從產業面來看,Gemini Robotics ER 2 的推出不僅提升了機器人的智能化水平,更為多機協作和安全應用開創了新的可能性。這將對製造業、醫療保健、物流等多個領域產生深遠影響,推動這些行業的技術進步和效率提升。
如果你對這項技術感興趣,不妨進一步了解 Gemini Robotics ER 2 的應用案例,思考它如何改變你的工作和生活。未來,機器人將不再是簡單的工具,而是成為人類的智能夥伴。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Gemini Robotics ER 2 是什麼?
Gemini Robotics ER 2 是 Google DeepMind 推出的一款「具身推理」模型,旨在提升機器人在真實物理世界中的應用能力,特別是即時決策和多機器人協作。
Gemini Robotics ER 2 有哪些核心能力?
Gemini Robotics ER 2 具備連續進度分類和精准時刻尋找兩大核心能力,能夠即時分析影片畫面並精確鎖定關鍵事件發生的影格。
Gemini Robotics ER 2 如何提高安全性?
Gemini Robotics ER 2 在「安全指令遵循」和「人類鄰近度」評測中表現優異,當偵測到人類靠近時,機器人會自動暫停,並在區域安全後自動恢復作業。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。