谷歌发布Gemini Robotics 2:VLA模型实现人形机器人全身控制,200个示例即可适配新本体
谷歌发布Gemini Robotics 2:VLA模型实现人形机器人全身控制,200个示例即可适配新本体
谷歌DeepMind发布Gemini Robotics 2,VLA视觉-语言-动作模型实现人形机器人从脚到指尖的全身移动与精细操作,仅需200个示例即可适配新机器人本体,支持多机器人协作。
8月3日消息,谷歌DeepMind正式发布Gemini Robotics 2,其VLA(视觉-语言-动作)模型实现了人形机器人从脚到指尖的全身移动与精细操作控制,标志着具身智能领域迎来重要突破。
此次发布同步推出三款模型:负责全身控制的VLA主模型、负责高级推理规划的ER 2,以及可端侧部署的On-Device 2。其中端侧模型仅需200个示例即可适配新机器人本体,大幅降低了机器人技能迁移的成本。
Gemini Robotics 2核心亮点:
- 全身控制:VLA模型实现人形机器人从脚部运动到指尖精细操作的全身协调控制
- 快速适配:On-Device 2仅需200个示例即可迁移至新机器人本体,无需大规模重新训练
- 多硬件兼容:可迁移至Apollo、Franka等多种机器人硬件平台
- 多机协作:支持多个机器人协同完成长序列复杂任务
- 端侧部署:On-Device版本可在机器人本地运行,降低延迟并提升隐私性
同期,阿尔特联合富士康在2026年ESCC具身智能供应链生态大会上发布机器人"交钥匙"全栈平台。行业普遍认为2026年是具身智能量产元年,国内人形机器人整机产量有望突破10万台。
但行业也面临挑战:上半年1041亿元融资中超半数涌向"大脑派"VLA模型,软件能力发展速度落后于硬件量产节奏,存在"身体等大脑"的现象。
Gemini Robotics 2的"200示例适配新本体"是关键指标——如果这一能力在非实验室环境中得到验证,意味着机器人技能迁移的成本正从"重新训练"降至"少量示范",这正是量产落地的核心瓶颈。谷歌选择专注于模型研发而非机器人本体制造,与阿尔特-富士康的量产平台形成产业互补。当模型能力与量产平台同时成熟,具身智能的商业化拐点才算真正到来。