Google DeepMind представила семейство моделей Gemini Robotics 2 для полноценного управления гуманоидами
Лаборатория Google DeepMind анонсировала линейку ИИ-моделей Gemini Robotics 2, которая обеспечивает роботам полноценное управление всем телом — от ступней до кончиков пальцев. Предыдущая версия системы контролировала преимущественно верхнюю часть корпуса, тогда как новая архитектура позволяет гуманоидам ходить, приседать, наклоняться, удерживать баланс и выполнять деликатные манипуляции. В демонстрационном ролике компания показала робота Apollo 2 от Apptronik, который поднимает лейку с пола, находит и снимает предметы с полки, а также выполняет тонкие операции вроде вкручивания лампочки и завязывания узлов. 
Три уровня архитектуры: управление, рассуждение, локальное выполнение
Семейство Gemini Robotics 2 включает три модели, каждая из которых решает свою задачу. Базовая Gemini Robotics 2 отвечает за низкоуровневый моторный контроль и координацию десятков суставов гуманоида. Модуль Gemini Robotics ER 2 (Embodied Reasoning) выступает «высокоуровневым мозгом»: он обрабатывает непрерывные потоки видео, текста и аудио, разбивает сложные задания на этапы, отслеживает прогресс в реальном времени и умеет «думать» о следующем шаге параллельно с выполнением текущего действия. Третья модель — Gemini Robotics On-Device 2 — рассчитана на автономную работу непосредственно на «железе» робота без постоянной привязки к облаку. По словам разработчиков, облегчённая версия адаптируется к новой конструкции двурукого робота за пару часов обучения на менее чем 200 примерах.
Gemini Robotics ER 2: планирование, контекст и работа с инструментами
ER 2 позиционируется как наиболее продвинутое embodied reasoning-решение Google DeepMind. По сравнению с версией ER 1.6 модель лучше классифицирует прогресс задачи (progress classification) и находит ключевые моменты в видеопотоке (moment finding) — то есть понимает, когда этап выполнен и какое событие в кадре имеет решающее значение. Система интегрируется в потоковую архитектуру Gemini Live API для задач с низкой задержкой, использует инструменты вроде Google Search и пользовательские функции, а также умеет объяснять свои действия во время выполнения. Модель уже доступна через Gemini API и Google AI Studio, в Gemini Enterprise Agent Platform открыта в приватном превью. 
Командная работа нескольких роботов и безопасность
Ключевая новинка ER 2 — поддержка multi-robot collaboration. Разные устройства могут обмениваться семантическим контекстом, распределять обязанности и совместно решать многошаговые задачи. В одном из примеров робот Apollo 2 координирует действия двурукого робота Google при уборке гаража; в других демонстрациях задействованы платформы Boston Dynamics Spot и манипуляторы Franka. Отдельный акцент сделан на безопасности: ER 2 улучшает механизмы Human Proximity — робот мгновенно останавливается, если рядом появляется человек, и возобновляет работу только когда зона снова становится безопасной. «Наша цель — перенести ИИ в физический мир и затем создать интеллектуальный слой, который сможет использоваться каждым роботом», — подчеркнула вице-президент по робототехнике Google DeepMind Каролина Парада. 
Инструменты для разработчиков и текущие ограничения
В репозитории на GitHub опубликованы стартовые примеры для разработчиков, желающих опробовать модели в своих сценариях. Стек Google постепенно приобретает черты классического агентского воркфлоу: высокоуровневый планировщик (ER 2), набор инструментов, потоковый ввод данных и отдельный слой исполнения (VLA-модели и специализированные контроллеры). При этом компания честно указывает на существующие ограничения: модели ещё предстоит улучшить устойчивость к незнакомым ситуациям и работу с роботами, обладающими высокой степенью свободы движений. Скорость движений гуманоидов также остаётся ниже человеческой, однако в Google DeepMind называют текущий релиз «важным шагом к обретению навыков, необходимых для выполнения более сложных задач в реальных условиях».