Gemini Robotics ER 2: как Google разделила мозг и моторику
Google представила Gemini Robotics ER 2 — модель для планирования, контроля прогресса и совместной работы роботов. Моторы остаются за VLA.
Gemini Robotics ER 2 — высокоуровневая модель воплощённого рассуждения Google DeepMind: она планирует действия робота и следит за выполнением по видео, а моторное управление передаёт отдельной VLA-модели или API робота. Google представила модель 30 июля 2026 года и открыла доступ через Gemini API и Google AI Studio.
ER 2 связывает видео, диалог, многошаговый план, вызов инструментов и работу нескольких машин в одном управляющем контуре. Демонстрации и цифры пока принадлежат Google; независимой проверки в реальной эксплуатации на момент анонса нет.
Характеристики и доступность проверены 31 июля 2026 года.
Три Gemini Robotics 2 с разными задачами
Название семейства легко спутать с названием отдельной модели. На официальной странице Google разделяет три компонента. Они могут работать вместе, но отвечают за разные уровни управления.
| Компонент | Роль | Вход и выход | Чего не делает |
|---|---|---|---|
| Gemini Robotics ER 2 | Понимает сцену, строит многошаговый план, следит за прогрессом и вызывает инструменты. | Получает текст, изображения, видео и аудио; возвращает текстовые решения и вызовы функций. | Не преобразует план напрямую в команды моторам. |
| Gemini Robotics 2 | VLA-модель переводит зрительные и языковые команды в физические действия робота. | Получает зрительные и языковые данные; формирует моторное управление. | Не заменяет высокоуровневое планирование ER 2 во всех сценариях. |
| Gemini Robotics On-Device 2 | Облегчённая VLA-модель для локального запуска на роботизированном оборудовании. | Работает на устройстве и исполняет физические действия. | Не позиционируется как основной облачный слой сложного рассуждения. |
| Robotics API | Детерминированный инструмент для навигации, манипулятора или другого низкоуровневого действия. | Получает вызов функции от ER 2 и возвращает результат выполнения. | Сам по себе не понимает свободную речь и не строит длинный план. |
Схема напоминает связку планировщика и исполнителя в программном ИИ-агенте. Только здесь ошибка выходит за пределы экрана, поэтому разделение слоёв особенно важно. Разработчик может подключить к ER 2 VLA-модель или объявить обычные интерфейсы робота как инструменты.
Что изменилось после Gemini Robotics-ER 1.6
Предыдущее поколение Gemini Robotics-ER 1.6 уже давало разработчикам пространственное понимание и вызов функций. ER 2 добавляет непрерывное видео и отслеживание выполнения: модель классифицирует степень готовности шага, ищет точный момент события и решает, когда продолжать план или повторить действие.
Для управления инструментами Google подключила ER 2 к Gemini Live API с двусторонним потоковым обменом. Модель может обдумывать следующий шаг, пока робот выполняет текущий. В демонстрации с Boston Dynamics Spot она вызывает API навигации и манипулятора, чтобы по голосовой команде найти и принести предмет.

ER 2 также распределяет этапы одной задачи между разными машинами, опираясь на общее смысловое представление. В ролике Google гуманоид Apollo 2 и манипулятор Franka F3 Duo делят один рабочий процесс. Демонстрация показывает координацию заранее доступных навыков, но не доказывает универсальность роботов.
Что показывают внутренние тесты Google
Google опубликовала две числовые оценки понимания видео. Обе относятся к внутренним тестам компании, поэтому их нельзя переносить на произвольный завод, склад или домашнего робота.
| Задача | Результат ER 2 | Что измерялось | Оговорка |
|---|---|---|---|
| Классификация прогресса | 57,4% точности | Отнесение каждого кадра к одному из пяти диапазонов готовности: от 0–20% до 80–100%. | Внутренняя оценка Google DeepMind. |
| Поиск момента | 91,3% точности; средняя абсолютная ошибка 0,96 секунды | Поиск кадра, в котором наступило критическое событие, например чашка наполнилась кофе. | Внутренняя оценка Google DeepMind. |
| Скорость поиска момента | В 4 раза выше | Скорость исполнения относительно более крупных категорий моделей в тесте Google. | Google не приводит в тексте анонса независимое воспроизведение. |

57,4% выглядит скромно, но задача сложнее бинарного «готово или нет»: модели нужно оценить промежуточное состояние каждого кадра. Для реального оборудования важнее другое: неизвестно, как метрика поведёт себя при плохом свете, перекрытии камеры, нестандартном инструменте или поломке привода.
Где заканчивается анонс Google
WIRED описывает Gemini Robotics 2 как единую систему из модели зрения и языка и двух VLA-моделей. Физическим навыкам её обучали с помощью управления человеком, видеопримеров и симуляций. Издание подчёркивает ограничение: современные модели пока не выполняют широкий набор сложных задач без специального обучения.
Поэтому фраза Google о «мозге для роботов» полезна как объяснение архитектуры, но не как оценка готовности. ER 2 может выбрать следующий инструмент, проверить ход работы и передать действие другой машине. Она не добавит манипулятору отсутствующую механику и не научит VLA-модель неизвестному движению одним рассуждением.
Соседний подход — модели действий для роботов, которые прогнозируют последствия движения и формируют моторное поведение. ER 2 занимает уровень выше: она решает, какое действие нужно и когда считать его завершённым.
Безопасность остаётся отдельной инженерной задачей
Google показала, как ER 2 останавливает Apollo 2 при приближении человека и возобновляет работу после освобождения зоны. Но технический отчёт проводит чёткую границу: тесты оценивают семантическое рассуждение и координацию, а не функциональную безопасность всей системы.
Авторы не проверяли сертифицированные аппаратные компоненты, резервирование и гарантии реального времени. Карточка модели требует осторожности перед использованием в производственной, коммерческой или публичной среде и запрещает применять модель в критически важных для безопасности задачах, включая медицину и транспорт.
ER 2 может стать дополнительным уровнем контроля, но не заменяет аварийную кнопку, ограничение скорости и усилия, безопасные зоны, аппаратные блокировки и детерминированный контроллер. Генеративная модель не должна быть единственной системой, которая решает, когда остановить механизм.
Что доступно разработчикам
Модель уже доступна через Gemini API и Google AI Studio; в Gemini Enterprise Agent Platform она находится в закрытом предварительном доступе. Google также опубликовала примеры настройки и вызова инструментов.
Согласно карточке модели, ER 2 основана на Gemini 3.5 Flash. Она принимает текст, изображения, видео и аудио с возможностью чередования, поддерживает контекст до 128 тыс. токенов и выдаёт до 64 тыс. токенов текста. На выходе остаются решение и команда инструменту, а не поток низкоуровневых моторных сигналов.
Для эксперимента логично начинать с симуляции или ограниченного стенда: дать модели небольшой набор явно описанных инструментов, журналировать каждый вызов и оставить независимый низкоуровневый контур безопасности. Модели мира Google для роботов и симуляции полезны для расширения данных, но не заменяют проверку на конкретном оборудовании.
Короткие ответы
Что такое Gemini Robotics ER 2?
Это модель воплощённого рассуждения Google DeepMind для роботов. Она понимает видео, аудио и текст, строит многошаговый план, следит за выполнением и вызывает VLA-модели или robotics API.
Управляет ли ER 2 моторами робота напрямую?
Нет. Google прямо описывает ER 2 как высокоуровневый слой, который передаёт моторное исполнение VLA-модели или низкоуровневому API робота.
Чем ER 2 отличается от ER 1.6 и Gemini Robotics 2?
По сравнению с ER 1.6 новая модель работает с непрерывным видео, оценивает прогресс, ищет точный момент события и координирует несколько роботов. Gemini Robotics 2 — отдельная VLA-модель для моторных действий.
ER 2 делает архитектуру роботизированного агента понятнее: один слой наблюдает и планирует, другой исполняет физическое действие. Польза появится там, где интегратор уже располагает надёжными навыками робота, формальными ограничениями и независимой защитой. Без них хороший план останется текстом или превратится в опасную команду.
Источники
- анонс ER 2 от 30 июля 2026 года;
- официальная карточка модели ER 2;
- официальная страница семейства Gemini Robotics 2;
- технический отчёт Gemini Robotics 2: Safety Evaluations;
- независимый разбор WIRED от 30 июля 2026 года.