NVIDIA Cosmos 3 Edge: локальная модель мира для роботов

NVIDIA выпустила 4B-модель Cosmos 3 Edge для локального вывода на Jetson и RTX. Проверяем обещанные 15 Гц и границы практического применения.

Официальная страница релиза NVIDIA Cosmos 3 Edge на Hugging Face
Страница релиза NVIDIA Cosmos 3 Edge на Hugging Face. Скриншот Toolarium, 20 июля 2026 года.

По состоянию на 20 июля 2026 года NVIDIA Cosmos 3 Edge — открытая 4B-модель мира для физического ИИ, доступная на Hugging Face. Она обрабатывает сцену, прогнозирует её изменение и может генерировать действия робота на поддерживаемом периферийном GPU. Готового универсального автопилота в комплекте нет: разработчику всё равно нужны данные своего робота, дообучение и проверка безопасности.

Главная ценность релиза в размере. Ранее семейство Cosmos 3 начиналось с Nano на 16 млрд параметров и Super на 64 млрд. Версия Edge уменьшает порог для локального запуска, но рекламные 15 Гц достигаются не на любом Jetson. Подробная карточка модели показывает, где именно проходит эта граница.

Что NVIDIA выпустила 20 июля

NVIDIA анонсировала Cosmos 3 Edge 15 июля, а 20 июля опубликовала веса, карточку модели и материалы на Hugging Face и GitHub. Базовая модель содержит 4 млрд обучаемых параметров. Рядом вышла Cosmos 3 Edge Policy DROID, специализированная политика манипуляции для платформы DROID.

Вариант Параметры Основная задача Целевой вычислительный контур
Cosmos 3 Edge 4 млрд Понимание сцены, прогноз, генерация видео и действий RTX, GeForce RTX, DGX и Jetson; конкретная скорость зависит от режима и устройства
Edge Policy DROID 4 млрд Траектории действий для манипулятора DROID Сервер политики на поддерживаемом GPU, включая измеренные конфигурации Jetson Thor
Cosmos 3 Nano 16 млрд Универсальная мультимодальная модель семейства Рабочая станция уровня RTX PRO 6000
Cosmos 3 Super 64 млрд Масштабная генерация синтетических данных и исследования GPU архитектур Hopper и Blackwell

Все четыре строки относятся к одной архитектурной семье, но решают задачи разного масштаба. Edge интересна именно как компактная основа для локальной специализированной политики. Сравнивать её с Super только по числу параметров бессмысленно: у моделей разные сценарии развёртывания.

Как модель связывает восприятие, прогноз и действие

Модель мира учится представлять объекты, движение, пространственные связи и последствия действий. Для робота одного распознавания банана на столе мало. Системе нужно оценить положение захвата, предсказать контакт с предметом и выбрать движение, которое доведёт предмет до тарелки.

Cosmos 3 использует архитектуру Mixture-of-Transformers с двумя башнями. Авторегрессионная часть работает с визуальными и текстовыми токенами, отвечает за понимание и рассуждение. Диффузионная часть генерирует непрерывные мультимодальные данные: видео, звук и действия. Общий механизм внимания связывает их в одном представлении сцены.

Архитектура NVIDIA Cosmos 3 Edge с авторегрессионной и диффузионной башнями и общим механизмом внимания
Авторегрессионная башня отвечает за понимание, диффузионная — за генерацию видео и действий; внимание между ними общее. Источник: NVIDIA и Hugging Face.

Для политики робототехники эта связка позволяет предсказывать действие вместе с ожидаемым визуальным результатом. Подробный разбор того, как World Action Models связывают прогноз и действие робота, помогает отделить такую модель от обычного распознавания объектов.

15 Гц на Jetson Thor: что показали измерения

Короткий анонс Hugging Face формулирует результат широко: наблюдения 640 × 360, 32 действия за один вывод и управление на 15 Гц на NVIDIA Jetson Thor. В обновлённой карточке Policy DROID условия описаны точнее. Тест PyTorch использовал наблюдение 640 × 540 с переводом в вычислительный формат 544 × 736, четыре шага диффузии и блок из 32 действий.

На частоте 15 Гц бюджет для такого блока равен 2,133 секунды. Jetson AGX Thor T5000 показал медиану 1,528 секунды и уложился в бюджет. T4000 получил 2,208 секунды, а T3000 — 2,632 секунды; обе конфигурации выдержали 5 Гц, но не 15 Гц. T2000 также не прошёл порог 15 Гц.

Заявление Подтверждённый контекст Чего оно не доказывает
32 действия и управление на 15 Гц Режим Policy DROID; подробный тест проходит 15 Гц на AGX Thor T5000 Что любой Jetson Thor или любая политика даст ту же частоту
Первое место на VANTAGE-Bench Заявление NVIDIA/Hugging Face для моделей сопоставимого размера, 4 млрд параметров Лидерство в независимых производственных испытаниях роботов
Адаптация примерно за день Оценка NVIDIA для настройки под конкретного робота, сенсоры и среду; блог указывает небольшую группу H100 или DGX Station Бесплатное дообучение на слабом периферийном устройстве
Открытая модель Веса и рецепты опубликованы по лицензии OpenMDW 1.1 для коммерческого и некоммерческого использования Что лицензия относится к обычным OSI-лицензиям открытого ПО

Такое чтение результатов полезнее единственной цифры в заголовке. NVIDIA действительно перенесла 4B-политику на Jetson, но частота управления зависит от модуля, памяти, рантайма, разрешения и числа шагов диффузии.

Policy DROID показывает сценарий адаптации

Cosmos 3 Edge Policy DROID дообучена на данных одноимённой робототехнической платформы. Она получает языковую инструкцию и визуальное наблюдение, затем возвращает траекторию управления манипулятором. В демонстрации робот берёт банан и переносит его на тарелку.

Манипулятор DROID захватывает банан в демонстрации NVIDIA Cosmos 3 Edge Policy
Кадр официальной демонстрации Policy DROID: манипулятор выполняет задачу с бананом и тарелкой. Источник: NVIDIA и Hugging Face.

Этот checkpoint служит примером, а не каталогом готовых навыков. Для другого манипулятора меняются камеры, кинематика, формат действий и рабочая среда. Нужны собственные данные и повторное дообучение. Похожий контур с политиками и моделями оценки развивается в world-model policies в LeRobot.

Локальный запуск не отменяет дорогого дообучения

Слово «локальный» относится прежде всего к выводу модели рядом с сенсорами. Блог Hugging Face рекомендует небольшую группу H100 или DGX Station для дообучения под целевую задачу. После этого checkpoint можно переносить на поддерживаемые RTX, DGX и Jetson.

У текущего релиза есть и программные ограничения. Карточка модели подтверждает Linux и протестированный формат BF16; FP4, FP8 и FP16 официально не поддержаны. Интеграция потребует сервера политики, клиента для управления роботом, преобразования сенсорных данных и проверки задержек на конкретном устройстве.

NVIDIA Cosmos 3 Edge не сможет управлять произвольным роботом сразу после скачивания. Работа без облачного запроса возможна на поддерживаемом GPU, но сенсоры, кинематика и задача должны совпадать с обучением или пройти адаптацию. Контур безопасности остаётся внешней обязанностью разработчика.

Физическая правдоподобность остаётся слабым местом

Карточка модели прямо предупреждает о нестабильном движении объектов, неточных взаимодействиях и дрейфе состояния. Внутри нет явного физического симулятора, поэтому геометрия, контактная динамика и постоянство объектов лишь приближаются статистической моделью. За пределами обучающего распределения качество падает сильнее.

Выводы Cosmos 3 нельзя считать физически точной симуляцией или сертифицированным решением для управления. Для роботов и автономных систем NVIDIA требует дополнительной проверки, внешних ограничений, системного анализа безопасности и доменных защитных механизмов.

Релиз сокращает размер модели, которую можно поставить рядом с роботом, но не сокращает инженерную работу до одной команды запуска. Практический выигрыш получат команды, у которых уже есть данные, стенд валидации и понятный контур управления. Для остальных Edge остаётся хорошей основой для эксперимента, а не готовой системой.

Источники и дата проверки

Факты, характеристики и ограничения проверены 20 июля 2026 года. Цифры производительности быстро меняются вместе с карточками модели и рантаймами, поэтому в тексте сохранён контекст каждого измерения.

Telegram-канал @toolarium