Нейросеть Kandinsky будет создавать видео для обучения роботов

Фото: Perplexity
Фото: Perplexity
Новые генеративные модели создают физически достоверные видео и помогают обучать беспилотники и роботов там, где реальные данные получить сложно или невозможно

Что случилось

  • «Сбер» представил семейство генеративных моделей Kandinsky WM 1.0. Они способны создавать короткие видео, соответствующие базовым законам физики и пригодные для обучения систем Physical AI. В основе лежит нейросеть Kandinsky 5.0 Video Lite, дополнительно обученная на реальных видео с камер роботов, беспилотных автомобилей и записях промышленных процессов.
  • Модели генерируют ролики длительностью пять секунд и отражают отдельные действия и ситуации. Например, взять и положить предмет или проехать перекресток. Видео используются для обучения автономных систем и алгоритмов компьютерного зрения.
  • «Это шаг к моделям мира — системам, которые понимают физическую реальность, предсказывают, что произойдет дальше, и могут действовать в ней самостоятельно», — подчеркнул CTO Kandinsky, управляющий директор по исследованию данных «Сбера» Денис Димитров.
  • Особая ценность разработки — возможность синтезировать редкие, опасные или трудно воспроизводимые сценарии: ДТП, экстремальные погодные условия, отказы оборудования. В реальности такие данные либо отсутствуют, либо крайне дороги в сборе.
  • Код и веса Kandinsky WM 1.0 опубликованы в открытом доступе под лицензией MIT и доступны разработчикам по всему миру бесплатно, что снижает барьеры входа для стартапов и исследовательских команд.
  • Модели уже применяются в Центре робототехники «Сбера». Институт AIRI использует их в собственном дорожном симуляторе.

Фото:Freepik
Индустрия 4.0 Когда компьютер будет понимать как человек: революция моделей мира в ИИ

Что это значит

  • Physical AI — направление искусственного интеллекта, ориентированное на понимание физического мира и управление реальными устройствами. В отличие от языковых моделей, такие системы требуют огромных объемов видеоданных, которые сложно и дорого собирать.
  • Синтетические данные становятся ключевым инструментом для закрытия дефицита обучающих выборок. Один автомобиль с камерами и датчиками генерирует около 5 тыс. часов видео в год, тогда как для обучения современных моделей требуются миллионы часов.
  • Дообучение Kandinsky на миллионах реальных видеосцен и применение обучения с подкреплением позволили повысить физическую достоверность генерации. Модели лучше сохраняют геометрию объектов, перспективу и естественность движения.
  • Такие системы рассматриваются как шаг к моделям ИИ, способным предсказывать развитие событий и использовать это для управления роботами в реальной среде.
  • Технология может ускорить развитие беспилотного транспорта, промышленной автоматизации и робототехники, а также снизить затраты на разработку за счет замены части реальных испытаний виртуальными.

➤ Подписывайтесь на телеграм-канал «РБК Трендов» — будьте в курсе последних тенденций в науке, бизнесе, обществе и технологиях.

Обновлено 04.08.2026
Авторы
Теги
Анастасия Гринева
Главная Лента Подписаться Поделиться
Закрыть