adblock check

Сбер представил Kandinsky WM 1.0 — ИИ для генерации реалистичных видео с учётом физики

Модели Kandinsky WM 1.0 способны создавать реалистичные видеосцены для обучения роботов, беспилотников и других так называемых систем физического ИИ
Обложка: пресс-служба Сбера

Сбер объявил о выпуске семейства генеративных моделей Kandinsky WM 1.0, предназначенных для создания видеороликов, которые максимально соответствуют законам физики. Основная задача перед разработчиками стояла в том, чтобы создать нейросеть, способную формировать синтетические данные, которые можно использовать при обучении систем класса Physical AI, включая роботов и различные автономные устройства. Исходный код и веса моделей опубликованы на платформе Hugging Face под лицензией MIT — разработчики, а также исследовательские компании могут использовать их бесплатно.

Направление Physical AI (физический ИИ) ориентировано на работу с физическим миром, поэтому такие системы должны не только анализировать окружающую среду, но и понимать происходящие процессы и прогнозировать развитие событий. В отличие от крупных языковых моделей, для обучения подобных систем не хватает открытых данных, а для создания такого материала требуются дорогостоящее оборудование, ресурсы, люди и подходящие условия. Современным моделям нужны миллионы часов обучающих данных, при этом многие моменты (опасные, экстремальные) невозможно воспроизвести в реальных условиях. Именно поэтому генерация реалистичных синтетических видеоданных становится одним из наиболее перспективных способов ускорить развитие Physical AI.

В основе моделей Kandinsky WM 1.0 лежит модель Kandinsky 5.0 Video Lite, которая была дополнительно обучена на нескольких миллионах реальных видеозаписей, полученных с камер роботов и беспилотных автомобилей. Сюда также добавили записи различных производственных процессов и сложных механических взаимодействий. Для решения проблем с нарушением базовых законов физики разработчики использовали дополнительное обучение на специализированных данных. На текущий момент модели семейства Kandinsky WM 1.0 могут генерировать видео продолжительностью 5 секунд, каждое из них представляет отдельное действие или ситуацию, например, действия с предметами, дорожные манёвры, производственные процессы и прочее. Именно такие небольшие фрагменты становятся базовыми элементами для последующего обучения автономных систем.

По словам разработчиков, Kandinsky WM 1.0 является первым шагом к созданию полноценных моделей мира — нейросетей, способных не только генерировать видео, но и прогнозировать развитие событий во времени, создавая виртуальную среду для тестирования и обучения роботов. В Сбере сообщили, что Kandinsky WM уже используются в собственном Центре робототехники при обучении роботизированных систем. Кроме того, модели используются специалистами института AIRI, где они помогают создавать синтетические дорожные сценарии для симуляторов беспилотного транспорта.

Svidetel Автор
ИИ ИИ
17,8K участников
Вступить
Комментариев пока нет
Оставьте комментарий...
Оставьте комментарий...