Сбер объявил о выпуске семейства генеративных моделей Kandinsky WM 1.0, предназначенных для создания видеороликов, которые максимально соответствуют законам физики. Основная задача перед разработчиками стояла в том, чтобы создать нейросеть, способную формировать синтетические данные, которые можно использовать при обучении систем класса Physical AI, включая роботов и различные автономные устройства. Исходный код и веса моделей опубликованы на платформе Hugging Face под лицензией MIT — разработчики, а также исследовательские компании могут использовать их бесплатно.
Направление Physical AI (физический ИИ) ориентировано на работу с физическим миром, поэтому такие системы должны не только анализировать окружающую среду, но и понимать происходящие процессы и прогнозировать развитие событий. В отличие от крупных языковых моделей, для обучения подобных систем не хватает открытых данных, а для создания такого материала требуются дорогостоящее оборудование, ресурсы, люди и подходящие условия. Современным моделям нужны миллионы часов обучающих данных, при этом многие моменты (опасные, экстремальные) невозможно воспроизвести в реальных условиях. Именно поэтому генерация реалистичных синтетических видеоданных становится одним из наиболее перспективных способов ускорить развитие Physical AI.
В основе моделей Kandinsky WM 1.0 лежит модель Kandinsky 5.0 Video Lite, которая была дополнительно обучена на нескольких миллионах реальных видеозаписей, полученных с камер роботов и беспилотных автомобилей. Сюда также добавили записи различных производственных процессов и сложных механических взаимодействий. Для решения проблем с нарушением базовых законов физики разработчики использовали дополнительное обучение на специализированных данных. На текущий момент модели семейства Kandinsky WM 1.0 могут генерировать видео продолжительностью 5 секунд, каждое из них представляет отдельное действие или ситуацию, например, действия с предметами, дорожные манёвры, производственные процессы и прочее. Именно такие небольшие фрагменты становятся базовыми элементами для последующего обучения автономных систем.
По словам разработчиков, Kandinsky WM 1.0 является первым шагом к созданию полноценных моделей мира — нейросетей, способных не только генерировать видео, но и прогнозировать развитие событий во времени, создавая виртуальную среду для тестирования и обучения роботов. В Сбере сообщили, что Kandinsky WM уже используются в собственном Центре робототехники при обучении роботизированных систем. Кроме того, модели используются специалистами института AIRI, где они помогают создавать синтетические дорожные сценарии для симуляторов беспилотного транспорта.