Компания DeepSeek представила экспериментальную мультимодальную ИИ-модель DeepSeek-V4-Flash-Vision-Exp, способную понимать не только текстовые, но и визуальные запросы. Разработчики заявляют, что в тестовых задачах новая модель приближается к Opus 4.8 компании Anthropic, а в некоторых моментах даже превосходит её. V4-Flash-Vision-Exp основана на флагманской модели V4 Flash, которая изначально могла работать только с текстом. Новая версия получила возможности, благодаря которым умеет анализировать изображения, скриншоты и другой визуальный контент, а также выполнять различные действия на основе анализа информации без постоянного контроля со стороны человека.
V4-Flash-Vision-Exp сохраняет уровень V4-Flash при работе с текстом, обеспечивая аналогичный уровень возможностей в таких направлениях, как агентные сценарии, рассуждения и работа с общеизвестной информацией. При этом основной прирост производительности приходится именно на мультимодальные задачи. Такие задачи являются одним из ключевых направлений развития современных ИИ-агентов, которые должны самостоятельно проходить через несколько последовательных этапов.
DeepSeek заявляет, что изображения в API тарифицируются по модели V4-Flash, но каждое изображение учитывается максимально до 384 токена. Модель поддерживает комбинированные запросы, в которых одновременно содержатся текст и визуальный контент. Это позволяет использовать V4-Flash-Vision-Exp в приложениях, где ИИ должен понимать разный контекст.
Экспериментальная модель DeepSeek-V4-Flash-Vision-Exp на текущий момент ориентирована прежде всего на разработчиков, а доступ к ней можно получить пока только через API DeepSeek. При успешном тестировании мультимодальные функции могут стать частью будущих моделей DeepSeek.
