adblock check

DeepSeek представила мультимодальную модель V4-Flash-Vision-Exp — в тестах на уровне Opus 4.8

Модель сохранила возможности флагманской V4-Flash в работе с текстом, научилась анализировать изображения и выполнять мультимодальные агентские задачи
Обложка: Solen Feyissa, Unsplash

Компания DeepSeek представила экспериментальную мультимодальную ИИ-модель DeepSeek-V4-Flash-Vision-Exp, способную понимать не только текстовые, но и визуальные запросы. Разработчики заявляют, что в тестовых задачах новая модель приближается к Opus 4.8 компании Anthropic, а в некоторых моментах даже превосходит её. V4-Flash-Vision-Exp основана на флагманской модели V4 Flash, которая изначально могла работать только с текстом. Новая версия получила возможности, благодаря которым умеет анализировать изображения, скриншоты и другой визуальный контент, а также выполнять различные действия на основе анализа информации без постоянного контроля со стороны человека.

V4-Flash-Vision-Exp сохраняет уровень V4-Flash при работе с текстом, обеспечивая аналогичный уровень возможностей в таких направлениях, как агентные сценарии, рассуждения и работа с общеизвестной информацией. При этом основной прирост производительности приходится именно на мультимодальные задачи. Такие задачи являются одним из ключевых направлений развития современных ИИ-агентов, которые должны самостоятельно проходить через несколько последовательных этапов.

DeepSeek представила мультимодальную модель V4-Flash-Vision-Exp — в тестах на уровне Opus 4.8

DeepSeek заявляет, что изображения в API тарифицируются по модели V4-Flash, но каждое изображение учитывается максимально до 384 токена. Модель поддерживает комбинированные запросы, в которых одновременно содержатся текст и визуальный контент. Это позволяет использовать V4-Flash-Vision-Exp в приложениях, где ИИ должен понимать разный контекст.

Экспериментальная модель DeepSeek-V4-Flash-Vision-Exp на текущий момент ориентирована прежде всего на разработчиков, а доступ к ней можно получить пока только через API DeepSeek. При успешном тестировании мультимодальные функции могут стать частью будущих моделей DeepSeek.

Источник

Svidetel Автор
ИИ ИИ
18K участников
Вступить
Комментариев пока нет
Оставьте комментарий...
Оставьте комментарий...