Компания AMD выпустила обновление Lemonade 11.8 — сервера для локального запуска больших языковых моделей с открытым исходным кодом. Ключевым нововведением стала экспериментальная интеграция бэкенда DwarfStar «ds4», который значительно упрощает запуск языковой модели DeepSeek V4 Flash на процессорах Ryzen AI Max семейства Strix Halo.
DeepSeek V4 Flash представляет собой модель архитектуры Mixture-of-Experts с 284 миллиардами параметров, из которых одновременно активируются только 13 миллиардов. Это решение обеспечивает быструю работу при сохранении высокого качества генерации текста. Новая интеграция позволяет владельцам систем на базе Strix Halo, включая Framework Desktop и AMD Ryzen AI Halo Developer Platform, развернуть модель локально без обращения к облачным сервисам.
Платформа Lemonade предоставляет разработчикам унифицированный API, совместимый с протоколами OpenAI, Anthropic и Ollama. Инструмент поддерживает различные типы задач: генерацию текста, создание изображений, распознавание речи и синтез голоса. Все вычисления выполняются локально на графических процессорах и нейронных ускорителях, что обеспечивает приватность данных и отсутствие затрат на использование.
Помимо поддержки DeepSeek V4 Flash, обновление 11.8 расширило каталог доступных моделей. В него добавлены чат-бот RPG-HaloTales-V2, генераторы изображений Flux-2-Klein-4B и 9B, а также голосовые модели OpenMOSS для создания звуковых эффектов. Появился новый механизм получения обновлений, упрощающая обслуживание системы.
Процессоры Strix Halo оснащены 16 ядрами архитектуры Zen 5 и интегрированной графикой Radeon 8060S с 40 вычислительными блоками, что обеспечивает достаточную производительность для работы с крупными языковыми моделями непосредственно на устройстве пользователя.