Технологии

DeepSeek V4.1 Flash: 552 млрд параметров, 8 млрд активных, кэш на 60% дешевле — и вровень с Opus 5

Adrian Kessler

DeepSeek V4.1 Flash работает на новой архитектуре, которую компания называет Causal Encoder-Decoder. Её 552 миллиарда параметров распределены между 20-слойным энкодером и 20-слойным декодером, но только 8 миллиардов активируются на входных токенах и 16 миллиардов — на выходных. Это делает модель структурно более лёгкой по сравнению с моделями, которые активируют более крупные срезы параметров для каждой операции — конструктивное решение, которое напрямую окупается в стоимости инференса и эффективности памяти.

Выигрыш в памяти конкретен. KV-кэш V4.1 Flash составляет 890 байт на токен, примерно четверть от V4-Flash. Кэширование FP4 и Compressed Sparse Attention 2 сокращают постоянный объём кэша до одной восьмой от предыдущего поколения. Кэшированный ввод теперь стоит $0,003 за миллион токенов в непиковое время — на 60% меньше, чем у V4-Flash. Некэшированный ввод подешевел на 33%, вывод — на 11%.

На бенчмарках, за которыми разработчики следят больше всего, модель держится уверенно. DeepSWE v1.1 — тест автономной разработки ПО — даёт ей 74,2, что немного опережает Anthropic Opus 5 с 74,0 и GPT-5.6 Sol с 73,0. GPQA Diamond набирает 90,9. Заметный разрыв — Terminal-Bench 3.0: 30,0 против 43,3 у Opus 5, реальная разница в задачах, требующих расширенной интерактивной отладки.

Зрение встроено с предобучения. Ранее V4 разделял зрение на отдельный вариант Vision-Exp. V4.1 Flash заменяет обе версии единой моделью, построенной на DeepSeek-ViT — специально обученном энкодере, разработанном совместно с языковой моделью с самого начала. Мультимодальный уровень исчез — каждый вызов по умолчанию получает зрение.

Окно контекста составляет 1 миллион токенов с ограничением вывода в 384 000, что достаточно для анализа длинных документов и расширенных агентных рабочих процессов без разбивки. Существующие пользователи API, использующие старые идентификаторы deepseek-v4-flash и deepseek-v4-flash-vision-exp, уже перенаправляются на V4.1 Flash. 14 сентября трафик DeepSeek V4 Pro также переключается — по цене Flash.

DeepSeek описал V4.1 Flash как «самую маленькую модель в нашем новом семействе архитектур». Подразумевается более крупная V4.1 Pro на той же конструкции Causal Encoder-Decoder. Если она сохранит траекторию эффективности Flash, то продвинет соотношение производительности на доллар этой архитектуры ещё выше по кривой бенчмарков — на территорию, которую сейчас занимают модели, стоящие значительно дороже за миллион токенов.

Архитектурный аспект важен не только в таблице цен. Рост KV-кэша является основным ограничением при запуске больших моделей на длинном контексте, и он масштабируется с каждым обработанным токеном. Подход V4.1 Flash — меньше активных параметров, сжатый кэш — напрямую решает это ограничение. Это пригодный шаблон для развёртывания на длинном контексте, а не оптимизация для частного случая.

Теги: , , , , ,

Обсуждение

Имеется 0 комментариев.