DeepSeek V4.1 Flash: 1M контекст і лише 890 байтів кешу на токен
DeepSeek V4.1 Flash: 552B MoE на новій CED-архітектурі, 1M контекст, KV-кеш ×4 менший. Нічні тарифи на інференс.

Поки інші змагаються за бали в бенчмарках, DeepSeek атакують фізику інференсу: їхня нова V4.1 Flash тримає мільйон токенів контексту, витрачаючи на кеш 890 байтів на токен — у чотири рази менше за попередню Flash. І це перша модель на зовсім новій архітектурі.
Що це таке
DeepSeek-V4.1-Flash — мультимодальна MoE-модель із 552B параметрів бекбона (загальний розмір моделі в репозиторії більший — рахуючи всі додаткові компоненти), яка активує 8B на токен під час префілу та 16B під час генерації. Входи — текст і зображення (власний DeepSeek-ViT, натренований з нуля), вихід — текст. Контекст — до 1 048 576 токенів. Ліцензія — MIT: ваги відкриті на Hugging Face разом із технічним звітом.
Головна новизна — архітектура CED (Causal Encoder-Decoder): 20 шарів каузального енкодера + 20 шарів декодера, де глобальний KV-кеш декодера проєктується з фінальних станів енкодера, а не будується кожним шаром окремо. Саме це робить префіл дешевим — ідеально для агентних навантажень, де на вході сотні сторінок, а на виході коротка відповідь.
Економія памʼяті: 1/8 і 1/4
Два механізми варто запамʼятати навіть без математики:
- SWA Bounded Replay — замість зберігати SWA-стан на SSD, модель відтворює їх повторним програванням лише останніх n_win токенів. Постійний KV-кеш скорочується до ~1/8 від V4-Flash.
- Compressed Sparse Attention 2 — кожен шар уваги отримує один із трьох статичних режимів (Full / Reindex / Reuse), а FP4-кеш (E2M1) стискає глобальний кеш до 890 байтів на токен — ~1/4 від попередника.
Що це означає на пальцях: 890 байтів — це скільки памʼяті під кеш займає один токен твоєї розмови. Помнож на мільйон — отримаєш ~0,9 ГБ на повний контекст проти ~3,6 ГБ у V4-Flash. Важливе уточнення: це лише global KV-cache, а не загальне споживання памʼяті — ваги моделі та runtime-дані потребують значно більше ресурсів. Тому «1M контекст» тут не маркетинг, а наслідок стиснення кешу.
Додатково: Single-Pass mHC у резидуальному потоці, умовна памʼять Engram (196B параметрів зі спарсеним доступом) і спекулятивне декодування DSpark. На кожному MoE-шарі — 1 спільний та 384 маршрутизованих експерти, активні 6 на токен.
Мільйон токенів контексту перестає бути маркетингом, коли кеш займає 890 байтів на токен — це вже інженерія, а не слоган.
Ціни з нічними знижками
Базовий тариф на OpenRouter — $0.15 за мільйон вхідних і $0.60 за мільйон вихідних токенів, читання кешу — $0.003/M. Найцікавіше — off-peak тарифи: у будні піковими вікнами є 01:40–06:40 та 10:00–16:40 UTC (ставка ×2), у решту часу діє базова ставка, а у вихідні — базова ціла добу. Пакетні задачі можна планувати на «дешеві години», як зі споживчим електрикою. Актуальні вікна звіряй на сторінці моделі — розклад періодично оновлюється.
Як спробувати
На OpenRouter модель доступна як deepseek/deepseek-v4.1-flash: image+text на вході, structured outputs, tools, reasoning з регульованим effort. Тренування — 45T токенів з нуля, спарсена увага на 64K із розширенням до 1M на 34T. Для self-host — ваги на Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash).
- Найкращий кейс — довгі документи та агентні конвеєри з важким входом: CED якраз під це.
- Плануйте batch-задачі на нічні вікна — економія до 50%.
- У релізі немає окремих результатів для української мови — якість для наших сценаріїв варто перевіряти на власних задачах.
Джерела: model card DeepSeek-V4.1-Flash (Hugging Face, MIT) · сторінка моделі та тарифи (OpenRouter). Дані про архітектуру й тренування — з офіційного технічного звіту.
Щотижневий дайджест — у вашій пошті
Один лист на тиждень: головне зі світу AI українською. Без спаму, відписка одним кліком.



