31 июля DeepSeek перевела V4 Flash из превью в официальный релиз — DeepSeek-V4-Flash-0731. Открытые веса под MIT, 284 млрд параметров в MoE-архитектуре, из которых на каждый токен работают всего 13 млрд активных, нативный контекст 1M. Независимый Artificial Analysis после релиза дал модели 50 баллов Intelligence Index — топ-3 из 101 модели на тот момент, в одном балле от GLM-5.2.
Но для нас главное в этой модели другое: это быстрый уровень SOTA. Качество топ-класса при скорости и стоимости генерации «рабочей лошадки» — а значит, на ней можно держать автономных агентов, работающих 24/7 на своём железе. Мы в Лаборатории Павла Жукова уже делаем это в продакшене — покажем два кейса.
Table Of Contents
Краткий обзор обновления
Что изменилось 31 июля по сравнению с превью-версией:
- та же архитектура (284B MoE / 13B активных), но модель заново пост-обучена — упор на агентные сценарии;
- нативный Responses API, параллельные вызовы инструментов, совместимость с Codex CLI и расширением для VS Code — из коробки, без обвязки;
- контекст 1M нативно — не масштабируемое расширение, а штатный режим работы;
- лицензия MIT, веса выложены на Hugging Face.
Результат по агентным бенчмаркам: Terminal-Bench 2.1 — 82.7, DeepSWE 1.1 — 54.4 против 7.3 у превью. Апдейт превратил «быструю недорогую модель» в агентную: DeepSeek заявляет превосходство над собственным флагманом V4-Pro (Preview) по девяти агентным тестам — при активных параметров в разы меньше.
Цена при этом осталась из другого мира: $0.14 за миллион входных и $0.28 за миллион выходных токенов, а попадание в кеш режет стоимость входа ещё на 98% — по этому показателю модель №1 в рейтинге Artificial Analysis.
Info
Оговорка для честности: часть агентных цифр DeepSeek получила на собственном харнессе, который пока не опубликован — воспроизвести их независимо нельзя. Независимый индекс Artificial Analysis (50 баллов, топ-3) при этом подтверждает: общий уровень модели действительно топовый. Ещё особенность — многословность: на оценку индекса модель сгенерировала 210 млн токенов против медианы в 100 млн. Думает она много, но при 13B активных параметров каждый токен дешёвый и быстрый.
Почему «быстрый SOTA»
Формула простая. В MoE-архитектуре на генерацию каждого токена работает лишь небольшое подмножество экспертов — 13B из 284B. Получается редкая комбинация:
| Свойство | Что даёт |
|---|---|
| «Знания» всех 284B параметров | качество ответов топ-уровня |
| 13B активных на токен | высокая скорость генерации и низкая цена |
| 1M контекст | агенту можно скормить весь репозиторий или весь массив документов |
| MIT-веса | запуск локально, данные не покидают контур |
Для обычного чат-бота это просто приятные цифры. Для автономных агентов 24/7 это принципиально: агент за сутки прокручивает десятки тысяч токенов размышлений на каждую задачу, и именно стоимость токена × скорость × стабильность определяет, имеет ли смысл держать таких агентов на своём железе. У Flash 0731 это оптимум на сегодня.
Кейс: юридический отдел под ключ — «КиберПравосудие»
Наш проект «КиберПравосудие» мы недавно развернули у клиента «под ключ»: локальный юридический AI-помощник, который обслуживает до 50 юристов в штате. Как это устроено.
Железо. Сервер с 2× NVIDIA RTX PRO 6000 (Blackwell, 96 ГБ) под агентную нагрузку 24/7 и отдельный vision-кластер для чтения документов. Суммарно кластер обошёлся примерно в 4 млн рублей (цены августа 2026) — то есть около 80 тысяч рублей на рабочее место юриста, дешевле годовой облачной подписки фронтир-уровня на человека. Vision-нагрузку (OCR документов, разбор таблиц и реквизитов) мы вынесли в отдельный кластер осознанно: чтение PDF — это своя специфика нагрузки, и она не должна конкурировать с агентным инференсом за память.
Модель. Flash 0731 с LoRA-адаптацией под юридический домен: базовые знания всей MoE-модели плюс дообученные юридические формулировки, шаблоны документов и стиль ответов.
Данные. Ключевое требование клиента — полная локальная обработка, ни один документ не выходит за периметр. Поэтому:
- наши системы поставляют нормативно-правовую базу и базу решений судов для локальных агентов — юристы ищут по актуальному НПА и судебной практике офлайн;
- внутренняя нормативная документация клиента развёрнута локально и обновляется ежедневно — агенты всегда отвечают по действующим редакциям, а не по устаревшему снимку.
Итог: у 50 юристов — круглосуточный помощник, который ищет по НПА и судебной практике, готовит проекты документов и разборы, а регуляторные требования к конфиденциальности выполнены архитектурно — данных просто нет снаружи.
Кейс: автономная обработка ошибок
Вторая система работает у нас самих — и на текущий момент это наша основная система автономных агентов. Схема: после поступления ошибки в систему мониторинга агент автоматически готовит исследование и разбор, проверяет базы продакшена и логи, готовит исправление и делает PR в Gitea.
Весь этот конвейер крутится на Flash 0731: за ночь система разбирает накопившиеся ошибки, и утром инженер получает не алерт «разберитесь», а готовый разбор с корневой причиной и веткой с фиксом. Сегодня мы публикуем отдельную статью с полным разбором того, как устроен этот конвейер — «Автономные агенты 24/7: от ошибки в мониторинге до PR с исправлением».
Итог
- DeepSeek V4 Flash 0731 — редкий случай «быстрого SOTA»: топ-качество (AA Index 50, топ-3 из 101) при цене $0.14/$0.28 и 13B активных параметров;
- открытые веса MIT и 1M контекст делают её идеальным движком для автономных агентов 24/7 на своём железе;
- «КиберПравосудие»: юридический отдел на 50 юристов, кластер ~4 млн ₽, LoRA под домен, полная локальность, ежедневные обновления НПА и судебной практики;
- автономная обработка ошибок — наша основная система автономных агентов: ошибка в мониторинге → разбор → фикс → PR в Gitea, подробный разбор — в отдельной статье;
- в паре с Qwen3.8-27B как локальным vision-инспектором получается полный локальный контур: «мозг» + «глаза».
Если хотите выстроить автономных агентов на своём железе — юридических помощников, обработку документов или автоматизацию инженерных процессов — обращайтесь, Лаборатория Павла Жукова проектирует и разворачивает такие системы под ключ.
