DeepSeek V4 Flash 0731: быстрый уровень SOTA — и агенты 24/7 на своём железе
16 августа 2026 г. 5 мин Читать

DeepSeek V4 Flash 0731: быстрый уровень SOTA — и агенты 24/7 на своём железе

31 июля DeepSeek перевела V4 Flash из превью в официальный релиз — DeepSeek-V4-Flash-0731. Открытые веса под MIT, 284 млрд параметров в MoE-архитектуре, из которых на каждый токен работают всего 13 млрд активных, нативный контекст 1M. Независимый Artificial Analysis после релиза дал модели 50 баллов Intelligence Index — топ-3 из 101 модели на тот момент, в одном балле от GLM-5.2.

Но для нас главное в этой модели другое: это быстрый уровень SOTA. Качество топ-класса при скорости и стоимости генерации «рабочей лошадки» — а значит, на ней можно держать автономных агентов, работающих 24/7 на своём железе. Мы в Лаборатории Павла Жукова уже делаем это в продакшене — покажем два кейса.

Table Of Contents

Краткий обзор обновления

Что изменилось 31 июля по сравнению с превью-версией:

  • та же архитектура (284B MoE / 13B активных), но модель заново пост-обучена — упор на агентные сценарии;
  • нативный Responses API, параллельные вызовы инструментов, совместимость с Codex CLI и расширением для VS Code — из коробки, без обвязки;
  • контекст 1M нативно — не масштабируемое расширение, а штатный режим работы;
  • лицензия MIT, веса выложены на Hugging Face.

Результат по агентным бенчмаркам: Terminal-Bench 2.1 — 82.7, DeepSWE 1.1 — 54.4 против 7.3 у превью. Апдейт превратил «быструю недорогую модель» в агентную: DeepSeek заявляет превосходство над собственным флагманом V4-Pro (Preview) по девяти агентным тестам — при активных параметров в разы меньше.

Цена при этом осталась из другого мира: $0.14 за миллион входных и $0.28 за миллион выходных токенов, а попадание в кеш режет стоимость входа ещё на 98% — по этому показателю модель №1 в рейтинге Artificial Analysis.

Info

Оговорка для честности: часть агентных цифр DeepSeek получила на собственном харнессе, который пока не опубликован — воспроизвести их независимо нельзя. Независимый индекс Artificial Analysis (50 баллов, топ-3) при этом подтверждает: общий уровень модели действительно топовый. Ещё особенность — многословность: на оценку индекса модель сгенерировала 210 млн токенов против медианы в 100 млн. Думает она много, но при 13B активных параметров каждый токен дешёвый и быстрый.

Почему «быстрый SOTA»

Формула простая. В MoE-архитектуре на генерацию каждого токена работает лишь небольшое подмножество экспертов — 13B из 284B. Получается редкая комбинация:

СвойствоЧто даёт
«Знания» всех 284B параметровкачество ответов топ-уровня
13B активных на токенвысокая скорость генерации и низкая цена
1M контекстагенту можно скормить весь репозиторий или весь массив документов
MIT-весазапуск локально, данные не покидают контур

Для обычного чат-бота это просто приятные цифры. Для автономных агентов 24/7 это принципиально: агент за сутки прокручивает десятки тысяч токенов размышлений на каждую задачу, и именно стоимость токена × скорость × стабильность определяет, имеет ли смысл держать таких агентов на своём железе. У Flash 0731 это оптимум на сегодня.

Кейс: юридический отдел под ключ — «КиберПравосудие»

Наш проект «КиберПравосудие» мы недавно развернули у клиента «под ключ»: локальный юридический AI-помощник, который обслуживает до 50 юристов в штате. Как это устроено.

Железо. Сервер с 2× NVIDIA RTX PRO 6000 (Blackwell, 96 ГБ) под агентную нагрузку 24/7 и отдельный vision-кластер для чтения документов. Суммарно кластер обошёлся примерно в 4 млн рублей (цены августа 2026) — то есть около 80 тысяч рублей на рабочее место юриста, дешевле годовой облачной подписки фронтир-уровня на человека. Vision-нагрузку (OCR документов, разбор таблиц и реквизитов) мы вынесли в отдельный кластер осознанно: чтение PDF — это своя специфика нагрузки, и она не должна конкурировать с агентным инференсом за память.

Модель. Flash 0731 с LoRA-адаптацией под юридический домен: базовые знания всей MoE-модели плюс дообученные юридические формулировки, шаблоны документов и стиль ответов.

Данные. Ключевое требование клиента — полная локальная обработка, ни один документ не выходит за периметр. Поэтому:

  • наши системы поставляют нормативно-правовую базу и базу решений судов для локальных агентов — юристы ищут по актуальному НПА и судебной практике офлайн;
  • внутренняя нормативная документация клиента развёрнута локально и обновляется ежедневно — агенты всегда отвечают по действующим редакциям, а не по устаревшему снимку.

Итог: у 50 юристов — круглосуточный помощник, который ищет по НПА и судебной практике, готовит проекты документов и разборы, а регуляторные требования к конфиденциальности выполнены архитектурно — данных просто нет снаружи.

Кейс: автономная обработка ошибок

Вторая система работает у нас самих — и на текущий момент это наша основная система автономных агентов. Схема: после поступления ошибки в систему мониторинга агент автоматически готовит исследование и разбор, проверяет базы продакшена и логи, готовит исправление и делает PR в Gitea.

Весь этот конвейер крутится на Flash 0731: за ночь система разбирает накопившиеся ошибки, и утром инженер получает не алерт «разберитесь», а готовый разбор с корневой причиной и веткой с фиксом. Сегодня мы публикуем отдельную статью с полным разбором того, как устроен этот конвейер — «Автономные агенты 24/7: от ошибки в мониторинге до PR с исправлением».

Итог

  • DeepSeek V4 Flash 0731 — редкий случай «быстрого SOTA»: топ-качество (AA Index 50, топ-3 из 101) при цене $0.14/$0.28 и 13B активных параметров;
  • открытые веса MIT и 1M контекст делают её идеальным движком для автономных агентов 24/7 на своём железе;
  • «КиберПравосудие»: юридический отдел на 50 юристов, кластер ~4 млн ₽, LoRA под домен, полная локальность, ежедневные обновления НПА и судебной практики;
  • автономная обработка ошибок — наша основная система автономных агентов: ошибка в мониторинге → разбор → фикс → PR в Gitea, подробный разбор — в отдельной статье;
  • в паре с Qwen3.8-27B как локальным vision-инспектором получается полный локальный контур: «мозг» + «глаза».

Если хотите выстроить автономных агентов на своём железе — юридических помощников, обработку документов или автоматизацию инженерных процессов — обращайтесь, Лаборатория Павла Жукова проектирует и разворачивает такие системы под ключ.