DeepSeek V4-Flash-0731: что изменилось для AI-агентов

DeepSeek обновила V4 Flash для агентных задач. Разбираем результаты, условия тестов, цену API и спорные 304B параметров.

Официальный журнал изменений DeepSeek API с релизом DeepSeek V4-Flash-0731 от 31 июля 2026 года

DeepSeek V4-Flash-0731 вышла 31 июля 2026 года в открытое бета-тестирование API и заменила апрельскую Preview-версию под прежним именем deepseek-v4-flash. DeepSeek не меняла базовую архитектуру: компания дополнительно обучила модель, добавила нативный Responses API и заявила большой прирост в задачах для программных агентов.

Цифры выглядят убедительно, но читать их нужно вместе с условиями. Лучшие официальные результаты получены при reasoning_effort=max и в ещё не опубликованном режиме DeepSeek Harness. Независимый Artificial Analysis тоже ставит версию 0731 высоко, однако фиксирует большой расход выходных токенов. Ниже отделяем подтверждённые изменения от рекламных выводов.

Что изменилось в DeepSeek V4-Flash-0731

Обновление касается только Flash API. V4 Pro, приложение и веб-чат DeepSeek остались прежними. Вызов API тоже не меняется: имя модели deepseek-v4-flash теперь указывает на версию 0731.

Область Что изменилось Что не изменилось Источник
Модель Дополнительное обучение версии 0731 Базовая архитектура и размер Preview DeepSeek Change Log
API Открытое бета-тестирование, нативный Responses API Имя deepseek-v4-flash и базовый URL DeepSeek Models & Pricing
Рассуждения Уровни low, high и max Thinking и non-thinking режимы Карточка модели
Другие продукты Нет изменений V4 Pro, приложение и веб-чат DeepSeek Change Log

Контекст серии и отличия Flash от Pro уже разобраны в нашем материале про DeepSeek V4 Pro и Flash. Здесь важен более узкий вопрос: что даёт конкретная версия 0731 разработчику агента.

Карточка DeepSeek V4-Flash-0731 на Hugging Face с официальным описанием и меткой 304B параметров
Карточка DeepSeek V4-Flash-0731 на Hugging Face: официальная версия, лицензия MIT и метка 304B в репозитории. Источник: Hugging Face / DeepSeek.

Агентные тесты выросли, но условия решают

В официальной карточке DeepSeek сравнивает 0731 с двумя апрельскими Preview-моделями. На Terminal Bench 2.1 новая версия получила 82,7 балла против 61,8 у Flash Preview и 72,1 у V4 Pro Preview. На Toolathlon-Verified результат вырос до 70,3 с 49,7 и 55,9 соответственно. На публичной части AutomationBench новая модель набрала 25,1 против 10,8 и 12,8.

Все эти цифры опубликовала сама DeepSeek. Для задач программных агентов компания использовала reasoning_effort=max, температуру 1,0, top_p=0.95 и минимальный режим собственного DeepSeek Harness. Код этого режима обещают выпустить позже. Ещё два набора, DSBench-FullStack и DSBench-Hard, внутренние, поэтому воспроизвести их сейчас нельзя.

Независимая проверка даёт сильный, но более трезвый сигнал. По состоянию на 1 августа Artificial Analysis присваивает точной версии 0731 в режиме max 50 баллов в Intelligence Index и третье место среди 101 сопоставимой открытой модели. Полный прогон обошёлся в $72,02 и породил 210 млн выходных токенов при медиане 100 млн. Модель выглядит дешёвой по тарифу, но максимальный режим расходует токены щедро.

Поэтому чужие 82,7 балла нельзя переносить в прогноз для своего агента. Сначала воспроизведите собственный набор задач с тем же уровнем рассуждений, лимитом ответа и агентной обвязкой.

Reasoning effort меняет не только качество

Версия 0731 поддерживает три уровня рассуждений: low, high и max. Официальные агентные тесты используют максимальный уровень, поэтому сравнение с настройками по умолчанию будет некорректным.

Саймон Уиллисон показал это на небольшом, но наглядном примере. Его первый запуск через OpenRouter с настройкой по умолчанию плохо справился с тестом на изображение пеликана на велосипеде. После переключения на reasoning_effort=high результат стал заметно лучше. Один рисунок слишком слаб для общего вывода. Для разработчика он полезен как предупреждение: уровень рассуждений способен изменить ответ сильнее, чем ожидаешь.

В рабочем агенте стоит измерять три величины вместе: долю успешно завершённых задач, число выходных токенов и время до результата. Если max добавляет несколько пунктов качества, но удваивает длину траектории, дешёвый прайс за миллион токенов может не спасти бюджет.

Цена DeepSeek V4 Flash 0731

По состоянию на 1 августа 2026 года DeepSeek сохранила ставку Flash. Компания уже предупредила о будущей схеме с удвоением тарифов в часы пик, но дату её запуска пока не объявила.

Операция Цена за 1 млн токенов Источник
Вход, cache hit $0,0028 DeepSeek pricing
Вход, cache miss $0,14 DeepSeek pricing
Выход $0,28 DeepSeek pricing

Пример масштаба: 10 млн входных токенов без попадания в кэш и 2 млн выходных обойдутся в $1,96. При полном попадании тех же входных токенов в кэш сумма снизится до $0,588. Расчёт прозрачный, но реальный счёт зависит от повторяемости префиксов, длины рассуждений и числа повторных запусков.

Для длинных агентных циклов считайте стоимость одной завершённой задачи. Рекламная ставка не учитывает повторные запуски и лишние рассуждения. Мы уже разбирали эту разницу в материале о ценовой войне DeepSeek API.

Официальная таблица DeepSeek API с версией V4-Flash-0731, контекстом 1M и поддержкой Responses API
Официальная таблица DeepSeek API: версия 0731, контекст 1 млн токенов и нативный Responses API для Flash. Источник: DeepSeek API Docs.

304B параметров: почему число требует пояснения

Интерфейс Hugging Face показывает для репозитория 304B параметров, а API сервиса считает 304 180 418 494 тензорных параметра. Из этого нельзя делать вывод, что DeepSeek увеличила базовую модель с 284B до 304B.

DeepSeek пишет, что 0731 сохранила архитектуру и размер Flash Preview и получила только дополнительное обучение. Карточка версии уточняет, что в комплект входит модуль спекулятивного декодирования DSpark. В исходной V4 Flash компания указывала 284B общих и 13B активных параметров; Artificial Analysis сохраняет эти значения для ядра 0731.

Корректная формулировка такая: репозиторий 0731 содержит около 304,18B параметров вместе с DSpark, а базовая MoE-модель остаётся 284B с 13B активных параметров. Это большой серверный релиз. Официальный пример запуска использует один узел с четырьмя ускорителями GB300, а не рабочую станцию разработчика.

Кому стоит тестировать обновление

DeepSeek V4-Flash-0731 интересна командам, у которых агент много работает в терминале, правит репозитории или вызывает инструменты в длинной сессии. Нативный Responses API даёт готовый путь интеграции, а низкая цена оставляет запас для повторных прогонов. Доступ к инструментам и внешним системам всё равно требует ограничений, журналирования и проверки действий.

Если вы только выбираете архитектуру, сначала сверьте сценарий с нашим разбором что такое ИИ-агенты и когда они нужны. Сильная модель не исправит плохо заданные права, неустойчивый цикл вызова инструментов или отсутствие собственных тестов.

Доступна ли версия 0731 через API?

Да. В API DeepSeek нужно указывать прежнее имя deepseek-v4-flash. Сейчас оно ведёт на DeepSeek V4-Flash-0731. Обновление проходит открытое бета-тестирование.

Версия 0731 появилась в приложении и веб-чате?

Нет. DeepSeek отдельно пишет, что обновлён только Flash API. V4 Pro, приложение и веб-чат не менялись.

Какой reasoning effort выбрать?

Начните с high и сравните его с max на своих задачах. Публикация DeepSeek доказывает преимущество max только в конкретной тестовой обвязке. Для продакшена важна цена успешной задачи, а не максимальный балл.

Источники и дата проверки

Факты и цены проверены 1 августа 2026 года. Основные первоисточники: DeepSeek Change Log, DeepSeek Models & Pricing, официальная карточка DeepSeek V4-Flash-0731 и метаданные репозитория Hugging Face. Независимая проверка: Artificial Analysis. Иллюстрация влияния reasoning effort: тест Саймона Уиллисона.

Читайте также

Telegram-канал @toolarium