DeepSeek V4-Flash-0731: что изменилось для AI-агентов
DeepSeek обновила V4 Flash для агентных задач. Разбираем результаты, условия тестов, цену API и спорные 304B параметров.
DeepSeek V4-Flash-0731 вышла 31 июля 2026 года в открытое бета-тестирование API и заменила апрельскую Preview-версию под прежним именем deepseek-v4-flash. DeepSeek не меняла базовую архитектуру: компания дополнительно обучила модель, добавила нативный Responses API и заявила большой прирост в задачах для программных агентов.
Цифры выглядят убедительно, но читать их нужно вместе с условиями. Лучшие официальные результаты получены при reasoning_effort=max и в ещё не опубликованном режиме DeepSeek Harness. Независимый Artificial Analysis тоже ставит версию 0731 высоко, однако фиксирует большой расход выходных токенов. Ниже отделяем подтверждённые изменения от рекламных выводов.
Что изменилось в DeepSeek V4-Flash-0731
Обновление касается только Flash API. V4 Pro, приложение и веб-чат DeepSeek остались прежними. Вызов API тоже не меняется: имя модели deepseek-v4-flash теперь указывает на версию 0731.
| Область | Что изменилось | Что не изменилось | Источник |
|---|---|---|---|
| Модель | Дополнительное обучение версии 0731 | Базовая архитектура и размер Preview | DeepSeek Change Log |
| API | Открытое бета-тестирование, нативный Responses API | Имя deepseek-v4-flash и базовый URL |
DeepSeek Models & Pricing |
| Рассуждения | Уровни low, high и max |
Thinking и non-thinking режимы | Карточка модели |
| Другие продукты | Нет изменений | V4 Pro, приложение и веб-чат | DeepSeek Change Log |
Контекст серии и отличия Flash от Pro уже разобраны в нашем материале про DeepSeek V4 Pro и Flash. Здесь важен более узкий вопрос: что даёт конкретная версия 0731 разработчику агента.

Агентные тесты выросли, но условия решают
В официальной карточке DeepSeek сравнивает 0731 с двумя апрельскими Preview-моделями. На Terminal Bench 2.1 новая версия получила 82,7 балла против 61,8 у Flash Preview и 72,1 у V4 Pro Preview. На Toolathlon-Verified результат вырос до 70,3 с 49,7 и 55,9 соответственно. На публичной части AutomationBench новая модель набрала 25,1 против 10,8 и 12,8.
Все эти цифры опубликовала сама DeepSeek. Для задач программных агентов компания использовала reasoning_effort=max, температуру 1,0, top_p=0.95 и минимальный режим собственного DeepSeek Harness. Код этого режима обещают выпустить позже. Ещё два набора, DSBench-FullStack и DSBench-Hard, внутренние, поэтому воспроизвести их сейчас нельзя.
Независимая проверка даёт сильный, но более трезвый сигнал. По состоянию на 1 августа Artificial Analysis присваивает точной версии 0731 в режиме max 50 баллов в Intelligence Index и третье место среди 101 сопоставимой открытой модели. Полный прогон обошёлся в $72,02 и породил 210 млн выходных токенов при медиане 100 млн. Модель выглядит дешёвой по тарифу, но максимальный режим расходует токены щедро.
Поэтому чужие 82,7 балла нельзя переносить в прогноз для своего агента. Сначала воспроизведите собственный набор задач с тем же уровнем рассуждений, лимитом ответа и агентной обвязкой.
Reasoning effort меняет не только качество
Версия 0731 поддерживает три уровня рассуждений: low, high и max. Официальные агентные тесты используют максимальный уровень, поэтому сравнение с настройками по умолчанию будет некорректным.
Саймон Уиллисон показал это на небольшом, но наглядном примере. Его первый запуск через OpenRouter с настройкой по умолчанию плохо справился с тестом на изображение пеликана на велосипеде. После переключения на reasoning_effort=high результат стал заметно лучше. Один рисунок слишком слаб для общего вывода. Для разработчика он полезен как предупреждение: уровень рассуждений способен изменить ответ сильнее, чем ожидаешь.
В рабочем агенте стоит измерять три величины вместе: долю успешно завершённых задач, число выходных токенов и время до результата. Если max добавляет несколько пунктов качества, но удваивает длину траектории, дешёвый прайс за миллион токенов может не спасти бюджет.
Цена DeepSeek V4 Flash 0731
По состоянию на 1 августа 2026 года DeepSeek сохранила ставку Flash. Компания уже предупредила о будущей схеме с удвоением тарифов в часы пик, но дату её запуска пока не объявила.
| Операция | Цена за 1 млн токенов | Источник |
|---|---|---|
| Вход, cache hit | $0,0028 | DeepSeek pricing |
| Вход, cache miss | $0,14 | DeepSeek pricing |
| Выход | $0,28 | DeepSeek pricing |
Пример масштаба: 10 млн входных токенов без попадания в кэш и 2 млн выходных обойдутся в $1,96. При полном попадании тех же входных токенов в кэш сумма снизится до $0,588. Расчёт прозрачный, но реальный счёт зависит от повторяемости префиксов, длины рассуждений и числа повторных запусков.
Для длинных агентных циклов считайте стоимость одной завершённой задачи. Рекламная ставка не учитывает повторные запуски и лишние рассуждения. Мы уже разбирали эту разницу в материале о ценовой войне DeepSeek API.

304B параметров: почему число требует пояснения
Интерфейс Hugging Face показывает для репозитория 304B параметров, а API сервиса считает 304 180 418 494 тензорных параметра. Из этого нельзя делать вывод, что DeepSeek увеличила базовую модель с 284B до 304B.
DeepSeek пишет, что 0731 сохранила архитектуру и размер Flash Preview и получила только дополнительное обучение. Карточка версии уточняет, что в комплект входит модуль спекулятивного декодирования DSpark. В исходной V4 Flash компания указывала 284B общих и 13B активных параметров; Artificial Analysis сохраняет эти значения для ядра 0731.
Корректная формулировка такая: репозиторий 0731 содержит около 304,18B параметров вместе с DSpark, а базовая MoE-модель остаётся 284B с 13B активных параметров. Это большой серверный релиз. Официальный пример запуска использует один узел с четырьмя ускорителями GB300, а не рабочую станцию разработчика.
Кому стоит тестировать обновление
DeepSeek V4-Flash-0731 интересна командам, у которых агент много работает в терминале, правит репозитории или вызывает инструменты в длинной сессии. Нативный Responses API даёт готовый путь интеграции, а низкая цена оставляет запас для повторных прогонов. Доступ к инструментам и внешним системам всё равно требует ограничений, журналирования и проверки действий.
Если вы только выбираете архитектуру, сначала сверьте сценарий с нашим разбором что такое ИИ-агенты и когда они нужны. Сильная модель не исправит плохо заданные права, неустойчивый цикл вызова инструментов или отсутствие собственных тестов.
Доступна ли версия 0731 через API?
Да. В API DeepSeek нужно указывать прежнее имя deepseek-v4-flash. Сейчас оно ведёт на DeepSeek V4-Flash-0731. Обновление проходит открытое бета-тестирование.
Версия 0731 появилась в приложении и веб-чате?
Нет. DeepSeek отдельно пишет, что обновлён только Flash API. V4 Pro, приложение и веб-чат не менялись.
Какой reasoning effort выбрать?
Начните с high и сравните его с max на своих задачах. Публикация DeepSeek доказывает преимущество max только в конкретной тестовой обвязке. Для продакшена важна цена успешной задачи, а не максимальный балл.
Источники и дата проверки
Факты и цены проверены 1 августа 2026 года. Основные первоисточники: DeepSeek Change Log, DeepSeek Models & Pricing, официальная карточка DeepSeek V4-Flash-0731 и метаданные репозитория Hugging Face. Независимая проверка: Artificial Analysis. Иллюстрация влияния reasoning effort: тест Саймона Уиллисона.