DeepSeek обновила V4 Flash: дешевле на задачу, но токенов тратит больше
DeepSeek выложила в API обновлённую V4-Flash-0731. Архитектура та же: 284 млрд параметров, из них 13 млрд работают на каждый запрос. По бенчмаркам новая версия обгоняет GLM 5.2 и предварительную V4 Pro.
По замерам Artificial Analysis модель расходует примерно столько же токенов, сколько прежняя, и в пересчёте на задачу выходит в разы дешевле GPT-5.6 Luna даже после свежего снижения цен. Обратная сторона — скорость: Luna решает те же задачи заметно быстрее и укладывается в меньшее число токенов. Модель работает через Responses API и совместима с Codex.
Что говорят
dnhkngHacker News
DeepSeek V4 Flash от превью к 2026-07-31: Terminal Bench 56,9 → 82,7, Toolathlon 51,8 → 70,3. Против GPT-5.6 Terra: Terminal Bench 82,7 против 78,4 и Toolathlon 70,3 против 53,1 в пользу Flash, но DeepSWE 54,4 против 69,6 и Agents' Last Exam 25,2 против 50,4 — в пользу Terra. Явного победителя нет, разброс огромный.
NitpickLawyerHacker News
По-моему, это интереснее K3. Модели DSv4 крайне дешевы в обслуживании, поэтому рост их возможностей означает, что они становятся «достаточно хороши» для всё большего числа задач. DeepSeek долго отдавала pro-версию почти бесплатно и имела интеграции с opencode и другими — значит, собрала массу данных о реальных задачах разработчиков и может дообучать модели на этих живых сценариях.
spwa4Hacker News
Если кто-то захочет запустить локально: это DeepSeek-V4-Flash-284B-A13B. Впритык влезет в один B300 и, будучи достаточно небольшой, еле-еле пойдёт на M5 Max.