9 августа 2026 г.

DeepSeek снова уронил цены на ИИ: разбираемся в V4 Flash

ии-агентыавтоматизацияинструментыбизнес

Карты на стол. DeepSeek выкатила официальный релиз V4 Flash - модели на 304 миллиарда параметров - и назначила ей цену 14 центов за миллион входных токенов. Для сравнения: Claude Sonnet 5 и Gemini 3.1 Pro берут по 2 доллара за тот же миллион. Разница не в проценты, а в разы - и это не рекламный трюк, а официальный прайс-лист DeepSeek.

Я уже писал про открытые веса, которые можно поставить себе на видеокарту - Meta Glimmer 30B тому пример. V4 Flash - другая история. Она тоже открытая (веса лежат на Hugging Face, лицензия MIT), но реальный вопрос тут не «как поставить дома», а «что вообще происходит с ценами на ИИ и как этим пользоваться с умом». Дома эту модель почти никто не потянет - и я скажу почему.

Что вообще случилось

31 июля 2026 DeepSeek выпустила официальный релиз V4-Flash-0731 - модель, которая до этого месяц ходила в статусе превью. Это не косметическое обновление номера версии: агентные бенчмарки подскочили в разы за счёт дообучения, без увеличения размера модели. На Terminal Bench 2.1 модель выросла с 61.8 до 82.7 баллов, на DeepSWE - с 7.3 до 54.4. Обучали ту же архитектуру заново и другому - вызову инструментов, длинным агентным цепочкам, работе с терминалом.

Показательный момент: у DeepSeek есть более крупная модель V4 Pro на 1.6 триллиона параметров, и V4 Flash её обходит на всех девяти агентных бенчмарках, которые DeepSeek публикует. Дообучение победило масштаб. Это ровно то направление, куда сейчас двигается вся индустрия - не «модель побольше», а «модель поумнее натренирована».

Почему так дёшево

Секрет не в благотворительности, а в архитектуре. V4 Flash - модель типа Mixture-of-Experts: 304 миллиарда параметров формально в наличии, но на каждый токен реально работают около 13 миллиардов - 256 «экспертов», из которых на любой запрос включаются шесть плюс один общий. Остальные в этот момент простаивают. Считаешь ты по активным параметрам, а не по общему весу модели - вот откуда дешёвый инференс.

Добавь сюда спекулятивное декодирование (модель угадывает несколько токенов вперёд и проверяет разом, а не по одному) и обучение сразу в FP8 - более компактном числовом формате, чем стандартный BF16. По отдельности каждый приём даёт проценты экономии, вместе - разы.

API и свой сервер - две разные истории

Вот тут я разведу вещи, которые в новостях обычно сваливают в кучу. «DeepSeek дешёвый» касается API - облачного доступа к модели, за который платишь по токенам. Загрузить эти же 304 миллиарда параметров и крутить их у себя - совсем другая экономика, и путать их не стоит.

Официальные веса в родном формате (FP8) - это около 157 гигабайт видеопамяти под саму модель, плюс кэш контекста сверху. На меньшем железе модель тоже гоняют, но с потерями:

Вариант Память Железо
Сильный квант ~33 ГБ RTX 6000 Ada или 2× RTX 4090
FP8 (родной формат) ~80 ГБ 1× H100 80ГБ
Полные веса + кэш ~170 ГБ 2× H200
Без квантования на одной карте 192 ГБ HBM3 AMD MI300X

Схема: 304 миллиарда параметров дома? Три варианта железа - Glimmer на RTX 3090, V4 Flash на H100 80ГБ, полные веса на 2× H200

Ни один из этих вариантов не карта за 40 тысяч рублей. MI300X на вторичном рынке стоит порядка 20 тысяч долларов, аренда через облако AMD - около 2 долларов в час. Это разговор для компании с серверной инфраструктурой, не для домашнего апгрейда видеокарты, как было с Glimmer.

Через API те же 304 миллиарда параметров арендуешь по 14 центов за миллион токенов без единой покупки железа. Если цель - просто пользоваться моделью, а не размещать её у себя из соображений приватности или офлайн-доступа, API - однозначно разумный путь.

Сколько это в цифрах

Официальный прайс DeepSeek: 14 центов за миллион входных токенов (при промахе кэша), 28 центов за миллион выходных, и всего 0.28 цента за миллион входных при попадании в кэш - это в 50 раз дешевле обычного входа.

Сравнение с закрытыми моделями на ту же дату:

Модель Вход, $/1М Выход, $/1М
DeepSeek V4 Flash 0.14 0.28
Gemini 3 Flash 0.50 3.00
GPT-5.6 Luna (бюджетная) 0.20 1.20
Claude Sonnet 5 2.00 10.00
Gemini 3.1 Pro 2.00 12.00
GPT-5.6 Sol (флагман) 5.00 30.00

Сравнение цены входных токенов, $ за миллион: GPT-5.6 Sol 5.00, Claude Sonnet 5 и Gemini 3.1 Pro по 2.00, Gemini 3 Flash 0.50, GPT-5.6 Luna 0.20, DeepSeek V4 Flash 0.14

По входным токенам V4 Flash дешевле Claude Sonnet 5 и Gemini 3.1 Pro примерно в 14 раз, флагманского GPT - почти в 36 раз. По выходным разрыв ещё больше - там счёт идёт на десятки раз. Даже против самой бюджетной модели OpenAI (Luna) DeepSeek дешевле в разы, а не на проценты.

Что она реально умеет и где не дотягивает

Возьму цифры без прикрас. По независимому рейтингу Artificial Analysis у V4 Flash 52 балла индекса интеллекта - четвёртое место среди 104 протестированных моделей, заметно выше медианы. По скорости - около 128-168 токенов в секунду в зависимости от железа, тоже входит в верхнюю часть списка.

Против Claude Opus 4.8 модель всё ещё проигрывает - на каждом опубликованном бенчмарке, но разрыв местами символический. На «Agents’ Last Exam» счёт 25.2 против 25.7 у Opus - по сути ничья. На Terminal Bench 2.1 разрыв заметнее: 82.7 против 85.0. Ставка DeepSeek здесь не «мы обогнали лучших», а «мы почти на их уровне за цену на порядок ниже».

Есть и обратная сторона, о которой в рекламных постах молчат. Модель заметно многословнее конкурентов - в одном из независимых тестов она сгенерировала вдвое больше токенов, чем медианная модель того же класса. Если платишь за вывод, часть выигрыша в цене за токен съедается количеством токенов. И ещё честное замечание одного из обзоров, которое стоит держать в голове: дешёвые токены не значит дешёвый результат - если модель ошибается чаще топовой, ревью и переделка могут стоить дороже, чем сэкономил на API.

Кому это реально пригодится

Агентные пайплайны с частыми вызовами инструментов - как раз то, ради чего модель дообучали в первую очередь, и там она показывает лучшие относительно себя же результаты.

Массовые эксперименты и перебор вариантов. Когда токен стоит копейки, можно позволить агенту сделать десять неудачных попыток вместо одной осторожной - именно об этом писали разборы про «репрайсинг экономики кодинг-агентов»: дешёвые токены превращают дорогое исследование задачи в рутинную операцию.

LLM-судья и второй слой проверки в собственных пайплайнах - роль, где не нужен гений, нужна стабильность и низкая цена за прогон большого объёма данных.

Высоконагруженные продукты, где счёт за токены реально давит на юнит-экономику - миллион запросов в месяц по 2 доллара и по 14 центов за вход это совершенно разные бюджеты.

Что это значит для тренда

DeepSeek уже проделывала такое однажды - в начале 2025 модель R1 обвалила ожидания рынка по стоимости обучения топовых моделей. V4 Flash - тот же приём, но не про тренировку, а про инференс: показать, что качество топ-4 в мире по независимому рейтингу можно продавать за цену, которая раньше ассоциировалась с моделями второго эшелона.

Для закрытых игроков это давление держать цены вниз - GPT-5.6 Luna подешевела на 80% буквально на днях, и это едва ли совпадение с публикацией V4 Flash. Для тех, кто строит продукты на API, это конкретная экономия здесь и сейчас, но с оговоркой из середины статьи: DeepSeek сама предупреждает о грядущем повышении, и многословность модели частично съедает разницу в цене за токен.

Если у тебя уже есть агентный пайплайн на дорогой модели и часть задач в нём рутинные - протестировать V4 Flash на этих задачах стоит буквально сегодня, цена входа - один API-ключ и вечер на сравнение. Ставить 304 миллиарда параметров у себя ради экономии смысла нет почти никому - для этого есть облако DeepSeek и его 14 центов.

← Все статьи