deepseek-flash или deepseek-v4-pro: что выбрать
В API DeepSeek два актуальных имени моделей: deepseek-flash (DeepSeek-V4.1-Flash) и deepseek-v4-pro (DeepSeek-V4-Pro-0813). У них одинаковый контекст и почти одинаковый набор функций, но разные цены, лимиты и один важный нюанс со статусом старшей модели.
Сравнение по характеристикам
| Параметр | deepseek-flash | deepseek-v4-pro |
|---|---|---|
| Полное имя версии | DeepSeek-V4.1-Flash | DeepSeek-V4-Pro-0813 |
| Контекст | 1 048 576 токенов (1M) | 1 048 576 токенов (1M) |
| Максимальный вывод | 393 216 токенов (384K) | 393 216 токенов (384K) |
| Работа с изображениями (vision) | Поддерживается | Не поддерживается |
| Режим рассуждений | Есть, включён по умолчанию | Есть, включён по умолчанию |
| JSON, инструменты, Responses API, Anthropic API | Все поддерживаются | Все поддерживаются |
| Дополнение кода (FIM, Beta) | Только в режиме без рассуждений | Только в режиме без рассуждений |
| Concurrency на аккаунт | 2500 | 500 |
| Ввод из кэша, вне пика, за 1M | $0.003 | $0.022 |
| Ввод без кэша, вне пика, за 1M | $0.15 | $0.66 |
| Вывод, вне пика, за 1M | $0.60 | $1.98 |
| Те же цены в часы пик | Вдвое выше | Вдвое выше |
Ключевые различия, которые видны сразу: младшая модель в 4,4 раза дешевле по вводу без кэша и в 3,3 раза по выводу, у неё в пять раз выше лимит одновременных запросов и есть поддержка изображений. Старшая модель не даёт ничего дополнительно по формальным параметрам — её смысл в качестве рассуждений на сложных задачах.
Ещё два параметра, о которых стоит помнить при планировании. Максимальный вывод у обеих моделей одинаковый — 393 216 токенов, но если max_tokens не задан, действуют значения по умолчанию: 8K в режиме без рассуждений, 64K в режиме рассуждений и 128K при reasoning_effort: "max". Допустимый диапазон значений — от 1 до 393 216. Для длинных ответов параметр лучше задавать явно: иначе ответ обрежется, а finish_reason придёт со значением length. Ещё одна деталь — при работе с изображениями у deepseek-flash действуют отдельные лимиты: до 600 изображений на запрос и до 8192 символов в URL.
Статус deepseek-v4-pro: источники расходятся
Здесь нужна честная оговорка, потому что ситуация действительно неоднозначна. Новость от 10 сентября 2026 года сообщает, что модель V4-Pro выводится поэтапно и с 04:00 UTC 14 сентября 2026 года запросы к deepseek-v4-pro маршрутизируются на V4.1-Flash по цене Flash. При этом страница цен и Change Log по-прежнему публикуют отдельные цены и лимиты для V4-Pro.
Проще говоря: по одному источнику вы уже получаете Flash, даже если указали v4-pro, а по другому — отдельная модель с отдельным прайсом продолжает работать. По состоянию на 9 октября 2026 года статус модели неоднозначен, поэтому перед тем как строить на ней продакшен или считать бюджет, проверяйте актуальную информацию на странице цен и в списке изменений официальной документации.
Если запросы deepseek-v4-pro действительно обслуживаются Flash по цене Flash, то надбавка за старшую модель в счёте не появится — но и качество ответов будет уровнем Flash. Обратная ситуация тоже возможна, если маршрутизация изменится. Практический вывод: выбирайте модель по результату на ваших задачах, а стоимость пересчитывайте по фактическому прайсу, а не по предположениям.
Нужен API-ключ сегодня
Регистрация по email или Telegram занимает пару минут, оплата идёт в рублях, VPN не нужен. Один ключ работает и с DeepSeek, и с другими моделями.
Когда достаточно deepseek-flash
В большинстве прикладных сценариев младшей модели хватает, и переплата за старшую не даёт ничего, кроме более дорогого счёта:
- Массовые задачи. Классификация, разметка, перевод, переписывание текстов, генерация коротких описаний — здесь важны цена и пропускная способность, а не глубина рассуждений.
- Извлечение данных. Разбор писем, счетов, договоров и таблиц в JSON: модель хорошо справляется со структурированным выводом в режиме
json_object. - Чат-боты и ассистенты. Диалоги с короткими ответами, где задержка заметна пользователю, а рассуждения не нужны.
- Работа с изображениями. Здесь выбора нет: vision поддерживает только
deepseek-flash. Это скриншоты интерфейсов, фотографии документов, распознавание графиков. - Длинный контекст. Оба варианта держат 1M токенов, поэтому анализ больших массивов текста не требует старшей модели сам по себе.
Когда имеет смысл deepseek-v4-pro
Старшая модель оправдана там, где ошибка стоит дороже токенов, а задача требует многошаговых рассуждений:
- разбор сложной логики, поиск причины сбоя в большом объёме кода или логов;
- аналитика с промежуточными выводами: финансовые модели, оценка рисков, проверка гипотез;
- задачи с жёсткими требованиями к точности, где неверный ответ переделывается вручную;
- построение планов и декомпозиция: длинные цепочки шагов, в которых важна согласованность.
Практический способ проверить необходимость: возьмите 20–30 своих реальных запросов, прогоните их через deepseek-flash и посмотрите, сколько ответов пришлось исправлять. Если доля приемлема, старшая модель не нужна. С учётом оговорки выше это ещё и единственный надёжный способ понять, что вы действительно получаете.
Как сэкономить на токенах
Отключайте рассуждения на простых задачах
Режим рассуждений включён по умолчанию и увеличивает количество выходных токенов — а значит, и счёт. Для перевода, извлечения полей и классификации его стоит выключать явно.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
# Быстрый и дешёвый путь: рассуждения выключены
fast = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Извлеки номер счёта и сумму из текста: ..."}],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "disabled"}},
)
# Сложная задача: рассуждения на максимум
deep = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Найди ошибку в алгоритме и объясни её."}],
reasoning_effort="max",
)
Следите за попаданием в кэш
Контекстный кэш включён по умолчанию и не требует настройки. Он срабатывает, когда начало запроса совпадает с уже сохранённым «префиксом»: у deepseek-flash попадание в кэш снижает цену входных токенов с $0.15 до $0.003 за 1M, то есть в 50 раз. Условие одно — стабильный префикс. Поэтому инструкцию, примеры и большой справочный контекст лучше держать в начале сообщений и не перемешивать, а статус смотреть в usage.prompt_cache_hit_tokens. Кэш работает по принципу best-effort: 100% попаданий не гарантируется.
Выбирайте внепиковое время
Часы пик — 01:00–04:00 и 06:00–10:00 UTC по будням (кроме китайских государственных праздников), что соответствует 04:00–07:00 и 09:00–13:00 по Москве. В это время цены вдвое выше, во все остальные часы, включая полные выходные, действует внепиковая цена. Пакетные задачи — разбор архивов документов, ночные пересчёты, индексация — имеет смысл сдвигать за пределы этих интервалов. Точный прайс всегда сверяйте на странице «Цены и расчёт».
Ограничение max_tokens: если параметр не задан, в режиме рассуждений по умолчанию закладывается 64K токенов, а при reasoning_effort: "max" — 128K. Само по себе это не расход, но длинные ответы обходятся дороже. Ещё один рычаг — user_id: он изолирует запросы пользователей и помогает разбираться со всплесками нагрузки.
Нужен API-ключ сегодня
Регистрация по email или Telegram занимает пару минут, оплата идёт в рублях, VPN не нужен. Один ключ работает и с DeepSeek, и с другими моделями.
Читайте также
- Модели и параметры Полный список параметров Chat Completions с типами, значениями по умолчанию и ограничениями.
- Режим рассуждений Как работает thinking, чем отличаются уровни reasoning_effort и что перестаёт действовать при включённых рассуждениях.
- Как оплатить DeepSeek API из России Способы пополнения и пример расчёта бюджета на 10 млн входных токенов.
- Примеры на Python Готовый код: запрос, стриминг, JSON, инструменты и расчёт стоимости запроса.