Цены DeepSeek API: токены, часы пик и кэш ввода
Оплата идёт за токены, валюта — доллар США. Итоговая цена запроса зависит от трёх вещей: модели, того, попал ли вход в контекстный кэш, и времени суток. Ниже прайс, правила тарификации и три разобранных примера расчёта.
Формула одна: стоимость = токены × цена / 1 000 000. Сначала списываются средства из granted balance, затем — из пополненного баланса. Расход по конкретному запросу виден в объекте usage ответа, остаток — через GET /user/balance.
Таблица цен
| Категория токенов | flash, вне пика | flash, часы пик | v4-pro, вне пика | v4-pro, часы пик |
|---|---|---|---|---|
| Ввод, попадание в кэш (cache HIT) | $0.003 | $0.006 | $0.022 | $0.044 |
| Ввод, без попадания в кэш (cache MISS) | $0.15 | $0.30 | $0.66 | $1.32 |
| Вывод | $0.60 | $1.20 | $1.98 | $3.96 |
Часы пик: 01:00–04:00 и 06:00–10:00 UTC по будням, кроме китайских государственных праздников; это соответствует 04:00–07:00 и 09:00–13:00 по Москве. Всё остальное время, включая полные выходные, — вне пика, и цена вне пика составляет ровно половину цены часов пик.
| Период | UTC | По Москве (UTC+3) |
|---|---|---|
| Часы пик (понедельник–пятница, кроме госпраздников КНР) | 01:00–04:00 и 06:00–10:00 | 04:00–07:00 и 09:00–13:00 |
| Вне пика (всё остальное время, включая полные выходные) | — | — |
Страница цен и changelog публикуют для deepseek-v4-pro отдельные цены — они приведены в таблице выше. При этом новость от 10 сентября 2026 года сообщает о поэтапном выводе модели и маршрутизации запросов на Flash по цене Flash. По состоянию на 9 октября 2026 года однозначного ответа нет: уточняйте на странице цен DeepSeek, прежде чем планировать бюджет на этой модели.
Кэш ввода: самая заметная экономия
Context Caching on Disk включён по умолчанию для всех аккаунтов: включать его вручную не нужно, управлять им тоже нельзя. Если начало запроса совпадает с уже сохранённым «префиксным блоком», эти токены тарифицируются как cache hit. Разница в цене велика: у deepseek-flash попадание в кэш стоит $0.003 за 1M токенов против $0.15 за 1M без попадания — в 50 раз дешевле.
- Кэш матчит только префикс запроса. Новый уникальный текст в начале всегда считается как miss.
- Сам ответ модели всё равно генерируется заново — кэш влияет только на цену входа.
- Работа кэша — best-effort: 100% попаданий не гарантируется, построение занимает секунды, неиспользуемые блоки очищаются обычно за часы или дни.
- Статус виден в ответе:
usage.prompt_cache_hit_tokensиusage.prompt_cache_miss_tokens, при этомusage.prompt_tokensравен их сумме, аprompt_tokens_details.cached_tokensповторяет значение hit.
Пример 1. Короткий чат-бот без кэша
Считаем по ценам deepseek-flash вне пика. Один запрос: 1 000 входных токенов (системный промпт, история диалога и вопрос — всё без попадания в кэш) и 500 выходных токенов. Формула: токены × цена / 1 000 000.
| Часть запроса | Токены | Цена за 1M | Расчёт |
|---|---|---|---|
| Ввод, cache miss | 1 000 | $0.15 | 1 000 × 0.15 / 1 000 000 = $0.00015 |
| Вывод | 500 | $0.60 | 500 × 0.60 / 1 000 000 = $0.00030 |
| Итого за один запрос | 1 500 | — | $0.00015 + $0.00030 = $0.00045 |
| 10 000 таких запросов в месяц | — | — | 10 000 × $0.00045 = $4.50 |
В часы пик тот же объём стоит ровно вдвое дороже: 1 000 × 0.30 / 1 000 000 = $0.00030 за вход плюс 500 × 1.20 / 1 000 000 = $0.00060 за вывод, то есть $0.00090 за запрос.
Нужен API-ключ сегодня
Регистрация по email или Telegram занимает пару минут, оплата идёт в рублях, VPN не нужен. Один ключ работает и с DeepSeek, и с другими моделями.
Пример 2. Длинный системный промпт с попаданием в кэш
Тот же чат-бот, но с базой знаний в системном промпте: 20 000 токенов неизменного текста плюс 800 токенов вопроса и истории на каждый запрос. Первый запрос строит кэш и целиком тарифицируется как miss, все последующие — как hit. Ниже расчёт для установившегося режима, цены deepseek-flash вне пика.
| Часть запроса | Токены | Цена за 1M | Расчёт |
|---|---|---|---|
| Ввод, cache hit | 20 000 | $0.003 | 20 000 × 0.003 / 1 000 000 = $0.00006 |
| Ввод, cache miss | 800 | $0.15 | 800 × 0.15 / 1 000 000 = $0.00012 |
| Вывод | 500 | $0.60 | 500 × 0.60 / 1 000 000 = $0.00030 |
| Итого за один запрос | 21 300 | — | $0.00006 + $0.00012 + $0.00030 = $0.00048 |
| 10 000 запросов в месяц с кэшем | — | — | 10 000 × $0.00048 = $4.80 |
| Те же 10 000 запросов без кэша | — | — | 20 800 × 0.15 / 1 000 000 = $0.00312 за вход, плюс $0.00030 за вывод = $0.00342 за запрос, то есть $34.20 |
| Экономия на кэше | — | — | $34.20 − $4.80 = $29.40, около 86% |
Именно поэтому длинный неизменный промпт выгодно держать в начале запроса: кэш работает по префиксу. Если менять текст в начале, попаданий не будет и весь вход будет считаться как miss.
Пример 3. Разбор документа на 200 000 входных токенов
Документ отдаётся модели целиком: 200 000 входных токенов при первом обращении, то есть без попадания в кэш, и 4 000 токенов ответа. Режим рассуждений выключен. Цены deepseek-flash вне пика.
| Часть запроса | Токены | Цена за 1M | Расчёт |
|---|---|---|---|
| Ввод, cache miss | 200 000 | $0.15 | 200 000 × 0.15 / 1 000 000 = $0.03 |
| Вывод | 4 000 | $0.60 | 4 000 × 0.60 / 1 000 000 = $0.0024 |
| Итого за один документ | 204 000 | — | $0.03 + $0.0024 = $0.0324 |
| 100 документов | — | — | 100 × $0.0324 = $3.24 |
- В часы пик тот же разбор стоит ровно вдвое: $0.0324 × 2 = $0.0648 за документ.
- Если оставить thinking включённым и модель добавит 2 000 токенов рассуждений, они тарифицируются как вывод: 4 000 + 2 000 = 6 000 токенов, 6 000 × 0.60 / 1 000 000 = $0.0036. Итого $0.03 + $0.0036 = $0.0336 за документ.
- Тот же вход на
deepseek-v4-proвне пика обошёлся бы в 200 000 × 0.66 / 1 000 000 = $0.132 — но помните оговорку о статусе этой модели выше.
Тот же расчёт в коде
Считать стоимость по факту удобнее из объекта usage: он приходит в каждом ответе и уже разделён на попадания в кэш и промахи. Ниже — рабочий пример на Python с ценами deepseek-flash вне пика.
import os
from openai import OpenAI
# Цены deepseek-flash вне пика, USD за 1M токенов
PRICE_HIT = 0.003
PRICE_MISS = 0.15
PRICE_OUT = 0.60
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Сделай выжимку из документа."}],
extra_body={"thinking": {"type": "disabled"}},
)
usage = response.usage
cost = (
usage.prompt_cache_hit_tokens * PRICE_HIT
+ usage.prompt_cache_miss_tokens * PRICE_MISS
+ usage.completion_tokens * PRICE_OUT
) / 1_000_000
print(f"Токены входа: {usage.prompt_tokens}, выхода: {usage.completion_tokens}")
print(f"Стоимость запроса: ${cost:.6f}")
Для расчёта в часы пик умножьте итог на два: цена вне пика ровно вдвое ниже.
Что ещё влияет на счёт
- Длина ответа: выход у обеих моделей дороже входа, а токены рассуждений входят в
completion_tokens. Если рассуждения не нужны, отключайте их через{"thinking": {"type": "disabled"}}— см. раздел о режиме рассуждений. - Количество токенов во входе: ориентиры — 1 английский символ ≈ 0.3 токена, 1 китайский иероглиф ≈ 0.6 токена, слово или число ≈ 1 токен. Официального эндпоинта подсчёта до отправки запроса нет: есть офлайн-токенизатор и калькулятор на официальной странице Token & Token Usage.
- Изображения: считаются по размерам, верхняя граница — 1024 токена на одно изображение.
- Остаток средств удобно проверять через
GET /user/balance, а фактические значения расхода — изusageкаждого ответа.
Страница цен DeepSeek — первоисточник всех цифр выше. Token & Token Usage — ориентиры по токенам, калькулятор и ссылка на офлайн-токенизатор.
Нужен API-ключ сегодня
Регистрация по email или Telegram занимает пару минут, оплата идёт в рублях, VPN не нужен. Один ключ работает и с DeepSeek, и с другими моделями.
Читайте также
- Модели и параметры Чем отличаются модели, какой у них контекст и какие поля запроса принимает API.
-
Стриминг и токены
Как получать ответ по частям, зачем нужен
include_usageи как считать токены. - Режим рассуждений Почему thinking включён по умолчанию, как им управлять и как он влияет на расход.
-
Пример на Python
Как вывести
usageпосле запроса и посчитать стоимость в коде.