Вопросы и ответы о DeepSeek API
Собрали то, что чаще всего спрашивают перед стартом: модели, цены, оплата, лимиты и ошибки. Все данные сверены с официальной документацией 9 октября 2026 года.
Что такое DeepSeek API
Это HTTP-интерфейс к языковым моделям DeepSeek. Запрос — обычный POST с JSON-телом, ответ — JSON. Формат совпадает с OpenAI Chat Completions, поэтому подойдёт любой язык программирования и любая библиотека с поддержкой OpenAI-совместимых адресов. Минимальный пример есть на главной странице, подробный — в быстром старте.
Какие модели сейчас доступны
API принимает два актуальных имени: deepseek-flash и deepseek-v4-pro. У обеих контекст 1M токенов и вывод до 384K, работа с изображениями — только у deepseek-flash.
Старые имена deepseek-chat и deepseek-reasoner были отключены 24 июля 2026 года. Если ваш код всё ещё использует их, запросы будут отклоняться — замените название модели. Разбор различий — на странице «Модели и параметры».
Сколько стоит DeepSeek API
Оплата идёт за токены, отдельно за вход и выход. Для deepseek-flash вне часов пик: $0.003 за 1M входных токенов при попадании в кэш, $0.15 за 1M входных токенов без кэша, $0.60 за 1M выходных. Для deepseek-v4-pro те же позиции дороже: $0.022 / $0.66 / $1.98.
В часы пик цена ровно вдвое выше. Подробные таблицы и примеры расчёта — на странице «Цены и расчёт». Цены могут меняться, сверяйте их с официальной документацией.
Что такое кэш ввода и почему он дешевле в десятки раз
Сервис автоматически кэширует повторяющиеся начала запросов. Если новый запрос начинается с того же текста, что и предыдущий (например, длинный системный промпт или база знаний), эти токены считаются как «попадание в кэш» и стоят в десятки раз дешевле: $0.003 против $0.15 за 1M у deepseek-flash.
Управлять кэшем вручную не нужно, но и гарантий стопроцентного попадания нет — механизм работает по лучшему усилию. Состояние видно в полях usage.prompt_cache_hit_tokens и usage.prompt_cache_miss_tokens.
Когда выгоднее отправлять запросы
Часы пик — 01:00–04:00 и 06:00–10:00 UTC по будням, кроме китайских государственных праздников. По московскому времени это 04:00–07:00 и 09:00–13:00. Всё остальное время, включая полные выходные, действует половина цены.
Для пакетной обработки документов и ночных задач разница в цене ощутима: например, разбор массива текстов в выходные обойдётся вдвое дешевле, чем в понедельник утром.
Нужен ли VPN
Для запросов — нет, адрес api.deepseek.com доступен напрямую. Сложность в другом: регистрация аккаунта и пополнение баланса на platform.deepseek.com обычно требуют зарубежной платёжной карты.
Если это неприемлемо, используют агрегаторы с оплатой в рублях. Тогда меняется base_url и название модели, остальной код остаётся прежним — разбор на странице «Подключение через AITUNNEL».
Можно ли платить российской картой
Напрямую в DeepSeek — как правило, нет: нужна зарубежная карта. Варианты обхода: агрегаторы с рублёвой оплатой (карты РФ, СБП, счёт для юрлиц), а также оплата через посредника. Разбор вариантов и расчёт на конкретных объёмах — в статье «Как оплатить DeepSeek API из России».
Совместим ли API с OpenAI SDK
Зачем нужен режим рассуждений и как его выключить
В этом режиме модель сначала строит цепочку рассуждений (поле reasoning_content) и только потом даёт ответ. Это помогает на сложных задачах — математике, анализе, планировании, — но расходует выходные токены, а значит деньги.
Режим включён по умолчанию. Отключить: "thinking": {"type": "disabled"} в запросе (в Python SDK — через extra_body). Глубина настройки — reasoning_effort со значениями none, low, high, max. Важно: в этом режиме не действуют temperature и штрафы за повторы. Подробнее — отдельная страница.
Какие лимиты по запросам
Ограничение считается по одновременным запросам на аккаунт, а не по количеству запросов в минуту: 2500 для deepseek-flash и 500 для deepseek-v4-pro. Один запрос занимает одно соединение от отправки до завершения ответа модели.
При превышении приходит HTTP 429. Расширение квоты запрашивается отдельно и дополнительно не оплачивается. Кэш, безопасность контента и планирование можно изолировать по полю user_id.
Как посчитать токены заранее
Эндпоинта для предварительного подсчёта в API нет: точный расход виден в объекте usage уже после ответа. Для оценки используют справочные соотношения: один английский символ — примерно 0,3 токена, слово, число или знак — около одного токена. Для более точных расчётов есть офлайн-токенизатор DeepSeek.
Второй способ контролировать расход — ограничить max_tokens. Если параметр не задан, лимит ответа зависит от режима: 8K без рассуждений, 64K с рассуждениями, до 128K при максимальной глубине.
Что делать, если ответ пустой или обрезан
Обрезанный ответ — это finish_reason: "length": увеличьте max_tokens. Пустой ответ обычно означает, что модель израсходовала весь бюджет на рассуждения, поэтому для «думающих» моделей не ставьте маленький лимит. У агрегаторов встречается та же проблема, там рекомендуют ставить max_tokens не меньше 50 000.
Можно ли использовать API в коммерческом продукте
Технических ограничений на коммерческое использование в API нет, но условия использования сервиса и лицензии на сами модели устанавливает их правообладатель. Перед запуском в продукт проверьте актуальные условия на официальном сайте — мы их здесь не пересказываем, чтобы не давать юридических советов.
Нужен API-ключ сегодня
Регистрация по email или Telegram занимает пару минут, оплата идёт в рублях, VPN не нужен. Один ключ работает и с DeepSeek, и с другими моделями.