Выпуск DeepSeek V4 Pro 0813 знаменует собой переход флагманской модели компании из четырехмесячной фазы предварительного просмотра в стадию общей доступности (GA) [4]. Эта версия стандартизирует конечные точки API и обеспечивает стабильный фундамент для производственных сред [S4, S5].
Что изменилось в релизе 0813?
Сборка 0813 является официальной производственной версией, заменяющей предыдущие итерации превью [4]. В то время как превью-сборки позволяли проводить ранние эксперименты с открытыми весами, GA-релиз сфокусирован на стабильности API и согласованности производительности [S4, S5].
DeepSeek обновила документацию, указав эту версию в качестве бэкенда для официальной конечной точки Pro [4]. Для команд, интегрирующих эту модель, данный переход означает отказ от маршрутизации, специфичной для превью, в пользу сборки 0813 для обеспечения предсказуемого поведения и поддержки [4].
Как архитектура влияет на эффективность?
DeepSeek V4 Pro использует архитектуру смеси экспертов (mixture-of-experts), имея в общей сложности 1,6 триллиона параметров и 49 миллиардов активных параметров на токен [S4, S8]. Для управления вычислительной нагрузкой при контекстном окне в один миллион токенов модель применяет гибридный механизм внимания [S4, S7].
Этот механизм сочетает в себе сжатое разреженное внимание (Compressed Sparse Attention) и сильно сжатое внимание (Heavily Compressed Attention) [S4, S7]. Данные методы разработаны для снижения вычислительных затрат на инференс одного токена до 27% и объема KV-кэша до 10% по сравнению с требованиями поколения V3.2 [S4, S7].
Выбор между режимами рассуждения
API предоставляет три режима работы: без рассуждений (non-thinking), высокая интенсивность рассуждений (high reasoning effort) и максимальная интенсивность (max effort) [S4, S8]. Эти режимы позволяют разработчикам балансировать между скоростью и глубиной анализа в зависимости от конкретных требований задачи [8].
Режим «без рассуждений» оптимизирован для быстрых, интуитивных ответов, что делает его подходящим для стандартных разговорных интерфейсов [8]. Напротив, режим «максимальной интенсивности» предназначен для сложных проблем, таких как задачи в бенчмарках по программированию или многошаговая логическая проверка, где модели требуется больше времени для обработки входных данных [S4, S8].
Развертывание и экономические соображения
Для планирования производства: модель поддерживает контекстное окно в один миллион токенов [S4, S7]. Структура ценообразования для конечной точки Pro составляет $0,435 за миллион входных токенов при промахе кэша (cache miss), что снижается до $0,003625 за миллион токенов при попадании в кэш (cache hit) [4].
Стоимость выходных токенов составляет $0,87 за миллион [4]. При развертывании командам следует учитывать лимит параллелизма (concurrency limit) в 500 запросов для конечной точки Pro, который отличается от лимита, применяемого к варианту Flash [4].
Разработчики могут получить доступ к модели через стандартные API-запросы с поддержкой форматов OpenAI ChatCompletions и Anthropic Messages [4]. Кроме того, поддерживается локальное развертывание с помощью таких инструментов, как vLLM и SGLang, что позволяет выполнять модель на собственных серверах или в облаке [S2, S4]. Если вы создаете агентные рабочие процессы, рекомендуется протестировать ваш конкретный сценарий использования, опираясь на производительность модели в SWE-bench Verified, где она продемонстрировала уровень решения задач 80,6% [S4, S8].
Источники
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- deepseek-v4-pro - ollama.com
- AI Model Catalog | Microsoft Foundry Models
- deepseek-ai/DeepSeek-V4-Pro · Hugging Face
- deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
- DeepSeek
- DeepSeek releases official V4 Pro model as it steps up expansion