El lanzamiento de DeepSeek V4 Pro 0813 marca la transición del modelo insignia de la compañía desde una fase de vista previa de cuatro meses hacia su disponibilidad general [4]. Esta versión estandariza los endpoints de la API y proporciona una base estable para entornos de producción [S4, S5].
¿Qué ha cambiado en el lanzamiento 0813?
La versión 0813 sirve como la versión oficial de producción, sustituyendo a las iteraciones de vista previa anteriores [4]. Mientras que las versiones de vista previa permitían la experimentación temprana con pesos abiertos, el lanzamiento de disponibilidad general (GA) se centra en la estabilidad de la API y la consistencia del rendimiento [S4, S5].
DeepSeek ha actualizado su documentación para reflejar que esta versión es el backend del endpoint Pro oficial [4]. Para los equipos que integran este modelo, el cambio implica dejar atrás el enrutamiento específico de la vista previa para utilizar la versión 0813, garantizando así un comportamiento y soporte predecibles [4].
¿Cómo influye la arquitectura en la eficiencia?
DeepSeek V4 Pro utiliza una arquitectura de mezcla de expertos (mixture-of-experts), que cuenta con un total de 1,6 billones de parámetros y 49 mil millones de parámetros activos por token [S4, S8]. Para gestionar la carga computacional de una ventana de contexto de un millón de tokens, el modelo emplea un mecanismo de atención híbrido [S4, S7].
Este mecanismo combina la Atención Dispersa Comprimida (Compressed Sparse Attention) y la Atención Altamente Comprimida (Heavily Compressed Attention) [S4, S7]. Estas técnicas están diseñadas para reducir el cómputo de inferencia de un solo token al 27 por ciento y el caché KV al 10 por ciento de los requisitos observados en la generación V3.2 [S4, S7].
Elección entre modos de razonamiento
La API ofrece tres modos de operación: sin pensamiento (non-thinking), esfuerzo de razonamiento alto (high reasoning effort) y esfuerzo máximo (max effort) [S4, S8]. Estos modos permiten a los desarrolladores equilibrar la velocidad frente a la profundidad del razonamiento según los requisitos específicos de la tarea [8].
El modo sin pensamiento está optimizado para respuestas rápidas e intuitivas, lo que lo hace adecuado para interfaces conversacionales estándar [8]. Por el contrario, el modo de esfuerzo máximo está destinado a problemas complejos, como los que se encuentran en benchmarks de programación o verificación lógica de múltiples pasos, donde el modelo requiere más tiempo para procesar la entrada [S4, S8].
Consideraciones de implementación y económicas
Para la planificación de producción, el modelo admite una ventana de contexto de un millón de tokens [S4, S7]. La estructura de precios para el endpoint Pro es de $0,435 por millón de tokens de entrada en caso de fallo de caché (cache miss), lo que disminuye a $0,003625 por millón de tokens en caso de acierto de caché (cache hit) [4].
Los tokens de salida tienen un precio de $0,87 por millón [4]. Al implementar, los equipos deben tener en cuenta el límite de concurrencia de 500 para el endpoint Pro, que difiere del límite aplicado a la variante Flash [4].
Los desarrolladores pueden acceder al modelo mediante solicitudes API estándar, con soporte para los formatos OpenAI ChatCompletions y Anthropic Messages [4]. Además, se admite la implementación local mediante herramientas como vLLM y SGLang, lo que permite la ejecución en servidores locales o en la nube [S2, S4]. Si está construyendo flujos de trabajo de agentes, considere comparar su caso de uso específico con el rendimiento del modelo en SWE-bench Verified, donde ha demostrado una resolución del 80,6 por ciento [S4, S8].
Fuentes
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- deepseek-v4-pro - ollama.com
- AI Model Catalog | Microsoft Foundry Models
- deepseek-ai/DeepSeek-V4-Pro · Hugging Face
- deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
- DeepSeek V4 Pro & Flash API Models: IDs, Pricing, Limits
- DeepSeek
- DeepSeek releases official V4 Pro model as it steps up expansion