Si buscas DeepSeek V4 Pro vs GPT-5.6, el primer paso es fijar el par correcto: en la API de OpenAI, el alias gpt-5.6 dirige a GPT-5.6 Sol; en la API de DeepSeek, deepseek-v4-pro corresponde a DeepSeek-V4-Pro-0813. Comparar Luna con Pro, o Flash con Sol, responde a otra comparación y puede alterar tanto el precio como la conclusión.
La respuesta corta depende de tu restricción. Prueba primero DeepSeek V4 Pro 0813 si el coste API de lista manda y puedes validar la calidad en tu propia carga. Prueba primero GPT-5.6 Sol si necesitas entrada de imagen o si una de sus capacidades documentadas es un requisito no negociable. Si lo decisivo es la calidad en programación, agentes o razonamiento, prueba ambos: las fuentes revisadas no contienen una evaluación independiente del par actual bajo condiciones idénticas que permita declarar un ganador universal.
| Tu restricción dominante | Primer candidato razonable | Motivo comprobable | Qué debes validar |
|---|---|---|---|
| Presupuesto API | DeepSeek V4 Pro 0813 | Precio oficial por token mucho menor el 13 de agosto de 2026 | Calidad aceptada, reintentos y precio vigente al ejecutar |
| Entrada de imagen | GPT-5.6 Sol | OpenAI documenta entrada de texto e imagen | Precisión sobre tus imágenes y coste total |
| Salidas potencialmente muy largas | DeepSeek V4 Pro 0813 | Máximo documentado de 384K frente a 128K de Sol | Que tu caso realmente necesite y sostenga esa longitud |
| Calidad de código o agentes | Ambos en la misma prueba | No hay una evaluación equivalente y reproducible del par actual | Tasa de éxito, intervención humana y coste por tarea aceptada |
| Condiciones de cuenta en España | Ninguno sin comprobar | Pago, IVA, cuotas, datos y soporte regional no están verificados | Cuenta, factura, región, latencia y política aplicable |

Antes de comparar, descarta los modelos sustitutos
La búsqueda “GPT-5.6” es ambigua fuera de la documentación de API. Algunos comparadores eligen GPT-5.6 Luna, que ocupa otra posición de precio, mientras que algunos artículos enfrentan DeepSeek V4 Flash con la familia GPT-5.6. Esas páginas pueden ser útiles para explorar el mercado, pero no deben prestar sus cifras ni sus veredictos a Sol frente a Pro.
Para esta comparación, conserva estas identidades:
gpt-5.6→ GPT-5.6 Sol, según la ficha oficial de OpenAI.deepseek-v4-pro→ DeepSeek-V4-Pro-0813, según la tabla oficial de DeepSeek.- Luna y Terra son otros niveles de GPT-5.6; Flash no es Pro.
- Una tarifa de un marketplace no equivale automáticamente a la tarifa directa del proveedor.
- Un plan de suscripción no es una tarifa API por tokens.
También conviene separar el servicio API de los pesos públicos. La investigación disponible no confirmó que los pesos publicados de DeepSeek V4 Pro y el modelo servido por la API sean idénticos byte a byte ni equivalentes en comportamiento. Por tanto, un resultado de la API no se debe atribuir a una instalación propia sin verificar configuración, cuantización, infraestructura y versión.
Qué documenta cada API
DeepSeek anunció la disponibilidad general de V4 Pro en aplicación, web y API el 13 de agosto de 2026. Su documentación mantiene el ID deepseek-v4-pro, ofrece modos con y sin razonamiento, esfuerzos de pensamiento low, high y max, salida JSON, llamadas a herramientas, Responses API y compatibilidad con el formato de Anthropic. La ventana de contexto documentada es de 1 millón de tokens y la salida máxima, de 384K.
OpenAI presenta GPT-5.6 Sol como el modelo más avanzado de la familia GPT-5.6. Admite esfuerzos de razonamiento none, low, medium, high, xhigh y max, una ventana de 1.050.000 tokens, hasta 128.000 tokens de salida, entrada de texto e imagen y salida de texto.
| Contrato documentado | DeepSeek V4 Pro 0813 | GPT-5.6 Sol |
|---|---|---|
| ID de API usado aquí | deepseek-v4-pro | gpt-5.6 |
| Contexto | 1M tokens | 1,05M tokens |
| Salida máxima | 384K tokens | 128K tokens |
| Entrada de imagen | No establecida en las fuentes usadas para esta comparación | Sí |
| Esfuerzo de razonamiento | low, high, max | none, low, medium, high, xhigh, max |
| Base del dato | Documentación de DeepSeek | Documentación de OpenAI |
Esta tabla sirve para filtrar requisitos, no para inferir calidad. Una ventana mayor no garantiza mejor uso de contexto; una salida máxima mayor no garantiza que una respuesta larga sea correcta; disponer de más niveles de esfuerzo no dice cuánto valor añade cada uno en tu tarea.
El coste por token favorece a DeepSeek, pero la fecha y la base importan
El 13 de agosto de 2026, DeepSeek listaba por millón de tokens para V4 Pro:
- USD 0,003625 por entrada con acierto de caché.
- USD 0,435 por entrada sin caché.
- USD 0,87 por salida.
OpenAI listaba para GPT-5.6 Sol:
- USD 0,50 por entrada en caché.
- USD 5 por entrada normal.
- USD 30 por salida.
Además, OpenAI indica que las solicitudes con más de 272K tokens de entrada cobran 2 veces la entrada y 1,5 veces la salida para toda la solicitud. Ese escalón puede cambiar mucho el coste de una carga de contexto extremo y debe modelarse antes de elegir.
DeepSeek también anunció un cambio para el 16 de agosto de 2026 a las 16:00 UTC. La tarifa programada era, en horario valle, USD 0,022 / 0,66 / 1,98 para caché, entrada sin caché y salida; en horario punta, USD 0,044 / 1,32 / 3,96. Las ventanas punta anunciadas eran 01:00–04:00 y 06:00–10:00 UTC. Esos importes aún no estaban vigentes en la fecha de esta comparación: vuelve a comprobar la página oficial de precios de DeepSeek antes de presupuestar.
Un cálculo común para evitar comparaciones engañosas
Usa la misma mezcla de tokens y multiplica cada parte, expresada en millones, por su tarifa:
coste por intento = (entrada sin caché × tarifa) + (entrada en caché × tarifa) + (salida × tarifa)
Por ejemplo, con 100.000 tokens de entrada sin caché y 20.000 de salida, y sin superar el umbral largo de Sol:
- DeepSeek con el precio del 13 de agosto:
0,1 × 0,435 + 0,02 × 0,87 = USD 0,0609. - GPT-5.6 Sol:
0,1 × 5 + 0,02 × 30 = USD 1,10.
Esto no significa que DeepSeek complete la tarea por una fracción exacta del coste. Si necesita más intentos, más salida o más intervención humana, el ahorro por token puede reducirse. La unidad útil es:
coste por tarea aceptada = coste total de intentos / número de resultados aceptados
No mezcles este cálculo con un precio “blended” de otra página sin copiar también su proporción de caché, entrada y salida. Tampoco mezcles tarifas directas con gateways, impuestos o planes mensuales.

Qué dicen las mediciones externas y qué no pueden decidir
Artificial Analysis mostraba para DeepSeek V4 Pro 0813 Max Effort frente a GPT-5.6 Sol high un Intelligence Index de 53 frente a 57, precio combinado de USD 0,18 frente a USD 4,35, velocidad de salida aproximada de 83 frente a 56 tokens por segundo y tiempo hasta el primer token de 1,63 frente a 19,28 segundos.
Es una señal útil, no un veredicto. La configuración de esfuerzo no tiene el mismo nombre, el precio combinado usa una mezcla 7:2:1 de caché, entrada y salida, y un índice agregado no representa necesariamente tu repositorio, tus herramientas ni tus criterios de aceptación. Puedes usar la medición para formular dos hipótesis: que DeepSeek merece entrar primero si pesan mucho el coste, la velocidad de salida y el tiempo hasta el primer token; y que Sol debe seguir en la prueba para comprobar si la ventaja de su índice agregado se reproduce en tu carga. No permite afirmar que uno “gana” en programación o agentes.
La comparación justa debe mantener constantes, como mínimo:
- el mismo conjunto de tareas y datos de entrada;
- el mismo proveedor o, si no es posible, la diferencia documentada;
- una política de esfuerzo definida para cada modelo;
- las mismas herramientas, permisos, límites de tiempo y formato esperado;
- varias repeticiones para tareas no deterministas;
- una regla de aceptación escrita antes de ver el resultado;
- tokens, latencia, errores, reintentos y revisión humana por separado.
Cómo probarlos sin construir un banco de pruebas de laboratorio
No necesitas cientos de prompts para tomar una primera decisión. Necesitas una muestra pequeña que represente el coste del fallo.
- Elige entre 12 y 30 tareas reales. Incluye casos habituales, casos difíciles y dos o tres fallos históricos. Para código, usa cambios que puedan validarse con pruebas automatizadas; para agentes, usa un estado final observable.
- Congela la entrada. Mismo contexto, archivos, herramientas, límite de tiempo y definición de terminado. Si Sol recibe una imagen, esa tarea ya mide una capacidad que el contrato aquí documentado solo confirma para Sol; etiquétala aparte.
- Define la aceptación antes de ejecutar. Puede ser tests aprobados, campos correctos, ausencia de alucinaciones críticas, tiempo máximo o revisión humana inferior a cierto umbral.
- Elige esfuerzos comparables por objetivo, no por nombre. “high” no demuestra equivalencia entre proveedores. Registra el valor usado y, si el resultado cambia la decisión, prueba una segunda configuración.
- Ejecuta varias veces los casos decisivos. Guarda resultado, tokens, latencia al primer token, duración total, errores, reintentos e intervención humana.
- Calcula el coste por tarea aceptada. Un intento barato que falla tres veces puede perder frente a otro más caro que acierta a la primera.
- Decide con un umbral. Por ejemplo: el modelo elegido debe superar el 90 % de aceptación, no exceder el presupuesto por tarea y mantener la latencia p95 dentro del límite del producto.
No sumes todas las métricas en una puntuación arbitraria si una de ellas es obligatoria. Si la entrada de imagen es esencial, funciona como filtro. Si el presupuesto es un límite duro, también. Solo compara calidad y velocidad entre candidatos que ya cumplen los requisitos no negociables.
Decisión práctica por tipo de carga
Empieza con DeepSeek V4 Pro 0813
Es la primera prueba más defendible cuando procesas mucho texto, el coste API domina la economía del producto, una salida potencialmente larga tiene valor o quieres explorar una alternativa con llamadas a herramientas y Responses API documentadas. La diferencia de precio oficial es suficientemente grande para justificar que entre en la lista de candidatos, aunque aún debes medir cuántos resultados son aceptables.
No extrapoles esa recomendación a pesos autoalojados. Tampoco presupongas que el precio del 13 de agosto seguirá activo: DeepSeek ya había anunciado un cambio para el día 16.
Empieza con GPT-5.6 Sol
Es el primer candidato cuando la entrada de imagen es un requisito, cuando ya dependes del comportamiento documentado de la API de OpenAI o cuando el coste de un fallo hace razonable pagar más por comprobar si la señal agregada de calidad se reproduce en tu caso. Para entradas superiores a 272K, incluye el multiplicador de precio desde el principio.
No lo sustituyas por Luna para abaratar el experimento y luego atribuyas el resultado a Sol. Luna puede merecer una evaluación distinta, pero responde a otra comparación.
Prueba ambos antes de decidir
Hazlo cuando la calidad de código, planificación o uso de herramientas define el producto y ninguna capacidad documentada elimina a uno. Este es el caso en el que un ganador declarado por especificaciones resulta menos fiable. Un test pequeño y bien instrumentado vale más que otra tabla de benchmarks sin tu harness.
Lo que esta comparación no puede confirmar
Las fuentes globales no establecen para España los métodos de pago, IVA, cuotas, residencia de datos, soporte o latencia de red. Confirma esas condiciones en tu cuenta y contrato antes de comprometer una arquitectura. Tampoco se ha verificado que la versión de pesos públicos de DeepSeek y el servicio API sean intercambiables.
Sobre todo, no se encontró una prueba independiente y reproducible de DeepSeek V4 Pro 0813 y GPT-5.6 Sol con el mismo proveedor, esfuerzo, banco de pruebas, tareas, repeticiones y base de precio. Por eso la conclusión correcta no es “empate” ni “uno gana”: es una prioridad de prueba basada en restricciones.
Si el coste por token es tu restricción principal, comienza por DeepSeek V4 Pro 0813 y exige una tasa de aceptación suficiente. Si necesitas imagen o un requisito específico del contrato de Sol, comienza por GPT-5.6 Sol. Si buscas el mejor modelo para programar o ejecutar agentes, ejecuta ambos sobre las mismas tareas y deja que el coste por resultado aceptado —no el nombre del tier— cierre la decisión.



