Si solo quieres decidir qué modelo probar primero, usa este punto de partida:
- Claude Fable 5 para trabajos extremadamente difíciles, largos y caros de fallar.
- GPT-5.6 Sol para buscar capacidad de frontera sin pagar siempre la tarifa más alta.
- Gemini 3.6 Flash para mucho volumen, respuesta rápida y entradas de vídeo, audio o PDF además de texto e imagen.
Eso no convierte a ninguno en ganador absoluto. La elección final es el modelo que supera tu criterio de aceptación con menos coste total, contando herramientas, reintentos y fallos, no solo el precio de los tokens.
Primero iguala las condiciones de la comparación
A 6 de agosto de 2026, los tres ofrecen una ventana de contexto cercana al millón de tokens. Ahí termina la similitud simple: cambian la salida máxima, los tipos de entrada, el control del razonamiento, las herramientas y la forma de detectar algunos fallos.
| Criterio | GPT-5.6 Sol | Claude Fable 5 | Gemini 3.6 Flash |
|---|---|---|---|
| ID oficial de API | gpt-5.6-sol (gpt-5.6 es alias) | claude-fable-5 | gemini-3.6-flash |
| Entrada / salida | $5 / $30 por millón de tokens | $10 / $50 por millón de tokens | $1,50 / $7,50 por millón de tokens |
| Ventana de contexto | 1.050.000 | 1.000.000 | 1.048.576 |
| Salida máxima | 128.000 | 128.000 | 65.536 |
| Entradas principales | Texto e imagen | Texto, imagen y documentos | Texto, imagen, vídeo, audio y PDF |
| Razonamiento | Nivel de esfuerzo configurable | Adaptive thinking siempre activo | Thinking compatible; nivel medium por defecto |
| Atención al integrar | La entrada larga puede usar otra tarifa | Un rechazo puede llegar con HTTP 200 | Thinking cuenta como salida; algunas tools cuestan aparte |
Las cifras proceden de la documentación oficial de GPT-5.6 Sol, Claude Fable 5 y Gemini 3.6 Flash, junto con la tarifa de Gemini API. Son precios base de API en USD, no suscripciones de ChatGPT, Claude.ai o Gemini. Tampoco incluyen impuestos, prioridad, batch, caché, marketplaces ni gateways.
La tabla sirve para diseñar una prueba justa. No demuestra qué modelo resolverá mejor tu repositorio, tus documentos o tus llamadas a herramientas.

Convierte la tarifa en coste por tarea completada
Una petición con 100.000 tokens de entrada y 20.000 de salida cuesta, aplicando solo las tarifas base:
- GPT-5.6 Sol:
0,1 × $5 + 0,02 × $30 = $1,10. - Claude Fable 5:
0,1 × $10 + 0,02 × $50 = $2,00. - Gemini 3.6 Flash:
0,1 × $1,50 + 0,02 × $7,50 = $0,30.
Gemini es el más barato en este cálculo, pero la factura útil es otra:
coste por tarea completada = coste total de todas las ejecuciones / número de tareas que superan la rúbrica
Supón 100 tareas. Un modelo de $0,30 por intento que solo completa 60 cuesta $0,50 por éxito, antes de tools. Uno de $1,10 que completa 90 cuesta unos $1,22. Ninguno de esos resultados se puede inferir de la tarifa: necesitas medirlo con tu carga.
Incluye en el numerador:
- tokens no almacenados en caché y tokens de salida o razonamiento;
- llamadas a búsqueda, ejecución de código, ordenador u otras herramientas;
- reintentos por formato inválido, timeout, rechazo o resultado incompleto;
- ejecuciones del modelo alternativo cuando hay escalado;
- tiempo de infraestructura y, si importa, revisión humana.
En Fable 5, una negativa del clasificador puede responder HTTP 200 con stop_reason: "refusal". Si tu cliente solo vigila los códigos 4xx o 5xx, contará un fallo como éxito técnico. En Gemini, los tokens de thinking se facturan como salida y algunas funciones tienen cargos propios. En Sol, las entradas por encima de 272.000 tokens pueden entrar en la tarifa de contexto largo. Estas diferencias cambian el coste por éxito incluso cuando el precio visible parece claro.

Qué dicen las mediciones independientes, y qué no dicen
El índice v4.1 de Artificial Analysis mostraba 60 puntos para Fable 5 con fallback a Opus 4.8, 59 para Sol con esfuerzo máximo y 50 para Gemini 3.6 Flash con thinking alto. En esas configuraciones, el throughput observado era aproximadamente 73,5, 65,9 y 200,5 tokens por segundo, respectivamente.
Son señales útiles, no una clasificación universal. La configuración de Fable incluye otro modelo como fallback, y los niveles de razonamiento no son equivalentes. Además, tokens por segundo mide la producción una vez iniciada; no es tiempo al primer token, latencia completa, duración de tools ni garantía para tu región.
Un experimento de Quesma con Baba Is You ofrece otra lección: Fable 5 y Sol resolvieron 13 de 14 niveles tardíos, Fable fue 3,1 veces más rápido y Sol un 47 % más barato. Gemini 3.6 Flash no participó, y las versiones posteriores usaron harness específicos para cada modelo. El dato no permite declarar un ganador; muestra por qué el arnés, el tiempo y el coste de una tarea completa deben medirse juntos.
Cuándo probar cada modelo primero
Empieza por Claude Fable 5 si fallar es lo más caro
Fable encaja como primer candidato para una migración grande, una sesión de programación de muchas horas, investigación extensa o una cadena de decisiones donde perder el estado obliga a repetir trabajo costoso. Su contexto y salida de 128k ayudan en entregables largos, y Anthropic lo posiciona precisamente para los trabajos de código y conocimiento más difíciles.
La contrapartida es la tarifa más alta del grupo y un razonamiento adaptativo siempre activo. Exige que la mejora en tasa de éxito, continuidad o tiempo total compense ese coste. También implementa el tratamiento explícito de stop_reason: "refusal" y un modelo alternativo antes de ponerlo en producción.
Empieza por GPT-5.6 Sol si buscas el equilibrio de frontera
Sol es el punto de partida razonable cuando necesitas programación compleja, investigación con herramientas o trabajo profesional largo, pero Fable no ha demostrado todavía una ventaja suficiente en tu conjunto. Tiene salida de 128k, esfuerzo de razonamiento configurable y una gama amplia de herramientas en Responses API.
Su tarifa del ejemplo es un 45 % menor que la de Fable, aunque sigue muy por encima de Flash. Prueba varios niveles de esfuerzo: usar siempre el máximo puede aumentar coste y latencia sin mejorar los casos fáciles. Si el prompt supera 272k tokens, vuelve a calcular con la regla de contexto largo en lugar de extrapolar la tarifa corta.
Empieza por Gemini 3.6 Flash si mandan el volumen y lo multimodal
Flash es el candidato natural para clasificar grandes lotes, extraer información, responder con baja demora o analizar entradas que ya incluyen vídeo y audio. La salida máxima de 65.536 tokens es menor, pero suficiente para muchas tareas de producción. Su precio base y throughput observado permiten ensayar más casos con el mismo presupuesto.
No necesita liderar un índice general. Si supera tu calidad mínima de forma consistente, puede ofrecer mejor economía operativa. Comprueba, eso sí, la precisión de herramientas, el coste de thinking y grounding, y la tasa de reintento; una respuesta rápida e incorrecta sigue siendo un fallo.
Diseña una prueba pequeña que pueda decidir
No empieces con miles de peticiones. Reúne entre 20 y 50 tareas representativas, incluyendo casos normales, límites y fallos frecuentes. Antes de ejecutar nada, escribe una rúbrica binaria o puntuable: exactitud, formato, uso de tools, completitud, seguridad y tiempo máximo.
Ejecuta después el mismo conjunto con:
- el mismo contexto disponible y las mismas herramientas;
- un presupuesto de tiempo y tokens comparable;
- varios intentos por caso si la variabilidad importa;
- niveles de razonamiento documentados, no ocultos en un preset;
- registro de calidad, tiempo al primer token, tiempo total, tokens, tools, reintentos y refusals.
Define la regla de parada de antemano. Por ejemplo: descartar cualquier opción por debajo del 90 % de tareas válidas; entre las restantes, elegir la de menor coste por éxito siempre que el percentil 95 de latencia cumpla el objetivo. Así evitas cambiar la métrica cuando aparece un resultado atractivo.
Para operar a escala, una ruta de dos niveles suele ser más robusta que escoger un único modelo para todo. Envía el trabajo ordinario al modelo más barato que supere el umbral y escala los fallos, los casos de alto riesgo o los contextos extremos a uno más fuerte. Esa regla también permite cambiar de proveedor sin reescribir el criterio de negocio.
Puedes probar las APIs oficiales por separado. Si prefieres una interfaz compatible para el ensayo, la documentación de LaoZhang API enumera actualmente los tres IDs; confirma en la consola el grupo de token, la región, la disponibilidad y el precio antes de ejecutar, porque el gateway no sustituye la información oficial del proveedor.
La respuesta corta sigue siendo condicional: Fable 5 para el fallo más caro, Sol para el equilibrio de frontera y Gemini 3.6 Flash para volumen multimodal. La respuesta defendible llega después de la prueba: gana el que supera tu rúbrica con el menor coste por tarea completada.
