처음 시험할 모델만 빠르게 정한다면 다음 기준이 실용적입니다.
- 실패 비용이 큰 최고난도 장기 작업은 Claude Fable 5부터 봅니다.
- frontier 성능과 작업 경제성을 함께 보려면 GPT-5.6 Sol부터 봅니다.
- 속도, 멀티모달 입력, 대량 처리가 우선이면 Gemini 3.6 Flash부터 봅니다.
이 결론은 순위가 아니라 시험 순서입니다. 동일한 도구, 시간, 예산, 합격 기준에서 가장 낮은 성공 비용으로 안정적으로 통과하는 모델이 실제 선택입니다.
점수를 보기 전에 API 조건을 맞춰 보세요
2026년 8월 6일 기준 세 모델은 모두 약 100만 token의 컨텍스트를 제공합니다. 하지만 출력 한도, 입력 형식, 추론 제어, 가격과 실패 동작은 다릅니다.
| 비교 기준 | GPT-5.6 Sol | Claude Fable 5 | Gemini 3.6 Flash |
|---|---|---|---|
| 공식 API ID | gpt-5.6-sol, gpt-5.6은 alias | claude-fable-5 | gemini-3.6-flash |
| 입력 / 출력 요금 | $5 / $30, 100만 token | $10 / $50, 100만 token | $1.50 / $7.50, 100만 token |
| 컨텍스트 창 | 1,050,000 | 1,000,000 | 1,048,576 |
| 최대 출력 | 128,000 | 128,000 | 65,536 |
| 주요 입력 | 텍스트, 이미지 | 텍스트, 이미지, 문서 | 텍스트, 이미지, 영상, 오디오, PDF |
| 추론 방식 | effort 조절 | adaptive thinking 상시 활성화 | thinking 지원, 기본 medium |
| 구현 시 주의 | 272k 초과 입력은 장문 요금 | refusal이 HTTP 200일 수 있음 | thinking은 출력 과금, tool은 별도 비용 가능 |
공식 수치는 OpenAI Sol 모델 문서, Anthropic Fable 5 통합 문서, Google Gemini 3.6 Flash 모델 문서에서 확인했습니다. 표의 숫자는 공식 API 기본 USD 요금이며 ChatGPT, Claude.ai, Gemini 앱 구독 가격이 아닙니다. 세금, marketplace, priority, batch, cache, tool 비용도 별도입니다.
큰 컨텍스트가 곧 긴 작업 성공을 뜻하지는 않습니다. 불필요한 파일, 긴 tool transcript, 지시문 위치, 출력 예산이 검색과 판단을 방해할 수 있습니다. 먼저 입력을 정리한 뒤 모델 차이를 평가해야 합니다.

세 모델은 서로 다른 여유를 제공합니다
Fable 5는 어려운 장기 작업의 상한을 노립니다
Anthropic은 Fable 5를 가장 어려운 코딩과 지식 작업용으로 설명합니다. 1M 컨텍스트, 128k 출력, 상시 adaptive thinking은 대규모 migration, 여러 단계의 research, 복잡한 문서 판단, 장시간 agent 작업에 적합한지 먼저 시험할 이유가 됩니다.
기본 요금 $10/$50은 세 모델 중 가장 높습니다. 한 번의 잘못된 설계나 누락 때문에 생기는 재작업 비용이 token 차액보다 클 때 이 premium이 의미가 있습니다.
통합에서는 거부 처리를 따로 구현해야 합니다. 안전 classifier가 요청을 거부하면 HTTP 200과 stop_reason: "refusal"이 올 수 있습니다. HTTP 성공을 작업 성공으로 처리하지 말고, 요청 축소, 사람 검토, 허용된 fallback으로 분기해야 합니다.
Sol은 복잡한 작업을 확장하기 좋은 기본 후보입니다
GPT-5.6 Sol의 기본 요금은 $5/$30입니다. 텍스트와 이미지를 입력하고 Responses API에서 web/file search, code interpreter, hosted shell, computer use, MCP 등 다양한 도구를 사용할 수 있습니다. 실제 지원은 endpoint, account와 policy에 따라 달라집니다.
복잡한 coding agent, 전문 분석, 도구가 많은 장기 workflow, 문서와 spreadsheet 산출물을 규모화할 때 먼저 비교하기 좋습니다. Fable보다 기본 단가가 낮고 현재 독립 종합 지표에서는 근접해 있어 성능과 비용 사이의 실용적인 출발점이 됩니다.
Sol은 272k를 넘는 입력에 장문 배율을 적용합니다. 전체 repository를 매번 넣기보다 검색 범위, 관련 파일과 history를 줄이는 편이 비용과 정확도 모두에 도움이 될 수 있습니다.
Gemini 3.6 Flash는 반복 횟수와 다양한 입력을 확보합니다
표준 유료 Gemini API의 가격은 $1.50/$7.50입니다. 텍스트, 이미지, 영상, 오디오, PDF를 입력하고 텍스트를 출력합니다. function calling, code execution, file search, URL context, Search/Maps grounding, structured output과 preview computer use를 지원합니다.
영상·오디오 이해, 문서 추출, 분류, 빠른 agent loop, 일반 사례를 저렴하게 처리하고 어려운 사례만 상위 모델로 보내는 구조에 잘 맞습니다. 최대 출력은 65,536으로 Sol과 Fable의 128k보다 작으므로 매우 긴 단일 산출물에는 제한이 됩니다.
Flash는 종합 점수 1위일 필요가 없습니다. 필요한 품질선을 빠르고 싸게 넘으면 대량 production에서 더 좋은 선택입니다.
API 단가를 성공 작업당 비용으로 바꾸세요
한 번의 실행이 입력 100,000 token과 출력 20,000 token을 사용한다고 가정합니다. cache, tools, 재시도, 특별 처리 요금을 제외하면 다음과 같습니다.
text기본 실행 비용 = 입력 token / 1,000,000 × 입력 단가 + 출력 token / 1,000,000 × 출력 단가
| 모델 | 계산 | 기본 실행 비용 |
|---|---|---|
| GPT-5.6 Sol | 0.1 × $5 + 0.02 × $30 | $1.10 |
| Claude Fable 5 | 0.1 × $10 + 0.02 × $50 | $2.00 |
| Gemini 3.6 Flash | 0.1 × $1.50 + 0.02 × $7.50 | $0.30 |
실제 비용에는 reasoning과 생성량, cache write/read, 도구, 장문·priority 요금, timeout, refusal, 잘못된 JSON, 재시도와 사람 검토가 들어갑니다.
text성공 작업당 비용 = (모든 실행 비용 + 도구 비용 + 검토 비용) / 합격한 작업 수
Gemini가 네 번째 실행에서 합격하고 Sol은 한 번에 합격한다면 $0.30과 $1.10의 차이는 거의 사라집니다. 반대로 두 모델이 구조화 추출을 한 번에 통과하면 Flash의 가격과 처리량 이점이 그대로 남습니다.

독립 수치는 실행 설정과 함께 읽어야 합니다
Artificial Analysis Intelligence Index v4.1의 현재 결과는 Fable 5가 60, Sol이 59, Gemini 3.6 Flash가 50입니다. 하지만 Fable은 max effort의 adaptive reasoning과 Opus 4.8 fallback을 포함하고, Sol은 max, Gemini는 high 설정입니다. 완전히 같은 조건이 아닙니다.
같은 기관의 출력 처리량 관측은 Fable 약 73.5 tokens/s, Sol 65.9, Gemini 200.5입니다. 이 숫자는 출력이 시작된 뒤의 속도이며 첫 token 지연이나 추론과 도구를 포함한 전체 완료 시간이 아닙니다.
Quesma의 Baba Is You 실험에서는 후반 단계에서 Fable과 Sol이 각각 14개 중 13개 level을 풀었고, Fable은 더 빨랐으며 Sol은 더 저렴했습니다. Gemini 3.6 Flash는 시험하지 않았고 후반에는 모델별 harness를 사용했습니다. 이 사례는 승자가 아니라 harness, token 사용량, 성공률과 비용을 함께 기록해야 한다는 점을 보여 줍니다.
실제 업무로 작은 공정 테스트를 만드세요
- 실제 업무에서 6~12개를 고릅니다. 일반 사례, 긴 컨텍스트, 과거 실패 사례를 포함하고 비밀 정보는 제거합니다.
- 실행 전에 합격 기준을 씁니다. 테스트 통과, 무관한 파일 미변경, 링크 접근 가능, JSON schema 일치처럼 관찰 가능한 조건을 정합니다.
- 입력 자료, tool 권한, 제한 시간과 최대 예산을 동일하게 맞추고 model ID와 effort를 기록합니다.
- 각 작업을 최소 세 번 반복해 첫 실행 성공률, 최종 성공률, 사람 개입 횟수를 비교합니다.
- input, output, reasoning, cache, tools, refusal, timeout, retries, 첫 token과 전체 시간을 분리해 저장합니다.
- 품질선 미달 모델을 먼저 제외한 뒤 합격 후보의 성공 작업당 비용과 실패 처리 난이도를 비교합니다.
고위험 작업의 first-pass success가 기준보다 낮다면 낮은 token 단가만으로 production에 넣지 않습니다. 두 모델의 품질 차이가 실무에서 의미 있는 범위보다 작다면 더 낮은 합격 비용과 예측 가능한 실패 경로를 선택합니다.
의료, 법률, 금융, 보안에는 이 작은 테스트만으로 부족합니다. 데이터셋과 전문 검토를 확대해야 합니다.
최종 선택은 모델 하나보다 routing 정책에 가깝습니다
| 주된 제약 | 먼저 시험 | 전환 조건 |
|---|---|---|
| 최고난도 코드, 장기 agent, 높은 실패 비용 | Claude Fable 5 | refusal, 비용, 시간이 한도를 넘음 |
| 복잡한 전문 작업의 규모화 | GPT-5.6 Sol | 일반 작업은 Flash, 어려운 실패는 Fable이 유리함 |
| 영상·오디오·PDF, 빠른 대량 처리 | Gemini 3.6 Flash | 어려운 사례가 rubric을 통과하지 못함 |
| 구조화 추출과 분류 | Gemini 3.6 Flash | 재시도가 절감액을 없앰 |
| 정책 민감 작업 | 통제 방식에 따라 결정 | refusal/fallback과 사람 검토가 없음 |
한 OpenAI-compatible 인터페이스에서 동일 입력을 초기에 비교하려는 개발자는 LaoZhang API 모델 목록을 참고할 수 있습니다. 문서에는 세 ID가 있지만 live console에서 token group, region, price, availability를 확인해야 합니다. 최신 native tool과 공급사 고유 동작이 필요하면 공식 API 직접 연결이 기준입니다.
오래가는 운영 방식은 “항상 한 모델”이 아니라 두 단계 routing입니다. 품질선을 넘는 가장 저렴한 모델이 일반 작업을 맡고, 실패하거나 위험한 사례만 더 강한 모델로 올립니다. 이 기준은 다음 leaderboard 변화 뒤에도 유지할 수 있습니다.
