처음 시험할 모델만 빠르게 정한다면 다음 기준이 실용적입니다.
- 실패 비용이 큰 최고난도 장기 작업은 Claude Fable 5부터 봅니다.
- 고난도 성능과 작업 경제성을 함께 보려면 GPT-5.6 Sol부터 봅니다.
- 속도, 멀티모달 입력, 대량 처리가 우선이면 Gemini 3.6 Flash부터 봅니다.
이 결론은 순위가 아니라 시험 순서입니다. 여기서 비교하는 Gemini는 이전 3.5 계열이 아니라 안정 버전 ID gemini-3.6-flash입니다. 동일한 도구, 시간, 예산, 합격 기준에서 가장 낮은 성공 비용으로 안정적으로 통과하는 모델이 실제 선택입니다.
점수를 보기 전에 API 조건을 맞춰 보세요
2026년 8월 7일 기준 세 모델은 모두 약 100만 token의 컨텍스트를 제공합니다. 하지만 출력 한도, 입력 형식, 추론 제어, 가격과 실패 동작은 다릅니다.
| 비교 기준 | GPT-5.6 Sol | Claude Fable 5 | Gemini 3.6 Flash |
|---|---|---|---|
| 공식 API ID | gpt-5.6-sol, gpt-5.6은 별칭 | claude-fable-5 | gemini-3.6-flash |
| 입력 / 출력 요금 | $5 / $30, 100만 token | $10 / $50, 100만 token | $1.50 / $7.50, 100만 token |
| 컨텍스트 창 | 1,050,000 | 1,000,000 | 1,048,576 |
| 최대 출력 | 128,000 | 128,000 | 65,536 |
| 공식 모델 페이지의 입력 형식 | 텍스트, 이미지 | 텍스트, 이미지 | 텍스트, 이미지, 영상, 오디오, PDF |
| 추론 방식 | 추론 단계 조절 | adaptive thinking 상시 활성화 | thinking 지원, 기본값 medium |
| 구현 시 주의 | 272k 초과 입력은 장문 요금 | 거부가 HTTP 200일 수 있음 | thinking은 출력 과금, 도구는 별도 비용 가능 |
공식 수치는 OpenAI Sol 모델 문서, Anthropic 모델 개요, Fable 5 통합 문서, Google Gemini 3.6 Flash 모델 문서에서 확인했습니다. 입력 형식 행은 공식 모델 페이지 기준입니다. Claude API의 PDF 문서 블록과 Sol의 파일 검색 같은 기능은 API 작업 기능으로 분리해 봐야 합니다. 표의 숫자는 공식 API 기본 USD 요금이며 ChatGPT, Claude.ai, Gemini 앱 구독 가격이 아닙니다. 세금, 제3자 경로, 우선·일괄 처리, 캐시, 도구 비용도 별도입니다.
큰 컨텍스트가 곧 긴 작업 성공을 뜻하지는 않습니다. 불필요한 파일, 긴 도구 실행 기록, 지시문 위치, 출력 예산이 검색과 판단을 방해할 수 있습니다. 먼저 입력을 정리한 뒤 모델 차이를 평가해야 합니다.

세 모델은 서로 다른 여유를 제공합니다
Fable 5는 어려운 장기 작업의 상한을 노립니다
Anthropic은 Fable 5를 가장 어려운 코딩과 지식 작업용으로 설명합니다. 1M 컨텍스트, 128k 출력, 상시 adaptive thinking은 대규모 이전, 여러 단계의 조사, 복잡한 문서 판단, 장시간 에이전트 작업에 적합한지 먼저 시험할 이유가 됩니다.
기본 요금 $10/$50은 세 모델 중 가장 높습니다. 한 번의 잘못된 설계나 누락 때문에 생기는 재작업 비용이 token 차액보다 클 때 이 추가 비용이 의미가 있습니다.
통합에서는 거부 처리를 따로 구현해야 합니다. 안전 분류기가 요청을 거부하면 HTTP 200과 stop_reason: "refusal"이 올 수 있습니다. HTTP 성공을 작업 성공으로 처리하지 말고, 요청 축소, 사람 검토, 허용된 대체 모델로 분기해야 합니다.
Sol은 복잡한 작업을 확장하기 좋은 기본 후보입니다
GPT-5.6 Sol의 기본 요금은 $5/$30입니다. 텍스트와 이미지를 입력하고 Responses API에서 웹·파일 검색, 코드 실행, 호스팅 셸, computer use, MCP 등 다양한 도구를 사용할 수 있습니다. 실제 지원은 API 접속점, 계정과 정책에 따라 달라집니다.
복잡한 코딩 에이전트, 전문 분석, 도구가 많은 장기 작업, 문서와 스프레드시트 산출물을 규모화할 때 먼저 비교하기 좋습니다. Fable보다 기본 단가가 낮고 현재 독립 종합 지표에서는 근접해 있어 성능과 비용 사이의 실용적인 출발점이 됩니다.
Sol은 272k를 넘는 입력에 장문 배율을 적용합니다. 전체 저장소를 매번 넣기보다 검색 범위, 관련 파일과 작업 기록을 줄이는 편이 비용과 정확도 모두에 도움이 될 수 있습니다.
Gemini 3.6 Flash는 반복 횟수와 다양한 입력을 확보합니다
표준 유료 Gemini API의 가격은 $1.50/$7.50입니다. 텍스트, 이미지, 영상, 오디오, PDF를 입력하고 텍스트를 출력합니다. 함수 호출, 코드 실행, 파일 검색, URL 컨텍스트, Google 검색·지도 연동, 구조화 출력과 미리보기 단계의 computer use를 지원합니다.
영상·오디오 이해, 문서 추출, 분류, 짧은 에이전트 반복 작업, 일반 사례를 저렴하게 처리하고 어려운 사례만 상위 모델로 보내는 구조에 잘 맞습니다. 최대 출력은 65,536으로 Sol과 Fable의 128k보다 작으므로 매우 긴 단일 산출물에는 제한이 됩니다.
Flash는 종합 점수 1위일 필요가 없습니다. 필요한 품질선을 빠르고 싸게 넘으면 대량 운영에서 더 좋은 선택입니다.
API 단가를 성공 작업당 비용으로 바꾸세요
한 번의 실행이 입력 100,000 token과 출력 20,000 token을 사용한다고 가정합니다. 캐시, 도구, 재시도, 특별 처리 요금을 제외하면 다음과 같습니다.
text기본 실행 비용 = 입력 token / 1,000,000 × 입력 단가 + 출력 token / 1,000,000 × 출력 단가
| 모델 | 계산 | 기본 실행 비용 |
|---|---|---|
| GPT-5.6 Sol | 0.1 × $5 + 0.02 × $30 | $1.10 |
| Claude Fable 5 | 0.1 × $10 + 0.02 × $50 | $2.00 |
| Gemini 3.6 Flash | 0.1 × $1.50 + 0.02 × $7.50 | $0.30 |
실제 비용에는 추론과 생성량, 캐시 쓰기·읽기, 도구, 장문·우선 처리 요금, 시간 초과, 거부, 잘못된 JSON, 재시도와 사람 검토가 들어갑니다.
text성공 작업당 비용 = (모든 실행 비용 + 도구 비용 + 검토 비용) / 합격한 작업 수
Gemini가 네 번째 실행에서 합격하고 Sol은 한 번에 합격한다면 $0.30과 $1.10의 차이는 거의 사라집니다. 반대로 두 모델이 구조화 추출을 한 번에 통과하면 Flash의 가격과 처리량 이점이 그대로 남습니다.

독립 수치는 실행 설정과 함께 읽어야 합니다
Artificial Analysis의 Fable 5 페이지, Sol 페이지, Gemini 페이지를 2026년 8월 7일 확인했을 때 Intelligence Index v4.1.1 점수는 각각 62, 61, 52였습니다. Fable은 최대 추론 강도의 adaptive thinking과 Opus 4.8 대체 실행을 포함하고, Sol은 max, Gemini는 high 설정입니다. 완전히 같은 조건이 아니며 이 변동 수치만으로 실제 업무의 승자를 정할 수 없습니다.
같은 페이지의 출력 처리량은 Fable 약 67 tokens/s, Sol 62.9, Gemini 219.2였습니다. 이 숫자는 출력이 시작된 뒤의 속도이며 첫 token 지연이나 추론과 도구를 포함한 전체 완료 시간이 아닙니다. 구매나 이전 전에 각 모델 페이지를 다시 확인해야 합니다.
Quesma의 Baba Is You 실험에서는 후반 단계에서 Fable과 Sol이 각각 14개 중 13개 단계를 풀었고, Fable은 더 빨랐으며 Sol은 더 저렴했습니다. Gemini 3.6 Flash는 시험하지 않았고 후반에는 모델별 시험 환경을 사용했습니다. 이 사례는 승자가 아니라 시험 환경, token 사용량, 성공률과 비용을 함께 기록해야 한다는 점을 보여 줍니다.
실제 업무로 작은 공정 테스트를 만드세요
- 실제 업무에서 6~12개를 고릅니다. 일반 사례, 긴 컨텍스트, 과거 실패 사례를 포함하고 비밀 정보는 제거합니다.
- 실행 전에 합격 기준을 씁니다. 테스트 통과, 무관한 파일 미변경, 링크 접근 가능, JSON이 정해진 구조와 일치하는지처럼 관찰 가능한 조건을 정합니다.
- 입력 자료, 도구 권한, 제한 시간과 최대 예산을 동일하게 맞추고 모델 ID와 추론 단계를 기록합니다.
- 각 작업을 최소 세 번 반복해 첫 실행 성공률, 최종 성공률, 사람 개입 횟수를 비교합니다.
- 입력, 출력, 추론, 캐시, 도구 호출, 거부, 시간 초과, 재시도, 첫 token까지의 시간과 전체 시간을 분리해 저장합니다.
- 품질선 미달 모델을 먼저 제외한 뒤 합격 후보의 성공 작업당 비용과 실패 처리 난이도를 비교합니다.
고위험 작업의 첫 실행 성공률이 기준보다 낮다면 낮은 token 단가만으로 운영에 넣지 않습니다. 두 모델의 품질 차이가 실무에서 의미 있는 범위보다 작다면 더 낮은 합격 비용과 예측 가능한 실패 경로를 선택합니다.
의료, 법률, 금융, 보안에는 이 작은 테스트만으로 부족합니다. 데이터셋과 전문 검토를 확대해야 합니다.
최종 선택은 모델 하나보다 업무별 분배에 가깝습니다
| 주된 제약 | 먼저 시험 | 전환 조건 |
|---|---|---|
| 최고난도 코드, 장기 에이전트, 높은 실패 비용 | Claude Fable 5 | 거부, 비용, 시간이 한도를 넘음 |
| 복잡한 전문 작업의 규모화 | GPT-5.6 Sol | 일반 작업은 Flash, 어려운 실패는 Fable이 유리함 |
| 영상·오디오·PDF, 빠른 대량 처리 | Gemini 3.6 Flash | 어려운 사례가 합격 기준을 통과하지 못함 |
| 구조화 추출과 분류 | Gemini 3.6 Flash | 재시도가 절감액을 없앰 |
| 정책 민감 작업 | 통제 방식에 따라 결정 | 거부·대체 모델·사람 검토 절차가 없음 |
OpenAI 호출 방식과 호환되는 한 인터페이스에서 동일 입력을 초기에 비교하려는 개발자는 LaoZhang API 모델 목록을 참고할 수 있습니다. 문서에는 세 ID가 있지만 관리 화면에서 이용 그룹, 지역, 가격, 사용 가능 여부를 확인해야 합니다. 최신 고유 도구와 공급사 동작이 필요하면 공식 API 직접 연결이 기준입니다.
오래가는 운영 방식은 “항상 한 모델”이 아니라 두 단계 업무 분배입니다. 품질선을 넘는 가장 저렴한 모델이 일반 작업을 맡고, 실패하거나 위험한 사례만 더 강한 모델로 올립니다. 이 기준은 다음 순위표 변화 뒤에도 유지할 수 있습니다.



