AIFreeAPI Logo

GPT-5.6 Sol vs Claude Fable 5 비교: 코딩 성능·가격·선택 가이드

A
5 min readAI 모델 비교

검수가 명확하고 비용에 민감한 코딩은 Codex + Sol부터 시험하세요. Fable + Claude Code는 복합 작업에서 개입과 재작업을 줄일 때 선택합니다.

한 저장소에서 Codex의 GPT-5.6 Sol과 Claude Code의 Fable 5를 비교하는 모습

결론부터 말하면:tests와 완료 조건이 명확하고 반복 비용이 중요하면 Codex + GPT-5.6 Sol을 먼저 시험하세요. 긴 migration이나 복합 구현에는 Claude Code + Fable 5도 후보지만, 같은 저장소 work sample에서 사람의 개입과 재작업을 확실히 줄일 때만 더 높은 비용을 선택할 이유가 생깁니다.

비교 단위는 benchmark 점수나 생성 코드 줄 수가 아닙니다. 팀의 검수 기준을 통과한 수용 가능한 diff 한 건의 총비용입니다.

아래 가격과 접근 조건은 2026년 8월 5일 확인 기준이며 바뀔 수 있습니다.

GPT-5.6 Sol과 Claude Fable 5의 핵심 차이와 업무별 선택

작은 bugfix, 테스트 추가, 경계가 선명한 feature라면 Sol을 먼저 시험하는 편이 합리적입니다. 반대로 여러 단계의 migration이나 설계 판단이 계속 필요한 작업이라면 Fable을 첫 후보로 둘 수 있습니다. 어느 쪽이든 flagship이 필요 없는 정형 작업은 더 작은 tier가 같은 검수를 통과하는지 먼저 봐야 합니다.

이 첫 선택은 최종 판정이 아니라 가설입니다. 다음 네 계층을 분리해야 결과를 제대로 읽을 수 있습니다.

계층GPT-5.6 Sol 쪽Claude Fable 5 쪽왜 중요한가
모델gpt-5.6-sol, gpt-5.6 aliasclaude-fable-5순수 API 비교에 가장 가까움
API1.05M context, 128K max output1M context, 최대 128K output크기는 비슷하지만 refusal 의미가 다름
에이전트 하네스Codex의 tools, approvals, skills, agent modesClaude Code의 permissions, hooks, skills, tools최종 diff를 크게 바꾸는 계층
과금 meterCodex credits 또는 API USDClaude limits/usage credits 또는 API USD크레딧과 달러는 같은 단위가 아님
모델, API, 에이전트 하네스, 과금 meter의 네 계층
모델, API, 에이전트 하네스, 과금 meter의 네 계층

OpenAI의 현재 안내에서 Codex Plus, Pro, Business, Enterprise 사용자는 Sol/Terra/Luna를 고를 수 있고 Free/Go는 Terra를 사용합니다. Sol의 token-based rate card는 MTok당 125 input credits, 12.5 cached-input credits, 750 output credits입니다. Ultra는 별도 모델 가격이 아닙니다. 추가 agent가 사용한 token도 credits를 소비합니다.

Claude Code는 Claude 유료 plan에 포함되며 다른 Claude surface와 usage pool을 공유합니다. 현재 표에서 Fable은 Pro에서 usage credits, Max 5x/20x에서는 최대 주간 한도의 50%를 씁니다. 계정에 접근 권한이 있으면 /model 또는 claude --model claude-fable-5로 선택할 수 있습니다.

실험 전에 model picker와 status, workspace admin 설정을 확인하세요. 한쪽만 사용할 수 없거나 승인되지 않은 과금 pool을 쓴다면 품질 비교를 시작할 조건부터 맞지 않습니다.

API 가격 비교: 272K 입력을 넘으면 비용이 어떻게 달라지나?

직접 API에서 input이 272K 이하일 때 표준 가격은 다음과 같습니다.

1M tokens당GPT-5.6 SolClaude Fable 5
Input$5$10
Cached input read$0.50$1
Output$30$50
Context / max output1.05M / 128K1M / 최대 128K

캐시가 없는 100K input + 20K output 작업을 계산하면:

  • Sol:0.1 × \$5 + 0.02 × \$30 = \$1.10
  • Fable:0.1 × \$10 + 0.02 × \$50 = \$2.00

이는 API 예시이며 Codex 또는 Claude 구독 session 가격이 아닙니다. tools, cache write, retries, 지역 inference, 세금, 추가 agent 비용을 제외했습니다.

GPT-5.6 Sol 공식 model page에는 중요한 경계가 있습니다. input이 272K를 넘으면 전체 request가 input 2배, output 1.5배로 계산됩니다. 실효 단가는 $10 input/$45 output이 됩니다. Fable의 표준 $10/$50과 비교하면 Sol의 input 우위는 사라지고 output 차이도 작아집니다.

1M context를 지원한다고 저장소 전체를 넣을 필요는 없습니다. 관련 파일, 짧은 handoff, 중복 없는 로그가 모델 교체보다 더 큰 비용 절감을 만들 수 있습니다.

코딩 성능은 누가 앞서나? 멀티 에이전트와 benchmark의 함정

한국어 비교 콘텐츠에서 Ultra의 여러 agent와 Claude Code 한 session을 나란히 놓는 경우가 많습니다. 제품 조합을 비교하는 실험으로는 의미가 있지만, 그 결과를 “Sol 모델이 Fable 모델보다 빠르다”라고 바꾸면 안 됩니다.

OpenAI가 7월 9일 공개한 표에서도 결과가 한 방향이 아닙니다. Artificial Analysis Coding Agent Index는 Sol 80, Fable 77.2지만 SWE-Bench Pro는 Sol 64.6%, Fable 80%입니다.

순위를 바꾸는 조건은 많습니다.

  • reasoning effort와 agent 수
  • repo instructions, permissions, MCP, shell, compaction
  • 첫 응답 시간인지, 검수 완료 시간인지
  • 예쁜 demo인지, tests와 유지보수까지 통과한 결과인지

따라서 benchmark는 첫 후보를 고르는 자료이고, 주력 도구는 실제 저장소의 acceptance suite가 결정합니다.

Codex와 Claude Code를 공정하게 테스트하는 방법

세 개의 대표 작업을 고르면 우연을 줄일 수 있습니다. 예를 들면 작은 bugfix, 여러 파일을 건드리는 feature, 긴 refactor입니다. 세 작업을 모두 돌릴 필요가 없다면 가장 자주 돈을 쓰는 유형 하나부터 시작하세요.

같은 작업·commit·권한·시간 제한을 고정한다

같은 commit과 clean worktree에서 시작합니다. 요구사항, 수정 가능 범위, 실행 명령, permission, timebox, definition of done을 동일하게 줍니다. 한쪽만 성숙한 project instruction이나 도구를 받으면 모델이 아니라 팀 설정을 비교하게 됩니다.

model ID, effort/agent mode, 제품 version, 과금 meter도 기록합니다. Codex Ultra와 Claude Code 단일 session의 결과에는 “제품 configuration 비교”라고 표시합니다.

대화가 아니라 검수를 통과한 코드 변경을 본다

실제 merge 전에 필요한 검사를 실행합니다.

  • build, unit/integration tests, lint, type check
  • 필요할 때 migration과 security check
  • UI 작업의 browser/visual 검수
  • 불필요한 scope와 숨은 동작, 유지보수성에 대한 diff review
  • 작업 고유의 업무 완료 조건

첫 시도가 실패하면 같은 종류의 수정 기회를 줍니다. 질문, approval, 수동 수정, restart는 모두 human intervention으로 셉니다.

수용된 변경 1건당 비용을 계산한다

항목기록할 내용
Accepted diffpass/fail과 실패한 검사
Human intervention질문, 승인, 수동 수정, restart
Wall time시작부터 검수 합격까지
Metertokens, Codex credits, Claude usage credits
Reworkreview 뒤 삭제·재작성한 코드
운영 마찰refusal, permission block, context/tool failure
세 라운드에서 수용 가능한 diff와 비용을 측정하는 scorecard
세 라운드에서 수용 가능한 diff와 비용을 측정하는 scorecard

싸지만 실패한 run은 싸지 않습니다. 비싼 run도 사람의 감독과 재작업을 안정적으로 줄이면 총비용이 낮을 수 있습니다. 다만 차이가 일반적인 run 변동이나 instructions/hooks/MCP를 옮기는 비용보다 작으면 전환을 멈추는 것이 낫습니다.

Fable 5 refusal과 fallback을 평가에 반영하는 방법

Fable 5에는 safety classifier가 있습니다. Anthropic 문서에 따르면 일부 거절은 transport error가 아니라 HTTP 200과 stop_reason: "refusal"로 옵니다. output 전에 거절되면 청구되지 않으며 server-side, SDK, 수동 fallback 경로가 제공됩니다.

API 통합은 정상 응답을 parse하기 전에 stop reason을 확인해야 합니다. fallback이 다른 모델을 사용했다면 그 결과를 Fable 단독 성과로 세면 안 됩니다. Claude Code에서 security 작업이 막힌 경우도 reasoning 실패가 아니라 제품 policy 결과로 기록하세요.

Sol에도 safeguards가 있습니다. security 작업은 허가된 환경, 허용 tools, 방어적 산출물을 먼저 정의해야 하며 모델 비교가 제한 우회 수단이 되어서는 안 됩니다.

업무별 선택: Sol, Fable 5, 더 저렴한 모델

Sol을 먼저 선택할 작업:명확한 tests가 있는 짧은 구현, 비용 민감한 반복, Codex instructions와 검증 경로가 이미 준비된 일입니다.

Fable을 먼저 선택할 작업:장기 migration이나 복합 구현, 성숙한 Claude Code hooks/permissions가 있는 repo, 그리고 실제 sample에서 재작업 감소가 확인된 일입니다. 계정 접근과 credits 승인도 필요합니다.

flagship을 쓰지 않을 작업:정형·대량·latency 중심 작업이며 작은 tier가 같은 acceptance suite를 통과하는 경우입니다. OpenAI Terra/Luna와 다른 Claude tier도 같은 scorecard로 시험하세요.

오늘의 실용적인 default는 Codex + Sol에 대표 work sample 한 건을 먼저 맡기는 것입니다. 272K 아래 표준 API 단가가 낮기 때문입니다. 그러나 두 번째 대표 작업에서도 Fable이 개입과 재작업을 줄인다면 Claude Code + Fable을 주력으로 둘 근거가 생깁니다.

결제 전 GPT-5.6 Sol 공식 페이지, Codex rate card, Claude Fable, Claude pricing을 다시 확인하세요. 모델이 아니라 local supervision, cloud delegation, permissions와 handoff를 비교하려면 Claude Code vs Codex 워크플로 비교가 더 적합합니다.