2026년 8월 25일 기준 OpenAI의 최신 범용 텍스트·코드 모델은 GPT-5.6 Sol, Terra, Luna입니다. Sol은 flagship, Terra는 성능과 비용의 균형, Luna는 비용에 민감한 대량 작업을 담당하는 같은 세대의 세 tier입니다.
새 API workload라면 gpt-5.6-terra와 medium 으로 기준선을 만드는 것이 실용적입니다. 복잡한 추론, 코드 변경, 긴 tool chain에서 의미 있는 품질 차이가 확인될 때 Sol을 비교하고, 결과가 안정적이며 자동 검증과 안전한 fallback이 있을 때 Luna를 비용 최적화 후보로 시험합니다.
이 글의 기준은 API입니다. ChatGPT, ChatGPT Work, Codex에서 보이는 이름과 플랜별 접근은 API model ID나 token 요금과 동일하지 않습니다. 이미지, 음성, Realtime, embedding, cyber, open-weight 모델도 별도 task category이므로 현재 범용 텍스트 생성 세 tier와 한 표에 섞지 않습니다.
세 모델의 정확한 API ID
OpenAI 현재 모델 카탈로그는 복잡한 추론과 coding에는 Sol, 지능과 비용의 균형에는 Terra, 비용 중심의 고처리량 작업에는 Luna를 권합니다.
| 모델 | API model ID | 먼저 시험할 작업 | 선택 근거로 부족한 것 |
|---|---|---|---|
| GPT-5.6 Sol | gpt-5.6-sol; gpt-5.6 alias도 Sol로 라우팅 | 복잡한 코드, 긴 도구 체인, 전문 분석, 높은 오류 비용 | flagship이라는 이름 |
| GPT-5.6 Terra | gpt-5.6-terra | 대부분의 신규 앱, structured output, tools, 일상 지식 작업 | 중간 tier라는 인상 |
| GPT-5.6 Luna | gpt-5.6-luna | 분류, 추출, 변환, 검증 가능한 batch | 가장 낮은 token 단가 |
gpt-5.6은 네 번째 모델이 아니라 Sol alias입니다. OpenAI 모델 가이드는 Terra가 이전 GPT-5 family의 mini tier, Luna가 nano tier에 대략 대응한다고 설명합니다. 제품 계층을 이해하기 위한 표현이지 이전 모델과 행동이 같다는 보장은 아닙니다.
세 모델은 모두 reasoning.effort의 none, low, medium, high, xhigh, max를 지원하고 기본값은 medium입니다. 따라서 model tier와 추론 강도는 별도 변수입니다. 먼저 tier를 고른 뒤 acceptance를 만족하는 가장 낮은 effort를 찾아야 품질, latency, 비용을 설명할 수 있습니다.
공통 스펙이 선택을 대신하지 못하는 이유
세 model page는 모두 1,050,000-token context window, 128,000 max output, 2026년 2월 16일 knowledge cutoff를 표시합니다. text와 image를 입력하고 text를 출력하며 streaming, function calling, structured outputs, Responses API tools를 지원합니다.
따라서 context가 더 크다는 이유로 Sol을 선택할 수는 없습니다. 공개 context는 세 tier가 같고, 실제 차이는 대표 작업에서의 first-pass acceptance, human correction, reasoning/output token, tool correctness, retry와 latency에서 나타납니다.
OpenAI는 GPT-5.6 발표 페이지에 coding, knowledge work, browsing, tool use, science 등의 결과를 공개했습니다. 이는 공급자가 발표한 평가이지 이 Blog의 독립 테스트나 사용자의 production 결과가 아닙니다. 모델 후보를 좁히는 근거는 되지만 routing 결정은 같은 acceptance set에서 다시 확인해야 합니다.
모든 후보 설정에서 다음을 함께 기록합니다.
- first-pass 합격률과 사람의 수정량
- input, cached input, output, reasoning token
- tool 선택과 arguments의 정확성, retry 횟수
- P50/P95 latency, timeout, 운영 오류
- 요청당 비용이 아니라 “합격한 작업 1건”의 비용
Luna가 schema 검증을 한 번에 통과하면 낮은 요금을 그대로 활용할 수 있습니다. 하지만 오류를 찾기 어렵고 재시도나 검수가 늘면 낮은 token 단가가 낮은 완료 비용을 보장하지 않습니다.
2026년 8월 API 가격
공식 model page의 현재 text token 가격은 100만 token당 다음과 같습니다.
| 모델 | Input | Cached input | Output | 상태 |
|---|---|---|---|---|
| GPT-5.6 Sol | $4.00 | $0.40 | $20.00 | 최소 2026-11-21까지 프로모션 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 | 현재 표준가 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 | 현재 표준가 |
출처: Sol, Terra, Luna. Sol의 $4/$20은 영구 요금이 아니라 최소 2026년 11월 21일까지의 프로모션입니다. 장기 예산에는 가격 재확인 날짜가 필요합니다.
동일하게 input 100,000 token과 output 10,000 token을 쓰고 cache, tool, long-context multiplier가 없다면:
- Sol:
0.1 × $4 + 0.01 × $20 = $0.60 - Terra:
0.1 × $2 + 0.01 × $12 = $0.32 - Luna:
0.1 × $0.20 + 0.01 × $1.20 = $0.032
같은 token 양의 요금 비교일 뿐, 같은 결과의 비용 보장은 아닙니다. Input이 272K token을 넘으면 전체 request가 input 2배, output 1.5배로 청구됩니다. 명시적 cache write는 uncached input의 1.25배, 성공한 cache read는 90% 할인입니다. Web search나 computer use 같은 tool은 별도 call charge가 생길 수 있습니다.
Sol: 실패 비용이 단가보다 클 때
여러 파일의 코드 변경, 다중 제약 분석, 장시간 agent 작업, 복잡한 tool coordination, 오류 후 재작업이 비싼 전문 deliverable에서는 Sol을 평가할 가치가 있습니다. Sol을 quality ceiling으로 삼아 Terra가 실제로 얼마나 가까이 오는지도 측정할 수 있습니다.
정해진 label 분류나 짧은 normalization이 낮은 tier에서 이미 안정적이라면 flagship 자체는 관찰 가능한 이점이 아닙니다.
Terra: 신규 시스템의 기준선
Terra는 현행 GPT-5.6 reasoning과 tool surface를 유지하면서 Sol보다 낮은 token 요금으로 기준선을 만듭니다. 신뢰할 내부 benchmark가 없을 때 가장 비싼 모델이나 가장 싼 모델에 바로 베팅하지 않고 품질·비용 경계를 찾기 좋습니다.
Terra가 실패하면 prompt/tool contract 개선, effort 조정, Sol 비교 중 무엇이 필요한지 한 변수씩 시험할 수 있습니다. 안정적으로 통과하면 Luna의 비용 최적화를 검토합니다.
Luna: 자동 검증과 fallback이 전제
Luna는 명확한 schema, programmatic validator, 짧은 output, 안전한 fallback이 있는 분류·추출·형식 변환·전처리·대량 작업에 적합합니다. 미묘한 실패를 찾기 어려운 자유도 높은 업무에서는 절감액이 human review로 이동할 수 있습니다.

GPT-5.4/5.5에서 통제된 방식으로 이동하기
OpenAI는 기존 reasoning effort를 baseline으로 유지하고, GPT-5.6의 같은 effort와 한 단계 낮은 effort를 대표 작업에서 비교하라고 안내합니다.
- Prompt, system instructions, tools/schema, acceptance set, timeout, retry/fallback을 고정합니다.
- 기존 모델과 현재 effort의 결과를 기록합니다.
- 대응하는 GPT-5.6 tier를 같은 effort로 시험합니다.
- 같은 GPT-5.6 tier를 effort 한 단계 낮춰 시험합니다.
- 품질이나 비용 문제가 남을 때만 Sol/Terra/Luna tier를 바꿉니다.

이전 branch의 배경은 GPT-5.4 vs GPT-5.2, GPT-5.4 vs GPT-5 mini 비교에서 볼 수 있지만, 새 build의 현재 정보는 GPT-5.6 공식 page를 확인해야 합니다.
Responses API 기준 요청
bashcurl https://api.openai.com/v1/responses \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-5.6-terra", "reasoning": {"effort": "medium"}, "input": "계약서에서 갱신일, 통지 기한, 해지 책임을 추출하고 JSON으로 반환하세요." }'
Production에서는 effective model, effort, usage, latency, tool outcomes, schema validation, retry와 human edits를 같은 evaluation record에 저장합니다. 몇 개의 그럴듯한 답변만으로 default route를 결정하면 안 됩니다.
유지 가능한 결론
Terra는 baseline, Sol은 품질 escalation, Luna는 비용 optimization으로 두고 승격·강등 조건을 측정 가능한 기준으로 만듭니다. 가격, alias, tools, prompt, acceptance가 바뀌면 같은 대표 작업을 다시 실행합니다.
새 workload는 gpt-5.6-terra + medium에서 시작하고, 어려운 reasoning이나 tool coordination의 합격 차이가 남을 때 Sol을 비교합니다. 자동 검증이 충분하고 cost가 주요 제약이 된 경우에만 Luna를 시험합니다. 이 정책이 고정된 모델 순위보다 오래 유지됩니다.



