2026년 8월 26일 현재 SpaceXAI의 공식 모델 카탈로그는 코딩과 범용 업무의 추천 모델로 grok-4.6을 제시합니다. 하지만 직접 API 요금표에는 grok-4.5, grok-4.3, 세 가지 Grok 4.20 경로, 코딩 특화 grok-build-0.1도 있습니다. 숫자가 크다고 모든 업무에서 상위인 단순한 순서가 아닙니다.
새로운 복잡한 애플리케이션이라면 4.6을 첫 후보로 삼을 수 있습니다. 100만 토큰 창, Batch, 낮은 토큰 단가, 추론을 끈 실행이 중요하다면 같은 시험에 4.3을 포함합니다. 이미 안정적으로 운영 중인 4.5는 4.6의 개선을 측정할 때 좋은 기준선입니다. 4.20 Multi-Agent와 Build 0.1은 각자의 특화 업무에서 별도로 가치를 증명해야 합니다.
이 글은 xAI 직접 API의 텍스트 출력 계약을 다룹니다. Grok 앱의 모델 선택, Grok Build에 포함된 사용량, Cursor 제공 여부, 게이트웨이의 가격은 별도 상품 계약입니다. API 문서에 모델 ID가 있다고 해서 모든 요금제·지역·인터페이스에서 같은 선택지가 보장되지는 않습니다.
현재 모델을 버전이 아니라 역할로 읽기
| 직접 API ID | 컨텍스트와 추론 | 먼저 시험할 업무 | 지켜야 할 경계 |
|---|---|---|---|
grok-4.6 | 500K, low·medium·high·xhigh | 긴 에이전트 작업, 어려운 코드, 도구를 쓰는 범용 앱 | prompt가 200K에 도달하면 전체 요청이 장문 요금으로 전환 |
grok-4.5 | 500K, low·medium·high | 기존 운영 시스템의 대조군 | 현재 카탈로그의 기본 추천은 아님 |
grok-4.3 | 1M, none~high, Batch | 대형 문서, 구조화 처리, 추론 없는 요청 | 저렴한 1회 호출이 저렴한 통과 작업을 뜻하지 않음 |
grok-4.20-0309-reasoning | 1M, reasoning 고정 | 특정 4.20 동작을 재현해야 할 때 | 날짜가 붙은 ID이며 최신 범용 기본값이 아님 |
grok-4.20-0309-non-reasoning | 1M, 무추론 | 지연에 민감하고 결과를 기계 검증할 수 있는 작업 | 재시도까지 포함하면 경제성이 달라짐 |
grok-4.20-multi-agent-0309 | 1M, 병렬 조사, Beta | 독립 하위 문제로 분해하고 출처·종합을 검토할 수 있는 조사 | 에이전트 수가 실행 경로와 총사용량을 바꿈 |
grok-build-0.1 | 256K, agentic coding 특화 | 저장소 수정, 웹 개발, 빌드 복구 | 범용 4.6의 할인판이 아님 |
Grok 4.6 계약은 500,000토큰 창, 텍스트·이미지 입력과 텍스트 출력, 2026년 2월 1일 지식 기준일을 명시합니다. Responses API와 Chat Completions, function calling, Web Search, X Search, 코드 실행을 지원하며 기본 reasoning effort는 high입니다.
최신 정보는 모델명만으로 생기지 않습니다. 학습 기준일 이후의 사실이 필요하면 Web Search나 X Search를 명시적으로 켜고, 출처 선택, 인용, 도구 장애, 지연, 호출 비용까지 시험해야 합니다.
4.6 업그레이드는 공급자 점수가 아니라 통과율로 판단
SpaceXAI는 4.6을 더 긴 에이전트 실행과 복잡한 상호작용·시각 작업을 위한 4.5의 확장으로 설명합니다. 4.6 발표에는 여러 에이전트·코딩·지식 업무 평가에서 4.6 High가 4.5 High보다 높은 결과가 제시됩니다.
이는 공급자가 발표하거나 수집한 수치입니다. “여러 단계 뒤에도 목표를 더 잘 유지하는가”라는 실험 가설은 만들지만, 한국어 고객지원 문서나 특정 저장소에서 승리한다는 증거는 아닙니다.
후보 모델에 같은 권한, 업무 설명, 컨텍스트 구성, 추론 강도, timeout, 합격 조건을 적용합니다. 첫 시도 통과율, 사람의 개입, 재시도, P95 시간, 도구 실패, 모든 시도의 총비용을 기록합니다. 개선이 반복 표본에서 유지되고 전환 비용보다 클 때 업그레이드합니다.
운영 중인 4.5를 먼저 제거하면 비교 기준과 빠른 롤백 지점을 동시에 잃습니다. 4.5의 역할은 “두 번째로 최신”이 아니라 실제 변화량을 측정하는 기준선입니다.
4.3의 낮은 단가는 200K 경계와 함께 계산
Grok 4.3 사양은 1M 컨텍스트, Batch, none부터 high까지의 추론 설정을 지원합니다. 200K 미만에서 입력·캐시 입력·출력 100만 토큰당 요금은 $1.25 / $0.20 / $2.50입니다. 4.6은 $2 / $0.50 / $6입니다.
캐시 없이 입력 100K와 출력 20K, 도구와 재시도가 없는 예시는 다음과 같습니다.
- 4.3:
0.1 × $1.25 + 0.02 × $2.50 = $0.175 - 4.6:
0.1 × $2 + 0.02 × $6 = $0.32
이 값은 호출 1회의 비용입니다. 4.3이 두 번 시도하고 사람이 수정해야 하지만 4.6은 한 번에 통과한다면 결과는 달라집니다. 실무 지표는 토큰, 도구 호출, 재시도, 사람의 수정을 합한 뒤 통과한 작업 수로 나눈 값입니다.
현재 요금표의 핵심은 200K prompt 경계입니다. 200K에 도달하면 초과분이 아니라 요청의 모든 토큰에 장문 요금이 적용됩니다. 4.3은 $2.50 / $0.40 / $5, 4.6은 $4 / $1 / $12로 바뀝니다. 문서 중복 제거, retrieval, 공통 prefix 캐시, 컨텍스트 압축이 최대 창 크기보다 비용에 더 큰 영향을 줄 수 있습니다.
Web Search, X Search, 코드 실행은 모델 토큰과 별도로 현재 1,000회당 $5입니다. 에이전트의 호출 횟수는 작업마다 달라지므로 실제 usage와 통과 결과를 함께 기록합니다.

4.20과 Build를 한 줄의 순위에 넣지 않는 이유
4.20의 세 ID는 1M 창과 4.3과 같은 토큰 요금을 공유하지만 실행 계약이 다릅니다. reasoning과 non-reasoning ID는 해당 동작을 고정합니다. grok-4.20-multi-agent-0309는 심층 조사를 위해 에이전트를 병렬 실행하며 공식 모델 페이지에서 Beta로 표시됩니다. 관점을 분해할 수 있고, 누락 비용이 크며, 검토자가 출처와 종합을 확인할 때 시험할 가치가 있습니다.
grok-build-0.1은 256K 창의 agentic coding 모델이며 단문 요금은 $1 / $0.20 / $2입니다. 저장소 변경, 웹 개발, 빌드 복구, 코드 리뷰에서 평가합니다. Grok Build 제품의 포함 사용량을 직접 API 토큰 청구와 바꿔 계산하면 안 됩니다.
오래된 ID의 HTTP 성공은 호환성 증명이 아니다
2026년 5월 사용 종료 가이드에 따르면 이전 Grok 4 Fast, 4.1 Fast, grok-4-0709, grok-3 ID는 지정된 reasoning 설정의 4.3으로 리디렉션됩니다. grok-code-fast-1은 grok-build-0.1로 이동합니다. 청구도 실제 목적지 모델을 따릅니다.
애플리케이션 코드, 환경 변수, 설정 서비스, 큐, 게이트웨이에서 모델 ID를 찾고 각 alias의 현재 목적지를 기록합니다. 일반 입력, 약 200K 컨텍스트, 도구 장애, 구조화 출력, 안전 거부를 포함한 동일 평가 세트를 실행합니다. 모델과 추론 강도를 되돌릴 수 있는 설정으로 두고, 작은 범위가 합격률·지연·비용 한도를 지킨 뒤에만 확대합니다.

일반 모델명이나 -latest는 새 버전으로 움직일 수 있고, 날짜형 ID는 고정됩니다. 중요한 운영 업무라면 고정 ID, 계획된 업데이트 시험, 알려진 롤백 지점을 함께 관리하는 편이 안전합니다.
결론은 조건부입니다. 복잡한 범용 업무는 4.6부터 시작하고, 저렴한 단가·1M 창·무추론 대조군으로 4.3을 남깁니다. 4.5는 업그레이드 효과를 재는 기준선이며, 4.20 Multi-Agent와 Build 0.1은 특화 업무에서 별도 시험합니다.
공급자까지 넓혀야 한다면 Grok 4.6·GPT-5.6 Sol·Claude Fable 5 코딩 비교를 참고할 수 있습니다. 최신 번호는 시험을 시작할 후보일 뿐, 채택은 같은 업무와 명시된 합격 조건, 되돌릴 수 있는 배포가 결정합니다.



