본문으로 건너뛰기

Gemini 4 Argon·Opus 5.5·Sonnet 5.5 선택 기준

Argon 도입가 $2/$10은 Sonnet 5.5와, 정가 $4/$20은 Opus 5.5와 같습니다. 세 모델을 한 척도에 놓은 Vals Index에서는 Argon이 68.90%로 가장 높습니다.

A
••12 분 분량•AI 모델 비교
받침대 위에 입력 단가에 비례한 타일 더미 세 개가 놓인 표지. Argon 도입가 $2와 Sonnet 5.5 $2는 8층, Opus 5.5 $4는 16층

Google이 2026년 9월 30일 발표한 Gemini 4 Argon(제미나이 4 아르곤)은 2026년 10월 1일 기준 개발자가 호출할 수 없는 모델입니다. 지금은 Fairwind Program에 참여한 보안 방어 조직에만 제공되고, Gemini API의 모델 목록과 가격표에도 올라와 있지 않습니다. 그래서 오늘 실제로 고를 수 있는 것은 Claude Opus 5.5와 Claude Sonnet 5.5 둘입니다.

둘 사이에서는 이렇게 나누면 됩니다. 요구 사항과 범위가 정해진 일상 작업은 입력 $2, 출력 $10인 Sonnet 5.5로 시작하고, 몇 시간씩 이어지는 자율 코딩 에이전트나 대규모 리팩터링처럼 열려 있고 복잡한 작업은 입력 $4, 출력 $20인 Opus 5.5에 맡깁니다. Argon은 발표된 가격과 벤치마크만 보면 시험해 볼 이유가 충분하지만, 판단은 API가 열려 자기 작업으로 돌려 본 뒤에 내릴 수 있습니다.

항목Gemini 4 ArgonClaude Opus 5.5Claude Sonnet 5.5
발표·출시2026-09-30 발표2026-09-22 출시2026-09-28 출시
개발자 호출불가 (Fairwind Program 참여 조직만)가능가능
모델 ID공개되지 않음claude-opus-5-5claude-sonnet-5-5
입력 / 출력 (100만 토큰당)도입가 $2 / $10, 이후 $4 / $20$4 / $20$2 / $10
캐시된 입력 (100만 토큰당)도입가 기준 $0.10$0.20$0.20
컨텍스트 윈도공개되지 않음100만 토큰100만 토큰
최대 출력100만 토큰12만 8,000 토큰12만 8,000 토큰

가격은 모두 미국 달러 공식 단가이며 세금은 포함하지 않았습니다. 벤치마크 수치는 Google, Anthropic, Vals가 각자 공개한 값이고, 누가 어떤 조건으로 쟀는지는 수치마다 함께 적었습니다.

지금 호출할 수 있는 모델은 Claude 두 개입니다

Google의 발표문에 따르면 Argon은 Fairwind Program을 통해 일부 보안 방어 조직에 먼저 배포되고 있습니다. 개발자, 기업, 일반 사용자에게는 "가능한 한 빨리" 제공하겠다고 했고, 순서는 유료 API 고객과 Google AI Ultra 구독자가 먼저입니다. 날짜와 모델 ID는 발표문에 없습니다. Gemini API 모델 페이지와 가격 페이지에도 Argon 항목이 없습니다.

Gemini 4 Argon은 개발자 호출 불가, Claude Opus 5.5와 Sonnet 5.5는 지금 호출 가능하다는 상태와 출시일, 제공 경로, 컨텍스트, 최대 출력을 나란히 보여 주는 카드 세 장

발표 전 유출 글에서 쓰이던 "Gemini 4 Pro"는 공식 이름이 아닙니다. 공식 이름은 Gemini 4 Argon입니다.

Gemini API에서 지금 호출할 수 있는 최신 모델은 Gemini 3.8 Flash(gemini-3.8-flash)입니다. 유료 등급 가격은 2026년 12월 31일까지 입력 $0.75, 출력 $3.75이고 2027년 1월 1일부터 $1.50, $7.50으로 바뀝니다. 무료 등급도 있습니다. Gemini 쪽에서 당장 붙여 볼 모델이 필요하다면 Gemini 3.8 Flash의 모델 ID, 가격, 사양부터 보면 됩니다. 다만 Flash는 Argon과 급이 다른 모델이므로 Flash 결과로 Argon의 성능을 짐작할 수는 없습니다.

Claude 쪽은 두 모델 모두 열려 있습니다. Claude 모델 개요 기준으로 Opus 5.5와 Sonnet 5.5는 Claude API 전체 고객에게 제공되고, Amazon Bedrock(anthropic.claude-opus-5-5, anthropic.claude-sonnet-5-5), Google Cloud, Microsoft Foundry, Claude Platform on AWS에서도 쓸 수 있습니다. 클라우드별 리전 활성화는 계정마다 다릅니다.

사양Claude Opus 5.5Claude Sonnet 5.5
컨텍스트 윈도100만 토큰100만 토큰
최대 출력 (동기 요청)12만 8,000 토큰12만 8,000 토큰
지식 기준 시점2026년 6월2026년 6월
입력 / 출력 형식텍스트·이미지 / 텍스트텍스트·이미지 / 텍스트
응답 속도 표기ModerateFast
기본 effortmediumhigh
사고(thinking)적응형, 항상 켜짐적응형, 도구 호출 사이에만 쓰도록 설정 가능

Argon에서 공개된 사양은 출력 한도 하나입니다. Google은 이전 Gemini의 6만 4,000 토큰에서 100만 토큰으로 늘렸다고 밝혔습니다. 컨텍스트 윈도, 지식 기준 시점, 속도 제한은 발표문에 없습니다.

가격: 도입가는 Sonnet 5.5와, 정가는 Opus 5.5와 같습니다

Argon의 발표 가격은 두 단계입니다. 도입가는 입력 100만 토큰당 $2, 출력 100만 토큰당 $10이고, 캐시된 입력은 입력 단가에서 95% 할인됩니다. 발표문 각주에는 도입 기간이 끝나면 입력 $4, 출력 $20이 적용된다고 적혀 있습니다. 도입 기간이 언제 끝나는지는 나와 있지 않습니다.

이 숫자를 Claude API 가격표와 나란히 놓으면 대응 관계가 분명합니다.

100만 토큰당 단가Argon 도입가Argon 정가Opus 5.5Sonnet 5.5
입력$2$4$4$2
출력$10$20$20$10
캐시된 입력(캐시 읽기)$0.10공개되지 않음$0.20$0.20
5분 캐시 쓰기공개되지 않음공개되지 않음$5$2.50
Batch 입력 / 출력공개되지 않음공개되지 않음$2 / $10$1 / $5

Argon의 캐시 단가 $0.10은 발표문의 "입력 단가의 95% 할인"을 도입가 $2에 적용한 값입니다($2 × 0.05). 두 Claude 모델의 캐시 읽기 $0.20의 절반입니다. Claude 쪽에서 눈여겨볼 점은 캐시 읽기 단가가 Opus 5.5와 Sonnet 5.5에서 똑같이 $0.20이라는 것입니다. 입력과 출력 단가는 두 배 차이지만 캐시 읽기에는 차이가 없습니다.

Claude에는 이 밖의 요금 항목도 있습니다. 1시간 캐시 쓰기는 Opus 5.5 $8, Sonnet 5.5 $4입니다. Opus 5.5에는 연구 프리뷰인 fast mode(입력 $8, 출력 $40, Claude API 전용)가 있고 Sonnet 5.5에는 없습니다. 미국 내 추론만 쓰도록 지정하면 1.1배가 붙습니다. 100만 토큰 컨텍스트는 두 모델 모두 표준 단가로 과금됩니다. Bedrock과 Google Cloud의 가격은 각 클라우드가 따로 정합니다.

같은 토큰 수로 계산한 요청 한 건의 비용

아래 두 예시는 세 모델이 정확히 같은 토큰 수를 쓴다고 가정한 계산입니다. 캐시 쓰기, 도구 요금, 세금은 뺐습니다. Argon 줄은 아직 누구도 이 가격으로 결제할 수 없는 가정값입니다.

예시 A: 캐시 없이 입력 10만 토큰, 출력 2만 토큰

모델계산식비용
Sonnet 5.50.1 × $2 + 0.02 × $10$0.40
Opus 5.50.1 × $4 + 0.02 × $20$0.80
Argon 도입가0.1 × $2 + 0.02 × $10$0.40
Argon 정가0.1 × $4 + 0.02 × $20$0.80

예시 B: 캐시를 많이 쓰는 에이전트의 한 턴. 캐시 읽기 20만 토큰, 새 입력 2만 토큰, 출력 5,000 토큰

모델계산식비용
Sonnet 5.50.2 × $0.20 + 0.02 × $2 + 0.005 × $10 = 0.04 + 0.04 + 0.05$0.13
Opus 5.50.2 × $0.20 + 0.02 × $4 + 0.005 × $20 = 0.04 + 0.08 + 0.10$0.22
Argon 도입가0.2 × $0.10 + 0.02 × $2 + 0.005 × $10 = 0.02 + 0.04 + 0.05$0.11
캐시 읽기 20만, 새 입력 2만, 출력 5,000 토큰 예시의 계산식과 합계. Sonnet 5.5 $0.13, Opus 5.5 $0.22, Argon 도입가 $0.11을 막대로 비교

예시 A에서는 단가 차이가 그대로 드러나 Opus 5.5가 Sonnet 5.5의 두 배입니다. 예시 B에서는 Sonnet 5.5가 Opus 5.5보다 약 41% 쌉니다((0.22 − 0.13) ÷ 0.22). 50%가 아닌 이유는 캐시 읽기 $0.04가 두 모델에서 같기 때문입니다. 캐시 비중이 큰 에이전트일수록 두 Claude 모델의 비용 차이는 단가표에서 보이는 것보다 좁아집니다.

자기 작업에 대입하려면 토큰 수(100만 단위)에 위 표의 단가를 곱해 더하면 됩니다.

text
요청 비용 = 캐시 읽기 토큰 × 캐시 단가 + 새 입력 토큰 × 입력 단가 + 출력 토큰 × 출력 단가

단가가 같아도 작업당 비용은 달라집니다

위 계산에서 가장 약한 가정은 "토큰 수가 같다"는 부분입니다. 같은 작업이라도 모델마다 토크나이저가 다르고, 사고에 쓰는 토큰과 도구 호출 횟수가 다릅니다. Claude 안에서도 기본 effort가 Opus 5.5는 medium, Sonnet 5.5는 high로 달라서, 설정을 건드리지 않으면 Sonnet 5.5가 출력 토큰을 더 많이 쓸 수 있습니다.

단가가 아닌 작업 단위로 잰 비용을 공개한 자료는 Vals Index입니다. 2026년 9월 30일 갱신된 v2.1에서 테스트 한 건당 비용은 Argon $15.68, Sonnet 5.5 $21.34, Opus 5.5 $32.14입니다. 단가가 두 배인 Opus 5.5와 Sonnet 5.5의 차이는 두 배가 아니라 약 1.5배였습니다. Argon의 $15.68에 도입가와 정가 중 어느 쪽이 적용됐는지는 Vals 페이지에 나와 있지 않습니다.

실제 청구액을 맞춰 보려면 응답의 usage 필드에서 사고 토큰이 출력 토큰에 포함되는지부터 봐야 합니다. 회사마다 집계 방식이 다르며, 자세한 방법은 Gemini·OpenAI·Claude의 추론 토큰 요금 검산에 있습니다.

벤치마크: 누가 쟀고 무엇을 뒷받침하나

세 모델에 관해 공개된 수치는 출처가 셋입니다. 독립 리더보드인 Vals, Google이 Argon과 함께 낸 비교표, Anthropic이 Sonnet 5.5 발표에서 낸 수치입니다. 세 모델이 같은 척도에 함께 놓인 것은 Vals뿐입니다. Google 표에는 Sonnet 5.5가 없고, Anthropic 자료에는 Argon이 없습니다.

Vals Index: 세 모델이 한 표에 있는 유일한 자료

Vals Index는 금융, 코딩, 법률, 세무 과제를 GDP 비중으로 가중한 종합 지수입니다. 2026년 9월 30일 갱신된 v2.1의 값은 다음과 같습니다.

모델점수테스트당 비용소요 시간
Gemini 4 Argon68.90%$15.6846분 33초
Claude Sonnet 5.567.04%$21.341시간 18분
Claude Opus 5.566.97%$32.141시간 19분

Argon은 두 Claude 모델보다 약 1.9점 높고, 테스트당 비용과 소요 시간이 모두 적습니다. Sonnet 5.5와 Opus 5.5의 차이는 0.07점으로, Vals도 사실상 동률이라고 설명하며 Sonnet 5.5의 테스트당 비용이 Opus 5.5의 약 3분의 2라고 적었습니다.

이 표가 뒷받침하는 것은 "Vals가 고른 업무형 과제 묶음에서 Argon이 가장 높고 싸게 나왔다"까지입니다. 리더보드는 재실행할 때마다 수치가 바뀌므로 인용할 때는 날짜와 버전을 함께 적어야 합니다. 1.9점 차이가 자기 코드베이스나 문서 작업에서도 그대로 나타난다는 근거는 아닙니다.

Google 비교표: Argon 대 Opus 5.5

Google DeepMind의 Gemini 모델 페이지에는 Argon과 Opus 5.5의 항목별 비교가 있습니다. 단위는 모두 %입니다.

벤치마크Gemini 4 ArgonClaude Opus 5.5
Vals Index68.967.0
AutomationBench51.342.5
Vals Finance Agent v265.458.6
Harvey Legal Agent Benchmark19.63.8
DeepSWE v1.177.974.2
Vibe Code Bench91.990.3
LABBench 288.873.1
RiemannBench76.069.6
GraphWalks (12만 8,000 토큰 이하)99.790.6
GraphWalks (25만 6,000~100만 토큰)84.266.8
Agent's Last Exam39.538.2
Chartography71.666.3
LVBench91.783.7
CWE-bench v168.067.0
FrontierSWE v255.062.3
Terminal-Bench 4.057.466.4
PostTrainBench45.349.3
Terminal-Bench Science 0.157.663.3

위 14개 항목에서는 Argon이, 아래 4개 항목에서는 Opus 5.5가 앞섭니다. Opus 5.5가 앞선 네 항목은 코딩 에이전트 계열인 FrontierSWE v2와 Terminal-Bench 4.0, ML 엔지니어링 항목인 PostTrainBench, 그리고 Terminal-Bench Science 0.1입니다. Argon의 격차가 큰 항목은 Google이 지식 업무로 분류한 법률·금융 에이전트, 긴 컨텍스트 항목인 GraphWalks, 과학·수학 항목인 LABBench 2, 멀티모달 항목인 LVBench입니다.

읽을 때 감안할 조건이 있습니다. 벤치마크 목록은 Google이 골랐습니다. 평가 방법 문서에 따르면 경쟁 모델 수치는 대부분 각 회사가 직접 밝힌 결과나 공개 리더보드에서 가져온 최고 추론 설정 값이고, Argon은 가장 높은 사고 수준으로 측정했습니다. PostTrainBench, LABBench 2, GraphWalks, LVBench는 모든 모델의 값을 Google이 직접 돌려 얻었습니다. LVBench는 "API 제한 때문에" 모델마다 입력 프레임 수가 달라서, Gemini는 초당 1프레임, Opus 5.5는 600프레임으로 측정했습니다.

Anthropic 수치: Sonnet 5.5 대 Opus 5.5

Sonnet 5.5 발표 페이지에는 두 Claude 모델을 직접 비교한 수치가 있습니다.

벤치마크Claude Sonnet 5.5Claude Opus 5.5
Terminal-Bench 4.070.6%66.4%
FrontierCode 1.146.2% (effort max), 52.1% (xhigh)54.4%
CursorBench 4.055.5%57.8%
GDPval-AA v2.118441846
AA-Briefcase v1.118111822
Humanity's Last Exam (도구 사용)64.5%67.7%
OSWorld 2.180.1%81.8%
Chartography (도구 없음)61.6%64.4%

Terminal-Bench 4.0에서는 Sonnet 5.5가 앞서고(Opus 5.5는 가장 성적이 좋은 xhigh 기준), 나머지 항목에서는 Opus 5.5가 조금씩 앞섭니다. 차이가 가장 큰 항목은 FrontierCode 1.1입니다. Anthropic은 Sonnet 5.5를 "범위가 잘 정해진 일상 작업"에 권하고, 복잡하고 열린 작업에서는 Opus 5.5가 여전히 분명히 강하다고 설명합니다.

Opus 5.5의 Chartography 값은 이 표에서 64.4, Google 표에서 66.3입니다. 측정 설정이 다른 값이므로 한 표의 숫자를 다른 표의 숫자와 섞어 비교하면 안 됩니다. 발표 페이지의 "출력이 30% 이상 빠르다", "작업당 비용이 최대 30% 낮다"는 문구도 Sonnet 5와 비교한 것이며 Opus 5.5나 Gemini와의 비교가 아닙니다.

Argon과 Sonnet 5.5를 직접 맞붙인 수치는 Google과 Anthropic 어느 쪽에서도 내지 않았습니다. 이 둘의 관계를 말해 주는 근거는 Vals Index의 1.86점 차이 하나입니다.

지금은 어떤 Claude를 쓸까

Anthropic의 모델 선택 안내는 "대부분의 작업은 Opus 5.5에서 시작"하라고 하면서, 모델을 바꾸기 전에 effort를 조정하는 편이 더 나은 수단일 때가 많다고 덧붙입니다. 여기에 위의 가격과 수치를 겹치면 다음처럼 정리됩니다.

작업먼저 쓸 모델근거
범위가 정해진 코드 생성, 데이터 분석, 콘텐츠 작성, 도구를 쓰는 에이전트Sonnet 5.5단가 절반, 응답 속도 표기 Fast, Vals Index에서 Opus 5.5와 0.07점 차이
몇 시간씩 이어지는 자율 코딩 에이전트, 대규모 리팩터링, 복잡한 시스템 설계Opus 5.5Anthropic 안내의 권장 용도, FrontierCode 1.1에서 54.4% 대 46.2~52.1%
화면 조작(computer use), 이미지 비중이 큰 워크플로Opus 5.5Anthropic 안내의 권장 용도, OSWorld 2.1에서 81.8% 대 80.1%
응답 지연이 중요한 대화형 기능Sonnet 5.5응답 속도 표기 Fast, 사고를 도구 호출 사이로만 제한 가능
캐시 읽기가 대부분인 긴 에이전트 세션두 모델을 같은 작업으로 비교캐시 읽기 단가가 같아 비용 차이가 두 배보다 좁음

어느 쪽인지 애매하면 Sonnet 5.5로 먼저 돌려 보고, 결과가 모자란 작업만 Opus 5.5로 올리는 순서가 비용 면에서 안전합니다. Opus 5.5를 이미 쓰고 있다면 모델을 내리기 전에 effort를 낮춰 보는 방법도 있습니다. 단계별 차이는 Opus 5.5 effort 다섯 단계 중 어디서 시작할지에서, Fable 5.1을 포함한 Claude 라인업 전체의 선택 기준은 Claude API 모델을 비용과 성능으로 고르는 법에서 다룹니다.

이전 세대에서 옮겨 오는 코드에는 오류가 나는 변경점이 있습니다. 두 모델 모두 tool_choice를 any나 tool로 주어 도구 호출을 강제하면 400 오류를 반환하고, Claude API와 Google Cloud에서는 예전 computer_20251124 도구도 거부합니다. thinking: {"type": "disabled"}는 두 모델 모두 받지 않습니다. Sonnet 5.5는 대신 thinking: {"type": "between_tools"}를 받는데, effort가 low, medium, high일 때만 쓸 수 있습니다. 점검 순서는 Claude Opus 5.5 이용 경로·실제 비용·Opus 5 이전 점검에 정리되어 있고, Sonnet 5.5의 변경점은 Anthropic 문서에 있습니다.

Argon이 열리면 무엇을 다시 시험할까

Argon을 기다리느라 지금 결정을 미룰 필요는 없습니다. 다만 아래에 해당하는 작업이 있다면 API가 열리는 날 바로 돌려 볼 수 있게 평가용 입력과 채점 기준을 미리 준비해 둘 만합니다.

  • 법률·금융 문서를 다루는 에이전트: Google 표에서 격차가 가장 큰 영역입니다(Harvey Legal Agent Benchmark 19.6 대 3.8, Vals Finance Agent v2 65.4 대 58.6).
  • 수십만 토큰짜리 입력에서 관계를 추적하는 작업: GraphWalks 25만 6,000~100만 토큰 구간에서 84.2 대 66.8입니다. 단, Argon의 컨텍스트 윈도 크기는 공개되지 않았습니다.
  • 한 번에 긴 결과물을 내야 하는 작업: Argon의 출력 한도는 100만 토큰, 두 Claude 모델은 12만 8,000 토큰입니다.
  • 지금 Sonnet 5.5로 돌리는 대량 작업: 도입가 기간에는 입력·출력 단가가 같고 캐시된 입력은 절반입니다.

반대로 터미널 조작이나 장시간 코딩 에이전트가 중심이라면 서두를 이유가 적습니다. Google의 표에서도 FrontierSWE v2, Terminal-Bench 4.0, Terminal-Bench Science 0.1은 Opus 5.5가 앞섭니다.

Argon이 공개되면 다음 네 가지부터 확인해야 합니다.

  1. Gemini API 모델 페이지와 가격 페이지에 Argon의 모델 ID와 단가가 올라왔는지, 발표된 $2 / $10과 같은지 봅니다.
  2. 도입 기간 종료일이 공지됐는지 봅니다. 정가 $4 / $20으로 다시 계산해도 예산이 맞는지 확인해야 합니다. 정가에서는 입력·출력 단가의 이점이 Sonnet 5.5 대비로는 사라지고 Opus 5.5와 같아집니다.
  3. 컨텍스트 윈도, 속도 제한, Batch와 도구 요금을 확인합니다. 모두 발표문에 없는 항목입니다.
  4. 같은 입력을 세 모델에 넣고 토큰 수가 아니라 작업 한 건당 비용과 성공률을 비교합니다.

자주 묻는 질문

Gemini 4 Argon 출시일은 언제이고 지금 API로 쓸 수 있나요?

2026년 10월 1일 기준으로는 쓸 수 없습니다. Fairwind Program에 참여한 보안 방어 조직에만 제공되고 있고, Gemini API 모델 페이지와 가격 페이지에 Argon이 없습니다. Google은 유료 API 고객과 Google AI Ultra 구독자부터 순서대로 열겠다고 했지만 날짜는 밝히지 않았습니다.

Gemini 4 Argon이 Opus 5.5와 Sonnet 5.5보다 성능이 좋은가요?

2026년 9월 30일 자 Vals Index v2.1에서는 Argon 68.90%, Sonnet 5.5 67.04%, Opus 5.5 66.97%로 Argon이 가장 높습니다. Google의 비교표에서는 18개 항목 중 14개에서 Argon이 Opus 5.5를 앞서고, FrontierSWE v2와 Terminal-Bench 4.0을 포함한 4개에서는 Opus 5.5가 앞섭니다. Argon을 호출할 수 없는 지금은 외부 개발자가 이 수치를 자기 작업으로 재현해 볼 방법이 없습니다.

Argon·Opus 5.5·Sonnet 5.5 중 어느 모델이 가장 싼가요?

단가로는 Sonnet 5.5와 Argon 도입가가 입력 $2, 출력 $10으로 같고, 캐시된 입력은 Argon이 $0.10으로 Claude의 $0.20보다 쌉니다. 다만 Argon은 아직 결제할 수 없고 도입 기간 뒤에는 Opus 5.5와 같은 $4 / $20이 됩니다. 오늘 결제할 수 있는 모델 중에서는 Sonnet 5.5가 가장 쌉니다.

Opus 5.5 대신 Sonnet 5.5만 써도 되나요?

범위가 정해진 작업이라면 Sonnet 5.5로 충분한 경우가 많습니다. Vals Index에서는 두 모델이 0.07점 차이이고, Anthropic 수치에서는 Terminal-Bench 4.0을 Sonnet 5.5가 앞섭니다. 반면 FrontierCode 1.1, Humanity's Last Exam, OSWorld 2.1에서는 Opus 5.5가 앞서며, Anthropic도 복잡하고 열린 작업에는 Opus 5.5를 권합니다.