AIFreeAPI Logo

GLM-5.3 vs DeepSeek V4 Pro: 코딩과 AI 에이전트에는 무엇을 고를까

A
7 min readAI 모델 비교

GLM-5.3은 Coding Plan에서 쓸 수 있지만 일반 종량제 API는 준비 중입니다. DeepSeek V4 Pro는 App·Web·API에서 GA이며 8월 17일 01시에 새 요금으로 바뀝니다.

GLM-5.3과 DeepSeek V4 Pro의 코딩 에이전트 접근 경로 비교

2026년 8월 15일 현재, 두 모델의 선택은 단순한 성능 대결이 아닙니다. GLM-5.3은 GLM Coding Plan의 모든 등급에서 사용할 수 있지만 일반 종량제 Model API는 아직 출시 전입니다. DeepSeek V4 Pro는 App, Web, API에 정식 출시됐습니다.

따라서 지금 내릴 수 있는 결론은 조건부입니다.

  • 지원되는 코딩 도구와 Coding Plan을 이미 사용한다면 GLM-5.3을 새 후보로 테스트할 수 있습니다.
  • 자체 서비스에 일반 API를 즉시 연결하거나 thinking을 끄는 작업이 필요하다면 DeepSeek V4 Pro가 현재 구현 가능한 후보입니다.
  • 두 경로가 모두 가능하다면 공개 점수의 합이 아니라 동일 작업에서의 검수 통과율과 통과 작업당 비용으로 결정해야 합니다.

한국어 설명 품질, 국내에서 체감하는 latency, 특정 provider의 안정성은 공식 표만으로 알 수 없습니다. 이 항목은 한국어 문서와 오류 메시지를 포함한 실제 작업으로 확인해야 합니다.

먼저 두 가지 질문에 답해야 한다

오늘 호출할 수 있는가?

Z.ai의 GLM-5.3 공식 안내에 따르면 정식 ID는 glm-5.3이고, text-only 입출력, 1M context, 128K 최대 출력을 제공합니다. GLM-5.2와 같은 base model을 사용하며 개선은 post-training에서 왔다는 설명입니다. 그렇다고 5.2의 API 가격이나 사용 후기가 5.3의 사실이 되는 것은 아닙니다.

현재 GLM-5.3은 Coding Plan 전용 경로에서 사용할 수 있습니다. 모델 전환 가이드는 Claude Code/Goose용 Anthropic-compatible endpoint, Codex용 Responses-compatible endpoint, 그 밖의 OpenAI-compatible coding agent용 endpoint를 따로 안내합니다. Claude Code의 glm-5.3[1m]은 Plan adapter의 1M route 이름이지 미래 일반 API의 정식 ID가 아닙니다.

DeepSeek의 안정적인 요청 ID는 deepseek-v4-pro이며 현재 서비스 버전은 DeepSeek-V4-Pro-0813입니다. 8월 13일 GA 공지 이후 App, Web, API에서 사용할 수 있습니다. 요청에는 안정 ID를 넣고, 평가 기록에는 0813을 남겨 alias가 나중에 바뀌어도 비교 대상을 추적하는 편이 안전합니다.

현재 계약GLM-5.3DeepSeek V4 Pro
model IDglm-5.3deepseek-v4-pro
즉시 이용 경로GLM Coding PlanApp, Web, 일반 API
일반 종량제 APIComing soonGA
context / 최대 출력1M / 128K1M / 384K
reasoning항상 사용, low/high/max켜기/끄기, low/high/max
현재 비용 단위월 구독 creditstoken 종류별 USD
GLM-5.3 공개 weights안전 평가 후 약 2주 뒤 공개 예정, 확인일에는 미공개V4 Pro self-hosting 여부는 이 비교의 검증 범위 밖

1M context는 권장 입력량이나 품질 보증이 아닙니다. 관련 파일을 먼저 찾지 않고 전체 저장소를 밀어 넣으면 prefill, cache, 불필요한 정보가 오히려 작업을 방해할 수 있습니다.

같은 비용 단위를 비교하고 있는가?

Z.ai의 일반 API 가격표는 현재 GLM-5.2까지만 표시합니다. 5.2의 input $1.40/M, cached input $0.26/M, output $4.40/M을 GLM-5.3 가격으로 쓰면 안 됩니다.

현재 GLM-5.3의 비용은 Coding Plan으로 계산합니다. 확인 당시 국제 가격은 Lite $18, Pro $72, Max $160/월이었고, 5시간 rolling credits와 주간 credits 제한이 함께 적용됩니다. GLM-5.3 표준 사용량은 다음 식입니다.

credits = (input × 6.9 + cached input × 1.7 + output × 24) / 10,000

평일 15:00–19:00 KST 밖과 주말에는 표준 credits의 50%를 사용합니다. 구독료와 남은 한도가 다르므로 credits를 고정된 token 달러 단가로 환산할 수 없습니다.

DeepSeek는 직접 종량제지만 8월 17일 01:00 KST에 가격이 변경됩니다. 공식 가격표의 100만 tokens당 USD는 다음과 같습니다.

V4 Pro 요금 항목변경 전변경 후 off-peak변경 후 peak
cache hit input$0.003625$0.022$0.044
cache miss input$0.435$0.66$1.32
output, reasoning 포함$0.87$1.98$3.96

새 peak 시간은 10:00–13:00, 15:00–19:00 KST입니다. 재시도, 도구, 세금, gateway, 사람의 수정 비용은 포함되지 않습니다.

예를 들어 cache miss input 10만, output 5만 tokens인 작업은 새 요금에서 off-peak 약 $0.165, peak 약 $0.33입니다. 같은 token 모양은 GLM-5.3에서 약 189 표준 credits를 쓰지만, 구독 credits와 종량제 달러를 그대로 우열 비교할 수는 없습니다.

승인된 작업당 비용 = 모든 시도의 모델·도구·재시도 비용 / 검수에 통과한 작업 수

이 식으로 보면 저렴한 요청이 두 번 실패하거나, 구독 credits가 매주 남는 상황도 비용에 반영됩니다.

발표 표는 작업별 가설을 제공한다

Z.ai의 GLM-5.3 출시 글은 DeepSeek-V4-Pro-0813을 같은 표에 넣었습니다. 아래는 공급사가 취합한 발표값이며 독립적인 동일 환경 재실행은 아닙니다.

benchmarkGLM-5.3DeepSeek V4 Pro 0813
Terminal-Bench 2.188.287.9
DeepSWE v1.166.962.7
NL2Repo58.061.1
CyberGym84.583.3
Toolathlon Verified73.074.1
AutomationBench v1.0.648.243.2
Agents’ Last Exam CLI28.525.7

GLM이 앞선 행이 더 많지만 DeepSeek는 NL2Repo와 Toolathlon에서 앞섭니다. 더 중요한 문제는 실행 계약입니다. Z.ai가 공개한 GLM Terminal-Bench 2.1 조건에는 특정 Claude Code 버전, 65,536 최대 생성 tokens, 6시간 timeout이 포함됩니다. NL2Repo는 1M context, 64K output과 추가 판정 규칙을 사용합니다. 각 경쟁 모델의 모든 조건이 같은 수준으로 공개된 것은 아닙니다.

DeepSeek의 변경 이력도 Terminal Bench 2.1 87.9, DeepSWE 62.7을 공개하고 Code Agent 평가에 DeepSeek Harness minimal, max effort를 사용했다고 설명합니다. 숫자의 출처를 확인하는 데는 도움이 되지만, 한국어 작업이나 여러분의 agent client에서 같은 결과를 보장하지 않습니다.

0.3점 차이보다 파일 선택, context 압축, tool 복구, timeout, 재시도 정책이 실제 결과에 더 큰 영향을 줄 수 있습니다. 공개 표는 “무슨 작업을 다음에 시험할지”를 정하는 자료이지, 전체 모델 순위가 아닙니다.

migration에서 먼저 드러나는 실패 지점

GLM-5.3은 thinking을 완전히 끌 수 없습니다. 표준 계약은 low/high/max를 지원하고 default는 max입니다. Coding Plan 호환 계층은 disabled, none, minimal 같은 값을 low로 변환합니다. 짧은 분류나 정형 변환에서는 이 동작이 latency와 credits에 미치는 영향을 측정해야 합니다.

DeepSeek V4 Pro는 thinking을 끌 수 있습니다. thinking 중에는 temperature, top_p 등이 적용되지 않습니다. tool loop에서는 이전 assistant message의 reasoning_content, content, tool_calls를 모두 보존한 뒤 role: tool 결과를 추가해야 합니다. DeepSeek thinking 가이드에 따르면 reasoning_content를 누락하면 다음 요청이 HTTP 400으로 실패할 수 있습니다.

DeepSeek의 Responses는 stateless이며 일부 상태 필드와 tools를 무시하고 이미지/file input을 받지 않습니다. Anthropic-compatible route도 모든 Claude 기능과 같지 않습니다. GLM 역시 tool 동작은 Coding Plan client와 protocol에 좌우됩니다. “호환”이라는 한 단어만 보고 base URL만 바꾸는 것은 migration 검증이 아닙니다.

모델 ID부터 tool history와 tests까지 확인하는 migration 체크포인트
모델 ID부터 tool history와 tests까지 확인하는 migration 체크포인트

한국어를 포함한 15개 작업으로 결정하기

최근 완료한 실제 작업에서 약 15개를 고릅니다. 작은 bug fix, 여러 파일 변경, 긴 refactor, 반복 tool 조사, 엄격한 JSON, 한국어 요구사항과 오류 설명을 섞습니다.

15개 작업을 동일 조건으로 실행하고 credits와 USD를 분리 기록하는 평가 흐름
15개 작업을 동일 조건으로 실행하고 credits와 USD를 분리 기록하는 평가 흐름

두 후보에 같은 commit, 파일 권한, tools, context 정책, effort, timeout, 최대 turn과 retry budget을 줍니다. 실행 전 tests, schema, 화면 또는 사실 확인 같은 합격 조건을 고정합니다. 실행 후에는 다음을 기록합니다.

  • 검수 통과 여부와 실패 조건
  • input, cached input, output, reasoning tokens
  • GLM credits 또는 DeepSeek USD와 tool 비용
  • 총 시간, turn, 재시작 횟수
  • 사람의 추가 지시, 승인, 수동 수정
  • 무시된 parameter, 잘못된 tool call, client별 기능 차이

필수 endpoint가 없거나, 필요한 tool을 재현하지 못하거나, 두 번째 대표 batch에서도 통과율과 통과 작업당 비용이 계속 불리하면 중단합니다. 기능 차이를 몰래 보정하지 말고 운영 마찰로 기록해야 합니다.

현재 선택은 이렇게 정리할 수 있습니다. 지원되는 Coding Plan에서 최신 코딩 모델을 바로 시험하려면 GLM-5.3, 일반 API로 지금 제품에 연결하려면 DeepSeek V4 Pro입니다. 두 모델을 모두 쓸 수 있다면 한국어가 포함된 실제 작업의 검수율, 비용, 도구 안정성이 최종 결정을 내려야 합니다.