먼저 결론부터 말하면, 텍스트와 코드가 중심이고 API 비용·처리량이 중요할 때는 DeepSeek V4 Flash부터 시험하는 것이 합리적입니다. 이미지, 도표, 스캔 문서, 영상을 직접 이해해야 한다면 Kimi K3가 첫 후보입니다. GLM-5.2는 공식 직결 가격이 두 모델 사이에 있으며, 실제 저장소에서 Flash보다 재작업을 줄일 때 선택할 가치가 있습니다.
세 모델은 모두 약 100만 토큰 컨텍스트를 공개했습니다. 따라서 “1M 지원”만으로는 승부가 나지 않습니다. 입력 모달리티, 추론 제어, 가격, 그리고 코딩 에이전트가 검수를 통과하는지가 핵심입니다.
아래 가격과 제품 정보는 2026년 8월 6일 확인했습니다. 도입 전에 다시 확인하세요.
세 모델의 차이를 한 번에 보기
| 선택 기준 | DeepSeek V4 Flash | Kimi K3 | GLM-5.2 |
|---|---|---|---|
| 먼저 시험할 작업 | 비용 민감한 텍스트·코드·다수 Agent run | 시각 입력이 포함된 장기 작업 | Flash가 반복 실패하는 복잡한 코딩 |
| 공식 컨텍스트 | 1M | 1,048,576 | 1M |
| 추론 제어 | thinking / non-thinking | 항상 추론, low·high·max | 여러 effort 단계 |
| 공식 설명의 모달리티 | 텍스트 생성 | 네이티브 멀티모달 | 텍스트 장기 작업 |
| 오픈 웨이트 라이선스 | MIT | Kimi K3 License | MIT |
| 미캐시 입력 / 출력 1M당 | $0.14 / $0.28 | $3.00 / $15.00 | $1.40 / $4.40 |
정확한 모델명을 유지해야 합니다. deepseek-v4-flash는 DeepSeek V4 Pro가 아니며, kimi-k3는 Kimi K2.5나 K2.6이 아닙니다. Pro의 점수를 Flash 열에 넣거나 K2의 가격으로 K3를 계산하면 다른 비교가 됩니다.
DeepSeek 공식 가격표는 thinking/non-thinking, tool calls, JSON 출력, 384K 최대 출력을 안내합니다. V4 Flash 모델 카드는 284B 전체·13B 활성 파라미터 MoE와 MIT 라이선스를 설명합니다.
Kimi K3 가격 페이지는 reasoning_effort와 구조화 출력·동적 도구 기능을 안내합니다. Kimi K3 모델 카드는 2.8T 전체·104B 활성 파라미터, 네이티브 멀티모달을 명시합니다.
GLM-5.2 모델 카드는 1M 컨텍스트, 장기 코딩, 유연한 추론 강도, 로컬 서빙과 MIT 라이선스를 설명합니다. 이런 벤더 설명은 테스트 우선순위를 정할 근거이지, 내 저장소 성능의 보증은 아닙니다.
같은 토큰 구성에서 공식 비용은 얼마나 다른가
미캐시 입력 100만 + 출력 10만 토큰을 한 번 처리한다고 가정하면 계산은 간단합니다.
- DeepSeek V4 Flash:
1 × $0.14 + 0.1 × $0.28 = $0.168 - Kimi K3:
1 × $3.00 + 0.1 × $15.00 = $4.50 - GLM-5.2:
1 × $1.40 + 0.1 × $4.40 = $1.84

이 수치는 세 공식 직결 가격표의 산술 결과입니다. 세금, 도구 비용, 캐시 쓰기, 재시도, 제3자 provider 마진은 포함하지 않습니다.
실무에서는 다음 공식을 사용하세요.
채택 가능한 결과당 비용 = 모든 시도의 입력·캐시·출력·도구·재시도 비용 / 검수를 통과한 결과 수
저렴한 요청이 세 번 실패하면 “요청당 가격”만으로 경제적이라고 할 수 없습니다. 반대로 Kimi K3는 높은 텍스트 비용을 상쇄할 만큼 멀티모달 요구를 해결하거나 사람의 개입을 줄여야 합니다.
캐시 적중은 실제 계량값으로 확인한다
확인 당시 cached input은 DeepSeek $0.0028/M, Kimi $0.30/M, GLM $0.26/M입니다. 반복되는 system prompt, 저장소 지도, 공통 문서 묶음에는 큰 차이를 만들 수 있습니다.
다만 캐시 지원이 전체 prompt 적중을 뜻하지는 않습니다. provider가 반환한 cached tokens를 기록하고, 계속 바뀌는 도구 결과와 대화 이력을 고정 prefix와 분리하세요. 집계 API를 쓰면 그 서비스의 규칙과 가격으로 다시 계산해야 합니다.
DeepSeek V4 Flash를 먼저 고를 때
테스트가 명확한 버그 수정, 여러 파일의 작은 기능, 데이터 변환, 반복 tool calls라면 Flash의 낮은 가격을 활용해 표본을 늘릴 수 있습니다. 한 개 데모보다 20개 실제 과제가 더 유용합니다.
간단한 변환은 non-thinking, 계획·디버깅·다단계 도구 작업은 thinking으로 비교하세요. 13B 활성 파라미터만 보고 속도를 단정하지 마세요. provider 하드웨어, 대기열, 출력 길이, Agent harness가 실제 지연을 바꿉니다.
Kimi K3가 명확한 선택이 되는 때
UI 스크린샷, 차트, 이미지 PDF, 영상이 입력에 포함되면 네이티브 멀티모달은 선택 조건 자체가 됩니다. OCR이나 별도 vision 모델을 붙이면 이미 다른 시스템과 비용 구조입니다.
텍스트 전용 업무에서는 더 높은 증거를 요구하세요. 개입 횟수가 크게 줄었는지, 다른 모델이 못 끝낸 장기 작업을 완료했는지, 채택 결과당 비용이 개선됐는지 확인합니다. 오픈 웨이트 카드와 hosted API의 미디어 입력 contract는 같지 않을 수 있으므로 본番 형식을 다시 확인해야 합니다.
GLM-5.2의 중간 가격이 의미 있을 때
Flash가 같은 문제를 반복하거나 저장소 규칙을 놓치고 tool call 수리가 많다면 GLM-5.2를 붙여 비교합니다. 여러 추론 강도와 장기 코딩 초점은 복합 Agent 작업에 유용한 가설입니다.
그러나 “중간이라 안전하다”는 결론은 없습니다. 통과율, 사람 개입, 완료 시간이 Flash와 비슷하면 더 저렴하거나 운영이 쉬운 쪽을 남기세요. 두 번째 대표 표본에서도 재작업 감소가 반복돼야 추가 비용이 정당화됩니다.
벤치마크 순위가 충돌하는 이유
공식 모델 카드의 점수도 동일 조건의 3자 실험이 아닐 수 있습니다. 다음 항목이 다르면 결과가 바뀝니다.
- 파일 선택과 context compaction을 담당하는 agent harness;
reasoning_effort, temperature, 최대 출력, retry policy;- 네트워크, shell, 검색과 같은 도구 권한;
- 과제 버전, judge, timeout, 성공 정의;
- 직결 또는 제3자 provider, 캐시와 혼잡도.
벤더 점수는 “무엇을 시험할지”를 고르는 데 쓰고, 자체 시험을 생략하는 근거로 쓰지 마세요.
10~30개 비공개 과제로 동일 조건 테스트하기
장난감 prompt 대신 다중 파일 bug fix, tests가 있는 기능, 문서·데이터 종합, 여러 도구를 쓰는 지원 작업을 고릅니다.
- 같은 commit, 파일, 요구사항, 예상 결과에서 시작합니다.
- 가능하면 같은 provider 등급을 사용하고 무료 혼잡 endpoint와 유료 고속 route를 섞지 않습니다.
- 도구 권한, context packet, effort 정책, timeout, retry budget을 고정합니다.
- 실행 전에 tests, schema, 사실 확인, 화면 검수 등 합격 조건을 정합니다.
- pass/fail, 사람 개입, 전체 시간, input/output/cached tokens, 도구와 재시도를 기록합니다.
- 경계 과제를 반복하고 채택 결과당 비용을 비교합니다.

| 기록 | 확인할 값 |
|---|---|
| 합격 | 통과한 검사와 남은 실패 |
| 사람 개입 | 추가 설명, 승인, 수동 수정, 재시작 |
| 시간 | 시작부터 채택 가능한 결과까지 |
| 계량 | 미캐시 입력, 캐시, 출력, tools |
| 마찰 | 잘못된 tool call, context loss, refusal, retry |
필수 모달리티를 지원하지 않거나 예산을 넘거나, 두 번째 대표 표본에서도 한 모델이 명확히 앞서면 비교를 끝냅니다. 차이가 실행 편차 안이면 저렴한 후보를 기본값으로 유지하세요.
최종 선택과 다음 단계
대부분의 텍스트·코드 팀은 DeepSeek V4 Flash에 첫 실제 표본을 주는 것이 경제적입니다. Kimi K3는 멀티모달과 가치가 큰 장기 작업의 전문 선택, GLM-5.2는 실제 저장소에서 Flash의 재작업을 줄일 때 채택하는 도전자입니다.
provider 고유 추론·캐시·멀티모달 contract가 필요하면 공식 API를 우선하세요. 하나의 OpenAI-compatible 연결이 필요하다면 LaoZhang API 문서의 통합 API와 Models endpoint를 확인하되, 현재 모델 목록을 보기 전에는 세 모델 지원을 가정하지 마세요. 서구권 코딩 에이전트도 후보라면 한국어 GPT-5.6 Sol vs Claude Fable 5 비교를 이어서 볼 수 있습니다.
