대규모 레거시 코드 리팩터링이나 보안 취약점 점검 등 깊이 있는 추론이 필요한 엔지니어링 팀에 적합한 플래그십 모델입니다. 복잡한 시스템 아키텍처 검토에 투입할 수 있습니다.
운영 전에는 100만 토큰당 입력 1.40달러, 출력 4.40달러의 요율과 상시 사고 모드 동작 조건(thinking.type: "disabled" 비호환)을 확인해야 합니다. 비사고 프롬프트 호출이 불가하므로 파이프라인 설정을 점검해야 합니다.
한 줄 결론
100만 토큰 문맥과 128K 출력을 지원하며, 사고 모드가 상시 가동되므로 연산 복잡도에 맞춘 프롬프트 설계가 필요합니다.
바뀐 점
- 사양 및 식별자: API ID
glm-5.3으로 제공되며 1,000,000 토큰 컨텍스트와 128,000 토큰 출력을 지원합니다. - 상시 사고 모드: low, high, max 수준을 지원하며 기본값은 max입니다.
thinking.type: "disabled"설정은 호환되지 않습니다. - 과금 및 캐시: 100만 토큰당 입력 1.40달러, 출력 4.40달러이며 캐시 입력은 0.26달러입니다. 컨텍스트 캐싱 스토리지 요금은 한시적 무료입니다.
가격과 조건
| 항목 | 공식 확인 사양 |
|---|---|
| 공식 제품명 / API ID | GLM-5.3 (glm-5.3) |
| 서비스 상태 | 정식 출시 (Generally available) |
| 컨텍스트 윈도우 | 1,000,000 토큰 |
| 최대 출력 한도 | 128,000 토큰 |
| 표준 입력 가격 | $1.40 / 1M 토큰 |
| 표준 출력 가격 | $4.40 / 1M 토큰 |
| 캐시 입력 가격 | $0.26 / 1M 토큰 |
| 캐시 스토리지 요금 | 한시적 무료 (Limited-time Free) |
상시 사고 모드가 적용되므로 비사고 호출 옵션은 지원되지 않으며, 작업 난도에 따라 reasoning_effort 수준을 설정해야 합니다.
공개 평가에서 읽을 것
- LiveBench (2026-06-25 release, glm-5.3): 76.14점 (7개 카테고리 평균).
- Artificial Analysis Intelligence Index (v4.2 · 2026-09-04): max 모드에서 48.58점.
- GPQA Diamond (Artificial Analysis · GPQA Diamond): max 모드 91.72%의 정답률을 나타냈습니다.
- Terminal-Bench 4.0 (Terminal-Bench 4.0 · official leaderboard): GLM-5.3 · Claude Code · max 환경에서 41.82% 과제 해결률을 기록했습니다. (구형 GLM-5.2는 LiveBench 73.16점, GPQA Diamond max 89.49%를 기록했습니다.)
평가 버전: v4.2 · 2026-09-04.
| 모델·실행 설정 | 공개 점수 |
|---|---|
| GLM-5.3 (max) | 48.58 |
같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.
추천하는 사용법
- 정밀한 소프트웨어 패치나 보안 점검 작업에는 기본 max 모드를 유지하고, 다단계 테스트 자동화에는 high나 low로 조정해 응답 시간을 시험하는 구성을 권장합니다.
- 기존 비사고 프롬프트 호출 코드가 있다면
thinking.type: "disabled"매개변수를 제거하는 코드 정비 작업을 선행해야 합니다.
요청 한 건의 비용으로 바꿔 보면
고객 지원 티켓을 분류하는 작업을 예로 들면, 낮은 단가만큼 오분류 처리 비용도 중요합니다. 담당자가 수정한 티켓 수를 기록하고, Flash가 처리하기 어려운 유형을 기본 GLM 모델로 넘기는 방식을 비교할 수 있습니다. 할인 종료 후 단가까지 반영해야 운영 예산이 흔들리지 않습니다.
GLM-5.3 기준의 아래 계산은 입력 10,000토큰과 청구 대상 출력 1,000토큰을 사용하는 텍스트 요청을 가정한 예시입니다. 실제 사용량을 측정한 결과가 아니며, 캐시가 없는 표준 호출에서 본문의 단가를 곱했습니다. 입력과 출력의 가격이 다르므로 두 항목을 더해 계산합니다.
| 모델 | 입력 비용 USD | 출력 비용 USD | 합계 USD |
|---|---|---|---|
| GLM-5.3 | 0.014 | 0.0044 | 0.0184 |
| GLM-5.2 | 0.014 | 0.0044 | 0.0184 |
이 요청을 1,000회 처리한다면 GLM-5.3의 예시 합계는 18.4 USD입니다. 재시도, 검색과 도구 사용료, 세금, 멀티모달 입력 비용은 포함하지 않았습니다. 추론 과정이 출력으로 청구되는 제품에서는 화면에 보이는 답변의 길이보다 청구 토큰 수가 많을 수 있습니다. 실제 청구량은 API 사용량 기록을 기준으로 확인하세요.
GLM-5.3의 도입 여부는 이 예시 금액만으로 결정하지 않는 편이 좋습니다. 같은 요청 묶음에서 정확히 완료한 건수와 사람이 다시 처리한 건수를 함께 기록하세요. 단가가 낮아도 재시도가 많으면 최종 작업 비용이 커집니다. 반대로 상위 모델이 수정 횟수를 줄여 준다면 추가 비용을 낼 요청 범위를 구체적으로 정할 수 있습니다. Flash의 할인 단가가 포함된 경우 할인 종료 뒤에는 공식 정가로 다시 계산해야 합니다.
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.