대규모 API 호출이나 백엔드 텍스트 정제 파이프라인에서 비용 효율을 중시하는 서비스 개발팀에 적합한 경량 모델입니다. 실시간 챗봇 1차 분류나 대량 비정형 데이터 추출 작업에 투입할 수 있습니다.
채택 전에는 1,000,000 토큰 문맥 지원과 함께 한시적 50% 할인(입력 $0.075 / 출력 $0.25)의 종료 시점인 2026년 9월 10일 01:00 KST를 확인해야 합니다. 할인 종료 이후 정가로 환원되는 조건을 운영 예산에 반영해야 합니다.
한 줄 결론
100만 토큰 문맥과 128K 출력을 저비용으로 제공하며, 할인 종료 후 정가($0.15/$0.50) 환원을 반영해 예산을 책정해야 합니다.
바뀐 점
- 사양 및 식별자: API 식별자
glm-5.3-flash로 서비스되며 1,000,000 토큰 컨텍스트와 128,000 토큰 출력을 지원합니다. 경량 비전 작업도 소화합니다. - 프로모션 요금: 정가 대비 50% 할인된 100만 토큰당 입력 0.075달러, 출력 0.25달러에 제공됩니다. 캐시 입력은 0.015달러(정가 $0.03)입니다.
- 할인 종료 일정: 본 프로모션 할인은 2026년 9월 10일 01:00 KST에 종료되며, 이후에는 표준 정가가 적용됩니다.
가격과 조건
| 항목 | 프로모션 요금 (한시적) | 정규 요금 (표준 정가) |
|---|---|---|
| 서비스 상태 | 정식 출시 (Generally available) | 정식 출시 (Generally available) |
| 입력 가격 (1M 토큰) | $0.075 | $0.15 |
| 출력 가격 (1M 토큰) | $0.25 | $0.50 |
| 캐시 입력 가격 (1M 토큰) | $0.015 | $0.03 |
| 캐시 스토리지 요금 | 한시적 무료 | 한시적 무료 |
| 컨텍스트 / 최대 출력 | 1,000,000 토큰 / 128,000 토큰 | 1,000,000 토큰 / 128,000 토큰 |
50% 프로모션 할인은 2026년 9월 10일 01:00 KST에 종료되며, 이후에는 표준 정가(입력 $0.15 / 출력 $0.50)로 청구됩니다.
공개 평가에서 읽을 것
- LiveBench (2026-06-25 release): glm-5.3-flash 모델이 71.59점(7개 카테고리 평균)을 기록했습니다.
- Artificial Analysis Intelligence Index (v4.2 · 2026-09-04): GLM-5.3-Flash가 46.22점을 기록했습니다.
- GPQA Diamond (Artificial Analysis · GPQA Diamond): GLM-5.3-Flash가 91.21%의 정답률을 나타냈습니다.
평가 버전: v4.2 · 2026-09-04.
| 모델·실행 설정 | 공개 점수 |
|---|---|
| GLM-5.3-Flash | 46.22 |
같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.
추천하는 사용법
- 온라인 커뮤니티의 실시간 콘텐츠 라벨링이나 고객 지원 티켓 1차 분류 파이프라인에 배치하여 처리 비용을 낮추는 구성을 권장합니다.
- 2026년 9월 10일 프로모션 종료 이후 정가로 환원되었을 때의 월간 운영 비용을 사전에 산출해 두고, 캐시 입력을 적극 활용해 비용을 방어하는 실험을 추천합니다.
- 대용량 문서를 처리할 때도 문맥 길이가 길다고 해서 세부 항목의 검색 정확도가 보장되는 것은 아니므로, 주요 키워드 추출 정확도를 샘플 데이터로 사전 검증해야 합니다.
요청 한 건의 비용으로 바꿔 보면
Flash를 고객 문의의 첫 분류에 쓴다면 사람에게 전달해야 할 요청을 빠뜨리지 않는지 확인하세요. 할인 기간의 호출 비용이 낮아도 오분류를 수정하는 시간이 늘면 전체 운영 비용은 커질 수 있습니다.
GLM-5.3-Flash 기준의 아래 계산은 입력 10,000토큰과 청구 대상 출력 1,000토큰을 사용하는 텍스트 요청을 가정한 예시입니다. 실제 사용량을 측정한 결과가 아니며, 캐시가 없는 표준 호출에서 본문의 단가를 곱했습니다. 입력과 출력의 가격이 다르므로 두 항목을 더해 계산합니다.
| 모델 | 입력 비용 USD | 출력 비용 USD | 합계 USD |
|---|---|---|---|
| GLM-5.3-Flash | 0.00075 | 0.00025 | 0.001 |
이 요청을 1,000회 처리한다면 GLM-5.3-Flash의 예시 합계는 1 USD입니다. 재시도, 검색과 도구 사용료, 세금, 멀티모달 입력 비용은 포함하지 않았습니다. 추론 과정이 출력으로 청구되는 제품에서는 화면에 보이는 답변의 길이보다 청구 토큰 수가 많을 수 있습니다. 실제 청구량은 API 사용량 기록을 기준으로 확인하세요.
GLM-5.3-Flash의 도입 여부는 이 예시 금액만으로 결정하지 않는 편이 좋습니다. 같은 요청 묶음에서 정확히 완료한 건수와 사람이 다시 처리한 건수를 함께 기록하세요. 단가가 낮아도 재시도가 많으면 최종 작업 비용이 커집니다. 반대로 상위 모델이 수정 횟수를 줄여 준다면 추가 비용을 낼 요청 범위를 구체적으로 정할 수 있습니다. Flash의 할인 단가가 포함된 경우 할인 종료 뒤에는 공식 정가로 다시 계산해야 합니다.
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.