다국어 비즈니스 처리, 복합 문서 추론, 대형 소프트웨어 개발 워크플로를 구축하려는 엔지니어링 팀에 적합한 플래그십 모델입니다. 비사고 모드와 사고 모드를 작업 성격에 맞게 선택할 수 있습니다.
도입 전에는 1,000,000 토큰 문맥 지원과 함께 USD 고정 단가가 아닌 알리바바 클라우드 Model Studio의 공식 CNY 요금 체계 및 배치 API 50% 할인 조건을 확인해야 합니다. 결제 통화 기준을 예산에 반영해야 합니다.
한 줄 결론
2026년 9월 2일 출시된 최신 플래그십으로 100만 토큰 문맥과 사고 모드를 지원하며, Model Studio의 CNY 공식 요금을 기준으로 비용을 계산해야 합니다.
바뀐 점
- 사양 및 스냅샷: 2026년 9월 2일 출시된
qwen3.8-max-0902스냅샷으로 제공되며 1,000,000 토큰 컨텍스트를 지원합니다. - 이중 추론 모드: 일반 처리를 위한 비사고(Non-thinking) 모드와 심층 문제 해결을 위한 사고(Thinking) 모드를 선택할 수 있습니다.
- 과금 및 배치 할인: Model Studio를 통해 글로벌 및 인터내셔널 티어의 공식 CNY 단가로 청구되며 배치 호출 시 50% 할인이 지원됩니다.
가격과 조건
| 리전 티어 | 입력 단가 (1M 토큰) | 출력 단가 (1M 토큰) | 지원 조건 |
|---|---|---|---|
| Global Tier | CNY 12.0 | CNY 36.0 | 컨텍스트 1,000,000 토큰, 배치 50% 할인 |
| International Tier | CNY 14.988 | CNY 44.965 | 컨텍스트 1,000,000 토큰, 배치 50% 할인 |
이 글의 요금표는 확인한 공식 문서의 CNY 표기를 따릅니다. 지역별 청구 조건을 확인하고 통화를 임의 환산하지 않습니다.
공개 평가에서 읽을 것
- LiveBench (2026-06-25 release, qwen3.8-max): 78.46점 (7개 카테고리 평균).
- Artificial Analysis Intelligence Index (v4.2 · 2026-09-04): Qwen3.8 Max 기준 46.91점.
- GPQA Diamond (Artificial Analysis · GPQA Diamond): Qwen3.8 Max 기준 92.73%의 정답률을 기록했습니다.
평가 버전: v4.2 · 2026-09-04.
| 모델·실행 설정 | 공개 점수 |
|---|---|
| Qwen3.8 Max | 46.91 |
같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.
추천하는 사용법
- 다국어 문서 검토나 복합 데이터 추론 시 사고 모드를 적용하고, 실시간성이 요구되지 않는 대량 분석에는 배치 API를 연결해 CNY 50% 할인을 받는 구성을 권장합니다.
- 100만 토큰 문맥을 활용하더라도 장문 내 세부 항목의 검색 정확도가 보장되는 것은 아니므로, 주요 키워드에 대한 인출 정확도를 사전 검증하는 실험을 권장합니다.
긴 문서 분석에 적용하는 예
여러 부서의 규정 문서를 읽고 서로 충돌하는 조항을 찾는 작업을 생각해 보겠습니다. Max의 긴 문맥 한도는 문서를 한 번에 전달할 수 있는 범위를 알려 줍니다. 그러나 필요한 조항을 정확히 찾아냈는지, 서로 다른 문서의 시행일을 구별했는지는 별도로 확인해야 합니다. 문서마다 번호를 붙이고 답변에 해당 번호와 원문 구절을 함께 요구하면 검토하기 쉬워집니다.
실험에서는 처음부터 문서 전체를 넣기보다 짧은 문서 묶음으로 정답 목록을 만드세요. 이어서 문서 수를 늘리면서 누락된 조항과 잘못 연결한 조항이 얼마나 생기는지 확인합니다. 사고 모드의 결과가 좋아도 출력 토큰이 크게 늘 수 있으므로, 성공한 분석 한 건의 비용을 함께 적어야 합니다. 이 절차는 이 글에서 실시한 성능 테스트가 아니라 독자가 재현할 수 있는 평가 제안입니다.
요금 비교 시에는 CNY와 USD를 혼용하지 마세요. 배치 할인은 대상 모델과 제공 지역의 적용 조건을 확인한 뒤 계산합니다. 실시간 응답이 필요한 내부 검색 서비스에는 배치 처리 조건을 그대로 적용할 수 없습니다. 긴 문맥 지원이 꼭 필요한 요청과 일부 문단만 검색하면 되는 요청을 나누면 Max를 투입할 범위가 더 분명해집니다.
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.