시각과 텍스트가 결합된 대형 기술 문서나 도면을 분석하려는 팀은 Kimi K3를, 코드베이스 리팩터링과 프로그래밍 세션을 운영하는 개발자는 Kimi K2.7 Code를 검토할 수 있습니다. 작업 대상에 맞춘 모델 선택이 필요합니다.
도입 전에는 상시 추론(Always Thinking) 특성에 따른 지연 시간과 공식 모델별 요금 확인 구조를 확인해야 합니다. 오픈 가중치 배포와 클라우드 API 중 환경에 맞는 방식을 선택해야 합니다.
한 줄 결론
네이티브 멀티모달 추론에는 Kimi K3, 특화 코딩 작업에는 K2.7 Code를 선택하며, 오픈 가중치 호스팅과 플랫폼 API의 비용 조건을 비교해야 합니다.
바뀐 점
- Kimi K3 출시: 1,000,000 토큰 컨텍스트를 지원하는 네이티브 멀티모달 모델로 오픈 가중치와 클라우드 API로 공급됩니다. 항상 사고 모드로 동작하며
reasoning_effort매개변수로 추론 깊이를 조절합니다. 공식 저장소에서 최대 출력 한도는 미기재 상태입니다. - Kimi K2.7 Code 제공: 262,144 토큰 컨텍스트의 코딩 특화 모델로, 다회차 대화에서 사고 맥락을 보존하는
preserve_thinking옵션을 지원합니다.
가격과 조건
| 모델명 | API ID | 컨텍스트 | 최대 출력 | 과금 및 실행 조건 |
|---|---|---|---|---|
| Kimi K3 | kimi-k3 |
1,000,000 | 미공개 | 오픈 가중치 및 상용 API (공식 모델별 요금 확인) |
| Kimi K2.7 Code | kimi-k2.7-code |
262,144 | 미공개 | 오픈 가중치 및 상용 API (공식 모델별 요금 확인) |
공식 Kimi 페이지는 토큰별 종량제 과금을 설명합니다. 확인 당시 숫자 요금표를 읽을 수 없어 이 글은 단가를 미확인으로 표시했습니다. 오픈 가중치를 자체 인프라에 배포할 경우 무료로 구동되는 것이 아니며 서버와 전력 비용이 발생합니다.
공개 평가에서 읽을 것
- Kimi K3: LiveBench(2026-06-25 release, kimi-k3) 79.19점, Artificial Analysis Intelligence Index(v4.2 · 2026-09-04, max) 50.23점, GPQA Diamond max 93.54%, low 84.24%를 기록했습니다.
- Kimi K2.7 Code: LiveBench(kimi-k2.7-code) 68.41점, GPQA Diamond 89.60%를 나타냈습니다.
평가 버전: v4.2 · 2026-09-04.
| 모델·실행 설정 | 공개 점수 |
|---|---|
| Kimi K3 (max) | 50.23 |
같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.
추천하는 사용법
- 복합 도표나 기술 문서를 해석할 때는 Kimi K3의 네이티브 멀티모달 추론을 활용하되, 실시간 대화보다는 비동기 큐 기반 파이프라인에 배치하는 방식을 권장합니다.
- 대규모 코드 리팩터링 작업에서는 K2.7 Code의
preserve_thinking옵션을 적용해 다단계 추론 결과의 품질을 점검하는 실험을 추천합니다.
K3와 Code를 같은 기준으로 비교하기
Moonshot 모델을 도입하는 팀은 문서를 이해하는 요청과 실제 파일을 수정하는 요청을 구별하는 것이 좋습니다. 기술 문서의 도표를 설명하는 작업은 시각 정보 해석이 중요하고, 저장소의 오류를 고치는 작업은 도구 실행과 테스트 통과 여부가 중요합니다. 한 종류의 평가에서 좋은 결과를 얻었다고 해서 다른 요청도 같은 수준으로 처리한다고 판단할 수 없습니다.
문서 분석에는 숫자와 단위를 포함한 표를 준비하고, 답변이 어느 셀을 근거로 삼았는지 확인하세요. 코드 작업에는 재현 가능한 오류와 실행 가능한 테스트를 함께 제공해 수정 전후를 비교합니다. K3와 K2.7 Code의 사고 방식이 다르다면 사용한 설정도 기록해야 합니다. 첫 응답이 나온 시간과 작업이 완전히 끝난 시간은 서로 다른 지표이므로 따로 측정합니다.
요금은 실제 사용하는 계정의 공식 가격표에서 다시 확인하는 편이 안전합니다. 컨텍스트가 길어질 때 구간이 나뉘는지, 캐시가 적용되는지, 추론 토큰이 어떻게 청구되는지에 따라 계산이 달라질 수 있습니다. 이 글은 확인하지 못한 단가를 빈칸 대신 임의 숫자로 채우지 않습니다. 예산이 정해진 서비스라면 요청 한 건의 최대 토큰 수와 재시도 횟수를 먼저 제한한 뒤 후보 모델을 평가하세요.
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.