Kimi K2.7 Code는 Moonshot AI가 Kimi K2.6을 바탕으로 만든 코딩 특화 에이전트 모델이다. 공식 모델 카드는 복잡한 소프트웨어 엔지니어링 흐름의 끝까지 작업을 수행하는 능력을 강화했고, K2.6보다 thinking 토큰 사용량을 약 30% 줄였다고 설명한다.
공개 설정과 API 문서를 함께 보면 용도가 더 분명해진다. 256K 컨텍스트에서 텍스트·이미지·영상을 입력받고, 여러 차례의 도구 호출 사이에 이전 reasoning 내용을 유지한다. 반면 thinking을 끌 수 없고 Instant 모드도 지원하지 않는다. 빠른 짧은 답변보다 긴 코드베이스와 도구 실행 기록을 이어 가는 작업에 초점을 둔 구성이다.
이 글은 직접 사용기가 아니다. Moonshot AI가 공개한 모델 카드, config.json, API 가이드, 가격표와 모델 카드에서 연결한 배포 가이드만으로 사양, 비교, 비용, 도입 조건을 정리한다.
공식 문서에서 확인되는 사양
| 항목 | 공식 자료상 내용 |
|---|---|
| 공식 제품명·API ID | Kimi K2.7 Code · kimi-k2.7-code |
| 모델 유형 | 코딩 특화 에이전트 모델, 텍스트·이미지·영상 입력과 텍스트 출력 |
| 아키텍처 | MoE, 총 1T 파라미터·토큰당 32B 활성 |
| 레이어·전문가 | 61개 레이어, 384개 routed expert 중 토큰당 8개 선택, shared expert 1개 |
| 컨텍스트 | 256K, 설정값 max_position_embeddings: 262144 |
| 비전 인코더 | MoonViT, 400M 파라미터 |
| 추론 동작 | thinking과 preserve_thinking이 항상 활성화되며 비활성화 불가 |
| API 생성 설정 | max_tokens 기본값 32,768, temperature 1.0·top_p 0.95·n 1 고정 |
| 도구 호출 | 다단계 tool call, tool_choice는 auto 또는 none |
| 배포 | 공식 API, 오픈 웨이트, vLLM·SGLang·KTransformers 권장 |
| 양자화 | 네이티브 INT4, 설정상 4비트·group size 32 compressed-tensors |
| 라이선스 | Modified MIT License |
config.json은 텍스트 백본의 hidden size 7,168, attention head 64개, expert별 MoE hidden size 2,048을 기록한다. 모델 카드의 160K 어휘 규모는 설정 파일의 vocab_size: 163840과 대응한다. 비전 설정에는 27개 레이어와 1,152 hidden size가 적혀 있다.
공식 API는 OpenAI·Anthropic 호환 형식을 제공한다. 자체 배포에는 transformers>=4.57.1,<5.0.0이 요구된다. 모델 카드가 오픈 웨이트와 Modified MIT를 명시하지만, 실제 배포 전에는 라이선스 원문과 제3자 고지 사항을 별도로 검토해야 한다.
API 가이드의 max_tokens 32,768은 기본값이다. 지정된 공식 문서만으로 절대 최대 출력 토큰을 확정할 수는 없다. 256K는 입력만의 한도가 아니라 요청에 포함된 입력과 생성·추론 기록을 함께 관리해야 하는 컨텍스트 범위로 보는 편이 안전하다.
K2.6에서 달라진 동작
Moonshot은 K2.7 Code가 K2.5·K2.6과 같은 아키텍처를 사용해 기존 배포 방법을 재사용할 수 있다고 안내한다. 세대 차이는 모델 크기를 키웠다는 설명보다 코딩 작업의 완주율, 지시 준수, 에이전트 실행과 토큰 효율 개선에 맞춰져 있다.
공식 모델 카드가 밝힌 thinking 토큰 감소 폭은 K2.6 대비 약 30%다. 이는 같은 가격표에서 실제 요청당 출력 토큰을 줄일 가능성을 보여주지만, 모든 작업의 청구액이 정확히 30% 줄어든다는 뜻은 아니다. 두 모델을 같은 저장소와 도구 구성으로 실행한 총 청구 토큰 자료가 없기 때문이다.
preserve_thinking은 선택 기능이 아니다. 이전 assistant 메시지의 reasoning 내용을 여러 턴에 걸쳐 보존하며, 다단계 도구 호출에서는 해당 reasoning_content를 다음 요청 컨텍스트에 유지해야 한다. 중간 reasoning을 제거하는 기존 게이트웨이나 대화 저장 구조라면 연동 방식을 먼저 바꿔야 한다.
영상 입력도 지원하지만 공식 모델 카드는 현재 공식 API에서만 실험 기능으로 제공된다고 적는다. vLLM이나 SGLang으로 자체 배포한 엔드포인트가 공식 API와 같은 영상 대화 동작을 제공한다고 가정하면 안 된다.
공식 비교표에서 보이는 위치
아래 점수는 Moonshot AI의 Kimi K2.7 Code 모델 카드에 실린 결과다. 높을수록 좋은 지표이며, 독립 기관의 통합 리더보드가 아니라 공급사가 구성하거나 재실행한 평가라는 점을 함께 봐야 한다.
| 평가 | Kimi K2.6 | Kimi K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | 69.0 | 67.4 |
| Program Bench | 48.3 | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 26.7 | 35.1 | 35.5 | 42.8 |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | 52.8 | 50.4 |
| MCP Atlas | 69.4 | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 72.8 | 81.1 | 92.9 | 76.4 |
K2.7 Code는 K2.6보다 여섯 평가에서 모두 높다. 절대점수 차이는 Kimi Code Bench v2 +11.1, Program Bench +5.3, MLS Bench Lite +8.4, Kimi Claw 24/7 +4.0, MCP Atlas +6.6, MCP Mark Verified +8.3이다. K2.6을 이미 운영 중이라면 같은 아키텍처를 유지하면서 장기 코딩과 도구 사용 성공률을 다시 측정할 이유가 있다.
다만 이 표만으로 GPT-5.5나 Claude Opus 4.8보다 전반적으로 낫다고 말할 수는 없다. K2.7 Code는 MCP Mark Verified에서 Opus 4.8보다 높고, MLS Bench Lite에서는 GPT-5.5와 0.4점 차이다. 나머지 항목에서는 두 폐쇄형 대안 중 최고 점수보다 낮다.
평가 조건도 동일한 API 호출 한 번으로 맞춘 형태가 아니다. K2.7 Code와 K2.6은 Kimi Code CLI의 thinking 모드, temperature 1.0, top-p 0.95, 262,144토큰 컨텍스트로 실행됐다. GPT-5.5는 Codex xhigh, Opus 4.8은 Claude Code xhigh를 사용했다. Kimi Code Bench v2와 Kimi Claw 24/7은 Moonshot 내부 평가이며, MCP Mark Verified는 모델 카드 작성 시점에 공개 예정이라고 설명됐다. 따라서 실제 구매 판단에는 동일 저장소·동일 도구·동일 시간 제한을 적용한 자체 평가가 필요하다.
가격과 실제 운영비
Kimi API Platform의 현재 가격표는 Kimi K2.7 Code를 100만 토큰당 다음과 같이 표시한다.
| 과금 항목 | 가격 |
|---|---|
| 캐시 적중 입력 | $0.19 / 100만 토큰 |
| 일반 입력 | $0.95 / 100만 토큰 |
| 출력 | $4.00 / 100만 토큰 |
캐시를 적용하지 않고 한 달에 입력 1,000만 토큰과 출력 200만 토큰을 사용하면 토큰 비용은 10 × $0.95 + 2 × $4.00 = $17.50이다. 같은 입력이 모두 캐시 적중으로 과금된다는 단순 가정에서는 10 × $0.19 + 2 × $4.00 = $9.90이다. 실제 청구액에는 캐시 적중률, 실패한 도구 호출, 재시도, reasoning 길이가 영향을 준다.
K2.6의 일반 입력과 출력 가격도 각각 $0.95와 $4.00으로 같다. 캐시 적중 입력은 K2.6이 $0.16으로 K2.7 Code보다 $0.03 낮다. 따라서 목록 가격만으로 K2.7 Code를 더 싼 모델이라고 부를 수 없다. Moonshot이 제시한 약 30%의 thinking 토큰 감소가 실제 총비용을 낮추는지는 같은 작업의 완료율과 청구 토큰을 함께 기록해야 확인된다.
오픈 웨이트라고 해서 자체 배포비가 낮다고 단정하기도 어렵다. 공식 vLLM·SGLang 예시는 단일 노드 H200에서 tensor parallel 8을 사용하고, KTransformers 측정 예시는 8×NVIDIA L20 구성을 사용한다. 공식 문서에는 시간당 인프라 비용이나 동시 사용자별 원가가 없다. GPU 서버를 이미 운영하고 데이터 통제가 필요한 조직은 자체 배포를 검토할 수 있지만, 소규모 팀은 API 비용과 운영 인력 비용을 먼저 비교하는 편이 현실적이다.
실전 도입에서 확인할 항목
직접 사용기가 아니므로 특정 저장소에서의 성공률이나 속도를 보장할 수 없다. 도입 전에는 다음과 같은 대표 작업을 K2.6과 같은 조건으로 실행하는 편이 좋다.
| 테스트 작업 | 기록할 지표 |
|---|---|
| 여러 파일에 걸친 버그 수정과 테스트 통과 | 최종 통과율, 수정 파일 수, 되돌림 횟수 |
| 긴 리팩터링과 마이그레이션 | 중간 지시 누락, 컨텍스트 재주입 횟수, 총 토큰 |
| GitHub·파일시스템·브라우저 도구 연속 호출 | 도구 선택 정확도, 잘못된 호출, 복구 성공률 |
| 스크린샷·영상이 포함된 UI 오류 분석 | 시각 근거 누락, 잘못 읽은 화면 요소, 재시도율 |
| 같은 작업의 K2.6 대조군 | 완료 시간, thinking·출력 토큰, 요청당 비용 |
속도는 별도 측정해야 한다. 공식 API 문서는 kimi-k2.7-code-highspeed라는 같은 모델의 고속 변형을 별도로 안내하지만, 이 글의 대상은 kimi-k2.7-code다. 고속 변형의 처리량 수치를 일반 K2.7 Code의 속도로 옮겨 적지 않았다.
먼저 답하면
- 추천 작업: 긴 코드베이스와 여러 도구 실행 기록을 유지해야 하는 코딩 에이전트, 이미지·영상 근거까지 읽는 소프트웨어 작업
- 비추천 작업: thinking을 끄고 짧은 응답 지연을 최소화해야 하는 단순 코드 보완·일반 채팅
- 비용 판단: K2.6과 일반 입력·출력 단가는 같고 캐시 적중 단가는 더 높다. 약 30%의 thinking 토큰 감소가 실제 청구액과 완료 비용을 낮추는지는 자체 대조가 필요하다.
- 현재 판단: K2.6 운영팀에는 호환성을 유지한 업그레이드 후보이고, 신규 팀에는 긴 작업 완주율을 가격보다 먼저 검증해야 하는 코딩 에이전트 모델이다.
추천 대상 / 비추천 대상
추천
- K2.6 배포 구조를 유지하면서 긴 코딩 작업의 성공률을 높이고 싶은 팀
- 256K 컨텍스트에서 코드, 문서, 도구 실행 기록을 함께 유지하는 에이전트 개발팀
- 이미지나 영상을 읽고 코드 수정과 도구 호출까지 이어 가는 워크플로를 만드는 팀
- OpenAI·Anthropic 호환 API와 오픈 웨이트 배포를 함께 비교하려는 모델 플랫폼 팀
- reasoning 내용을 보존하는 다단계 호출 구조를 운영할 수 있는 팀
비추천
- non-thinking 또는 Instant 모드가 필요한 저지연 서비스
- 중간 reasoning을 저장하거나 다음 호출에 전달할 수 없는 게이트웨이 환경
- 단일 소비자용 GPU에서 간단히 전체 모델을 운영하려는 개인 개발자
- 독립 재현된 공개 벤치마크만으로 모델을 구매해야 하는 조직
- 목록 단가만 보고 K2.6보다 즉시 저렴한 교체 모델을 찾는 팀
판단
Kimi K2.7 Code는 K2.6의 배포 호환성을 유지하면서 긴 코딩 작업, 지시 준수, 도구 사용과 thinking 토큰 효율을 다듬은 모델이다. 공식 비교표에서는 K2.6을 여섯 항목 모두 앞섰지만, GPT-5.5와 Claude Opus 4.8을 전반적으로 넘어섰다는 근거는 아니다.
선택 기준은 단순 성능 순위보다 작업 형태에 있다. 한 번의 답변보다 여러 시간에 걸친 수정·테스트·도구 호출의 완주가 중요하고, reasoning 기록을 계속 보존할 수 있다면 시험할 가치가 있다. 반대로 짧은 코드 보완이나 즉답 중심 서비스에서는 강제 thinking과 보존형 컨텍스트가 비용·지연 측면의 부담이 될 수 있다.
K2.6 사용자라면 같은 과제 20~30개를 두 모델에 배정해 완료율, 총 토큰, 재시도와 실제 청구액을 비교하는 방식이 적합하다. 신규 도입이라면 API로 업무 적합성을 먼저 확인한 뒤, 데이터 통제와 사용량이 자체 배포 비용을 정당화할 때 오픈 웨이트 운영을 검토하는 순서가 안전하다.
아직 공식 문서에서 확인되지 않은 부분
kimi-k2.7-code의 절대 최대 출력 토큰과 지역별 실제 응답 속도- 한국어 코드 설명·리뷰·도구 호출 정확도
- 같은 작업에서 K2.6 대비 실제 청구액이 줄어드는 비율
- 공급사 공개 점수의 외부 독립 재현 결과
- 공식 API의 영상 입력 실험 기능에 대한 장기 작업 성공률
- 자체 배포 구성별 시간당 비용과 동시 사용자별 처리량
함께 읽을 글
근거와 출처
- Kimi K2.7 Code 공식 모델 카드 — 제품 위치, 아키텍처, 공식 비교표, 추론 동작, API·라이선스. Moonshot AI, 확인일 2026-08-26
- Kimi K2.7 Code config.json — 컨텍스트, 레이어, 전문가, 비전 인코더와 INT4 설정. Moonshot AI, 확인일 2026-08-26
- Kimi K2.7 Code API 가이드 — 멀티모달 입력, 강제 thinking, 생성·도구 호출 파라미터와 reasoning 보존 조건. Moonshot AI, 확인일 2026-08-26
- Kimi API Platform — K2.7 Code·K2.6의 캐시 적중, 입력, 출력 가격. Moonshot AI, 확인일 2026-08-26
- Kimi 모델 과금 설명 — 토큰 단위와 입력·출력 사용량 과금 방식. Moonshot AI, 확인일 2026-08-26
- Kimi K2.7 Code 공식 배포 가이드 — vLLM·SGLang·KTransformers 배포 예시와 검증 구성. Moonshot AI, 확인일 2026-08-26
게시: 2026-08-26 05:25 KST 작성 방식: 직접 사용기가 아닌 Moonshot AI 공식 문서 분석
독자 의견
댓글 0
글에 대한 생각과 경험을 남겨 주세요. 서로를 존중하는 표현을 부탁드립니다.