IDE 및 터미널 환경에서 다단계 코드 생성이나 시스템 제어 자동화 워크플로를 구축하려는 개발팀에 적합한 모델입니다. 추론 강도 설정 기반의 사고 강도를 활용할 수 있습니다.

운영 전에는 500,000 토큰 컨텍스트와 함께 표준 요금(입력 $2 / 출력 $6) 대비 2배 높은 Fast 모드(입력 $4 / 출력 $12)의 단가 차이를 확인해야 합니다. IDE 연동 시 호출 빈도와 캐싱 설정을 점검해야 합니다.

한 줄 결론

50만 토큰 문맥과 사고 강도 제어를 지원하며, 백그라운드 자동화에는 표준 모드를, 반응 속도가 중요한 작업에는 패스트 모드를 선별해 사용하는 구성이 적합합니다.

바뀐 점

  • 사양 및 식별자: API ID grok-4.6으로 서비스되며 500,000 토큰 문맥을 지원합니다. 최대 출력 한도는 확인한 공식 페이지에 별도 명시되어 있지 않습니다.
  • 추론 강도 설정: reasoning_effort 매개변수로 low, medium, high, xhigh 4단계 사고 강도를 제어할 수 있습니다.
  • 요금 모드 분리: 표준 요율($2/$6)과 지연 시간을 줄인 Fast 요율($4/$12)이 제공됩니다. 표준 모드 프롬프트 캐시 읽기는 100만 토큰당 0.50달러입니다.

가격과 조건

항목 표준 모드 (Standard) 패스트 모드 (Fast)
공식 제품명 / API ID Grok 4.6 (grok-4.6) Grok 4.6 Fast (공식 Fast 변형 문서 확인)
서비스 상태 정식 출시 (Generally available) 정식 출시 (Generally available)
컨텍스트 윈도우 500,000 토큰 500,000 토큰
최대 출력 한도 별도 미확인 별도 미확인
입력 가격 (1M 토큰) $2.00 $4.00
출력 가격 (1M 토큰) $6.00 $12.00
프롬프트 캐시 읽기 $0.50 / 1M 토큰 미공개

Fast 모드는 표준 요금 대비 단가가 2배이므로, 즉각적인 응답이 필요한 세션과 비동기 백엔드 처리를 엔드포인트별로 분리해야 합니다.

표준 요금도 입력 200K를 초과하면 입력 $4 / 출력 $12, 캐시 읽기 $1(100만 토큰당)로 달라집니다. 이 장문 할증과 발표에 언급된 Fast 변형의 추가 요금은 서로 다른 조건입니다.

공개 평가에서 읽을 것

  • LiveBench (2026-06-25 release): grok-4.6 모델이 78.04점(7개 카테고리 평균)을 기록했습니다.
  • Artificial Analysis Intelligence Index (v4.2 · 2026-09-04): high 모드 기준 50.58점을 기록했습니다.
  • GPQA Diamond (Artificial Analysis · GPQA Diamond): high 모드 94.95%, medium 모드 93.54%를 나타냈습니다.
  • Terminal-Bench 4.0 (Terminal-Bench 4.0 · official leaderboard): Grok 4.6 · Grok Build · high 환경에서 20.30% 해결률을 기록했습니다.

xAI · 공개 평가 결과. Artificial Analysis Intelligence Index · Intelligence Index v4.2

도표 크게 보기

평가 버전: v4.2 · 2026-09-04.

모델·실행 설정 공개 점수
Grok 4.6 (high) 50.58

전체 결과와 평가 조건

같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.

도표의 공개 원문

추천하는 사용법

  • Cursor나 Grok Build 연동 시에는 표준 모드를 기본으로 적용하고 캐시를 활용해 비용을 절감하는 방식을 권장합니다.
  • 단위 테스트 수정 자동화 파이프라인에서 사고 강도를 medium과 high로 변경해가며 소모 토큰 대비 해결 품질을 비교하는 실험을 추천합니다.

요청 한 건의 비용으로 바꿔 보면

개발 보조에 Grok을 붙일 때는 답변을 빨리 받는 일과 테스트를 통과하는 패치를 받는 일을 분리해 기록하세요. Fast 모드의 추가 비용을 내기 전에 실제 대기 시간이 줄었는지 확인해야 합니다. 표준 모드와의 차이는 같은 저장소, 같은 오류, 같은 제한 시간으로 측정하는 편이 좋습니다.

Grok 4.6 기준의 아래 계산은 입력 10,000토큰과 청구 대상 출력 1,000토큰을 사용하는 텍스트 요청을 가정한 예시입니다. 실제 사용량을 측정한 결과가 아니며, 캐시가 없는 표준 호출에서 본문의 단가를 곱했습니다. 입력과 출력의 가격이 다르므로 두 항목을 더해 계산합니다.

모델 입력 비용 USD 출력 비용 USD 합계 USD
Grok 4.6 0.02 0.006 0.026

이 요청을 1,000회 처리한다면 Grok 4.6의 예시 합계는 26 USD입니다. 재시도, 검색과 도구 사용료, 세금, 멀티모달 입력 비용은 포함하지 않았습니다. 추론 과정이 출력으로 청구되는 제품에서는 화면에 보이는 답변의 길이보다 청구 토큰 수가 많을 수 있습니다. 실제 청구량은 API 사용량 기록을 기준으로 확인하세요.

Grok 4.6의 도입 여부는 이 예시 금액만으로 결정하지 않는 편이 좋습니다. 같은 요청 묶음에서 정확히 완료한 건수와 사람이 다시 처리한 건수를 함께 기록하세요. 단가가 낮아도 재시도가 많으면 최종 작업 비용이 커집니다. 반대로 상위 모델이 수정 횟수를 줄여 준다면 추가 비용을 낼 요청 범위를 구체적으로 정할 수 있습니다.

출처