xAI가 Grok 4.5 공개 이후 불과 5주 만에 Grok 4.6을 정식 출시했다. 독립 평가기관인 Artificial Analysis 지능 지수에서 61점을 기록해 OpenAI의 최상위 플래그십 GPT-5.6 Sol과 동률을 이뤘다. 지식 노동 및 에이전트 다단계 작업에서 강력한 턴 효율을 보이지만, 프롬프트 길이가 20만 토큰을 넘는 순간 전체 요청 단가가 두 배로 뛰는 요금 체계는 도입 전 반드시 계산해 두어야 할 변수다.

먼저 답하면

  • 추천 작업: 20만 토큰 이내의 프롬프트에서 도구 호출 턴 수를 대폭 줄여야 하는 지식 노동 에이전트, Cursor 연동 코딩 환경
  • 비추천 작업: 20만 토큰을 상시 초과하는 대규모 문서/코드베이스 전체 임베딩 및 검색 파이프라인
  • 현재 판단: Grok 4.6은 지식 노동 평가(GDPval-AA 1753)와 에이전트 턴 효율(평균 53턴으로 Claude Opus 5의 절반 수준)에서 확실한 실무 경쟁력을 입증했다. 다만 20만 토큰을 넘기면 입력 $4, 출력 $12로 2배 할증이 전 구간에 소급 적용되므로, 컨텍스트 압축이나 분할 처리가 전제되어야 가성비를 챙길 수 있다.

정확히 어떤 모델인가

항목 확인된 내용
공급자 xAI (SpaceX AI)
공식 제품명 Grok 4.6
API ID grok-4.6
접근 상태 Generally available (Grok Build, Cursor, xAI API)
컨텍스트 500,000 토큰
최대 출력 128,000 토큰
20만 토큰 미만 가격 입력 $2.00 / 1M 토큰, 출력 $6.00 / 1M 토큰
20만 토큰 이상 가격 입력 $4.00 / 1M 토큰, 출력 $12.00 / 1M 토큰 (전체 토큰에 소급 적용)
캐시 입력 단가 $0.50 / 1M 토큰 (Grok 4.5 $0.30 대비 인상)
입출력 형식 텍스트 입출력, 이미지 입력
주요 기능 xhigh 사고 단계 지원, Cursor 네이티브 통합, 자체 검증 루프 강화, GB300 NVL72 클러스터 훈련

Grok 4.6은 Grok 4.5 체크포인트를 기반으로 직전 모델이 생성한 고품질 추론 데이터를 재선별해 학습에 투입하는 합성 데이터 루프로 완성됐다. 특히 Cursor 인수 효과로 실제 개발자의 편집 행동 패턴이 학습 데이터에 대거 반영됐다.

벤치마크에서 확인되는 위치

벤치마크 Grok 4.6 GPT-5.6 Sol Claude Opus 5 비고
AA Intelligence Index 61 61 63 최상위권 동률 안착
GDPval-AA v2 (지식 노동) 1753 1728 1741 지식 노동 지표 1위권
AA-Briefcase (에이전트) 1577 1550 1560 다단계 업무 수행력 우수
τ³-Banking (금융 업무) 50.7% 48.5% 52.0% 상위 2위 기록
DeepSWE (실전 코딩) 65.9% 73.0% 71.5% 코딩 순수 성능은 다소 열세
Terminal-Bench v3.0 26.0% 34.2% 34.0% 터미널 명령 제어 보완 필요
평균 에이전트 완료 턴 수 53턴 82턴 103턴 절반 수준의 왕복으로 과제 완료

지식 노동과 금융, 복합 에이전트 과제에서는 최상위 점수를 냈지만, 실제 오픈소스 레포지토리를 수정하는 DeepSWE나 터미널 벤치마크에서는 GPT-5.6 Sol 대비 격차가 확인된다.

가격과 실제 선택 조건

Grok 4.6의 명목 가격은 $2 / $6으로 매력적이지만, 실무 적용 시 아래 두 가지 가격 정책을 숙지해야 한다.

  1. 20만 토큰 계단식 할증의 소급 적용: 요청 컨텍스트가 20만 토큰을 1토큰이라도 넘기면 초과분에만 $4/$12가 붙는 것이 아니라, 요청의 1번 토큰부터 전체가 $4/$12로 계산된다. 25만 토큰 요청 시 예상 비용이 2배로 폭증할 수 있다.
  2. 높은 토큰 생성량: 모델 자체의 자가 검증(self-critique) 루프가 활성화되어 있어 Grok 4.5 대비 생성 토큰 수가 많다. 단가가 같더라도 월 청구액은 증가할 수 있다.

가장 가까운 대안

선택지 대안이 나은 상황 Grok 4.6을 고를 이유
Claude Opus 5 순수 코딩 정밀도와 터미널 환경 제어, 엄격한 코드 리팩토링 과제 완료까지 소요되는 왕복 턴 수 및 입력 토큰을 4분의 1로 절감하고 싶을 때
GPT-5.6 Sol 프롬프트 길이가 50만~100만 토큰에 달하는 초대형 프로젝트 분석 20만 토큰 미만의 정형 에이전트 워크플로에서 압도적인 가성비 달성
DeepSeek-V4-Pro 극단적인 API 비용 절감이 필수적인 대량 백그라운드 크롤링/가공 Cursor 기반의 매끄러운 개발자 경험과 검증된 지식 노동 수행력

최종 총평

Grok 4.6은 xAI를 다시 OpenAI, Anthropic과 대등한 3자 프런티어 구도로 올려놓은 완성도 높은 모델이다. 20만 토큰이라는 컨텍스트 경계선만 엄격히 관리할 수 있다면, 다단계 에이전트 작업에서 토큰 비용과 턴 수를 동시에 줄여주는 강력한 생산성 도구가 된다.

출처