다단계 자율 디버깅이나 가상 환경에서의 컴퓨터 조작 등 고난도 소프트웨어 엔지니어링 과제를 수행하는 팀에 적합한 모델입니다. 단순 질의응답보다는 여러 도구를 조합하는 긴 워크플로에 적용할 수 있습니다.

도입 전에는 100만 토큰당 입력 10.00달러, 출력 50.00달러의 단가와 함께 프롬프트가 272K 토큰을 초과할 때 적용되는 입력 2배·출력 1.5배 할증 조건을 확인해야 합니다. 높은 토큰 단가를 고려하여 캐싱과 작업 분기 계획을 세워야 합니다.

한 줄 결론

복잡한 다단계 환경 제어와 심층 분석에 투입할 수 있는 상위 모델이며, 토큰 단가가 높으므로 캐싱 관리와 할증 구간 관리가 필수적입니다.

바뀐 점

  • 사양 및 식별자: gpt-6-astra ID로 정식 제공되며 1,050,000 토큰 컨텍스트와 128,000 토큰 출력을 지원합니다. 지식 컷오프는 2026년 4월 30일입니다.
  • 5단계 사고 강도 제어: reasoning_effort 매개변수로 low, medium, high, xhigh, max의 5단계를 지원합니다.
  • 도구 연동: Responses API를 통한 컴퓨터 유즈(Computer Use) 환경 제어 및 프롬프트 캐싱을 지원합니다.

가격과 조건

항목 공식 확인 사양
공식 제품명 / API ID GPT-6 Astra (gpt-6-astra)
서비스 상태 정식 출시 (Generally available)
컨텍스트 윈도우 1,050,000 토큰
최대 출력 한도 128,000 토큰
표준 입력 가격 $10.00 / 1M 토큰
표준 출력 가격 $50.00 / 1M 토큰
프롬프트 캐시 읽기 / 작성 $1.00 / $12.50 (1M 토큰)

프롬프트 입력이 272K 토큰을 초과하면 전체 요청에 대해 입력 및 캐시 요율이 2배, 출력 요율이 1.5배 부과됩니다.

공개 평가에서 읽을 것

  • LiveBench (2026-06-25 release): gpt-6-astra-max 모델이 82.16점(7개 카테고리 평균)을 기록했습니다.
  • Artificial Analysis Intelligence Index (v4.2 · 2026-09-04): max 모드 54.66점, xhigh 모드 54.31점을 기록했습니다.
  • GPQA Diamond (Artificial Analysis · GPQA Diamond): xhigh 모드 96.26%, max 모드 96.06%의 정답률을 나타냈습니다.
  • Terminal-Bench 4.0 (Terminal-Bench 4.0 · official leaderboard): GPT-6 Astra · Codex 환경에서 max 설정 시 58.18%, xhigh 설정 시 57.88%의 과제 해결률을 기록했습니다.

OpenAI · 공개 평가 결과. Artificial Analysis Intelligence Index · Intelligence Index v4.2

도표 크게 보기

평가 버전: v4.2 · 2026-09-04.

모델·실행 설정 공개 점수
GPT-6 Astra (max) 54.66
GPT-6 Astra (xhigh) 54.31
GPT-6 Astra (high) 53.36
GPT-6 Astra (medium) 52.25

전체 결과와 평가 조건

같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.

도표의 공개 원문

추천하는 사용법

  • 가상 머신 환경 제어나 대규모 코드 리팩터링 작업에 연결하고, 공식 최소 길이 조건을 만족하는 시스템 프롬프트를 캐싱해 읽기 비용을 절감하는 구성을 권장합니다.
  • 272K 초과 시 부과되는 할증을 예방하기 위해 대화 이력을 요약하거나 입력 문맥을 청크 단위로 나누어 전달하는 전처리 파이프라인 실험을 추천합니다.
  • 105만 토큰 문맥을 지원하더라도 장문 내 세부 사실의 인출 정확도가 항상 보장되는 것은 아니므로, 주요 데이터 구간에 대한 추출 검증 테스트를 병행해야 합니다.

요청 한 건의 비용으로 바꿔 보면

고객 문의를 읽고 담당 부서를 정하는 일과, 실패한 배포의 원인을 여러 로그에서 찾는 일은 난도가 다릅니다. 같은 모델로 모든 요청을 처리하기 전에 두 작업을 나누고, 저렴한 후보가 놓친 요청에만 상위 모델을 다시 호출하는 구성을 비교해 볼 수 있습니다.

GPT-6 Astra 기준의 아래 계산은 입력 10,000토큰과 청구 대상 출력 1,000토큰을 사용하는 텍스트 요청을 가정한 예시입니다. 실제 사용량을 측정한 결과가 아니며, 캐시가 없는 표준 호출에서 본문의 단가를 곱했습니다. 입력과 출력의 가격이 다르므로 두 항목을 더해 계산합니다.

모델 입력 비용 USD 출력 비용 USD 합계 USD
GPT-6 Astra 0.1 0.05 0.15

이 요청을 1,000회 처리한다면 GPT-6 Astra의 예시 합계는 150 USD입니다. 재시도, 검색과 도구 사용료, 세금, 멀티모달 입력 비용은 포함하지 않았습니다. 추론 과정이 출력으로 청구되는 제품에서는 화면에 보이는 답변의 길이보다 청구 토큰 수가 많을 수 있습니다. 실제 청구량은 API 사용량 기록을 기준으로 확인하세요.

GPT-6 Astra의 도입 여부는 이 예시 금액만으로 결정하지 않는 편이 좋습니다. 같은 요청 묶음에서 정확히 완료한 건수와 사람이 다시 처리한 건수를 함께 기록하세요. 단가가 낮아도 재시도가 많으면 최종 작업 비용이 커집니다. 반대로 상위 모델이 수정 횟수를 줄여 준다면 추가 비용을 낼 요청 범위를 구체적으로 정할 수 있습니다.

출처