Qwen3.6 Plus: 256K를 넘는 순간 요청 전체가 비싸진다
싱가포르 입력은 256K 이하 $0.50, 넘기면 $2다. 베이징은 $0.276에서 $1.101로 뛰고, 구간이 바뀌면 그 요청의 모든 토큰에 상위 단가가 적용된다.
아카이브
AI 뉴스, 도구, 자동화 흐름을 주제별로 모아봅니다.
싱가포르 입력은 256K 이하 $0.50, 넘기면 $2다. 베이징은 $0.276에서 $1.101로 뛰고, 구간이 바뀌면 그 요청의 모든 토큰에 상위 단가가 적용된다.
Flash 입력은 100만 토큰당 $0.75, Pro Preview는 20만 토큰 이하에서도 $2다. Flash가 한 번에 끝내지 못할 때만 올리고, 200k를 넘기면 입력 $4·출력 $18이다.
Meta 공식 발표와 평가 보고서만으로 Muse Spark 1.1의 첫 공개 Model API, 100만 토큰 컨텍스트, 에이전트·코딩 평가와 도입 조건을 정리한다.
Anthropic 공식 문서만으로 Claude Opus 4.8의 Legacy 상태, 1M 컨텍스트, 캐시·Batch 가격과 같은 단가의 Opus 5 대신 유지할 조건을 정리한다.
OpenAI 공식 문서만으로 GPT-5.5 Pro의 Responses 전용 구조, 105만 토큰 컨텍스트, 장문·Batch 요금과 기본 호출 적합성을 판단한다.
OpenAI 공식 문서만으로 GPT-5.6 Sol·Terra·Luna의 API ID, 105만 토큰 컨텍스트, 장문·캐시 요금과 작업별 가격값을 비교한다.
xAI 공식 릴리스 노트·모델 문서·가격표로 Grok Build 0.1의 early access 지위, 256K 컨텍스트, 에이전트 기능, Grok 4.3 대비 단가와 운영 제약을 정리한다.
Moonshot 공식 모델 카드·설정·API·가격 문서로 Kimi K2.7 Code의 256K 컨텍스트, 1T MoE, 강제 thinking, 영상 입력, 비교 점수와 운영 비용을 검토한다.
Google 공식 모델 목록·개별 사양·최신 모델 가이드·가격표로 Gemini 3.5 Flash-Lite의 Stable 지위, 멀티모달 입력, 처리 방식별 비용과 적합한 작업을 정리한다.
Google 공식 모델 목록·개별 사양·최신 모델 가이드·가격표로 Gemini 3.5 Flash의 Stable 지위, 100만 토큰 컨텍스트, 도구 지원, 3.7 이전 조건과 운영 비용을 정리한다.
OpenAI 공식 모델 문서와 가격표만으로 GPT-5.4 Nano의 40만 토큰 컨텍스트, 도구 제한과 비용을 확인한다. GPT-5 nano·GPT-5.4 Mini·GPT-5.6 Luna와 비교해 기존 운영 유지와 신규 도입의 경계를 정리한다.
OpenAI 공식 모델 문서와 가격표만으로 GPT-5.4 Mini의 40만 토큰 컨텍스트, 도구 지원, 처리 한도와 비용을 확인한다. GPT-5.4·GPT-5.6 Terra·Luna와 비교해 기존 운영 유지와 신규 도입의 경계를 정리한다.
OpenAI 공식 모델 목록·최신 모델 가이드·가격표만으로 GPT-5.5의 105만 토큰 컨텍스트, 장문 할증, GPT-5.6·GPT-5.4 대비 비용과 유지 조건을 정리한다.
Google 공식 최신 모델 가이드·가격표·모델 목록만으로 Gemini 3.6 Flash의 현재 세대 위치, 2026년 한시 요금, 3.5·3.7 Flash 대비 선택 조건과 운영 비용을 정리한다.
xAI 공식 모델 문서·가격표·전환 안내만으로 Grok 4.3의 100만 토큰 컨텍스트, 추론 설정, 20만 토큰 장문 요금, 배치 할인과 Grok 4.5·4.6 대비 선택 조건을 정리한다.
DeepSeek 공식 발표·변경 기록·가격표·추론 문서만으로 V4 Pro GA의 1M 컨텍스트, 384K 최대 출력, 에이전트 벤치마크, 피크·비피크 요금과 V4 Flash 대비 선택 조건을 정리한다.
xAI 공식 모델 문서·릴리스 노트·가격표만으로 Grok 4.5의 50만 토큰 컨텍스트, 추론 설정, 캐시 단가, 장문 요금과 세대 간 선택 조건을 정리한다.

1.05M 긴 컨텍스트와 Tool Preamble, Compaction을 탑재해 개발과 비즈니스 판단의 표준 메인 모델로 자리잡은 GPT-5.4의 실전 성능과 비용 최적화 분업 구조를 심층 분석한다.
사전학습 없이 추론 알고리즘 개선으로 DeepSWE를 65.3%까지 끌어올린 Gemini 3.7 Flash의 성능과 2026년 말까지 한시 적용되는 반값 프로모션의 실전 도입 조건을 분석한다.
SpaceX AI 인프라와 Cursor 인수를 결합해 프런티어 최상위 3자 구도에 복귀한 Grok 4.6의 벤치마크 성과와 20만 토큰 이상 입력 시 전체 요금이 2배로 뛰는 요금 체계를 상세 분석한다.
Meta가 Apache 2.0으로 가중치를 공개한 30B 로컬 멀티모달 에이전트 Muse Glimmer의 구조와 4비트 양자화를 통해 단일 24GB/32GB 하드웨어에서 온디바이스 에이전트를 구동하는 실전 방안을 살펴본다.
입력 맥락과 기능 연결을 중심으로 코딩 에이전트의 비용 선택지를 살핀다. DeepSeek-V4-Pro와 GPT-5.4를 가격, 입력 방식, 확인된 벤치마크 범위에서 함께 비교한다.
Qwen3.7 Max는 긴 컨텍스트와 텍스트 입출력을 중심으로 검토할 수 있는 글로벌 API 모델이다. 공식 CNY 가격과 LiveBench의 범주 평균 지표를 GPT-5.4, Gemini 3.1 Pro와 함께 살펴 실제 선택 조건을 정리한다.
Kimi K3는 매우 긴 컨텍스트와 텍스트·이미지 입력을 결합한 Moonshot AI의 오픈 웨이트·API 모델이다. 장기 에이전트 후보로 매력적이지만 출력 한도와 API 가격이 확인되지 않아 운영 판단에는 추가 검증이 필요하다.
Claude Opus 5는 Claude Opus 4.8과 입력·출력 가격 및 주요 한도가 같아, 세대교체 판단이 비용보다 품질 검증에 달린 모델이다. 제공된 LiveBench 자료는 후보의 결과만 담고 있어, 같은 작업에서 Claude Opus 4.8보다 얼마나 나은지는 별도 평가가 필요하다.
Claude Sonnet 5는 Claude Fable 5와 같은 컨텍스트·최대 출력 한도를 더 낮은 가격에 제공한다. 다만 제공된 비교 자료만으로 두 모델의 업무별 품질 차이까지 판단할 수는 없다.
DSpark 기반 초저지연 추론과 100만 토큰당 입력 $0.14, 출력 $0.28의 압도적인 단가를 무기로 Cline 등 코딩 에이전트의 기본 모델로 떠오른 DeepSeek-V4-Flash의 실전 도입 가치를 평가한다.
Claude Fable 5의 가격, 접근성, LiveBench 공식 방식 종합 점수 80.79, 장기 에이전트와 코딩 활용, 데이터 보존과 안전 제한을 공식 자료로 검증했다.

OpenAI가 GPT-5.6 Sol·Terra·Luna를 정식 출시했다. 모델별 용도와 API 가격, max·ultra 모드, GitHub Copilot 지원 범위를 공식 원문과 공개 벤치마크로 교차 확인했다.

Financial Times와 Reuters 계열 보도를 바탕으로 Google이 Meta의 Gemini 모델 사용량을 제한했다는 이슈를 정리했다. 핵심은 모델 성능보다 추론 컴퓨트와 토큰 용량 병목이다.