장문 생성과 대규모 데이터 분석 파이프라인을 구축하는 팀은 DeepSeek-V4-Pro를, 대량 트래픽의 비용 절감이 중요한 백엔드 개발자는 DeepSeek-V4-Flash를 선택할 수 있습니다. 대규모 MoE 구조의 특성을 이해하고 작업 일정을 설계하는 것이 중요합니다.

도입 전에는 384K 최대 출력 한도와 함께 오프피크 기준 단가 대비 피크 시간대에 입력과 출력이 정확히 2배로 청구되는 조건을 반드시 확인해야 합니다. 호출 시간대에 따라 인프라 예산 편차가 크게 발생할 수 있습니다.

한 줄 결론

100만 토큰 컨텍스트와 384K 최대 출력을 지원하며, 오프피크 시간대에 배치 작업을 분산 실행할 때 토큰당 처리 비용을 크게 낮출 수 있습니다.

바뀐 점

  • DeepSeek-V4-Pro 업데이트: 최신 DeepSeek-V4-Pro-0813 버전으로 1.6T 총 파라미터 중 49B가 활성화되는 MoE 구조입니다. 1,000,000 토큰 문맥과 384,000 토큰 출력을 지원하며 사고 모드와 FIM 코드 완성을 제공합니다.
  • DeepSeek-V4-Flash 업데이트: 최신 DeepSeek-V4-Flash-0731 버전으로 총 284B(13B 활성) MoE 구조를 갖췄습니다. 1M 컨텍스트와 384K 출력을 지원하며 비전 실험 엔드포인트(deepseek-v4-flash-vision-exp)가 추가되었습니다.
  • 표준 API 호환: OpenAI 및 Anthropic 표준 API 스펙과 호환되는 엔드포인트를 제공합니다.

가격과 조건

모델명 버전 / API ID 컨텍스트 최대 출력 입력(1M, 오프피크) 출력(1M, 오프피크) 캐시 히트 입력
DeepSeek-V4-Pro deepseek-v4-pro (0813) 1,000,000 384,000 $0.66 $1.98 $0.022
DeepSeek-V4-Flash deepseek-v4-flash (0731) 1,000,000 384,000 $0.22 $0.66 $0.007
DeepSeek-V4-Flash-Vision-Exp deepseek-v4-flash-vision-exp 1,000,000 384,000 $0.22 $0.66 -

DeepSeek 입력/출력 단가는 오프피크 기준이고 피크 2배라는 조건이 적용됩니다. 피크 시간대에는 입력과 출력 요율이 각각 $1.32/$3.96(V4-Pro), $0.44/$1.32(V4-Flash)로 청구됩니다.

공개 평가에서 읽을 것

  • DeepSeek-V4-Pro: LiveBench(2026-06-25 release)에서 deepseek-v4-pro-0813 버전이 77.44점, 이전 deepseek-v4-pro가 71.57점을 기록했습니다. Artificial Analysis Intelligence Index(v4.2 · 2026-09-04, Reasoning, Max Effort)는 42.11점이며, GPQA Diamond는 Max Effort 92.83%, High Effort 90.51%입니다.
  • DeepSeek-V4-Flash: LiveBench(deepseek-v4-flash-0731) 74.17점, Artificial Analysis Intelligence Index(Max Effort) 40.84점, GPQA Diamond Max Effort 90.81%입니다. 비전 엔드포인트(deepseek-v4-flash-vision-exp)는 LiveBench 76.76점, GPQA Diamond Max Effort 91.31%를 달성했습니다.

DeepSeek · 모델별 API 단가. 100만 토큰당 USD · 입력과 출력은 별도 과금

도표 크게 보기

모델 입력 USD / 1M 출력 USD / 1M
DeepSeek-V4-Pro 0.66 1.98
DeepSeek-V4-Flash 0.22 0.66
DeepSeek-V4-Flash-Vision-Exp 0.22 0.66

오프피크·캐시 미적중 요금입니다. 평일 UTC 01–04시와 06–10시는 피크 요금(2배)이 적용됩니다.

도표의 공개 원문

추천하는 사용법

  • 대규모 데이터 변환, 로그 분석, 야간 코드 점검과 같은 배치 작업은 오프피크 시간대로 스케줄링하여 기본 단가로 처리하는 구성을 권장합니다.
  • 100만 토큰 컨텍스트를 활용할 수 있지만 문서 길이가 길어질수록 세부 항목의 검색 일관성이 보장되는 것은 아니므로, 장문 처리 시 주요 데이터 구간을 분할 검증하는 실험을 권장합니다.

요청 한 건의 비용으로 바꿔 보면

DeepSeek의 Pro와 Flash는 요청 시간대가 같아야 요금 비교가 가능합니다. 아래는 오프피크에 입력 10,000토큰과 출력 1,000토큰을 처리하는 가정입니다. 캐시 미적중 기준이며, 피크 시간에는 각 입력 및 출력 비용을 두 배로 계산해야 합니다.

모델 입력 비용 USD 출력 비용 USD 합계 USD
DeepSeek-V4-Pro 0.0066 0.00198 0.00858
DeepSeek-V4-Flash 0.0022 0.00066 0.00286
DeepSeek-V4-Flash-Vision-Exp 0.0022 0.00066 0.00286

Deepseek 모델을 고를 때는 표의 금액과 함께 작업 완료율을 확인하세요. 이 표는 실측 결과가 아닌 단가 계산 예시이며, 도구 사용료와 재시도 비용은 제외했습니다. 상위 모델을 모든 요청에 적용하기 전에 어려운 작업에만 선택적으로 사용하는 구성을 비교할 수 있습니다.

출처