대량 트래픽의 실시간 응답 챗봇이나 1차 텍스트 정제 파이프라인에서 토큰 비용을 최소화하려는 서비스 구축팀에 적합한 경량 모델입니다. 대용량 요청을 저비용으로 처리할 수 있습니다.

운영 전에는 오프피크 기준 입력 0.22달러, 출력 0.66달러의 저렴한 단가와 함께 피크 시간대에는 단가가 2배로 상승한다는 점을 확인해야 합니다. 파이프라인 일정에 맞춰 비용을 예측해야 합니다.

한 줄 결론

284B MoE 구조로 100만 토큰 문맥과 384K 출력을 지원하며, 오프피크 요금 조건을 파이프라인 일정에 반영해 비용을 관리해야 합니다.

바뀐 점

  • 사양 및 버전: DeepSeek-V4-Flash-0731 버전으로 총 284B 파라미터 중 13B가 활성화되는 경량 MoE 아키텍처입니다. 1,000,000 토큰 문맥과 384,000 토큰 출력을 지원합니다.
  • 비전 확장 엔드포인트: 실험적 멀티모달 엔드포인트 deepseek-v4-flash-vision-exp(2026년 8월 21일 공개)가 추가되어 동일한 요율로 비전 기능을 테스트할 수 있습니다.
  • 요금 체계: 오프피크 기준 100만 토큰당 입력 0.22달러, 출력 0.66달러이며 캐시 적중 시 0.007달러입니다.

가격과 조건

항목 오프피크 단가 (Off-peak) 피크 단가 (Peak, 2배)
표준 입력 가격 (1M 토큰) $0.22 $0.44
표준 출력 가격 (1M 토큰) $0.66 $1.32
캐시 히트 입력 가격 $0.007 $0.014
컨텍스트 윈도우 1,000,000 토큰 1,000,000 토큰
최대 출력 한도 384,000 토큰 384,000 토큰

DeepSeek 입력/출력 단가는 오프피크 기준이고 피크 2배라는 조건이 적용됩니다. 피크 시간대에는 단가가 2배로 청구되므로 대량 호출 일정 관리가 필요합니다.

공개 평가에서 읽을 것

  • LiveBench (2026-06-25 release): deepseek-v4-flash-0731 버전이 74.17점, deepseek-v4-flash-vision-exp 버전이 76.76점을 기록했습니다.
  • Artificial Analysis Intelligence Index (v4.2 · 2026-09-04): DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 기준 40.84점을 기록했습니다.
  • GPQA Diamond (Artificial Analysis · GPQA Diamond): DeepSeek V4 Flash 0731 (Reasoning, Max Effort) 90.81%, Vision-Exp 모드 91.31%입니다.

DeepSeek · 공개 평가 결과. GPQA Diamond · % correct

도표 크게 보기

평가 버전: Artificial Analysis · GPQA Diamond.

모델·실행 설정 공개 점수
DeepSeek V4 Flash (Reasoning, Max Effort) 89.39
DeepSeek V4 Flash (Reasoning, High Effort) 86.67
DeepSeek V4 Flash (Non-reasoning) 71.62

전체 결과와 평가 조건

같은 평가 안에서 공개된 실행 설정을 구분했습니다. 추론 강도와 평가 버전이 달라지면 점수를 직접 비교하지 않습니다.

도표의 공개 원문

추천하는 사용법

  • 대량 텍스트 요약이나 로그 분류 작업을 실행할 때는 오프피크 시간대에 배치 작업을 집중 배치하여 입력 0.22달러, 출력 0.66달러의 단가를 활용하는 구성을 권장합니다.
  • 이미지와 텍스트를 복합 검토하는 워크플로라면 실험적 엔드포인트인 Vision-Exp를 연결하여 시각 질의 응답 품질을 프로토타이핑하는 실험을 추천합니다.

요청 한 건의 비용으로 바꿔 보면

Flash에 대량 분류를 맡길 때는 처리량뿐 아니라 잘못 분류된 요청의 비중을 기록하세요. 오프피크에 처리할 수 있는 요청과 즉시 응답해야 하는 요청을 나누면 시간대별 요금이 운영 예산에 미치는 영향을 계산하기 쉽습니다.

DeepSeek-V4-Flash 기준의 아래 계산은 입력 10,000토큰과 청구 대상 출력 1,000토큰을 사용하는 텍스트 요청을 가정한 예시입니다. 실제 사용량을 측정한 결과가 아니며, 캐시가 없는 표준 호출에서 본문의 단가를 곱했습니다. 입력과 출력의 가격이 다르므로 두 항목을 더해 계산합니다.

모델 입력 비용 USD 출력 비용 USD 합계 USD
DeepSeek-V4-Flash 0.0022 0.00066 0.00286
DeepSeek-V4-Flash-Vision-Exp 0.0022 0.00066 0.00286

이 요청을 1,000회 처리한다면 DeepSeek-V4-Flash의 예시 합계는 2.86 USD입니다. 재시도, 검색과 도구 사용료, 세금, 멀티모달 입력 비용은 포함하지 않았습니다. 추론 과정이 출력으로 청구되는 제품에서는 화면에 보이는 답변의 길이보다 청구 토큰 수가 많을 수 있습니다. 실제 청구량은 API 사용량 기록을 기준으로 확인하세요.

DeepSeek-V4-Flash의 도입 여부는 이 예시 금액만으로 결정하지 않는 편이 좋습니다. 같은 요청 묶음에서 정확히 완료한 건수와 사람이 다시 처리한 건수를 함께 기록하세요. 단가가 낮아도 재시도가 많으면 최종 작업 비용이 커집니다. 반대로 상위 모델이 수정 횟수를 줄여 준다면 추가 비용을 낼 요청 범위를 구체적으로 정할 수 있습니다. DeepSeek 계산은 오프피크 기준이며 피크에는 표의 입력·출력 금액이 두 배입니다.

출처