Claude Fable 5는 매일 쓰는 기본 모델보다, 실패 한 번의 비용이 큰 장기 코딩과 전문 업무에 맞춘 모델이다. 공개 벤치마크에서는 최상위권이지만 출력 100만 토큰당 50달러라는 가격과 데이터 보존·안전 라우팅 조건을 감수할 만큼 어려운 작업인지가 선택의 기준이다.

이 글은 Anthropic과 LiveBench의 공개 자료를 분석한 것이다. DW AI Lab이 동일 조건으로 모델을 직접 재평가한 실사용 벤치마크는 아니다.

먼저 답하면

  • 추천 작업: 대규모 코드 변경, 여러 단계의 전문 분석, 장시간 에이전트 작업처럼 한 번에 끝내는 가치가 큰 업무
  • 비추천 작업: 요약, 분류, 짧은 문서 변환, 대량 고객 응답처럼 호출량과 출력량이 많은 반복 업무
  • 현재 판단: 성능만 보면 강력한 후보지만, 기본 모델로 전면 교체하기보다 실패 비용이 높은 작업에 선택적으로 배치하는 편이 합리적이다.

Fable 5는 정확히 어떤 모델인가

항목 확인된 내용
공급자 Anthropic
공식 API ID claude-fable-5
최초 발표 2026년 6월 9일
글로벌 접근 재개 2026년 7월 1일
접근 방식 Claude 유료 플랜, Claude Platform, AWS, Google Cloud, Microsoft Foundry
API 가격 입력 100만 토큰당 10달러 / 출력 100만 토큰당 50달러
캐시 기존 프롬프트 캐시 입력 90% 할인
데이터 보존 안전 모니터링을 위한 30일 보존 필요
주요 제한 일부 사이버 보안·생물학 요청은 안전 분류에 따라 Opus 4.8로 라우팅될 수 있음

Anthropic은 Fable 5를 가장 어려운 지식 업무와 코딩 문제, 장시간 에이전트 작업을 겨냥한 일반 제공 모델로 설명한다. 단순히 답변 한 번을 더 잘 만드는 모델이라기보다, 계획을 세우고 하위 작업을 나누며 결과를 검증하는 긴 작업에서 차별화를 노린다.

출시 과정에는 변수가 있었다. 6월 9일 공개 뒤 접근이 중단됐고, Anthropic은 7월 1일부터 글로벌 제공을 재개했다. 따라서 초기에 작성된 가격·접근성 글은 현재 상태와 다를 수 있다.

LiveBench에서는 2위지만, 설정 이름을 모델명으로 보면 안 된다

2026년 6월 25일 LiveBench 릴리스의 공개 원자료를 공식 화면과 같은 방식으로 계산하면 상위권은 다음과 같다.

순위 LiveBench 표기 종합 점수
1 gpt-5.6-sol-max 82.40
2 claude-fable-5-max-effort 80.79
3 claude-opus-5-xhigh-effort 80.31
4 gpt-5.5-xhigh 79.91
5 gpt-5.6-terra-max 79.80

여기서 claude-fable-5-max-effort는 별도의 ‘Fable 5 Max’ 제품이 아니다. Fable 5를 높은 추론 노력 설정으로 실행한 벤치마크 표기다. 제품 소개글을 실행 설정별로 나누면 같은 모델을 여러 제품처럼 오해하게 만든다.

종합 점수도 23개 세부 task를 곧바로 평균한 값이 아니다. LiveBench는 Reasoning, Coding, Agentic Coding, Mathematics, Data Analysis, Language, Instruction Following의 분야별 평균을 먼저 구하고, 일곱 분야 평균을 동일 가중치로 다시 평균한다. 분야마다 세부 task 수가 달라 단순 열 평균을 쓰면 공식 순위와 점수가 달라진다.

이 점수는 Fable 5가 여러 종류의 문제에서 고르게 강하다는 신호다. 하지만 API 가격, 응답 시간, 출력 토큰량, 장기 작업의 실제 성공률은 이 숫자 하나에 포함되지 않는다.

50달러 출력 가격은 어떤 작업에서 감당할 수 있나

Fable 5의 정가는 입력 10달러, 출력 50달러다. 같은 시기 OpenAI가 공개한 GPT-5.6 Sol의 정가는 입력 5달러, 출력 30달러다. 토큰 단가만 보면 Fable 5가 입력은 두 배, 출력은 약 1.67배 비싸다.

그렇다고 한 작업의 총비용도 같은 비율로 비싸다고 단정할 수는 없다. 모델마다 필요한 출력 토큰 수, 도구 호출 횟수, 재시도 횟수와 완료 시간이 다르기 때문이다. 비싼 모델이 한 번에 성공하면 전체 비용이 낮아질 수 있고, 반대로 긴 답변과 반복 호출을 많이 만들면 단가 차이보다 실제 청구액이 더 벌어질 수 있다.

Fable 5를 검토할 만한 작업은 다음 조건을 가진다.

  • 실패하면 사람이 다시 검토하고 수정하는 비용이 크다.
  • 여러 파일이나 문서를 오가며 긴 맥락을 유지해야 한다.
  • 구현 뒤 테스트와 자체 검증까지 이어지는 흐름이 필요하다.
  • 한 번의 성공이 수십 달러 이상의 업무 가치를 만든다.

반대로 단순 분류, 데이터 추출, 짧은 번역, 반복 요약은 더 저렴한 모델로 먼저 처리하는 편이 낫다. Fable 5를 모든 요청의 기본값으로 두기보다 라우터가 난도가 높은 요청만 넘기는 구조가 비용 관리에 유리하다.

강점보다 먼저 봐야 할 두 가지 제약

30일 데이터 보존

Anthropic은 Fable 5 사용에 안전 모니터링 목적의 30일 데이터 보존이 필요하다고 안내한다. 민감한 코드, 계약서, 고객 데이터, 미공개 재무 자료를 다룬다면 성능보다 먼저 조직의 보안·컴플라이언스 조건과 맞는지 확인해야 한다.

일부 요청의 Opus 4.8 라우팅

Fable 5에는 사이버 보안과 생물학 분야의 강한 안전장치가 적용된다. 특정 요청이 위험하다고 판단되면 Fable 5가 그대로 답하는 대신 Opus 4.8로 전달될 수 있다. 일반적인 코딩에는 큰 문제가 없을 수 있지만, 보안 연구·취약점 분석·생명과학 업무에서는 모델 선택과 결과 재현성에 영향을 줄 수 있다.

이 제한은 ‘Fable 5를 선택했으니 항상 Fable 5가 처리한다’는 전제를 깨뜨린다. 관련 분야에서 도입할 때는 허용 범위, 대체 라우팅, 로그와 비용 처리를 먼저 확인해야 한다.

GPT-5.6 Sol과 비교하면 선택 기준은 선명하다

기준 Claude Fable 5 GPT-5.6 Sol
입력 단가 10달러 / 100만 토큰 5달러 / 100만 토큰
출력 단가 50달러 / 100만 토큰 30달러 / 100만 토큰
LiveBench 종합 80.79, 2위 82.40, 1위
강점 포지셔닝 장기 코딩·전문 업무·자체 검증 복잡한 전문 업무·코딩·도구 및 병렬 에이전트
먼저 확인할 제약 30일 보존, 일부 안전 라우팅 제품·플랜별 접근, 추론 설정과 병렬 실행 비용

현재 공개 자료만 놓고 보면 일반적인 고난도 API 작업에는 Sol의 가격이 더 유리하다. Fable 5를 고를 이유는 Anthropic 생태계, Claude Code·Managed Agents와의 결합, 긴 작업에서의 행동 특성이 실제 업무에서 더 높은 성공률을 만들 때다.

결국 두 모델은 짧은 프롬프트 몇 개로 비교할 대상이 아니다. 동일한 실제 작업을 여러 번 실행해 완료율, 사람이 수정한 시간, 총 토큰 비용, 소요 시간을 함께 기록해야 한다.

추천 대상

  • Claude Code나 Anthropic 기반 에이전트 환경을 이미 운영하는 팀
  • 대규모 마이그레이션, 복잡한 구현, 긴 전문 보고서처럼 작업 실패 비용이 큰 조직
  • 모델 비용보다 사람의 재작업 시간을 더 중요하게 보는 팀
  • 민감도와 보존 정책을 검토한 뒤 장시간 작업을 위임하려는 사용자

비추천 대상

  • 짧은 질의를 많이 처리하는 소비자 서비스
  • 출력 토큰이 많은 대량 콘텐츠 생성
  • 30일 데이터 보존을 허용할 수 없는 업무
  • 안전 라우팅으로 모델이 바뀌면 안 되는 사이버 보안·생물학 워크플로
  • 벤치마크 2위라는 이유만으로 전 요청을 전환하려는 팀

판단

Claude Fable 5는 ‘가장 비싼 모델을 쓰면 가장 좋은 결과가 나온다’는 식으로 도입할 모델이 아니다. 높은 단가는 장시간 작업을 한 번에 끝내고 사람의 재작업을 줄일 때만 정당화된다.

이미 Anthropic 도구 체계를 사용하고 있고, 복잡한 코딩이나 전문 업무의 실패 비용이 크다면 소규모 실제 작업군으로 검증할 가치가 있다. 단순 업무까지 Fable 5에 맡기는 구성이라면 성능 이득보다 비용과 정책 제약이 먼저 커질 가능성이 높다.

아직 확인이 필요한 부분

  • LiveBench 결과는 공개 평가의 한 단면이며, 한국어 전문 업무의 체감 품질을 직접 보여주지는 않는다.
  • 동일 작업에서 Fable 5와 경쟁 모델의 총비용을 비교하려면 출력량·재시도·도구 호출을 포함한 반복 실험이 필요하다.
  • 플랜별 실제 사용 한도와 클라우드별 제공 조건은 계약과 시점에 따라 달라질 수 있다.

근거와 출처

  1. Anthropic — Claude Fable 5 — 공식 API ID, 가격, 접근성, 용도, 데이터 보존과 안전 라우팅
  2. Anthropic — Redeploying Fable 5 — 출시 중단과 2026년 7월 1일 접근 재개 경과
  3. LiveBench — 2026-06-25 raw score table — 모델별 세부 task 원점수
  4. LiveBench — 2026-06-25 category map — 공식 종합 점수의 분야 구성
  5. OpenAI — GPT-5.6 — GPT-5.6 Sol 가격과 제품 비교 기준

게시: 2026-07-28 17:40 KST
마지막 원문·벤치마크 확인: 2026-07-28 17:28 KST