벤치마크 상세
HELM Capabilities
여러 능력의 균형: 모델을 품질, 편향, 견고성, 효율 등 여러 축으로 넓게 비교
공식 리더보드 보기
Stanford가 공개한 Core Scenarios의 Mean score를 100점 척도로 표시합니다. latest가 가리키는 릴리스는 2025-11-24의 v1.15.0입니다. 확인일을 새 평가일로 바꾸지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 07.원문 기준 2025. 11. 24.HELM Capabilities v1.15.0 · Core Scenariosmean score × 100
68개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | GPT-5 mini (2025-08-07) | 81.9 | HELM Capabilities v1.15.0 · Core Scenarios |
| 2 | o4-mini (2025-04-16) | 81.17 | HELM Capabilities v1.15.0 · Core Scenarios |
| 3 | o3 (2025-04-16) | 81.12 | HELM Capabilities v1.15.0 · Core Scenarios |
| 4 | GPT-5 (2025-08-07) | 80.68 | HELM Capabilities v1.15.0 · Core Scenarios |
| 5 | Gemini 3 Pro (Preview) | 79.93 | HELM Capabilities v1.15.0 · Core Scenarios |
| 6 | Qwen3 235B A22B Instruct 2507 FP8 | 79.8 | HELM Capabilities v1.15.0 · Core Scenarios |
| 7 | Grok 4 (0709) | 78.53 | HELM Capabilities v1.15.0 · Core Scenarios |
| 8 | Claude 4 Opus (20250514, extended thinking) | 78 | HELM Capabilities v1.15.0 · Core Scenarios |
| 9 | gpt-oss-120b | 76.96 | HELM Capabilities v1.15.0 · Core Scenarios |
| 10 | Kimi K2 Instruct | 76.75 | HELM Capabilities v1.15.0 · Core Scenarios |
| 11 | Claude 4 Sonnet (20250514, extended thinking) | 76.59 | HELM Capabilities v1.15.0 · Core Scenarios |
| 12 | Claude 4.5 Sonnet (20250929) | 76.24 | HELM Capabilities v1.15.0 · Core Scenarios |
| 13 | Claude 4 Opus (20250514) | 75.74 | HELM Capabilities v1.15.0 · Core Scenarios |
| 14 | GPT-5 nano (2025-08-07) | 74.83 | HELM Capabilities v1.15.0 · Core Scenarios |
| 15 | Gemini 2.5 Pro (03-25 preview) | 74.49 | HELM Capabilities v1.15.0 · Core Scenarios |
| 16 | Claude 4 Sonnet (20250514) | 73.25 | HELM Capabilities v1.15.0 · Core Scenarios |
| 17 | Grok 3 Beta | 72.72 | HELM Capabilities v1.15.0 · Core Scenarios |
| 18 | GPT-4.1 (2025-04-14) | 72.67 | HELM Capabilities v1.15.0 · Core Scenarios |
| 19 | Qwen3 235B A22B FP8 Throughput | 72.64 | HELM Capabilities v1.15.0 · Core Scenarios |
| 20 | GPT-4.1 mini (2025-04-14) | 72.61 | HELM Capabilities v1.15.0 · Core Scenarios |
| 21 | Llama 4 Maverick (17Bx128E) Instruct FP8 | 71.8 | HELM Capabilities v1.15.0 · Core Scenarios |
| 22 | Claude 4.5 Haiku (20251001) | 71.68 | HELM Capabilities v1.15.0 · Core Scenarios |
| 23 | Qwen3-Next 80B A3B Thinking | 70 | HELM Capabilities v1.15.0 · Core Scenarios |
| 24 | DeepSeek-R1-0528 | 69.89 | HELM Capabilities v1.15.0 · Core Scenarios |
| 25 | Palmyra X5 | 69.65 | HELM Capabilities v1.15.0 · Core Scenarios |
| 26 | Grok 3 mini Beta | 67.87 | HELM Capabilities v1.15.0 · Core Scenarios |
| 27 | Gemini 2.0 Flash | 67.86 | HELM Capabilities v1.15.0 · Core Scenarios |
| 28 | Claude 3.7 Sonnet (20250219) | 67.41 | HELM Capabilities v1.15.0 · Core Scenarios |
| 29 | gpt-oss-20b | 67.36 | HELM Capabilities v1.15.0 · Core Scenarios |
| 30 | GLM-4.5-Air-FP8 | 66.96 | HELM Capabilities v1.15.0 · Core Scenarios |
| 31 | DeepSeek v3 | 66.53 | HELM Capabilities v1.15.0 · Core Scenarios |
| 32 | Gemini 1.5 Pro (002) | 65.69 | HELM Capabilities v1.15.0 · Core Scenarios |
| 33 | GPT-5.1 (2025-11-13) | 65.64 | HELM Capabilities v1.15.0 · Core Scenarios |
| 34 | Claude 3.5 Sonnet (20241022) | 65.31 | HELM Capabilities v1.15.0 · Core Scenarios |
| 35 | Llama 4 Scout (17Bx16E) Instruct | 64.38 | HELM Capabilities v1.15.0 · Core Scenarios |
| 36 | Gemini 2.0 Flash Lite (02-05 preview) | 64.16 | HELM Capabilities v1.15.0 · Core Scenarios |
| 37 | Amazon Nova Premier | 63.69 | HELM Capabilities v1.15.0 · Core Scenarios |
| 38 | GPT-4o (2024-11-20) | 63.43 | HELM Capabilities v1.15.0 · Core Scenarios |
| 39 | Gemini 2.5 Flash (04-17 preview) | 62.58 | HELM Capabilities v1.15.0 · Core Scenarios |
| 40 | Llama 3.1 Instruct Turbo (405B) | 61.77 | HELM Capabilities v1.15.0 · Core Scenarios |
| 41 | GPT-4.1 nano (2025-04-14) | 61.57 | HELM Capabilities v1.15.0 · Core Scenarios |
| 42 | Palmyra-X-004 | 60.91 | HELM Capabilities v1.15.0 · Core Scenarios |
| 43 | Gemini 1.5 Flash (002) | 60.86 | HELM Capabilities v1.15.0 · Core Scenarios |
| 44 | Qwen2.5 Instruct Turbo (72B) | 59.9 | HELM Capabilities v1.15.0 · Core Scenarios |
| 45 | Mistral Large (2411) | 59.84 | HELM Capabilities v1.15.0 · Core Scenarios |
| 46 | Gemini 2.5 Flash-Lite | 59.08 | HELM Capabilities v1.15.0 · Core Scenarios |
| 47 | Amazon Nova Pro | 59.07 | HELM Capabilities v1.15.0 · Core Scenarios |
| 48 | Palmyra Fin | 57.67 | HELM Capabilities v1.15.0 · Core Scenarios |
| 49 | IBM Granite 4.0 Small | 57.54 | HELM Capabilities v1.15.0 · Core Scenarios |
| 50 | Llama 3.1 Instruct Turbo (70B) | 57.37 | HELM Capabilities v1.15.0 · Core Scenarios |
| 51 | GPT-4o mini (2024-07-18) | 56.47 | HELM Capabilities v1.15.0 · Core Scenarios |
| 52 | Mistral Small 3.1 (2503) | 55.77 | HELM Capabilities v1.15.0 · Core Scenarios |
| 53 | Amazon Nova Lite | 55.13 | HELM Capabilities v1.15.0 · Core Scenarios |
| 54 | Claude 3.5 Haiku (20241022) | 54.87 | HELM Capabilities v1.15.0 · Core Scenarios |
| 55 | Qwen2.5 Instruct Turbo (7B) | 52.91 | HELM Capabilities v1.15.0 · Core Scenarios |
| 56 | Amazon Nova Micro | 52.22 | HELM Capabilities v1.15.0 · Core Scenarios |
| 57 | IBM Granite 4.0 Micro | 48.61 | HELM Capabilities v1.15.0 · Core Scenarios |
| 58 | Mixtral Instruct (8x22B) | 47.85 | HELM Capabilities v1.15.0 · Core Scenarios |
| 59 | Palmyra Med | 47.55 | HELM Capabilities v1.15.0 · Core Scenarios |
| 60 | OLMo 2 32B Instruct March 2025 | 47.51 | HELM Capabilities v1.15.0 · Core Scenarios |
| 61 | IBM Granite 3.3 8B Instruct | 46.28 | HELM Capabilities v1.15.0 · Core Scenarios |
| 62 | Llama 3.1 Instruct Turbo (8B) | 44.37 | HELM Capabilities v1.15.0 · Core Scenarios |
| 63 | OLMo 2 13B Instruct November 2024 | 44.01 | HELM Capabilities v1.15.0 · Core Scenarios |
| 64 | OLMo 2 7B Instruct November 2024 | 40.51 | HELM Capabilities v1.15.0 · Core Scenarios |
| 65 | Mixtral Instruct (8x7B) | 39.66 | HELM Capabilities v1.15.0 · Core Scenarios |
| 66 | Mistral Instruct v0.3 (7B) | 37.59 | HELM Capabilities v1.15.0 · Core Scenarios |
| 67 | OLMoE 1B-7B Instruct January 2025 | 33.23 | HELM Capabilities v1.15.0 · Core Scenarios |
| 68 | Marin 8B Instruct | 32.49 | HELM Capabilities v1.15.0 · Core Scenarios |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. Stanford가 공개한 Core Scenarios의 Mean score를 100점 척도로 표시합니다. latest가 가리키는 릴리스는 2025-11-24의 v1.15.0입니다. 확인일을 새 평가일로 바꾸지 않습니다.
읽는 법
전체 벤치마크Stanford CRFM의 종합 모델 평가 프레임워크입니다.
특정 작업 1등을 찾기보다, 모델의 전반적인 성격을 볼 때 유용합니다.