벤치마크 상세
TAU-bench / τ²-Bench Telecom
고객지원 도구 사용: 상담봇, 예약/환불/주문 변경 같은 업무 자동화
공식 리더보드 보기
Sierra τ²-Bench의 Telecom 도메인을 Artificial Analysis가 측정한 값입니다. 원래 τ-Bench retail/airline이나 τ³-Banking과 합산하지 않습니다.
모든 공개 결과
모델 검색 · 점수순확인 2026. 09. 07.AA · τ²-Bench Telecom% success
440개 결과원문 ↗
| 순서 | 모델 / 실행 구성 | 점수 | 평가 조건·근거 |
|---|---|---|---|
| 1 | JT-35B-FlashChina Mobile | 99.12 | AA · τ²-Bench Telecom |
| 2 | GLM-5.2 (max)Z AI | 99.12 | AA · τ²-Bench Telecom |
| 3 | GLM-4.7-Flash (Reasoning)Z AI | 98.83 | AA · τ²-Bench Telecom |
| 4 | GLM-5-TurboZ AI | 98.54 | AA · τ²-Bench Telecom |
| 5 | GLM 5V Turbo (Reasoning)Z AI | 98.54 | AA · τ²-Bench Telecom |
| 6 | Step 3.7 FlashStepFun | 98.54 | AA · τ²-Bench Telecom |
| 7 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic | 98.54 | AA · τ²-Bench Telecom |
| 8 | GLM-5 (Reasoning)Z AI | 98.25 | AA · τ²-Bench Telecom |
| 9 | GLM-5.1 (Reasoning)Z AI | 97.66 | AA · τ²-Bench Telecom |
| 10 | Grok 4.3 (high)SpaceXAI | 97.66 | AA · τ²-Bench Telecom |
| 11 | Qwen3.6 PlusAlibaba | 97.66 | AA · τ²-Bench Telecom |
| 12 | GLM-5 (Non-reasoning)Z AI | 97.37 | AA · τ²-Bench Telecom |
| 13 | GLM-5.1 (Non-reasoning)Z AI | 97.08 | AA · τ²-Bench Telecom |
| 14 | Grok 4.20 0309 (Reasoning)SpaceXAI | 96.49 | AA · τ²-Bench Telecom |
| 15 | DeepSeek V4 Pro (Reasoning, Max Effort)DeepSeek | 96.2 | AA · τ²-Bench Telecom |
| 16 | Kimi K2.6Kimi | 95.91 | AA · τ²-Bench Telecom |
| 17 | Qwen3.6 Max PreviewAlibaba | 95.91 | AA · τ²-Bench Telecom |
| 18 | GLM-4.7 (Reasoning)Z AI | 95.91 | AA · τ²-Bench Telecom |
| 19 | Kimi K2.5 (Reasoning)Kimi | 95.91 | AA · τ²-Bench Telecom |
| 20 | Qwen3.5 397B A17B (Reasoning)Alibaba | 95.61 | AA · τ²-Bench Telecom |
| 21 | Gemini 3.5 Flash (medium)Google | 95.61 | AA · τ²-Bench Telecom |
| 22 | DeepSeek V4 Flash (Reasoning, High Effort)DeepSeek | 95.61 | AA · τ²-Bench Telecom |
| 23 | Gemini 3.1 Pro PreviewGoogle | 95.61 | AA · τ²-Bench Telecom |
| 24 | Gemini 3.5 Flash (high)Google | 95.32 | AA · τ²-Bench Telecom |
| 25 | MiniMax-M2.5MiniMax | 95.32 | AA · τ²-Bench Telecom |
| 26 | Qwen3.6 35B A3B (Reasoning)Alibaba | 95.32 | AA · τ²-Bench Telecom |
| 27 | MiMo-V2-ProXiaomi | 95.03 | AA · τ²-Bench Telecom |
| 28 | MiMo-V2-Flash (Reasoning)Xiaomi | 95.03 | AA · τ²-Bench Telecom |
| 29 | DeepSeek V4 Flash (Reasoning, Max Effort)DeepSeek | 95.03 | AA · τ²-Bench Telecom |
| 30 | Qwen3.7 MaxAlibaba | 94.74 | AA · τ²-Bench Telecom |
| 31 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic | 94.44 | AA · τ²-Bench Telecom |
| 32 | DeepSeek V4 Flash (Non-reasoning)DeepSeek | 94.44 | AA · τ²-Bench Telecom |
| 33 | Step 3.5 FlashStepFun | 94.44 | AA · τ²-Bench Telecom |
| 34 | MiMo-V2.5-ProXiaomi | 94.15 | AA · τ²-Bench Telecom |
| 35 | DeepSeek V4 Pro (Reasoning, High Effort)DeepSeek | 94.15 | AA · τ²-Bench Telecom |
| 36 | GLM-4.7 (Non-reasoning)Z AI | 94.15 | AA · τ²-Bench Telecom |
| 37 | Qwen3.6 27B (Reasoning)Alibaba | 94.15 | AA · τ²-Bench Telecom |
| 38 | Mistral Medium 3.5Mistral | 94.15 | AA · τ²-Bench Telecom |
| 39 | Kimi K2.6 (Non-reasoning)Kimi | 93.86 | AA · τ²-Bench Telecom |
| 40 | Qwen3.5 27B (Reasoning)Alibaba | 93.86 | AA · τ²-Bench Telecom |
| 41 | GPT-5.5 (xhigh)OpenAI | 93.86 | AA · τ²-Bench Telecom |
| 42 | Qwen3.5 122B A10B (Reasoning)Alibaba | 93.57 | AA · τ²-Bench Telecom |
| 43 | Qwen3.6 27B (Non-reasoning)Alibaba | 93.57 | AA · τ²-Bench Telecom |
| 44 | MiMo-V2-Flash (Feb 2026)Xiaomi | 93.27 | AA · τ²-Bench Telecom |
| 45 | Grok 4.1 Fast (Reasoning)SpaceXAI | 93.27 | AA · τ²-Bench Telecom |
| 46 | Tri-21B-think PreviewTrillion Labs | 93.27 | AA · τ²-Bench Telecom |
| 47 | JT-MINIChina Mobile | 92.98 | AA · τ²-Bench Telecom |
| 48 | Qwen3.7 PlusAlibaba | 92.98 | AA · τ²-Bench Telecom |
| 49 | GPT-5.5 (high)OpenAI | 92.98 | AA · τ²-Bench Telecom |
| 50 | Kimi K2 ThinkingKimi | 92.98 | AA · τ²-Bench Telecom |
| 51 | Grok 4.20 0309 v2 (Reasoning)SpaceXAI | 92.98 | AA · τ²-Bench Telecom |
| 52 | Nova 2.0 Pro Preview (medium)Amazon | 92.69 | AA · τ²-Bench Telecom |
| 53 | Hy3-preview (Reasoning)Tencent | 92.69 | AA · τ²-Bench Telecom |
| 54 | Ring-2.6-1TInclusionAI | 92.4 | AA · τ²-Bench Telecom |
| 55 | GPT-5.2 Codex (xhigh)OpenAI | 92.11 | AA · τ²-Bench Telecom |
| 56 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 92.11 | AA · τ²-Bench Telecom |
| 57 | Qwen3.5 4B (Reasoning)Alibaba | 92.11 | AA · τ²-Bench Telecom |
| 58 | GPT-5.5 (medium)OpenAI | 91.81 | AA · τ²-Bench Telecom |
| 59 | GLM-4.7-Flash (Non-reasoning)Z AI | 91.81 | AA · τ²-Bench Telecom |
| 60 | Muse SparkMeta | 91.52 | AA · τ²-Bench Telecom |
| 61 | Grok 4.3 (medium)SpaceXAI | 91.23 | AA · τ²-Bench Telecom |
| 62 | DeepSeek V4 Pro (Non-reasoning)DeepSeek | 91.23 | AA · τ²-Bench Telecom |
| 63 | MiMo-V2-OmniXiaomi | 91.23 | AA · τ²-Bench Telecom |
| 64 | MiMo-V2.5Xiaomi | 90.64 | AA · τ²-Bench Telecom |
| 65 | DeepSeek V3.2 (Reasoning)DeepSeek | 90.64 | AA · τ²-Bench Telecom |
| 66 | Nova 2.0 Pro Preview (low)Amazon | 90.64 | AA · τ²-Bench Telecom |
| 67 | Grok 3 mini Reasoning (high)SpaceXAI | 90.35 | AA · τ²-Bench Telecom |
| 68 | Kimi K2.7 CodeKimi | 90.06 | AA · τ²-Bench Telecom |
| 69 | Trinity Large ThinkingArcee AI | 90.06 | AA · τ²-Bench Telecom |
| 70 | Ling-2.6-1TInclusionAI | 89.77 | AA · τ²-Bench Telecom |
| 71 | Claude Opus 4.5 (Reasoning)Anthropic | 89.47 | AA · τ²-Bench Telecom |
| 72 | KAT Coder Pro V2KwaiKAT | 89.47 | AA · τ²-Bench Telecom |
| 73 | Qwen3.5 35B A3B (Reasoning)Alibaba | 89.18 | AA · τ²-Bench Telecom |
| 74 | MiniMax-M3MiniMax | 88.89 | AA · τ²-Bench Telecom |
| 75 | Grok 4.3 (low)SpaceXAI | 88.89 | AA · τ²-Bench Telecom |
| 76 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic | 88.6 | AA · τ²-Bench Telecom |
| 77 | KAT-Coder-Pro V1KwaiKAT | 88.6 | AA · τ²-Bench Telecom |
| 78 | Qwen3.5 Omni PlusAlibaba | 88.3 | AA · τ²-Bench Telecom |
| 79 | MiMo-V2-Omni-0327Xiaomi | 88.01 | AA · τ²-Bench Telecom |
| 80 | Qwen3.5 4B (Non-reasoning)Alibaba | 87.72 | AA · τ²-Bench Telecom |
| 81 | MiniCPM-V 4.6 1.3BOpenBMB | 87.72 | AA · τ²-Bench Telecom |
| 82 | Step 3.5 Flash 2603StepFun | 87.43 | AA · τ²-Bench Telecom |
| 83 | HyperCLOVA X SEED Think (32B)Naver | 87.43 | AA · τ²-Bench Telecom |
| 84 | Qwen3.5 27B (Non-reasoning)Alibaba | 87.13 | AA · τ²-Bench Telecom |
| 85 | GPT-5.4 (xhigh)OpenAI | 87.13 | AA · τ²-Bench Telecom |
| 86 | Gemini 3 Pro Preview (high)Google | 87.13 | AA · τ²-Bench Telecom |
| 87 | Qwen3.5 9B (Reasoning)Alibaba | 86.84 | AA · τ²-Bench Telecom |
| 88 | GPT-5 Codex (high)OpenAI | 86.84 | AA · τ²-Bench Telecom |
| 89 | MiniMax-M2MiniMax | 86.84 | AA · τ²-Bench Telecom |
| 90 | GPT-5 (medium)OpenAI | 86.55 | AA · τ²-Bench Telecom |
| 91 | Mi:dm K 2.5 ProKorea Telecom | 86.55 | AA · τ²-Bench Telecom |
| 92 | Claude Opus 4.5 (Non-reasoning)Anthropic | 86.26 | AA · τ²-Bench Telecom |
| 93 | Solar Pro 3Upstage | 86.26 | AA · τ²-Bench Telecom |
| 94 | GPT-5.6 Terra (max)OpenAI | 86.26 | AA · τ²-Bench Telecom |
| 95 | Qwen3.5 35B A3B (Non-reasoning)Alibaba | 86.26 | AA · τ²-Bench Telecom |
| 96 | GPT-5.3 Codex (xhigh)OpenAI | 85.96 | AA · τ²-Bench Telecom |
| 97 | Ling 2.6 FlashInclusionAI | 85.96 | AA · τ²-Bench Telecom |
| 98 | MiniMax-M2.1MiniMax | 85.38 | AA · τ²-Bench Telecom |
| 99 | Qwen3.5 9B (Non-reasoning)Alibaba | 85.09 | AA · τ²-Bench Telecom |
| 100 | Qwen3.6 35B A3B (Non-reasoning)Alibaba | 85.09 | AA · τ²-Bench Telecom |
| 101 | GPT-5.6 Sol (max)OpenAI | 85.09 | AA · τ²-Bench Telecom |
| 102 | Claude Opus 4.6 (Non-reasoning, High Effort)Anthropic | 84.8 | AA · τ²-Bench Telecom |
| 103 | GPT-5 (high)OpenAI | 84.8 | AA · τ²-Bench Telecom |
| 104 | GPT-5.2 (xhigh)OpenAI | 84.8 | AA · τ²-Bench Telecom |
| 105 | MiniMax-M2.7MiniMax | 84.8 | AA · τ²-Bench Telecom |
| 106 | GPT-5.6 Sol (xhigh)OpenAI | 84.8 | AA · τ²-Bench Telecom |
| 107 | Qwen3.5 122B A10B (Non-reasoning)Alibaba | 84.5 | AA · τ²-Bench Telecom |
| 108 | Qwen3.5 Omni FlashAlibaba | 84.5 | AA · τ²-Bench Telecom |
| 109 | GPT-5 (low)OpenAI | 84.21 | AA · τ²-Bench Telecom |
| 110 | Qwen3.5 397B A17B (Non-reasoning)Alibaba | 83.92 | AA · τ²-Bench Telecom |
| 111 | MiMo-V2-Flash (Non-reasoning)Xiaomi | 83.92 | AA · τ²-Bench Telecom |
| 112 | ERNIE 5.0 Thinking PreviewBaidu | 83.92 | AA · τ²-Bench Telecom |
| 113 | GPT-5.5 (low)OpenAI | 83.92 | AA · τ²-Bench Telecom |
| 114 | Qwen3 Max ThinkingAlibaba | 83.63 | AA · τ²-Bench Telecom |
| 115 | Qwen3 Max Thinking (Preview)Alibaba | 83.63 | AA · τ²-Bench Telecom |
| 116 | Nemotron 3 Ultra 550B A55B (Reasoning)NVIDIA | 83.33 | AA · τ²-Bench Telecom |
| 117 | GPT-5.6 Sol (high)OpenAI | 83.33 | AA · τ²-Bench Telecom |
| 118 | GPT-5.4 mini (xhigh)OpenAI | 83.33 | AA · τ²-Bench Telecom |
| 119 | GPT-5.1 Codex (high)OpenAI | 83.04 | AA · τ²-Bench Telecom |
| 120 | MiniCPM5-1B (Non-reasoning)OpenBMB | 82.46 | AA · τ²-Bench Telecom |
| 121 | GPT-5.1 (high)OpenAI | 81.87 | AA · τ²-Bench Telecom |
| 122 | Qwen3.5 2B (Non-reasoning)Alibaba | 81.58 | AA · τ²-Bench Telecom |
| 123 | Nex-N2-ProNex AGI | 81.58 | AA · τ²-Bench Telecom |
| 124 | Kimi K2.5 (Non-reasoning)Kimi | 81.29 | AA · τ²-Bench Telecom |
| 125 | Tri-21B-ThinkTrillion Labs | 80.99 | AA · τ²-Bench Telecom |
| 126 | GPT-5.6 Sol (medium)OpenAI | 80.99 | AA · τ²-Bench Telecom |
| 127 | MiniCPM5-1B (Reasoning)OpenBMB | 80.99 | AA · τ²-Bench Telecom |
| 128 | o3OpenAI | 80.7 | AA · τ²-Bench Telecom |
| 129 | Command A+Cohere | 80.7 | AA · τ²-Bench Telecom |
| 130 | Nova 2.0 Omni (medium)Amazon | 80.41 | AA · τ²-Bench Telecom |
| 131 | Gemini 3 Flash Preview (Reasoning)Google | 80.41 | AA · τ²-Bench Telecom |
| 132 | GPT-5.6 Terra (xhigh)OpenAI | 80.41 | AA · τ²-Bench Telecom |
| 133 | Claude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic | 79.53 | AA · τ²-Bench Telecom |
| 134 | LongCat Flash LiteLongCat | 79.53 | AA · τ²-Bench Telecom |
| 135 | Qwen3 Coder NextAlibaba | 79.53 | AA · τ²-Bench Telecom |
| 136 | DeepSeek V3.2 (Non-reasoning)DeepSeek | 78.95 | AA · τ²-Bench Telecom |
| 137 | Claude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic | 78.95 | AA · τ²-Bench Telecom |
| 138 | GPT-5.6 Terra (high)OpenAI | 78.36 | AA · τ²-Bench Telecom |
| 139 | EXAONE 4.5 33BLG AI Research | 78.07 | AA · τ²-Bench Telecom |
| 140 | Claude 4.5 Sonnet (Reasoning)Anthropic | 78.07 | AA · τ²-Bench Telecom |
| 141 | GLM-4.6 (Non-reasoning)Z AI | 76.9 | AA · τ²-Bench Telecom |
| 142 | GPT-5.6 Sol (low)OpenAI | 76.02 | AA · τ²-Bench Telecom |
| 143 | GPT-5.4 nano (xhigh)OpenAI | 76.02 | AA · τ²-Bench Telecom |
| 144 | Grok Code Fast 1SpaceXAI | 75.73 | AA · τ²-Bench Telecom |
| 145 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic | 75.73 | AA · τ²-Bench Telecom |
| 146 | Nova 2.0 Lite (medium)Amazon | 75.73 | AA · τ²-Bench Telecom |
| 147 | Grok 4SpaceXAI | 74.85 | AA · τ²-Bench Telecom |
| 148 | GPT-5.4 (low)OpenAI | 74.56 | AA · τ²-Bench Telecom |
| 149 | K-EXAONE (Reasoning)LG AI Research | 74.27 | AA · τ²-Bench Telecom |
| 150 | Qwen3 MaxAlibaba | 74.27 | AA · τ²-Bench Telecom |
| 151 | GPT-5.2 (medium)OpenAI | 74.27 | AA · τ²-Bench Telecom |
| 152 | Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic | 73.98 | AA · τ²-Bench Telecom |
| 153 | Kimi K2 0905Kimi | 73.39 | AA · τ²-Bench Telecom |
| 154 | Claude 4 Opus (Reasoning)Anthropic | 73.39 | AA · τ²-Bench Telecom |
| 155 | GPT-5.6 Terra (medium)OpenAI | 72.81 | AA · τ²-Bench Telecom |
| 156 | Nova 2.0 Lite (high)Amazon | 72.81 | AA · τ²-Bench Telecom |
| 157 | MiMo-V2.5-Pro (Non-reasoning)Xiaomi | 72.51 | AA · τ²-Bench Telecom |
| 158 | Nova 2.0 Lite (low)Amazon | 71.93 | AA · τ²-Bench Telecom |
| 159 | Nova 2.0 Pro Preview (Non-reasoning)Amazon | 71.64 | AA · τ²-Bench Telecom |
| 160 | Claude 4.1 Opus (Reasoning)Anthropic | 71.37 | AA · τ²-Bench Telecom |
| 161 | GPT-5 mini (medium)OpenAI | 71.05 | AA · τ²-Bench Telecom |
| 162 | Mercury 2Inception | 70.76 | AA · τ²-Bench Telecom |
| 163 | GLM-4.6 (Reasoning)Z AI | 70.47 | AA · τ²-Bench Telecom |
| 164 | Claude 4.5 Sonnet (Non-reasoning)Anthropic | 70.47 | AA · τ²-Bench Telecom |
| 165 | Grok 4.20 0309 (Non-reasoning)SpaceXAI | 69.59 | AA · τ²-Bench Telecom |
| 166 | GPT-5.5 (Non-reasoning)OpenAI | 69.3 | AA · τ²-Bench Telecom |
| 167 | Apriel-v1.6-15B-ThinkerServiceNow | 69.3 | AA · τ²-Bench Telecom |
| 168 | Qwen3.5 2B (Reasoning)Alibaba | 69.01 | AA · τ²-Bench Telecom |
| 169 | GPT-5 mini (high)OpenAI | 68.42 | AA · τ²-Bench Telecom |
| 170 | Apriel-v1.5-15B-ThinkerServiceNow | 68.42 | AA · τ²-Bench Telecom |
| 171 | Gemini 3 Pro Preview (low)Google | 68.13 | AA · τ²-Bench Telecom |
| 172 | Nemotron 3 Super 120B A12B (Reasoning)NVIDIA | 67.84 | AA · τ²-Bench Telecom |
| 173 | Nova 2.0 Omni (low)Amazon | 67.84 | AA · τ²-Bench Telecom |
| 174 | Hy3-preview (Non-reasoning)Tencent | 67.54 | AA · τ²-Bench Telecom |
| 175 | GPT-5 (minimal)OpenAI | 66.96 | AA · τ²-Bench Telecom |
| 176 | Grok 4 Fast (Reasoning)SpaceXAI | 65.79 | AA · τ²-Bench Telecom |
| 177 | Grok 4.3 (Non-reasoning)SpaceXAI | 65.79 | AA · τ²-Bench Telecom |
| 178 | gpt-oss-120b (high)OpenAI | 65.79 | AA · τ²-Bench Telecom |
| 179 | Gemma 4 31B (Non-reasoning)Google | 65.5 | AA · τ²-Bench Telecom |
| 180 | Qwen3.5 0.8B (Non-reasoning)Alibaba | 65.2 | AA · τ²-Bench Telecom |
| 181 | Claude 4 Sonnet (Reasoning)Anthropic | 64.62 | AA · τ²-Bench Telecom |
| 182 | Grok 4 Fast (Non-reasoning)SpaceXAI | 63.74 | AA · τ²-Bench Telecom |
| 183 | Grok 4.1 Fast (Non-reasoning)SpaceXAI | 63.74 | AA · τ²-Bench Telecom |
| 184 | HyperNova 60B 2605 (high, based on gpt-oss-120b)Multiverse Computing | 63.16 | AA · τ²-Bench Telecom |
| 185 | GPT-5.1 Codex mini (high)OpenAI | 62.87 | AA · τ²-Bench Telecom |
| 186 | o1OpenAI | 62.57 | AA · τ²-Bench Telecom |
| 187 | Nova 2.0 Lite (Non-reasoning)Amazon | 61.99 | AA · τ²-Bench Telecom |
| 188 | Kimi K2Kimi | 61.11 | AA · τ²-Bench Telecom |
| 189 | GPT-5.6 Terra (low)OpenAI | 60.53 | AA · τ²-Bench Telecom |
| 190 | gpt-oss-20b (high)OpenAI | 60.23 | AA · τ²-Bench Telecom |
| 191 | Grok 4.20 0309 v2 (Non-reasoning)SpaceXAI | 59.94 | AA · τ²-Bench Telecom |
| 192 | Gemma 4 31B (Reasoning)Google | 59.94 | AA · τ²-Bench Telecom |
| 193 | K-EXAONE (Non-reasoning)LG AI Research | 59.06 | AA · τ²-Bench Telecom |
| 194 | Gemini 3.5 Flash (minimal)Google | 58.77 | AA · τ²-Bench Telecom |
| 195 | Doubao Seed CodeByteDance Seed | 58.19 | AA · τ²-Bench Telecom |
| 196 | o4-mini (high)OpenAI | 55.56 | AA · τ²-Bench Telecom |
| 197 | Claude 3.7 Sonnet (Reasoning)Anthropic | 54.68 | AA · τ²-Bench Telecom |
| 198 | Claude 4.5 Haiku (Reasoning)Anthropic | 54.68 | AA · τ²-Bench Telecom |
| 199 | Gemini 2.5 ProGoogle | 54.09 | AA · τ²-Bench Telecom |
| 200 | Qwen3 VL 235B A22B (Reasoning)Alibaba | 54.09 | AA · τ²-Bench Telecom |
| 201 | Nemotron Cascade 2 30B A3BNVIDIA | 53.22 | AA · τ²-Bench Telecom |
| 202 | Qwen3 235B A22B 2507 (Reasoning)Alibaba | 53.22 | AA · τ²-Bench Telecom |
| 203 | GPT-4.1 miniOpenAI | 52.92 | AA · τ²-Bench Telecom |
| 204 | GPT-5.4 nano (medium)OpenAI | 52.63 | AA · τ²-Bench Telecom |
| 205 | Claude 4 Sonnet (Non-reasoning)Anthropic | 52.34 | AA · τ²-Bench Telecom |
| 206 | Magistral Medium 1.2Mistral | 52.05 | AA · τ²-Bench Telecom |
| 207 | gpt-oss-20b (low)OpenAI | 50.29 | AA · τ²-Bench Telecom |
| 208 | Claude 3.7 Sonnet (Non-reasoning)Anthropic | 50 | AA · τ²-Bench Telecom |
| 209 | Seed-OSS-36B-InstructByteDance Seed | 49.42 | AA · τ²-Bench Telecom |
| 210 | Mi:dm K 2.5 Pro PreviewKorea Telecom | 49.42 | AA · τ²-Bench Telecom |
| 211 | GPT-5.5 Instant (May 2026)OpenAI | 49.42 | AA · τ²-Bench Telecom |
| 212 | Grok 3SpaceXAI | 48.83 | AA · τ²-Bench Telecom |
| 213 | Solar Open 100B (Reasoning)Upstage | 48.25 | AA · τ²-Bench Telecom |
| 214 | Qwen3.5 0.8B (Reasoning)Alibaba | 47.66 | AA · τ²-Bench Telecom |
| 215 | GPT-4.1OpenAI | 47.08 | AA · τ²-Bench Telecom |
| 216 | DeepSeek V3 0324DeepSeek | 47.08 | AA · τ²-Bench Telecom |
| 217 | Sarvam 105B (high)Sarvam | 46.78 | AA · τ²-Bench Telecom |
| 218 | GLM-4.5-AirZ AI | 46.49 | AA · τ²-Bench Telecom |
| 219 | Motif-2-12.7B-ReasoningMotif Technologies | 46.49 | AA · τ²-Bench Telecom |
| 220 | GPT-5.2 (Non-reasoning)OpenAI | 46.49 | AA · τ²-Bench Telecom |
| 221 | GPT-5.1 (Non-reasoning)OpenAI | 46.49 | AA · τ²-Bench Telecom |
| 222 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning)Google | 45.61 | AA · τ²-Bench Telecom |
| 223 | Qwen3 VL 32B (Reasoning)Alibaba | 45.61 | AA · τ²-Bench Telecom |
| 224 | Nemotron 3 Nano Omni 30B A3B ReasoningNVIDIA | 45.32 | AA · τ²-Bench Telecom |
| 225 | gpt-oss-120b (low)OpenAI | 45.03 | AA · τ²-Bench Telecom |
| 226 | Nova 2.0 Omni (Non-reasoning)Amazon | 44.74 | AA · τ²-Bench Telecom |
| 227 | Qwen3 Coder 480B A35B InstructAlibaba | 43.57 | AA · τ²-Bench Telecom |
| 228 | Gemma 4 26B A4B (Reasoning)Google | 43.57 | AA · τ²-Bench Telecom |
| 229 | Gemini 3 Flash Preview (Non-reasoning)Google | 43.27 | AA · τ²-Bench Telecom |
| 230 | GLM-4.5 (Reasoning)Z AI | 42.98 | AA · τ²-Bench Telecom |
| 231 | Granite 4.1 30BIBM | 42.11 | AA · τ²-Bench Telecom |
| 232 | Qwen3 Next 80B A3B (Reasoning)Alibaba | 41.52 | AA · τ²-Bench Telecom |
| 233 | Mistral Small 4 (Reasoning)Mistral | 41.23 | AA · τ²-Bench Telecom |
| 234 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA | 40.94 | AA · τ²-Bench Telecom |
| 235 | Mistral Medium 3.1Mistral | 40.64 | AA · τ²-Bench Telecom |
| 236 | Gemma 4 26B A4B (Non-reasoning)Google | 40.35 | AA · τ²-Bench Telecom |
| 237 | Nova PremierAmazon | 38.3 | AA · τ²-Bench Telecom |
| 238 | Devstral Small (May '25)Mistral | 38.01 | AA · τ²-Bench Telecom |
| 239 | DeepSeek V3.1 (Reasoning)DeepSeek | 37.43 | AA · τ²-Bench Telecom |
| 240 | North Mini CodeCohere | 37.43 | AA · τ²-Bench Telecom |
| 241 | DeepSeek V3.1 Terminus (Reasoning)DeepSeek | 37.13 | AA · τ²-Bench Telecom |
| 242 | DeepSeek V3.1 Terminus (Non-reasoning)DeepSeek | 37.13 | AA · τ²-Bench Telecom |
| 243 | GPT-5.4 mini (medium)OpenAI | 36.55 | AA · τ²-Bench Telecom |
| 244 | DeepSeek R1 0528 (May '25)DeepSeek | 36.55 | AA · τ²-Bench Telecom |
| 245 | Pixtral LargeMistral | 36.55 | AA · τ²-Bench Telecom |
| 246 | GPT-5 nano (high)OpenAI | 36.55 | AA · τ²-Bench Telecom |
| 247 | Gemma 4 12B (Reasoning)Google | 36.26 | AA · τ²-Bench Telecom |
| 248 | GPT-5.4 (Non-reasoning)OpenAI | 35.96 | AA · τ²-Bench Telecom |
| 249 | Qwen3 VL 235B A22B InstructAlibaba | 35.09 | AA · τ²-Bench Telecom |
| 250 | GPT-5.4 nano (Non-Reasoning)OpenAI | 34.8 | AA · τ²-Bench Telecom |
| 251 | DeepSeek V3.1 (Non-reasoning)DeepSeek | 34.8 | AA · τ²-Bench Telecom |
| 252 | Qwen3 14B (Reasoning)Alibaba | 34.5 | AA · τ²-Bench Telecom |
| 253 | Sarvam 30B (high)Sarvam | 34.5 | AA · τ²-Bench Telecom |
| 254 | Qwen2.5 Instruct 72BAlibaba | 34.5 | AA · τ²-Bench Telecom |
| 255 | Qwen3 Coder 30B A3B InstructAlibaba | 34.5 | AA · τ²-Bench Telecom |
| 256 | MiniMax M1 80kMiniMax | 34.21 | AA · τ²-Bench Telecom |
| 257 | DeepSeek V3.2 Exp (Non-reasoning)DeepSeek | 33.92 | AA · τ²-Bench Telecom |
| 258 | DeepSeek V3.2 Exp (Reasoning)DeepSeek | 33.92 | AA · τ²-Bench Telecom |
| 259 | Qwen3 235B A22B 2507 InstructAlibaba | 33.33 | AA · τ²-Bench Telecom |
| 260 | Mistral Large 2 (Jul '24)Mistral | 33.04 | AA · τ²-Bench Telecom |
| 261 | Ling-1TInclusionAI | 32.75 | AA · τ²-Bench Telecom |
| 262 | Qwen3 Max (Preview)Alibaba | 32.75 | AA · τ²-Bench Telecom |
| 263 | Claude 4.5 Haiku (Non-reasoning)Anthropic | 32.46 | AA · τ²-Bench Telecom |
| 264 | Qwen3 14B (Non-reasoning)Alibaba | 32.16 | AA · τ²-Bench Telecom |
| 265 | Gemma 4 12B (Non-reasoning)Google | 31.87 | AA · τ²-Bench Telecom |
| 266 | Solar Pro 2 (Non-reasoning)Upstage | 31.87 | AA · τ²-Bench Telecom |
| 267 | GPT-5 mini (minimal)OpenAI | 31.87 | AA · τ²-Bench Telecom |
| 268 | Gemini 2.5 Flash (Reasoning)Google | 31.58 | AA · τ²-Bench Telecom |
| 269 | MiniMax M1 40kMiniMax | 31.58 | AA · τ²-Bench Telecom |
| 270 | GLM-4.6V (Reasoning)Z AI | 31.58 | AA · τ²-Bench Telecom |
| 271 | o3-mini (high)OpenAI | 31.29 | AA · τ²-Bench Telecom |
| 272 | Gemini 3.1 Flash-LiteGoogle | 31.29 | AA · τ²-Bench Telecom |
| 273 | GLM-4.6V (Non-reasoning)Z AI | 30.7 | AA · τ²-Bench Telecom |
| 274 | Mistral Large 2 (Nov '24)Mistral | 30.7 | AA · τ²-Bench Telecom |
| 275 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)Google | 30.7 | AA · τ²-Bench Telecom |
| 276 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)Google | 30.41 | AA · τ²-Bench Telecom |
| 277 | GPT-5 nano (medium)OpenAI | 30.41 | AA · τ²-Bench Telecom |
| 278 | Qwen3 32B (Reasoning)Alibaba | 29.82 | AA · τ²-Bench Telecom |
| 279 | Mistral Small 3.2Mistral | 29.53 | AA · τ²-Bench Telecom |
| 280 | Gemini 2.0 Flash (Feb '25)Google | 29.53 | AA · τ²-Bench Telecom |
| 281 | Qwen3 VL 8B InstructAlibaba | 29.24 | AA · τ²-Bench Telecom |
| 282 | Qwen3 VL 32B InstructAlibaba | 29.24 | AA · τ²-Bench Telecom |
| 283 | GPT-4o (Aug '24)OpenAI | 28.95 | AA · τ²-Bench Telecom |
| 284 | o3-miniOpenAI | 28.65 | AA · τ²-Bench Telecom |
| 285 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Google | 28.36 | AA · τ²-Bench Telecom |
| 286 | Devstral Small (Jul '25)Mistral | 28.36 | AA · τ²-Bench Telecom |
| 287 | Qwen3 30B A3B 2507 (Reasoning)Alibaba | 28.07 | AA · τ²-Bench Telecom |
| 288 | NVIDIA Nemotron 3 Nano 4BNVIDIA | 28.07 | AA · τ²-Bench Telecom |
| 289 | Llama Nemotron Super 49B v1.5 (Reasoning)NVIDIA | 28.07 | AA · τ²-Bench Telecom |
| 290 | Solar Pro 2 (Reasoning)Upstage | 28.07 | AA · τ²-Bench Telecom |
| 291 | Magistral Small 1.2Mistral | 27.78 | AA · τ²-Bench Telecom |
| 292 | Granite 4.1 8BIBM | 27.78 | AA · τ²-Bench Telecom |
| 293 | Qwen3 8B (Reasoning)Alibaba | 27.78 | AA · τ²-Bench Telecom |
| 294 | K2-V2 (high)MBZUAI Institute of Foundation Models | 27.78 | AA · τ²-Bench Telecom |
| 295 | Falcon-H1R-7BTII UAE | 27.78 | AA · τ²-Bench Telecom |
| 296 | Qwen3 235B A22B (Non-reasoning)Alibaba | 27.19 | AA · τ²-Bench Telecom |
| 297 | Ministral 3 14BMistral | 27.19 | AA · τ²-Bench Telecom |
| 298 | Llama 3.3 Nemotron Super 49B v1 (Reasoning)NVIDIA | 26.9 | AA · τ²-Bench Telecom |
| 299 | Magistral Small 1Mistral | 26.61 | AA · τ²-Bench Telecom |
| 300 | INTELLECT-3Prime Intellect | 26.61 | AA · τ²-Bench Telecom |
| 301 | Ministral 3 8BMistral | 26.61 | AA · τ²-Bench Telecom |
| 302 | Llama 3.3 Instruct 70BMeta | 26.61 | AA · τ²-Bench Telecom |
| 303 | Qwen3 4B 2507 InstructAlibaba | 26.61 | AA · τ²-Bench Telecom |
| 304 | Hermes 4 - Llama-3.1 405B (Non-reasoning)Nous Research | 26.61 | AA · τ²-Bench Telecom |
| 305 | Ring-1TInclusionAI | 26.32 | AA · τ²-Bench Telecom |
| 306 | Qwen3 30B A3B (Reasoning)Alibaba | 26.02 | AA · τ²-Bench Telecom |
| 307 | Gemma 4 E4B (Non-reasoning)Google | 26.02 | AA · τ²-Bench Telecom |
| 308 | Qwen3 1.7B (Reasoning)Alibaba | 26.02 | AA · τ²-Bench Telecom |
| 309 | GPT-5 nano (minimal)OpenAI | 25.73 | AA · τ²-Bench Telecom |
| 310 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA | 25.44 | AA · τ²-Bench Telecom |
| 311 | Qwen3 4B 2507 (Reasoning)Alibaba | 25.44 | AA · τ²-Bench Telecom |
| 312 | K2 Think V2MBZUAI Institute of Foundation Models | 25.44 | AA · τ²-Bench Telecom |
| 313 | Mistral Small 3.1Mistral | 25.15 | AA · τ²-Bench Telecom |
| 314 | Llama Nemotron Super 49B v1.5 (Non-reasoning)NVIDIA | 25.15 | AA · τ²-Bench Telecom |
| 315 | GPT-4o (Nov '24)OpenAI | 25.15 | AA · τ²-Bench Telecom |
| 316 | Devstral 2Mistral | 24.85 | AA · τ²-Bench Telecom |
| 317 | Ministral 3 3BMistral | 24.85 | AA · τ²-Bench Telecom |
| 318 | Qwen3 8B (Non-reasoning)Alibaba | 24.85 | AA · τ²-Bench Telecom |
| 319 | K2-V2 (medium)MBZUAI Institute of Foundation Models | 24.85 | AA · τ²-Bench Telecom |
| 320 | Claude 3.5 HaikuAnthropic | 24.56 | AA · τ²-Bench Telecom |
| 321 | Mistral Large 3Mistral | 24.56 | AA · τ²-Bench Telecom |
| 322 | Mistral Medium 3Mistral | 24.27 | AA · τ²-Bench Telecom |
| 323 | Qwen3 235B A22B (Reasoning)Alibaba | 23.98 | AA · τ²-Bench Telecom |
| 324 | NVIDIA Nemotron Nano 9B V2 (Non-reasoning)NVIDIA | 23.39 | AA · τ²-Bench Telecom |
| 325 | GPT-5.4 mini (Non-Reasoning)OpenAI | 23.39 | AA · τ²-Bench Telecom |
| 326 | Devstral Small 2Mistral | 23.39 | AA · τ²-Bench Telecom |
| 327 | Qwen3 VL 4B InstructAlibaba | 23.39 | AA · τ²-Bench Telecom |
| 328 | Magistral Medium 1Mistral | 23.1 | AA · τ²-Bench Telecom |
| 329 | Llama 3.1 Nemotron Instruct 70BNVIDIA | 23.1 | AA · τ²-Bench Telecom |
| 330 | DeepSeek V3 (Dec '24)DeepSeek | 22.81 | AA · τ²-Bench Telecom |
| 331 | Granite 4.0 1BIBM | 22.81 | AA · τ²-Bench Telecom |
| 332 | GLM-4.5V (Reasoning)Z AI | 22.51 | AA · τ²-Bench Telecom |
| 333 | Hermes 4 - Llama-3.1 70B (Reasoning)Nous Research | 22.51 | AA · τ²-Bench Telecom |
| 334 | Qwen3 VL 8B (Reasoning)Alibaba | 22.51 | AA · τ²-Bench Telecom |
| 335 | Gemma 4 E2B (Non-reasoning)Google | 22.22 | AA · τ²-Bench Telecom |
| 336 | Hermes 4 - Llama-3.1 405B (Reasoning)Nous Research | 22.22 | AA · τ²-Bench Telecom |
| 337 | Qwen3 30B A3B (Non-reasoning)Alibaba | 22.22 | AA · τ²-Bench Telecom |
| 338 | DeepSeek R1 Distill Llama 70BDeepSeek | 21.93 | AA · τ²-Bench Telecom |
| 339 | NVIDIA Nemotron Nano 9B V2 (Reasoning)NVIDIA | 21.93 | AA · τ²-Bench Telecom |
| 340 | Hermes 4 - Llama-3.1 70B (Non-reasoning)Nous Research | 21.64 | AA · τ²-Bench Telecom |
| 341 | Qwen3 Next 80B A3B InstructAlibaba | 21.64 | AA · τ²-Bench Telecom |
| 342 | Qwen3 1.7B (Non-reasoning)Alibaba | 21.64 | AA · τ²-Bench Telecom |
| 343 | Nanbeige4.1-3BNanbeige | 21.64 | AA · τ²-Bench Telecom |
| 344 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIA | 21.35 | AA · τ²-Bench Telecom |
| 345 | Olmo 3.1 32B InstructAllen Institute for AI | 21.35 | AA · τ²-Bench Telecom |
| 346 | Qwen3 Omni 30B A3B (Reasoning)Alibaba | 21.35 | AA · τ²-Bench Telecom |
| 347 | Claude 3 HaikuAnthropic | 21.05 | AA · τ²-Bench Telecom |
| 348 | Qwen3 0.6B (Reasoning)Alibaba | 21.05 | AA · τ²-Bench Telecom |
| 349 | Llama 3.2 Instruct 3BMeta | 21.05 | AA · τ²-Bench Telecom |
| 350 | Ling-flash-2.0InclusionAI | 20.76 | AA · τ²-Bench Telecom |
| 351 | Gemma 4 E2B (Reasoning)Google | 20.76 | AA · τ²-Bench Telecom |
| 352 | Gemma 4 E4B (Reasoning)Google | 20.76 | AA · τ²-Bench Telecom |
| 353 | K2-V2 (low)MBZUAI Institute of Foundation Models | 20.76 | AA · τ²-Bench Telecom |
| 354 | Exaone 4.0 1.2B (Non-reasoning)LG AI Research | 20.47 | AA · τ²-Bench Telecom |
| 355 | Solar MiniUpstage | 20.18 | AA · τ²-Bench Telecom |
| 356 | Devstral MediumMistral | 19.88 | AA · τ²-Bench Telecom |
| 357 | Qwen3 VL 30B A3B (Reasoning)Alibaba | 19.88 | AA · τ²-Bench Telecom |
| 358 | GLM-4.5V (Non-reasoning)Z AI | 19.59 | AA · τ²-Bench Telecom |
| 359 | LFM2.5-1.2B-ThinkingLiquid AI | 19.59 | AA · τ²-Bench Telecom |
| 360 | Granite 4.1 3BIBM | 19.59 | AA · τ²-Bench Telecom |
| 361 | Granite 4.0 H 1BIBM | 19.59 | AA · τ²-Bench Telecom |
| 362 | Mistral Small 3Mistral | 19.59 | AA · τ²-Bench Telecom |
| 363 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIA | 19.3 | AA · τ²-Bench Telecom |
| 364 | Qwen3 4B (Reasoning)Alibaba | 19.01 | AA · τ²-Bench Telecom |
| 365 | Gemini 2.5 Flash-Lite (Non-reasoning)Google | 19.01 | AA · τ²-Bench Telecom |
| 366 | Llama 3.1 Instruct 405BMeta | 19.01 | AA · τ²-Bench Telecom |
| 367 | Qwen3 VL 30B A3B InstructAlibaba | 19.01 | AA · τ²-Bench Telecom |
| 368 | Mistral Small 4 (Non-reasoning)Mistral | 18.42 | AA · τ²-Bench Telecom |
| 369 | Gemini 2.5 Flash-Lite (Reasoning)Google | 18.42 | AA · τ²-Bench Telecom |
| 370 | Llama 4 MaverickMeta | 17.84 | AA · τ²-Bench Telecom |
| 371 | Nova LiteAmazon | 17.54 | AA · τ²-Bench Telecom |
| 372 | EXAONE 4.0 32B (Reasoning)LG AI Research | 17.25 | AA · τ²-Bench Telecom |
| 373 | Granite 4.0 H SmallIBM | 17.25 | AA · τ²-Bench Telecom |
| 374 | GPT-4.1 nanoOpenAI | 17.25 | AA · τ²-Bench Telecom |
| 375 | Qwen3 Omni 30B A3B InstructAlibaba | 16.37 | AA · τ²-Bench Telecom |
| 376 | Llama 3.1 Instruct 8BMeta | 16.37 | AA · τ²-Bench Telecom |
| 377 | Exaone 4.0 1.2B (Reasoning)LG AI Research | 16.37 | AA · τ²-Bench Telecom |
| 378 | Step3 VL 10BStepFun | 16.08 | AA · τ²-Bench Telecom |
| 379 | LFM2.5-8B-A1BLiquid AI | 16.08 | AA · τ²-Bench Telecom |
| 380 | Jamba Reasoning 3BAI21 Labs | 15.79 | AA · τ²-Bench Telecom |
| 381 | Llama 4 ScoutMeta | 15.5 | AA · τ²-Bench Telecom |
| 382 | Qwen3 VL 4B (Reasoning)Alibaba | 15.5 | AA · τ²-Bench Telecom |
| 383 | Command ACohere | 15.2 | AA · τ²-Bench Telecom |
| 384 | Llama 3.1 Instruct 70BMeta | 15.2 | AA · τ²-Bench Telecom |
| 385 | Gemini 2.5 Flash (Non-reasoning)Google | 14.91 | AA · τ²-Bench Telecom |
| 386 | Qwen3 0.6B (Non-reasoning)Alibaba | 14.62 | AA · τ²-Bench Telecom |
| 387 | Llama 3.2 Instruct 11B (Vision)Meta | 14.62 | AA · τ²-Bench Telecom |
| 388 | Granite 4.0 H 350MIBM | 14.62 | AA · τ²-Bench Telecom |
| 389 | Nova MicroAmazon | 14.04 | AA · τ²-Bench Telecom |
| 390 | Nova ProAmazon | 14.04 | AA · τ²-Bench Telecom |
| 391 | LFM2 2.6BLiquid AI | 13.45 | AA · τ²-Bench Telecom |
| 392 | Jamba 1.7 LargeAI21 Labs | 13.45 | AA · τ²-Bench Telecom |
| 393 | Ling-mini-2.0InclusionAI | 13.16 | AA · τ²-Bench Telecom |
| 394 | Granite 4.0 350MIBM | 13.16 | AA · τ²-Bench Telecom |
| 395 | Apertus 70B InstructSwiss AI Initiative | 12.87 | AA · τ²-Bench Telecom |
| 396 | LFM2 1.2BLiquid AI | 12.57 | AA · τ²-Bench Telecom |
| 397 | Granite 4.0 MicroIBM | 12.57 | AA · τ²-Bench Telecom |
| 398 | Olmo 3 7B InstructAllen Institute for AI | 12.57 | AA · τ²-Bench Telecom |
| 399 | Jamba 1.7 MiniAI21 Labs | 12.57 | AA · τ²-Bench Telecom |
| 400 | Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning)NVIDIA | 11.7 | AA · τ²-Bench Telecom |
| 401 | DeepSeek R1 (Jan '25)DeepSeek | 11.4 | AA · τ²-Bench Telecom |
| 402 | Apertus 8B InstructSwiss AI Initiative | 11.4 | AA · τ²-Bench Telecom |
| 403 | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIA | 11.4 | AA · τ²-Bench Telecom |
| 404 | LFM2 24B A2BLiquid AI | 11.11 | AA · τ²-Bench Telecom |
| 405 | Gemma 3 12B InstructGoogle | 10.82 | AA · τ²-Bench Telecom |
| 406 | LFM2.5-1.2B-InstructLiquid AI | 10.82 | AA · τ²-Bench Telecom |
| 407 | Gemma 3 27B InstructGoogle | 10.53 | AA · τ²-Bench Telecom |
| 408 | Granite 3.3 8B (Non-reasoning)IBM | 10.53 | AA · τ²-Bench Telecom |
| 409 | LFM2 8B A1BLiquid AI | 10.53 | AA · τ²-Bench Telecom |
| 410 | Gemma 3 1B InstructGoogle | 10.53 | AA · τ²-Bench Telecom |
| 411 | Qwen3 30B A3B 2507 InstructAlibaba | 10.23 | AA · τ²-Bench Telecom |
| 412 | Gemma 3 270MGoogle | 9.06 | AA · τ²-Bench Telecom |
| 413 | LFM2.5-VL-1.6BLiquid AI | 8.48 | AA · τ²-Bench Telecom |
| 414 | Phi-4 Mini InstructMicrosoft | 8.19 | AA · τ²-Bench Telecom |
| 415 | Gemma 3 4B InstructGoogle | 4.97 | AA · τ²-Bench Telecom |
| 416 | Gemma 3n E4B InstructGoogle | 4.97 | AA · τ²-Bench Telecom |
| 417 | EXAONE 4.0 32B (Non-reasoning)LG AI Research | 4.09 | AA · τ²-Bench Telecom |
| 418 | Mistral 7B InstructMistral | 0 | AA · τ²-Bench Telecom |
| 419 | Olmo 3 7B ThinkAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
| 420 | Sarvam M (Reasoning)Sarvam | 0 | AA · τ²-Bench Telecom |
| 421 | Olmo 3.1 32B ThinkAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
| 422 | Molmo2-8BAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
| 423 | Ring-flash-2.0InclusionAI | 0 | AA · τ²-Bench Telecom |
| 424 | DeepSeek V3.2 SpecialeDeepSeek | 0 | AA · τ²-Bench Telecom |
| 425 | OLMo 2 32BAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
| 426 | Kimi Linear 48B A3B InstructKimi | 0 | AA · τ²-Bench Telecom |
| 427 | DeepSeek R1 0528 Qwen3 8BDeepSeek | 0 | AA · τ²-Bench Telecom |
| 428 | Llama 3.2 Instruct 1BMeta | 0 | AA · τ²-Bench Telecom |
| 429 | Tiny Aya GlobalCohere | 0 | AA · τ²-Bench Telecom |
| 430 | Llama 3 Instruct 8BMeta | 0 | AA · τ²-Bench Telecom |
| 431 | Gemma 3n E2B InstructGoogle | 0 | AA · τ²-Bench Telecom |
| 432 | Llama 3 Instruct 70BMeta | 0 | AA · τ²-Bench Telecom |
| 433 | ERNIE 4.5 300B A47BBaidu | 0 | AA · τ²-Bench Telecom |
| 434 | Molmo 7B-DAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
| 435 | Olmo 3 32B ThinkAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
| 436 | Reka Flash 3Reka AI | 0 | AA · τ²-Bench Telecom |
| 437 | Phi-3 Mini Instruct 3.8BMicrosoft | 0 | AA · τ²-Bench Telecom |
| 438 | GPT-5 (ChatGPT)OpenAI | 0 | AA · τ²-Bench Telecom |
| 439 | Phi-4Microsoft | 0 | AA · τ²-Bench Telecom |
| 440 | OLMo 2 7BAllen Institute for AI | 0 | AA · τ²-Bench Telecom |
일치하는 모델이 없습니다. 검색어를 줄여 보세요.
공개된 숫자만 높은 순으로 표시합니다. 순서가 신뢰구간을 고려한 확정 순위는 아닙니다. Sierra τ²-Bench의 Telecom 도메인을 Artificial Analysis가 측정한 값입니다. 원래 τ-Bench retail/airline이나 τ³-Banking과 합산하지 않습니다.
평가 방법 확인 ↗읽는 법
전체 벤치마크고객지원 상황에서 사용자와 에이전트가 함께 도구를 쓰는 능력을 평가합니다. 이 표는 τ²-Bench Telecom의 AA 측정치입니다.
Retail·Airline·Telecom·Banking은 서로 다른 평가 조건입니다. 같은 도메인 결과끼리 비교합니다.