这个评测关注什么
从权重、许可、技术披露和复现条件观察模型开放程度。
阅读时注意
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
适用场景
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。
透明度与可获得性
Artificial Analysis Openness Index 公开榜单,比较 322 个模型的权重可用性、透明度、训练数据访问与许可。智能指数仅作辅助列。
| 排名 | 机构 | 模型 | 开放性指数 | 智能指数 | 模型可用性 | 模型透明度 | 预训练数据访问 | 预训练数据许可 | 后训练数据访问 | 后训练数据许可 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Institute of Foundation Models | K2 Think V2 | 88.89 | 11.5 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 2 | Institute of Foundation Models | K2-V2 (high) | 88.89 | 9.87 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 3 | Institute of Foundation Models | K2-V2 (medium) | 88.89 | 9.02 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 4 | Institute of Foundation Models | K2-V2 (low) | 88.89 | 7.31 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 5 | Allen Institute for AI | Olmo 3.1 32B Think | 88.89 | 7.12 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 6 | Allen Institute for AI | Olmo 3.1 32B Instruct | 88.89 | 6.5 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 7 | Allen Institute for AI | Olmo 3 32B Think | 88.89 | 6.47 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 8 | Allen Institute for AI | OLMo 2 32B | 88.89 | 5.97 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 9 | Allen Institute for AI | Olmo 3 7B Think | 88.89 | 5.62 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 10 | Allen Institute for AI | OLMo 2 7B | 88.89 | 5.58 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 11 | Allen Institute for AI | Molmo 7B-D | 88.89 | 5.56 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 12 | Allen Institute for AI | Olmo 3 7B Instruct | 88.89 | 5.24 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 13 | Swiss AI Initiative | Apertus 70B Instruct | 88.89 | 5.11 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 14 | Swiss AI Initiative | Apertus 8B Instruct | 88.89 | 4.83 v4.3 | 6 | 10 | 3 | 1 | 3 | 1 |
| 15 | NVIDIA | Nemotron 3 Ultra 550B A55B (Reasoning) | 83.33 | 23.41 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 16 | NVIDIA | Nemotron 3.5 Lightning | 83.33 | 13.64 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 17 | NVIDIA | Nemotron 3 Super 120B A12B (Reasoning) | 83.33 | 13.55 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 18 | NVIDIA | Nemotron Cascade 2 30B A3B | 83.33 | 11.67 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 19 | NVIDIA | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | 83.33 | 8.9 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 20 | OpenBMB | MiniCPM5-1B (Reasoning) | 83.33 | 8.8 v4.3 | 6 | 9 | 3 | 3 | 3 | 3 |
| 21 | OpenBMB | MiniCPM5-1B (Non-reasoning) | 83.33 | 8.69 v4.3 | 6 | 9 | 3 | 3 | 3 | 3 |
| 22 | NVIDIA | NVIDIA Nemotron 3 Nano 4B | 83.33 | 7.38 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 23 | NVIDIA | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | 83.33 | 6.85 v4.3 | 6 | 9 | 2 | 1 | 2 | 1 |
| 24 | IBM | Granite 4.2 30B | 72.22 | 14.83 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 25 | IBM | Granite 4.2 8B | 72.22 | 11.81 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 26 | Prime Intellect | INTELLECT-3 | 72.22 | 10.61 v4.3 | 6 | 7 | 0 | 0 | 2 | 2 |
| 27 | IBM | Granite 4.2 3B | 72.22 | 9.06 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 28 | NVIDIA | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | 72.22 | 7.48 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 29 | NVIDIA | NVIDIA Nemotron Nano 9B V2 (Reasoning) | 72.22 | 7.43 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 30 | NVIDIA | NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | 72.22 | 6.84 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 31 | NVIDIA | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | 72.22 | 5.82 v4.3 | 6 | 7 | 2 | 1 | 2 | 1 |
| 32 | Allen Institute for AI | Molmo2-8B | 72.22 | 5 v4.3 | 6 | 7 | 3 | 1 | 3 | 1 |
| 33 | OpenBMB | MiniCPM5-2B | 66.67 | 13.14 v4.3 | 6 | 6 | 2 | 1 | 2 | 1 |
| 34 | IBM | Granite 4.1 30B | 61.11 | 7.44 v4.3 | 6 | 5 | 2 | 1 | 2 | 1 |
| 35 | Kimi | Kimi Linear 48B A3B Instruct | 61.11 | 7.3 v4.3 | 6 | 5 | 1 | 0 | 1 | 0 |
| 36 | IBM | Granite 4.1 8B | 61.11 | 6.57 v4.3 | 6 | 5 | 2 | 1 | 2 | 1 |
| 37 | IBM | Granite 4.1 3B | 61.11 | 5.86 v4.3 | 6 | 5 | 2 | 1 | 2 | 1 |
| 38 | Z AI | GLM-4.5 (Reasoning) | 55.56 | 12.77 v4.3 | 6 | 4 | 0 | 0 | 0 | 0 |
| 39 | Z AI | GLM-4.5-Air | 55.56 | 11.09 v4.3 | 6 | 4 | 0 | 0 | 0 | 0 |
| 40 | NVIDIA | Nemotron 3 Nano Omni 30B A3B Reasoning | 55.56 | 10.25 v4.3 | 6 | 4 | 1 | 0 | 1 | 0 |
| 41 | Baidu | ERNIE 4.5 300B A47B | 55.56 | 7.5 v4.3 | 6 | 4 | 0 | 0 | 0 | 0 |
| 42 | IBM | Granite 4.0 H Small | 55.56 | 6.05 v4.3 | 6 | 4 | 2 | 1 | 2 | 1 |
| 43 | IBM | Granite 4.0 H 1B | 55.56 | 5.19 v4.3 | 6 | 4 | 2 | 1 | 2 | 1 |
| 44 | IBM | Granite 4.0 Micro | 55.56 | 5.11 v4.3 | 6 | 4 | 2 | 1 | 2 | 1 |
| 45 | IBM | Granite 4.0 1B | 55.56 | 5.01 v4.3 | 6 | 4 | 2 | 1 | 2 | 1 |
| 46 | IBM | Granite 4.0 350M | 55.56 | 4.83 v4.3 | 6 | 4 | 2 | 1 | 2 | 1 |
| 47 | IBM | Granite 4.0 H 350M | 55.56 | 4.83 v4.3 | 6 | 4 | 2 | 1 | 2 | 1 |
| 48 | Xiaomi | MiMo-V2-Flash (Reasoning) | 52.78 | 20.82 v4.3 | 6 | 3.5 | 0 | 0 | 1 | 0 |
| 49 | Xiaomi | MiMo-V2-Flash (Non-reasoning) | 52.78 | 16.05 v4.3 | 6 | 3.5 | 0 | 0 | 1 | 0 |
| 50 | NVIDIA | Llama Nemotron Super 49B v1.5 (Reasoning) | 52.78 | 9.01 v4.3 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 51 | NVIDIA | Llama 3.3 Nemotron Super 49B v1 (Reasoning) | 52.78 | 8.93 v4.3 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 52 | Z AI | GLM-4.5V (Reasoning) | 52.78 | 7.56 v4.3 | 6 | 3.5 | 1 | 0 | 0 | 0 |
| 53 | NVIDIA | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | 52.78 | 7.53 v4.3 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 54 | NVIDIA | Llama Nemotron Super 49B v1.5 (Non-reasoning) | 52.78 | 7.36 v4.3 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 55 | NVIDIA | Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | 52.78 | 7.31 v4.3 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 56 | NVIDIA | Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) | 52.78 | 7.28 v4.3 | 4 | 5.5 | 1 | 0 | 1 | 1 |
| 57 | Z AI | GLM-4.5V (Non-reasoning) | 52.78 | 6.7 v4.3 | 6 | 3.5 | 1 | 0 | 0 | 0 |
| 58 | DeepSeek | DeepSeek V4 Pro 0424 (Reasoning, Max Effort) | 50 | 30.87 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 59 | DeepSeek | DeepSeek V4 Pro 0424 (Reasoning, High Effort) | 50 | 30.11 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 60 | Z AI | GLM-5 (Reasoning) | 50 | 27.91 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 61 | DeepSeek | DeepSeek V4 Flash 0420 (Reasoning, High Effort) | 50 | 24.84 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 62 | DeepSeek | DeepSeek V4 Flash 0420 (Reasoning, Max Effort) | 50 | 24.63 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 63 | SK Telecom | A.X-K2 | 50 | 22.7 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 64 | Xiaomi | MiMo-V2-Flash (Feb 2026) | 50 | 22.44 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 65 | Z AI | GLM-5 (Non-reasoning) | 50 | 21.78 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 66 | DeepSeek | DeepSeek V4 Pro 0424 (Non-reasoning) | 50 | 20.83 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 67 | DeepSeek | DeepSeek V4 Flash 0420 (Non-reasoning) | 50 | 18.88 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 68 | StepFun | Step 3.5 Flash | 50 | 16.62 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 69 | Alibaba | Qwen3 VL 235B A22B (Reasoning) | 50 | 13.44 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 70 | ServiceNow | Apriel-v1.6-15B-Thinker | 50 | 13.4 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 71 | DeepSeek | DeepSeek R1 0528 (May '25) | 50 | 13.12 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 |
| 72 | Alibaba | Qwen3 VL 32B (Reasoning) | 50 | 11.87 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 73 | Alibaba | Qwen3 VL 235B A22B Instruct | 50 | 9.94 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 74 | Alibaba | Qwen3 VL 30B A3B (Reasoning) | 50 | 9.45 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 75 | Mistral | Magistral Small 1.2 | 50 | 8.59 v4.3 | 6 | 3 | 0 | 0 | 1 | 1 |
| 76 | Alibaba | Qwen3 VL 32B Instruct | 50 | 8.39 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 77 | Alibaba | Qwen3 VL 8B (Reasoning) | 50 | 8.17 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 78 | Alibaba | Qwen3 VL 30B A3B Instruct | 50 | 7.93 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 79 | Alibaba | Qwen3 VL 8B Instruct | 50 | 7.26 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 80 | Alibaba | Qwen3 VL 4B (Reasoning) | 50 | 7.05 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 81 | Microsoft | Phi-4 Mini Instruct | 50 | 6.33 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 82 | Microsoft | Phi-4 | 50 | 5.92 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 83 | Microsoft | Phi-4 Multimodal Instruct | 50 | 5.81 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 84 | Alibaba | Qwen3 VL 4B Instruct | 50 | 5.66 v4.3 | 6 | 3 | 1 | 0 | 1 | 0 |
| 85 | Gemma 3 27B Instruct | 50 | 4.85 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 86 | Gemma 3 4B Instruct | 50 | 4.83 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 87 | Gemma 3n E4B Instruct | 50 | 4.83 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 88 | Gemma 3n E2B Instruct | 50 | 4.83 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 89 | Gemma 3 1B Instruct | 50 | 4.83 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 90 | Gemma 3 12B Instruct | 50 | 3.75 v4.3 | 6 | 3 | 0 | 0 | 0 | 0 | |
| 91 | ServiceNow | Apriel-v1.5-15B-Thinker | 47.22 | 13.82 v4.3 | 6 | 2.5 | 0 | 0 | 1 | 0 |
| 92 | DeepSeek | DeepSeek R1 0528 Qwen3 8B | 47.22 | 8.08 v4.3 | 6 | 2.5 | 0 | 0 | 1 | 0 |
| 93 | Nous Research | Hermes 4 - Llama-3.1 70B (Reasoning) | 47.22 | 7.91 v4.3 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 94 | Nous Research | Hermes 4 - Llama-3.1 405B (Reasoning) | 47.22 | 7.49 v4.3 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 95 | Nous Research | Hermes 4 - Llama-3.1 405B (Non-reasoning) | 47.22 | 7.41 v4.3 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 96 | Nous Research | Hermes 4 - Llama-3.1 70B (Non-reasoning) | 47.22 | 6.66 v4.3 | 4 | 4.5 | 1 | 0 | 2 | 0 |
| 97 | Z AI | GLM 5.3 Flash | 44.44 | 41.91 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 98 | DeepSeek | DeepSeek V4.1 Flash (Reasoning, Max Effort) | 44.44 | 39.55 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 99 | DeepSeek | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | 44.44 | 36.28 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 100 | DeepSeek | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 44.44 | 34.53 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 101 | Z AI | GLM-5.2 (max) | 44.44 | 34.01 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 102 | Motif Technologies | Motif 3 | 44.44 | 33.57 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 103 | Z AI | GLM-5.1 (Reasoning) | 44.44 | 26.45 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 104 | Tencent | Hy3 | 44.44 | 25.77 v4.3 | 5 | 3 | 0 | 0 | 0 | 0 |
| 105 | InclusionAI | Ling-3.0-flash-VL | 44.44 | 24.97 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 106 | Z AI | GLM-5.1 (Non-reasoning) | 44.44 | 24.24 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 107 | InclusionAI | Ling-3.0-flash-Fin | 44.44 | 23.02 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 108 | Z AI | GLM-4.7 (Reasoning) | 44.44 | 22.24 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 109 | InclusionAI | Ling 3.0 Flash | 44.44 | 20.63 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 110 | LG AI Research | K-EXAONE 2.0 0803 | 44.44 | 19.69 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 111 | Z AI | GLM-4.6 (Reasoning) | 44.44 | 18.53 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 112 | Meta | Muse Glimmer (high) | 44.44 | 18.07 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 113 | Z AI | GLM-4.7 (Non-reasoning) | 44.44 | 17.36 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 114 | DeepSeek | DeepSeek V3.2 Exp (Reasoning) | 44.44 | 16.58 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 115 | Z AI | GLM-4.6 (Non-reasoning) | 44.44 | 14.93 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 116 | Z AI | GLM-4.7-Flash (Reasoning) | 44.44 | 14.87 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 117 | DeepSeek | DeepSeek V3.2 Exp (Non-reasoning) | 44.44 | 13.88 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 118 | Kimi | Kimi K2 | 44.44 | 12.72 v4.3 | 4 | 4 | 1 | 0 | 1 | 0 |
| 119 | Alibaba | Qwen3 235B A22B 2507 (Reasoning) | 44.44 | 12.71 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 120 | ByteDance Seed | Seed-OSS-36B-Instruct | 44.44 | 12.1 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 121 | Alibaba | Qwen3 235B A22B 2507 Instruct | 44.44 | 12 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 122 | Alibaba | Qwen3 Coder 480B A35B Instruct | 44.44 | 11.9 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 123 | LongCat | LongCat Flash Lite | 44.44 | 11.47 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 124 | Alibaba | Qwen3 Next 80B A3B (Reasoning) | 44.44 | 11.2 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 125 | Arcee AI | Trinity Large Thinking | 44.44 | 10.88 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 126 | Z AI | GLM-4.7-Flash (Non-reasoning) | 44.44 | 10.56 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 127 | Alibaba | Qwen3 30B A3B 2507 (Reasoning) | 44.44 | 9.81 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 128 | Alibaba | Qwen3 Next 80B A3B Instruct | 44.44 | 9.64 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 129 | Trillion Labs | Tri-21B-think Preview | 44.44 | 9.59 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 130 | Alibaba | Qwen3 Coder 30B A3B Instruct | 44.44 | 9.59 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 131 | DiffusionGemma 26B A4B | 44.44 | 9.51 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 | |
| 132 | InclusionAI | Ling-1T | 44.44 | 9.17 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 133 | Alibaba | Qwen3 4B 2507 (Reasoning) | 44.44 | 8.8 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 134 | TII UAE | Falcon-H1R-7B | 44.44 | 7.83 v4.3 | 4 | 4 | 1 | 0 | 1 | 0 |
| 135 | InclusionAI | Ling-flash-2.0 | 44.44 | 7.81 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 136 | Alibaba | Qwen3 Omni 30B A3B (Reasoning) | 44.44 | 7.76 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 137 | Mistral | Devstral Small (Jul '25) | 44.44 | 7.6 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 138 | Alibaba | Qwen3 30B A3B 2507 Instruct | 44.44 | 7.52 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 139 | NVIDIA | Llama 3.1 Nemotron Instruct 70B | 44.44 | 6.94 v4.3 | 4 | 4 | 0 | 0 | 1 | 1 |
| 140 | Alibaba | Qwen3 4B 2507 Instruct | 44.44 | 6.74 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 141 | Alibaba | Qwen3 Omni 30B A3B Instruct | 44.44 | 6.01 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 142 | OpenBMB | MiniCPM-V 4.6 1.3B | 44.44 | 5.69 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 143 | InclusionAI | Ling-mini-2.0 | 44.44 | 5.54 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 |
| 144 | Gemma 3 270M | 44.44 | 5.12 v4.3 | 6 | 2 | 0 | 0 | 0 | 0 | |
| 145 | Alibaba | Qwen3 Coder Next | 41.67 | 10.05 v4.3 | 6 | 1.5 | 0 | 0 | 1 | 0 |
| 146 | Cohere | North Mini Code | 41.67 | 9.91 v4.3 | 6 | 1.5 | 0 | 0 | 1 | 0 |
| 147 | Nanbeige | Nanbeige4.1-3B | 41.67 | 8.4 v4.3 | 6 | 1.5 | 0 | 0 | 1 | 0 |
| 148 | StepFun | Step3 VL 10B | 41.67 | 7.69 v4.3 | 6 | 1.5 | 0 | 0 | 1 | 0 |
| 149 | Kimi | Kimi K3 (max) | 38.89 | 43.78 v4.3 | 4 | 3 | 0 | 0 | 0 | 0 |
| 150 | Alibaba | Qwen3.8-Flash-Next | 38.89 | 39.91 v4.3 | 5 | 2 | 0 | 0 | 0 | 0 |
| 151 | Alibaba | Qwen3.8 27B (xhigh) | 38.89 | 33.9 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 152 | Kimi | Kimi K3 (low) | 38.89 | 30.48 v4.3 | 4 | 3 | 0 | 0 | 0 | 0 |
| 153 | Nex AGI | Nex-N2-Pro (based on Qwen3.5-397B-A17B) | 38.89 | 28.2 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 154 | Alibaba | Qwen3.8 27B (medium) | 38.89 | 27.81 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 155 | Sapiens AI | Agnes 2.5 Pro Alpha | 38.89 | 27.8 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 156 | Alibaba | Qwen3.8 27B (low) | 38.89 | 26.49 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 157 | Xiaomi | MiMo-V2.5-Pro | 38.89 | 26.41 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 158 | Thinking Machines | Inkling (xhigh) | 38.89 | 25.54 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 159 | Alibaba | Qwen3.5 27B (Reasoning) | 38.89 | 22.9 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 160 | Alibaba | Qwen3.8 27B (Non-reasoning) | 38.89 | 22.42 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 161 | Xiaomi | MiMo-V2.5 | 38.89 | 22.3 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 162 | Alibaba | Qwen3.6 27B (Reasoning) | 38.89 | 21.91 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 163 | AI9Stars | G9v3-39A5B | 38.89 | 21.83 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 164 | Alibaba | Qwen3.5 397B A17B (Non-reasoning) | 38.89 | 21.44 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 165 | Alibaba | Qwen3.6 27B (Non-reasoning) | 38.89 | 19.83 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 166 | LongCat | LongCat 2.0 | 38.89 | 19.69 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 167 | StepFun | Step 3.7 Flash | 38.89 | 19.48 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 168 | Alibaba | Qwen3.5 27B (Non-reasoning) | 38.89 | 19.37 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 169 | Alibaba | Qwen3.5 35B A3B (Reasoning) | 38.89 | 19.33 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 170 | Alibaba | Qwen3.5 397B A17B (Reasoning) | 38.89 | 19.11 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 171 | Alibaba | Qwen3.6 35B A3B (Reasoning) | 38.89 | 18.81 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 172 | Xiaomi | MiMo-V2.5-Pro (Non-reasoning) | 38.89 | 18.29 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 173 | Alibaba | Qwen3.5 122B A10B (Non-reasoning) | 38.89 | 17.75 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 174 | InclusionAI | Ring-2.6-1T | 38.89 | 17.28 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 175 | InclusionAI | Ling-2.6-1T | 38.89 | 17 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 176 | Gemma 4 26B A4B (Reasoning) | 38.89 | 16.67 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 177 | Alibaba | Qwen3.5 122B A10B (Reasoning) | 38.89 | 16.19 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 178 | Gemma 4 31B (Reasoning) | 38.89 | 15.42 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 179 | DeepSeek | DeepSeek V3.1 Terminus (Reasoning) | 38.89 | 15.4 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 180 | Alibaba | Qwen3.6 35B A3B (Non-reasoning) | 38.89 | 15.23 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 181 | Alibaba | Qwen3.5 35B A3B (Non-reasoning) | 38.89 | 15.12 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 182 | Gemma 4 12B (Reasoning) | 38.89 | 14.18 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 183 | DeepSeek | DeepSeek V3.1 Terminus (Non-reasoning) | 38.89 | 13.93 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 184 | Cohere | Command A+ | 38.89 | 13.92 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 185 | Gemma 4 31B (Non-reasoning) | 38.89 | 13.92 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 186 | Alibaba | Qwen3.5 9B (Reasoning) | 38.89 | 13.65 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 187 | Alibaba | Qwen3.5 9B (Non-reasoning) | 38.89 | 13.27 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 188 | Gemma 4 26B A4B (Non-reasoning) | 38.89 | 13.13 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 189 | Alibaba | Qwen3.5 4B (Reasoning) | 38.89 | 13.12 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 190 | OpenAI | gpt-oss-120b (high) | 38.89 | 12.35 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 191 | InclusionAI | Ling 3.0 Tiny | 38.89 | 11.87 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 192 | Multiverse Computing | HyperNova 60B 2605 (high, based on gpt-oss-120b) | 38.89 | 11.74 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 193 | Mistral | Mistral Small 4 (Reasoning) | 38.89 | 11.45 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 194 | InclusionAI | Ring-1T | 38.89 | 10.9 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 195 | Alibaba | Qwen3.5 4B (Non-reasoning) | 38.89 | 10.81 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 196 | OpenAI | gpt-oss-120b (low) | 38.89 | 10.21 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 197 | OpenAI | gpt-oss-20b (low) | 38.89 | 9.95 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 198 | Mistral | Mistral Large 3 | 38.89 | 9.71 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 199 | InclusionAI | Ling 2.6 Flash | 38.89 | 9.68 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 200 | Gemma 4 12B (Non-reasoning) | 38.89 | 9.38 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 201 | OpenAI | gpt-oss-20b (high) | 38.89 | 9.04 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 202 | Mistral | Mistral Small 4 (Non-reasoning) | 38.89 | 8.99 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 203 | Trillion Labs | Tri-21B-Think | 38.89 | 8.99 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 204 | Gemma 4 E4B (Reasoning) | 38.89 | 8.91 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 205 | Sarvam | Sarvam 105B (high) | 38.89 | 8.79 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 206 | Liquid AI | LFM2.5-2.6B | 38.89 | 8.39 v4.3 | 5 | 2 | 0 | 0 | 0 | 0 |
| 207 | Gemma 4 E2B (Reasoning) | 38.89 | 7.77 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 208 | Meta | Llama 3.3 Instruct 70B | 38.89 | 7.66 v4.3 | 4 | 3 | 1 | 0 | 1 | 0 |
| 209 | Gemma 4 E4B (Non-reasoning) | 38.89 | 7.46 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 210 | Meta | Llama 3.1 Instruct 405B | 38.89 | 7.29 v4.3 | 4 | 3 | 1 | 0 | 1 | 0 |
| 211 | InclusionAI | Ring-flash-2.0 | 38.89 | 7.15 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 212 | Mistral | Mistral Small 3.2 | 38.89 | 6.96 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 213 | Alibaba | Qwen3.5 2B (Reasoning) | 38.89 | 6.94 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 214 | Sarvam | Sarvam 30B (high) | 38.89 | 6.56 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 215 | Gemma 4 E2B (Non-reasoning) | 38.89 | 6.48 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 | |
| 216 | Perplexity | R1 1776 | 38.89 | 6.44 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 217 | Meta | Llama 3.2 Instruct 90B (Vision) | 38.89 | 6.41 v4.3 | 4 | 3 | 1 | 0 | 1 | 0 |
| 218 | Alibaba | Qwen3.5 2B (Non-reasoning) | 38.89 | 6.19 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 219 | Alibaba | Qwen3.5 0.8B (Reasoning) | 38.89 | 6.13 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 220 | Nous Research | DeepHermes 3 - Mistral 24B Preview (Non-reasoning) | 38.89 | 6.07 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 221 | Mistral | Ministral 3 14B | 38.89 | 6.04 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 222 | AI21 Labs | Jamba Reasoning 3B | 38.89 | 5.67 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 223 | Reka AI | Reka Flash 3 | 38.89 | 5.65 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 224 | Mistral | Ministral 3 8B | 38.89 | 5.48 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 225 | Meta | Llama 3.2 Instruct 11B (Vision) | 38.89 | 5.41 v4.3 | 4 | 3 | 1 | 0 | 1 | 0 |
| 226 | Alibaba | Qwen3.5 0.8B (Non-reasoning) | 38.89 | 5.4 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 227 | Mistral | Ministral 3 3B | 38.89 | 4.84 v4.3 | 6 | 1 | 0 | 0 | 0 | 0 |
| 228 | Deep Cogito | Cogito v2.1 (Reasoning) | 38.89 | — | 6 | 1 | 0 | 0 | 0 | 0 |
| 229 | DeepSeek | DeepSeek R1 Distill Llama 70B | 36.11 | 7.89 v4.3 | 4 | 2.5 | 0 | 0 | 1 | 0 |
| 230 | Cohere | Tiny Aya Global | 36.11 | 4.83 v4.3 | 3 | 3.5 | 0 | 0 | 1 | 0 |
| 231 | Z AI | GLM-5.3 (max) | 33.33 | 44.86 v4.3 | 5 | 1 | 0 | 0 | 0 | 0 |
| 232 | MiniMax | MiniMax-M3 | 33.33 | 29.61 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 233 | Kimi | Kimi K2.6 | 33.33 | 27.46 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 234 | Thinking Machines | Inkling Small | 33.33 | 26.09 v4.3 | 5 | 1 | 0 | 0 | 0 | 0 |
| 235 | Upstage | Solar Open2 250B | 33.33 | 24.74 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 236 | Kimi | Kimi K2.6 (Non-reasoning) | 33.33 | 23.57 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 237 | Kimi | Kimi K2.5 (Reasoning) | 33.33 | 23.46 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 238 | Tencent | Hy3-preview (Reasoning) | 33.33 | 22.74 v4.3 | 5 | 1 | 0 | 0 | 0 | 0 |
| 239 | Kimi | Kimi K2.5 (Non-reasoning) | 33.33 | 19.43 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 240 | Tencent | Hy3-preview (Non-reasoning) | 33.33 | 17.04 v4.3 | 5 | 1 | 0 | 0 | 0 | 0 |
| 241 | Mistral | Mistral Medium 3.5 | 33.33 | 14.89 v4.3 | 5 | 1 | 0 | 0 | 0 | 0 |
| 242 | AI9Stars | G9v3-3B | 33.33 | 10.84 v4.3 | 6 | 0 | 0 | 0 | 0 | 0 |
| 243 | Liquid AI | LFM2.5-8B-A1B | 33.33 | 7.22 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 244 | Cohere | Command A | 33.33 | 6.96 v4.3 | 3 | 3 | 0 | 0 | 0 | 0 |
| 245 | Liquid AI | LFM2 2.6B | 33.33 | 5.21 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 246 | Nous Research | DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) | 33.33 | 5.08 v4.3 | 5 | 1 | 0 | 0 | 0 | 0 |
| 247 | Liquid AI | LFM2 8B A1B | 33.33 | 4.93 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 248 | Liquid AI | LFM2 1.2B | 33.33 | 4.83 v4.3 | 4 | 2 | 0 | 0 | 0 | 0 |
| 249 | Naver | HyperCLOVA X SEED Think (32B) | 30.56 | 11.36 v4.3 | 4 | 1.5 | 1 | 0 | 0 | 0 |
| 250 | Alibaba | Qwen3.8 2.4T A95B | 27.78 | 40.04 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 251 | Kimi | Kimi K2.7 Code | 27.78 | 26.27 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 252 | MiniMax | MiniMax-M2.5 | 27.78 | 22.8 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 253 | Kimi | Kimi K2 Thinking | 27.78 | 22.02 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 254 | MiniMax | MiniMax-M2.1 | 27.78 | 20.95 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 255 | MiniMax | MiniMax-M2 | 27.78 | 18.63 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 256 | Kimi | Kimi K2 0905 | 27.78 | 15.29 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 257 | LG AI Research | K-EXAONE (Reasoning) | 27.78 | 14.37 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 258 | LG AI Research | EXAONE 4.5 33B | 27.78 | 13.21 v4.3 | 3 | 2 | 0 | 0 | 0 | 0 |
| 259 | Mistral | Magistral Medium 1.2 | 27.78 | 11.83 v4.3 | 2 | 3 | 0 | 0 | 1 | 1 |
| 260 | LG AI Research | K-EXAONE (Non-reasoning) | 27.78 | 11.21 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 261 | Upstage | Solar Open 100B (Reasoning) | 27.78 | 10.36 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 262 | Mistral | Devstral 2 | 27.78 | 9.41 v4.3 | 5 | 0 | 0 | 0 | 0 | 0 |
| 263 | Meta | Llama 4 Maverick | 27.78 | 9.3 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 264 | Mistral | Devstral Small 2 | 27.78 | 8.36 v4.3 | 5 | 0 | 0 | 0 | 0 | 0 |
| 265 | LG AI Research | EXAONE 4.0 32B (Reasoning) | 27.78 | 8.18 v4.3 | 3 | 2 | 0 | 0 | 0 | 0 |
| 266 | Meta | Llama 4 Scout | 27.78 | 6.45 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 267 | LG AI Research | EXAONE 4.0 32B (Non-reasoning) | 27.78 | 6.33 v4.3 | 3 | 2 | 0 | 0 | 0 | 0 |
| 268 | Liquid AI | LFM2 24B A2B | 27.78 | 5.95 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 269 | LG AI Research | Exaone 4.0 1.2B (Reasoning) | 27.78 | 5.27 v4.3 | 3 | 2 | 0 | 0 | 0 | 0 |
| 270 | LG AI Research | Exaone 4.0 1.2B (Non-reasoning) | 27.78 | 5.23 v4.3 | 3 | 2 | 0 | 0 | 0 | 0 |
| 271 | Liquid AI | LFM2.5-1.2B-Thinking | 27.78 | 5.22 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 272 | Liquid AI | LFM2.5-1.2B-Instruct | 27.78 | 5.21 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 273 | Liquid AI | LFM2.5-VL-1.6B | 27.78 | 4.83 v4.3 | 4 | 1 | 0 | 0 | 0 | 0 |
| 274 | LG AI Research | EXAONE 4.5 33B (Non-reasoning) | 27.78 | — | 3 | 2 | 0 | 0 | 0 | 0 |
| 275 | MiniMax | MiniMax-M2.7 | 22.22 | 23.22 v4.3 | 3 | 1 | 0 | 0 | 0 | 0 |
| 276 | AI21 Labs | Jamba 1.7 Large | 22.22 | 6.07 v4.3 | 4 | 0 | 0 | 0 | 0 | 0 |
| 277 | AI21 Labs | Jamba 1.7 Mini | 22.22 | 5.22 v4.3 | 4 | 0 | 0 | 0 | 0 | 0 |
| 278 | Alibaba | Qwen3 Max Thinking (Preview) | 16.67 | 16.29 v4.3 | 2 | 1 | 0 | 0 | 0 | 0 |
| 279 | Alibaba | Qwen3 Max | 16.67 | 15.61 v4.3 | 2 | 1 | 0 | 0 | 0 | 0 |
| 280 | Anthropic | Claude Opus 4.5 (Reasoning) | 11.11 | 29.1 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 281 | Anthropic | Claude Opus 4.5 (Non-reasoning) | 11.11 | 23.68 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 282 | Anthropic | Claude 4.5 Sonnet (Reasoning) | 11.11 | 21.18 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 283 | Anthropic | Claude 4.5 Sonnet (Non-reasoning) | 11.11 | 19.34 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 284 | Anthropic | Claude 4.5 Haiku (Reasoning) | 11.11 | 17.59 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 285 | ByteDance Seed | Doubao Seed Code | 11.11 | 16.95 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 286 | Anthropic | Claude 4.5 Haiku (Non-reasoning) | 11.11 | 15.41 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 287 | SpaceXAI | Grok 3 mini Reasoning (high) | 11.11 | 14.62 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 288 | OpenAI | GPT-5.1 (Non-reasoning) | 11.11 | 13.31 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 289 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 11.11 | 12.38 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 | |
| 290 | SpaceXAI | Grok 4.1 Fast (Non-reasoning) | 11.11 | 11.28 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 291 | SpaceXAI | Grok 4 Fast (Non-reasoning) | 11.11 | 11.06 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 292 | OpenAI | GPT-5 (ChatGPT) | 11.11 | 10.44 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 293 | Mistral | Mistral Medium 3.1 | 11.11 | 9.53 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 294 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 11.11 | 9.34 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 | |
| 295 | Amazon | Nova Premier | 11.11 | 9.16 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 296 | Mistral | Devstral Medium | 11.11 | 9.01 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 297 | Upstage | Solar Pro 2 (Reasoning) | 11.11 | 7.49 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 298 | Upstage | Solar Pro 2 (Non-reasoning) | 11.11 | 7 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 299 | Amazon | Nova Pro | 11.11 | 6.96 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 300 | Amazon | Nova Lite | 11.11 | 6.67 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 301 | Amazon | Nova Micro | 11.11 | 5.88 v4.3 | 2 | 0 | 0 | 0 | 0 | 0 |
| 302 | Gemini 3 Pro Preview (high) | 5.56 | 27.96 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 303 | OpenAI | GPT-5 Codex (high) | 5.56 | 24.88 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 304 | OpenAI | GPT-5.1 (high) | 5.56 | 24.74 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 305 | OpenAI | GPT-5 (high) | 5.56 | 22.98 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 306 | OpenAI | GPT-5 (medium) | 5.56 | 22.87 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 307 | SpaceXAI | Grok 4 | 5.56 | 22.49 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 308 | OpenAI | GPT-5 (low) | 5.56 | 20.79 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 309 | OpenAI | GPT-5 mini (medium) | 5.56 | 20.6 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 310 | SpaceXAI | Grok 4.1 Fast (Reasoning) | 5.56 | 20.37 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 311 | OpenAI | o3 | 5.56 | 20.2 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 312 | SpaceXAI | Grok 4 Fast (Reasoning) | 5.56 | 17.94 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 313 | OpenAI | GPT-5 mini (high) | 5.56 | 17.41 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 314 | Gemini 2.5 Pro | 5.56 | 16.66 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 315 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 5.56 | 15.47 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 316 | SpaceXAI | Grok Code Fast 1 | 5.56 | 14.06 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 317 | OpenAI | GPT-5 nano (high) | 5.56 | 12.99 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 318 | OpenAI | GPT-5 nano (medium) | 5.56 | 12.48 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 319 | OpenAI | GPT-5 (minimal) | 5.56 | 11.45 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 320 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 5.56 | 10.35 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 | |
| 321 | OpenAI | GPT-5 mini (minimal) | 5.56 | 9.91 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
| 322 | OpenAI | GPT-5 nano (minimal) | 5.56 | 7.09 v4.3 | 1 | 0 | 0 | 0 | 0 | 0 |
FAQ
回答只使用来源页面可以明确核对的指标定义。
它分别观察模型可用性、模型透明度、预训练数据访问与许可、后训练数据访问与许可,不把智能表现直接当作开放程度。
不等于。开放权重只说明模型权重可以获取;是否允许商业使用、修改或再分发,仍取决于具体许可。本站保留来源中的许可名称和商业使用标记。
这表示来源榜单没有提供该辅助指标,不代表分数为 0。开放性总分及六个组成字段仍按来源完整展示。
从权重、许可、技术披露和复现条件观察模型开放程度。
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。