- 智能
- —
- 成本 / 任务
- —
- 输出速度
- —
WHAT IS MODEL COORDINATE
模型坐标是什么?
模型坐标是一个中文 AI Benchmark 聚合与模型选型站。我们把公开评测、真实任务、API 成本和速度放回各自原始口径,不自产一个掩盖差异的综合总分。
最新变化
模型与评测动态
保留来源的发布日期与事实描述,点击后进入原始文章或模型页面。
- 09-19模型日报DeepSeek V4 Pro 与 V4 Flash 当前 API 报价怎么变
- 08-15新评测AA-AnalystAgent 发布 30 模型榜单,以 pass^5 衡量五次重复分析的稳定性
- 07-24模型评测Claude Opus 5 加入语言模型评测并登顶 Intelligence Index
- 07-20模型评测Motif 3(Beta)加入语言模型评测
- 07-17研究文章六家实验室已有模型突破 Intelligence Index 50
- 07-17研究文章Kimi K3 位列 Intelligence Index 第三
- 07-15模型评测Inkling 成为领先的美国开放权重模型
Model Leaderboard
智能指数 v4.3 前 10
共收录 653 个模型配置;v4.3 评测矩阵 528 行。本表只比较同版本、非估算且未弃用的智能指数,不混入旧版任务成本。
查看原始来源 ↗| # | 模型 | 机构 | 智能指数 v4.3 | 观测日期 |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | Anthropic | 53.37 | 2026-09-09 |
| 2 | Claude Fable 5.1 (xhigh with fallback) | Anthropic | 53.18 | 2026-09-09 |
| 3 | GPT-6 Astra (max) | OpenAI | 52.81 | 2026-09-09 |
| 4 | GPT-6 Astra (xhigh) | OpenAI | 52.51 | 2026-09-09 |
| 5 | Claude Fable 5.1 (high with fallback) | Anthropic | 51.21 | 2026-09-09 |
| 6 | GPT-6 Astra (high) | OpenAI | 51.05 | 2026-09-09 |
| 7 | Claude Opus 5 (max) | Anthropic | 50.70 | 2026-09-09 |
| 8 | Claude Fable 5 | Anthropic | 49.70 | 2026-09-09 |
| 9 | GPT-6 Astra (medium) | OpenAI | 49.67 | 2026-09-09 |
| 10 | Claude Opus 5 (xhigh) | Anthropic | 49.65 | 2026-09-09 |
BEGINNER QUESTIONS
小白最常问的模型选择问题
先给一个能直接执行的答案,再解释适用场景、公开证据和限制。
复杂编程、疑难调试和长链路 Agent 选 Opus 5;日常开发、批量调用和成本敏感场景选 Sonnet 5。
查看答案和依据 →02Claude Code 哪个模型最好当前 Claude Code 复杂任务首选 Opus 5;日常高频开发优先 Sonnet 5,只有追求最高难度任务上限时再比较 Fable 5。
查看答案和依据 →03Cursor 用什么模型不想研究模型时直接用 Cursor Auto;复杂 Agent 任务按当前公开 Cursor CLI 快照首选 GPT-5.5(medium),预算优先选 Composer 2.5。
查看答案和依据 →04国产模型 Coding 能力排行当前国产 Coding 综合首选 Kimi K3;预算敏感选 DeepSeek V4 Pro;需要开放生态和私有部署时优先看 Qwen Coder 系列。
查看答案和依据 →05DeepSeek vs Claude 写代码只选一个做真实工程,优先 Claude;大量生成、预算敏感或国产 API 场景,优先 DeepSeek。复杂重构和长链路 Agent 是 Claude 的优势区。
查看答案和依据 →06AI 小说写作模型排行写中文网文可先试 Kimi,文学润色和改稿优先 Claude,长篇设定管理再比较 Gemini;如果只选一个中文创作起点,本站当前建议 Kimi。
查看答案和依据 →07中文大模型排行榜中文选型可从 Kimi K3、DeepSeek V4 Flash 和 Qwen 等候选开始;先按任务与预算筛选,再比较同一评测版本、同一推理档位的结果,不能把国产综合排名当作中文能力排名。
查看答案和依据 →关于数据
如何理解这些公开数据
当前智能指数榜单展示 Artificial Analysis Intelligence Index v4.3 的公开结果, 由 AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0、SciCode、AA-Omniscience、GDP.pdf、AA-LCR v1.1、Humanity's Last Exam、CritPt 共 10 项评测组成。 首页能力—成本坐标保留标注日期的 v4.1 历史快照;不同版本的分数不混排,也不能直接相减表示能力变化。
不同模块使用不同评价对象和量纲:模型、Agent、媒体竞技场、Provider 与硬件数据不能直接横向合并。本站没有重新计算、归一化或修改来源分数。