AA Intelligence Index v4.3:53.37。本期来源未标记为暂估。
模型日报 · 2026-09-09
模型日报 2026-09-09|AA 智能指数升级 v4.3:十项评测与新配置如何比较
Artificial Analysis 智能指数升级 v4.3,纳入 Terminal-Bench v4.0 与 AutomationBench-AA。本期核对 20 个新收录配置、519 行评测,以及旧版分数和 API 价格的可比边界。
TODAY'S TAKE
指数换了口径,选型先对齐版本
Artificial Analysis Intelligence Index v4.3 采用十项评测,覆盖 Agent、代码、通用能力与科学推理。本次更新的重点是新方法与精确配置:可以比较同一 v4.3 下的结果,不能把旧 v4.1 到新 v4.3 的指数差值当作模型能力涨跌。
AA Intelligence Index v4.3:52.81。本期来源未标记为暂估。
AA Intelligence Index v4.3:44.86。本期来源未标记为暂估。
v4.3 方法具体改变了什么
AA 于 2026-09-07 公布 Intelligence Index v4.3,采用十项评测,纳入 Terminal-Bench v4.0 与 AutomationBench-AA。本期 Omniscience 榜覆盖 519 个配置;新旧指数属于不同方法版本,不能直接将分数差解释为能力涨跌。
官方方法把权重分为 Agents 30%、Coding 20%、General 30% 和 Scientific Reasoning 20%。AA-Briefcase、GDPval-AA v2 与 AutomationBench-AA 观察带工具的实际工作;Terminal-Bench 使用 v4.0,长上下文使用 AA-LCR v1.1。AA-Omniscience 的准确率和幻觉率分别进入指数,不能把该榜单的单一分数直接当成这两项。
对检索 AA Intelligence Index v4.3 methodology 或“Artificial Analysis v4.3 评测变化”的读者,关键区别是任务集合、版本与权重同时影响总指数。下面保留 AA 发布的原始分项和单位;模型坐标不重新合成总分。
| 评测 / 官方权重 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | GPT-6 Astra (max) | GLM-5.3 | 如何解释 |
|---|---|---|---|---|
| AA-Briefcase 15% | 1661.82 | 1562.01 | 1515.06 | 整体 Elo;高分更好,不是百分比 |
| GDPval-AA v2 10% | 1763.64 | 1580.20 | 1676.24 | 原始 Elo;指数内部采用 AA 的固定尺度 |
| AutomationBench-AA 5% | 59.4% | 68.5% | 62.2% | 来源 partial score;越界触发任务不计分 |
| Terminal-Bench v4.0 10% | 52.0% | 59.1% | 41.9% | pass@1;不可接到旧 v2.1 曲线 |
| SciCode 10% | 63.1% | 56.5% | 59.0% | 代码执行 pass@1,按子问题计分 |
| AA-Omniscience 15% | 67.2% 幻觉率:72.6% | 62.6% 幻觉率:51.3% | 33.9% 幻觉率:29.6% | 准确率占 10%;1 − 幻觉率占 5% |
| GDP.pdf 10% | 26.2% | 31.0% | 11.2% | 公开 all-pass 指标,区别于单次答对 |
| AA-LCR v1.1 5% | 85.3% | 80.7% | 79.7% | 长上下文推理 pass@1 |
| Humanity's Last Exam 10% | 59.1% | 54.7% | 42.3% | 开放式作答 pass@1 |
| CritPt 10% | 29.7% | 31.7% | 19.1% | 科学推理;按官方评分服务器核验 |
未知表示本期没有该精确配置的可用观测,不代表零分。带 * 的数字是 AA 标记的暂估结果;它们不应被当成完整评测确认值。幻觉率低更好,其他表列指标高更好;Elo 与百分比不能直接相加。
与上一期如何比较
以同一 GLM-5.3 为例,保留的旧口径指数为 59.51,observedAt 为 2026-08-19T00:00:00.000Z;本期 v4.3 指数为 44.86,observedAt 为 2026-09-09T14:00:04.717Z。这两条属于不同方法身份,不计算升降幅,也不解释成模型“退步”或“变强”。
同版本、同配置、同评测协议才有连续比较的基础。Terminal-Bench v2.1 与 v4.0、旧 GDPval 与 GDPval-AA v2 分别保存;即便某分项名称未变,也要核对题集、推理档位和运行协议。历史页提供旧观测,本期表格只读取 v4.3。
同期更新:模型与评测覆盖
- 20 个精确模型配置新纳入模型坐标
本期新增收录 20 个精确模型配置。这里的“新增”指本站首次收录该 AA 身份,不等于厂商在今天发布;推理档位、fallback 和基于其他模型的变体均按来源名称分别保留。
| 精确配置 | v4.3 指数 | observedAt |
|---|---|---|
| Apodex 1.1 | 30.37* | |
| Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) | 51.21 | |
| Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) | 47.04 | |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 53.37 | |
| Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | 49.06 | |
| Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) | 53.18 | |
| Gemini 3.8 Flash (high) | 41.19 | |
| Gemini 3.8 Flash (low) | 33.79 | |
| Gemini 3.8 Flash (medium) | 40.00 | |
| GPT-6 Astra (high) | 51.05 | |
| GPT-6 Astra (low) | 45.99 | |
| GPT-6 Astra (max) | 52.81 | |
| GPT-6 Astra (medium) | 49.67 | |
| GPT-6 Astra (Non-reasoning) | 45.17 | |
| GPT-6 Astra (xhigh) | 52.51 | |
| K2 Horizon 375B A23B | 33.92* | |
| MiniCPM5-2B | 13.14 | |
| Muse Spark 1.3 (max) | 48.17 | |
| Muse Spark 1.3 (xhigh) | 45.16 | |
| Quasar 438B (max, based on GLM-5.2) | 27.13 |
价格与 API:本期没有发布确认变化
本期更新评测与模型覆盖,没有更新 OpenRouter 精确同款价格。新收录的配置若尚无一一对应的 OpenRouter model ID,当前 API 与价格保持未知;不能拿相似名称、独立免费变体或 AA 单任务成本替代。
既有模型的价格如有保留,应连同 OpenRouter 来源和原 observedAt 作为历史参考。模型页的评测时间不能充当价格复核时间,新的能力指数也不能证明某个 API 已经可调用。
对模型选型有什么实际影响
知识工作 Agent 可以先看 AA-Briefcase、GDPval-AA v2 与 AutomationBench-AA;命令行和科学编程任务看 Terminal-Bench v4.0 与 SciCode;长文档任务看 AA-LCR v1.1 与 GDP.pdf;需要可信回答时同时看 Omniscience 准确率与幻觉率。指数适合缩小候选集,最后仍应按真实任务、预算与可调用配置验证。
比较 Claude Fable、GPT-6 Astra 等配置时,先固定 effort 与 fallback,再查看同版分项。更高推理档位的结果不能直接代替低档位;没有本期速度、成本观测时,也不能宣称性价比同步提高。
未知项、适用范围与日期
- 本期来源观察截止为 ;每条数字保留自己的 observedAt,后续更新不回写本文。
- AA Intelligence Index 主要是英语、文本任务评测。多语言、图像、语音等能力不能由本指数直接推出。
- 暂估、缺失分项和未核验 API 分别标明。官方厂商披露与 AA 独立第三方结果属于不同证据来源。
- 本文没有把跨版本指数差、榜单扩容或排名变化解释为底层模型能力变化。