模型日报 · 2026-09-09

模型日报 2026-09-09|AA 智能指数升级 v4.3:十项评测与新配置如何比较

Artificial Analysis 智能指数升级 v4.3,纳入 Terminal-Bench v4.0 与 AutomationBench-AA。本期核对 20 个新收录配置、519 行评测,以及旧版分数和 API 价格的可比边界。

TODAY'S TAKE

指数换了口径,选型先对齐版本

Artificial Analysis Intelligence Index v4.3 采用十项评测,覆盖 Agent、代码、通用能力与科学推理。本次更新的重点是新方法与精确配置:可以比较同一 v4.3 下的结果,不能把旧 v4.1 到新 v4.3 的指数差值当作模型能力涨跌。

GPT-6 Astra (max)

AA Intelligence Index v4.3:52.81。本期来源未标记为暂估。

GLM-5.3

AA Intelligence Index v4.3:44.86。本期来源未标记为暂估。

v4.3 方法具体改变了什么

AA 于 2026-09-07 公布 Intelligence Index v4.3,采用十项评测,纳入 Terminal-Bench v4.0 与 AutomationBench-AA。本期 Omniscience 榜覆盖 519 个配置;新旧指数属于不同方法版本,不能直接将分数差解释为能力涨跌。

官方方法把权重分为 Agents 30%、Coding 20%、General 30% 和 Scientific Reasoning 20%。AA-Briefcase、GDPval-AA v2 与 AutomationBench-AA 观察带工具的实际工作;Terminal-Bench 使用 v4.0,长上下文使用 AA-LCR v1.1。AA-Omniscience 的准确率和幻觉率分别进入指数,不能把该榜单的单一分数直接当成这两项。

对检索 AA Intelligence Index v4.3 methodology 或“Artificial Analysis v4.3 评测变化”的读者,关键区别是任务集合、版本与权重同时影响总指数。下面保留 AA 发布的原始分项和单位;模型坐标不重新合成总分。

本期 v4.3 原始分项;观察截止 2026-09-09T14:00:04.717Z。百分比仅由来源 fraction 转换显示。
评测 / 官方权重Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)GPT-6 Astra (max)GLM-5.3如何解释
AA-Briefcase
15%
1661.821562.011515.06整体 Elo;高分更好,不是百分比
GDPval-AA v2
10%
1763.641580.201676.24原始 Elo;指数内部采用 AA 的固定尺度
AutomationBench-AA
5%
59.4%68.5%62.2%来源 partial score;越界触发任务不计分
Terminal-Bench v4.0
10%
52.0%59.1%41.9%pass@1;不可接到旧 v2.1 曲线
SciCode
10%
63.1%56.5%59.0%代码执行 pass@1,按子问题计分
AA-Omniscience
15%
67.2%
幻觉率:72.6%
62.6%
幻觉率:51.3%
33.9%
幻觉率:29.6%
准确率占 10%;1 − 幻觉率占 5%
GDP.pdf
10%
26.2%31.0%11.2%公开 all-pass 指标,区别于单次答对
AA-LCR v1.1
5%
85.3%80.7%79.7%长上下文推理 pass@1
Humanity's Last Exam
10%
59.1%54.7%42.3%开放式作答 pass@1
CritPt
10%
29.7%31.7%19.1%科学推理;按官方评分服务器核验

未知表示本期没有该精确配置的可用观测,不代表零分。带 * 的数字是 AA 标记的暂估结果;它们不应被当成完整评测确认值。幻觉率低更好,其他表列指标高更好;Elo 与百分比不能直接相加。

与上一期如何比较

以同一 GLM-5.3 为例,保留的旧口径指数为 59.51,observedAt 为 2026-08-19T00:00:00.000Z;本期 v4.3 指数为 44.86,observedAt 为 2026-09-09T14:00:04.717Z。这两条属于不同方法身份,不计算升降幅,也不解释成模型“退步”或“变强”。

同版本、同配置、同评测协议才有连续比较的基础。Terminal-Bench v2.1 与 v4.0、旧 GDPval 与 GDPval-AA v2 分别保存;即便某分项名称未变,也要核对题集、推理档位和运行协议。历史页提供旧观测,本期表格只读取 v4.3。

同期更新:模型与评测覆盖

  • 20 个精确模型配置新纳入模型坐标

本期新增收录 20 个精确模型配置。这里的“新增”指本站首次收录该 AA 身份,不等于厂商在今天发布;推理档位、fallback 和基于其他模型的变体均按来源名称分别保留。

本期新增配置的 AA Intelligence Index v4.3;* 表示来源暂估
精确配置v4.3 指数observedAt
Apodex 1.130.37*
Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)51.21
Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)47.04
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)53.37
Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)49.06
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)53.18
Gemini 3.8 Flash (high)41.19
Gemini 3.8 Flash (low)33.79
Gemini 3.8 Flash (medium)40.00
GPT-6 Astra (high)51.05
GPT-6 Astra (low)45.99
GPT-6 Astra (max)52.81
GPT-6 Astra (medium)49.67
GPT-6 Astra (Non-reasoning)45.17
GPT-6 Astra (xhigh)52.51
K2 Horizon 375B A23B33.92*
MiniCPM5-2B13.14
Muse Spark 1.3 (max)48.17
Muse Spark 1.3 (xhigh)45.16
Quasar 438B (max, based on GLM-5.2)27.13

价格与 API:本期没有发布确认变化

本期更新评测与模型覆盖,没有更新 OpenRouter 精确同款价格。新收录的配置若尚无一一对应的 OpenRouter model ID,当前 API 与价格保持未知;不能拿相似名称、独立免费变体或 AA 单任务成本替代。

既有模型的价格如有保留,应连同 OpenRouter 来源和原 observedAt 作为历史参考。模型页的评测时间不能充当价格复核时间,新的能力指数也不能证明某个 API 已经可调用。

对模型选型有什么实际影响

知识工作 Agent 可以先看 AA-Briefcase、GDPval-AA v2 与 AutomationBench-AA;命令行和科学编程任务看 Terminal-Bench v4.0 与 SciCode;长文档任务看 AA-LCR v1.1 与 GDP.pdf;需要可信回答时同时看 Omniscience 准确率与幻觉率。指数适合缩小候选集,最后仍应按真实任务、预算与可调用配置验证。

比较 Claude Fable、GPT-6 Astra 等配置时,先固定 effort 与 fallback,再查看同版分项。更高推理档位的结果不能直接代替低档位;没有本期速度、成本观测时,也不能宣称性价比同步提高。

未知项、适用范围与日期

  • 本期来源观察截止为 ;每条数字保留自己的 observedAt,后续更新不回写本文。
  • AA Intelligence Index 主要是英语、文本任务评测。多语言、图像、语音等能力不能由本指数直接推出。
  • 暂估、缺失分项和未核验 API 分别标明。官方厂商披露与 AA 独立第三方结果属于不同证据来源。
  • 本文没有把跨版本指数差、榜单扩容或排名变化解释为底层模型能力变化。