Methodology

数据与方法说明

解释 AA Intelligence Index v4.3 的组成与权重、实时 Elo 裁判协议 v4.3.1 和历史版本边界。模型坐标保留来源原始分数,不合成全站总分。

数据快照:2026-09-16T01:36:22.563Z查看原始来源 ↗

我们做什么

收集公开榜单,规范字段名称,提供中文解释、站内检索、横向比较和稳定页面地址;个别中文专题会对已有输出运行可复现的 AI 复评。

我们不做什么

不修改公开来源分数,不调整来源权重,不把能力、价格、速度、开放性或专题复评分合并成本站总分。

本站 AI 复评边界

复评分只在所属专题内比较同一任务的有效输出,并披露固定样本、评分维度、Judge 模型、匿名方式、评分轮次、分歧处理、原始输出和机器数据。

数据快照与方法版本

本页方法核验于 2026-09-09T01:19:58Z,当前说明对应 AA Intelligence Index v4.3。各模型、价格和历史观测有独立的来源与 observedAt;方法更新时间不代表每条模型数据都在同一天更新。

版本可比边界

v4.3 更换了组成评测及权重,旧 v4.1 观测仍保留原版本。跨版本的分数差不能直接解释成能力涨跌;同一版本、模型 variant 和评测设置才可用于同口径比较。来源标为估算的分数保留估算标记,不与完整评测混称。

缺失值

“—”表示当前公开快照没有可核验结果。缺失不代表性能为零,也不会被本站估算补齐。

名称处理

保留会影响结果的模型版本和推理档位;删除对普通读者没有帮助的冗余描述,但详情页始终提供原始来源供核验。

INTELLIGENCE INDEX v4.3

当前 10 项评测与权重

Agent 30%、编码 20%、通用 30%、科学推理 20%。权重仅解释 Artificial Analysis 原始方法;本站不据此重算指数。

Artificial Analysis Intelligence Index v4.3 当前组成
类别评测题目重复回答类型评分权重工具
AgentAA-Briefcase91 项任务 / 4 个场景1Agent 交付文件多维 rubric 成对比较的综合 Elo15%
AgentGDPval-AA v2220 项任务1Agent 交付文件多裁判成对 Elo;人类专家锚定 1000,冻结并缩放10%
AgentAutomationBench-AA657 项任务1REST API 工作流客观任务完成;违规任务零分5%
编码Terminal-Bench v4.066 项任务3终端任务执行测试套件通过,pass@110%
编码SciCode288 个子问题3Python 代码代码执行,子问题计分;使用科学家标注背景10%
通用AA-Omniscience6,0001开放回答准确率 10% +(1 − 幻觉率)5%15%
通用GDP.pdf100 项任务 / 10 个领域5基于长 PDF 的开放回答All-pass 主指标与任务宏平均 Mean Pass10%
通用AA-LCR v1.11003开放回答LLM 等价性检查,pass@15%
科学推理Humanity's Last Exam2,1581开放回答LLM 等价性检查,pass@110%
科学推理CritPt705函数、符号和数值答案官方评分服务,pass@110%

AA-Omniscience 的准确率与非幻觉率占两个权重分量,但属于同一项评测。Briefcase 与 GDPval 的 Elo、其他评测的通过率,以及独立 Omniscience Index 具有不同量纲,不宜直接平均。

LIVE ELO · JUDGING PROTOCOL v4.3.1

实时 Elo 与冻结的指数贡献

AA 的方法版本记录将 v4.3.1 定义为 AA-Briefcase 与 GDPval-AA v2 的成对比较裁判更新:Claude Opus 5(high effort)、GPT-5.6 Sol(medium reasoning)、Gemini 3.8 Flash(high reasoning)。Briefcase 的 rubric 评分裁判未变;这不代表所有组成评测都升级为 v4.3.1,来源 Intelligence Index 仍标为 v4.3。

两项 Elo 在模型加入 Intelligence Index 时冻结,作为当时的指数贡献;独立榜单的实时 Elo 后续可能变化。本站展示来源原值,不用当前实时 Elo 反算或改写 Intelligence Index。

已核实当前协议的 Elo 单独标注“裁判协议 v4.3.1”。此前未区分裁判协议的观测保留原值、原版本与原 observedAt,仅作历史参考,不与当前协议混排,也不将跨协议差额解释成模型能力涨跌。

本次方法核验时间为 2026-09-16T01:36:22.563Z。来源只注明“September 2026 to current”,没有精确生效日或逐模型重跑时间;核验日期不是方法发布日期。

查看 AA 方法与版本记录 ↗

历史参考 · INTELLIGENCE INDEX v4.1

旧版 9 项评测与权重

保留已提交的 v4.1 方法快照(2026-07-25),供阅读旧观测使用,不代表当前方法。Agent 34%、编码 24%、科学推理 24%、通用 18%。

Artificial Analysis Intelligence Index v4.1 历史组成
类别评测题目重复回答类型评分权重工具
Agent(34%)GDPval-AA v2220 项任务1Agent 交付文件多裁判成对 Elo;人类专家锚定 100020%
Agent(34%)τ³-Banking975双控制 Agent / 用户模拟后端数据库状态,pass@114%
编码(24%)Terminal-Bench v2.1893终端任务执行测试套件通过,pass@116%
编码(24%)SciCode288 个子问题3Python 代码代码执行,子问题计分8%
通用(18%)AA-LCR1003开放回答LLM 等价性检查,pass@16%
通用(18%)AA-Omniscience6,0001开放回答准确率 8% + 非幻觉率 4%12%
科学推理(24%)Humanity's Last Exam2,1581开放回答LLM 等价性检查,pass@112%
科学推理(24%)GPQA Diamond1985四选一正则提取,pass@16%
科学推理(24%)CritPt705函数、符号和数值答案官方评分服务,pass@16%

EVALUATION PRINCIPLES

四项评测原则

标准化

相同条件、提示策略、温度和评分标准。

尽量无偏

使用明确提示、稳健提取和允许有效表达差异的答案验证。

Zero-shot

不给示例或演示,直接测试模型理解和执行指令的能力。

透明

公开提示模板、评估标准、参数和已知限制。

TESTING PARAMETERS

通用测试参数

生成设置

  • 非推理模型温度 0;推理模型温度 0.6,模型实验室另有推荐时例外。
  • 非推理模型最多输出 16,384 Token,模型限制更小时下调;推理模型使用创建者披露的最大输出上限。
  • Agent 评测的主要沙箱提供方为 e2b;具体环境以各项评测协议为准,不假定所有任务共用同一系统镜像。

错误与计分

  • API 失败最多自动重试 30 次;持续失败的问题人工复核。
  • 多数评测使用 pass@1;有重复实验时,汇总全部重复结果。GDP.pdf 的 All-pass 与 AA-AnalystAgent 的 pass^5 等指标单独解释。
  • Intelligence Index 任务成本优先使用 Provider 报告的 Token 数;缺失时来源使用统一 tokenizer 回退。它与 OpenRouter 精确型号的当前 API 单价分开记录。

ADDITIONAL EVALUATIONS

不计入 v4.3 的独立评测

覆盖多语言、视觉、专业服务、企业工具等能力;这与旧版指数的组成范围不同。

Additional Evaluations
类别评测规模主要形式
Agentτ³-Banking97 项任务双控制 Agent / 用户模拟与知识检索
AgentHarvey LAB-AA120 项任务法律交付物与 rubric 评估
AgentAPEX-Agents-AA452 项任务专业服务任务与本地文件评分
AgentAA-AnalystAgent80 项任务 / 14 个领域Python 数据分析;五次均正确的 pass^5
AgentITBench-AA59 个场景离线 Kubernetes 事故根因诊断
AgentEnterpriseOps-Gym-AA1,117 项任务8 个领域的多轮 MCP 工具使用
通用IFBench294指令遵循与规则驱动评估
通用MLCR-AA60 项问题医学长上下文;简洁性门槛与多裁判评估
其他Global-MMLU-Lite约 6,00016 种语言的四选一评估
其他MMMU Pro1,730图文多模态十选一评估