我们做什么
收集公开榜单,规范字段名称,提供中文解释、站内检索、横向比较和稳定页面地址;个别中文专题会对已有输出运行可复现的 AI 复评。
我们不做什么
不修改公开来源分数,不调整来源权重,不把能力、价格、速度、开放性或专题复评分合并成本站总分。
本站 AI 复评边界
复评分只在所属专题内比较同一任务的有效输出,并披露固定样本、评分维度、Judge 模型、匿名方式、评分轮次、分歧处理、原始输出和机器数据。
数据快照与方法版本
本页方法核验于 2026-09-09T01:19:58Z,当前说明对应 AA Intelligence Index v4.3。各模型、价格和历史观测有独立的来源与 observedAt;方法更新时间不代表每条模型数据都在同一天更新。
版本可比边界
v4.3 更换了组成评测及权重,旧 v4.1 观测仍保留原版本。跨版本的分数差不能直接解释成能力涨跌;同一版本、模型 variant 和评测设置才可用于同口径比较。来源标为估算的分数保留估算标记,不与完整评测混称。
缺失值
“—”表示当前公开快照没有可核验结果。缺失不代表性能为零,也不会被本站估算补齐。
名称处理
保留会影响结果的模型版本和推理档位;删除对普通读者没有帮助的冗余描述,但详情页始终提供原始来源供核验。
AA-Omniscience 的准确率与非幻觉率占两个权重分量,但属于同一项评测。Briefcase 与 GDPval 的 Elo、其他评测的通过率,以及独立 Omniscience Index 具有不同量纲,不宜直接平均。
AA 的方法版本记录将 v4.3.1 定义为 AA-Briefcase 与 GDPval-AA v2 的成对比较裁判更新:Claude Opus 5(high effort)、GPT-5.6 Sol(medium reasoning)、Gemini 3.8 Flash(high reasoning)。Briefcase 的 rubric 评分裁判未变;这不代表所有组成评测都升级为 v4.3.1,来源 Intelligence Index 仍标为 v4.3。
两项 Elo 在模型加入 Intelligence Index 时冻结,作为当时的指数贡献;独立榜单的实时 Elo 后续可能变化。本站展示来源原值,不用当前实时 Elo 反算或改写 Intelligence Index。
已核实当前协议的 Elo 单独标注“裁判协议 v4.3.1”。此前未区分裁判协议的观测保留原值、原版本与原 observedAt,仅作历史参考,不与当前协议混排,也不将跨协议差额解释成模型能力涨跌。
本次方法核验时间为 2026-09-16T01:36:22.563Z。来源只注明“September 2026 to current”,没有精确生效日或逐模型重跑时间;核验日期不是方法发布日期。
查看 AA 方法与版本记录 ↗EVALUATION PRINCIPLES
四项评测原则
标准化相同条件、提示策略、温度和评分标准。
尽量无偏使用明确提示、稳健提取和允许有效表达差异的答案验证。
Zero-shot不给示例或演示,直接测试模型理解和执行指令的能力。
透明公开提示模板、评估标准、参数和已知限制。
生成设置
- 非推理模型温度 0;推理模型温度 0.6,模型实验室另有推荐时例外。
- 非推理模型最多输出 16,384 Token,模型限制更小时下调;推理模型使用创建者披露的最大输出上限。
- Agent 评测的主要沙箱提供方为 e2b;具体环境以各项评测协议为准,不假定所有任务共用同一系统镜像。
错误与计分
- API 失败最多自动重试 30 次;持续失败的问题人工复核。
- 多数评测使用 pass@1;有重复实验时,汇总全部重复结果。GDP.pdf 的 All-pass 与 AA-AnalystAgent 的 pass^5 等指标单独解释。
- Intelligence Index 任务成本优先使用 Provider 报告的 Token 数;缺失时来源使用统一 tokenizer 回退。它与 OpenRouter 精确型号的当前 API 单价分开记录。