新配置有什么证据:从总指数转向具体任务
这份 Qwen3.8 Max 0902 benchmark 记录绑定明确快照。此前没有该精确配置的本站历史前值,因此下表只展示本次原始结果,不把 0803 当作它的上一观测,也不计算“升级幅度”。
| 原始指标 | 本期结果 | 指标 / 方法版本 | observedAt |
|---|---|---|---|
| Terminal-Bench v4.0 pass@1 | 38.89% | AA 指标版本 4.3 | |
| AutomationBench-AA partial score | 56.19% | AA 指标版本 4.3 | |
| GDP.pdf all-pass | 22.80% | AA 指标版本 4.3 | |
| SciCode | 52.08% | AA 指标版本 4.3 | |
| AA-LCR | 80.33% | AA 指标版本 4.3 | |
| CritPt | 17.71% | AA 指标版本 4.3 | |
| AA-Briefcase live Elo | 1609.69 | 当前 pairwise judge 协议 4.3.1 | |
| GDPval-AA v2 live Elo | 1664.28 | 当前 pairwise judge 协议 4.3.1 |
终端编码优先看 Terminal-Bench v4.0;跨工具工作流看 AutomationBench-AA;文件交付看 GDP.pdf、Briefcase 与 GDPval-AA。它们测量的事情不同:AutomationBench 的 partial score 是部分得分,不是完整任务成功率;GDP.pdf all-pass 要求一份交付通过全部要求;Elo 是各自评测中的相对尺度,不能读成百分比。
这些指标可以帮助安排试用优先级,不能直接代替业务验收。真正上线前仍应以自己的文件、工具权限、失败恢复和人工接管要求测试;API 提供相同型号,也不自动证明你选择的推理参数与 AA 的测量设置完全一致。
同期新收录:Ling-3.0-flash-Fin,不能借用 Ling Flash 的结论
Ling-3.0-flash-Fin 本期首次进入本站独立评测记录,AA Intelligence Index v4.3 为 23.02。它是单独的被测配置,不把 Ling Flash 的历史、成绩或 API 报价迁过来。名称中的 Fin 也不足以证明它在你的金融任务中更强,仍需看对应任务与业务样本。
| 指标 | 本期结果 | 指标 / 方法版本 | observedAt |
|---|---|---|---|
| Terminal-Bench v4.0 pass@1 | 0.00% | AA 指标版本 4.3 | |
| AutomationBench-AA partial score | 7.39% | AA 指标版本 4.3 | |
| GDP.pdf all-pass | 5.40% | AA 指标版本 4.3 | |
| SciCode | 42.36% | AA 指标版本 4.3 | |
| AA-LCR | 73.67% | AA 指标版本 4.3 | |
| CritPt | 2.57% | AA 指标版本 4.3 | |
| AA-Briefcase live Elo | 967.05 | 当前 pairwise judge 协议 4.3.1 | |
| GDPval-AA v2 live Elo | 1170.55 | 当前 pairwise judge 协议 4.3.1 |
终端任务的零分是这份原始观测的有效结果,不表示模型完全没有编码能力;同样,其他分项也不构成金融业务的合规或可靠性证明。LingFin 当前精确 API 未核验,价格与可用性保持未知。
AnalystAgent 新增两款配置:一次成功与连续可靠性分开看
| 配置 | pass^5 | pass@1 | pass@5 | observedAt |
|---|---|---|---|---|
| Qwen3.8 Max (0902) | 45.00 | 61.30 | 76.30 | |
| Ling-3.0-flash-Fin | 16.30 | 40.80 | 67.50 |
pass^5 看多次运行都成功的可靠性,pass@1 与 pass@5 回答不同问题,不能挑最大的数字替代主指标。两款配置同时进入已有 Briefcase 与 GDPval-AA 结果集合;Openness 则补入 LingFin、Ling Flash VL 和 DeepSeek V4.1 Flash。它们是既有评测覆盖扩容,开放度也不等于任务能力。完整方法与来源分别见AnalystAgent和Openness。
为什么 live Elo 写 4.3.1,而总指数仍是 4.3?
AA 版本史披露的 4.3.1 更新涉及 Briefcase 与 GDPval-AA v2 的成对比较裁判:Claude Opus 5、GPT-5.6 Sol、Gemini 3.8 Flash。rubric 评分面板没有随这次更新改变。来源将生效范围写为 2026 年 9 月至今,未给出具体生效日及每条模型结果的重评时间;本文不把它描述为今天刚发布的评测。
独立榜的 live Elo 与总指数采用的贡献有不同时间语义。按 AA 方法,模型加入指数时的 Briefcase/GDPval Elo 贡献会冻结,Intelligence Index 的公开 headline 仍为 v4.3。实时 Elo 变化不授权我们重新计算总指数,也不能将全部历史观测改挂为新裁判协议。
因此,下文的旧 Elo 保留为历史参考:当时没有记录 4.3.1 裁判标记,本期则明确标记当前协议。不能据两列之差宣称模型能力提升或下降。要做严格比较,应从Briefcase、GDPval-AA与分项矩阵核对同任务、同配置、同版本结果。
同期更新:四个暂估指数转为正式结果
| 精确配置 | 上一观测 | 本期观测 | 原始观测日期 |
|---|---|---|---|
| Mistral Medium 3.1 | 9.89*(暂估) | 9.53(未标暂估) | → |
| North Mini Code | 12.84*(暂估) | 9.91(未标暂估) | → |
| GPT-5.6 Terra (Non-reasoning) | 22.30*(暂估) | 21.21(未标暂估) | → |
| GPT-5.6 Luna (Non-reasoning) | 16.76*(暂估) | 16.05(未标暂估) | → |
Mistral Medium 3.1、North Mini Code、GPT-5.6 Terra/Luna Non-reasoning 当前不再标记暂估。相同指数版本不意味着前后证据完整度相同,数字修订不能直接解释成模型突然变弱;本期也没有证据把变化完全归因于某一个新增分项。
五个既有配置补齐八项任务结果
| 配置 | 指标 | 本期结果 | observedAt |
|---|---|---|---|
| North Mini Code | GDP.pdf all-pass | 1.80% | |
| Qwen3.8 27B (Non-reasoning) | AutomationBench-AA partial score | 12.43% | |
| GPT-5.6 Sol (Non-reasoning) | GDP.pdf all-pass | 15.20% | |
| GPT-5.6 Terra (Non-reasoning) | GDP.pdf all-pass | 11.20% | |
| GPT-5.6 Terra (Non-reasoning) | Terminal-Bench v4.0 pass@1 | 0.51% | |
| GPT-5.6 Luna (Non-reasoning) | GDP.pdf all-pass | 6.00% | |
| GPT-5.6 Luna (Non-reasoning) | Terminal-Bench v4.0 pass@1 | 1.01% | |
| GPT-5.6 Luna (Non-reasoning) | AutomationBench-AA partial score | 4.97% |
Non-reasoning 属于精确被测配置,不能挪给同名的其他推理档位。没有列出的字段不代表没有能力;历史中未披露的值保持未知,不按其他型号或评测推算。
其余任务修订:AA-LCR 与 SciCode
| 配置 / 指标 | 同版上一观测 | 本期观测 | 本期 observedAt |
|---|---|---|---|
| Mistral Medium 3.1 AA-LCR | 未知 | 42.67% | |
| GPT-5.6 Luna (Non-reasoning) SciCode | 未知 | 40.39% |
这两项与指数、live Elo 分别记录,不将某个分项的修订归因为模型整体能力变化。完整旧记录仍可在历史页查阅。
二十九项 live Elo 更新:保留历史,不跨裁判协议计算升降
| 配置 / 评测 | 旧观测 · 协议标记不足 | 当前 live Elo · 4.3.1 | 原始日期 |
|---|---|---|---|
| Mistral Medium 3.1 AA-Briefcase | 538.27 | 538.05 | → |
| Mistral Medium 3.1 GDPval-AA v2 | 537.42 | 536.15 | → |
| North Mini Code AA-Briefcase | 230.21 | 234.19 | → |
| North Mini Code GDPval-AA v2 | 489.70 | 471.64 | → |
| Qwen3.8 27B (Non-reasoning) GDPval-AA v2 | 1136.81 | 1113.30 | → |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) AA-Briefcase | 1661.82 | 1646.09 | → |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) GDPval-AA v2 | 1763.64 | 1723.58 | → |
| GPT-5.6 Luna (max) AA-Briefcase | 1339.38 | 1332.90 | → |
| GPT-5.6 Luna (max) GDPval-AA v2 | 1489.33 | 1455.60 | → |
| GPT-5.6 Luna (medium) AA-Briefcase | 933.74 | 934.87 | → |
| GPT-5.6 Luna (medium) GDPval-AA v2 | 1172.83 | 1164.13 | → |
| Gemma 4 26B A4B (Reasoning) GDPval-AA v2 | 713.04 | 693.00 | → |
| GPT-5.6 Sol (medium) AA-Briefcase | 1240.36 | 1236.71 | → |
| GPT-5.6 Sol (medium) GDPval-AA v2 | 1456.10 | 1426.50 | → |
| GPT-5.6 Sol (Non-reasoning) AA-Briefcase | 1014.19 | 1015.25 | → |
| GPT-5.6 Sol (Non-reasoning) GDPval-AA v2 | 1274.76 | 1273.32 | → |
| GPT-5.6 Terra (Non-reasoning) AA-Briefcase | 948.02 | 947.67 | → |
| GPT-5.6 Terra (Non-reasoning) GDPval-AA v2 | 1147.15 | 1145.71 | → |
| Claude Opus 5 (Adaptive Reasoning, Max Effort) AA-Briefcase | 1644.90 | 1633.44 | → |
| GLM-5.3 AA-Briefcase | 1511.24 | 1504.38 | → |
| GLM-5.3 GDPval-AA v2 | 1655.16 | 1633.80 | → |
| GPT-5.6 Sol (max) AA-Briefcase | 1475.00 | 1463.44 | → |
| GPT-5.6 Sol (max) GDPval-AA v2 | 1624.11 | 1586.78 | → |
| GPT-5.6 Luna (Non-reasoning) AA-Briefcase | 704.43 | 710.24 | → |
| GPT-5.6 Luna (Non-reasoning) GDPval-AA v2 | 1007.01 | 987.47 | → |
| Kimi K3 (max) AA-Briefcase | 1488.03 | 1488.10 | → |
| Kimi K3 (max) GDPval-AA v2 | 1551.96 | 1547.63 | → |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) AA-Briefcase | 1256.72 | 1253.08 | → |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) GDPval-AA v2 | 1456.09 | 1441.89 | → |
本表只列原始数值确有变化的配置,不把同值重新标记协议算成能力变化,也不将微小 Elo 差异解读为稳定优劣。独立榜上的置信区间与具体任务定义仍需一起阅读。
价格与 API:四款精确型号报价更新,0902 仍待核验
每条报价来自 OpenRouter 当前同一个活跃付费端点,单位为美元 / 百万 Token。按最低正输入价选择完整端点报价,输入价相同再比较输出价;输出和缓存字段不跨 provider 拼接。网页上的日期后缀是来源链接的一部分,实际调用身份以表中精确 API ID 为准。
| 精确型号 / API ID | 本期 provider | 输入 | 输出 | 缓存读取 | 缓存写入 | 报价 observedAt |
|---|---|---|---|---|---|---|
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)deepseek/deepseek-v4-pro-0813 | Sail Research fp4 | $0.96 → $0.7 | $2.88 → $2.96 | $0.088 → $0.033 | 未知 → 未知 | → |
Qwen3.6 27B (Reasoning)qwen/qwen3.6-27b | Chutes fp8 | $0.3 → $0.3 | $3.2 → $2 | 未知 → $0.03 | 未知 → 未知 | → |
GLM-5.3z-ai/glm-5.3 | Reka fp8 | $0.936 → $0.8775 | $3.168 → $2.97 | $0.1872 → $0.1755 | 未知 → 未知 | → |
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)deepseek/deepseek-v4-flash-0731 | StreamLake fp8 | $0.04 → $0.0572 | $0.1 → $0.1716 | $0.01 → $0.00182 | 未知 → 未知 | → |
Qwen3.8 Max 0902 的 API 对应仍待核验;本期不提供其当前报价,也不与原 0803 比成“同价升级”。未日期化 qwen/qwen3.8-max 的当前响应不能证明原配置仍可调用,因此原模型当前 API 保持未知,旧报价留在其历史页。
Qwen3.6 27B 本期输出价变化,输入价沿用原始观测时间,缓存读取有本次明确报价;这条报价来自 Chutes。GLM-5.3、DeepSeek Pro 0813 与 Flash 0731 的输入、输出和缓存读取报价也有变化。前期没有保存 provider 的报价只能作快照对照,不应统称同 provider 涨价或降价。
表内缓存读取与缓存写入分别核对;未报价保持未知,不拼接另一 provider 或网页摘要的字段。报价不是你的最终账单;实际成本还取决于输出、缓存命中、推理消耗与重试。AA 的单任务测量成本也不能充当 OpenRouter Token 单价。
GLM-5.3 同期补充:已开放权重,许可需单独阅读
截至 ,Z.ai 官方模型仓库可核验完整 GLM-5.3 权重,本站状态更新为“已开放权重”。官方仓库已有八月提交;这是本期状态补充,不宣称今天才释权,也不改变原模型发布日期。
权重适用 GLM-5.3 License。它是自定义许可,不等于 MIT、Apache 或无条件商用。计划自部署或提供模型服务时,应阅读完整许可与适用条件;权重可下载也不证明任意硬件都能有效部署。旧厂商成绩仍标为“官方披露 · 未独立复核”,不与本期 AA 独立结果混为一种证据。
选型结论与观察边界
- 选 Qwen3.8 Max 时先锁定 0902 或原 0803,再比较具体任务;避免用同系列名称把独立快照混成一条历史。
- AA 指数与分项截止 ,AnalystAgent 使用其表中独立观察时间;此前历史截止 2026-09-15T23:59:59Z。API 各报价使用表中自己的观察时间,未变字段保留原日期。
- 当前 live Elo 的方法标记为 4.3.1;总指数仍读取 AA 的 v4.3 原值,不使用实时 Elo 自行重算,也不将版本标记补充误写成今天发布的新评测。
- 当前报价与来源未说明的配置、上下文或发布日期保持各自边界。没有确切数据时,不能通过搜索摘要、近似名称或旧观测填补。
可从0902 历史核对原始观测,在模型比较选择任务维度,并用API 经济性与数据及来源页核对成本。本文数值固定于本期观察时间,后续变化不回写本期结论。