模型日报 · 2026-09-18

模型日报 2026-09-18|Qwen3.8 Max 0902 新增 AA 独立评测,任务能力怎么看

Qwen3.8 Max 0902 首次收录 AA 独立结果,区分原 0803 配置并明确 API 未核验边界;同期收录 LingFin、任务评测扩容、四款精确报价变化及 GLM-5.3 官方权重事实。

TODAY'S TAKE

Qwen3.8 Max 0902:独立快照,先看任务结果与可比边界

Qwen3.8 Max 0902 首次进入本站的独立评测记录:AA Intelligence Index v4.3 为 45.44,同时有终端、自动化与文档任务分项。0902 的精确 API 对应尚未完成核验,本期价格与可用性保持未知。

“新增”指本期收录这份证据,不表示模型今天发布。0902 与原 0803 配置分别保存,不能因为同属 Qwen3.8 Max 就继承旧评测或价格。同期收录 Ling-3.0-flash-Fin,补充既有配置分项、四款精确 API 报价,以及 GLM-5.3 官方权重状态。

新配置有什么证据:从总指数转向具体任务

这份 Qwen3.8 Max 0902 benchmark 记录绑定明确快照。此前没有该精确配置的本站历史前值,因此下表只展示本次原始结果,不把 0803 当作它的上一观测,也不计算“升级幅度”。

Qwen3.8 Max 0902 的独立 AA 结果;截止 2026-09-18T01:47:49.578Z
原始指标本期结果指标 / 方法版本observedAt
Terminal-Bench v4.0 pass@138.89%AA 指标版本 4.3
AutomationBench-AA partial score56.19%AA 指标版本 4.3
GDP.pdf all-pass22.80%AA 指标版本 4.3
SciCode52.08%AA 指标版本 4.3
AA-LCR80.33%AA 指标版本 4.3
CritPt17.71%AA 指标版本 4.3
AA-Briefcase live Elo1609.69当前 pairwise judge 协议 4.3.1
GDPval-AA v2 live Elo1664.28当前 pairwise judge 协议 4.3.1

终端编码优先看 Terminal-Bench v4.0;跨工具工作流看 AutomationBench-AA;文件交付看 GDP.pdf、Briefcase 与 GDPval-AA。它们测量的事情不同:AutomationBench 的 partial score 是部分得分,不是完整任务成功率;GDP.pdf all-pass 要求一份交付通过全部要求;Elo 是各自评测中的相对尺度,不能读成百分比。

这些指标可以帮助安排试用优先级,不能直接代替业务验收。真正上线前仍应以自己的文件、工具权限、失败恢复和人工接管要求测试;API 提供相同型号,也不自动证明你选择的推理参数与 AA 的测量设置完全一致。

同期新收录:Ling-3.0-flash-Fin,不能借用 Ling Flash 的结论

Ling-3.0-flash-Fin 本期首次进入本站独立评测记录,AA Intelligence Index v4.3 为 23.02。它是单独的被测配置,不把 Ling Flash 的历史、成绩或 API 报价迁过来。名称中的 Fin 也不足以证明它在你的金融任务中更强,仍需看对应任务与业务样本。

LingFin 的首批独立 AA 分项;原始零值保留,未知不补零
指标本期结果指标 / 方法版本observedAt
Terminal-Bench v4.0 pass@10.00%AA 指标版本 4.3
AutomationBench-AA partial score7.39%AA 指标版本 4.3
GDP.pdf all-pass5.40%AA 指标版本 4.3
SciCode42.36%AA 指标版本 4.3
AA-LCR73.67%AA 指标版本 4.3
CritPt2.57%AA 指标版本 4.3
AA-Briefcase live Elo967.05当前 pairwise judge 协议 4.3.1
GDPval-AA v2 live Elo1170.55当前 pairwise judge 协议 4.3.1

终端任务的零分是这份原始观测的有效结果,不表示模型完全没有编码能力;同样,其他分项也不构成金融业务的合规或可靠性证明。LingFin 当前精确 API 未核验,价格与可用性保持未知。

AnalystAgent 新增两款配置:一次成功与连续可靠性分开看

AA-AnalystAgent:80 道题,每题 5 次独立运行;单位为 %
配置pass^5pass@1pass@5observedAt
Qwen3.8 Max (0902)45.0061.3076.30
Ling-3.0-flash-Fin16.3040.8067.50

pass^5 看多次运行都成功的可靠性,pass@1 与 pass@5 回答不同问题,不能挑最大的数字替代主指标。两款配置同时进入已有 Briefcase 与 GDPval-AA 结果集合;Openness 则补入 LingFin、Ling Flash VL 和 DeepSeek V4.1 Flash。它们是既有评测覆盖扩容,开放度也不等于任务能力。完整方法与来源分别见AnalystAgentOpenness

为什么 live Elo 写 4.3.1,而总指数仍是 4.3?

AA 版本史披露的 4.3.1 更新涉及 Briefcase 与 GDPval-AA v2 的成对比较裁判:Claude Opus 5、GPT-5.6 Sol、Gemini 3.8 Flash。rubric 评分面板没有随这次更新改变。来源将生效范围写为 2026 年 9 月至今,未给出具体生效日及每条模型结果的重评时间;本文不把它描述为今天刚发布的评测。

独立榜的 live Elo 与总指数采用的贡献有不同时间语义。按 AA 方法,模型加入指数时的 Briefcase/GDPval Elo 贡献会冻结,Intelligence Index 的公开 headline 仍为 v4.3。实时 Elo 变化不授权我们重新计算总指数,也不能将全部历史观测改挂为新裁判协议。

因此,下文的旧 Elo 保留为历史参考:当时没有记录 4.3.1 裁判标记,本期则明确标记当前协议。不能据两列之差宣称模型能力提升或下降。要做严格比较,应从BriefcaseGDPval-AA分项矩阵核对同任务、同配置、同版本结果。

同期更新:四个暂估指数转为正式结果

AA Intelligence Index v4.3;正式仅指来源未再标暂估
精确配置上一观测本期观测原始观测日期
Mistral Medium 3.19.89*(暂估)9.53(未标暂估)
North Mini Code12.84*(暂估)9.91(未标暂估)
GPT-5.6 Terra (Non-reasoning)22.30*(暂估)21.21(未标暂估)
GPT-5.6 Luna (Non-reasoning)16.76*(暂估)16.05(未标暂估)

Mistral Medium 3.1、North Mini Code、GPT-5.6 Terra/Luna Non-reasoning 当前不再标记暂估。相同指数版本不意味着前后证据完整度相同,数字修订不能直接解释成模型突然变弱;本期也没有证据把变化完全归因于某一个新增分项。

五个既有配置补齐八项任务结果

原先未知 → 本期披露;原始 fraction 只转换为百分比显示
配置指标本期结果observedAt
North Mini CodeGDP.pdf all-pass1.80%
Qwen3.8 27B (Non-reasoning)AutomationBench-AA partial score12.43%
GPT-5.6 Sol (Non-reasoning)GDP.pdf all-pass15.20%
GPT-5.6 Terra (Non-reasoning)GDP.pdf all-pass11.20%
GPT-5.6 Terra (Non-reasoning)Terminal-Bench v4.0 pass@10.51%
GPT-5.6 Luna (Non-reasoning)GDP.pdf all-pass6.00%
GPT-5.6 Luna (Non-reasoning)Terminal-Bench v4.0 pass@11.01%
GPT-5.6 Luna (Non-reasoning)AutomationBench-AA partial score4.97%

Non-reasoning 属于精确被测配置,不能挪给同名的其他推理档位。没有列出的字段不代表没有能力;历史中未披露的值保持未知,不按其他型号或评测推算。

其余任务修订:AA-LCR 与 SciCode

按明确的 AA v4.3 指标身份读取;未有同版前值时不借用旧版
配置 / 指标同版上一观测本期观测本期 observedAt
Mistral Medium 3.1
AA-LCR
未知42.67%
GPT-5.6 Luna (Non-reasoning)
SciCode
未知40.39%

这两项与指数、live Elo 分别记录,不将某个分项的修订归因为模型整体能力变化。完整旧记录仍可在历史页查阅。

二十九项 live Elo 更新:保留历史,不跨裁判协议计算升降

旧观测仅供参考;当前值使用 AA 4.3.1 pairwise judge 协议
配置 / 评测旧观测 · 协议标记不足当前 live Elo · 4.3.1原始日期
Mistral Medium 3.1
AA-Briefcase
538.27538.05
Mistral Medium 3.1
GDPval-AA v2
537.42536.15
North Mini Code
AA-Briefcase
230.21234.19
North Mini Code
GDPval-AA v2
489.70471.64
Qwen3.8 27B (Non-reasoning)
GDPval-AA v2
1136.811113.30
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
AA-Briefcase
1661.821646.09
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
GDPval-AA v2
1763.641723.58
GPT-5.6 Luna (max)
AA-Briefcase
1339.381332.90
GPT-5.6 Luna (max)
GDPval-AA v2
1489.331455.60
GPT-5.6 Luna (medium)
AA-Briefcase
933.74934.87
GPT-5.6 Luna (medium)
GDPval-AA v2
1172.831164.13
Gemma 4 26B A4B (Reasoning)
GDPval-AA v2
713.04693.00
GPT-5.6 Sol (medium)
AA-Briefcase
1240.361236.71
GPT-5.6 Sol (medium)
GDPval-AA v2
1456.101426.50
GPT-5.6 Sol (Non-reasoning)
AA-Briefcase
1014.191015.25
GPT-5.6 Sol (Non-reasoning)
GDPval-AA v2
1274.761273.32
GPT-5.6 Terra (Non-reasoning)
AA-Briefcase
948.02947.67
GPT-5.6 Terra (Non-reasoning)
GDPval-AA v2
1147.151145.71
Claude Opus 5 (Adaptive Reasoning, Max Effort)
AA-Briefcase
1644.901633.44
GLM-5.3
AA-Briefcase
1511.241504.38
GLM-5.3
GDPval-AA v2
1655.161633.80
GPT-5.6 Sol (max)
AA-Briefcase
1475.001463.44
GPT-5.6 Sol (max)
GDPval-AA v2
1624.111586.78
GPT-5.6 Luna (Non-reasoning)
AA-Briefcase
704.43710.24
GPT-5.6 Luna (Non-reasoning)
GDPval-AA v2
1007.01987.47
Kimi K3 (max)
AA-Briefcase
1488.031488.10
Kimi K3 (max)
GDPval-AA v2
1551.961547.63
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
AA-Briefcase
1256.721253.08
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
GDPval-AA v2
1456.091441.89

本表只列原始数值确有变化的配置,不把同值重新标记协议算成能力变化,也不将微小 Elo 差异解读为稳定优劣。独立榜上的置信区间与具体任务定义仍需一起阅读。

价格与 API:四款精确型号报价更新,0902 仍待核验

每条报价来自 OpenRouter 当前同一个活跃付费端点,单位为美元 / 百万 Token。按最低正输入价选择完整端点报价,输入价相同再比较输出价;输出和缓存字段不跨 provider 拼接。网页上的日期后缀是来源链接的一部分,实际调用身份以表中精确 API ID 为准。

OpenRouter 精确报价;历史参考 → 本期
精确型号 / API ID本期 provider输入输出缓存读取缓存写入报价 observedAt
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
deepseek/deepseek-v4-pro-0813
Sail Research
fp4
$0.96 → $0.7$2.88 → $2.96$0.088 → $0.033未知 → 未知
Qwen3.6 27B (Reasoning)
qwen/qwen3.6-27b
Chutes
fp8
$0.3 → $0.3$3.2 → $2未知 → $0.03未知 → 未知
GLM-5.3
z-ai/glm-5.3
Reka
fp8
$0.936 → $0.8775$3.168 → $2.97$0.1872 → $0.1755未知 → 未知
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
deepseek/deepseek-v4-flash-0731
StreamLake
fp8
$0.04 → $0.0572$0.1 → $0.1716$0.01 → $0.00182未知 → 未知

Qwen3.8 Max 0902 的 API 对应仍待核验;本期不提供其当前报价,也不与原 0803 比成“同价升级”。未日期化 qwen/qwen3.8-max 的当前响应不能证明原配置仍可调用,因此原模型当前 API 保持未知,旧报价留在其历史页。

Qwen3.6 27B 本期输出价变化,输入价沿用原始观测时间,缓存读取有本次明确报价;这条报价来自 Chutes。GLM-5.3、DeepSeek Pro 0813 与 Flash 0731 的输入、输出和缓存读取报价也有变化。前期没有保存 provider 的报价只能作快照对照,不应统称同 provider 涨价或降价。

表内缓存读取与缓存写入分别核对;未报价保持未知,不拼接另一 provider 或网页摘要的字段。报价不是你的最终账单;实际成本还取决于输出、缓存命中、推理消耗与重试。AA 的单任务测量成本也不能充当 OpenRouter Token 单价。

GLM-5.3 同期补充:已开放权重,许可需单独阅读

截至 Z.ai 官方模型仓库可核验完整 GLM-5.3 权重,本站状态更新为“已开放权重”。官方仓库已有八月提交;这是本期状态补充,不宣称今天才释权,也不改变原模型发布日期。

权重适用 GLM-5.3 License。它是自定义许可,不等于 MIT、Apache 或无条件商用。计划自部署或提供模型服务时,应阅读完整许可与适用条件;权重可下载也不证明任意硬件都能有效部署。旧厂商成绩仍标为“官方披露 · 未独立复核”,不与本期 AA 独立结果混为一种证据。

选型结论与观察边界

  • 选 Qwen3.8 Max 时先锁定 0902 或原 0803,再比较具体任务;避免用同系列名称把独立快照混成一条历史。
  • AA 指数与分项截止 ,AnalystAgent 使用其表中独立观察时间;此前历史截止 2026-09-15T23:59:59Z。API 各报价使用表中自己的观察时间,未变字段保留原日期。
  • 当前 live Elo 的方法标记为 4.3.1;总指数仍读取 AA 的 v4.3 原值,不使用实时 Elo 自行重算,也不将版本标记补充误写成今天发布的新评测。
  • 当前报价与来源未说明的配置、上下文或发布日期保持各自边界。没有确切数据时,不能通过搜索摘要、近似名称或旧观测填补。

可从0902 历史核对原始观测,在模型比较选择任务维度,并用API 经济性数据及来源页核对成本。本文数值固定于本期观察时间,后续变化不回写本期结论。