模型日报 · 2026-09-13

模型日报 2026-09-13|GLM-5.2 完成指数评测,如何理解暂估修订

GLM-5.2 与 K2 Horizon 的 AA v4.3 指数从暂估转为正式结果,补齐 Terminal-Bench v4.0;对照同版本历史解释修订,并核对 DeepSeek V4 Flash 0731 的精确 OpenRouter 报价变化。

TODAY'S TAKE

GLM-5.2 指数转为正式结果:先看评测状态,再解释差值

GLM-5.2 (max) 的 AA Intelligence Index v4.3 从 38.64* 修订为 34.01,来源不再标记暂估,并补齐此前未知的 Terminal-Bench v4.0 分项。这是评测证据的更新;仅凭这两个数字,不能得出模型本身能力退化的结论。

本期没有新增模型或 Benchmark。同期包括 K2 Horizon 的暂估转正式、既有模型的 Briefcase / GDPval-AA 结果修订,以及 DeepSeek V4 Flash 0731 的精确 API 报价变化。

暂估与正式结果:同一版本,也要保留状态差异

搜索 GLM-5.2 benchmark 或查看指数历史时,星号与数字应一起阅读。本文的“正式”仅表示 AA 当前结果未标记暂估,不表示所有业务场景已经验证,也不表示厂商今天发布了新版本。

AA Intelligence Index v4.3;上一期截止 2026-09-12T01:04:56.591Z → 本期截止 2026-09-13T01:03:54.135Z
精确模型配置上一观测本期观测原始观测时间
GLM-5.2 (max)38.64*(暂估)34.01(未标暂估)
K2 Horizon 375B A23B30.70*(暂估)30.79(未标暂估)

表内均为相同 variant 与 v4.3 的来源原值,仅在显示时保留两位小数。GLM-5.2 固定为 max 配置;旧暂估仍保留在历史页。该修订足以更新选型参照,但缺少同一完整协议下的前后重复实验,不能将指数差值直接解释为能力下降幅度。

新补齐的分项:Terminal-Bench v4.0

AA v4.3 组件中的 Terminal-Bench v4.0 pass@1;未知不等于零分
精确模型配置上一期本期本期 observedAt
GLM-5.2 (max)未知1.01%
K2 Horizon 375B A23B未知1.52%

这一项观察模型在来源规定的终端任务与执行配置下的通过表现。它让此前缺失的能力切面变得可见;不应把未知补齐描述为从零分提升,也不能把 v4.0 与旧 Terminal-Bench v2.1 直接拼接成趋势。本文没有证据把指数修订的全部原因归给这一分项。

同期评测修订:Briefcase 与 GDPval-AA

以下 6 个既有配置在两项评测中出现来源 Elo 修订;本站独立评测页同步呈现对应结果。它们属于现有结果更新,不是榜单扩容或新 Benchmark。

AA v4.3 原始 Elo,上一期截止观测 → 本期截止观测;保留两位小数
精确模型配置AA-BriefcaseGDPval-AA v2
GLM-5.2 (max)1233.94 → 1231.381417.62 → 1406.07
K2 Horizon 375B A23B1299.25 → 1298.341404.28 → 1400.00
GLM-5.31512.51 → 1511.641667.27 → 1661.42
GLM-5.3-Flash1454.58 → 1448.991669.27 → 1655.48
Kimi K3 (max)1494.85 → 1492.581572.42 → 1569.47
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)1259.31 → 1256.721467.78 → 1456.09

Elo 是各评测内部的相对表现尺度,不是百分比。小幅修订本身不能证明稳定的能力差异,选择模型还应结合各榜单的方法与置信区间。Openness 表中的 GLM-5.2 Intelligence 辅助列随本次指数更新;这不代表其开放性分数发生变化。

价格与 API:DeepSeek V4 Flash 0731 的精确报价更新

当前报价取 OpenRouter 活跃付费端点中最低正输入价的一个端点,输出价用于输入同价时排序。所有当前字段来自同一 provider,单位为美元/百万 Token。下面比较的是报价快照;旧快照未记录 provider,不能据此宣称同一家 provider 降价。

OpenRouter 历史参考 → 本期精确报价(USD / 1M tokens)
精确 model ID当前 provider / 量化输入输出缓存读取缓存写入报价 observedAt
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
deepseek/deepseek-v4-flash-0731
OpenInference
fp8
$0.05 → $0.03$0.16 → $0.07$0.013 → $0.003未知 → 未知

缓存写入价格未披露,保持未知。该报价属于 deepseek/deepseek-v4-flash-0731,不能挪给 DeepSeek V4.1 Flash、其他日期版本或独立免费变体。API 报价也不是 AA 的单任务成本,调用时仍需核对路由、推理设置与实际账单。

主题模型 GLM-5.2:本期没有确认价格变化

z-ai/glm-5.2 本期端点复核未发现上述报价字段变化,因此保留上一条已记录观测的日期。以下为带原日期的报价参考,不能据此推断端点速度或复现 AA 的 max 评测配置。

  • 输入:$0.4802 / 百万 Token;OpenRouter observedAt
  • 输出:$1.5092 / 百万 Token;OpenRouter observedAt
  • 缓存读取:$0.08918 / 百万 Token;OpenRouter observedAt
  • 缓存写入:未知 / 百万 Token

对选型的影响:重看候选依据,保留业务验证

此前如果依据 GLM-5.2 暂估指数筛选模型,应改用本期正式结果,并继续查看具体任务分项。终端自动化项目优先核对 Terminal-Bench 的运行条件,再用自己的工具权限、任务集与失败恢复机制验证;不能用总指数替代端到端验收。

需要文档或工作任务能力时,可沿 BriefcaseGDPval-AA 查看原始方法。成本敏感的调用则按准确的 model ID、provider 和输入/输出/缓存结构核算;报价下调只改变成本输入,不自动改善可靠性或延迟。

未知项、可比边界与观察时间

  • AA 结果截止 ,历史对照截止 ;各原观测日期保留,未变化值不刷新日期。
  • 暂估转正式与厂商模型发布是不同事件。本期不补造模型发布日期、参数、上下文或未知 API 配置。
  • 没有将来源暂缺的旧配置清除,也不把本期缺行当作模型撤回或性能变化;旧观测仍供历史核对。
  • API 报价来自 OpenRouter,评测来自 Artificial Analysis;官方规格披露不能替代独立评测,二者不合成本站总分。
  • 本文按确切 benchmark、版本及截止时间读取历史,后续结果更新不会改写本期数字。