暂估与正式结果:同一版本,也要保留状态差异
搜索 GLM-5.2 benchmark 或查看指数历史时,星号与数字应一起阅读。本文的“正式”仅表示 AA 当前结果未标记暂估,不表示所有业务场景已经验证,也不表示厂商今天发布了新版本。
| 精确模型配置 | 上一观测 | 本期观测 | 原始观测时间 |
|---|---|---|---|
| GLM-5.2 (max) | 38.64*(暂估) | 34.01(未标暂估) | → |
| K2 Horizon 375B A23B | 30.70*(暂估) | 30.79(未标暂估) | → |
表内均为相同 variant 与 v4.3 的来源原值,仅在显示时保留两位小数。GLM-5.2 固定为 max 配置;旧暂估仍保留在历史页。该修订足以更新选型参照,但缺少同一完整协议下的前后重复实验,不能将指数差值直接解释为能力下降幅度。
新补齐的分项:Terminal-Bench v4.0
| 精确模型配置 | 上一期 | 本期 | 本期 observedAt |
|---|---|---|---|
| GLM-5.2 (max) | 未知 | 1.01% | |
| K2 Horizon 375B A23B | 未知 | 1.52% |
这一项观察模型在来源规定的终端任务与执行配置下的通过表现。它让此前缺失的能力切面变得可见;不应把未知补齐描述为从零分提升,也不能把 v4.0 与旧 Terminal-Bench v2.1 直接拼接成趋势。本文没有证据把指数修订的全部原因归给这一分项。
同期评测修订:Briefcase 与 GDPval-AA
以下 6 个既有配置在两项评测中出现来源 Elo 修订;本站独立评测页同步呈现对应结果。它们属于现有结果更新,不是榜单扩容或新 Benchmark。
| 精确模型配置 | AA-Briefcase | GDPval-AA v2 |
|---|---|---|
| GLM-5.2 (max) | 1233.94 → 1231.38 | 1417.62 → 1406.07 |
| K2 Horizon 375B A23B | 1299.25 → 1298.34 | 1404.28 → 1400.00 |
| GLM-5.3 | 1512.51 → 1511.64 | 1667.27 → 1661.42 |
| GLM-5.3-Flash | 1454.58 → 1448.99 | 1669.27 → 1655.48 |
| Kimi K3 (max) | 1494.85 → 1492.58 | 1572.42 → 1569.47 |
| DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | 1259.31 → 1256.72 | 1467.78 → 1456.09 |
Elo 是各评测内部的相对表现尺度,不是百分比。小幅修订本身不能证明稳定的能力差异,选择模型还应结合各榜单的方法与置信区间。Openness 表中的 GLM-5.2 Intelligence 辅助列随本次指数更新;这不代表其开放性分数发生变化。
价格与 API:DeepSeek V4 Flash 0731 的精确报价更新
当前报价取 OpenRouter 活跃付费端点中最低正输入价的一个端点,输出价用于输入同价时排序。所有当前字段来自同一 provider,单位为美元/百万 Token。下面比较的是报价快照;旧快照未记录 provider,不能据此宣称同一家 provider 降价。
| 精确 model ID | 当前 provider / 量化 | 输入 | 输出 | 缓存读取 | 缓存写入 | 报价 observedAt |
|---|---|---|---|---|---|---|
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)deepseek/deepseek-v4-flash-0731 | OpenInference fp8 | $0.05 → $0.03 | $0.16 → $0.07 | $0.013 → $0.003 | 未知 → 未知 | → |
缓存写入价格未披露,保持未知。该报价属于 deepseek/deepseek-v4-flash-0731,不能挪给 DeepSeek V4.1 Flash、其他日期版本或独立免费变体。API 报价也不是 AA 的单任务成本,调用时仍需核对路由、推理设置与实际账单。
主题模型 GLM-5.2:本期没有确认价格变化
z-ai/glm-5.2 本期端点复核未发现上述报价字段变化,因此保留上一条已记录观测的日期。以下为带原日期的报价参考,不能据此推断端点速度或复现 AA 的 max 评测配置。
- 输入:$0.4802 / 百万 Token;OpenRouter observedAt
- 输出:$1.5092 / 百万 Token;OpenRouter observedAt
- 缓存读取:$0.08918 / 百万 Token;OpenRouter observedAt
- 缓存写入:未知 / 百万 Token
对选型的影响:重看候选依据,保留业务验证
此前如果依据 GLM-5.2 暂估指数筛选模型,应改用本期正式结果,并继续查看具体任务分项。终端自动化项目优先核对 Terminal-Bench 的运行条件,再用自己的工具权限、任务集与失败恢复机制验证;不能用总指数替代端到端验收。
需要文档或工作任务能力时,可沿 Briefcase 与 GDPval-AA 查看原始方法。成本敏感的调用则按准确的 model ID、provider 和输入/输出/缓存结构核算;报价下调只改变成本输入,不自动改善可靠性或延迟。
未知项、可比边界与观察时间
- AA 结果截止 ,历史对照截止 ;各原观测日期保留,未变化值不刷新日期。
- 暂估转正式与厂商模型发布是不同事件。本期不补造模型发布日期、参数、上下文或未知 API 配置。
- 没有将来源暂缺的旧配置清除,也不把本期缺行当作模型撤回或性能变化;旧观测仍供历史核对。
- API 报价来自 OpenRouter,评测来自 Artificial Analysis;官方规格披露不能替代独立评测,二者不合成本站总分。
- 本文按确切 benchmark、版本及截止时间读取历史,后续结果更新不会改写本期数字。