新模型:同一来源、同一版本,任务分项仍有明显差异
| 精确配置 | AA Intelligence Index v4.3 | Briefcase Elo | GDPval-AA v2 Elo | Terminal-Bench v4.0 pass@1 | Omniscience |
|---|---|---|---|---|---|
| K2 Horizon 7B | 21.05 | 1020.86 | 1091.08 | 1.01% | -16.57 |
| K2 Horizon 3.7B | 16.16 | 792.80 | 962.39 | 0.00% | -28.62 |
| K2 Horizon MoVA 36B A4B | 25.67 | 1170.41 | 1243.11 | 0.00% | -10.95 |
| K2 Horizon 0.9B | 3.05 | 0.00 | -173.76 | 0.00% | -72.82 |
AA Intelligence Index 是来源发布的指数,本站不另行合成总分。Briefcase 与 GDPval-AA 的 Elo、终端任务的通过率以及 Omniscience 的知识表现是不同切面,不能把各列相加,也不能把 Elo 当作百分比。模型名称里的尺寸与 MoVA 配置保持来源原名,不据名称推断硬件需求。
这些配置在上一期截止 的本站同版历史中没有观测。因此本期没有可报告的“较昨日提升”:缺少旧值就保持未知,不以零作为虚构的起点。
零分与负分该怎么读?
表中的零与负值都是已确认的来源原值,不能当作漏采而抹去。Terminal-Bench 的零通过率表示该配置在来源这次任务评测中没有通过;它不证明所有终端工作都无法完成,也不等于没有执行评测。Briefcase 的零 Elo 是另一种指标,不能解释为百分之零通过率。
GDPval-AA 的负 Elo 属于该榜内部的相对尺度;Omniscience 负值也必须在其知识回答与幻觉方法下理解。两者都不能外推为“模型整体能力是负数”。相反,这些结果提示:需要可靠执行、长流程完成或事实问答时,应先检查对应分项,再用自己的任务与失败恢复机制验证,不能只依据模型尺寸或总指数选型。
新评测覆盖:现有榜单扩容,未新增 Benchmark 版本
同一 AA v4.3 与 Omniscience 当前有效集合由 521 扩至 525 个配置;本站保留历史的结果集合由 522 扩至 526。新增四个精确配置,来源暂缺的旧配置继续保留历史,不算本期新增或撤榜。没有新增 Benchmark 或指数版本。
Briefcase 与 GDPval-AA v2 独立榜各新增四个 K2 Horizon 配置。Briefcase 当前来源 166 行、本站保留 167 行;GDPval-AA 当前来源 245 行、本站保留 246 行。新增结果沿用各榜现有方法;Openness 与 AA-AnalystAgent 本期没有结果变化。
独立榜按其展示精度发布 Elo,本文主表读取 v4.3 组件中的原始小数,两者精度口径不同。可沿 能力分项矩阵、Omniscience、Briefcase 与 GDPval-AA 查看各自方法;当前结果集合与保留历史集合的行数分开计算。
同期更新:既有配置的 Elo 修订
本期另外核实了 6 项既有 Elo 数值变化。以下对照固定为相同配置、相同 AA v4.3 指标;未变化的分项不在此表重复列出,也不刷新其原始观察日期。
| 配置 | 评测 | 上一观测 | 本期观测 | 原始观察时间 |
|---|---|---|---|---|
| GLM-5.3-Flash | AA-Briefcase | 1448.99 | 1448.95 | → |
| GLM-5.3-Flash | GDPval-AA v2 | 1655.48 | 1654.95 | → |
| Solar Pro 4 | GDPval-AA v2 | 1194.75 | 1183.90 | → |
| GLM-5.3 | AA-Briefcase | 1511.64 | 1511.37 | → |
| Kimi K3 (max) | AA-Briefcase | 1492.58 | 1491.84 | → |
| Kimi K3 (max) | GDPval-AA v2 | 1569.47 | 1565.65 | → |
这些是来源结果修订。Elo 的微小差值本身不足以证明稳定的能力变化,判断优劣仍需看对应榜单的置信区间、方法与任务覆盖。
价格与 API:K2 Horizon 未核实,已有型号按精确报价更新
本期新增的 4 个 K2 Horizon 配置没有已核实的一一对应 OpenRouter 当前 API。它们的当前价格、可用性与可复现评测设置均保持未知。这里不以相似名称映射,不借其他 K2 配置的价格,也不把 AA 的零美元占位或单任务成本写成当前调用价格。
以下 6 个既有型号有确认的报价快照变化,单位为美元/百万 Token。当前每行选择一个活跃付费端点:按最低正输入价选择,输入同价时比较输出价;该行所有价格都来自同一 provider,未披露字段不从其他端点或旧快照补齐。
| 精确 model ID | 当前 provider / 量化 | 输入 | 输出 | 缓存读取 | 缓存写入 | 报价 observedAt |
|---|---|---|---|---|---|---|
Nemotron 3.5 Lightningnvidia/nemotron-3.5-lightning | Darkbloom int4 | $0.08 → $0.065 | $0.2 → $0.18 | $0.04 → 未知 | 未知 → 未知 | → |
Inkling Smallthinkingmachines/inkling-small | BaseTen fp8 | $0.45 → $0.5 | $1.2 → $1.2 | $0.1 → $0.1 | 未知 → 未知 | → |
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)deepseek/deepseek-v4-pro-0813 | Ionstream 量化未知 | $0.57816 → $0.88 | $1.73448 → $2.64 | $0.018396 → $0.088 | 未知 → 未知 | → |
GLM-5.3z-ai/glm-5.3 | Reka fp8 | $0.8727 → $0.936 | $3.36 → $3.168 | $0.1639 → $0.1872 | 未知 → 未知 | → |
GLM-5.2 (max)z-ai/glm-5.2 | StreamLake fp8 | $0.4802 → $0.48048 | $1.5092 → $1.51008 | $0.08918 → $0.089232 | 未知 → 未知 | → |
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)deepseek/deepseek-v4-flash-0731 | Baidu fp8 | $0.03 → $0.0352 | $0.07 → $0.1056 | $0.003 → $0.00112 | 未知 → 未知 | → |
这张表比较的是两个时点的报价快照,provider 或量化可能不同,不能统称为同一家 provider 涨价或降价。Nemotron 3.5 Lightning 当前端点没有披露缓存读取价,故显示“未知”;此前缓存价格仅保留为带原 observedAt 的历史参考。缓存写入未披露时同样不补零。
表末日期对应整条报价快照;未改变的单项价格继续使用其原始历史观测,不人为刷新日期。本文逐项核对本期精确报价后读取历史数值,当前未披露字段不会回退成旧报价。
DeepSeek 的日期后缀属于身份的一部分,0731 与 0813 的报价不能挪给 V4.1 或其他配置。API 报价与 AA 评测分别归属 OpenRouter 和 Artificial Analysis;能调用同名模型,也不自动证明端点设置与 AA 运行配置完全一致。
对选型的影响:先确定任务门槛,再验证可部署路径
如果你的目标是小模型或自部署候选,先用本期分项筛掉不满足任务可靠性要求的配置,再查权重、许可、上下文、硬件与推理实现。本文没有核实这些部署条件,不能仅凭“7B”“3.7B”或“MoVA”保证在某台设备运行、具有何种延迟或成本。
如果目标是现成托管 API,应先确认 exact model ID 与所需设置确实可用,再按输入、输出与缓存结构核算预算。已有型号的报价变化会改变成本输入,能力评测与实际服务质量仍需分别判断。继续比较可使用 模型比较、API 经济性 和各模型历史页。
未知项、可比边界与观察时间
- 主题评测 observedAt 为 ;独立榜覆盖截至 ;价格逐行保留自己的原始观察日期。
- 新增配置没有上一条同版观测,不计算虚构增幅;首次收录时间不冒充厂商发布日期。
- 未知 API、部署条件与缺少的配置保持未知。零与负评测值不等于空值,旧结果不会被本次抓取覆盖。
- 评测不同版本、任务协议、provider 与推理设置不直接拼接比较;官方自报与独立评测也不能混作同一种证据。
- 本文按明确 benchmark、版本与 asOf 截止时间读取历史。后续数据更新不会改写本期指标和报价。