模型日报 · 2026-09-15

模型日报 2026-09-15|Ling 3.0 Flash 完成 AA 评测,如何理解指数修订

Ling 3.0 Flash 的 AA v4.3 指数从暂估转正式,新增 Terminal-Bench v4.0 与 AutomationBench-AA 分项;对照同版历史解释修订,并核对精确 API 报价及同期六型号价格变化。

TODAY'S TAKE

Ling 3.0 Flash 完成指数评测:用正式结果重看任务适配

Ling 3.0 Flash 的 AA Intelligence Index v4.3 从 24.94*(暂估)修订为 20.63(未标暂估),并新增 Terminal-Bench v4.0 与 AutomationBench-AA 两项结果。这里改变的是可用评测证据;不能据此认定模型本身突然变弱。

本期没有新模型或新 Benchmark 版本。主线是同一配置从暂估到正式的观察变化;Kimi K2.6 同期转为正式结果,另有非推理配置的自动化分项补齐、既有模型原值修订与精确 OpenRouter 报价变化。

为什么指数变了,不能直接说能力下降?

搜索 Ling 3.0 Flash benchmark 或比较历史指数时,数字旁的暂估标记同样重要。“正式”在本文仅表示 AA 本期未再标记暂估,不表示模型今天发布新版本,也不表示全部业务任务均已验证。

各精确配置的 AA Intelligence Index v4.3;旧值截止 2026-09-14T23:59:59Z,本期截止 2026-09-15T07:01:49.564Z
精确配置上一观测本期观测原始观测时间
Ling 3.0 Flash24.94*(暂估)20.63(未标暂估)
Kimi K2.631.32*(暂估)27.46(未标暂估)
Ling-3.0-flash-VL24.77(未标暂估)24.97(未标暂估)

旧观测覆盖尚不完整,本期又补齐了此前未知的分项。虽然指数版本相同,前后证据完整度与暂估状态不同;不能把这一次差值写成可复现的“能力下降百分比”。本文也没有证据将指数修订全部归因于某一个分项。此前依据暂估值筛选的候选,应使用本期结果重新核对任务门槛,旧值仍可在模型历史中查看。

Kimi K2.6 同期从暂估转为未标暂估,适用同样的阅读边界。Ling 3.0 Flash VL 则是另一个精确模型,表中指数修订没有暂估状态切换;它与不带 VL 的 Ling 不能混用分数或 API 报价。

新补齐的评测:终端任务零值与自动化 partial score

AA v4.3 原生组件;fraction 仅转换为百分比显示,未知不等于零
精确配置指标上一期本期本期 observedAt
Ling 3.0 FlashTerminal-Bench v4.0 pass@1未知0.00%
Ling 3.0 FlashAutomationBench-AA partial score未知3.22%
Kimi K2.6Terminal-Bench v4.0 pass@1未知0.51%
GPT-5.6 Sol (Non-reasoning)AutomationBench-AA partial score未知22.66%
GPT-5.6 Terra (Non-reasoning)AutomationBench-AA partial score未知12.54%

Terminal-Bench v4.0 的零值是来源明确给出的这次评测结果:在该任务与执行协议下没有通过,不是缺少评测,也不能推广成“所有终端任务都做不了”。旧 Terminal-Bench v2.1 与 v4.0 的任务协议不同,不拼成一条连续升降趋势。

AutomationBench-AA 显示的是 partial score,反映来源规定的部分得分;即使以百分比显示,也不能改称完整任务通过率、成功率或目标完成率。选型时应沿能力分项矩阵核对指标定义,再用实际工具权限、执行环境和失败恢复流程验证。

Terminal-Bench v4.0 新增 Ling 3.0 Flash、Kimi K2.6,AutomationBench-AA 新增 Ling 及 GPT-5.6 Sol/Terra 的 Non-reasoning 配置,共补齐五项原始结果。属于既有同版评测覆盖扩容,没有新增 Benchmark 或版本。Terminal-Bench 的零值有效;AutomationBench 原生 partial score 不等于完整任务通过率。

同期评测更新:既有配置的 Elo 修订

以下 17 项原始 Elo 发生变化。所有对照都固定精确配置、指标与 v4.3 版本,未变化字段保留原始日期,不在本表重复列出。

同版原始 Elo;上一已记录观测 → 本期观测
配置评测上一观测本期观测原始观测时间
Ling 3.0 FlashAA-Briefcase800.34802.47
Ling 3.0 FlashGDPval-AA v21035.511017.28
GLM-5.3AA-Briefcase1511.371511.24
GLM-5.3GDPval-AA v21661.421655.16
Kimi K3 (max)AA-Briefcase1491.841488.03
Kimi K3 (max)GDPval-AA v21565.651551.96
Kimi K2.6AA-Briefcase819.92823.87
Kimi K2.6GDPval-AA v21115.311096.33
GPT-5.6 Sol (Non-reasoning)AA-Briefcase1012.781014.19
GPT-5.6 Sol (Non-reasoning)GDPval-AA v21299.141274.76
GPT-5.6 Terra (Non-reasoning)AA-Briefcase946.69948.02
GPT-5.6 Terra (Non-reasoning)GDPval-AA v21168.631147.15
GPT-5.6 Luna (medium)AA-Briefcase934.00933.74
GPT-5.6 Luna (medium)GDPval-AA v21190.161172.83
Mistral Medium 3.1AA-Briefcase532.28538.27
Mistral Medium 3.1GDPval-AA v2555.23537.42
Solar Pro 4GDPval-AA v21183.901172.77

Elo 属于各评测内部的相对尺度,不能解释成百分比。微小修订不足以证明稳定的能力差异;BriefcaseGDPval-AA 独立榜的展示精度、置信区间和方法应一起阅读。Openness 表内伴随的 Ling 与 Kimi K2.6 Intelligence 辅助列同步变化,这不代表开放性得分变化。

GDP.pdf 与 SciCode:协议标签决定能否比较

本期任务分项;旧值缺少同版协议时,不计算提升
精确配置指标上一同版观测本期观测本期 observedAt
Ling-3.0-flash-VLGDP.pdf all-pass6.40%8.40%
GPT-5.6 Sol (Non-reasoning)SciCode未知:无同版观测47.69%
GPT-5.6 Terra (Non-reasoning)SciCode未知:无同版观测45.14%

Ling 3.0 Flash VL 的 GDP.pdf all-pass 有可核对的同版前值。GPT-5.6 Sol/Terra Non-reasoning 的旧 SciCode 数值缺少同版协议标记,本文不将它们改挂到 v4.3,也不把本期结果表述为同协议提升。非推理配置的结果不能挪给同名的其他 reasoning effort。

价格与 API:按精确型号和同一端点核价

以下 6 个精确型号有确认的报价快照变化,单位为美元/百万 Token。每条当前报价选择一个活跃付费端点:按最低正输入价选择,输入同价时比较输出价;输出与缓存字段均来自同一 provider,未披露字段不借用其他端点或旧快照。

OpenRouter 历史参考 → 本期精确报价(USD / 1M tokens)
精确 model ID当前 provider / 量化输入输出缓存读取缓存写入报价 observedAt
Inkling Small
thinkingmachines/inkling-small
DeepInfra
fp8
$0.5 → $0.45$1.2 → $1.2$0.1 → $0.1未知 → 未知
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
deepseek/deepseek-v4-pro-0813
Ionstream
量化未知
$0.88 → $0.96$2.64 → $2.88$0.088 → $0.088未知 → 未知
Qwen3.6 27B (Reasoning)
qwen/qwen3.6-27b
SiliconFlow
fp8
$0.3 → $0.3$2 → $3.2$0.03 → 未知未知 → 未知
Qwen3.8 27B (xhigh)
qwen/qwen3.8-27b
DeepInfra
bf16
$0.15 → $0.15$2 → $1.875未知 → $0.0375未知 → 未知
GLM-5.2 (max)
z-ai/glm-5.2
DeepInfra
fp4
$0.48048 → $0.4875$1.51008 → $1.56$0.089232 → $0.091未知 → 未知
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
deepseek/deepseek-v4-flash-0731
OpenInference
fp8
$0.0352 → $0.04$0.1056 → $0.1$0.00112 → $0.01未知 → 未知

这是报价快照对照,provider 或量化可能改变,不能统称为同一 provider 涨价或降价。表末日期对应整条报价,未变化字段保持自己的原始观测日期;当前未披露价格不会从历史中回填。DeepSeek 的日期后缀属于身份,0731 与 0813 报价不能挪给其他日期或 V4.1 型号;独立 :free 变体也不是这些付费端点的价格。

Qwen3.6 27B 的本期缓存读取没有报价,保持未知;Qwen3.8 27B 则新增明确缓存读取价。模型页汇总标题不一定等于当期活跃付费端点的完整报价,本文按所列 provider 的实际端点字段核对,不拼接 headline、其他 provider 或历史缓存价。

主题模型 Ling 3.0 Flash 的 API 参考

本期复核 inclusionai/ling-3.0-flash 的 Novita 端点,输入、输出与缓存读取报价未变。以下数值继续保留原 observedAt,不将旧观测改写为今天;API 可用也不证明该端点设置已复现 AA 的评测配置。

  • 输入:$0.021 / 百万 Token;OpenRouter observedAt
  • 输出:$0.063 / 百万 Token;OpenRouter observedAt
  • 缓存读取:$0.0042 / 百万 Token;OpenRouter observedAt
  • 缓存写入:未知 / 百万 Token

对选型的影响:先验证任务,再核算调用成本

Ling 的本期结果补上了终端执行与自动化两个切面。若你需要可靠的自主执行,优先核对这些分项以及适用协议,再在自己的任务中验证成功率、工具错误、重试与人工接管成本。只看一个总指数或一条低价,不足以证明它满足生产可靠性要求。

文档与知识工作可继续查看 Briefcase、GDPval-AA 等任务证据;成本评估则用确切 API 身份、provider、输入/输出和缓存比例。本站比较工具API 经济性与模型历史提供核对入口,不把不同来源的指标合成为“模型坐标总分”。

未知项、可比边界与观察时间

  • AA 结果截止 ;上一已提交历史对照截止 。旧观测各自保留原日期,API 报价逐行使用自己的时间。
  • 本期记录评测更新与同版结果覆盖扩容,不声称厂商新发布模型或模型版本,不补造发布日期、上下文、权重或部署规格。
  • 缺失字段保持未知,来源合法零值保留。AutomationBench 部分得分、Terminal-Bench 通过率与 Elo 是不同语义,不能互换。
  • AA 负责独立评测,OpenRouter 负责精确当前 API 报价;AA 单任务成本不能冒充 API Token 单价。
  • 本文按 benchmark、版本与 asOf 固定读取历史,后续新观测不会改写本期数字。