为什么指数变了,不能直接说能力下降?
搜索 Ling 3.0 Flash benchmark 或比较历史指数时,数字旁的暂估标记同样重要。“正式”在本文仅表示 AA 本期未再标记暂估,不表示模型今天发布新版本,也不表示全部业务任务均已验证。
| 精确配置 | 上一观测 | 本期观测 | 原始观测时间 |
|---|---|---|---|
| Ling 3.0 Flash | 24.94*(暂估) | 20.63(未标暂估) | → |
| Kimi K2.6 | 31.32*(暂估) | 27.46(未标暂估) | → |
| Ling-3.0-flash-VL | 24.77(未标暂估) | 24.97(未标暂估) | → |
旧观测覆盖尚不完整,本期又补齐了此前未知的分项。虽然指数版本相同,前后证据完整度与暂估状态不同;不能把这一次差值写成可复现的“能力下降百分比”。本文也没有证据将指数修订全部归因于某一个分项。此前依据暂估值筛选的候选,应使用本期结果重新核对任务门槛,旧值仍可在模型历史中查看。
Kimi K2.6 同期从暂估转为未标暂估,适用同样的阅读边界。Ling 3.0 Flash VL 则是另一个精确模型,表中指数修订没有暂估状态切换;它与不带 VL 的 Ling 不能混用分数或 API 报价。
新补齐的评测:终端任务零值与自动化 partial score
| 精确配置 | 指标 | 上一期 | 本期 | 本期 observedAt |
|---|---|---|---|---|
| Ling 3.0 Flash | Terminal-Bench v4.0 pass@1 | 未知 | 0.00% | |
| Ling 3.0 Flash | AutomationBench-AA partial score | 未知 | 3.22% | |
| Kimi K2.6 | Terminal-Bench v4.0 pass@1 | 未知 | 0.51% | |
| GPT-5.6 Sol (Non-reasoning) | AutomationBench-AA partial score | 未知 | 22.66% | |
| GPT-5.6 Terra (Non-reasoning) | AutomationBench-AA partial score | 未知 | 12.54% |
Terminal-Bench v4.0 的零值是来源明确给出的这次评测结果:在该任务与执行协议下没有通过,不是缺少评测,也不能推广成“所有终端任务都做不了”。旧 Terminal-Bench v2.1 与 v4.0 的任务协议不同,不拼成一条连续升降趋势。
AutomationBench-AA 显示的是 partial score,反映来源规定的部分得分;即使以百分比显示,也不能改称完整任务通过率、成功率或目标完成率。选型时应沿能力分项矩阵核对指标定义,再用实际工具权限、执行环境和失败恢复流程验证。
Terminal-Bench v4.0 新增 Ling 3.0 Flash、Kimi K2.6,AutomationBench-AA 新增 Ling 及 GPT-5.6 Sol/Terra 的 Non-reasoning 配置,共补齐五项原始结果。属于既有同版评测覆盖扩容,没有新增 Benchmark 或版本。Terminal-Bench 的零值有效;AutomationBench 原生 partial score 不等于完整任务通过率。
同期评测更新:既有配置的 Elo 修订
以下 17 项原始 Elo 发生变化。所有对照都固定精确配置、指标与 v4.3 版本,未变化字段保留原始日期,不在本表重复列出。
| 配置 | 评测 | 上一观测 | 本期观测 | 原始观测时间 |
|---|---|---|---|---|
| Ling 3.0 Flash | AA-Briefcase | 800.34 | 802.47 | → |
| Ling 3.0 Flash | GDPval-AA v2 | 1035.51 | 1017.28 | → |
| GLM-5.3 | AA-Briefcase | 1511.37 | 1511.24 | → |
| GLM-5.3 | GDPval-AA v2 | 1661.42 | 1655.16 | → |
| Kimi K3 (max) | AA-Briefcase | 1491.84 | 1488.03 | → |
| Kimi K3 (max) | GDPval-AA v2 | 1565.65 | 1551.96 | → |
| Kimi K2.6 | AA-Briefcase | 819.92 | 823.87 | → |
| Kimi K2.6 | GDPval-AA v2 | 1115.31 | 1096.33 | → |
| GPT-5.6 Sol (Non-reasoning) | AA-Briefcase | 1012.78 | 1014.19 | → |
| GPT-5.6 Sol (Non-reasoning) | GDPval-AA v2 | 1299.14 | 1274.76 | → |
| GPT-5.6 Terra (Non-reasoning) | AA-Briefcase | 946.69 | 948.02 | → |
| GPT-5.6 Terra (Non-reasoning) | GDPval-AA v2 | 1168.63 | 1147.15 | → |
| GPT-5.6 Luna (medium) | AA-Briefcase | 934.00 | 933.74 | → |
| GPT-5.6 Luna (medium) | GDPval-AA v2 | 1190.16 | 1172.83 | → |
| Mistral Medium 3.1 | AA-Briefcase | 532.28 | 538.27 | → |
| Mistral Medium 3.1 | GDPval-AA v2 | 555.23 | 537.42 | → |
| Solar Pro 4 | GDPval-AA v2 | 1183.90 | 1172.77 | → |
Elo 属于各评测内部的相对尺度,不能解释成百分比。微小修订不足以证明稳定的能力差异;Briefcase 与 GDPval-AA 独立榜的展示精度、置信区间和方法应一起阅读。Openness 表内伴随的 Ling 与 Kimi K2.6 Intelligence 辅助列同步变化,这不代表开放性得分变化。
GDP.pdf 与 SciCode:协议标签决定能否比较
| 精确配置 | 指标 | 上一同版观测 | 本期观测 | 本期 observedAt |
|---|---|---|---|---|
| Ling-3.0-flash-VL | GDP.pdf all-pass | 6.40% | 8.40% | |
| GPT-5.6 Sol (Non-reasoning) | SciCode | 未知:无同版观测 | 47.69% | |
| GPT-5.6 Terra (Non-reasoning) | SciCode | 未知:无同版观测 | 45.14% |
Ling 3.0 Flash VL 的 GDP.pdf all-pass 有可核对的同版前值。GPT-5.6 Sol/Terra Non-reasoning 的旧 SciCode 数值缺少同版协议标记,本文不将它们改挂到 v4.3,也不把本期结果表述为同协议提升。非推理配置的结果不能挪给同名的其他 reasoning effort。
价格与 API:按精确型号和同一端点核价
以下 6 个精确型号有确认的报价快照变化,单位为美元/百万 Token。每条当前报价选择一个活跃付费端点:按最低正输入价选择,输入同价时比较输出价;输出与缓存字段均来自同一 provider,未披露字段不借用其他端点或旧快照。
| 精确 model ID | 当前 provider / 量化 | 输入 | 输出 | 缓存读取 | 缓存写入 | 报价 observedAt |
|---|---|---|---|---|---|---|
Inkling Smallthinkingmachines/inkling-small | DeepInfra fp8 | $0.5 → $0.45 | $1.2 → $1.2 | $0.1 → $0.1 | 未知 → 未知 | → |
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)deepseek/deepseek-v4-pro-0813 | Ionstream 量化未知 | $0.88 → $0.96 | $2.64 → $2.88 | $0.088 → $0.088 | 未知 → 未知 | → |
Qwen3.6 27B (Reasoning)qwen/qwen3.6-27b | SiliconFlow fp8 | $0.3 → $0.3 | $2 → $3.2 | $0.03 → 未知 | 未知 → 未知 | → |
Qwen3.8 27B (xhigh)qwen/qwen3.8-27b | DeepInfra bf16 | $0.15 → $0.15 | $2 → $1.875 | 未知 → $0.0375 | 未知 → 未知 | → |
GLM-5.2 (max)z-ai/glm-5.2 | DeepInfra fp4 | $0.48048 → $0.4875 | $1.51008 → $1.56 | $0.089232 → $0.091 | 未知 → 未知 | → |
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)deepseek/deepseek-v4-flash-0731 | OpenInference fp8 | $0.0352 → $0.04 | $0.1056 → $0.1 | $0.00112 → $0.01 | 未知 → 未知 | → |
这是报价快照对照,provider 或量化可能改变,不能统称为同一 provider 涨价或降价。表末日期对应整条报价,未变化字段保持自己的原始观测日期;当前未披露价格不会从历史中回填。DeepSeek 的日期后缀属于身份,0731 与 0813 报价不能挪给其他日期或 V4.1 型号;独立 :free 变体也不是这些付费端点的价格。
Qwen3.6 27B 的本期缓存读取没有报价,保持未知;Qwen3.8 27B 则新增明确缓存读取价。模型页汇总标题不一定等于当期活跃付费端点的完整报价,本文按所列 provider 的实际端点字段核对,不拼接 headline、其他 provider 或历史缓存价。
主题模型 Ling 3.0 Flash 的 API 参考
本期复核 inclusionai/ling-3.0-flash 的 Novita 端点,输入、输出与缓存读取报价未变。以下数值继续保留原 observedAt,不将旧观测改写为今天;API 可用也不证明该端点设置已复现 AA 的评测配置。
- 输入:$0.021 / 百万 Token;OpenRouter observedAt
- 输出:$0.063 / 百万 Token;OpenRouter observedAt
- 缓存读取:$0.0042 / 百万 Token;OpenRouter observedAt
- 缓存写入:未知 / 百万 Token
对选型的影响:先验证任务,再核算调用成本
Ling 的本期结果补上了终端执行与自动化两个切面。若你需要可靠的自主执行,优先核对这些分项以及适用协议,再在自己的任务中验证成功率、工具错误、重试与人工接管成本。只看一个总指数或一条低价,不足以证明它满足生产可靠性要求。
文档与知识工作可继续查看 Briefcase、GDPval-AA 等任务证据;成本评估则用确切 API 身份、provider、输入/输出和缓存比例。本站比较工具、API 经济性与模型历史提供核对入口,不把不同来源的指标合成为“模型坐标总分”。
未知项、可比边界与观察时间
- AA 结果截止 ;上一已提交历史对照截止 。旧观测各自保留原日期,API 报价逐行使用自己的时间。
- 本期记录评测更新与同版结果覆盖扩容,不声称厂商新发布模型或模型版本,不补造发布日期、上下文、权重或部署规格。
- 缺失字段保持未知,来源合法零值保留。AutomationBench 部分得分、Terminal-Bench 通过率与 Elo 是不同语义,不能互换。
- AA 负责独立评测,OpenRouter 负责精确当前 API 报价;AA 单任务成本不能冒充 API Token 单价。
- 本文按 benchmark、版本与 asOf 固定读取历史,后续新观测不会改写本期数字。