模型日报 · 2026-09-12

模型日报 2026-09-12|DeepSeek V4.1 Flash 新增独立评测:分项表现与 API 边界

DeepSeek V4.1 Flash Max Effort 首次收录 AA 独立评测;同期新增 Agnes 3.0 Flash、Ling-3.0-flash-VL,核对既有配置结果与精确 OpenRouter 报价,区分评测版本、暂估状态和 API 设置。

TODAY'S TAKE

DeepSeek V4.1 Flash 有了独立评测,API 仍须对齐配置

本期首次收录 DeepSeek V4.1 Flash (Reasoning, Max Effort) 的 Artificial Analysis 独立评测。AA Intelligence Index v4.3 为 39.55;这给模型选型增加了一个可核验的能力参照,但不能据此沿用 DeepSeek V4 Flash 0731 的价格、速度或 API 配置。

Agnes 3.0 Flash

AA Intelligence Index v4.3:35.50*。来源暂估;不视为完整评测确认值。

Ling-3.0-flash-VL

AA Intelligence Index v4.3:24.77。本期来源未标记为暂估。

新模型:先看精确配置,再看分项表现

本期首次收录 3 个精确 AA 身份:DeepSeek V4.1 Flash (Reasoning, Max Effort)、Agnes 3.0 Flash 与 Ling-3.0-flash-VL。新增指本站首次收录,不代表厂商今天发布;Agnes 的指数仍为来源暂估。

这里的“新增”指模型坐标首次收录该 AA 身份,不等于厂商今天发布。DeepSeek 的结果固定在 Reasoning、Max Effort 配置;Agnes 和 Ling 的身份分别保留,不按相似名称归并。检索 DeepSeek V4.1 Flash benchmark 时,应先确认评测版本与 effort,再比较相同任务的分数。

本期新增配置的 AA v4.3 原始分项;观察截止 2026-09-12T01:04:56.591Z
评测DeepSeek V4.1 Flash (Reasoning, Max Effort)Agnes 3.0 FlashLing-3.0-flash-VL可比边界
AA-Briefcase1423.72未知985.98整体 Elo;高分更好
GDPval-AA v21632.061573.471224.84原始 Elo;不是百分比
AutomationBench-AA68.9%50.7%15.7%来源 partial score;高分更好
Terminal-Bench v4.026.8%7.1%0.0%pass@1;不可与旧 v2.1 直接衔接
SciCode51.9%51.6%44.2%代码执行 pass@1;按子问题计分
AA-LCR v1.184.0%81.0%78.3%长上下文推理 pass@1
GDP.pdf12.8%10.0%6.4%all-pass;不同于单次答对率
Humanity's Last Exam39.2%38.5%22.0%开放式作答 pass@1
CritPt14.3%15.1%2.0%来源科学推理评测
Omniscience 准确率46.4%25.5%14.3%高分更好;须与幻觉率一起看
Omniscience 幻觉率96.5%48.4%22.0%低分更好;按 AA 的评测定义解释

未知与零分不同;* 是来源的暂估标记。百分比只由来源 fraction 换算显示。Elo、通过率和幻觉率各自回答不同问题,本文不再合成总分。

DeepSeek V4.1 Flash 的知识回答不能只看准确率,还要一起看 Omniscience 幻觉率。幻觉率衡量来源规定的作答行为,并非任意业务问答的错误概率;需要可靠引用或拒答的产品,应另外验证自己的问题集与检索链路。Ling 名称中的 VL 也不表示这张主要面向文本任务的表已经验证其视觉能力。

评测覆盖与上一观测:扩容、补齐和暂估转正式要分开

AA 当前目录从 644 增至 647 个模型配置;同一 v4.3 的评测矩阵与 Omniscience 有效行从 519 增至 522。新增的是既有方法下的结果覆盖,本期没有发布新的 Benchmark 或指数版本。

逐项核实 17 个既有 variant 的 v4.3 结果:43 个来源数值变化、19 个先前未知分项获得结果,12 个指数由暂估转为来源未标记暂估。旧观测保留;结果修订与状态变化不直接等同于底层模型能力升级。

本期有 12 个既有配置的指数从暂估转为未标记暂估。下表保留上一观测与本期观测;分数变化可以描述为来源结果修订,不能在缺少模型版本变更证据时直接称作底层能力升级。新模型没有本站上一期同身份观测,不计算“提升幅度”。

同一 v4.3、同一 variant:截至 2026-09-09T14:00:04.717Z → 2026-09-12T01:04:56.591Z;* 为暂估
精确配置Intelligence Index本期改变或补齐的分项
Agnes 2.5 Pro Alpha26.77* → 27.80
  • AA-Briefcase:1196.25 → 1195.25
  • GDPval-AA v2:1093.13 → 1087.81
  • GDP.pdf:未知 → 9.00%
Claude Sonnet 5 (Adaptive Reasoning, High Effort)未知 → 32.03
  • AA-Briefcase:1179.20 → 1177.84
  • GDPval-AA v2:1315.68 → 1308.45
  • CritPt:未知 → 15.14%
Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)未知 → 34.71
  • AA-Briefcase:1275.52 → 1273.41
  • GDPval-AA v2:1410.49 → 1400.77
  • CritPt:未知 → 15.43%
GLM-5.344.86 → 44.86
  • AA-Briefcase:1515.06 → 1512.51
  • GDPval-AA v2:1676.24 → 1667.27
GPT-5.6 Luna (high)32.91* → 32.41
  • GDP.pdf:未知 → 22.20%
GPT-5.6 Luna (low)21.83* → 21.55
  • AA-Briefcase:742.04 → 743.81
  • GDPval-AA v2:1081.79 → 1075.16
  • GDP.pdf:未知 → 14.20%
GPT-5.6 Luna (medium)25.78* → 25.48
  • AA-Briefcase:933.37 → 934.00
  • GDPval-AA v2:1196.42 → 1190.16
  • GDP.pdf:未知 → 15.20%
GPT-5.6 Terra (low)27.88* → 27.92
  • AA-Briefcase:1014.18 → 1014.49
  • GDPval-AA v2:1179.22 → 1177.99
  • GDP.pdf:未知 → 17.60%
GPT-5.6 Terra (medium)32.76* → 30.42
  • AA-Briefcase:1041.14 → 1040.72
  • GDPval-AA v2:1319.37 → 1318.34
  • GDP.pdf:未知 → 17.00%
Granite 4.2 8B12.40* → 11.81
  • AA-Briefcase:319.61 → 320.12
  • GDPval-AA v2:646.23 → 645.07
  • Terminal-Bench v4.0:未知 → 0.00%
K2 Horizon 375B A23B33.92* → 30.70*
  • AA-Briefcase:1302.74 → 1299.25
  • GDPval-AA v2:1410.00 → 1404.28
  • AutomationBench-AA:未知 → 37.21%
Kimi K3 (max)43.78 → 43.78
  • AA-Briefcase:1496.56 → 1494.85
  • GDPval-AA v2:1583.53 → 1572.42
Kimi K3 (low)34.46* → 30.48
  • AA-Briefcase:986.82 → 984.78
  • GDPval-AA v2:1196.20 → 1185.27
  • Terminal-Bench v4.0:未知 → 12.63%
Qwen3.6 35B A3B (Reasoning)22.26* → 18.81
  • AA-Briefcase:711.07 → 711.46
  • GDPval-AA v2:991.86 → 990.51
  • Terminal-Bench v4.0:未知 → 0.00%
Qwen3.8 27B (low)29.22* → 26.49
  • AA-Briefcase:1277.38 → 1277.44
  • GDPval-AA v2:1403.79 → 1402.54
  • Terminal-Bench v4.0:未知 → 2.53%
Qwen3.8 27B (medium)30.66* → 27.81
  • AA-Briefcase:未知 → 1375.70
  • GDPval-AA v2:1431.33 → 1430.39
  • Terminal-Bench v4.0:未知 → 5.05%
Qwen3.8-Flash-Next42.24* → 39.91
  • AA-Briefcase:未知 → 1586.58
  • GDPval-AA v2:1648.02 → 1647.02
  • Terminal-Bench v4.0:未知 → 25.25%

Terminal-Bench v4.0 与旧 v2.1、v4.3 与旧指数版本保持独立。表中未改变的数字保留自身原始 observedAt,不因为本期发表文章而改写;完整点位与日期可在各模型历史页查看。

同期更新:独立榜单覆盖也在扩容

以下数量与本站上次收录的对应榜单快照比较,表示结果覆盖增加,不代表同日发布了同样数量的新模型。各榜单继续保留自己的方法与指标。

  • AA-AnalystAgent:30 → 32 个结果,新增 Claude Fable 5.1 (max with fallback) 与 GPT-6 Astra (max);原有配置的 pass^5、pass@1、pass@5 成绩未变。
  • AA-Briefcase:62 → 163 个结果,新增 101 个配置。
  • GDPval-AA v2:204 → 242 个结果,新增 38 个配置;属于既有 v2 结果覆盖扩容。
  • Openness Index:306 → 319 个结果,新增 13 个配置;Nemotron 3.5 Lightning 的开放性指数由 77.78 变为 83.33。
本期 AA-AnalystAgent 新增结果;截至 2026-09-12T01:07:04.635Z
精确配置pass^5pass@1pass@5
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)57.5%65.8%72.5%
GPT-6 Astra (max)51.2%60.0%67.5%

AA-AnalystAgent 的 pass^5 观察重复运行能否全部正确,pass@1 与 pass@5 分别对应单次表现和多次尝试至少一次成功;它们不进入本文的 v4.3 指数组合。该榜单的 DeepSeek V4 Pro 0424 结果属于另一明确版本,不能替代 V4 Pro 0813 的观测或 API 报价。

Openness 描述开放性,不等同于任务能力;其表内 Intelligence 列从旧版切到 v4.3 时,跨版差值不可解释为能力涨跌。GDPval-AA v2 本来已采用 v2,本期扩容不再包装成“发布新版本”。

价格与 API:精确同款报价快照变化

本期核实 8 个精确 OpenRouter model ID 的报价变化。当前值取活跃付费端点中最低正输入价的单一端点,输出价用于同价时排序,所有字段来自同一 provider;价格单位均为美元/百万 Token。它们是本期与历史快照的比较,旧快照未完整记录 provider,因此不宣称同一个 provider 统一降价。

OpenRouter 历史参考 → 本期精确报价(USD / 1M tokens)
模型 / 精确 model ID本期 provider / 量化输入输出缓存读取缓存写入报价快照日期
Solar Pro 4
upstage/solar-pro4
Upstage
量化未披露
$0.03 → $0.09$0.12 → $0.36$0.006 → $0.018未知 → 未知
Muse Glimmer (high)
meta/muse-glimmer-30b
Phala
量化未披露
$0.3 → $0.3$1.1 → $1.1未知 → $0.04未知 → 未知
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
deepseek/deepseek-v4-pro-0813
Baidu
fp8
$1.056 → $0.57816$3.168 → $1.73448$0.0352 → $0.018396未知 → 未知
Qwen3.8 2.4T A95B
qwen/qwen3.8-2.4t-a95b
Alibaba
量化未披露
$2 → $2$6 → $6$0.2 → $0.25未知 → $2.5
Qwen3.8 27B (xhigh)
qwen/qwen3.8-27b
Darkbloom
fp4
$0.45 → $0.15$3.2 → $2$0.05 → 未知未知 → 未知
GLM-5.3
z-ai/glm-5.3
Inceptron
fp4
$1.4 → $0.8727$4.4 → $3.36$0.26 → $0.1639未知 → 未知
GLM-5.2 (max)
z-ai/glm-5.2
Baidu
fp8
$0.5 → $0.4802$3.15 → $1.5092$0.115 → $0.08918未知 → 未知
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
deepseek/deepseek-v4-flash-0731
OpenInference
fp8
$0.065 → $0.05$0.18 → $0.16$0.02 → $0.013未知 → 未知

端点没有返回缓存价格时,当前值为未知,旧缓存价只作带日期的历史参考;不能从其他 provider 或模型目录拼接一条“最低价”。独立免费型号不属于上述付费报价,AA 单任务成本也不是 OpenRouter API 单价。

DeepSeek V4.1 Flash 本期没有经核实的 Max Effort 精确 API 报价。公开产品页存在不等于其调用设置与 AA 的测试配置一一对应;上表 DeepSeek V4 Flash 0731 和 V4 Pro 0813 是另外两个明确版本。Ling-3.0-flash 的旧报价同样不能挪给 Ling-3.0-flash-VL。

对选型的影响:能力、可靠性与成本分别验证

需要自动化操作或终端任务时,可从 AutomationBench-AA 与 Terminal-Bench 分项筛选候选,再用自己的工具权限、任务集和失败恢复流程验证。长文档场景看 AA-LCR 与 GDP.pdf;需要事实准确和适当拒答时,同时关注 Omniscience 的两个指标。总指数适合缩小范围,不能代替具体业务验收。

比较 DeepSeek V4.1 Flash vs Pro 时,版本、effort 和 API 路由都是比较条件。本文没有为未知 API 假设相同吞吐、延迟或成本;报价有更新的既有型号,也应按输入、输出、缓存结构重新核算,而不是拿家族平均价选型。

未知项与观察时间

  • AA 评测观察截止 ;OpenRouter 每个型号的报价时间单独列在表内。
  • 本期没有给新配置补造未核实的 API、速度、上下文或发布日期;首次收录时间不能充当厂商发布时间。
  • 暂估转正式表示来源的结果状态改变,不意味着 AA 已独立重现厂商的所有能力宣传。
  • 本期数字固定读取相同 benchmark、版本和截止时间的历史观测,后续更新不会改写这期表格。