AA Intelligence Index v4.3:39.55。本期来源未标记为暂估。
模型日报 · 2026-09-12
模型日报 2026-09-12|DeepSeek V4.1 Flash 新增独立评测:分项表现与 API 边界
DeepSeek V4.1 Flash Max Effort 首次收录 AA 独立评测;同期新增 Agnes 3.0 Flash、Ling-3.0-flash-VL,核对既有配置结果与精确 OpenRouter 报价,区分评测版本、暂估状态和 API 设置。
TODAY'S TAKE
DeepSeek V4.1 Flash 有了独立评测,API 仍须对齐配置
本期首次收录 DeepSeek V4.1 Flash (Reasoning, Max Effort) 的 Artificial Analysis 独立评测。AA Intelligence Index v4.3 为 39.55;这给模型选型增加了一个可核验的能力参照,但不能据此沿用 DeepSeek V4 Flash 0731 的价格、速度或 API 配置。
AA Intelligence Index v4.3:35.50*。来源暂估;不视为完整评测确认值。
AA Intelligence Index v4.3:24.77。本期来源未标记为暂估。
新模型:先看精确配置,再看分项表现
本期首次收录 3 个精确 AA 身份:DeepSeek V4.1 Flash (Reasoning, Max Effort)、Agnes 3.0 Flash 与 Ling-3.0-flash-VL。新增指本站首次收录,不代表厂商今天发布;Agnes 的指数仍为来源暂估。
这里的“新增”指模型坐标首次收录该 AA 身份,不等于厂商今天发布。DeepSeek 的结果固定在 Reasoning、Max Effort 配置;Agnes 和 Ling 的身份分别保留,不按相似名称归并。检索 DeepSeek V4.1 Flash benchmark 时,应先确认评测版本与 effort,再比较相同任务的分数。
| 评测 | DeepSeek V4.1 Flash (Reasoning, Max Effort) | Agnes 3.0 Flash | Ling-3.0-flash-VL | 可比边界 |
|---|---|---|---|---|
| AA-Briefcase | 1423.72 | 未知 | 985.98 | 整体 Elo;高分更好 |
| GDPval-AA v2 | 1632.06 | 1573.47 | 1224.84 | 原始 Elo;不是百分比 |
| AutomationBench-AA | 68.9% | 50.7% | 15.7% | 来源 partial score;高分更好 |
| Terminal-Bench v4.0 | 26.8% | 7.1% | 0.0% | pass@1;不可与旧 v2.1 直接衔接 |
| SciCode | 51.9% | 51.6% | 44.2% | 代码执行 pass@1;按子问题计分 |
| AA-LCR v1.1 | 84.0% | 81.0% | 78.3% | 长上下文推理 pass@1 |
| GDP.pdf | 12.8% | 10.0% | 6.4% | all-pass;不同于单次答对率 |
| Humanity's Last Exam | 39.2% | 38.5% | 22.0% | 开放式作答 pass@1 |
| CritPt | 14.3% | 15.1% | 2.0% | 来源科学推理评测 |
| Omniscience 准确率 | 46.4% | 25.5% | 14.3% | 高分更好;须与幻觉率一起看 |
| Omniscience 幻觉率 | 96.5% | 48.4% | 22.0% | 低分更好;按 AA 的评测定义解释 |
未知与零分不同;* 是来源的暂估标记。百分比只由来源 fraction 换算显示。Elo、通过率和幻觉率各自回答不同问题,本文不再合成总分。
DeepSeek V4.1 Flash 的知识回答不能只看准确率,还要一起看 Omniscience 幻觉率。幻觉率衡量来源规定的作答行为,并非任意业务问答的错误概率;需要可靠引用或拒答的产品,应另外验证自己的问题集与检索链路。Ling 名称中的 VL 也不表示这张主要面向文本任务的表已经验证其视觉能力。
评测覆盖与上一观测:扩容、补齐和暂估转正式要分开
AA 当前目录从 644 增至 647 个模型配置;同一 v4.3 的评测矩阵与 Omniscience 有效行从 519 增至 522。新增的是既有方法下的结果覆盖,本期没有发布新的 Benchmark 或指数版本。
逐项核实 17 个既有 variant 的 v4.3 结果:43 个来源数值变化、19 个先前未知分项获得结果,12 个指数由暂估转为来源未标记暂估。旧观测保留;结果修订与状态变化不直接等同于底层模型能力升级。
本期有 12 个既有配置的指数从暂估转为未标记暂估。下表保留上一观测与本期观测;分数变化可以描述为来源结果修订,不能在缺少模型版本变更证据时直接称作底层能力升级。新模型没有本站上一期同身份观测,不计算“提升幅度”。
| 精确配置 | Intelligence Index | 本期改变或补齐的分项 |
|---|---|---|
| Agnes 2.5 Pro Alpha | 26.77* → 27.80 |
|
| Claude Sonnet 5 (Adaptive Reasoning, High Effort) | 未知 → 32.03 |
|
| Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | 未知 → 34.71 |
|
| GLM-5.3 | 44.86 → 44.86 |
|
| GPT-5.6 Luna (high) | 32.91* → 32.41 |
|
| GPT-5.6 Luna (low) | 21.83* → 21.55 |
|
| GPT-5.6 Luna (medium) | 25.78* → 25.48 |
|
| GPT-5.6 Terra (low) | 27.88* → 27.92 |
|
| GPT-5.6 Terra (medium) | 32.76* → 30.42 |
|
| Granite 4.2 8B | 12.40* → 11.81 |
|
| K2 Horizon 375B A23B | 33.92* → 30.70* |
|
| Kimi K3 (max) | 43.78 → 43.78 |
|
| Kimi K3 (low) | 34.46* → 30.48 |
|
| Qwen3.6 35B A3B (Reasoning) | 22.26* → 18.81 |
|
| Qwen3.8 27B (low) | 29.22* → 26.49 |
|
| Qwen3.8 27B (medium) | 30.66* → 27.81 |
|
| Qwen3.8-Flash-Next | 42.24* → 39.91 |
|
Terminal-Bench v4.0 与旧 v2.1、v4.3 与旧指数版本保持独立。表中未改变的数字保留自身原始 observedAt,不因为本期发表文章而改写;完整点位与日期可在各模型历史页查看。
同期更新:独立榜单覆盖也在扩容
以下数量与本站上次收录的对应榜单快照比较,表示结果覆盖增加,不代表同日发布了同样数量的新模型。各榜单继续保留自己的方法与指标。
- AA-AnalystAgent:30 → 32 个结果,新增 Claude Fable 5.1 (max with fallback) 与 GPT-6 Astra (max);原有配置的 pass^5、pass@1、pass@5 成绩未变。
- AA-Briefcase:62 → 163 个结果,新增 101 个配置。
- GDPval-AA v2:204 → 242 个结果,新增 38 个配置;属于既有 v2 结果覆盖扩容。
- Openness Index:306 → 319 个结果,新增 13 个配置;Nemotron 3.5 Lightning 的开放性指数由 77.78 变为 83.33。
| 精确配置 | pass^5 | pass@1 | pass@5 |
|---|---|---|---|
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 57.5% | 65.8% | 72.5% |
| GPT-6 Astra (max) | 51.2% | 60.0% | 67.5% |
AA-AnalystAgent 的 pass^5 观察重复运行能否全部正确,pass@1 与 pass@5 分别对应单次表现和多次尝试至少一次成功;它们不进入本文的 v4.3 指数组合。该榜单的 DeepSeek V4 Pro 0424 结果属于另一明确版本,不能替代 V4 Pro 0813 的观测或 API 报价。
Openness 描述开放性,不等同于任务能力;其表内 Intelligence 列从旧版切到 v4.3 时,跨版差值不可解释为能力涨跌。GDPval-AA v2 本来已采用 v2,本期扩容不再包装成“发布新版本”。
价格与 API:精确同款报价快照变化
本期核实 8 个精确 OpenRouter model ID 的报价变化。当前值取活跃付费端点中最低正输入价的单一端点,输出价用于同价时排序,所有字段来自同一 provider;价格单位均为美元/百万 Token。它们是本期与历史快照的比较,旧快照未完整记录 provider,因此不宣称同一个 provider 统一降价。
| 模型 / 精确 model ID | 本期 provider / 量化 | 输入 | 输出 | 缓存读取 | 缓存写入 | 报价快照日期 |
|---|---|---|---|---|---|---|
Solar Pro 4upstage/solar-pro4 | Upstage 量化未披露 | $0.03 → $0.09 | $0.12 → $0.36 | $0.006 → $0.018 | 未知 → 未知 | → |
Muse Glimmer (high)meta/muse-glimmer-30b | Phala 量化未披露 | $0.3 → $0.3 | $1.1 → $1.1 | 未知 → $0.04 | 未知 → 未知 | → |
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)deepseek/deepseek-v4-pro-0813 | Baidu fp8 | $1.056 → $0.57816 | $3.168 → $1.73448 | $0.0352 → $0.018396 | 未知 → 未知 | → |
Qwen3.8 2.4T A95Bqwen/qwen3.8-2.4t-a95b | Alibaba 量化未披露 | $2 → $2 | $6 → $6 | $0.2 → $0.25 | 未知 → $2.5 | → |
Qwen3.8 27B (xhigh)qwen/qwen3.8-27b | Darkbloom fp4 | $0.45 → $0.15 | $3.2 → $2 | $0.05 → 未知 | 未知 → 未知 | → |
GLM-5.3z-ai/glm-5.3 | Inceptron fp4 | $1.4 → $0.8727 | $4.4 → $3.36 | $0.26 → $0.1639 | 未知 → 未知 | → |
GLM-5.2 (max)z-ai/glm-5.2 | Baidu fp8 | $0.5 → $0.4802 | $3.15 → $1.5092 | $0.115 → $0.08918 | 未知 → 未知 | → |
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)deepseek/deepseek-v4-flash-0731 | OpenInference fp8 | $0.065 → $0.05 | $0.18 → $0.16 | $0.02 → $0.013 | 未知 → 未知 | → |
端点没有返回缓存价格时,当前值为未知,旧缓存价只作带日期的历史参考;不能从其他 provider 或模型目录拼接一条“最低价”。独立免费型号不属于上述付费报价,AA 单任务成本也不是 OpenRouter API 单价。
DeepSeek V4.1 Flash 本期没有经核实的 Max Effort 精确 API 报价。公开产品页存在不等于其调用设置与 AA 的测试配置一一对应;上表 DeepSeek V4 Flash 0731 和 V4 Pro 0813 是另外两个明确版本。Ling-3.0-flash 的旧报价同样不能挪给 Ling-3.0-flash-VL。
对选型的影响:能力、可靠性与成本分别验证
需要自动化操作或终端任务时,可从 AutomationBench-AA 与 Terminal-Bench 分项筛选候选,再用自己的工具权限、任务集和失败恢复流程验证。长文档场景看 AA-LCR 与 GDP.pdf;需要事实准确和适当拒答时,同时关注 Omniscience 的两个指标。总指数适合缩小范围,不能代替具体业务验收。
比较 DeepSeek V4.1 Flash vs Pro 时,版本、effort 和 API 路由都是比较条件。本文没有为未知 API 假设相同吞吐、延迟或成本;报价有更新的既有型号,也应按输入、输出、缓存结构重新核算,而不是拿家族平均价选型。
未知项与观察时间
- AA 评测观察截止 ;OpenRouter 每个型号的报价时间单独列在表内。
- 本期没有给新配置补造未核实的 API、速度、上下文或发布日期;首次收录时间不能充当厂商发布时间。
- 暂估转正式表示来源的结果状态改变,不意味着 AA 已独立重现厂商的所有能力宣传。
- 本期数字固定读取相同 benchmark、版本和截止时间的历史观测,后续更新不会改写这期表格。