Chinese LLM Ranking

中文大模型排行榜

从公开综合能力、中文固定样本、Coding、成本和速度多个视角比较中文大模型,不把不同评测单位合成为本站总分。

数据快照:2026-09-15

本站判断 · 基于公开证据

中文选型可从 Kimi K3、DeepSeek V4 Flash 和 Qwen 等候选开始;先按任务与预算筛选,再比较同一评测版本、同一推理档位的结果,不能把国产综合排名当作中文能力排名。

本页 2026-07-21 的选型依据属于历史参考,不据此判断当前第一名。AA Intelligence Index v4.1 与 v4.3 不可直接比较;最新结果请查看评测拆解和具体模型页,价格与 API 以精确变体的来源和观测日期为准。

判断置信度:高页面更新:2026-09-15证据快照:2026-07-21

DECISION SHORTLIST

不同场景直接选谁

先给默认选择,再说明在哪些条件下应该换模型。

综合能力候选

Kimi K3

作为候选查看具体变体的综合与任务评测,并与同版本、同推理档位的模型比较;历史名次不代表当前排名。

低成本 API

DeepSeek V4 Flash 0731

适合高频调用和成本敏感场景;复杂任务还要观察重试与返工后的总成本。

开放生态 / 部署

Qwen3.7 Max / Qwen 系列

优先用于需要阿里生态、开放模型选项和私有部署路线的团队。

PUBLIC EVIDENCE

结论依据什么

不同指标保持原单位,不合成为本站自定义总分。

01

公开智能指数

比较不同国家和机构模型的综合能力,但保留原始来源口径。

模型排行榜
02

中文固定样本

补充通用英文 Benchmark 难以反映的中文表达与产品阅读体验。

中文测评
03

国家与机构视角

单独查看中国机构模型及其在统一智能指数中的位置。

中国模型分析

中文模型至少要看四张榜

一张总榜会掩盖任务差异。更可靠的入口是综合能力、中文表达、Coding 和成本性能四个并列视角。

  • 综合能力:公开 Intelligence Index
  • 中文体验:固定中文任务输出
  • 软件工程:Coding Index 与 Agent 数据
  • 商业使用:价格、速度与 Provider

国产模型不等于中文模型

国产模型描述机构和生态来源,中文模型描述使用能力。海外模型也可能有很强的中文表现,国产模型也需要按具体版本验证中文任务。两者可以交叉筛选,但不能混为一个标签。

FAQ

常见问题

中文大模型第一名是谁?

没有一个跨任务、跨评测版本通用的第一名。先区分中文表达、Coding、价格和部署需求,再核对同版本评测、具体变体与观测日期;本页历史选型依据不代表当前排名。

为什么不做一个中文综合总分?

不同来源指标的样本、单位和权重不同。强行合并会变成本站自创评估体系,降低可解释性。

国产模型应该从哪里开始看?

先看中国模型分析,再进入国产 Coding、中文测评和具体模型详情核对版本。

本页路径:/rankings/chinese-llm/。模型和工具版本会变化,引用结论时请同时保留页面更新时间与原始来源。