本站判断 · 基于公开证据
中文选型可从 Kimi K3、DeepSeek V4 Flash 和 Qwen 等候选开始;先按任务与预算筛选,再比较同一评测版本、同一推理档位的结果,不能把国产综合排名当作中文能力排名。
本页 2026-07-21 的选型依据属于历史参考,不据此判断当前第一名。AA Intelligence Index v4.1 与 v4.3 不可直接比较;最新结果请查看评测拆解和具体模型页,价格与 API 以精确变体的来源和观测日期为准。
DECISION SHORTLIST
不同场景直接选谁
先给默认选择,再说明在哪些条件下应该换模型。
Kimi K3
作为候选查看具体变体的综合与任务评测,并与同版本、同推理档位的模型比较;历史名次不代表当前排名。
DeepSeek V4 Flash 0731
适合高频调用和成本敏感场景;复杂任务还要观察重试与返工后的总成本。
Qwen3.7 Max / Qwen 系列
优先用于需要阿里生态、开放模型选项和私有部署路线的团队。
PUBLIC EVIDENCE
结论依据什么
不同指标保持原单位,不合成为本站自定义总分。
中文模型至少要看四张榜
一张总榜会掩盖任务差异。更可靠的入口是综合能力、中文表达、Coding 和成本性能四个并列视角。
- 综合能力:公开 Intelligence Index
- 中文体验:固定中文任务输出
- 软件工程:Coding Index 与 Agent 数据
- 商业使用:价格、速度与 Provider
国产模型不等于中文模型
国产模型描述机构和生态来源,中文模型描述使用能力。海外模型也可能有很强的中文表现,国产模型也需要按具体版本验证中文任务。两者可以交叉筛选,但不能混为一个标签。
FAQ
常见问题
中文大模型第一名是谁?
没有一个跨任务、跨评测版本通用的第一名。先区分中文表达、Coding、价格和部署需求,再核对同版本评测、具体变体与观测日期;本页历史选型依据不代表当前排名。
为什么不做一个中文综合总分?
不同来源指标的样本、单位和权重不同。强行合并会变成本站自创评估体系,降低可解释性。
国产模型应该从哪里开始看?
先看中国模型分析,再进入国产 Coding、中文测评和具体模型详情核对版本。
本页路径:/rankings/chinese-llm/。模型和工具版本会变化,引用结论时请同时保留页面更新时间与原始来源。