temperature 0.2
Chinese Evaluation / Fortune Telling
命理年度详解模型横评
同一份匿名 2026 年固定样本下,对 11 个有效模型输出进行四维 AI 盲评,比较命理依据、现实洞察、行动建议与中文表达。
AI CONTENT SCORE
11 个有效输出完整排名
四项内容维度各 25 分,总分 100。切换维度后,榜单按对应分数重新排序;展开模型可查看原文证据和两轮分差。
- 01DeepSeek-V4-FlashTencentMaaS结构通过
命理逻辑连贯,现实信号具体,建议明确可执行,中文表达自然有节奏,仅少量冗余。
- 02GLM-5V-TurboTencentMaaS结构通过
命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅结尾稍显截断。
- 03DeepSeek-V4-ProTencentMaaS结构通过
命理逻辑连贯,现实信号具体,建议可执行,表达流畅有节奏,仅部分表述稍显重复。
- 04MiniMax-M2.7TencentMaaS需工程修复
命理逻辑清晰,现实信号具体可识别,建议克制可执行,表达自然流畅。
- 05DeepSeek-V3.2TencentMaaS结构通过
命理逻辑清晰,现实映射具体,建议较实用,表达稍冗长,部分内容重复。
- 06Hy3 PreviewTencentMaaS结构通过
命理逻辑通顺,现实信号清晰,建议具体可行,表达自然,仅细节稍显泛泛。
- 07MiniMax-M2.5TencentMaaS结构通过
命理逻辑连贯,现实信号具体,建议可执行,中文表达自然有节奏,仅个别表述稍显夸张。
- 08Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan结构通过
命理推导合理,现实对应较具体,建议较明确,表达稍模板化,部分内容偏泛。
- 09DeepSeek-V3.0324TencentMaaS需工程修复
命理逻辑连贯,现实信号具体,建议较明确但含保健品断言,表达自然流畅。
查看四维得分与原文依据
命理依据22/25现实洞察23/25行动建议20/25中文表达22/25“配备护肝保健品,9月前完成重大事项保险配置”
两轮分差 18 分 · 已触发第三轮复评
查看该次完整输出 ↗ - 10GLM-5TencentMaaS需工程修复
岁运并临解释清晰,现实场景具体,建议有止盈但缺细节,表达有节奏感。
查看四维得分与原文依据
命理依据21/25现实洞察22/25行动建议19/25中文表达22/25“宜设定明确的止盈线,落袋为安或购置保值资产”
两轮分差 14 分 · 已触发第三轮复评
查看该次完整输出 ↗ - 11GLM-5.1TencentMaaS需工程修复
命理逻辑有偏差,现实信号不完整,建议零散,内容截断,表达不连贯。
ENGINEERING STATUS
内容得分之外的工程状态
格式问题不会改写 AI 内容分。4 个输出需要 JSON 修复或补齐字段;小米追加批次的延迟不参与同批次比较。
| 排名 | 模型 | 内容分 | JSON | 字段 | 延迟 | 输出 | 原文 |
|---|---|---|---|---|---|---|---|
| 01 | DeepSeek-V4-FlashTencentMaaS | 95 | 通过 | 完整 | 21.5 秒 | 1,564 Token | 查看 ↗ |
| 02 | GLM-5V-TurboTencentMaaS | 94 | 通过 | 完整 | 88.4 秒 | 2,400 Token | 查看 ↗ |
| 03 | DeepSeek-V4-ProTencentMaaS | 94 | 通过 | 完整 | 43.7 秒 | 1,616 Token | 查看 ↗ |
| 04 | MiniMax-M2.7TencentMaaS | 93 | 需修复 | 不完整 | 85.8 秒 | 1,872 Token | 查看 ↗ |
| 05 | DeepSeek-V3.2TencentMaaS | 91 | 通过 | 完整 | 39.2 秒 | 1,309 Token | 查看 ↗ |
| 06 | Hy3 PreviewTencentMaaS | 90 | 通过 | 完整 | 43.7 秒 | 977 Token | 查看 ↗ |
| 07 | MiniMax-M2.5TencentMaaS | 89 | 通过 | 完整 | 27.2 秒 | 2,045 Token | 查看 ↗ |
| 08 | Xiaomi MiMo V2.5 ProXiaomi MiMo Token Plan | 88 | 通过 | 完整 | 61.8 秒* | 1,258 Token | 查看 ↗ |
| 09 | DeepSeek-V3.0324TencentMaaS | 87 | 需修复 | 不完整 | 27.0 秒 | 794 Token | 查看 ↗ |
| 10 | GLM-5TencentMaaS | 84 | 需修复 | 不完整 | 42.5 秒 | 2,400 Token | 查看 ↗ |
| 11 | GLM-5.1TencentMaaS | 47 | 通过 | 不完整 | 52.1 秒 | 2,400 Token | 查看 ↗ |
* Xiaomi MiMo V2.5 Pro 来自后续独立批次,最大输出长度不同,延迟只作记录。
JUDGING PROTOCOL
AI 盲评怎样产生
同一份匿名固定样本:事业与财富得分较高、健康得分较低,用于检验模型能否解释高机会与高风险并存的年度状态。
- 01
命理依据是否解释大运、流年、藏干、十神与岁运并临,而不是只堆术语
- 02
是否把事业、财富、关系与健康的强弱翻译成具体体感和现实信号
- 03
行动建议是否明确、克制、可执行,能够回应高机会与高风险并存的状态
- 04
中文是否自然、清晰、有节奏,适合面向用户的产品阅读
至少 2 轮独立评分
触发第三轮,按各维中位数聚合
2026-07-22
LIMITATIONS
这份排名不能说明什么
它是固定样本上的内容质量复评,不是命理有效性证明,也不是通用中文能力排名。
这是单一匿名固定样本,不代表模型在所有命理任务上的平均水平。
内容得分由 AI Judge 在匿名、乱序条件下按专题 rubric 生成,只适用于本次固定样本,不是全站综合评分。
小米模型来自后续独立批次,最大输出长度不同,因此延迟不宜与主批次直接排名。
本专题评估中文产品输出质量与结构稳定性,不验证命理预测是否具有科学有效性;Judge 也可能存在模型偏好。
PROVENANCE
来源与机器数据
结构化镜像同时保留 11 个有效输出、AI Judge 逐轮分数和原始运行记录。