这个评测关注什么
同时观察回答正确性与模型是否知道自己不知道。
阅读时注意
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
适用场景
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。
知识边界
AA-Omniscience 公开榜单,比较 528 个模型的知识可靠指数、准确率与幻觉率。本站保留 Artificial Analysis 原始口径,不合成新总分。
FAQ
回答只使用来源页面可以明确核对的指标定义。
它奖励正确回答、惩罚错误猜测,对拒绝回答不扣分。分数范围为 -100 到 100,用于同时观察知识准确性与模型管理不确定性的能力。
Accuracy 观察全部问题中回答正确的比例;Hallucination Rate 观察模型缺少知识时仍选择错误作答的倾向。两者不能互相替代。
负分表示在该评测中,模型的错误回答多于正确回答。它不等于模型在所有任务上都不可用,只反映这套知识与幻觉测试的结果。
同时观察回答正确性与模型是否知道自己不知道。
评测结果受任务集合、评分方法和模型版本影响。本站保留原始口径,不用它生成新的综合排名。
用于回答一个明确的问题:模型在这一类任务上的相对表现如何,而不是“哪个模型绝对最好”。