Methodology & Sources

排名不是“拍脑袋”,
也不是把厂商跑分抄在一起。

为了让榜单可复核,我们把“独立测评”“官方规格”“本站建议”明确分层。你可以同意或不同意推荐,但至少能知道结论是怎么来的。

01

能力榜:同口径优先

主榜的“能力指数”优先使用 Artificial Analysis Intelligence Index v4.3.x。它聚合知识工作、编程/终端、科学推理、长上下文、Agent 自动化等评测。我们不把不同版本的指数直接混排。

02

规格:回到官方

模型是否最新、发布日期、上下文、输入模态、API 价格、是否开放权重等信息,以厂商官方文档 / 模型卡为主;独立平台用于交叉验证。

03

推荐:不伪装成客观分数

“适合编程”“适合批量处理”等是本站基于能力、速度、价格、上下文和产品定位做的编辑推荐,不与独立能力指数混成一个看似精确的总分。

04

缺数据就留空

Seed2.1、ERNIE 5.1 等模型如果没有当前同口径独立指数,就显示“待统一评测”。这比用厂商自测数字强行换算更诚实。

Source Ledger

核心来源

数据快照截至 2026-09-27。外部页面会继续变化。

读榜单时,记住这 4 个限制