能力榜:同口径优先
主榜的“能力指数”优先使用 Artificial Analysis Intelligence Index v4.3.x。它聚合知识工作、编程/终端、科学推理、长上下文、Agent 自动化等评测。我们不把不同版本的指数直接混排。
Methodology & Sources
为了让榜单可复核,我们把“独立测评”“官方规格”“本站建议”明确分层。你可以同意或不同意推荐,但至少能知道结论是怎么来的。
主榜的“能力指数”优先使用 Artificial Analysis Intelligence Index v4.3.x。它聚合知识工作、编程/终端、科学推理、长上下文、Agent 自动化等评测。我们不把不同版本的指数直接混排。
模型是否最新、发布日期、上下文、输入模态、API 价格、是否开放权重等信息,以厂商官方文档 / 模型卡为主;独立平台用于交叉验证。
“适合编程”“适合批量处理”等是本站基于能力、速度、价格、上下文和产品定位做的编辑推荐,不与独立能力指数混成一个看似精确的总分。
Seed2.1、ERNIE 5.1 等模型如果没有当前同口径独立指数,就显示“待统一评测”。这比用厂商自测数字强行换算更诚实。
Source Ledger
数据快照截至 2026-09-27。外部页面会继续变化。