← 返回文章首页

Coding 模型性价比坐标系

用公开的 SWE-bench Pro 结果与官方 API 输出价,快速找到“能力高、成本低”的模型。编码场景以生成代码为主,输出 token 是成本大头,故横轴用输出价。SWE-bench Pro 采用全新的私有任务集,比 Verified 更难、污染更少。

数据核验:2026-08-24价格单位:USD / 1M output tokens

能力 × 价格

横轴为对数刻度|左上区域通常更具性价比

模型明细

模型输入价 / 输出价SWE-bench Pro能力 / 输出价
口径说明

① 分数:全部采用各厂商官方公布的 SWE-bench Pro pass rate(self-reported,经 llm-stats 汇总,2026-08-23 更新)。SWE-bench Pro 使用全新私有任务集(真实 GitHub issue,含隐藏测试),官方口径下最高分为 80.0%(Claude Fable 5),头部模型之间差距比 Verified 更明显。② 价格:横轴与排序统一采用各厂商官方标准 API 价的 output 价格——编码以生成为主,输出 token 成本占比更高;input 价格在明细表中一并列出,未把两者粗暴合并。③ “能力 / 输出价”仅是便于排序的观察指标,不等于真实项目总成本。数据会随模型版本、价格和评测条件变化,请以来源页面为准。

数据来源 SWE-bench Pro 分数:llm-stats.com/swe-bench-pro 基准说明:swebench.com/pro 价格:各模型官方 pricing 页面