2026 年 8 月 AI/LLM 趋势图表解读
基于 AI Trends (August 2026) — AI Trend Analysis, LLM Statistics & Industry Insights 最新数据快照,逐图解读 48 张 AI/LLM 趋势图表及其比较边界。
- 整体趋势总结
- 与上一期相比
- 方法与局限
- 数据范围与读图方法
- 基准与综合能力:前沿抬升,头部差距仍会波动
- 实验室与国家:新增发布仍由中美主导
- 开放模型:能力逼近,短期发布占比回落
- 模型形态:多模态与 MoE 继续扩张
- 价格与价值:40+ 综合分进入每百万 token 一角区间
- 效率与规模:门槛越高,规模与成本跃迁越明显
- 速度与上下文:200 万窗口保持纪录,吞吐仍有能力税
- 人类偏好:指数有方向性,价格解释力仍弱
数据来源:AI Trends (August 2026) — AI Trend Analysis, LLM Statistics & Industry Insights;抓取日期:2026-08-03;动态图表数量:48。
AI 模型的能力、价格、速度和使用偏好都在持续变化。单看某一张排行榜,很容易把评测分数、真实体验和成本效率混为一谈。这份报告先给出跨图整体判断及其依据,再说明方法和口径,随后按主题逐图展开。
整体趋势总结
1. 能力前沿继续抬升,但头部差距并未单向收窄
判断依据: GPT-5.6 Sol 与 Claude Opus 5 的 LLM Stats Score 都达到 57.9;当前第 1 与第 10 名相差 8.8 分,高于 GPT-5 时点的 4.7 分,说明头部仍拥挤但差距会随新模型发布重新扩张。
2. 模型供给继续增长,中美仍是绝对发布中心
判断依据: 收录总量从上一期 322 增至 334;美国由 164 增至 173,中国由 118 增至 121,两国合计占当前 334 个模型中的 294 个。
3. 开放权重能力贴近闭源,但最新发布结构出现反向波动
判断依据: 开放与闭源的综合分前沿在图末只剩较小视觉差距;但 2026 年 7 月展示的 12 次发布中,开放模型仅 3 个、占 25%,与上一季度 53% 的开放占比形成反差。
4. 同等综合能力持续变便宜,低价前沿由中国模型推动
判断依据: 40+ LLM Stats Score 的最低价格从每百万 token 3.8 美元降至 0.10 美元,降幅 97%;DeepSeek-V4-Flash-0731 以 0.10 美元取得 49.0 分,中国模型的价格中位数也降至 0.48 美元。
5. 参数量和训练数据仍无法单独解释能力
判断依据: 达到 30+ 综合分的最小模型已降到 25.2B,但 50+ 仍需 2.8T 参数;训练 token 与 LLM Stats Score 的回归 R² 仅 0.06,同样数据规模下分数差异很大。
6. 更大上下文已成平台能力,速度仍要支付能力税
判断依据: 上下文纪录维持在 200 万 token;GPT-5.6 Sol 可在 157 token/s 达到 57.9 分,而 Mercury 2 达到约 1009 token/s 时综合分只有 25.0。
7. 综合指数能提供方向,但不能替代人类偏好
判断依据: LLM Stats Score 与 Arena 的 Pearson r 只有 0.25,另一组样本 R² 为 0.31;价格对 Arena 偏好的解释力也只有 14%,高偏好模型横跨 0.65 至 30 美元。
与上一期相比
对比基线:2026 年 7 月 AI/LLM 趋势图表解读;上一期抓取日期:2026-07-11。
两期都包含 48 张图,但本期有 11 个原始标题发生变化,核心能力口径从 GPQA / SWE-Bench 大面积切换到 LLM Stats Score / Coding Index。发布量、国家价格中位数和偏好榜单可做同口径快照比较;能力、效率与相关性图则必须先处理口径变化。
1. 能力轴从单项 benchmark 转向综合指数
对比证据: 上一期图 22、23、35、36、40、41 分别使用 GPQA 或 SWE-Bench;本期对应图改为 LLM Stats Score 或 Coding Index,连图 17 的门槛也从 75%+ GPQA 改为 40+ 综合分。
可比性说明: 指标公式和量纲发生切换,不可把两期分数、门槛成本或参数效率直接计算环比。
2. 收录模型增加 12 个,新增量主要来自美国
对比证据: 总收录量由 322 增至 334;美国由 164 增至 173,增加 9 个,中国由 118 增至 121,增加 3 个,法国等其他国家的累计值未变。
可比性说明: 同一来源、同一累计发布口径,可直接比较;它仍只代表站点收录范围。
3. 最新显示季度的开放发布占比降到 25%
对比证据: 上一期最新完整显示的 2026 年第二季度为开放 53%、专有 48%;本期新增的 2026 年第三季度当前只有 12 次发布,其中开放 3 次、专有 9 次。
可比性说明: 分类口径相同,但本期第三季度只覆盖 7 月,不能据此断言整季开放生态转弱。
4. 中国模型的价格中位数继续下降
对比证据: 同名图 Price by Country 中,中国最低价格中位数由上一期每百万 token 0.65 美元降至本期 0.48 美元。
可比性说明: 图表口径相同,可作为站点当前样本的直接快照比较;模型集合变化也会移动中位数。
5. 人类偏好榜首由 GPT-5.5 换成 GPT-5.6 Sol
对比证据: 上一期 Human Preference Map 的 GPT-5.5 保守评分为 24.4;本期 GPT-5.6 Sol 以 29.5 居首,GPT-5.5 为 24.5。
可比性说明: 两期都标注为盲测偏好的 μ − 3σ 保守评分,但投票样本和参赛模型随时间更新。
6. 价格与偏好的关系仍弱,解释力从 8% 升到 14%
对比证据: Cost vs Arena Rating 的 R² 从上一期 8% 变为本期 14%;本期 0.65 美元的 MiMo-V2.5-Pro 得到 23.9,而 30 美元的 Claude Fable 5 为 24.7。
可比性说明: 横纵轴口径相同,但样本集合更新;数值上升不代表价格产生了更强因果作用。
方法与局限
- 时间快照:模型、价格、评测和用户投票会持续变化,所有判断只代表本次抓取日期。
- 口径差异:不同图表可能采用不同样本、基准、硬件、区域或定价单位,不能把数值直接拼成因果关系。
- 相关不等于因果:散点图或时间趋势只能说明变量共同变化,不能单独证明某个因素导致另一个结果。
- 来源边界:图表版权与原始数据解释权归来源网站;引用时应保留来源链接和抓取日期。
数据范围与读图方法
本次分析覆盖来源页面在抓取时稳定呈现的 48 张图表。只有连续两次扫描得到相同的有序图表集合,才会进入解读阶段。明确数字来自图卡文字、坐标、图例或可见标签;仅凭图形走势得到的判断会明确标记为视觉推断。
不同评测、价格口径、参数规模和吞吐量的采集条件并不完全一致,因此跨图比较适合发现候选趋势,不应被理解为严格受控实验。
读图术语
- 综合能力分(LLM Stats Score):来源站点汇总多项能力信号形成的整体能力指数;它不是 GPQA 等单一 benchmark 的百分制分数。
- 编程能力指数(Coding Index):来源站点用于概括模型编程表现的综合指标,具体样本与权重受来源口径约束。
- 基准测试(Benchmark):使用统一任务、数据集和评分规则比较模型能力的测试体系,只覆盖其设计所包含的能力维度。
- Arena 偏好评分(Arena Rating):来自匿名模型对战或用户选择的相对偏好指标;不同图可能使用原始 rating、标准化分或保守估计。
- 帕累托前沿(Pareto Frontier):前沿上的点无法在不牺牲一个比较维度的情况下继续改善另一个维度。
- 混合专家模型(Mixture of Experts, MoE):每次推理只激活部分专家参数的架构;总参数量不等于单次推理的实际激活计算量。
- 开放权重模型(Open-weight Model):公开模型权重、允许本地部署或再开发的模型,不必然等同于完整意义上的开源软件。
- 吞吐量(Throughput):通常以每秒生成的 token 数衡量,会受到硬件、服务商、批量大小和测试配置影响。
- 决定系数与皮尔逊相关(Coefficient of Determination, R² / Pearson Correlation Coefficient, r):R² 表示回归所解释的方差比例,r 表示线性相关方向与强度;相关关系不能单独证明因果。
基准与综合能力:前沿抬升,头部差距仍会波动
本组结论: 旧 benchmark 继续出现饱和,但综合分第 1 与第 10 名当前相差 8.8 分;前沿总体上升并扩散到更多实验室,头部差距却不是单向收窄。
图 01|基准测试饱和度
原始标题:Benchmark Saturation
怎么看: 横轴是时间,纵轴是各 benchmark 的历史最佳得分;阶梯上升表示纪录被刷新,红色虚线标出 85% 饱和参考线。
图表显示: AIME 2025、SimpleQA、MMMLU 等较早或较窄的任务已进入高分区,OSWorld、Terminal Bench、Apex Agents 等任务仍明显低于饱和线。
关键模型 / 数据点:
- 85%:来源图定义的饱和参考线。
- 2025 年 5 月:SimpleQA 93.4%、AIME 2025 93.3%、MMMLU 87.7%。
- 同一时点:BrowseComp 51.5%、Terminal Bench 35.2%、OSWorld 8.8%。
解读边界: 不同 benchmark 的分数不可直接横向比较难度;图中只展示历史最好成绩,不代表模型总体分布。
证据依据
- 直接证据:图中标出 Saturation (85%) 参考线
- 直接证据:tooltip 给出 2025 年 5 月各 benchmark 的明确分数
图 02|头部综合分差距
原始标题:The Convergence
怎么看: 两条阶梯线分别表示 LLM Stats Score 第 1 名与第 10 名;两线的垂直距离就是头部差距。
图表显示: 前沿综合分持续上升,但头部差距会随新模型出现而重新扩大;当前卡片给出的差距为 8.8 分,并非单调收敛。
关键模型 / 数据点:
- GPT-5(2025 年 8 月):第 1 名 35.0,领先第 10 名 4.7 分。
- GPT-5.5(2026 年 5 月):第 1 名 49.1,领先 6.6 分。
- 当前卡片:第 1 名 GPT-5.6 Sol、第 10 名 GPT-5.5,差距 8.8 分。
解读边界: 卡片的当前差距为 8.8,但 GPT-5.6 Sol 的捕获 tooltip 显示 11.1;来源内部存在不一致,因此不据此计算精细环比。
证据依据
- 直接证据:图卡写明 Current gap: 8.8 points
- 直接证据:tooltip 给出 GPT-5 与 GPT-5.5 时点的分数和头尾差距
图 03|主要实验室过去一年的综合进步
原始标题:Lab Progress
怎么看: 左栏是 LLM Stats Score,右栏是 Coding Index;灰色表示 12 个月前的起点,彩色段表示一年增量。
图表显示: Anthropic 与 OpenAI 在综合分并列 57.9,OpenAI 在 Coding Index 以 50.2 居首;Moonshot AI 的一年综合分增量达到 32.8。
关键模型 / 数据点:
- Anthropic:综合分 30.8 → 57.9,增加 27.1;Coding Index 21.8 → 48.5。
- OpenAI:综合分 30.2 → 57.9;Coding Index 26.9 → 50.2。
- Moonshot AI:综合分 22.8 → 55.7,增加 32.8;Coding Index 升至 44.9。
解读边界: 每个组织只取其最好模型,不能据此比较组织的平均模型质量、投入产出或全部产品线。
证据依据
- 直接证据:tooltip 给出各实验室 12 个月前、当前和增量
- 直接证据:图中标出综合分与 Coding Index 的当前排序
图 04|组织级综合分纪录演进
原始标题:Organization Progress
怎么看: 每条阶梯线代表一个组织的历史最佳 LLM Stats Score;横轴为时间,纵轴为综合分。
图表显示: 2025 年后多个组织的最好成绩持续进入 40–60 分区间,能力前沿不再只由单个实验室刷新。
关键模型 / 数据点:
- 2025 年 4 月:OpenAI 31.9、xAI 31.5、Qwen 团队 22.1。
- 同一时点:Anthropic 20.2、Moonshot AI 18.2、Google 17.2、DeepSeek 16.6。
解读边界: 图例和线条密集,当前端点没有逐一标出精确数值;本图适合看扩散趋势,不适合估读个位数差距。
证据依据
- 直接证据:tooltip 给出 2025 年 4 月十个组织的明确数值
- 视觉推断:2026 年多条阶梯线进入 40 分以上区域
实验室与国家:新增发布仍由中美主导
本组结论: 站点收录量增至 334,美国与中国合计 294 个;美国仍领先,中国的综合能力前沿与发布份额继续处在第二极。
图 05|中美前沿综合分差距
原始标题:US vs China Gap
怎么看: 蓝色与粉色阶梯分别表示美国和中国模型的历史最佳 LLM Stats Score,线间距离反映前沿差距。
图表显示: 美国当前仍领先,但中国曲线在 2025–2026 年持续逼近;图末差距明显小于 2024 年。
关键模型 / 数据点:
- 2023 年 3 月:中国 9.4,美国 -8.3。
- 2024 年 5 月:美国 13.0,中国 9.4。
- 2024 年 12 月:美国 25.7,中国 15.4。
解读边界: 国家归属按来源站点口径;当前端点未提供 tooltip 精确值,只能把收窄视为视觉趋势。
证据依据
- 直接证据:tooltip 给出三个历史时点的中美综合分
- 视觉推断:2026 年末端两条曲线的垂直距离较 2024 年明显缩小
图 06|各国累计模型发布量
原始标题:Cumulative AI Model Releases
怎么看: 横向条形长度表示来源站点累计收录的模型发布数量。
图表显示: 发布活动高度集中在美国和中国,两国合计 294 个,占当前 334 个收录模型的约 88%。
关键模型 / 数据点:
- 美国:173 个;中国:121 个。
- 法国:32 个;加拿大 3 个。
- 以色列和印度各 2 个,韩国 1 个。
解读边界: 这是站点收录的发布数,不等同于各国全部模型、产业规模或研发投入。
证据依据
- 直接证据:图中和 tooltip 均标出各国累计数量
图 07|月度模型发布热力图
原始标题:The Release Heatmap
怎么看: 行表示年份、列表示月份;格子数字为当月发布量,颜色越深表示发布越密集。
图表显示: 2025 年仍是发布最密集年份;2026 年 7 月新增 12 个模型,使站点自 2023 年以来的累计量达到 334。
关键模型 / 数据点:
- 2025 年 12 月:30 个,为图中单月峰值。
- 2026 年 2–4 月:16、20、18 个。
- 2026 年 5–7 月:8、13、12 个。
解读边界: 2023 与 2026 都是不完整年度;当前 8 月为 0,可能只是尚未收录,不能解释为发布停滞。
证据依据
- 直接证据:图卡写明 334 models released since 2023
- 直接证据:热力图和 tooltip 给出逐月发布数
图 08|各国发布份额变化
原始标题:Model Releases by Country
怎么看: 堆叠面积图展示各国在累计收录模型中的份额,所有国家在每个时点合计为 100%。
图表显示: 美国份额随中国和法国进入而下降,但图末仍约占一半;中国已经形成稳定的第二大份额。
关键模型 / 数据点:
- 2023 年 4 月:美国 100%,其他国家 0%。
- 2024 年 12 月:美国 66%、中国 18%、法国 11%、以色列 3%、加拿大 2%。
解读边界: 交互捕获没有给出当前精确份额,末端比例只作视觉判断;累计份额也会受早期收录影响。
证据依据
- 直接证据:tooltip 给出 2023 年 4 月和 2024 年 12 月的国家份额
- 视觉推断:图末美国面积约一半,中国面积约三分之一
图 09|主要实验室累计发布轨迹
原始标题:Cumulative Releases by Lab
怎么看: 五条阶梯线表示 OpenAI、Qwen、Google、Mistral、DeepSeek 的累计模型发布数。
图表显示: Qwen 与 OpenAI 的累计发布线在图末处于最上方,Google 与 Mistral 构成第二梯队,DeepSeek 数量较少。
关键模型 / 数据点:
- 2024 年 12 月:OpenAI 10、Qwen 10、Google 7。
- 同一时点:Mistral 7、DeepSeek 2。
解读边界: 纵轴显示与 tooltip 口径存在视觉混杂,当前端点没有精确标签;结论只使用可核对历史点和相对次序。
证据依据
- 直接证据:tooltip 给出 2024 年 12 月五家实验室的累计数量
- 视觉推断:Qwen 与 OpenAI 的末端阶梯高于其余三家
开放模型:能力逼近,短期发布占比回落
本组结论: 开放权重前沿已接近闭源前沿,但 2026 年第三季度当前 12 次发布中开放模型只占 25%;能力差距和发布节奏需要分开观察。
图 10|开放与专有模型发布占比
原始标题:Open vs Proprietary Releases
怎么看: 折线分割每季度开放模型与专有模型的发布占比,二者合计约为 100%。
图表显示: 开放发布占比波动很大;2026 年第二季度略过半,第三季度当前只占 25%,但该季度目前只有 7 月的 12 次发布。
关键模型 / 数据点:
- 2025 年第一季度:37 次发布,开放 28 个(76%)。
- 2026 年第二季度:40 次发布,开放 21 个(53%)。
- 2026 年第三季度当前:12 次发布,开放 3 个(25%)、专有 9 个(75%)。
解读边界: 第三季度尚未结束,25% 不能直接代表完整季度;Open Source 标签也按来源站点分类。
证据依据
- 直接证据:tooltip 给出各季度总量、开放与专有数量及占比
图 11|开放权重与闭源综合分差距
原始标题:The Closing Gap
怎么看: 紫色与绿色阶梯分别表示闭源和开放权重模型的历史最佳 LLM Stats Score。
图表显示: 开放权重前沿在 2025–2026 年快速追近,图末与闭源前沿只剩较小视觉差距,但闭源仍略高。
关键模型 / 数据点:
- 2023 年 6 月:开放权重 9.4,闭源 4.3。
- 2025 年 1 月:闭源 25.7,开放权重 23.3。
解读边界: 比较的是两类模型各自最好成绩,不代表开放模型平均质量已经追平;当前端点缺少精确 tooltip。
证据依据
- 直接证据:tooltip 给出 2023 年 6 月和 2025 年 1 月的前沿分数
- 视觉推断:图末两条阶梯线的距离明显缩小
图 12|中美开放权重与闭源竞赛
原始标题:Open Weights Race: US vs China
怎么看: 四条线同时比较美国开放、美国闭源、中国开放和中国闭源模型的综合分前沿。
图表显示: 美国闭源前沿仍最高,中国开放前沿在图末跃升到第二;美国开放前沿则低于另外三条线。
关键模型 / 数据点:
- 2024 年 6 月:中国闭源 18.2、中国开放 9.4、美国开放 0.3、美国闭源 -8.3。
- 2024 年 7 月:美国闭源 31.5、中国闭源 18.2、中国开放 16.6、美国开放 15.9。
解读边界: 当前端点没有精确 tooltip;开放和国家归属均采用来源分类,不能外推到完整生态。
证据依据
- 直接证据:tooltip 给出 2024 年 6–7 月四条轨迹的数值
- 视觉推断:图末美国闭源最高,中国开放次之
模型形态:多模态与 MoE 继续扩张
本组结论: 2026 年第三季度当前多模态模型占 75%,开放模型高分区也以 MoE 点为主;两者正从附加特性变成前沿模型的常见设计。
图 13|新模型的多模态转向
原始标题:The Multimodal Shift
怎么看: 折线展示每季度新模型中具备视觉或多模态能力的比例,其余为纯文本模型。
图表显示: 多模态占比从 2025 年第四季度起处于较高区间,2026 年第三季度当前达到 75%。
关键模型 / 数据点:
- 2025 年第四季度:46 个模型,多模态 36 个(78%)。
- 2026 年第二季度:39 个模型,多模态 27 个(69%)。
- 2026 年第三季度当前:12 个模型,多模态 9 个(75%)。
解读边界: 2026 年第三季度当前只覆盖 7 月,样本为 12 个;季度占比仍可能变化。
证据依据
- 直接证据:tooltip 给出各季度模型总数和多模态数量
图 14|开放模型中的 MoE 采用
原始标题:MoE Adoption Over Time
怎么看: 横轴为发布日期,纵轴为 LLM Stats Score;蓝色为 MoE 开放模型,灰色为非 MoE 开放模型。
图表显示: 2026 年开放模型高分区持续由 MoE 扩张,7 月的 Kimi K3 和 DeepSeek-V4-Flash-0731 都进入接近或超过 50 分的区域。
关键模型 / 数据点:
- Kimi K2.6(2026-04-20):44.6。
- GLM-5.2(2026-06-16):47.0。
- Kimi K3(2026-07-16):55.7;DeepSeek-V4-Flash-0731(07-31):49.0。
解读边界: 散点只覆盖具备来源站点评分和架构标签的开放权重 canonical 模型,不能代表全部模型。
证据依据
- 直接证据:tooltip 给出模型、发布日期和 LLM Stats Score
- 视觉推断:高分区的多数可见点为蓝色 MoE
价格与价值:40+ 综合分进入每百万 token 一角区间
本组结论: 综合能力的最低购买成本继续下降,DeepSeek-V4-Flash-0731 以 0.10 美元取得 49.0 分;高价仍主要购买最后几个综合分和更高编程上限。
图 15|各国模型价格分布
原始标题:Price by Country
怎么看: 纵轴是每百万 token 的价格并使用对数尺度,横轴按模型来源国分组,短横线表示各国中位数。
图表显示: 中国模型的价格中位数最低,为 0.48 美元;同组既有 0.10 美元的高分模型,也有数美元的前沿模型。
关键模型 / 数据点:
- 中国模型价格中位数:每百万 token 0.48 美元。
- DeepSeek-V4-Flash-0731:0.10 美元,LLM Stats Score 49.0。
- GLM-5.2:1.3 美元、47.0;Kimi K3:5.0 美元、55.7。
- Claude Opus 5:8.3 美元、57.9。
解读边界: 价格是来源站点的混合 API 口径,不等同于基础设施成本;各国样本量差异很大。
证据依据
- 直接证据:图卡写明 Lowest median price: China at $0.48/M tokens
- 直接证据:tooltip 给出代表模型的价格和综合分
图 16|单位综合能力价格持续下降
原始标题:The Price of Intelligence
怎么看: 三条阶梯分别跟踪达到 30+、40+、50+ LLM Stats Score 时最便宜模型的单位分数成本,纵轴为对数尺度。
图表显示: 40+ 档位的每分成本从 0.09 美元降至 0.002 美元,降幅 98%;50+ 档位仍显著更贵。
关键模型 / 数据点:
- 40+ 档位:每个综合分成本 0.09 → 0.002 美元,下降 98%。
- DeepSeek-V4-Flash-0731:0.10 美元、49.0 分,每分成本 0.002 美元。
- Claude Opus 5:8.3 美元、57.9 分;GPT-5.6 Terra:4.6 美元、53.3 分。
解读边界: 单位分数成本依赖来源定义的综合分,不能与上一期 GPQA 每点成本直接换算。
证据依据
- 直接证据:图卡给出 40+ tier 的 98% 降幅和 $0.09 → $0.002
- 直接证据:tooltip 给出模型价格、综合分和 cost/point
图 17|达到 40+ 综合分的最低价格
原始标题:Cheapest 40+ LLM Stats Score Model
怎么看: 阶梯线记录每次出现更便宜且 LLM Stats Score 至少为 40 的模型,灰点是同期其他达标模型。
图表显示: 达标最低价在半年内从 3.8 美元降至 0.10 美元,降幅 97%。
关键模型 / 数据点:
- GPT-5.2:3.8 美元,42.1 分。
- Seed 2.0 Pro:0.92 美元,40.3 分。
- MiniMax M3:0.45 美元,43.1 分。
- DeepSeek-V4-Flash-0731:0.10 美元,49.0 分。
解读边界: 这是 40+ 综合分的新口径,不能与上一期 75%+ GPQA 门槛做数值环比。
证据依据
- 直接证据:图卡写明 97% cheaper: $3.8 → $0.10
- 直接证据:tooltip 给出五个达标模型的价格和综合分
图 18|编程前沿与平均价格并不同步
原始标题:Capability vs Price
怎么看: 绿色线表示各季度 Coding Index 的历史最好值,灰色柱表示当季模型平均价格,左右轴分别对应价格和指数。
图表显示: Coding Index 从 12.1 升到 50.2,平均价格却先降后升;能力提升与季度平均价格没有一一对应。
关键模型 / 数据点:
- 2024 年第二季度:Coding Index 12.1,平均价 13.1 美元。
- 2025 年第四季度:Coding Index 24.6,平均价 3.1 美元。
- 2026 年第二季度:48.5、6.1 美元;第三季度当前:50.2、6.7 美元。
解读边界: 平均价格受当季发布组合影响,不能解释为同一个模型自动降价,也不能证明价格导致能力变化。
证据依据
- 直接证据:tooltip 给出每季度 SOTA 模型、Coding Index 和平均价格
图 19|综合能力与价格分布
原始标题:Performance vs Price
怎么看: 横轴是混合 API 价格并采用对数尺度,纵轴是 LLM Stats Score,颜色区分实验室。
图表显示: 总体趋势线向右上,但相近综合分横跨多个价格数量级;低价模型已经进入 40–50 分区间。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:0.10 美元,49.0 分。
- MiniMax M3:0.45 美元,43.1 分;Qwen3.7-Plus:0.48 美元,43.8 分。
- Claude Opus 5:8.3 美元,57.9 分;GPT-5.6 Sol:9.2 美元,57.9 分。
解读边界: 散点相关不代表更高价格导致更高能力;价格还包含服务、上下文、限额和供应商策略。
证据依据
- 直接证据:tooltip 给出代表模型的价格和 LLM Stats Score
- 视觉推断:相近分数在横轴上跨越多个价格档位
图 20|不同规模档位的成本效率
原始标题:Cost Efficiency by Tier
怎么看: 横轴按参数规模分档,纵轴是来源定义的每个 LLM Stats Score 质量点成本,对数轴越低越好。
图表显示: 各规模档位内部差异很大,当前最佳值来自 DeepSeek-V4-Flash-0731,而不是最小或最贵的模型。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:49.0 分、0.10 美元,来源 quality point 成本 0.21 美元。
- DeepSeek-V4-Flash-Max:39.7 分、0.12 美元,quality point 成本 0.29 美元。
- Step-3.5-Flash:37.6 分、0.15 美元,quality point 成本 0.40 美元。
解读边界: quality point 是来源图的缩放口径,不能用普通美元/分自行替换;总参数量也不等于 MoE 激活参数。
证据依据
- 直接证据:图卡写明 Best value: DeepSeek-V4-Flash-0731 at $0.21/quality point
- 直接证据:tooltip 给出代表模型的分数、价格和 cost/point
图 21|单位价格价值的季度演化
原始标题:Value Evolution
怎么看: 横轴按发布季度分组,纵轴为每美元可获得的 LLM Stats Score,使用对数尺度;横线表示季度中位数。
图表显示: 来源给出的季度中位价值较 2024 年第二季度提升 5 倍,但同季度不同模型之间仍相差数十倍。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:467.0 分/$/M,49.0 分、0.10 美元。
- Step-3.5-Flash:251.0;Gemma 4 31B:195.0。
- GPT-5.6 Sol:6.3;Claude Opus 5:7.0。
解读边界: value/dollar 只结合来源综合分和标价,不包含延迟、稳定性、限额、上下文和任务适配。
证据依据
- 直接证据:图卡写明 Median value per dollar improved 5x since Q2 2024
- 直接证据:tooltip 给出代表模型的 value/dollar、分数和价格
图 22|综合能力与价格的帕累托前沿
原始标题:LLM Stats Score vs Price ($/1M tokens)
怎么看: 横轴为每百万 token 价格,纵轴为 LLM Stats Score;蓝线连接在价格或能力上不可同时被其他点支配的模型。
图表显示: 0.14 美元已经可取得 49.0 分,而从 49 分提升到约 58 分需要把价格提高到 15 美元以上。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:0.14 美元,49.0 分。
- Qwen3.7 Max:3 美元,46.6 分。
- Claude Opus 5:15 美元,57.9 分;GPT-5.6 Sol:18 美元,57.9 分。
- Claude Fable 5:30 美元,57.4 分。
解读边界: 此图价格口径为 $/1M tokens,与部分混合价格图数值不同;帕累托前沿只针对当前样本。
证据依据
- 直接证据:tooltip 给出模型的价格和 LLM Stats Score
- 视觉推断:蓝色前沿在低价端快速上升,随后趋平
图 23|编程指数与价格的帕累托前沿
原始标题:Coding Index vs Price ($/1M tokens)
怎么看: 横轴为每百万 token 价格,纵轴为 Coding Index,蓝线表示当前样本的价格—编程前沿。
图表显示: 低价模型已经达到接近 40 的 Coding Index,但 50.2 的最高点仍对应 18 美元。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:0.14 美元,Coding Index 38.5。
- MiniMax M3:0.75 美元,35.3;Qwen3.7 Max:3 美元,38.7。
- GPT-5.6 Sol:18 美元,50.2;Claude Fable 5:30 美元,48.5。
解读边界: Coding Index 是来源综合口径,不能与上一期 SWE-Bench Verified 百分比直接比较。
证据依据
- 直接证据:tooltip 给出模型价格和 Coding Index
- 视觉推断:蓝色前沿在约 40 分后需要更高价格才能继续上升
图 24|Arena 偏好与价格的帕累托前沿
原始标题:Arena Rating vs Price ($/1M tokens)
怎么看: 横轴为每百万 token 价格,纵轴为该图使用的 Arena Rating 原始尺度,蓝线表示价格—偏好前沿。
图表显示: 偏好前沿总体随价格抬升,但高价也存在被更便宜模型支配的点,价格不是偏好的充分条件。
关键模型 / 数据点:
- Gemma 4 31B:0.26 美元,Arena Rating 1194。
- Qwen3.7 Max:3 美元,1730;Gemini 3.1 Pro:9 美元,2055。
- Claude Opus 5:15 美元,2510;GPT-5.6 Sol:18 美元,2231。
- Claude Fable 5:30 美元,1986。
解读边界: 本图 Arena Rating 使用数百到数千的原始尺度,不能与后文 20–30 区间的标准化偏好值直接换算。
证据依据
- 直接证据:tooltip 给出模型价格和 Arena Rating
- 视觉推断:多个高价点位于蓝色前沿下方
效率与规模:门槛越高,规模与成本跃迁越明显
本组结论: 30+ 综合分可由 25.2B 模型达到,40+ 需要 295B,50+ 又升至 2.8T;规模、数据和架构共同作用,单一变量的解释力有限。
图 25|MoE 与 Dense 的价格—能力分布
原始标题:Performance vs Price, Colored by MoE
怎么看: 横轴是混合 API 价格,纵轴是 LLM Stats Score;蓝点为 MoE,灰点为 Dense。
图表显示: 当前低于 0.2 美元且高于 30 分的多个代表点都是 MoE,MoE 在低价高分区占据明显位置。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:0.10 美元,49.0 分。
- DeepSeek-V4-Flash-Max:0.12 美元,39.7 分。
- Gemma 4 26B-A4B:0.18 美元,30.3 分。
- GLM-5.2:1.3 美元,47.0 分。
解读边界: 图只覆盖有价格和架构标签的模型;MoE 关联低价高分不证明架构单独造成优势。
证据依据
- 直接证据:图例区分 MoE 与 Dense
- 直接证据:tooltip 给出代表模型的价格与综合分
图 26|跨过综合能力门槛的最低成本
原始标题:Minimum Cost to Reach Capability
怎么看: 横轴为 LLM Stats Score 门槛,纵轴为跨过门槛的最低混合 API 价格;蓝线是 MoE,灰线是 Dense。
图表显示: 20+ 至 40+ 门槛的最低成本由低价 MoE 模型占据,50+ 门槛则突然跳到 5 美元。
关键模型 / 数据点:
- 20+:Nemotron 3 Nano(30B A3B),0.09 美元,MoE。
- 30+ 与 40+:DeepSeek-V4-Flash-0731,0.10 美元,MoE。
- 50+:Kimi K3,5.0 美元,MoE。
- Dense 的 20+ 与 30+:Qwen3.5-27B,0.65 美元。
解读边界: 只比较 canonical LLM 和来源当前标价;门槛是综合分,不可与上一期 GPQA 百分比门槛直接比较。
证据依据
- 直接证据:tooltip 给出每个门槛的最低价、模型和架构
图 27|达到综合分门槛所需的最小模型
原始标题:The Efficiency Curve
怎么看: 阶梯线记录每个能力门槛随时间出现的最小参数模型,纵轴使用参数量对数尺度。
图表显示: 30+ 综合分已由 25.2B 模型达到,但 40+ 仍需 295B,50+ 则需要 2.8T;更高门槛出现明显规模跃迁。
关键模型 / 数据点:
- 20+ 门槛当前标注:4.0B 参数。
- 30+:Gemma 4 26B-A4B,25.2B 参数、30.3 分。
- 40+:Hy3,295B 参数、43.8 分。
- 50+:Kimi K3,2.8T 参数、55.7 分。
解读边界: 总参数量不能等同于 MoE 单次激活计算量;不同模型训练方法也不同。
证据依据
- 直接证据:SVG 末端标出 20+=4.0B、30+=25.2B、40+=295.0B、50+=2.8T
- 直接证据:tooltip 给出 30+、40+、50+ 对应模型
图 28|不同参数规模档位的综合分
原始标题:LLM Stats Score by Tier
怎么看: 横轴把模型分为 Tiny、Small、Large、Frontier 四档,纵轴是 LLM Stats Score,短横线表示每档中心位置。
图表显示: 规模更大时分数上限总体更高,但档位之间大量重叠;小模型也能超过部分前沿规模模型。
关键模型 / 数据点:
- Qwen3.5-2B:2B 参数,4.9 分;Qwen3.5-9B:9B,25.7 分。
- Qwen3.5-27B:27B 参数,34.7 分。
- Kimi K2.6:1000B 参数,44.6 分。
- Kimi K3:2800B 参数,55.7 分,为图中最高。
解读边界: 参数档位使用总参数量,不能反映 MoE 激活参数、训练 token、数据质量或推理时计算。
证据依据
- 直接证据:tooltip 给出代表模型的参数量和综合分
- 直接证据:图卡写明最高分模型为 Kimi K3,55.7
图 29|训练数据规模竞赛
原始标题:The Training Data Race
怎么看: 横轴为发布日期,纵轴为训练 token 数并使用对数尺度;虚线表示整体增长趋势。
图表显示: 大规模训练数据继续扩张,来源估计训练数据约每 1.6 年翻倍,当前可见最高点达到 48T token。
关键模型 / 数据点:
- Llama 4 Scout:40.0T token,2025 年 4 月发布。
- Qwen3 30B A3B:36.0T token,2025 年 4 月发布。
- MiMo-V2.5:48.0T token,2026 年 4 月发布。
- 来源统计:66 个模型使用 1T+ 训练 token。
解读边界: 训练 token 多来自公开披露或来源整理,数据质量、去重和训练轮次并不等价。
证据依据
- 直接证据:图卡写明 Training data doubles every 1.6 years 和 66 models with 1T+ tokens
- 直接证据:tooltip 给出模型训练 token 与发布日期
图 30|训练数据与综合能力的关系
原始标题:The Data Appetite
怎么看: 横轴为训练 token 数并使用对数尺度,纵轴为 LLM Stats Score,虚线是回归趋势。
图表显示: 训练数据与综合分只有很弱的线性关系;每增加 10 倍数据,回归仅增加约 3.9 分,R² 为 0.06。
关键模型 / 数据点:
- R² = 0.06;每 10 倍训练数据约对应 +3.9 综合分。
- Llama 4 Scout:40.0T token,9.0 分。
- MiMo-V2.5:48.0T token,36.3 分。
- DeepSeek-V4-Pro-Max:32.0T token,43.9 分。
解读边界: 相关不等于因果;模型架构、数据质量、训练方法和推理时计算都未被单独控制。
证据依据
- 直接证据:图卡给出 R² = 0.06 和 10x 数据约 +3.9 分
- 直接证据:tooltip 给出相近大数据规模下显著不同的综合分
图 31|参数效率帕累托前沿
原始标题:Efficiency Frontier
怎么看: 横轴是参数量对数尺度,纵轴是 LLM Stats Score;越靠左上越高效,蓝线连接帕累托前沿。
图表显示: 前沿在小参数区快速上升,随后收益变缓;304B 的 DeepSeek-V4-Flash-0731 达到 49.0,2.8T 的 Kimi K3 才继续升到 55.7。
关键模型 / 数据点:
- Qwen3.5-2B:2B,4.9 分;Qwen3.5-9B:9B,25.7 分。
- Gemma 4 26B-A4B:25B,30.3 分;Qwen3.5-27B:27B,34.7 分。
- DeepSeek-V4-Flash-0731:304B,49.0 分。
- Kimi K3:2.8T,55.7 分。
解读边界: 参数是总参数量,MoE 的实际激活规模可能更小;帕累托前沿只对当前样本成立。
证据依据
- 直接证据:tooltip 给出代表模型参数量和综合分
- 视觉推断:蓝色前沿在数百 B 后明显变平
图 32|MoE 与 Dense 的价格前沿
原始标题:Reasoning vs Price
怎么看: 横轴为混合 API 价格,纵轴为 LLM Stats Score;蓝线和灰线分别表示 MoE 与 Dense 的帕累托前沿。
图表显示: 在当前样本中,MoE 前沿同时覆盖最低价格和最高综合分,Dense 前沿主要停留在较低分区。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731(MoE):0.10 美元,49.0 分。
- Kimi K3(MoE):5.0 美元,55.7 分。
- Qwen3.5-27B(Dense):0.65 美元,34.7 分。
- Gemma 4 26B-A4B(MoE):0.18 美元,30.3 分。
解读边界: 样本选择和供应商定价会影响前沿;图中关联不能证明 MoE 架构单独导致价格优势。
证据依据
- 直接证据:tooltip 给出模型架构、价格和综合分
图 33|MoE 推理能力与吞吐前沿
原始标题:Reasoning vs Throughput
怎么看: 横轴为生成吞吐量,纵轴为 LLM Stats Score;曲线表示当前可见 MoE 样本的能力—速度前沿。
图表显示: 高综合分集中在较低吞吐区;当前 500 token/s 的前沿点只有 20.0 分,而 100–150 token/s 可达到约 37.5。
关键模型 / 数据点:
- GLM-5:30 token/s,37.7 分。
- MiniMax M2.5:100 token/s,37.5 分。
- Step-3.5-Flash:150 token/s,37.6 分。
- LongCat-Flash-Lite:500 token/s,20.0 分。
解读边界: 交互点几乎都标为 MoE,Dense 样本不足以做稳健架构比较;吞吐也受测试硬件影响。
证据依据
- 直接证据:tooltip 给出模型吞吐、综合分和架构
- 视觉推断:前沿在高吞吐端明显下行
图 34|MoE 与 Dense 的规模前沿
原始标题:Reasoning vs Size
怎么看: 横轴为总参数量对数尺度,纵轴为 LLM Stats Score;蓝线和灰线分别表示 MoE 与 Dense 前沿。
图表显示: Dense 前沿在数十 B 内快速提高,MoE 则把综合分上限继续推向 50 以上,但需要更大的总参数规模。
关键模型 / 数据点:
- Qwen3.5-9B(Dense):9B,25.7 分;Qwen3.5-27B:27B,34.7 分。
- Gemma 4 26B-A4B(MoE):25B,30.3 分。
- DeepSeek-V4-Flash-0731(MoE):304B,49.0 分。
- Kimi K3(MoE):2800B,55.7 分。
解读边界: MoE 总参数量不等于单次激活参数;横向比较不能替代实际计算量与延迟测试。
证据依据
- 直接证据:tooltip 给出模型参数量、综合分和架构
图 35|综合分与参数量的帕累托前沿
原始标题:LLM Stats Score vs Parameters (Billions)
怎么看: 横轴为十亿参数并使用对数尺度,纵轴为 LLM Stats Score;蓝线表示参数—能力前沿。
图表显示: 小模型到数十 B 的前沿上升很快,数百 B 后边际提升趋缓;同一参数量附近仍可出现明显分差。
关键模型 / 数据点:
- Gemma 4 26B-A4B:25B,30.3 分。
- DeepSeek-V4-Flash-0731:304B,49.0 分。
- GLM-5.1:754B,40.7 分;GLM-5.2:753B,47.0 分。
解读边界: 这是综合分而非上一期 GPQA 百分比;参数量相同也不代表架构、数据和训练方法相同。
证据依据
- 直接证据:tooltip 给出代表模型参数量和综合分
- 视觉推断:蓝色前沿在高参数区逐渐趋平
图 36|编程指数与参数量的帕累托前沿
原始标题:Coding Index vs Parameters (Billions)
怎么看: 横轴为参数量对数尺度,纵轴为 Coding Index,蓝线连接当前参数—编程前沿。
图表显示: 参数增加总体抬高编程上限,但同为约 753–754B 的 GLM-5.1 与 GLM-5.2 仍相差 5.3 分,训练代际同样重要。
关键模型 / 数据点:
- DeepSeek-V4-Flash-0731:304B,Coding Index 38.5。
- GLM-5.1:754B,33.3。
- GLM-5.2:753B,38.6。
解读边界: Coding Index 不是上一期 SWE-Bench Verified 百分比;总参数量也不能单独解释编程表现。
证据依据
- 直接证据:tooltip 给出参数量和 Coding Index
- 视觉推断:同一参数量级的点在纵轴上高度分散
图 37|Arena 偏好与参数量
原始标题:Arena Rating vs Parameters (Billions)
怎么看: 横轴为参数量对数尺度,纵轴为该图的 Arena Rating 原始尺度,蓝线表示帕累托前沿。
图表显示: 更大模型能提高偏好上限,但不是充分条件;相同或相近参数量下的 Arena Rating 差异很大。
关键模型 / 数据点:
- Gemma 4 26B-A4B:25B,Arena Rating 1165。
- Qwen3.6-27B:28B,1305。
- GLM-5.1:754B,1745;GLM-5.2:753B,1594。
- Kimi K2.6 与 Kimi K2.7 Code:同为 1000B,分别为 1476 与 1098。
解读边界: 偏好受产品行为和样本影响;总参数量尤其不能代表 MoE 的激活计算量。
证据依据
- 直接证据:tooltip 给出模型参数量和 Arena Rating
- 视觉推断:同一参数数量级的点纵向分散明显
速度与上下文:200 万窗口保持纪录,吞吐仍有能力税
本组结论: 上下文纪录维持在 200 万 token,而能力、编程和偏好三条吞吐前沿都随速度升高而下行;更快与更强仍是不同优化目标。
图 38|上下文窗口竞赛
原始标题:The Context Race
怎么看: 横轴为发布日期,纵轴为最大上下文 token 数并使用对数尺度;橙色阶梯表示历史纪录。
图表显示: 上下文纪录从 16K、128K、1M 提升到 2M,此后大量新模型停留在 1M 或更低,纪录暂未继续刷新。
关键模型 / 数据点:
- GPT-3.5 Turbo:16K;GPT-4 Turbo:128K。
- GPT-4.1:1.0M,2025 年 4 月发布。
- Grok-4 Fast Reasoning:2.0M,2025 年 8 月发布。
- Claude Opus 5:1.0M,2026 年 7 月发布。
解读边界: 最大窗口不等同于有效长上下文能力,也不反映长输入价格、延迟和信息保持质量。
证据依据
- 直接证据:图卡写明 Current record: Grok-4 Fast Reasoning at 2.0M tokens
- 直接证据:tooltip 给出代表模型的上下文窗口和发布日期
图 39|速度税:更快不等于更强
原始标题:The Speed Tax
怎么看: 横轴为吞吐量并使用对数尺度,纵轴为 LLM Stats Score;蓝线连接能力—速度帕累托点。
图表显示: 综合分最高点集中在 64–157 token/s,而接近或超过 900 token/s 的模型分数明显更低。
关键模型 / 数据点:
- Claude Opus 5:64 token/s,57.9 分。
- Claude Fable 5:116 token/s,57.4 分。
- GPT-5.6 Sol:157 token/s,57.9 分。
- Step-3.5-Flash:898 token/s,37.6;Mercury 2:约 1286 token/s,25.0。
解读边界: 吞吐来自特定测试配置,硬件、批量和服务商会改变结果;前沿不代表单模型可自由切换速度。
证据依据
- 直接证据:图卡标出 GPT-5.6 Sol 57.9 分、157 tok/s
- 直接证据:tooltip 给出代表模型吞吐和综合分
图 40|综合分与生成吞吐前沿
原始标题:LLM Stats Score vs Throughput (tokens/sec)
怎么看: 横轴为每秒 token 数,纵轴为 LLM Stats Score,蓝线表示当前能力—吞吐帕累托前沿。
图表显示: 前沿从低吞吐高分区向高吞吐较低分区下降;1000 token/s 端点只有 25.0 分。
关键模型 / 数据点:
- Claude Opus 4.8:42 token/s,52.6 分。
- Grok 4.5:80 token/s,49.5;Gemini 3.1 Pro:90 token/s,43.6。
- Step-3.5-Flash:150 token/s,37.6。
- Mercury 2:1009 token/s,25.0。
解读边界: 此图样本与图 39 不完全相同;吞吐依赖统一测试假设,不能直接视为供应商 SLA。
证据依据
- 直接证据:tooltip 给出模型吞吐和 LLM Stats Score
- 视觉推断:蓝色前沿随吞吐升高明显下行
图 41|编程指数与生成吞吐前沿
原始标题:Coding Index vs Throughput (tokens/sec)
怎么看: 横轴为生成吞吐量,纵轴为 Coding Index,蓝线表示编程能力—速度前沿。
图表显示: 最高 Coding Index 出现在低吞吐模型,高吞吐端的编程指数显著降低。
关键模型 / 数据点:
- Claude Opus 4.8:42 token/s,Coding Index 44.1。
- Grok 4.5:80 token/s,40.3;Gemini 3.1 Pro:90 token/s,33.0。
- Step-3.5-Flash:150 token/s,20.7。
- Mercury 2:1009 token/s,13.7。
解读边界: Coding Index 已替代上一期 SWE-Bench 轴,不能直接比较两期前沿高度;吞吐也受测试硬件影响。
证据依据
- 直接证据:tooltip 给出模型吞吐和 Coding Index
- 视觉推断:蓝色前沿随吞吐升高下行
图 42|Arena 偏好与生成吞吐前沿
原始标题:Arena Rating vs Throughput (tokens/sec)
怎么看: 横轴为吞吐量,纵轴为该图的 Arena Rating 原始尺度,蓝线连接偏好—速度前沿。
图表显示: 高 Arena Rating 集中在 42–90 token/s,500–1009 token/s 的端点偏好分明显更低。
关键模型 / 数据点:
- Claude Opus 4.6:42 token/s,Arena Rating 2049。
- Gemini 3.1 Pro:90 token/s,2055。
- LongCat-Flash-Lite:500 token/s,639。
- Mercury 2:1009 token/s,405。
解读边界: Arena Rating 使用本图原始尺度;相关分布不能证明提高吞吐会直接降低用户偏好。
证据依据
- 直接证据:tooltip 给出模型吞吐和 Arena Rating
- 视觉推断:蓝色前沿从约 2000 降到高吞吐端约 400
人类偏好:指数有方向性,价格解释力仍弱
本组结论: 不同样本下综合指数与人类偏好的相关强度差异很大,价格的 R² 只有 14%;榜单与 benchmark 应作为互补信号,而不是互相替代。
图 43|主要指数与 benchmark 的相关矩阵
原始标题:Benchmark Correlation
怎么看: 热力图单元格是 Pearson 相关系数,越接近 1 表示两个指标在样本中的线性同步程度越高。
图表显示: LLM Score 与 Coding Index、MMMU、AIME 高度相关,而 AIME 与 Coding Arena 的相关性只有 0.30,指标覆盖的能力并不相同。
关键模型 / 数据点:
- LLM Score 与 Coding Index:r = 0.92。
- LLM Score 与 MMMU:0.88;与 AIME:0.86。
- LLM Score 与 Coding Arena:0.62。
- AIME 与 Coding Arena:0.30,为图中最弱的非对角关系。
解读边界: 相关矩阵没有交互 tooltip,数值来自热力图直接标注;相关不等于指标可互换,更不代表因果。
证据依据
- 直接证据:热力图单元格直接标出全部 Pearson 相关系数
图 44|人类编程偏好是否认同综合指数
原始标题:Do Humans Agree With the Indexes?
怎么看: 横轴为 LLM Stats Score,纵轴为 Coding Arena Elo;虚线是回归趋势。
图表显示: 77 个模型上 R² 为 0.605,整体相关较强,但相近综合分仍可对应不同的编程偏好。
关键模型 / 数据点:
- 77 个模型:R² = 0.605。
- Claude Opus 5:57.9 分,Coding Arena Elo 25。
- GPT-5.6 Sol:57.9 分,Elo 22;Claude Fable 5:57.4 分,Elo 20。
- MiniMax M3:43.1 分,Elo 10;Qwen3.7 Max:46.6 分,Elo 17。
解读边界: 纵轴是 Coding Arena,而不是通用聊天偏好;样本与后两张通用 Arena 图不同。
证据依据
- 直接证据:图卡写明 R² = 0.605、77 models
- 直接证据:tooltip 给出代表模型的综合分与 Coding Arena Elo
图 45|综合分对通用 Arena 偏好的预测力
原始标题:LLM Stats Score vs Arena
怎么看: 横轴为 LLM Stats Score,纵轴为标准化 Arena Rating;虚线表示线性趋势。
图表显示: 80 个模型上的 Pearson r 只有 0.25,综合分越高时偏好略有上升,但预测力较弱且离群点明显。
关键模型 / 数据点:
- 80 个模型:Pearson r = 0.25。
- Gemini 3.1 Pro:43.6 分,Arena Rating 26.0。
- GPT-5.6 Sol:57.9 分,24.9;Claude Opus 5:57.9 分,22.4。
- MiMo-V2.5-Pro:26.9 分,23.9。
解读边界: 相关系数受模型样本和 Arena 口径影响;高综合分不保证更高用户偏好。
证据依据
- 直接证据:图卡写明 Pearson r = 0.25 across 80 models
- 直接证据:tooltip 给出代表模型的综合分和 Arena Rating
图 46|用户评分与综合分的另一组样本
原始标题:User Ratings vs LLM Stats Score
怎么看: 横轴为 LLM Stats Score,纵轴为另一口径的 Arena Rating;虚线为回归趋势。
图表显示: 66 个模型上的 R² 为 0.31,属于中等相关;同为 57.9 分的模型仍可相差 3 个 Arena 点。
关键模型 / 数据点:
- 66 个模型:R² = 0.31。
- Claude Opus 5:57.9 分,Arena Rating 25。
- GPT-5.6 Sol:57.9 分,22;Claude Opus 4.8:52.6 分,16。
- MiniMax M3:43.1 分,10;Gemini 3.1 Pro:43.6 分,16。
解读边界: 这张图的样本数和评分口径与图 45 不同,不能把 r 与 R² 直接当成互相矛盾的同一统计量。
证据依据
- 直接证据:图卡写明 66 models、R² = 0.31
- 直接证据:tooltip 给出代表模型的综合分和 Arena Rating
图 47|价格能否买到更高人类偏好
原始标题:Cost vs Arena Rating
怎么看: 横轴为混合 API 价格并使用对数尺度,纵轴为标准化 Arena Rating,虚线为回归趋势。
图表显示: 价格与偏好的 R² 只有 14%,低价和高价模型都能进入 23–25 的高偏好区间。
关键模型 / 数据点:
- R² = 14%,来源将其标为弱关系。
- MiMo-V2.5-Pro:0.65 美元,Arena Rating 23.9;MiniMax M3:0.75 美元,23.7。
- Qwen3.7 Max:2.5 美元,24.8。
- GPT-5.6 Sol:17.5 美元,24.9;Claude Fable 5:30 美元,24.7。
解读边界: 价格还购买上下文、限额、稳定性和服务质量;弱相关也不能证明降价会提高偏好。
证据依据
- 直接证据:图卡写明 R² = 14% 和 Weak relationship
- 直接证据:tooltip 给出代表模型的价格和 Arena Rating
图 48|人类偏好榜单快照
原始标题:Human Preference Map
怎么看: 横向条形按盲测偏好的 μ − 3σ 保守评分排序;数值越高,保守估计下的偏好越强。
图表显示: GPT-5.6 Sol 以 29.5 居首,Claude Fable 5 为 27.2;GPT-5.5、Gemini 3.1 Pro 和 Qwen3.7 Max 构成下一梯队。
关键模型 / 数据点:
- GPT-5.6 Sol:29.5;Claude Fable 5:27.2。
- GPT-5.5:24.5。
- Gemini 3.1 Pro:22.2;Qwen3.7 Max:22.1。
- Claude Opus 4.6:21.8;Claude Sonnet 5 与 Claude Opus 4.7:21.2。
解读边界: 这是抓取时的盲测快照,投票量、置信度和参赛模型会持续变化;榜单不覆盖价格、延迟和特定任务可靠性。
证据依据
- 直接证据:SVG 与 tooltip 列出八个模型及保守评分
- 直接证据:图下注明 μ − 3σ conservative rating shown















































