PAIBAOWORK · B2B DIGITAL GROWTHB2B 建站 · WhatsApp 客户沟通 · AI CRM

AI TOOLS · 月度榜单

LLM 月度榜单2026 年 9 月

按月整理公开评测与厂商官方动态,帮助团队快速看清每个品类的领先者与变化。本期数据截至 2026-09-24,每月更新一次。

QUICK ANSWER

本期速览

截至 2026-09-24,Claude Opus 5.5 以 58 分在 169 个排名模型中领先。

Reasoning

推理

最新的推理能力领导者,展示在逻辑处理和决策制定方面最先进的模型。

当前领先 Claude Opus 5.5 Anthropic · 上期领先:Claude Opus 5

本月变化Claude Opus 5.5 以 58 的智能指数得分取代了 Claude Opus 5 成为领导者。

怎么选Anthropic 继续凭借其 Claude Opus 系列在推理类别中占据主导地位。

  1. 1

    Claude Opus 5.5 Anthropic

    在推理方面领先,得分强劲。

    • 逻辑处理
    • 决策制定
    58
  2. 2

    Claude Opus 5.5 (xhigh with fallback) Anthropic

    具有回退功能的强劲表现。

    • 回退逻辑
    • 稳健推理
    56
  3. 3

    Claude Opus 5.5 (high with fallback) Anthropic

    具有回退功能的高推理能力。

    • 高容量
    • 回退支持
    54
  4. 4

    Claude Fable 5.1 (max with fallback) Anthropic

    最大化推理与回退。

    • 最大化逻辑
    • 回退
    53
  5. 5

    Claude Fable 5.1 (xhigh with fallback) Anthropic

    X高推理与回退。

    • X高逻辑
    • 回退
    53
  6. 6

    GPT-6 Astra (max) OpenAI

    最大化推理能力。

    • 最大化推理
    • 高级逻辑
    53

截至 2026-09-24,Claude Opus 5.5 以 58 分在 169 个排名模型中领先。

Text to Image

文生图

在当前 Text to Image Arena 中,GPT Image 2.5 Sunburst (max) 以 Elo 1197 领跑,其后是 GPT Image 2.5 Flare (max)(1191)和 GPT Image 2 (high)(1171)。Sunburst 的样本数为 13,433。

当前领先 GPT Image 2.5 Sunburst (max) OpenAI · 上期领先:GPT Image 2 / Nano Banana 2

本月变化本期榜首已由 8 月刊的 GPT Image 2 / Nano Banana 2 组合更替。

怎么选开放权重图像模型方面,Ideogram 4.0 (Quality) 以 1011 领跑,其后是 Ideogram 4.0(1003)和 FLUX.2 [dev](1000)。

  1. 1

    GPT Image 2.5 Sunburst (max) OpenAI

    当前 Text to Image Arena 榜首,Elo 1197。

    • 样本数 13,433
    • API 价格:每 1,000 张图 $210.7
    1197
  2. 2

    GPT Image 2.5 Flare (max) OpenAI

    当前 Text to Image Arena 排名第 2,Elo 1191。

    • 稳居榜单前二
    1191
  3. 3

    GPT Image 2 (high) OpenAI

    当前 Text to Image Arena 排名第 3,Elo 1171。

    • 进入榜单前三
    • API 价格:每 1,000 张图 $211.0
    1171
  4. 4

    Grok Imagine Image 2.0 xAI

    当前 Text to Image Arena 排名第 4,Elo 1150。

    • API 价格:每 1,000 张图 $60.0
    1150
  5. 5

    MAI-Image-2.6 Microsoft

    当前 Text to Image Arena 排名第 5,Elo 1147。

    • API 价格:每 1,000 张图 $38.9
    1147
  6. 6

    Nano Banana 2 (Gemini 3.1 Flash Image) Google

    当前 Text to Image Arena 排名第 6,Elo 1122。

    • API 价格:每 1,000 张图 $67.0
    1122

截至 2026-09-24,GPT Image 2.5 Sunburst (max) 以 Elo 1197 排名第 1,样本数为 13,433。

Video Generation

视频生成

Gemini Omni Flash 以 1233 Elo 继续领跑支持音频的文生视频榜单,Wan 3.0 以 1229 紧随其后。在无音频赛道中,榜首则由 Wan 3.0 以 1336 获得。

当前领先 Gemini Omni Flash Google

本月变化本月榜首较 8 月未变,但 Wan 3.0 升至第二;两个 MiniMax H3 版本分别占据第三和第四位。

怎么选头部竞争高度胶着:第一名 Gemini Omni Flash 与第五名 Dreamina Seedance 2.0 720p 仅相差 23 Elo。同期前五名的价格差异显著,每分钟从 $2.40 到 $12.00 不等。

  1. 1

    Gemini Omni Flash Google

    继续领跑有音频视频赛道,领先 Wan 3.0 四个 Elo。

    • 有音频榜单以 1233 Elo 排名第 1
    • 无音频榜单以 1330 排名第 2
    • 榜单价格为每分钟 $6.00
    1233 Elo
  2. 2

    Wan 3.0 Alibaba

    有音频赛道位列第二,同时登顶无音频榜单。

    • 有音频榜单以 1229 Elo 排名第 2
    • 无音频榜单以 1336 排名第 1
    • 榜单价格为每分钟 $12.00
    1229 Elo
  3. 3

    Minimax H3 Max post-trained by fal fal

    仅落后第二名 Wan 3.0 两个 Elo,并拥有前五名中最低的榜单价格。

    • 有音频榜单以 1227 Elo 排名第 3
    • 与第二名仅相差 2 Elo
    • 榜单价格为每分钟 $2.40
    1227 Elo
  4. 4

    MiniMax H3 Open Weights MiniMax

    当前支持音频的视频模型中排名最高的开放权重方案。

    • 以 1220 Elo 领跑有音频开放权重模型
    • 有音频总榜排名第 4
    • 榜单价格为每分钟 $7.80
    1220 Elo
  5. 5

    Dreamina Seedance 2.0 720p ByteDance

    跻身竞争密集的前五,与榜首仅相差 23 Elo。

    • 有音频榜单以 1210 Elo 排名第 5
    • 距第一名仅 23 Elo
    • 榜单价格为每分钟 $9.07
    1210 Elo

截至 2026-09-24,Wan 3.0 在有音频榜单以 1229 Elo 位列第 2,在无音频榜单则以 1336 排名第 1。

Code and Terminal Tasks

代码与终端任务

Terminal-Bench 2.1 覆盖软件工程、系统管理、数据处理、模型训练与安全任务。此次更新包含 89 项任务,并修正了环境和指令问题;pass@1 按三次重复运行取平均值,评测由 Artificial Analysis 独立执行。

当前领先 Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback Anthropic · 上期领先:Claude Opus 5

本月变化Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 取代 8 月榜首 Claude Opus 5。由于 Terminal-Bench 2.1 属于刷新后的评测版本,9 月百分比不宜与上期分数直接比较。

怎么选榜单前三均为 Claude Fable 5.1 的不同推理强度配置,成绩集中在 89.9% 至 91.4%。对企业选型而言,推理强度档位已成为与基础模型名称同样重要的评估维度。

  1. 1

    Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback Anthropic

    取得 Terminal-Bench 2.1 当前最高的经验证成绩。

    • 以 91.4% pass@1 位列第 1
    • 采用 Max Effort 自适应推理配置
    • 评测覆盖五类技术与运维任务
    91.4%
  2. 2

    Claude Fable 5.1 Adaptive Reasoning Xhigh with Default Fallback Anthropic

    与榜首配置仅相差 0.4 个百分点。

    • 以 91.0% pass@1 位列第 2
    • 采用 Xhigh 自适应推理配置
    • 在 89 项任务的刷新版评测中保持 90% 以上成绩
    91.0%
  3. 3

    Claude Fable 5.1 Adaptive Reasoning High with Default Fallback Anthropic

    帮助 Claude Fable 5.1 包揽榜单前三名。

    • 以 89.9% pass@1 位列第 3
    • 采用 High 自适应推理配置
    • 较榜首 Max Effort 配置低 1.5 个百分点
    89.9%

截至 2026-09-24,Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 以 91.4% 的 pass@1 成绩位列 Terminal-Bench 2.1 第 1 名。

Voice and Text-to-Speech

语音与文本转语音

Cartesia Sonic 3.6 于 2026 年 8 月发布,目前以 1278 Elo 位居 Provider Voice Arena 榜首。Inworld Realtime TTS-2 以 1243 排名第二,SpeechifyAI Simba 3.2 和 Alibaba Qwen-Audio-3.0-TTS-Plus 分别以 1238、1235 紧随其后。

当前领先 Cartesia Sonic 3.6 Cartesia · 上期领先:Realtime 2

本月变化Cartesia Sonic 3.6 取代 8 月榜首 Realtime 2;在本期榜单中,Inworld Realtime TTS-2 位列第二。

怎么选头部六款模型的 API 成本差异明显:SpeechifyAI Simba 3.2 的标价为每 100 万字符 $6.6,Sonic 3.6 为 $49.0,VUI Labs Luna TTS 则为 $80.0。开放权重阵营中,Breeze TTS 2 以 1203 成为排名最高的 TTS 模型。

  1. 1

    Cartesia Sonic 3.6 Cartesia

    这款于 2026 年 8 月发布的模型成为 Provider Voice Arena 新榜首。

    • 以 1278 Elo 排名第一
    • API 标价为每 100 万字符 $49.0
    1278 Elo
  2. 2

    Inworld Realtime TTS-2 Inworld

    在本期供应商语音榜单中排名第二。

    • 取得 1243 Elo
    • API 标价为每 100 万字符 $20.8
    1243 Elo
  3. 3

    SpeechifyAI Simba 3.2 SpeechifyAI

    位列第三,与 Realtime TTS-2 相差 5 个 Elo 分。

    • 取得 1238 Elo
    • API 标价为每 100 万字符 $6.6
    1238 Elo
  4. 4

    Alibaba Qwen-Audio-3.0-TTS-Plus Alibaba

    Alibaba 的语音模型跻身竞争紧密的第一梯队,位列第四。

    • 取得 1235 Elo
    • API 标价为每 100 万字符 $27.6
    1235 Elo
  5. 5

    VUI Labs Luna TTS VUI Labs

    Luna TTS 进入 Provider Voice Arena 前五。

    • 取得 1230 Elo
    • API 标价为每 100 万字符 $80.0
    1230 Elo
  6. 6

    Inworld Realtime TTS-2 Flash Inworld

    凭借标准版与 Flash 版,Inworld 在前六名中占据两个席位。

    • 取得 1214 Elo
    • API 标价为每 100 万字符 $10.4
    1214 Elo

截至 2026-09-24,Cartesia Sonic 3.6 以 1278 Elo 位列 Provider Voice Arena 第 1 名。

Instrumental Music

器乐音乐生成

Mureka V9 以 1177 Elo 位居 Instrumental Music Arena 榜首,Suno V5.5 以 1171 排名第二,Mureka V8 以 1143 排名第三。该榜单采用盲选偏好投票,并将器乐与人声模式分开评测。

当前领先 Mureka V9 Mureka · 上期领先:Suno v5.5

本月变化Mureka V9 取代 8 月榜首 Suno v5.5;Suno V5.5 本期降至第二位。

怎么选Mureka 与 Suno 各占前四名中的两个席位。各模型样本量从 StepAudio 3 Music 的 2,212 个到 Mureka V8 的 3,130 个不等;来源页面未提供音乐模型价格。

  1. 1

    Mureka V9 Mureka

    以 2,237 个样本支撑评测,位居 Instrumental Music Arena 榜首。

    • 在器乐模型盲选偏好排名中取得最高 Elo
    • 排名领先于 Suno V5.5
    1177 Elo
  2. 2

    Suno V5.5 Suno

    基于 2,222 个样本取得 1171 Elo,排名第二。

    • 盲选偏好得分位列第二
    • Suno 有两款模型进入前四,Suno V5.5 排名更高
    1171 Elo
  3. 3

    Mureka V8 Mureka

    以 1143 Elo 位列第三,样本量为 3,130 个。

    • Mureka 第二款进入前三的模型
    • 在列出的六款领先模型中样本量最高
    1143 Elo
  4. 4

    Suno V5 Suno

    基于 2,713 个样本取得 1137 Elo,排名第四。

    • 进入该榜单前四
    • Suno 第二款跻身前四的模型
    1137 Elo
  5. 5

    StepAudio 3 Music StepAudio

    以 1113 Elo 位列第五,样本量为 2,212 个。

    • 在器乐盲选偏好投票中进入前五
    • 排名领先于 Google Lyria 3 Pro
    1113 Elo
  6. 6

    Google Lyria 3 Pro Google

    基于 2,959 个样本取得 1102 Elo,排名第六。

    • 进入器乐音乐榜单前六
    • 评测覆盖 2,959 个样本
    1102 Elo

截至 2026-09-24,Mureka V9 以 1177 Elo 位列 Instrumental Music Arena 第 1 名。

Vision

视觉理解

Vision Arena 于 2026 年 9 月 13 日发布的榜单覆盖 152 个模型和 1,314,119 次投票。Claude Fable 5 High 以 1310±8 位居第一,Qwen3.8 Max 以 1302±8 紧随其后,两个 Claude Opus 4.7 配置也进入前四。

当前领先 Claude Fable 5 High Anthropic · 上期领先:Claude Fable 5

本月变化Claude Fable 5 High 登上榜首,接替 8 月榜单中的 Claude Fable 5。

怎么选榜首模型每 100 万输入和输出 token 的价格分别为 $10 和 $50;第二名 Qwen3.8 Max 分别为 $2 和 $6。对于重视部署成本的企业,前两名之间存在明显价差。

  1. 1

    Claude Fable 5 High Anthropic

    位居 9 月 Vision Arena 榜首。

    • 在 152 个模型中排名第 1
    • 所在榜单累计获得 1,314,119 次投票
    1310±8
  2. 2

    Qwen3.8 Max Alibaba

    与榜首相差 8 个 Elo 分。

    • 综合排名第 2
    • 每 100 万输入和输出 token 的价格分别为 $2 和 $6
    1302±8
  3. 3

    Claude Opus 4.7 High Anthropic

    排名第 3,仅落后 Qwen3.8 Max 1 分。

    • 综合排名第 3
    • 得分区间为 1301±7
    1301±7
  4. 4

    Claude Opus 4.7 Anthropic

    标准配置比 High 配置低 1 分。

    • 综合排名第 4
    • 与榜首仅相差 10 分
    1300±7
  5. 5

    Claude Opus 4.6 High Anthropic

    帮助 Anthropic 占据前五名中的四席。

    • 综合排名第 5
    • 仅落后 Claude Opus 4.7 1 分
    1299±7

截至 2026-09-24,Claude Fable 5 High 以 1310±8 排名第 1;该期 Vision Arena 覆盖 152 个模型和 1,314,119 次投票。

Open-Weights Models

开放权重模型

MiMo-V2.6-Pro 以 46 分位列 Artificial Analysis 开放权重模型第一,GLM-5.3 max 以 45 分紧随其后,Kimi K3 max 以 44 分排名第三。

当前领先 MiMo-V2.6-Pro Xiaomi · 上期领先:Kimi K3

本月变化MiMo-V2.6-Pro 取代 8 月榜首 Kimi K3,成为本期开放权重模型的新领跑者。

怎么选开放权重模型继续保持竞争力,但与专有模型的绝对前沿仍有差距:MiMo-V2.6-Pro 得分为 46,而 Claude Opus 5.5 max with fallback 为 58。

  1. 1

    MiMo-V2.6-Pro Xiaomi

    当前 Intelligence Index 排名最高的开放权重模型。

    • Intelligence Index 得分 46
    • 开放权重模型排名第一
    • 上下文窗口为 1M
    46
  2. 2

    GLM-5.3 max Zhipu AI

    位列开放权重模型第二,与榜首相差 1 个指数点。

    • Intelligence Index 得分 45
    • 开放权重模型排名第二
    • GLM-5.3 的上下文窗口为 1M
    45
  3. 3

    Kimi K3 max Moonshot AI

    8 月榜首本期位列开放权重模型第三。

    • Intelligence Index 得分 44
    • 开放权重模型排名第三
    • 上下文窗口为 1M
    44
  4. 4

    GLM-5.3-Flash Zhipu AI

    GLM-5.3-Flash 位列当前开放权重榜第四。

    • Intelligence Index 得分 42
    • 开放权重模型排名第四
    42
  5. 5

    Qwen3.8 2.4T A95B Alibaba

    Qwen3.8 2.4T A95B 的 Intelligence Index 得分为 40。

    • Intelligence Index 得分 40
    • 进入开放权重模型前六
    40
  6. 6

    Qwen3.8-Flash-Next Alibaba

    Qwen3.8-Flash-Next 同样取得 40 分,与 Qwen3.8 2.4T A95B 持平。

    • Intelligence Index 得分 40
    • 进入开放权重模型前六
    40

截至 2026-09-24,Artificial Analysis 收录的 169 个模型中有 68 个采用开放权重,其中 MiMo-V2.6-Pro 以 46 分排名第一。

Cost-effectiveness

成本效益

GPT-6 Luna (low) 的单任务成本为 $0.0045,Intelligence Index 为 21。本期将其列为性价比领先者,是基于 Artificial Analysis 同一对比表作出的编辑判断:在已明确列出的正成本模型中,其单任务成本最低,同时智能得分高于两款成本显示为 $0.00 的实用型模型。

当前领先 GPT-6 Luna (low) OpenAI · 上期领先:DeepSeek V4 Flash 0731

本月变化GPT-6 Luna (low) 取代 8 月榜首 DeepSeek V4 Flash 0731。

怎么选Command A+ 与 North Mini Code 的单任务成本均显示为 $0.00,但 Intelligence Index 分别只有 13 和 10。企业评估总体价值时,不能脱离这一性能差距仅比较账面成本。

  1. 1

    GPT-6 Luna (low) OpenAI

    已明确列出的正成本模型中单任务成本最低,同时取得 21 的 Intelligence Index。

    • 每任务成本 $0.0045
    • Intelligence Index 为 21
    • 综合成本与智能表现后,被编辑评估为总体性价比最佳
    $0.0045/task
  2. 2

    Granite 4.2 3B IBM

    以每任务 $0.01 跻身当前 Cost per Task 领先模型。

    • 每任务成本 $0.01
    • 3B 模型规格
    • 在已公布的低成本领先模型序列中位列第 2
    $0.01/task
  3. 3

    Ministral 3 3B Mistral AI

    单任务成本同为 $0.01,与 Granite 4.2 3B 持平。

    • 每任务成本 $0.01
    • 3B 模型规格
    • 进入当前三款低成本领先模型名单
    $0.01/task

截至 2026-09-24,GPT-6 Luna (low) 以每任务 $0.0045 位列成本效益第 1,Intelligence Index 为 21。

TRENDS

本月趋势洞察

从各品类的变化里,最值得记住的几件事。

01

前沿重置

前沿文本领导者已从 Claude Opus 5 转移到 Claude Opus 5.5,反映了推理能力的持续进步。

02

deepseek-flash-0731:暂无已核实的 9 月更新

所引用材料未包含 deepseek-flash-0731 的已核实事实条目或 URL,因此本期不对其模型、分数、发布日期或排名作出判断。

03

MiniMax H3 同时覆盖开放权重与后训练视频层级

H3 系列在有音频视频榜单前四名中连续占据两个席位:Minimax H3 Max post-trained by fal 以 1227 Elo 排名第三,价格为每分钟 $2.40;MiniMax H3 Open Weights 以 1220 排名第四,并位居有音频开放权重模型首位。

04

图像榜单洗牌,Nano Banana 2 位列第六

Nano Banana 2 (Gemini 3.1 Flash Image) 在当前 Text to Image Arena 中以 1122 Elo 排名第 6。榜首 GPT Image 2.5 Sunburst 达到 1197,两者相差 75 分。

05

生成式媒体的领先优势正按模态分化

当前没有一家厂商横扫所有生成式媒体赛道:GPT Image 2.5 Sunburst 以 1197 Elo 领跑文生图,Gemini Omni Flash 以 1233 位居有声文生视频第一,Cartesia Sonic 3.6 以 1278 登顶 TTS,Mureka V9 则以 1177 领先纯音乐生成。

FAQ

常见问题

如果您还有具体问题,欢迎预约一对一沟通。

榜单多久更新一次?

每月更新一次。新一期数据发布后,本页会在下一次站点更新时同步。

榜单数据来自哪里?

整理自 Artificial Analysis、LMArena、SWE-bench 等公开榜单与各厂商官方公告,页面底部列出全部来源与统计日期。

可以直接按榜单选模型吗?

榜单反映公开评测表现,实际选择还应结合您的任务类型、预算和数据边界;欢迎预约诊断一起评估。

不同类目之间的分数可以互相比较吗?

不建议。各榜单的评分体系不同,请以同一类目内的相对排名为主。

免费咨询

留个联系方式,我们帮你梳理

不确定阿里国际站、独立站还是 SaaS 更适合?留下信息或 预约诊断,我们结合你的产品、市场和预算给建站与获客建议。

BOOK A CONSULTATION

想判断哪类模型真正适合您的业务?

带上您的团队场景、预算与数据边界,一起评估最值得先试用的方向。

预约业务诊断
体验 AI 销售