
本文用 LMArena 匿名盲测、编码实测Terminal-Bench / SWE-bench、近一周多模态发布与 API 定价四组数据盘点 2026 年 8 月的大模型格局并给出按场景的开发者选型清单。所有数字标注来源价格以官方实时为准。关键字大模型LMArenaAI模型对比多模态模型API定价2026 年 8 月的第一周AI 圈有两件不大不小的事谷歌 DeepMind 的 Jeff Dean 宣布离开创办了名为 DiscoLoop AI 的新公司同一周阿里把 Wan3.0 视频模型挂上了公测MiniMax 开源了能出 2K 视频加原生立体声的全模态模型 H3。把这两件事放在一起看结论其实很直白巨头之间的模型能力上限之争已经进入下半场竞争的主战场正在从谁的文字更像人切换到谁的全模态更完整、谁的价格更敢打。对于在 CSDN 上读这篇文章的你不管是要给自己产品接一个模型还是想搞清楚 2026 年该押注哪个技术方向此刻最值得做的都不是追新闻而是看清一张全景图文本推理谁是榜首编码能力谁真的能打视频图像语音走到哪一步以及这一切的公开价格是多少。这篇文章用四组数据讲清楚这件事LMArena 匿名盲测的文本排名、SWE-bench 与 Terminal-Bench 的编码实测、近一周多模态模型的密集发布、主流 API 的定价横评。所有数字都标注了来源价格以官方实时为准不吹不黑。一、文本推理LMArena 视角的巅峰对决LMArena原 LMSys Chatbot Arena2024-25 年独立为 lmarena.ai是现在被引用最多的人类偏好基准。玩法是匿名盲测用户提一个问题两个模型各自作答用户只能凭答案质量投票票数汇成 Elo 评分。它测的不是模型能否背出标准答案而是真实用户更喜欢谁的输出这正是采购方拿它当参考的原因。以下是 2026 年 8 月初的文本榜头部快照多来源交叉Elo 会随投票滚动变化以官网实时为准模型组织文本 Elo快照备注Claude Opus 5Anthropic~15227 月发布的新旗舰Claude Fable 5Anthropic~1509头部轮换榜首之一Claude Opus 4.8 ThinkingAnthropic~1512编码 / Agent 场景强项GPT-5.5 ProOpenAI~1488推理档Gemini 3.1 Pro PreviewGoogle~1486科学 / 多模态领先Kimi K3开源权重Moonshot~1486文本中游编码见下节DeepSeek V4 ProMITDeepSeek~1462开源性价比标杆Qwen 3.7 Max阿里~1455国产模型文本最高来源LMArena 第三方快照 swfte.com / toolcenter.ai / datalearner.com2026-07-21 ~ 08-05这张表值得注意的不是第一名而是三件事第一头部已经挤成一团。榜首到第十名之间的 Elo 差距不到 30 分而 LMArena 官方口径是25 分以内的差距属于噪声。换句话说Fable 5、Opus 4.8、GPT-5.5 Pro、Gemini 3.1 Pro 谁是第一基本取决于本周投票样本。谁最聪明这个问题的答案已经不是一个可以回答的问题了。对选型者来说真正该问的是场景、上下文、价格和生态而不是那 10 分的排名差。第二榜首在 Anthropic 系内部轮换。从 6 月的 Opus 4.6/4.7到 7 月的 Fable 5 与 Opus 5文本榜头把交椅大部分时间在 Anthropic 手里OpenAI 的 GPT-5.5 Pro 与谷歌 Gemini 3.1 Pro 稳定咬在 1500 线附近。闭源三强的垄断地位没有变化变化的是它们之间的差距在收敛。第三开源已经摸到头部边缘。Kimi K3~1486、DeepSeek V4 Pro~1462、Qwen 3.7 Max~1455距离闭源头部只有 30–60 Elo其中 DeepSeek 是 MIT 开源、Kimi 是开源权重。2026 年的开源与闭源差距已经从代差缩小到半步。这个趋势在下一节的编码实测里会体现得更极端。二、编码能力开源第一次登顶的地方如果说文本榜是人类偏好的缩影编码则是可验证智能的试金石模型说它行不行拉出来跑真实代码任务就知道了。常用的编码实测有四类SWE-bench Verified真实 GitHub issue模型要产出能通过项目测试的补丁、Terminal-Bench终端里的真实工程任务、Program Bench程序构建、SWE Marathon长程多步软件工程模拟真实项目迭代。以下是 Moonshot 官方发布、并经独立来源交叉验证的 2026 年 7 月编码实测矩阵基准Kimi K3GPT-5.6 SolClaude Fable 5Claude Opus 4.8Terminal-Bench 2.188.388.884.684.6DeepSWE仓库级修复67.573.070.059.0Program Bench77.877.676.871.9SWE Marathon长程42.039.035.040.0FrontierSWE81.271.386.666.7来源Moonshot 官方发布 2026-07 prompt1001.com / wan27.org 独立交叉验证。SWE-bench Verified 各家评测口径差异较大未列入本表以各厂商官方发布为准。再叠加一个人类偏好信号。LMArena 前端编码榜Frontend Code Arena上Kimi K3 以约 1679 Elo 登顶第一超过 Claude Fable 5~1631与 GPT-5.6 Sol~1618七个前端子领域里拿下六个唯一输掉的是 Gaming第一名是 Fable 5。这是开源模型第一次在人类偏好的编码场景站上榜首。这张矩阵读出来的信息量比谁第一大得多第一Kimi K3 赢的是长程耐力赛输的是单次深读。它在 Program Bench、SWE Marathon、前端编码这些需要多步推理、长上下文、持续迭代的任务上压过所有闭源对手但在 DeepSWE跨文件理解代码库、FrontierSWE 这类一次性深读大仓库的任务上Claude Fable 586.6仍然领先它 5 个点。结论如果你的场景是 agent 长循环、多文件改动、前端整页生成K3 是当前性价比极高的选项如果是单次深度代码审查闭源头部更稳。第二开源编码已可用不再是口号。2.8 万亿参数 MoE每 token 只激活 16/896 个专家的 K3 以约3/15 的公开价格跑出了与 GPT-5.6 Sol 几乎持平的 Terminal-Bench 分数88.3 vs 88.8。对预算敏感的团队这会改写采购决策。一周前 DeepSeek V4 Flash 正式版又把这条线压低了一档284B 总参数只激活 13B架构一点没动只重做了一轮后训练代码修复基准 DeepSWE 就从预览版的 7.3 跳到 54.4六倍多Terminal-Bench 2.1 拿到 82.7和 Claude Opus 4.8 的 84.6 几乎打平。小参数、高激活效率、Agent 能力暴涨这是开源编码已可用的最新注脚。第三但单项突破不等于全面领先。在 Artificial Analysis 综合智能指数10 项基准加权上Kimi K3 得 57 分Claude Opus 5 为 61、GPT-5.6 Sol 为 59。开源追上了编码这个最陡峭的单项综合维度仍差闭源头部 2–4 分。这提醒我们看模型要看任务画像而不是被单一榜单的登顶新闻带走。三、多模态全谱系视频 / 图像 / 语音一周齐爆如果说文本和编码是存量竞争多模态就是 2026 年增量最猛的方向。只统计 2026 年 8 月第一周就有至少七款重量级多模态发布来源AI HOT 收录的官方渠道发布模型 / 产品厂商模态开源亮点Wan3.0阿里视频生成公测千问 APP 全网首发公测MiniMax H3MiniMax文本图像视频音频✅全模态生成2K 视频 原生立体声SeedRealtime字节音视频全双工—实时语音 视频双向交互大模型Qwen-Image-3.0-Pro阿里图像生成—上线 Qwen CloudSenseNova U1商汤推理 图像生成统一✅一个模型同时做推理与生图Hy ASR 3.0腾讯混元语音识别preview上下文感知的语音识别FLUX 3 VideoBlack Forest Labs视频生成—经 OpenRouter 统一多模态入口上线这张表背后有几件事值得说第一多模态正在从能力点变成系统。MiniMax H3 是典型例子。它不是一个视频模型加一个音频模型而是一个统一的全模态生成系统文本、图像、视频、音频一套权重出视频能到 2K 还带原生立体声。商汤 SenseNova U1 走的是另一条路把推理和图像生成收进同一个模型。当多模态从拼装走向原生应用开发者的接入成本在下一次换档。第二实时交互成为新战场。字节 SeedRealtime 做的是音视频全双工模型在听的同时能说、能看到画面实时回应。这已经不是生成一段视频的范畴而是把人机交互从打字-回车推向说话-看着-回应。对语音助手、客服、直播场景的开发者这是下半年最值得盯的机会。第三多模态也在开源。一周之内 MiniMax H3、SenseNova U1 两个重量级开源/开源权重发布加上此前 Qwen 系的多模态开源生态开源在多模态上复制了编码板块的剧本先用开源权重拉平能力门槛再靠生态抢占有率。对开发者的实际含义就一句话2026 年下半年接多模态你已经不太需要一个厂商接一个 SDK了。模型在收敛到全模态 统一接口而选型维度反而变多了视频质量、语音时延、开源可自托管、按次还是按量计费。价格就成了最后一道分水岭下一节来算这笔账。四、价格与性价比API 定价的残酷真相模型再强最终都要落到每百万 token 多少钱。下面是 2026 年 8 月主流 API 的公开定价快照$/1M tokens输入/输出公开渠道快照以官方实时定价为准模型输入 $/M输出 $/M档位GPT-5.5 Pro30180旗舰·推理Claude Opus 4.8525旗舰·编码/AgentClaude Fable 51050旗舰·知识工作GPT-5.6530通用旗舰Kimi K3开源权重315开源旗舰·编码DeepSeek V4 ProMIT 开源~1.75~3.5开源·极致性价比DeepSeek V4 Flash 正式版~0.14~0.28开源·价格屠夫新发布GLM-5.2—~3国产性价比Gemini 3 Flash 档—~3轻量性价比公开定价来源LMArena 价格列 / swfte.com / metatext.io2026-07 ~ 08 快照。个别模型不同渠道报价有出入以官方实时定价为准。这其中有两个残酷真相第一个残酷真相性能 Top 和价格 Top 几乎不重合。文本榜 1500 Elo 梯队里Kimi K3 输出价15/MGPT-5.5 Pro 输出价180/M。性能差距 20 分以内价格差 12 倍。对批量任务日志分析、内容抽取、批量改写用头部旗舰跑等于把利润烧在排行榜上选对性价比档位成本能降一个数量级。刚发布的 DeepSeek V4 Flash 是这个逻辑的极端版本Artificial Analysis 智能指数 50贴着 GPT-5.6 Luna 的 51输出价 $0.28/M只有 Claude Fable 5 的约 1/90。媒体把这事叫斩杀线——比它便宜的没它强比它强的贵出几个数量级。第二个残酷真相价格战已经打到显性化。官方定价公开透明之后聚合/网关渠道开始出现系统性折价。以我自己的持续监测数据为例2026-08-06 快照公开比价页实时更新DeepSeek R1官方混算价约4/M网关渠道约1.15/M省约七成GPT-5.6 Luna官方约0.45/M网关渠道约0.225/M五折GLM-5.2官方约2.15/M网关渠道约1.18/M省约四成五数据来源公开比价数据 2026-08-06 快照链接见文末各家计价方式不同仅作量级参考还有一个值得单说的信号就在本文成稿前两天DeepSeek 官方公告计划整体上调 API 定价当前 V4 Pro 输入 3 元、输出 6 元/百万 token具体涨幅待定。连把性价比打到地板上的玩家都要调价说明价格战正在从卷低价转向动态调价比价这件事只会越来越重要。对开发者来说2026 年的省钱方式已经不是等降价而是选对渠道同一套 OpenAI 兼容接口base_url 指向不同网关同样的活可能差一半以上的成本。这也是为什么比价正在从个人爱好变成工程刚需。五、三个趋势判断把前面四组数据放回时间轴上2026 年下半年的版图可以压缩成三个判断。判断一开源围剿闭源差距进入季度级收窄。看数据Kimi K3 拿下人类偏好的前端编码榜第一约 1679 Elo并在 Program Bench、SWE Marathon 两个长程任务登顶开源能在单项打赢闭源已经从假设变成事实同时 Artificial Analysis 综合指数显示开源旗舰K3 57 分与闭源头部Opus 5 61、GPT-5.6 Sol 59只剩 2–4 分。按这个收敛速度综合维度差距有望在 6–12 个月内被抹平。对采购决策的影响是闭源一定更强的假设2026 年年底之前大概率失效。判断二全模态成为标配单模态产品竞争力被稀释。事实是一周 7 款多模态发布第三节且 MiniMax H3、SenseNova U1 两个重量级都是开源/开源权重多模态正在复制编码板块开源拉平门槛的剧本。当一套模型同时出文本、图像、视频、音频成为默认选项仍然只提供文本能力的单模态产品在预算争夺中会越来越被动。对开发者的含义新项目立项时默认按多模态统一接口设计而不是先接文本再补模态。判断三价格战显性化比价从爱好变成工程刚需。依据性能差 20 分以内、价格差 12 倍K3 vs GPT-5.5 Pro同一模型经不同渠道调用成本可差 50%–70%第四节的网关折价例证。官方定价越来越透明意味着信息差在消失而渠道差在扩大。同样一个 OpenAI 兼容接口base_url 选得对不对就决定了成本结构。这就是为什么 2026 年的技术团队清单里应该多一项定期比价。六、开发者选型清单最后我们总结一下全文基于我的观点我们有下面的选择场景首选备选理由通用对话 / 知识工作Claude Fable 5GPT-5.6人类偏好榜头部但注意价格档位编码 · 长程 Agent 循环Kimi K3GPT-5.6 SolProgram Bench / SWE Marathon 第一开源权重可自托管编码 · 单次深度审查Claude Opus 4.8Claude Fable 5DeepSWE / FrontierSWE 深读能力领先视频生成Wan3.0 / MiniMax H3FLUX 3 Video按质量、成本、是否需开源三选语音 / 实时交互SeedRealtimeHy ASR 3.0音视频全双工 vs 上下文感知 ASR高性价比批量任务DeepSeek V4 Flash / V4 ProGLM-5.2成本可较旗舰降一个数量级多模型混合场景统一 API 网关—一个 key 一个计费省多厂商 SDK 维护如果你正处于多模型混合场景、想一步到位省掉多家 SDK 维护Nova Nexus 星海智能国际站https://dolphin.token6688.com/就是这类平台的一个代表文本 / 视频 / 图像 / 语音多类模型一个 API key、OpenAI 兼容接口统一调用正是上面说的换 base_url 即切换的典型实现。三条使用原则按任务画像选型不追单一榜单第一文本、编码、多模态是三个不同的世界第一、二、三节已经分别证明了。价格按量级估算不是按官网页抄批量场景优先跑性价比档 网关渠道旗舰留给真正需要的 20% 任务。多模型混用时用统一接口而不是多家 SDK2026 年几乎所有主流模型都兼容 OpenAI 协议换 base_url 即可切换维护成本下降一个量级。想自己动手比价和试接的看文末。附录本文数据来源LMArena 匿名盲测榜单Elo 随投票滚动快照时间 2026-07-21 ~ 08-05Moonshot 官方发布的编码实测2026-07各厂商官方渠道发布经 AI HOT 收录主流 API 官方公开定价公开比价数据快照2026-08-06。免责声明所有价格为公开渠道快照以官方实时定价为准榜单与价格都会随发布节奏变化。我写这篇文章时是 2026 年 8 月初结论只在此时点成立下个月可能又换一轮榜首。另个人查询资料恐有疏漏如有错误请指出。三个可以自取的资源开发者向开源维护实时更新Nova Nexus 星海智能国际站面向开发者和企业的多模型统一调用平台OpenAI 兼容一个 API key 调用文本 / 视频 / 图像 / 语音多类模型https://dolphin.token6688.com/多模型公开价格对比页Nova Nexus 星海智能国际站 vs OpenRouter仅对外价https://li589.github.io/nova-nexus/price/项目仓库品牌落地页 OpenAI 兼容 API 接入指南 模型覆盖清单https://github.com/li589/nova-nexus评论区聊一个话题你生产环境现在用哪个模型选它的理由是什么数据会说话但真实踩坑经验比数据更值钱。