从 Qwen 3.8 到 DeepSeek V4,中国开源模型凭什么把推理价格打到“白菜价“?

发布时间:2026/8/27 15:01:09
从 Qwen 3.8 到 DeepSeek V4,中国开源模型凭什么把推理价格打到“白菜价“? 上周末我翻了翻 OpenRouter 的实时调用排行榜说实话愣了一下。排在前四的模型——Qwen3.8-Flash-Next、DeepSeek-V4-Pro、Qwen3.8-Max、DeepSeek-V4-Flash——全是国产开源模型。曾经长期霸榜的 GPT-4o 系列和 Claude 系列被挤到了第二屏。这个变化不是一天发生的但 2026 年 8 月的数据把这个趋势推到了临界点中国开源模型在全球最大模型调用平台上的用量占比首次超过 60%。我自己的感受是半年前大家还在讨论国产模型能不能用现在讨论的已经是用哪个更划算。这种转变背后不只是模型变强了更关键的是成本结构被彻底掀翻了。一、一张定价表把硅谷的牌桌掀了先看一组数字。阿里昨天发布的 Qwen3.8-Flash-Next千亿总参数、激活仅 60 亿参数每百万 token 输入 1 元、输出 3 元。作为对比Claude Opus 5 是 $5/$25折合人民币约 36/180 元。差距接近 40 倍。但 Qwen 还不是最便宜的。DeepSeek V4-Flash 的 API 价格更低输入 0.5 元、输出 2 元。两家中国厂商在价格上互相卷把全球推理成本拉到了前所未有的低位。有人可能会说便宜没好货。但 Benchmark 数据不支持这个结论。Qwen3.8-Flash-Next 在多个编码和多模态评测上跑赢了同参数量级的闭源模型DeepSeek V4 Pro 在数学推理和长上下文任务上也和 GPT-5.6 Sol 互有胜负。换句话说不是性能降级换低价而是用更高效的架构实现了同等性能的极低成本。这背后是 MoE混合专家架构的成熟。中国厂商在 MoE 上的投入比硅谷同行激进得多——Qwen 3.8 系列的总参数/激活参数比高达 20:1DeepSeek 的 V4 系列也维持在 15:1 以上。这种参数量管够但每次只唤醒一小部分的思路让训练和推理的边际成本大幅下降。二、开源不只是免费而是生态定价权一个经常被忽略的点是开源模型的影响不只在下载量更在 API 定价权。道理很简单。当一个开发者可以在 Hugging Face 上免费下载 Qwen3.8 的权重自己部署到 4 张 RTX 4090 上跑推理时闭源 API 供应商就不能随意涨价。因为用户的替代方案摆在桌面上要么你把价格降到接近自部署的成本要么我走。这种开源锚定效应在过去一年表现得非常明显。2025 年初主流闭源 API 的每百万 token 价格还在 10-20 美元区间。到 2026 年 8 月GPT-5.6 Sol 已经把价格打到了 $4/$20促销价Claude Sonnet 5 的 $2/$10 也被认为是必须跟否则流失用户的价格。硅谷模型公司不是突然想降价是被开源模型逼着降价。国际数据也印证了这一点。中国开源模型在海外的下载量累计突破 100 亿次在美国开发者平台上的使用占比达到 62%首次超过闭源模型。这些数字说明中国开源模型已经不只是国内开发者用用而是真正进入了全球开发者的日常工具链。三、效率竞赛从堆参数到压成本今年八月的一个有趣现象是新模型发布节奏达到了历史最快——22 天里发布了至少 11 个新模型。但更值得关注的是这些新模型的参数规模并没有显著增长反而在效率上做文章。Qwen3.8-Flash-Next 的架构设计很能说明问题。它采用了阿里自研的 Next 混合架构Transformer 部分 125B 参数但只激活 6B加上视觉专家的 2B 激活总共只需 8B 激活参数就完成了千亿级模型的推理能力。训练成本比上一代 Qwen3.7-Plus 降低了近 90%。这个 90% 的数字很有意思。它不是靠单一技术实现的而是架构设计、数据配比、训练策略三个层面的协同优化。MoE 的专家路由更精准了长序列训练的并行效率更高了合成数据的质量也更接近人工标注。效率竞争取代参数竞赛是 2026 年大模型行业最重要的转折之一。当模型能力普遍跨过可用门槛后谁能以更低成本提供同等质量的服务谁就能赢下开发者生态。四、这套打法能持续吗也有质疑的声音。一个核心问题是中国开源模型当前的低价是技术进步带来的结构性优势还是烧钱补贴换市场份额我自己的判断偏向前者。理由有三第一MoE 架构的优化空间还远没到天花板。当前主流模型的激活参数比在 10:1 到 20:1 之间理论上可以做到 50:1 甚至更高这意味着推理成本还有进一步下降的空间。第二中国在芯片受限的条件下被迫在算法优化上走得更深。买不到最先进的 H100就在算子融合、量化压缩、投机解码上做文章。这些技术积累不是短期补贴能取代的。第三生态规模效应正在显现。当越来越多开发者基于开源模型做二次开发、写工具链、建社区时模型的边际成本会进一步摊薄。这不是烧钱这是典型的互联网规模效应在 AI 层的复制。当然风险也存在。中美科技脱钩可能进一步加剧影响开源模型的国际分发。国内算力基础设施的瓶颈也可能限制更大规模模型的训练。但至少从当前的市场数据看中国开源模型已经站稳了脚跟。五、结尾回到文章开头那个 OpenRouter 排行榜。排名前四的模型都是中国开源模型这个事实本身已经回答了能不能用的问题。现在真正需要关注的是当推理成本降到接近于零时应用的形态会发生什么变化我个人觉得答案可能不在模型本身而在那些被低成本模型催生出来的新场景上——比如实时多轮 agent 对话、端侧智能体、全量代码库的持续分析。这些场景以前因为推理成本太高而被搁置现在成本闸门一开想象力空间反而成了最大的变量。你最近在用什么模型跑生产是坚持闭源 API 还是迁移到了开源方案欢迎评论区聊聊。

相关新闻