2026年8月27日
科技

阿里云宣布Qwen3.8-Flash降价 输入每百万Token降至0.8元

智谱发布并开源 GLM-5.3-Flash;阿里发布并开源 Qwen3.8-Flash【AI 早报 2026-08-27】

8月27日午间,阿里云大模型服务平台百炼悄然更新了计费面板。Qwen3.8-Flash的输入价格从每百万Token 1元下调至0.8元,输出价格从3元降至2.7元。这一调整于当日12:00正式生效。

对于调用大模型API的开发者来说,这是一笔可以实时感知的成本变化——输入侧直降20%,输出侧降幅为10%。虽然幅度算不上激进,但考虑到Qwen3.8-Flash距离正式发布还不到48小时,这轮降价的速度本身传递了一个明确信号:阿里云正在用价格手段加速这款新模型的规模化渗透。

阿里云:下调Qwen3.8-Flash模型模式计费单价
阿里云:下调Qwen3.8-Flash模型模式计费单价

不到两天就降价,底气从何而来

要理解这次降价,得先回到8月26日晚。阿里通义千问团队正式发布了Qwen3.8-Flash。这是一个多模态混合专家(MoE)模型,主模型参数量为125B(约1250亿),额外配备51B的N-gram Embedding参数,每个Token仅激活6B参数。用通俗的话说:模型“知道”很多东西(1250亿参数的总规模),但每次推理只调用其中极小一部分(60亿参数),既保证了能力,又大幅节省了算力。

这种架构设计的直接成果是成本骤降。据阿里方面披露,Qwen3.8-Flash的训练成本仅约为前代Qwen3.7-Plus的九分之一。推理成本同样大幅下降——发布时的定价已经是每百万Token输入1元、输出3元,价格最低至DeepSeek-V4-Flash的三分之一。而8月27日的降价,是在这个本就极具竞争力的价格基础上再砍一刀。

性能方面,Qwen3.8-Flash被定位为Qwen4架构的技术预览版。在SWE-bench Pro智能体编程评测中,它领先Claude Opus4.6达9.1分;在AndroidWorld移动端智能体评测中高出22.5分。换言之,这不是一款靠低价取胜的“缩水版”模型,而是一个在多项基准测试中具备对标顶尖闭源模型能力的产品。

价格战的逻辑变了

2026年的大模型API定价正在经历一轮复杂的分化。据摩根士丹利报告统计,今年第二季度国内大模型平均API输入价格升至每百万Token 4.9元,输出价格升至21.9元,较2025年第一季度的3.3元和12.2元分别上涨约48%和80%。腾讯云年内完成两次涨价,智谱AI更是完成了三次API服务调价。在算力成本持续攀升的背景下,多数厂商选择了上调价格。

阿里云的策略则呈现出另一种节奏。一方面,它在3月跟随行业上调了AI算力产品价格;另一方面,在模型API层持续降价——8月24日上线的Token Plan模型订阅计划中,个人版正式上线、团队版同步降价,还推出了白天1折、夜间低至0.2折的错峰权益。三天后,Qwen3.8-Flash再度降价。

这种“算力层涨价、模型层降价”的双轨策略,折射出阿里云对AI商业化路径的判断:算力是基础设施,必须保证利润和可持续性;而模型是流量入口,需要用极致性价比跑马圈地。据IDC《中国AI软件市场半年度追踪,2025H2》报告,阿里云以42.2%的份额位居中国大模型训推公有云市场第一,同比增速116%为市场最高。在市场份额已经领先的情况下继续压价,更多是在巩固壁垒而非抢夺阵地。

Flash的定位:既要又要

Qwen3.8-Flash在阿里云模型矩阵中的位置值得细看。它原生支持百万级上下文窗口,兼容OpenAI与Anthropic接口协议,可无缝接入Claude Code、Codex等开发者工具。这些特性指向的是高并发应用与智能工作流场景——编程辅助、智能体协作、图文理解——而不是简单的聊天对话。

换句话说,Flash瞄准的是那些对模型能力有要求、对成本高度敏感的开发者和企业用户。这个群体恰恰是决定一个模型生态能否做大的关键。据美国AI追踪机构Interconnects AI发布的报告,截至2026年3月,通义千问系列模型已占全球开源模型下载量的50%以上,累计下载量接近10亿次。开源生态的规模优势需要转化为商业API的调用量,而价格是最直接的转化工具。

IDC在2026年7月发布的《全球基础模型软件厂商评估》报告中,将阿里云列入“领导者”象限,是唯一进入该象限的中国厂商。IDC指出,2026年全球已进入一个多模型、多智能体、多模态且自主执行的时代,考察的是“模型能力+服务能力”的综合竞争力。Qwen3.8-Flash的降价,正是在服务能力这个维度上加码——降低门槛、扩大调用量、积累更多场景数据,反过来再优化模型。

硬币的另一面

任何价格策略都有其代价。大模型API的持续降价正在将模型层变成纯粹的成本项而非差异化来源。当对手也可以跟进降价时,价格优势的窗口期往往很短。据公开信息,2026年上半年多家大模型公司密集调整定价,字节跳动豆包启动商业化付费体系,DeepSeek则将V4-Pro API价格永久降至原价的四分之一。

与此同时,算力成本仍在上涨。去年以来,算力层成本持续攀升,模型API层价格加速走低,剪刀差在扩大。阿里云能否在模型降价的同时保持云基础设施业务的利润,是一个需要持续观察的平衡题。

还有一个变量是Meta的选择。据Interconnects AI报告,Meta已于2026年放弃开源路线,转而发布闭源旗舰模型Muse Spark。当最大的开源竞争对手转向闭源,阿里云在开源模型领域的领先地位可能会进一步巩固——但也意味着它需要独自承担开源生态的维护成本。

降价的终点是规模

回到8月27日午间的这次调价。输入0.8元、输出2.7元,对于大多数开发者来说,这意味着一本100页的技术文档(约20万Token)进行一次完整分析的成本不到2元。当推理成本低到可以被忽略时,开发者的行为会发生改变——从“精打细算调用”转向“大规模实验和部署”。

这或许才是阿里云真正想要的结果。据IDC数据,2025年全年火山引擎在中国企业级MaaS市场的Token调用量份额达到49.5%,阿里云为28%。在Token调用量这个维度上,阿里云并非绝对领先。降价,本质上是在用利润换规模——更准确地说,是用架构创新带来的成本优势换取市场份额。

Qwen3.8-Flash的降价不是孤立事件。它是模型架构效率提升的结果,是开源生态规模效应的体现,也是阿里云在AI商业化路径上的一次明确表态。对于开发者而言,这意味着更好用、更便宜的工具;对于行业而言,这意味着价格战正在从单纯的低价竞争,转向“高性能+低成本”的双维较量。而这场较量的终局,将决定谁能在下一个AI应用爆发期成为基础设施级别的存在。

本文由AI辅助生成

分享到: