2026年9月1日
科技

智谱单位Token推理成本半年降80%,GLM-6.0聚焦“自进化”能力

智谱ZCode免费送3亿Token!GLM‑5.3‑Flash限时领取,官方Harness多智能体、浏览器控制与远程开发全体验

智谱单位Token推理成本半年降80%,GLM-6.0聚焦“自进化”能力

2026年上半年,大模型企业智谱AI披露其单位Token推理成本较年初下降80%。这一数据变化背后,是其在国产算力适配与模型架构优化上的双重突破。

在8月31日晚间举行的半年度业绩沟通会上,面对市场对其“仅依赖后训练、缺乏基座创新”的质疑,智谱创始人唐杰明确回应:下一代基座模型GLM-6.0仍在推进中,参数规模将继续扩大,但公司将同步引入激活参数管控机制,以平衡性能、速度与成本。

[IMG:1]

据公开信息,智谱已实现10万级国产AI芯片的规模化推理部署。其最新发布的GLM-5.3-Flash成为首款在超大规模真实流量场景下完全依托国产芯片集群提供服务的大模型。公司称,在相同硬件条件下,该模型端到端服务性能相较初始基线提升3倍。

这一进展对国内大模型产业具有标志性意义。长期以来,国产芯片因软件生态和算子优化不足,难以支撑高并发、低延迟的商业推理需求。智谱通过模型压缩、量化及推理引擎深度定制,显著提升了国产硬件的实际可用性。

[IMG:2]

唐杰将GLM-6.0的核心方向概括为“自进化”。他指出,未来模型的关键挑战并非单纯扩大参数量,而在于赋予模型自我判断能力——“能自己判断什么时候停止、什么时候纠正自己”。这一目标直指当前大模型幻觉频发、缺乏反思机制的行业痛点。

不过,技术路径仍存风险。据业内人士分析,“自进化”需结合强化学习、形式验证与人类反馈闭环,目前尚无成熟范式。若过度依赖模型自主修正,可能引发不可控的推理偏差。此外,尽管推理成本大幅下降,但训练GLM-6.0所需的算力投入仍将陡增,对智谱的融资节奏与商业化回血能力构成压力。

从行业视角看,智谱的选择反映了中国大模型厂商的战略分化:一边是追赶国际参数规模,另一边是深耕垂直场景效率。IDC《2026年第二季度中国人工智能基础设施市场追踪》显示,国产AI芯片在大模型推理市场的份额已升至34%,较2025年同期增长12个百分点。智谱的实践,或为这一趋势提供关键验证。

本文由AI辅助生成

分享到: