2026年9月11日
科技

GPU利用率不到三成,Token为何分出三六九等

15倍吞吐、首字延迟从4秒砍到0.7秒——LMCache把KV缓存从显存里"解放"了

“有人送你500个Token,有人送他500个Token,但你的500个Token可能很值钱,他的500个Token可能不值钱。”9月10日,在2026外滩大会“Token效率:推动Agent智能提升与广泛应用的关键”论坛上,中国工程院院士、清华大学计算机科学与技术系教授郑纬民用一个生活化的对比,把Token价值的分化摆到了台面上。

这句话背后,是AI基础设施正在经历的一场静默转向。过去两年,行业追逐的是算力规模、卡的数量、集群的峰值性能;如今,越来越多从业者开始盯住另一个指标:每产出单位Token,到底消耗了多少电、多少时间、多少有效算力。据公开信息,蚂蚁集团平台技术事业群总裁骆骥在同一个场合披露,以GPU为核心的硬件搭建计算集群、提供推理服务时,GPU的平均利用率目前不足30%,部分企业级数据中心甚至低于10%。

[IMG:1]

Token不是同一种“货币”

郑纬民解释,Token价值涉及多个指标。首Token延迟(TTFT)是用户发送请求到接收第一个输出Token的时间间隔,TTFT越小,体验越好;每秒生成的Token数(TPS)越高,生成速度越快;能同时服务多少用户、高峰期会不会卡顿,同样直接影响使用体验。这些指标表现越好,Token的价格越高。

源码资本投资合伙人、美国国家工程院外籍院士张宏江在外滩大会开幕式上给出了更直白的类比:“Token是智能体经济里的货币。”既然Token是货币,就会有币值高低之分。张宏江说,行业真正需要的是最有价值的Token,“你要的是‘茅台’,而不是一般的烈酒”。

这一判断与产业侧的体感一致。智能体长程任务正在拉长Token消耗链条。无论是编程辅助还是智能办公,一次复杂任务往往需要模型反复规划、调用工具、校验结果,Token消耗量成倍增长。Token价格的本质,也由此从“按量计费”转向“按服务等级定价”:从聊天到智能体,Token输出速度的价值逐级放大,厂家将速度产品化,形成独立的可选服务等级。

[IMG:2]

“Token工厂”热建,效率却卡在结构上

当前“Token工厂”建设如火如荼,但郑纬民提醒,这并不意味着产出高效Token。他将大模型推理拆成三个阶段:输入处理阶段(Prefill)计算密集,一次性处理所有输入,计算量大、延迟高;缓存阶段(KVCache)保存中间结果,被多次复用;输出生成阶段(Decode)带宽密集,每次生成一个输出,计算量小但次数多,要求内存带宽高、延迟小、容量大。

清华大学正在探索以KVCache为中心的分离架构,试图大幅降低集群推理成本。郑纬民透露,该方案将异构协同投入到千卡级商业生产中,“还供不应求”。但他同时指出,国产卡方案由于显存容量和带宽限制,与先进算力相比仍存在一定差距。Token效率面临需求爆发、算力低效、能源供给受限的结构性失衡问题。

能源与碳排放是另一条硬约束。骆骥介绍,2025年全球数据中心碳排放超过2.86亿吨,比预期高出57%。Token的背后是数据中心、算力和电力,电力又直接对应碳排放。这意味着,Token效率不只是一道技术题,也是一道能源题。

[IMG:3]

绿色计算链路里多了一个“Token”

骆骥认为,必须在绿色计算框架下解决Token效率问题。过去提出的绿色计算转化链路,在AI时代增加了一个关键环节——Token。Token效率既追求让每个Token承载更高的智能价值,也追求以更低成本、更快响应、更少能耗与更低碳排放实现更多有效智能产出。

但他强调了一条底线:“我们不能只顾着优化Token效率,却牺牲了智能水位。”任何Token效率的提升,都必须以保持一定智能水平为前提,智能不能出现明显退化。这一表态针对的是行业中可能出现的倾向:为压低成本而换用更小模型、更激进的量化策略,短期指标好看,实际业务价值反而下降。

工程层面的挑战同样棘手。市面上的GPU卡型多样,模型系列各不相同,要把它们组合起来优化Token效率,难度极大。在应用侧,还要解决Token“黑盒”问题和Token消耗治理,管住Token膨胀,让Token花在真正产生业务价值的地方。

[IMG:4]

缺一把统一的尺子

骆骥指出,Token效率的基准测试和标准体系亟待建立。“没有一把统一的尺子,就很难判断某个应用系统、某个AI创新应用、某个模型或某个推理系统的Token效率到底好不好,最后只能各说各话。”

从产业格局看,这一标准空白既是风险也是机会。对头部云厂商和推理服务商而言,谁先定义Token效率的度量方式,谁就有机会在服务等级定价中掌握话语权;对中小AI企业而言,缺乏统一标准意味着采购推理服务时难以横向比价,容易为“低价值Token”支付溢价。对国产算力厂商来说,显存和带宽的差距是现实短板,但在KVCache分离架构、异构协同等方向上,仍存在通过系统级优化缩小差距的空间。

郑纬民表示,AI工厂的最终产品是高质量Token,能源与算力只有经过模型和推理系统才会转化成为可供业务消费的智能服务。大模型负责内容质量,决定生成质量上限;推理系统决定交付质量。只有把模型和推理两个环节都做好,才能产出高质量Token。

骆骥则把Token比作AI时代新经济的硬通货,像干旱地区的水源,需要统筹治理、多方共同优化。“一个地方种树保水并非越多越好,过度同样可能会影响上下游。”他说,未来分配Token的权利和有效使用Token的权利非常关键。在规模庞大的智能体协作网络背后,每个智能体能被分配多少Token、能否高效使用这些Token,将决定整个网络的实际智能产出。

据公开信息,2026外滩大会相关论坛上,多位与会者形成的一个共识是:Token效率不是单一环节的优化,而是从芯片、推理系统、模型到应用治理的全链路工程。GPU利用率不足30%的现状,说明这条链路上仍有大量价值尚未释放。而释放的前提,是先承认Token与Token并不相同。

本文由AI辅助生成

分享到: