2026年8月26日
科技

中科曙光将发词元加速方案,直指大模型推理成本痛点

DeepSeek大模型涨价-还有无优质的Token Plan订阅?

一个存储厂商为何盯上“词元”

在多数人的认知里,存储系统负责“存数据”,计算芯片负责“算数据”。但中科曙光即将发布的新一代词元加速方案,试图打破这种分工边界。据公开信息,该方案面向大模型推理场景,重点处理推理过程中的重复计算与数据调度问题,直指当前生成式AI落地成本居高不下的核心环节。

“词元”是大模型处理文本的最小语义单元。用户每输入一句话,系统会拆解成若干词元;模型每生成一个回答,也会逐词元输出。推理过程中,大量词元被反复计算、缓存、调取,效率损耗往往发生在存储与计算的衔接处。中科曙光选择从这个切口进入,逻辑并不突兀。

[IMG:1]

从存储底座到推理加速的路径

中科曙光的ParaStor分布式存储系统,此前已在多个智算中心落地。更关键的一个背景是,该系统已部署于国内首个全国产十万卡AI超集群——曙光8000(登峰),承担大规模计算任务的数据吞吐与弹性扩展职能。十万卡级别集群对存储系统的并发访问压力、数据一致性要求和故障恢复能力,远高于常规数据中心。

据业内人士分析,正是这种超大规模集群的运维经验,让曙光积累了推理链路中数据调度瓶颈的一手数据。词元加速方案若能与ParaStor形成协同,意味着存储不再只是“数据仓库”,而成为推理计算流水线中的主动参与者。

[IMG:2]

技术逻辑:减少“重复劳动”

大模型推理存在一个显著特征:重复。同一个提示词前缀可能被成千上万个请求反复计算;同一段上下文窗口内的词元,在生成每个新词元时都会被重新读取。业界已有的KV Cache缓存技术,正是为了缓解这一问题。曙光的新方案,推测会在存储层面对词元缓存、预取、淘汰策略做更精细的调度。

横向对比来看,英伟达、AMD等芯片厂商的方案更多从GPU显存与计算单元入手;云厂商的推理优化集中在批处理调度和模型量化;而存储厂商切入推理加速,在国内尚属少数。曙光若能将词元级数据调度与分布式存储的带宽优势结合,可能在部分长文本、高并发场景中形成差异化竞争。

[IMG:3]

市场数据背后的正反两面

赛迪顾问最新发布的报告显示,中科曙光在AI、教育、具身智能和自动驾驶四个细分行业排名第一。这份报告发布于近期,具体统计口径为市场份额还是项目数量,公开信息中未完全披露。但四个细分领域的领先位置,至少说明曙光在智算基础设施领域的客户覆盖广度。

正面看,AI与具身智能是当前算力需求增速最快的赛道,自动驾驶则对存储系统的低延迟、高可靠有严苛要求。曙光在这些领域的第一名,意味着其解决方案经历了真实场景验证。反面看,细分行业第一不等于整体市场领先。在更广泛的通用存储市场,华为、浪潮、新华三等厂商同样具备强劲竞争力;在AI推理加速赛道,芯片厂商与云厂商的生态壁垒不容忽视。

[IMG:4]

战略卡位与潜在风险

从战略角度观察,中科曙光此番动作有明显的卡位意图。大模型竞争正从训练侧转向推理侧,推理成本直接决定商业模式的可持续性。谁能降低单位词元的推理成本,谁就能在下一轮AI基础设施投资中占据主动。曙光选择在存储与计算的中间地带做文章,避开了与GPU巨头正面交锋,也契合自身在分布式存储领域的技术积累。

但风险同样存在。词元加速方案的具体技术指标、实际性能提升幅度、与第三方大模型框架的兼容性,目前均未披露。若该方案仅在曙光自有生态内有效,其市场空间将受到限制。此外,推理加速是一个系统工程,存储层优化只是其中一环,单点突破能否带来可感知的端到端收益,仍有待验证。

[IMG:5]

行业影响初判

据公开信息,该方案的具体发布时间尚未确定。但从行业趋势看,存储系统深度参与AI计算流程,或将成为一条值得关注的技术路线。传统存储厂商若只停留在“提供更大容量、更快带宽”的层面,在AI基础设施价值链中的位置会持续边缘化。曙光此次尝试,本质上是为存储行业探索一条向上游计算环节延伸的路径。

对于下游客户而言,多一种降低推理成本的选项总是好事。但最终判断标准只有一个:实际部署后,每百万词元的推理成本能降多少。发布会上的技术名词再多,不及一组可复现的对比测试数据有说服力。

本文由AI辅助生成

分享到: