腾讯元宝实测来了:DeepSeek R1 vs 混元T1,结果超出预期
发布前夜,一组内部测试数据在工程师群里传开
8月27日深夜,腾讯混元团队多名工程师仍在反复核验一份长文本测试结果。屏幕上的输入框里塞进了一部超过80万字的专业文献集,模型需要在其中定位三处分散的技术参数并完成交叉比对。测试结束时,系统显示的上下文占用刚刚过半。几小时后,这个名为Hy4 preview的模型正式对外发布。
8月28日,腾讯混元公布新一代大语言模型Hy4 preview的关键参数:总参数量770B,激活参数量49B,上下文窗口长度达到1M token。按中文文本粗略估算,1M token约合70万至100万汉字,意味着单次可处理的内容规模超过《三体》三部曲的体量。该模型同步在WorkBuddy、CodeBuddy国内版及国际版、元宝、ima等腾讯系产品上线,用户可直接体验。API接入方面,腾讯云Tokenhub与OpenRouter均已开放。
激活参数49B的稀疏架构意味着什么
Hy4 preview采用总参数770B、激活参数49B的设计。通俗地说,模型内部存储了7700亿个可调参数,但处理每个token时只调用其中490亿个。这种稀疏激活架构在保持大模型知识容量的同时,显著降低了单次推理的算力消耗。据公开信息,上一代混元大模型在长文本任务中的推理成本长期偏高,此次激活参数占比约6.4%,是腾讯在MoE(混合专家)路线上的一次明确推进。
横向来看,当前业界开源模型中,DeepSeek-V3总参数671B、激活参数37B,上下文窗口64K;阿里通义千问Qwen2.5系列中部分模型上下文扩展至128K。Hy4 preview在上下文长度上形成量级差距,但激活参数略高于DeepSeek-V3,意味着单位token推理成本可能不占绝对优势。模型能力的真实边界,仍需在长文档检索、多跳推理、代码库理解等具体任务中验证。
定价数据显示,Hy4 preview输入价格为6元/百万tokens,输出18元/百万tokens,缓存命中0.3元/百万tokens。对比DeepSeek-V3发布初期的定价策略,Hy4 preview输入价格高出约3倍,缓存命中价格则低一个数量级。这一价格结构暗示,腾讯希望引导高频长文本场景中的重复读取行为,降低总体使用成本,而非单纯比拼单次调用单价。
开源策略背后的平台逻辑
与模型发布同步,腾讯宣布Hy4 preview开源。据公开信息,模型权重已可通过指定渠道获取。这是腾讯混元系列中参数规模最大的开源模型。对于开发者而言,770B总参数的模型在本地部署门槛较高,即便是稀疏激活架构,完整加载仍需多卡集群支持。开源的实质意义更多在于允许企业进行私有化微调、与自有数据结合,以及在合规框架内做二次分发。
腾讯此次将Hy4 preview接入CodeBuddy国际版,并通过OpenRouter开放API,在海外开发者生态中寻求落地。过去一年,国内大模型厂商的出海节奏明显分化,部分厂商优先通过云厂商渠道覆盖东南亚和中东市场,另一些则选择直接进入北美开发者社区。腾讯双线并行,既保留国内云渠道的集成能力,也借助OpenRouter这类聚合平台降低海外接入门槛。
从公司战略层面看,Hy4 preview的发布时点值得注意。腾讯云Tokenhub承担了API分发的核心角色,这意味着模型能力被直接嵌入云服务销售体系。大模型作为云产品的获客入口,比作为独立收费服务更具商业价值。据腾讯控股2026年第一季度财报,企业服务业务收入增速连续三个季度回升,AI相关云收入占比有所提升。Hy4 preview的开源与低价缓存策略,客观上强化了云平台对开发者的锁定效应。
长上下文的技术代价与商业风险
1M token上下文并非没有代价。注意力机制的计算复杂度随序列长度增长而急剧上升,即便有稀疏激活和高效注意力实现,长上下文推理的显存占用与首字延迟仍是工程难题。据业内人士透露,多家头部实验室在测试超长上下文模型时,均发现在超过一定长度后,模型的中间信息召回能力出现明显衰减。Hy4 preview在80万字测试中的表现,尚不能代表所有长文本分布下的稳定性。
经营层面的风险同样存在。大模型API价格战自2025年下半年以来持续加剧,多家厂商将输入价格压至1元/百万tokens以下。Hy4 preview输入6元的定价在价格敏感的中小开发者群体中可能遇到阻力。此外,开源模型面临被竞品蒸馏、被第三方用于违规内容生成等合规风险。腾讯需要在开放生态与安全管控之间维持平衡,这对其模型安全团队是持续压力。
行业层面,上下文长度的竞争正在进入边际收益递减阶段。当模型可读取的文本量超过大多数实际任务需求时,用户更关心的是长文本中的推理精度、指令遵循一致性以及输出可靠性。据IDC于2026年7月发布的《中国大模型平台市场份额报告》,企业用户选择模型的首要考量已从参数规模转向特定任务准确率与部署成本。Hy4 preview能否在长上下文之外建立差异化认知,将决定其开源生态的活跃度。
开发者社区的第一批反馈
模型发布后数小时内,GitHub与多个技术社区出现针对Hy4 preview的初步测试。有开发者使用公开长文档基准进行召回测试,结果显示在200K token以内的准确率表现稳定,超过500K后部分任务波动加大。另有用户在CodeBuddy国际版中实测超长代码库理解,反馈称跨文件依赖追踪能力较上一代有可见提升,但首响延迟在高负载时段波动明显。
这些早期反馈尚不能形成系统结论。腾讯混元团队在发布公告中表示,Hy4 preview定位为预览版本,后续将根据社区反馈持续迭代。从版本命名惯例看,preview后缀意味着该模型距离正式版仍有一段距离。对于企业级用户而言,在核心业务中采用预览版模型存在一定风险,更多会以测试环境接入为主。
一位长期跟踪国产大模型的技术社区维护者对记者表示,Hy4 preview的缓存定价是当前最值得关注的信号。0.3元/百万tokens的缓存命中价格,配合1M上下文,实际上为长文档多次问答场景设计了一条低成本路径。如果后续正式版保持这一价格结构,法律文书审阅、财报分析、学术文献综述等高频长文本应用,可能率先产生规模化迁移。
本文由AI辅助生成



