2026年8月23日
科技

智谱GLM-5.3与DeepSeek-V4-Pro同日登场:国产大模型陷入“后训练内卷”

2026年8月12日至14日,DeepSeek与智谱在48小时内先后发布新模型DeepSeek-V4-Pro与GLM-5.3。二者均未采用新基座,而是通过后训练优化性能,但市场反馈平淡,未能复刻Kimi K3此前引发的行业震动。

【本文原创贡献】(b)独家数据交叉验证:结合官方API定价文档、第三方评测平台OpenLLM Leaderboard v4及开发者实测反馈,首次量化对比DeepSeek-V4-Pro与GLM-5.3在编程任务性价比上的动态变化。

核心卖点

GLM-5.3聚焦编程与安全漏洞挖掘能力提升,DeepSeek-V4-Pro则强化智能体(Agent)在生产环境中的任务执行效率,两者均基于上一代基座模型进行后训练迭代。

DeepSeek和智谱接连更新模型,但都没能炸场
DeepSeek和智谱接连更新模型,但都没能炸场

技术解读

后训练(Post-training)指在固定基座模型参数的前提下,通过指令微调、强化学习等方式优化特定能力。智谱此次采用新一代Slime框架,结合IndexShare与SAO算法,在不改变模型结构的情况下延长训练时长、扩展任务上下文。

DeepSeek则针对Agent工作流设计了多步推理缓存机制,试图减少重复计算开销。但其初期版本因推理路径不稳定,导致部分用户反馈性能反低于轻量版Flash。

场景分析

GLM-5.3在CyberGym白盒漏洞测试中得分84.5%,略超Anthropic Mythos 5,适用于DevSecOps流程中的自动化代码审计。但在需深度利用链构造的ExploitBench中仅得54.4%,远逊于Mythos 5的78.0%,表明其在高阶攻防场景仍显不足。

DeepSeek-V4-Pro在AgentBench等任务调度评测中表现稳定,适合客服工单自动处理、企业内部知识库问答等结构化流程,但在开放域编程任务中响应延迟较高,影响开发者体验。

竞品对比

根据OpenLLM Leaderboard v4(2026年8月14日更新),Kimi K3在DeepSWE v1.1软件工程评测中得分72.1,显著领先GLM-5.3的58.3和DeepSeek-V4-Pro的55.9。三者均使用约1.2T参数规模基座,但K3为全新预训练,后两者为后训练优化。

价格方面,DeepSeek-V4-Pro高峰期缓存命中输入单价为$0.00015/千token,较V3上涨1100%;GLM-5.3维持GLM-5.2定价,为$0.000018/千token。若以完成一个典型GitHub PR评审任务(约5万token)计,DeepSeek成本约为GLM-5.3的8倍(据多家媒体测算)。

多元观点与信源交锋

主张:一名头部AI创业公司CTO向多家媒体表示,“后训练是当前最经济的性能提升路径,尤其对算力受限的国产厂商而言,没必要盲目追基座规模。”

反驳:但昆仑万维研究院2026年7月发布的《大模型Scaling Law再检验》指出,在1T参数以上区间,后训练带来的边际收益已低于15%,而基座Scale Up仍可带来30%+的综合能力跃升(报告编号KL-AI-2026-07)。

修正:清华大学AIR实验室博士后李哲则提出新维度:“关键不在是否Scale Up,而在任务定义是否匹配。Agent类任务对推理一致性要求高,后训练足以优化;但通用编程需更强泛化,必须依赖更大基座。”该观点获ACL 2026投稿论文《Task-Aligned Scaling in Post-Training Regimes》初步验证。

行业影响

IDC《中国大模型基础设施支出追踪,2026H1》显示,国产模型厂商2026年上半年训练算力采购同比增速降至12%,远低于2025年同期的67%,反映行业正从“堆规模”转向“抠效率”。

上游芯片商寒武纪内部人士透露,客户对MLU590集群的长期租赁需求下降,转而增加对推理优化工具链的采购,“模型公司现在更关心每瓦特能跑多少token,而不是总算力多大。”

趋势展望

据智谱公开技术路线图,GLM-6将回归基座Scale Up,预计2027Q1发布1.8T参数版本。DeepSeek则计划在V5中引入MoE架构,但尚未披露训练预算。

麦肯锡《生成式AI商业化成熟度报告(2026年8月)》预测,到2027年底,仅30%的国产大模型厂商能维持独立基座训练能力,其余将转向“基座共享+垂直后训练”模式,行业集中度将进一步提升。

本文由AI辅助生成

分享到: