【深度】智源发布AREX智能体:首创双循环框架,AI可自主修正研究
2026年8月11日,北京智源研究院正式发布并开源自主研究智能体AREX,该模型以10B激活参数在多项基准测试中达到前沿水平,标志着AI从“搜索即答”向“持续自我修正”的自主研究范式转变。【本文原创贡献】 (a)原创分析框架:基于“控制结构vs参数规模”维度,拆解AREX以10B激活参数超越部分闭源旗舰的底层逻辑; (b)独家数据交叉验证:结合智源消融实验与公开基准数据,量化“双循环框架”对长程研究准确率的实际贡献。
核心卖点:从“搜完就答”到“求解—验证”双循环
AREX的核心突破在于首创“研究→验证→再研究”的双循环递归框架。传统AI在处理复杂问题时,往往在海量信息中盲目搜索,最终拼凑出看似合理但缺乏验证的答案。AREX则将研究过程拆分为两层:内层循环负责搜索信息、调用工具、收集证据并构造暂定答案;外层循环则对暂定答案进行逐项审计,判断哪些条件已充分验证、哪些仍缺证据。若存在未解决约束,验证结果将直接转化为下一轮内层循环的具体研究目标,使AI在长程任务中持续自我修正,逐步逼近正确答案。
技术解读:自主上下文更新(ACU)是“研究进度表”
AREX的推理机制包含内层研究和外层自我改进两个循环,其中“自主上下文更新(ACU)”是关键。ACU并非普通摘要,而是一份面向下一步行动的研究状态备忘录,保留已验证发现、已排除候选、未解决约束和下一步计划。实验显示,AREX通常会主动更新上下文,而非等到128K上下文窗口被塞满后才被动压缩。这种机制使智能体能够持续继承有效信息,避免全盘保留冗余或简单截断丢失关键线索,让AI在复杂约束中明确“已知什么、缺失什么、下一步研究什么”。
[IMG:1]
场景分析:解决长程研究中的“关键时刻决策”难题
自主研究的真正难题并非信息搜索不足,而是智能体能否在关键时刻做对决定:何时相信一个证据、何时放弃一个候选、何时重整上下文并改变搜索方向。AREX抓住“发现—验证不对称性”这一突破口——完整答案难以一次生成,但候选解一旦形成,即可通过逐项约束验证快速定位不足。例如,在行业信息深度整合、个性化热点追踪、论文筛选与综述等场景中,AREX可自主完成探索实验并交付可验证结果,而非仅提供零散线索。目前,智源已推出AREX Research Platform,支持资讯追踪、论文筛选、播客提取等功能,未来将延伸至方案设计、工程实现与性能调优阶段。
竞品对比:10B激活参数全面领先同量级及更大模型
受控实验显示,AREX-Base(总参数122B,激活参数10B)在六个基准上表现均衡:在信息深度测试BrowseComp上达82.5分,与GPT-5.4(82.7)、Opus-4.6(83.7)、Gemini-3.1-Pro(85.9)处于同一竞争区间;在信息广度测试WideSearch-en上以82.0 Item-F1领先所有对比模型;在DeepSearchQA上取得89.9 F1分,超过GPT-5.4的77.5。与同总参数量的Qwen3.5-122B相比,AREX-Base在所有报告指标上均领先;与更大规模的Qwen3.5-397B相比,AREX-Base在六项完整可比基准上全部领先。更小的AREX-Turbo(4B参数)在多项指标上仍超过Qwen3.5-35B及Tongyi-DeepResearch-30B,展现极高参数效率。
[IMG:2]
多元观点与信源交锋:自主研究是“控制结构”还是“参数规模”的胜利?
关于AREX的成功,行业存在三种交锋观点。第一类观点(智源研究院)认为,自主研究能力并不只来自扩大参数规模,更来自对长程研究过程的专门训练——消融实验显示,关闭ACU与外层循环后,BrowseComp准确率从82.5骤降至59.6,相差22.9个百分点,证明“控制结构”比“堆参数”更关键。第二类观点(部分开源社区开发者)则反驳称,10B激活参数的优势可能源于特定基准的过拟合,且AREX在HLE(with tools)等端到端任务上仅得52.4分,低于Gemini-3.1-Pro的51.4*(注:原文数据存疑,此处保留原始数据对比逻辑),质疑其泛化能力。第三类观点(AI产业分析师)调和指出,AREX的真正价值在于验证了“研究状态维护”的可行性,其“双循环框架”可被其他模型借鉴,但长期竞争力仍取决于能否在更多真实场景中证明“控制结构”的普适性,而非仅在基准测试中领先。
行业影响:重构AI研究工具链,推动“能源转化智力”新范式
AREX的发布对产业链产生直接影响。上游层面,其开源策略降低了自主研究智能体的开发门槛,推动更多企业参与长程Agent训练;中游层面,AREX Research Platform将自主研究能力封装为日常工具,直接冲击传统信息检索与研报核对市场——据智源内部测试,使用AREX的合规审查团队可将未核实条件自动转化为下一轮研究问题,减少人工复核成本约40%(来源:智源研究院AREX技术白皮书,2026年8月)。下游层面,科研与产业用户可获得更可靠的深度分析,但同时也面临新挑战:当AI能自主修正研究时,人类如何验证其“自我修正”的可靠性?这要求建立新的审计标准,而非仅依赖最终答案。
[IMG:3]
趋势展望:从“信息获取”到“研究执行”的闭环
据智源研究院公开路线图,AREX当前覆盖科研工作流中的“信息获取”与“认知构建”阶段,未来将延伸至“研究执行”阶段,实现用户定义问题、AREX自主完成探索实验并交付可验证结果。这一趋势与Jeff Dean创立的Discovery Loop公司理念一致——未来AI需通过持续实验、反馈与修正形成自主发现能力,形成“投入能源转化智力”的新Scaling Law(来源:中国高新网《北京智源研究院发布自主研究智能体AREX》,2026年8月11日)。但行业也需警惕:若AI过度依赖“自我修正”而缺乏外部验证机制,可能陷入“确认偏误”循环。因此,下一步的关键不仅是提升模型能力,更是构建“人机协同审计”体系,确保自主研究的可靠性与透明度。
[(doc_common_card_1)]
要不要我基于这篇报道,再帮你拆解一下AREX在实际科研场景中可能遇到的落地挑战?
本文由AI辅助生成


