巨人天成
产经 科技 企业 数据 峰会 快讯 商业

智源AREX智能体:以验证驱动自主研究,开启智能进化新路径

2026-08-11来源:快讯编辑:瑞雪

在人工智能领域,当大模型逐步掌握对话、推理、编程和工具调用等能力后,自主研究被视为下一个重要突破口。这一发展方向的意义在于,AI将不再受限于人类知识边界,而是形成一种全新的智能生产模式——“投入多少能源,就转化多少智力”。衡量智能体自主研究能力的重要维度之一,正是其能否在复杂约束条件下持续接近正确答案。

与普通问答只需定位单一事实不同,自主研究需要处理一组相互关联、彼此制约的条件。智能体不仅要从海量信息中筛选候选答案,还需整合分散甚至冲突的证据,并确保最终答案满足所有关键约束。任何一项未验证的条件都会使答案失效。其核心挑战在于,智能体能否清晰判断当前答案的完整性、缺失部分,以及下一步的研究方向。

智源研究院发布的AREX模型正是针对这一难题提出的解决方案。它抓住了自主研究中的关键突破口——“发现—验证不对称性”:完整答案难以一次性生成,但通过逐项验证候选解的关键约束,可以快速定位不足并指导后续探索。验证不仅用于判断答案正确性,更重要的是帮助智能体理解“已知什么、缺失什么、下一步研究什么”,从而提升研究效率。

这一思路的前瞻性在Jeff Dean创立的Discovery Loop公司得到印证。该公司强调,未来AI不仅需要更强的推理能力,还需通过持续实验、反馈和修正形成自主发现能力。AREX通过“求解—验证”双循环框架,体现了这一趋势:内层循环负责研究,外层循环负责改进,二者协同推动智能体在复杂任务中持续进化。

AREX的目标是训练一种能长期运行、自我验证、持续修正的研究型智能体。与传统模型一次性给出答案不同,AREX通过“研究→验证→再研究”的循环,逐步接近完整解。面对复杂任务时,智能体会先给出阶段性答案,随后逐项检查约束条件,保留已验证证据,定位未解决主张,并发起更有针对性的后续研究。当新证据到来时,智能体会更新答案并重新验证,直至输出最终结论。

这一过程可递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的“自我改进”并非指模型在线更新参数,而是指智能体对研究状态和当前答案的持续修正。AREX更像一个会反复检查进度、修正路径、沉淀有效证据的研究助手,而非简单的“搜索后回答”工具。

AREX的整体方法可概括为双循环递归求解框架:内层循环(Research Loop)负责完成一轮相对完整的研究,包括搜索信息、调用工具、收集证据、比较候选并构造暂定答案;外层循环(Self-Improvement Loop)则负责判断当前答案的进展,依据任务约束逐项审计,并形成置信判断。若所有条件均获支持,智能体结束研究;若仍有条件未解决,验证结果将转化为下一轮内层循环的研究目标。

自主上下文更新(ACU)是AREX的关键机制。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。实验显示,AREX在BrowseComp基准上达到82.5分,比关闭ACU和外层循环的版本高出22.9个百分点。这表明长程研究状态维护能显著提升性能。

在长程研究中,AREX通过主动调用上下文更新工具,将交互历史整理为“研究进度表”,帮助模型明确当前进展、已成立内容、已排除假设和下一步方向。这种机制避免了全盘保留冗余信息或简单截断丢失关键线索的问题,使智能体能够持续继承有效信息并形成更稳健的解。

为训练这种能力,AREX设计了一套可验证的自主研究任务生成方法:从确定答案出发,构造一组必须由真实证据支撑的约束条件,再改写为开放式问题。强教师模型在同样工具环境中执行任务,留下全过程的研究轨迹。只有从不确定候选逐步走向可验证答案的轨迹才会被保留,确保训练数据能真正教会模型如何发现线索、交叉验证、推翻错误候选并调整方向。

训练顺序同样关键。AREX采取分阶段策略:模型先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,强化学习阶段会重点优化关键步骤(如找到关键证据、否定错误候选、切换搜索方向)的研究策略,而非将所有步骤同等对待。

在六个基准测试中,AREX以10B激活参数达到自主研究前沿水平。在信息深度测试(BrowseComp、xbench-2510)中,AREX-Base分别取得82.5和接近MiroThinker-H1的成绩,表明其能稳定维护研究状态并逐级深入挖掘。在信息广度测试(WideSearch-en)中,AREX-Base以82.0 Item-F1领先所有对比模型,证明其能管理大范围搜索任务并持续跟踪已覆盖范围和剩余空白。

在深度与广度结合测试(DeepSearchQA)中,AREX-Base取得89.9 F1分,超过GPT-5.4等模型,说明其学到了一套可迁移的研究方法论:检索、比较、验证、修正、聚合。在端到端能力测试(GAIA、HLE with tools)中,AREX-Base分别取得85.4、71.0和52.4分,表明其能将搜索与规划、推理、工具调用结合,完成完整智能体工作流。

与同量级模型相比,AREX-Base的总参数量为122B,但每次推理仅激活10B参数。相比Qwen3.5-122B,AREX-Base在所有报告指标上均领先;相比Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。例如,AREX-Turbo仅4B参数,但在多项指标上超过Qwen3.5-35B等模型。

基于AREX LLMs,智源研究院进一步推出AREX Research Platform,将自主研究能力封装为面向科研与产业用户的日常工具。该平台针对资讯、论文、播客三种信息形态提供独立入口,均由AREX智能体驱动。用户可指定关注方向(如Coding Agent、芯片行业进展),生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。

每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(如“该方向是否有后续讨论”“所选benchmark是否权威”)启动检索、对比、分析与综合,输出完整的知识脉络。这一设计将内容发现与自主研究直接衔接,降低了信息获取成本。

当前版本的AREX Research Platform覆盖科研工作流中的“信息获取”与“认知构建”阶段。后续,智源研究院计划将能力延伸至研究执行阶段,由提供参考信息发展为支持方案产出,最终实现用户定义研究问题、AREX自主完成探索与优化并交付可验证结果的目标。该平台已开放BETA版测试,用户可访问arex-research.com体验。

第二届世界人形机器人运动会将启,灵巧手专项赛机器人“精细活”练得如何?
我们参加了灵巧手专项的积木搭建的比赛,要在一个限定的时间和场地之内搭积木,一共要搭5层,按照比赛规则,最后能够立住5秒就有效。”这项比赛考核的是机器人和灵巧手的配合,包括它的精细操作的能力,对于以后走进家庭去…

2026-08-11

留学生海外用网易云卡顿难忍?这些方法让音乐社区体验流畅回归
为什么海外网易云这么卡网易云音乐的页面推荐、评论区、私人FM、每日推荐等功能,都需要实时从国内服务器拉取数据。 方法一:使用回国网络优化方案(如QuickFox)解决网易云卡顿,比较直接的方式是优化数据交互…

2026-08-11

机器人董秘赵陈晨:以专业能力获第十二届金麒麟金牌董秘殊荣
来源:新浪财经8月10日,新浪财经第十二届金麒麟・金牌董秘榜单正式揭晓。机器人董事会秘书赵陈晨凭借扎实的合规治理能力、成熟的投资者关系运营、长期稳健的资本价值传递表现,荣耀加冕第十二届金麒麟・金牌董秘。 今…

2026-08-10

硅臻芯片联合中科大实现片上MBQC突破 通用光量子计算迈向新里程
为此,研究团队提出一种基于测量的量子计算(MBQC)技术路线下的纠缠态资源制备方法,基于“高维扩展-路由-逐层量子测量”的资源扩展思路,利用单个光子的路径自由度进行高维编码,将复杂的多光子态制备问题转化为对单…

2026-08-10

企业数字化转型四步走:从流程电子化迈向智能体自主运营新阶段
对于正在规划或已进入智能体自主化阶段的企业,架构设计需关注以下关键要素:第一,可组合的智能体框架——智能体应具备独立的感知、规划、执行与记忆模块,并通过标准化接口(如MCP协议)与外部系统交互,降低耦合度;…

2026-08-10

零一万物大模型开放平台将停服务 保障用户权益设过渡期与退款通道
凤凰网科技讯8月10日,零一万物发布公告,宣布因公司产品与服务体系升级,并进一步聚焦企业级人工智能解决方案,零一万物大模型开放平台将逐步停止面向用户提供在线体验、API调用及充值等相关服务。 官方表示,为保…

2026-08-10

法信科技与科大讯飞强强联合 共绘法律智能化建设新蓝图
他回顾了双方近十年的合作历程表示,法信科技是法律智能化领域的重要力量,也是讯飞长期的重要合作伙伴。科大讯飞将以技术创新对接法治需求,始终把整体安全放在首位,持续加大政法领域资源投入,与法信科技携手打造法律人…

2026-08-10

阿里云“搭积木”建数据中心:100天交付,成本降10%引领全球算力新风潮
8月10日,阿里云对外披露,基于其首创的全模块化设计架构,其大型AIDC数据中心的交付工期已缩短至100天,远低于国内传统交付周期6至12个月和美国的12至18个月。阿里云以“搭积木”式的工程创新,将交付周期…

2026-08-10

软件安全测试全解析:从核心内容到多元方法,筑牢安全防线
形式化方法测试使用形式规格说明语言(如Z、VDM、B、SDL等)建立数学模型,通过形式化验证技术对软件的安全属性进行精确的逻辑推理和证明。同时,完整的软件安全测试报告是评估软件安全性的重要依据,对于指导软件改…

2026-08-10

华为Mate 90系列或首搭硬件级防窥屏 软硬协同守护隐私新体验
此前,华为在MateBook Pro S轻薄本上率先引入了防窥屏量产技术,则让不少用户看到了屏幕硬件级防偷窥的前景。日前,数码博主“超维界”透露,华为Mate 90系列预计将提供防窥屏版本,这意味着,用户无…

2026-08-10