0
| 本文作者: 陆毅 | 2026-07-28 10:15 |

作者丨AI 科技评论
编辑丨AI 科技评论
近日,XYZ AI Lab 正式发布了两款面向 Deep Search 场景的Agent:XYZ-Aquila-mini 和 XYZ-Aquila-pro,并在多项相关评测中取得领先成绩。
通读其技术报告后,我们发现,比榜单表现更值得追问的,是团队在研发过程中采用的一套 AI4AI 方法:AI 不只是最终被训练出来的产品,也开始参与发现问题、提出方案和验证改进。
围绕这套系统如何运作,以及它如何被用于 Agentic Post-Training,AI 科技评论采访了 XYZ-Aquila 核心团队。

图 1:XYZ-Aquila 技术报告中的 Deep Search Benchmark 总览。按照报告列出的比较口径,XYZ-Aquila-mini 在总参数量低于 40B 的开放权重比较组中七项指标位居组内第一,XYZ-Aquila-pro 在总参数量低于 400B 的开放权重比较组中六项指标位居组内第一。由于不同系统的工具栈、评判器、运行框架和评测时间并不完全一致,图中结果更适合被理解为公开结果对比,而非同一运行环境下的严格总排名。
Deep Search 并不是一次搜索、一次生成就能完成的任务。Agent 往往需要围绕同一个问题连续进行网页检索、信息抽取、证据核验、中间计算和答案提交,一条任务轨迹可能持续几十步,甚至上百步。按照技术报告给出的比较口径,Aquila-mini 和 Aquila-pro 在各自规模的开放权重比较组中都取得了领先表现。
如果只看这些数字,这已经是一次表现亮眼的 Deep Search Agent 发布。但比起榜单上的成绩,真正引起我们兴趣的,是技术报告《AI4AI at Scale》所披露的研发过程。
XYZ 在报告中将 Aquila 的研发方法概括为 AI4AI。这里的 AI,并不只是帮助工程师写几段代码、整理文献或者批量运行实验。
按照团队的描述,AI Agent 被放进了一个更完整的研发循环:它们读取评测结果和失败轨迹,分析问题可能出在数据、训练、工具、上下文还是运行框架;提出候选改进,将方案落实到代码、数据或系统配置中;再通过实验和评测判断改动是否有效,并把成功与失败的经验带入下一轮研发。
换句话说,在 Aquila的研发过程中,AI 不只是最终被制造出来的 Agent,也开始成为参与制造Agent 的研发力量。
眼下,AI-driven AI R&D 正成为越来越多 Frontier AI Lab 关注的方向:AI 开始从研发助手,进一步参与提出假设、设计实验和改进系统。它也因此常被放在 RSI,也就是递归式自我改进的语境下讨论。两者究竟是什么关系,Aquila 又走到了哪一步,正是我们在采访中首先想厘清的问题。
今天,让 Agent 写代码、跑实验,已经不算新鲜。真正关键的区别在于:AI 有没有进入研发判断本身?它是否能够从复杂的失败轨迹中,发现人类没有预先指出的问题?是否能够提出人类初始方案清单之外的改进?这些改进如何被开发、评测、接受或否决?当 AI 开始承担越来越多研发任务,人类又应该控制每一个执行步骤,还是转而控制目标、权限、评测和风险边界?
这些问题,也决定了AI4AI 究竟只是一种更高效的自动化工具,还是一种可能改变 Agent 研发方式的新范式。
为此,AI 科技评论围绕五个方面采访了 XYZ-Aquila 核心团队:AI4AI 到底意味着什么,它与 RSI 是什么关系;AI4AI 在 Agent 研发中采用了怎样的工作范式,又如何驱动 Agentic Post-Training;在 Aquila 的研发过程中,AI 是否提出过超出人类初始设想的改进,从而拓展团队能够探索的技术边界;要支持这样的研发方式,应该构建怎样的人机协作和验证架构;以及从 Aquila 出发,AI4AI 下一步可能走向哪里。
以下是经过编辑整理的对话内容。

01
AI4AI 到底是什么,
它离 RSI 还有多远?
▎AI 科技评论:现在几乎所有 AI 团队都在用 Agent 写代码、跑实验。为什么“研发中使用 AI”还不自动等于 AI4AI?
XYZ-Aquila 团队:判断标准不在于有没有调用大模型,而在于 AI 有没有进入研发闭环和研发判断。普通的编码 Agent 通常接到一个已经被人定义好的任务,例如修复某段代码、复现实验或生成一批数据;它可以把执行做得很快,但“为什么要做这件事”仍然由人预先决定。
在我们的 AI4AI 流程里,AI 需要读取开发评测返回的指标、成本和可靠性信号,查看获准访问的失败轨迹、历史实验与人类提案,判断当前瓶颈更可能出在数据、训练、工具、上下文、控制策略还是基础设施。然后,它要提出一个有范围、有预算、有验收条件的候选改动,并把改动落成可运行、可复现的系统工件。
所以 AI4AI 的关键不是“AI 帮人干了多少活”,而是 AI 是否开始参与“下一步应该改哪里、为什么改、怎样证明改对了”。
▎AI 科技评论:这听起来像把 AutoML的搜索空间放大。二者真正的区别是什么?
XYZ-Aquila 团队:两者都包含“提出候选—运行实验—根据结果继续搜索”的思想,但优化对象不同。AutoML 通常在任务、数据、模型框架和评价目标基本确定的前提下,搜索架构、超参数或训练配置。它解决的是一个已经被清楚定义的局部优化问题。
AI4AI 面向的是完整 AI 系统的研发。除了模型权重,它还可能修改数据生成与过滤方式、SFT 或 RL 策略、工具定义、检索与控制策略、上下文渲染、评测 Harness、代码执行环境、日志和回放系统。更重要的是,它还要先判断“应该动哪一层”。这一步已经不只是参数搜索,而是研究问题的归因与选择。

图 2:Aquila 把 Agent 能力视为系统设计问题。模型配置、学习过程、控制策略、工具接口、数据管线、评测系统和基础设施共同构成一套可优化、可审计的完整配置。
▎AI 科技评论:AI4AI 和 RSI 到底是什么关系?它们是一回事吗?
XYZ-Aquila 团队:不是一回事。我们更愿意把AI4AI 理解为一组方法和能力:让 AI 参与 AI 系统的研究、开发、评测和经验积累。RSI 则描述一种更强的递归状态——AI 不仅能参与研发,还能自主设计和开发更强的后继系统,而新的系统又显著提升下一轮 AI 研发能力,形成跨代复利。
一个系统可以用 AI 批量跑实验,却没有改进研发流程本身;也可以在同一个固定任务上循环优化,却没有证明下一代系统更擅长继续改进。真正接近 RSI,需要看到“改进者也被改进”,并且这种改进在后续循环里转化成更强的研发能力。
Aquila 目前更准确的定位,是一种有边界的系统级递归改进。递归体现在每一轮都会读取上一轮留下的成功配方、失败证据和人工反馈,改进对象也可以覆盖研发系统的多个组件;但目标、评测、权限、资源边界和最终发布权仍由人类控制。系统没有自主决定下一代基础模型的目标,也没有完成“训练一个后继系统,再由后继系统继续训练下一代”的闭环。因此,我们不会把它称为完整 RSI。
▎AI 科技评论:从公开信息看,几家前沿实验室和专门团队已经从不同方向推进 AI-driven AI R&D:Google DeepMind 的AlphaEvolve让模型提出算法、由自动评测器筛选并持续演化;Sakana AI 的 Darwin Gödel Machine尝试让 Agent 修改自己的代码;Anthropic与OpenAI也都把自动化 AI 研发和 RSI 纳入公开讨论。Aquila 与这些工作的共同点和差异分别是什么?
XYZ-Aquila 团队:共同点是,大家都在把 AI从执行工具推向研究循环:让它提出候选、运行实验、接受验证,并把结果带入下一轮。差异主要在优化对象和闭环边界。AlphaEvolve 适合目标可以自动验证的算法问题;Darwin Gödel Machine 直接修改 Agent 自身的代码与脚手架;Anthropic 和 OpenAI 更关注 AI 自动化研发能力的增长,以及它可能带来的 RSI 与治理问题。
Aquila 关注的是一个真实 Agent 产品怎样被系统性改进。优化器可以同时考虑数据、训练、工具、上下文和运行时,但它不能修改成功标准,也不能一边提出方案、一边查看私有答案并批准自己上线。我们的核心 claim 不是“已经实现 RSI”,而是:我们把一套有边界、可验证、可追溯的 AI4AI 闭环真正用在了 Agent 发布上。

图 3:有边界的 AI4AI 探索循环。人类预先定义目标能力、私有评测、允许改动的范围、资源预算、风险边界和验收标准;AI 在研究、开发、独立评审和记录的循环内探索,成功与失败都会进入共享经验。

02
上一部分讨论的是 AI4AI 的含义和边界。落到 Aquila,问题变得更具体:当研发对象不再只是一个模型,而是一整套 Deep Search Agent,AI4AI 究竟怎样参与它的后训练?
对 Aquila 团队来说,Agentic Post-Training 并不是一条固定的“SFT 做完再做 RL”的训练流水线。
一条长程搜索任务之所以失败,可能是训练数据存在捷径,也可能是监督信号使用了模型当时没有看到的证据;可能是网页抽取丢失了信息,也可能是上下文压缩删除了关键内容;还有一种情况是,Agent 已经找到正确答案,却没有在最终提交时使用它。
这些问题横跨数据、模型、工具、上下文和运行框架。AI4AI 的作用,是把它们放进同一套研发循环:从运行结果和失败轨迹中定位问题,形成可以实现的候选改动,再通过隔离评测和人工门禁,决定哪些方案进入发布系统。

图 4:外层 AI4AI 循环与内层 Agentic Post-Training。AI4AI 负责发现问题、形成候选改动并组织验证;具体改动可以落在数据、SFT、RL、工具、上下文或运行框架上。
▎AI 科技评论:具体到 Aquila 这次发布,这套 AI4AI 流程最后留下了哪些改动?为什么有些方案进入了发布版,有些却没有?
XYZ-Aquila 团队:最终完成开发和验收、进入Aquila-mini 与 Aquila-pro 发布配置的,主要有三类改造:图谱驱动且工具可达的数据构造、状态一致性 SFT,以及围绕上下文管理和精确回放展开的 Harness 改造。
它们看起来分别属于数据、训练和系统工程,但背后其实对应着同一个问题:怎样让 Agent 在真实工具环境中学到可以被验证、也可以被复现的行为。
这三类改造并不是一开始写死在训练计划里的固定步骤。AI4AI 会从失败轨迹、聚合指标、审计日志、历史实验和人类提案中收集信号,判断问题更可能出在哪一层;再把判断转化为候选系统,在既定的工具、上下文上限、轮次预算和私有评测边界内比较。优化器看不到私有答案和逐题反馈,也不能通过增加工具或扩大资源边界换取表面提升。
第一类改造发生在数据侧。
普通问答数据并不天然适合训练Deep Search Agent。有些问题看似复杂,实际上输入一个关键词就能直接找到答案;有些问题存在歧义或多个合理答案;还有一些问题在离线证据中成立,但关键网页在真实的 search 和 scrape 工具中根本无法到达。
如果直接使用这些数据,模型可能学到答案记忆或数据集捷径,而不是如何搜索、消歧和核验证据。
因此,Aquila 从连通的证据图中构造任务。网页和证据单元构成节点,引用、链接、实体和时间关系构成可追溯的连接。生成任务之后,系统还要使用发布时相同的工具检查:证据是否真的可达,答案是否唯一,简单查询能否绕过预期的搜索路径。只有在真实工具环境中依然需要搜索、同时又能够被核验的问题,才会进入训练数据。
第二类改造是状态一致性 SFT。
Deep Search Agent 的一条运行轨迹可能持续几十步甚至上百步。开发者事后能够看到完整审计日志,但模型在某个决策点真正看到的内容,可能已经经过折叠、摘要或压缩。
这会带来一个很隐蔽的问题:关键证据可能仍然存在于完整日志里,却已经不在模型当时的可见上下文中。如果直接使用完整日志进行监督,就相当于要求模型根据自己没有看到的信息作出正确决定。
Aquila因此为每一个训练决策重建模型当时真正可见的状态。有效的推理、工具调用和最终答案进入监督;无效调用和重复循环只作为上下文保留;遇到网页不可用或工具超时后产生的合理恢复行为,则继续用于训练。这里的重点不是简单地把训练序列做得更长,而是让每一个监督信号都忠实于模型当时真实看到的内容。
第三类改造落在 Harness,也就是 Agent 的运行框架上。
同一个错误答案,背后可能有完全不同的原因:模型没有搜到相关网页,网页抽取漏掉了关键段落,上下文策略删除了证据,或者模型已经看到证据,却没有在最终答案里使用。只看最终对错,很难区分这些原因。
因此,Aquila 在保持 search、scrape 和 python 三类工具接口不变的前提下,改进了网页处理、上下文渲染、状态保存和回放机制。每次运行不仅保留完整审计日志,也保存模型在每个决策点真正看到的状态。这样,系统才能判断:证据究竟没有被找到,还是找到后没有进入上下文;模型没有看到,还是看到以后没有使用。同一套运行记录也才能继续服务于失败诊断、训练数据转换和候选方案验证。

图 5:从优化契约到发布配置。图谱驱动任务、状态一致性 SFT 和运行时/回放完成开发与验收后进入 XYZ-Aquila-mini 和 pro;答案条件 RL 只通过前期筛选,没有计入发布能力。
RL 则展示了同一套流程的另一面。
长程搜索只根据最终答案给予奖励,信号往往过于稀疏。团队因此探索了一种答案条件的教师模型:在评测侧向教师提供参考答案,再比较模型在有无答案辅助时的策略分布差异,以此判断哪些步骤可能真正影响了最终结果。
前期实验显示,较强的归因信号经常出现在信息获取、消歧和答案提交等关键环节。这说明该方向值得继续研究,但并不足以证明一套完整的 RL 训练已经能够稳定提升能力。
由于后续训练和门控评测尚未完成,这项 RL 探索没有进入 Aquila 的发布配置。它的实验结果和未解决问题会被保留下来,供下一轮继续验证,但不能提前被算作发布成绩的来源。
这里也可以看出,AI4AI 并不意味着所有想法都由 AI 独立提出。候选方案可以来自 AI 对轨迹的分析,也可以来自人类专家,或者由双方共同形成。真正变化的是,所有方案都必须经过同一套过程:形成可以实施的改动,接受隔离评测,留下完整证据,并允许最终结论是“暂不采用”。
因此,Aquila 的 Agentic Post-Training 并不是选中了某一种“神奇的训练算法”。它更像是一条由AI4AI 驱动的研发管线:数据、训练和运行系统都可以成为改进对象;通过验证的方案进入发布版,证据不足的方案留在研究阶段;无论成功还是失败,结果都会成为下一轮可以继续使用的经验。

03
▎AI 科技评论:有没有一个具体案例,能说明AI4AI 不只是替人执行,而是真的拓展了团队能够探索的技术方向?
XYZ-Aquila 团队:有一类失败很反直觉:Agent在中间步骤已经找到关键网页,甚至抽取出了正确事实,但最终答案里没有使用它。我们把它叫作 found-but-not-submitted,也就是“找到了,却没有提交”。
只看最终得分,它和普通的“没找到答案”没有区别;把轨迹展开后,原因可能完全不同:证据在上下文压缩时被删掉了,被工具响应折叠后没有重新进入模型视野,或者模型已经看到证据,却在停止策略和最终提交时没有正确使用。
▎AI 科技评论:同一个错误答案背后可能有这么多原因,你们怎么判断问题到底出在哪一层?
XYZ-Aquila 团队:关键是同时保存两种记录。一种是只追加的完整审计日志,它保留整条运行历史;另一种是模型在每个决策点真正看到的可见状态 V_l。两者不能混为一谈。
如果关键证据出现在完整日志中,却没有进入当时的 V_l,问题更可能来自上下文渲染或压缩;如果证据已经进入 V_l,最终答案仍然没有使用,问题就更接近停止策略、约束检查或答案提交。这样才能把“模型不会”与“系统没有把信息正确呈现给模型”分开。

图 6:Aquila 长程轨迹的长度与工具调用分布。完整运行日志的中位长度为 102.7K 词元,中位工具调用次数为72;5.5% 的保留正确轨迹在完整日志中超过 256K。长尾轨迹使上下文压缩、证据保留和精确回放成为核心问题。
▎AI 科技评论:AI4AI 在这个案例里具体提出了什么?
XYZ-Aquila 团队:AI 优化 Agent 读取一组失败轨迹,对照完整日志、逐步可见状态与最终答案,沿着“证据何时进入上下文、何时消失、最后为什么没有被提交”这条链路寻找重复模式。它没有停留在“换一个更强模型”或“增加搜索次数”,而是把问题重新定义为长程任务中的状态管理。
它提出了两个不在人类初始方案清单里的方向。第一个是主动 compact:不等上下文逼近上限才被动压缩,而是在任务状态仍然清晰时,主动整理已经确认的事实、关键来源、未决问题、被否决的路径和下一步计划。第二个是研究记事本:把候选答案、证据链和关键中间结论放进独立、可检索的工作区,需要时再读回主上下文。
▎AI 科技评论:看起来合理并不等于真的有效。你们怎么验证?
XYZ-Aquila 团队:两个方向都要被实现成候选系统,并在相同工具、上下文上限、轮次预算和评测协议下接受端到端测试。评测不仅看分数,还看成本、延迟、证据链和副作用,再由人类 reviewer 检查它有没有改变任务边界或引入不可控行为。
最终,这两类方案都被实现并经过独立评测和人工验收:主动 compact 成为长程上下文管理的重要策略,研究记事本也被用于当前系统;它们的适用条件、资源开销和潜在副作用则写入共享经验,供后续继续迭代。重要的是,它们不是因为“AI 说得有道理”被采纳,而是因为方案被做出来、被比较并经受了证据检验。
▎AI 科技评论:这能说明 AI 已经比人更会做研究了吗?
XYZ-Aquila 团队:不能从一个案例推出这么大的结论。它能说明的更具体:在一个人类已经定义目标和边界的研发问题里,AI 可以从大量运行证据中提出人类没有预先列出的干预方向,并且其中至少有一部分能够经受独立评测。
AI4AI 的价值因此不只在于提高实验吞吐量,还在于扩大 solution space。人类仍然负责判断这个方向是否值得、是否安全、是否能进入发布版;但 AI 让团队实际能够探索的假设数量和组合深度明显增加。

04
▎AI 科技评论:如果 AI 已经参与提出方案和组织实验,人类会不会最后只剩下“盖章”?
XYZ-Aquila 团队:恰恰相反,人类负责的是最难被自动化、也最不该被默认交出去的部分。第一是定界:定义目标、优先级、资源、权限、风险边界和验收标准。第二是处理歧义:当证据互相矛盾、评测行为异常、疑似数据泄漏或需要改变任务定义时,AI 必须升级给人。
第三是发布:候选改动即便提分,也要判断它代表了可迁移能力,还是对评测规则的投机。第四是复盘:把失败原因、评审意见和新的边界要求转成下一轮可复用的规范。人类不需要审批每一次工具调用,但必须控制目标、权限、评测和最终采用权。
▎AI 科技评论:要让这种分工真正运行起来,底层需要怎样的人机协作架构?
XYZ-Aquila 团队:我们把它理解成一个带持久记忆的协作工作台,而不是一个超级聊天机器人。复杂目标先被拆成可执行任务,再分给不同角色:coordinator 负责路由和进度,executor 负责数据、代码与实验,reviewer 负责寻找风险和反例,memory 负责检索历史记录与沉淀经验。人类专家作为同一系统里的参与者,在需要判断和授权的节点介入。
系统要同时维护任务状态、权限、资源配额、工件版本和审计链。谁提出了假设,谁改了哪一版代码或数据,使用了多少资源,指标怎样变化,为什么接受或拒绝,都必须能追溯。没有这层基础设施,300 个 Agent 只会产生 300 份互相找不到的聊天记录。

图 7:人机协作流程。共享空间同时承担研究经验蒸馏、人类提案管理、阶段汇报和反馈绑定;每次贡献都被记录并可复用,但发布仍受人类定义的验收标准约束。
▎AI 科技评论:你们一直强调“共享经验”。记忆库里到底存什么,怎么避免它把错误不断带入下一轮?
XYZ-Aquila 团队:存的不是随手聊天,而是结构化、带版本的实验条目:任务目标、当时的模型与工具配置、干预类型、约束、证据链接、评测结果、评审结论、人类理由、失败类别、可复用配方和再次触发的条件。每条经验只在它被验证过的上下文中成立,换了模型、数据或工具,必须重新验证。
被拒绝的方案要和被接受的方案一样完整地保存,否则记忆库会变成只讲成功故事的幸存者偏差。每条记录都要能回到原始日志和评审工件;后续如果发现经验失效,也要追加修正,而不是悄悄覆盖。共享记忆不是“真理库”,而是一套可追溯、可质疑、可更新的团队实验笔记。
▎AI 科技评论:提出方案的 AI、执行实验的 AI 和评测 AI 之间,为什么要刻意分开?
XYZ-Aquila 团队:因为角色合一会放大自我确认偏差。优化器知道自己想证明什么,如果同时能看到私有答案、选择评测样本并批准结果,很容易把系统推向局部投机。我们因此把优化路径和评测路径隔离:优化器只能获得聚合反馈与获准诊断,评测 Agent 才能访问私有用例,Gate 按版本化规则作出决定,超出规则的情况再交给人。
这种分离并不能消除所有风险,但至少让“谁提出、谁执行、谁验证、谁发布”形成清晰责任链。AI4AI 的可扩展性不只来自更多 Agent,也来自验证、权限和审计能够随规模一起扩展。
▎AI 科技评论:所以,300 多个 worker 真正拓展的是什么?
XYZ-Aquila 团队:首先是并行探索和组织记忆的带宽:人类无法逐条阅读数万条长轨迹,也很难同时维护数据、训练、工具和基础设施上的大量候选。AI 可以承担高吞吐、可重复的工作,并把需要判断的少数例外整理给人。
但 worker 越多,验证瓶颈越明显。未来最稀缺的可能不是“再生成一个想法”,而是快速判断这个想法是否真实、可迁移、没有破坏边界。因此,人机协作架构的目标不是让人退出,而是把人的判断集中到杠杆最高的地方。

05
▎AI 科技评论:为什么先从 Deep Search 开始?它对 AI4AI 有什么特殊价值?
XYZ-Aquila 团队:搜索是一个很好的系统级试验场。它既有动态网页环境,又有相对明确的答案与证据;既要求长程规划,也要求工具调用、来源核验、计算和失败恢复。一个最终错误可能来自模型、网页抽取、上下文、工具协议或提交逻辑,正好迫使研发流程做跨组件归因。
不同搜索Benchmark 对工具的需求也明显不同:有的主要依赖广泛检索,有的需要更多网页抽取和 Python 计算。强 Agent 不能只学一套“多搜几轮”的固定套路,而要根据任务的信息结构切换搜索、读取、计算、核验和停止策略。

图 8:不同搜索 Benchmark 的工具使用组合。BrowseComp、BrowseComp-ZH 和 LiveBrowseComp 更依赖网页检索,GAIA 与 DeepSearchQA 的网页抽取和 Python 占比更高,WideSearch 同时要求广泛搜索与大量抽取。
▎AI 科技评论:这套方法接下来最自然的扩展场景是什么?
XYZ-Aquila 团队:Coding Agent 是最近的一步。代码、测试、编译错误、运行时日志、Code Review 和线上事故复盘都可以成为研发证据,系统可以据此判断应该改提示、工具路由、测试策略、数据配方还是模型。和搜索一样,Coding能力也不是单一模型权重的属性。
再往外是通用 Agent 和专业 Agent。通用 Agent 需要在多工具、跨领域、长流程任务中积累规划、工具选择和失败恢复经验;法律、医学、科研和企业内部 Agent 则需要学习本地文档、工作流约束、领域工具和专家反馈,同时把数据访问、隐私、责任和人工门禁写进契约。框架可以迁移,但评测和风险边界必须按领域重建。
▎AI 科技评论:AI4AI 本身还需要改进什么?
XYZ-Aquila 团队:首先是验证能力。随着提出假设和运行实验越来越便宜,瓶颈会转移到判断结果是否可靠:评测是否被过度适配,指标是否代表真实能力,候选是否带来隐藏副作用,经验能否迁移到新的模型和任务。未来的 AI4AI 不只需要更强的优化 Agent,也需要更强的 evaluator、回放、因果归因和反作弊机制。
其次是共享记忆和协作调度。循环从几十轮扩展到几千轮后,错误经验、过期结论和重复实验会迅速累积;Agent 数量从几百扩到上千后,任务路由、资源竞争、权限隔离和审计存储都会成为系统问题。规模会检验这套方法到底是一次演示,还是可持续的研发基础设施。
▎AI 科技评论:在什么条件下,你们会认为这套系统真的更接近 RSI?
XYZ-Aquila 团队:不能只看同一张榜单持续上涨。更关键的证据是:AI 是否开始改进负责研发的工作流本身;改进后的优化器、工具和记忆系统,是否让下一轮更快发现问题、提出更好的方案;由它参与构建的后继系统,是否又能继续提升研发能力;这种复利是否能跨模型、跨任务和跨代成立。
如果这些条件逐步出现,人类的角色可能从执行和逐项检查,更多转向目标设定、验证、治理与风险控制。但在那之前,把每一轮改动做成可解释、可回滚、可审计的工程闭环,比提前争夺“RSI”标签更重要。
▎AI 科技评论:这条路上最需要警惕的风险是什么?
XYZ-Aquila 团队:一是指标投机:系统学会提高分数,却没有提高可迁移能力。二是记忆污染:一次错误结论被反复引用,逐渐变成默认常识。三是验证失速:候选数量增长得比评测和人类审核更快。四是探索收敛:大量 Agent 共享同一模型和经验后,可能只是在重复相似假设。
还有成本问题。长程轨迹、隔离评测、回放和完整审计都很昂贵。AI4AI 不是“自动化之后成本归零”,而是把研发资源重新分配到更多探索和更强验证上。能否在能力、成本与风险之间形成稳定收益,是它能否走出实验室的关键。
▎AI 科技评论:Aquila 之后,团队下一步最想验证什么?
XYZ-Aquila 团队:一是继续推进process reward 与上下文管理相关的 RL,增加完整训练和门控评测,而不是停留在信号筛选。二是把循环扩展到更多任务和模型,验证有效经验是否真的可迁移。三是继续加强评测隔离、状态回放和人机协作基础设施,让更多 Agent 和更多迭代仍然保持证据纪律。
最终我们想验证的,不是 AI 能不能偶尔提出一个好点子,而是一套 AI4AI 系统能不能稳定地制造更强 Agent:每一轮都留下可复用的知识,同时让下一轮的研究更快、更广,也更可靠。
▎AI 科技评论:最后,如果只让读者记住一句话,你们希望是什么?
XYZ-Aquila 团队:AI4AI 不是把 AI“放养”成一个自行决定目标、自己给自己打分的系统,而是让 AI 在人类定义的边界内,成为能够发现问题、提出方案、完成开发、接受验证并积累经验的研发参与者。
回到 Aquila,这次公开发布回答了“做出了什么”:两款 Deep Search Agent,以及一张表现亮眼的成绩表。采访更想回答的,是“它们是怎么被做出来的”。
从这套流程看,XYZ 所说的 AI4AI 并不是一个神秘的自我进化黑箱。它更像一间被重新设计的研发实验室:AI 进入研究、开发和证据整理,人类控制目标、边界、评测与发布;数据、训练、工具、上下文、回放和基础设施不再分散,而被纳入同一条可以接受、拒绝和积累经验的循环。
Aquila 当然还不是完整 RSI,也不足以证明 AI4AI 已经适用于所有 Agent。但它至少提供了一个具体样本:当 AI 真正进入研发判断,Agentic Post-Training 的核心问题就不再只是“下一轮用 SFT 还是 RL”,而是如何让 AI 和人类共同管理一个复杂系统的改进。
SOTA 是一次结果;能否持续制造更强 Agent,才是这场 AI4AI 竞赛真正漫长的部分。