Meta创建AI过滤器以选择实验,节省GPU时间
Meta FAIR推出了AI研究偏好模型(AI Research Preference Models),这是一个在执行机器学习实验之前对其进行分类的系统,以减少GPU的消耗。在AIRS-Bench的测试中,该工具将平均分数从0.684提高到0.729,并在大约15小时内达到了与24小时训练相当的结果。
- RPM比较未执行的候选者,并允许代理仅选择最有前景的实验。
- 代理版本的标准化平均分数为0.729,而没有该系统时为0.684。
- 两个版本的结果都在大约15小时的计算中达到了24小时基础模型的结果。
使用人工智能进行自主研究面临一个不太显眼的问题:验证想法需要时间、金钱和计算能力。一个代理可以为机器学习模型提出数十种修改,但每次完整训练可能消耗数小时甚至数天的GPU,因此预先选择成为过程中的一个重要决策。
Meta的FAIR团队与牛津大学和伦敦大学学院的研究人员共同推出了AI研究偏好模型(RPM)。该系统并不试图猜测绝对分数或准确预测实验的最终结果,而是对尚未执行的候选者进行排序,并选择哪个候选者值得首先进入昂贵的训练阶段。
在计算支出之前的过滤器
该提案源于对语言模型的一个限制的发现:尽管它们可以推理计划、代码和搜索历史,但在直接预测执行指标时并不可靠。因此,RPM采用了一个更为有限的任务,比较两个候选者,并根据可用证据决定哪个看起来是更有前景的研究方向。
该机制集成在AIRA-dojo中,这是一个选择父代的贪婪树搜索环境,使用Draft、Improve和Debug操作符。代理并不是生成一个子代、执行它并重复该过程,而是并行应用一个操作符15次,收集未测试的候选者,并通过配对比较组织淘汰赛。
只有该淘汰赛的获胜者进入执行阶段,而每次比较都通过宽度优先搜索的遍历获得已探索节点的上下文。该上下文包括之前的实验和它们获得的验证分数,这些信息使评审能够区分出可行的改进、冗余的变体和仍可纠正的错误。
这种方法改变了代理的核心问题。代理不再被要求预测每个提案的表现,而是被要求确定哪个提案值得消耗下一个资源块,这一决策更接近研究人员在有限预算下优先考虑假设时所做的评估。
两个版本的不同成本
团队评估了一个仅基于推理的RPM变体和一个具有代理能力的变体。在第一个版本中,一个冻结的语言模型充当评审,检查候选计划、代码和搜索历史,而一个使用MIPROv2的优化评分标准指导其决策。
该评分标准试图重现主要研究人员的标准:容忍可纠正的错误,奖励可以扩展的想法,并惩罚重复已探索工作的方向。该版本的离线准确率在57.7%到59.0%之间,表明选择相较于随机性有所改善,尽管仍远未达到完美标准。
代理版本使用相同的评审,但允许在一个孤立的环境中操作,该环境克隆代理的工作空间并包含一个唯一的 H200。它的工具包括 python、bash 和 submit_solution,通过这些工具在决定是否继续某个方向或结束研究周期之前,执行小规模的试点测试。
设计中包含两个直接影响系统行为的决策。为了避免过早停止,剩余预算显示为 2700 秒,尽管实际可用时间为 300 秒,试点限制为 30 次,阈值为 60 秒;此外,代理选择器仅在 Draft 和 Improve 阶段介入,因为 Debug 会返回随机选择,以避免因额外评估而消耗时钟。
与随机选择的结果对比
测试在 AIRS-Bench 上进行,包含 20 个公共文本和表格数据任务,每个任务在单个 H200 上计算 24 小时,使用 10 个种子。Qwen3.6-27B 作为研究操作员和 RPM 的支柱,条件设计旨在将改进归因于选择层,而不是引入更强大的评审。
未使用 RPM 的随机选择作为参考,获得了 0.684 的平均标准化分数。仅基于推理的模型将该数字提升至 0.711,而代理版本达到了 0.729;使用验证和测试预言机计算的上限分别为 0.748 和 0.759。
在达到基线模型结果的速度上也出现了差异。推理变体在 14.88 小时内达到了 0.684 的最终分数,相当于加速 1.61 倍,而代理系统在 15.50 小时内达到了这一结果,相较于 24 小时的参考,提升了 1.55 倍。
这种收益并未消除所有成本:自托管推理每次执行增加 0.660 小时。调整该时间后,相应版本的报告性能为 0.708,耗时 23.34 小时,这表明实际优势既依赖于过滤器的质量,也依赖于执行它的基础设施的效率。
突出结果和提案的局限性
报告将两个新的基准结果归因于 RPM 变体。在 WinoGrande 中,代理系统达到了 94.1%,高于之前称为 AIRA₂ 的代理系统的 90.4%;而仅基于推理的版本在 SVAMP 中获得了 95.7%,相比之前的人类结果 94.2%。
这些数字并不意味着选择器可以替代实验评估,因为 RPM 仍然需要执行所选候选者并验证其表现。它的贡献在于减少进入该阶段的提案数量,这在 GPU 能力决定团队可以探索多少假设的场景中是一个重要的差异。
架构还表明,自主性不仅仅依赖于向代理提供更多工具。当系统组织预算、保留先前测试的上下文并在承诺资源之前比较替代方案时,性能会得到改善,尽管设计决策,如预算高估和 Debug 返回随机选择,仍然揭示了实验性的妥协。
该提案部分可部署:AIRA-dojo 和 AIRS-Bench 是开源的,使用的 LLM 保持冻结状态,Qwen3.6-27B 拥有开放权重。然而,使用 H200、自托管推理的成本以及对短期试点的依赖表明,将这些结果转移到其他环境中需要独立测量基础设施、任务和预算。
MarkTechPost报道,FAIR在Meta与牛津大学和伦敦大学学院合作开发了这项工作,并将RPM作为AI研究代理的优先级层。最相关的结果,超越了一个具体的数字,是将实验选择转变为机器学习循环的一个明确组成部分,而不是依赖随机生成或代理的直觉。
该发布还指出,相较于没有RPM的配置,推理变体的估计改进概率为0.5923,代理变体为0.5913,95%置信区间的下限分别为0.5066和0.5018。这些数据表明存在适度的统计优势,并建议将结果解读为有希望的证据,而不是保证该方法在任何研究问题上都能同样有效。
对于预算紧张的团队来说,吸引力在于在相同的可用时间内获得更多有用的探索。这个想法仍需在更多任务和配置中得到验证,但为一个日益增长的紧张局势提供了具体的回应:代理可以越来越快地生成实验,而执行这些实验的能力仍然稀缺且成本高昂。
-- 价格
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

BNB Chain 开启发射台乱战,本轮关键词是「币股 Meme」?

比特币:矿工收入反弹,但算力未能跟上

澳大利亚数据中心增长:美国大型科技公司准备投资1550亿美元

CZ对吉尔吉斯斯坦的访问凸显国家支持无法保证稳定币退出

当 Polymarket 们等走向「幕后」:预测市场的下半场,在交易所之外?

2026 上半年 Polymarket 报告:高频交易员,还是超级预测者?

IFM推出K2 Horizon,一个开放的AI家族,参数高达3750亿

尼泊尔向联合国气候基金请求25亿美元以应对毁灭性洪灾

亚马逊货运飞机在迈阿密着陆时坠毁,造成多人受伤

如何挖掘比特币:初学者的挖矿指南-2026年四大云挖矿网站
![[社论] 比民主更重要的东西,自由](/public-static/29_4631d65680.png?format=avif)
[社论] 比民主更重要的东西,自由

经济: 中国向金融系统注入540亿美元

百度股票通:股票在一个月内能涨20%吗?

日本初创公司能否在AI芯片领域击败Nvidia?

2026年9月 WEEX 上 AI 与人工加密货币交易奖励对比

AI 交易应用适合加密货币吗?深入了解 WEEX AI Wars 黑客松

特朗普的支持率降至33%,在中期选举前对市场施加压力

墨西哥:与一名音乐家及其家人谋杀案相关的150万美元比特币钱包

加密货币:一家庭在雷恩附近被错误扣押和暴力对待

波场 TRON 行业周报:非农偏鹰但 CPI 将决定 BTC 能否站稳 8 万,详解构建数字内容与 IP 资产化的 KOR Protocol

XRP Healthcare称4011个钱包损失45.2万美元

Meme 币直接配股票代币:Robinhood Chain 爆火的真正原因

AI 交易是真实还是炒作?WEEX AI Wars II 详解














