[控场AI]
· 5 分钟阅读· 2,891 字

AIBuildAI-2.5:用LLM引导树搜索破解自主建模效率瓶颈

AIBuildAI-2.5:用LLM引导树搜索破解自主建模效率瓶颈

AIBuildAI-2.5用LLM引导搜索、资源感知调度和分层模型路由三管齐下,刷新MLE-Bench自主建模纪录。

AIBuildAI-2.5是一套基于大语言模型智能体的自主AI建模系统,核心目标是解决现有树搜索框架在有限算力预算下的三大效率瓶颈:依赖稀疏执行奖励导致的评分噪声问题、缺乏硬件感知的训练调度问题,以及对顶级模型的无差别调用带来的推理成本膨胀。针对这三点,系统分别引入LLM裁判从"预期改进、依据充分性、可行性"三维度对候选程序进行执行前打分、资源感知调度器动态匹配负载与硬件状态,以及按任务难度分流大小模型的路由机制。最终,AIBuildAI-2.5在MLE-Bench上以73.3%奖牌率排名第一,并在AIRS-Bench六项自主研究任务上超越强基线,验证了"效率优先"设计路线的可行性。

自主AI智能体正在改变机器学习模型的构建方式。如果一个系统能够自动完成从数据处理到模型训练的全流程,AI能力就有望向科学与工程的更多领域扩散。arXiv上的一篇新论文提出了AIBuildAI-2.5,一套基于大语言模型(LLM)智能体的自主建模系统,专门针对现有方法在效率上的三大短板做出改进,并在权威基准上刷新了纪录。

AIBuildAI-2.5 论文封面

把建模变成一场“代码搜索”

目前流行的一类自主AI智能体,把模型构建抽象成一个代码搜索问题,并通过树搜索来求解。在这棵搜索树里,每个节点都是一段候选程序,树的生长过程就是从父节点生成一个改进版的子节点程序。凭借这套思路,这类智能体在真实基准测试上的表现已经逼近经验丰富的AI工程师。

然而,看似成熟的范式背后隐藏着效率上的结构性问题。论文明确指出了三个尚未被充分解决的弱点,而这三点恰恰决定了智能体能否在有限算力预算下高效运转。

三大效率瓶颈

有限预算下的“噪声评分”难题

第一个问题出在候选节点的评估上。在现实的算力预算内,能够真正执行的候选程序数量非常有限。像蒙特卡洛树搜索(Monte Carlo-style tree search)这样依赖已执行奖励来给节点排序的策略,只能基于极少且带有噪声的分数来做决策。样本太少、噪声太大,导致系统在选择下一个探索方向时效率低下,很容易走上弯路。

缺乏资源感知的任务调度

第二个问题在于训练作业的调度。现有智能体普遍没有采用资源感知(resource-aware)的调度策略,训练任务的启动往往忽略了当前硬件资源的实际状态。这会直接拉低硬件利用率和整体训练效率——在GPU资源紧张、成本高昂的现实环境中,这是不容忽视的浪费。

单一大模型带来的推理成本膨胀

第三个问题涉及成本。当前的做法是每一次智能体调用都由同一个强大的模型来处理。无论任务简单还是复杂,都动用顶级模型,这直接推高了推理成本。对于需要成千上万次调用的搜索过程而言,这种“大炮打蚊子”的方式在经济性上并不划算。

AIBuildAI-2.5 的三管齐下

AIBuildAI-2.5 针对上述三个问题,分别给出了对应的工程化解决方案,形成了一套完整的智能体系统。

LLM引导的树搜索

系统的核心创新是一种全新的“LLM引导树搜索”。它不再单纯依赖执行后的奖励分数,而是引入一个裁判(judge)角色,从三个维度对每个候选程序打分:预期改进(expected improvement)、依据充分性(grounding)以及可行性(feasibility)。随后,一个选择器(selector)综合这些评分和当前的搜索状态,对候选池进行排序。这种做法让系统在真正执行程序之前就能借助LLM的先验判断来筛选方向,缓解了“评分噪声大、样本少”的困境。

将LLM引入搜索决策的关键价值在于其"免执行"的先验判断能力。传统MCTS必须先运行代码才能得到奖励信号,而LLM裁判可以在程序执行之前,仅凭代码文本本身进行多维度评估。"预期改进"衡量该方案相对当前最优是否有实质性进步;"依据充分性"检查修改是否有合理的机器学习理论依据,而非随机扰动;"可行性"则评估代码在给定算力约束下能否正常运行完毕。三者合力构成一个软过滤层,使系统能优先执行最有价值的候选,把有限的GPU时间分配到更值得探索的方向。这种"先判断、后执行"的范式本质上是把LLM的语义理解能力嫁接到传统搜索框架的节点选择环节,是让搜索在稀疏奖励环境下仍能高效收敛的关键设计。

资源感知调度器

为解决硬件利用率问题,AIBuildAI-2.5 配备了一个调度器(scheduler),在启动训练作业时会把当前的硬件资源状态纳入考量。这种资源感知的调度方式,让算力的分配更贴合实际负载,从而提升训练效率。

成本感知的模型路由

针对推理成本膨胀,系统设计了一个路由器(router)。它会把成本更低的LLM分配给要求不高的任务,而把最强的模型保留给建模流程中最具挑战性的子任务。这种分层调度的思路,在保证关键环节质量的同时,有效压缩了整体的推理开销。

基准测试上的表现

效果最终要用数据说话。论文报告称,AIBuildAI-2.5 在 MLE-Bench 上排名第一,取得了 73.3% 的奖牌率(medal rate)。此外,在来自 AIRS-Bench 的六项自主AI研究任务上,它的表现也超越了一个强劲的基线系统。

奖牌率这一指标反映的是智能体在竞赛式机器学习任务中达到奖牌水平的比例,73.3% 的成绩意味着系统在多数任务上都能产出具有竞争力的模型方案。

MLE-Bench是由OpenAI提出的标准化评测框架,它将Kaggle历史竞赛题目(涵盖图像分类、时序预测、自然语言处理等多类任务)改造成可自动评分的基准,以参赛队伍历史成绩为参照线,按照金、银、铜三档划定奖牌区间。奖牌率因此成为一个既考察模型能力上限、又反映跨任务泛化能力的综合指标,比单一任务的准确率更难通过过拟合刷高。AIRS-Bench则侧重于更开放的自主AI研究场景,要求智能体在给定研究目标后自主完成文献调研、方案设计与实验验证的完整闭环,评估的是端到端研究能力而非单点技术。两个基准的互补性使得AIBuildAI-2.5的评测结论更具说服力——前者验证工程执行质量,后者验证研究自主性。

对自主AI研发的意义

AIBuildAI-2.5 的价值不在于单点技术的突破,而在于它系统性地把“效率”放到了自主建模的核心位置。过去这类智能体更多在比拼能力上限——能不能做出好模型;而这项工作把焦点转向了在真实预算约束下如何又快又省地做出好模型。

将LLM的先验判断引入搜索决策、让调度感知硬件状态、按任务难度分配模型——这三个改进共同指向一个方向:让自主AI研发在有限资源下变得更加务实和可落地。对于希望降低AI建模门槛、扩大AI在科学与工程领域应用面的目标而言,这样的效率优化或许比单纯堆算力更有现实意义。

背景补充

树搜索(tree search)作为一种经典的离散优化框架,在自主建模场景中被用来遍历"程序空间"。每次从父节点出发,LLM根据当前代码生成若干变体作为子节点,系统再按评分选择最有潜力的分支继续展开,直到找到表现足够好的程序为止。蒙特卡洛树搜索(MCTS)是其中最常见的变体,其核心思想是通过大量随机模拟来估计每个节点的长期价值,再用上置信界(UCB)之类的策略平衡"利用已知好节点"与"探索未知方向"之间的权衡。这套框架在棋类游戏(如AlphaGo)中已被充分验证,但移植到代码生成场景后面临一个关键差异:游戏中模拟成本极低,可以快速积累大量样本;而执行一段机器学习训练代码往往需要数分钟乃至数小时,样本稀少的情况下噪声对排序决策的干扰会被显著放大。

分享:

相关推荐