AREX-2
一种具备自我改进能力的LLM智能体框架,通过反思与长程执行两种领域无关机制,在测试阶段迭代优化解决方案,并支持跨领域能力迁移
时间轴 (近 90 天)
AREX-2 的核心目标是推进 LLM 智能体在推理阶段(test time)迭代优化自身解决方案的自我改进能力
AREX-2 将自我改进能力拆解为反思(reflection)和长程执行(long-horizon execution)两个互补机制
AREX-2 基于一个核心假设:反思与长程执行能力是领域无关(domain-agnostic)的,可从适合监督训练的场景迁移到不同任务领域
AREX-2 从机器学习任务和算法编程任务两个领域合成长程改进轨迹作为训练数据
AREX-2 基于 Qwen3.8-27B 构建
AREX-2 在 MLE-bench Lite 上得分 81.8,在 Frontier-CS 上得分 70.7
AREX-2 在深度研究类任务上取得成绩:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8
尽管训练数据来自机器学习和算法编程,AREX-2 能迁移到深度研究(deep research)类任务,支撑能力领域无关的假设
随着迭代轮数预算的增加,AREX-2 智能体持续改进而非过早触及天花板
机器学习任务的评估指标和算法编程任务的测试用例提供了客观、自动化的反馈,使大规模轨迹合成成为可能并避免对人工标注的依赖
还有 1 条时间轴事件
全部知识事实 (11)
AREX-2 的核心目标是推进 LLM 智能体在推理阶段(test time)迭代优化自身解决方案的自我改进能力
50%待验证AREX-2 将自我改进能力拆解为反思(reflection)和长程执行(long-horizon execution)两个互补机制
50%待验证AREX-2 基于一个核心假设:反思与长程执行能力是领域无关(domain-agnostic)的,可从适合监督训练的场景迁移到不同任务领域
50%待验证AREX-2 从机器学习任务和算法编程任务两个领域合成长程改进轨迹作为训练数据
50%待验证AREX-2 基于 Qwen3.8-27B 构建
50%待验证AREX-2 在 MLE-bench Lite 上得分 81.8,在 Frontier-CS 上得分 70.7
50%待验证AREX-2 在深度研究类任务上取得成绩:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8
50%待验证尽管训练数据来自机器学习和算法编程,AREX-2 能迁移到深度研究(deep research)类任务,支撑能力领域无关的假设
50%待验证随着迭代轮数预算的增加,AREX-2 智能体持续改进而非过早触及天花板
50%待验证机器学习任务的评估指标和算法编程任务的测试用例提供了客观、自动化的反馈,使大规模轨迹合成成为可能并避免对人工标注的依赖
50%待验证AREX-2 论文的核心结论是长程反思数据是通往自我改进智能体的有效路径
50%