Agent Harness
连接大模型和工具的执行框架,负责任务编排、状态管理和错误处理
核心事实
时间轴 (近 90 天)
框架选型应从任务复杂度、可定制性、安全要求、生态与工具集四个维度考量
同一个底层模型在不同Harness下的执行效率可以相差悬殊
NVIDIA推出NeMo Relay工具,用于追踪智能体执行框架(Agent Harness)的行为轨迹,解决可观测性缺口
NeMo Relay通过对Agent Harness行为进行细粒度追踪,让开发者看到智能体完成任务过程的完整路径而非仅终点
调度层负责决定何时调用哪个工具或子智能体,通常对应 Planner 或 Orchestrator 角色
上下文管理层处理长任务中的信息压缩、历史裁剪与记忆检索,以避免超出模型的上下文窗口
执行控制层负责错误捕获、重试策略、中断恢复与安全沙箱等可靠性保障
编程智能体如 Codex、Claude Code 本质上是围绕模型构建的软件框架(Agent Harness),推理模型是驱动系统的引擎
许多智能体框架在设计时刻意将最终评估数据与优化循环隔离,智能体只能看到训练和验证信号,无法直接接触测试集
六大模块不必一开始全做,应从简单指令文件开始渐进式演进,同时警惕过度工程化放大系统风险
还有 18 条时间轴事件
全部知识事实 (20)
Agent Harness指包裹在大语言模型外围、负责协调模型与外部世界交互的整套工程系统
80%已验证Harness是Agent运行所依赖的工具集合与运行环境,是让AI能够执行操作的底层基础设施
80%已验证Agents API 的技术底座由 Codex harness 提供支持
75%已验证AgentConnect支持从对话、Pull Request、Issue、Webhook或定时任务等多种来源自动触发智能体任务
75%已验证Harness概念源于软件工程中的Test Harness(测试脚手架),在AI Agent语境下扩展为让Agent持续、循环、可控运行的系统性工程
75%已验证Agent Harness(智能体线束)是一套围绕Agent构建的工程化约束框架,概念借鉴自汽车工程中的线束系统
75%已验证Harness首次运行会要求填入DeepSeek的API密钥,但用户可在设置中接入其他提供商,包括通过OpenCode接入GPT系列模型和本地Ollama
65%待验证Superpowers本质上是一个专为Coding场景设计的轻量级Agent Harness实现
85%待验证框架选型应从任务复杂度、可定制性、安全要求、生态与工具集四个维度考量
50%待验证NeMo Relay通过对Agent Harness行为进行细粒度追踪,让开发者看到智能体完成任务过程的完整路径而非仅终点
50%待验证同一个底层模型在不同Harness下的执行效率可以相差悬殊
50%待验证调度层负责决定何时调用哪个工具或子智能体,通常对应 Planner 或 Orchestrator 角色
50%待验证执行控制层负责错误捕获、重试策略、中断恢复与安全沙箱等可靠性保障
50%待验证上下文管理层处理长任务中的信息压缩、历史裁剪与记忆检索,以避免超出模型的上下文窗口
50%待验证编程智能体如 Codex、Claude Code 本质上是围绕模型构建的软件框架(Agent Harness),推理模型是驱动系统的引擎
50%待验证许多智能体框架在设计时刻意将最终评估数据与优化循环隔离,智能体只能看到训练和验证信号,无法直接接触测试集
50%待验证Agent Harness本质上是为LLM提供的一整套支撑体系,让概率性的模型输出变成可靠的生产级能力
50%待验证六大模块不必一开始全做,应从简单指令文件开始渐进式演进,同时警惕过度工程化放大系统风险
50%待验证Agent Harness提供权限设置(限制文件夹或完全访问)和多种运行模式(标准、最小、PTC程序化工具调用、创作模式)
50%待验证Agent Harness提供类似LangFuse的轨迹视图(Trace),可查看代理每次工具调用并搜索审计历史
50%