[控场AI]
基准

SWE-Serve

NVIDIA提出的AI编码智能体评测基准,专注于推理服务软件场景,通过模拟真实服务环境(模型加载、并发请求处理、KV缓存管理等)来评估代码补丁的功能正确性与运行时性能,弥补传统基准仅验证测试通过率的不足

时间轴 (近 90 天)

9月23日

NVIDIA提出了SWE-Serve,用于揭示AI编码智能体在本地测试通过但在实时服务中失效的差距

待验证50%
9月23日

SWE-Serve通过模拟服务器加载真实模型、接收并处理请求的完整流程,在真实服务环境中检验智能体的补丁

待验证50%
9月23日

对于推理服务而言,一个功能正确但让吞吐量下降30%的补丁实际上是不可接受的,性能表现应纳入评测维度

待验证50%
9月23日

理解系统运行时行为、预见改动在负载下的表现是当前大模型编码能力的薄弱环节

待验证50%

全部知识事实 (4)

来源文章