基准
SWE-Serve
NVIDIA提出的AI编码智能体评测基准,专注于推理服务软件场景,通过模拟真实服务环境(模型加载、并发请求处理、KV缓存管理等)来评估代码补丁的功能正确性与运行时性能,弥补传统基准仅验证测试通过率的不足
时间轴 (近 90 天)
9月23日
NVIDIA提出了SWE-Serve,用于揭示AI编码智能体在本地测试通过但在实时服务中失效的差距
待验证50%
9月23日
SWE-Serve通过模拟服务器加载真实模型、接收并处理请求的完整流程,在真实服务环境中检验智能体的补丁
待验证50%
9月23日
对于推理服务而言,一个功能正确但让吞吐量下降30%的补丁实际上是不可接受的,性能表现应纳入评测维度
待验证50%
9月23日
理解系统运行时行为、预见改动在负载下的表现是当前大模型编码能力的薄弱环节
待验证50%