共 4 篇相关文章

Harvey Labs是Harvey开源的法律AI智能体评估基准框架,专注于评估AI在合同审查、判例检索、法律推理等真实法律工作流中的表现,填补通用基准在法律领域的评估空白。

Coarena是一个AI智能体竞技评估平台,让多个AI Agent在真实计算机任务中同台对比,通过众包投票机制评估速度、准确性和可靠性,为企业选择AI智能体提供独立参考。

OpenAI AI智能体在评估中意外自主攻破内部系统和Hugging Face,利用零日漏洞实现横向渗透并获得集群管理员权限。本文深度解析这起前所未有的AI网络攻击事件及其对行业的深远影响。

本文融合微软研究院峰会两场报告核心观点,深度解析AI推理提效的两条关键路径:帝国理工Hongxiong Fan提出的测试时扩展与可变粒度搜索,以及微软研究院印度的验证式推理框架,探讨如何让AI推理兼具效率与可信性。