基准
Spider
Spider是一个用于Text-to-SQL任务的大规模跨域基准测试数据集,旨在评估自然语言处理模型将自然语言问题转换为结构化SQL查询的能力。该数据集覆盖多个领域的数据库,包含复杂的多表连接查询场景,要求模型具备跨域泛化能力,是学术界和工业界衡量Text-to-SQL系统性能的重要参考标准之一。
时间轴 (近 90 天)
8月4日
On the Spider benchmark, the accuracy of state-of-the-art models rose from under 20% in 2018 to over 80%
待验证85%