基准
UC-Bench
专门用于评估大语言模型在人机对话中检测用户侧隐性冲突能力的人工标注基准数据集
时间轴 (近 90 天)
9月18日
UC-Bench是一个由人工标注、专门用于评估用户侧冲突检测能力的基准
待验证50%
9月18日
在UC-Bench上基于UC-Data训练的Qwen3.5-4B表现超过了参数量更大的通用大模型(如Claude Opus 4.8)
待验证50%
专门用于评估大语言模型在人机对话中检测用户侧隐性冲突能力的人工标注基准数据集
UC-Bench是一个由人工标注、专门用于评估用户侧冲突检测能力的基准
在UC-Bench上基于UC-Data训练的Qwen3.5-4B表现超过了参数量更大的通用大模型(如Claude Opus 4.8)