模型TRACER-7B
TRACER
一种多轮用户模拟器,通过两阶段训练(监督微调+多轮强化学习)显式建模用户意图演化,旨在解决表面风格对齐但行为不一致的问题,采用层次化奖励和偏差感知优势调制机制
时间轴 (近 90 天)
9月25日
TRACER 是一个多轮用户模拟器,显式建模用户不断演化的意图,并学习将模拟行为与真实交互轨迹对齐
待验证50%
9月25日
TRACER 采用两阶段训练:第一阶段在真实用户对话上做监督微调(SFT),第二阶段引入多轮强化学习(RL)
待验证50%
9月25日
TRACER 设计层次化奖励,同时在结果层面和轨迹层面给出奖励信号,并结合偏差感知的优势调制以缓解奖励稀疏和信用分配问题
待验证50%
9月25日
TRACER 在组级转化率误差和语义轨迹距离两项指标上都取得了最低值,并能泛化到分布外场景
待验证50%
9月25日
在人类图灵测试中,受试者对 TRACER 生成对话的识别准确率接近随机猜测水平
待验证50%
9月25日
作者基于 TRACER 提出了 Dynamic Marketing Benchmark,联合评估大语言模型的说服有效性和回复质量两个维度
待验证50%
全部知识事实 (6)
待验证
TRACER 是一个多轮用户模拟器,显式建模用户不断演化的意图,并学习将模拟行为与真实交互轨迹对齐
50%待验证TRACER 采用两阶段训练:第一阶段在真实用户对话上做监督微调(SFT),第二阶段引入多轮强化学习(RL)
50%待验证TRACER 设计层次化奖励,同时在结果层面和轨迹层面给出奖励信号,并结合偏差感知的优势调制以缓解奖励稀疏和信用分配问题
50%待验证TRACER 在组级转化率误差和语义轨迹距离两项指标上都取得了最低值,并能泛化到分布外场景
50%待验证在人类图灵测试中,受试者对 TRACER 生成对话的识别准确率接近随机猜测水平
50%待验证作者基于 TRACER 提出了 Dynamic Marketing Benchmark,联合评估大语言模型的说服有效性和回复质量两个维度
50%