[控场AI]
模型TRACER-7B

TRACER

一种多轮用户模拟器,通过两阶段训练(监督微调+多轮强化学习)显式建模用户意图演化,旨在解决表面风格对齐但行为不一致的问题,采用层次化奖励和偏差感知优势调制机制

时间轴 (近 90 天)

9月25日

TRACER 是一个多轮用户模拟器,显式建模用户不断演化的意图,并学习将模拟行为与真实交互轨迹对齐

待验证50%
9月25日

TRACER 采用两阶段训练:第一阶段在真实用户对话上做监督微调(SFT),第二阶段引入多轮强化学习(RL)

待验证50%
9月25日

TRACER 设计层次化奖励,同时在结果层面和轨迹层面给出奖励信号,并结合偏差感知的优势调制以缓解奖励稀疏和信用分配问题

待验证50%
9月25日

TRACER 在组级转化率误差和语义轨迹距离两项指标上都取得了最低值,并能泛化到分布外场景

待验证50%
9月25日

在人类图灵测试中,受试者对 TRACER 生成对话的识别准确率接近随机猜测水平

待验证50%
9月25日

作者基于 TRACER 提出了 Dynamic Marketing Benchmark,联合评估大语言模型的说服有效性和回复质量两个维度

待验证50%

全部知识事实 (6)

来源文章