Actor-Critic是强化学习中的一类算法框架,结合了基于策略(Policy-based)和基于价值(Value-based)两种方法的优点。其中Actor负责根据当前策略选择动作,Critic负责评估该动作的价值并生成误差信号以指导Actor更新策略。该框架有效降低了策略梯度方法的方差,提升了训练稳定性,广泛应用于机器人控制、游戏智能及自然语言处理等领域。