奖励函数
-
Agent rl训练常见误区:奖励设计和探索不足怎么改
Agent 的强化学习训练效果差,很多时候并不是模型规模不够,而是训练目标没有被准确表达。奖励设计和探索策略彼此相关:奖励信号不清晰,Agent 不知道哪些行为值得重复;探索不足,Agent 又可能根本没有机会发现高回报行为。两类问题在训练曲线上经常表现相似,例如总回报长期不升、策略反复执行同一种动作,或者训练集表现不错但换一个场景就失效。
Agent 的强化学习训练效果差,很多时候并不是模型规模不够,而是训练目标没有被准确表达。奖励设计和探索策略彼此相关:奖励信号不清晰,Agent 不知道哪些行为值得重复;探索不足,Agent 又可能根本没有机会发现高回报行为。两类问题在训练曲线上经常表现相似,例如总回报长期不升、策略反复执行同一种动作,或者训练集表现不错但换一个场景就失效。