EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning
本文提出EvoRS框架,通过自进化奖励系统解决开放式强化学习中的奖励失效问题,提高任务表现并减少奖励黑客攻击。
0 citationsRead paper
本文提出EvoRS框架,通过自进化奖励系统解决开放式强化学习中的奖励失效问题,提高任务表现并减少奖励黑客攻击。
本文提出SocialRL框架,通过多轮强化学习和奖励设计解决语言模型在多轮对话中目标与关系平衡的问题,提高目标达成率。
论文提出MORE模型,通过在骨干网络中嵌入多任务信息流,利用Anchor Tokens改进推荐系统中的多任务学习效果。
本文提出EvoRS框架,通过自进化奖励系统解决开放式强化学习中的奖励失效问题,提高任务表现并减少奖励黑客攻击。
本文提出SocialRL框架,通过多轮强化学习和奖励设计解决语言模型在多轮对话中目标与关系平衡的问题,提高目标达成率。
论文提出MORE模型,通过在骨干网络中嵌入多任务信息流,利用Anchor Tokens改进推荐系统中的多任务学习效果。