ResearchNov 28, 2024
Reward Hacking in Reinforcement Learning
Reward hacking occurs when reinforcement learning agents exploit flaws in reward functions instead of completing tasks. With RLHF and language models, it has…
#reinforcement learning#reward hacking#AI alignment#language models#RLHF#AI Agents#AI