Reinforcement-learning environments, model evaluations and misalignment
One post compares most reinforcement-learning environments to large language model evaluations, arguing that this framing helps make sense of misalignment.
TLDR
A post describes most reinforcement-learning environments as “LLM evals but slop volumed.” Its argument is that viewing them this way makes issues such as misalignment more understandable.
Combined views
36.9K
4 Sources, first seen 14d ago
282 likes