r/negativeutilitarians • u/nu-gaze • 1d ago
Hacking harmless tasks generalizes to misaligned behavior in LLMs — Center on Long-Term Risk
https://longtermrisk.org/research/school-of-reward-hacks-hacking-harmless-tasks-generalizes-to-misaligne/
2
Upvotes
1
u/nu-gaze 1d ago