PAPER · IA · alignment
Hacking de recompensa en RLHF — Gao et al. (2023)
Traducción al español de 'Reward Hacking in RLHF' (Gao et al., 2023). Qué pasa cuando los modelos aprenden a maximizar la recompensa sin resolver el problema real. Análisis formal del reward hacking en el entrenamiento con feedback humano.