PAPER · ia · aprendizaje automático
LongTraceRL: Aprendizaje de razonamiento de contexto largo desde trayectorias de agentes de búsqueda con recompensas de rúbrica — Autor (2023)
Traducción al español de LongTraceRL (2023). Cómo entrenar modelos de lenguaje para razonar en contextos largos usando trayectorias de agentes de búsqueda y recompensas de rúbrica. Una técnica clave para mejorar LLMs en tareas complejas.