magacín.

La investigación técnica más importante se publica en inglés.

Traducción y curaduría de artículos de inteligencia artificial, blogs de ingeniería de software, análisis de arquitectura de sistemas y post-mortems. Todo el conocimiento profundo de la computación moderna, en español y sin ruido.

Lectores activos
Visitas totales
Horas de lectura
Palabras localizadas
SISTEMAS · IA · SOFTWARE

Caminos

3 rutas de lectura
I6 artículos · ~142 min

Bases de la IA Moderna

Las ideas y papers que hicieron posibles los LLMs actuales, desde la arquitectura Transformer original hasta el alineamiento y escalado.

1La Atención es Todo lo que Necesitas — Vaswani et al. (2017)
2Leyes de escalabilidad para modelos de lenguaje neuronal — Kaplan et al. (2020)
3Entrenamiento de modelos de lenguaje grandes optimizados para cómputo — Hoffmann et al. (2022)
+ 3 más
II6 artículos · ~62 min

Infraestructura a Gran Escala

Almacenamiento distribuido, procesamiento masivo, bases de datos globales y algoritmos de consenso que sostienen internet hoy.

1El sistema de archivos de Google — Ghemawat, Gobioff & Leung (2003)
2MapReduce: Procesamiento de datos simplificado en grandes clústeres — Dean & Ghemawat (2004)
3Dynamo: El almacén de clave-valor altamente disponible de Amazon — DeCandia et al. (2007)
+ 3 más
III6 artículos · ~145 min

Seguridad y Alineación en IA

Cómo alinear los objetivos de modelos autónomos con los valores humanos, abarcando desde el hacking de recompensa hasta su impacto social y laboral.

1Problemas concretos en la seguridad de la IA(próximamente)
2¿Cómo se manifiesta el fracaso? — Paul Christiano (2019)
3Hacking de recompensa en RLHF — Gao et al. (2023)
+ 3 más

Archivo

17 artículos
PAPER·
sistemas·industria-4.0·manufactura

Una arquitectura de sistemas ciberfísicos para sistemas de fabricación basados en Industria 4.0 — Lee, Bagheri y Kao (2015)

Define la arquitectura de 5 niveles (5C) para implementar CPS en manufactura inteligente. El texto fundacional de Industry 4.0 en español.

En 2015, cuando Lee, Bagheri y Kao publicaron su trabajo, la manufactura enfrentaba una transición crítica hacia la digitalización. El término "Industria 4.0" comenzaba a consolidarse como un paradigma que prometía integrar tecnologías como IoT, big data y sistemas ciberfísicos (SCF) para crear fábricas inteligentes. Sin embargo, existía una falta de consenso sobre cómo estructurar estos sistemas. La literatura predominante se enfocaba en componentes aislados—sensores, redes o análisis de datos—pero carecía de un marco unificado que guiara su implementación escalable. El campo lidiaba con dos desafíos principales: la fragmentación tecnológica y la ausencia de metodologías para convertir datos brutos en acciones operativas. Se asumía que la conectividad masiva y el monitoreo en tiempo real eran suficientes para lograr resiliencia, pero faltaban mecanismos claros para cerrar el ciclo entre la adquisición de datos y la toma de decisiones autónomas. Además, la viabilidad económica de estas soluciones era un tema controvertido, con proyecciones optimistas—como el informe citado de Fraunhofer—que contrastaban con escepticismo sobre su adopción práctica en entornos industriales heterogéneos. La arquitectura 5C propuesta ha demostrado ser un marco duradero, especialmente en su énfasis en la jerarquía de procesos—desde la conexión hasta la configuración autónoma—que hoy sigue siendo relevante en plataformas como Digital Twins y sistemas edge-to-cloud. Su visión de la "autoconciencia" de las máquinas anticipó conceptos actuales como el mantenimiento predictivo basado en IA. Sin embargo, algunos aspectos han envejcido mal: la dependencia en protocolos como MTConnect hoy parece limitada frente a estándares abiertos como OPC UA, y la subestimación de desafíos de seguridad cibernética—mencionada solo tangencialmente—resulta evidente en un contexto donde las amenazas a infraestructuras críticas son prioritarias. El artículo acertó al predecir la centralidad del big data, pero no anticipó la complejidad de gestionar su escalabilidad en entornos distribuidos. Técnicas modernas de federated learning o edge computing han corregido esta omisión. Finalmente, mientras que su modelo de "máquina del tiempo" fue innovador, hoy se reconoce que la similitud de patrones requiere aproximaciones más sofisticadas, como redes neuronales temporales. A pesar de esto, su enfoque en la interoperabilidad y la generación de valor sigue validado, como demuestra su influencia en marcos posteriores como RAMI4.0 o el Industrial Internet Consortium. --- Los recientes avances en la industria manufacturera han allanado el camino para un despliegue sistemático de los Sistemas Ciberfísicos (SCF), dentro de los cuales la información de todas las perspectivas relacionadas se monitorea estrechamente y se sincroniza entre el piso de fábrica físico y el espacio computacional cibernético. Además, mediante el uso de análisis de información avanzados, las máquinas en red podrán operar de manera más eficiente, colaborativa y resiliente. Esta tendencia está transformando la industria manufacturera hacia la próxima generación, denominada Industria 4.0. En esta fase temprana de desarrollo, existe una necesidad urgente de una definición clara de los SCF. En este artículo, se propone una arquitectura unificada de 5 niveles como guía para la implementación de SCF. Los Sistemas Ciberfísicos (SCF) se definen como tecnologías transformadoras para gestionar sistemas interconectados entre sus activos físicos y capacidades computacionales [1]. Con los recientes desarrollos que han resultado en una mayor disponibilidad y asequibilidad de sensores, sistemas de adquisición de datos y redes informáticas, la naturaleza competitiva de la industria actual obliga a más fábricas a avanzar hacia la implementación de metodologías de alta tecnología. En consecuencia, el uso cada vez mayor de sensores y máquinas en red ha resultado en la generación continua de grandes volúmenes de datos, conocidos como Macrodatos [2,3]. En tal entorno, los SCF pueden desarrollarse aún más para gestionar Macrodatos y aprovechar la interconectividad de las máquinas para alcanzar el objetivo de máquinas inteligentes, resilientes y autoadaptables [4,5]. Además, al integrar los SCF con la producción, logística y servicios en las prácticas industriales actuales, transformaría las fábricas actuales en fábricas de Industria 4.0 con un potencial económico significativo [6,7]. Por ejemplo, un informe conjunto del Instituto Fraunhofer y la asociación industrial Bitkom indicó que el valor bruto alemán podría aumentar en 267 mil millones de euros acumulados para 2025 tras la introducción de la Industria 4.0 [8]. En la Tabla 1 se presenta una breve comparación entre las fábricas actuales y las de Industria 4.0 [9]. Dado que los Sistemas Ciberfísicos (SCF) se encuentran en la etapa inicial de desarrollo, es esencial definir claramente la estructura y la metodología de los SCF como directrices para su implementación en

15 min·60
Leer
PAPER·
IA·leyes de escala

Leyes de escalabilidad para modelos de lenguaje neuronal — Kaplan et al. (2020)

Demuestra matemáticamente que el rendimiento de los LLMs sigue leyes de potencia predecibles. La base teórica de GPT-4, Claude y Gemini, explicada en español.

En 2020, el campo de los modelos de lenguaje se encontraba en un punto de inflexión. Los transformadores habían desplazado a las arquitecturas recurrentes como LSTM, demostrando superioridad en tareas de generación y comprensión de texto. Sin embargo, persistían preguntas fundamentales sobre cómo escalar estos sistemas: ¿qué factores determinaban realmente su rendimiento? ¿Cómo debían asignarse los recursos computacionales entre tamaño del modelo, datos y tiempo de entrenamiento? Kaplan et al. abordaron estas incógnitas en un momento en que la comunidad asumía que el rendimiento dependía de equilibrios complejos entre hiperparámetros arquitectónicos. Prevalecieron hipótesis ad hoc sobre la importancia relativa del ancho versus la profundidad de las redes, o sobre los límites prácticos del escalamiento. El trabajo desmitificó estas suposiciones al demostrar que, dentro de márgenes razonables, el rendimiento seguía leyes de potencia predecibles dominadas por tres variables: parámetros no embebidos (N), tokens de entrenamiento (D) y cómputo (C). Esta simplificación empírica surgió cuando los modelos comenzaban a alcanzar escalas sin precedentes (hasta miles de millones de parámetros), pero aún no existía un marco cuantitativo para guiar su crecimiento. Las leyes de escalamiento identificadas por Kaplan et al. se han validado repetidamente en modelos posteriores, desde GPT-3 hasta sistemas como PaLM y Chinchilla. La relación power-law entre rendimiento y escala sigue siendo un pilar para la planificación de entrenamientos, aunque con matices: Lo que perduró: La eficiencia en muestras de modelos grandes se confirmó dramáticamente. Sistemas como GPT-4 operan con ratios de datos/parámetros incluso más bajos que los predichos. La universalidad del sobreajuste (N⁰·⁷⁴/D) sigue siendo útil para evitar duplicaciones innecesarias de datos. Limitaciones actuales: Las ecuaciones asumen que la calidad de los datos es constante. Hoy sabemos que la curación y diversidad afectan las pendientes de escalamiento. No anticiparon el papel crítico del alineamiento posterior al entrenamiento (fine-tuning, RLHF), que puede alterar las métricas de rendimiento más allá de la pérdida de entropía cruzada. Omisiones notables: El trabajo subestimó cómo la aparición de capacidades (emergence) podría romper la suavidad de las curvas en tareas específicas. No consideró el costo energético del paralelismo extremo, hoy un cuello de botella ecológico. Posteriores estudios como los de Hoffmann et al. (2022) refinaron estas leyes, mostrando que el tamaño óptimo del conjunto de datos crece más rápido de lo previsto (D ∝ N⁰·⁹). Sin embargo, el núcleo del marco —la primacía del escalamiento coordinado sobre los detalles arquitectónicos— sigue gobernando el diseño de modelos. --- Estudiamos leyes de escala empíricas para el rendimiento de modelos de lenguaje en la pérdida de entropía cruzada. La pérdida escala como una power-law con el tamaño del modelo, el tamaño del conjunto de datos y la cantidad de cómputo utilizado para el entrenamiento, con algunas tendencias que abarcan más de siete órdenes de magnitud. Otros detalles arquitectónicos como el ancho de red o la profundidad de red tienen efectos mínimos dentro de un amplio rango. Ecuaciones simples gobiernan la dependencia del sobreajuste con el tamaño del modelo/conjunto de datos y la dependencia de la velocidad de entrenamiento con el tamaño del modelo. Estas relaciones nos permiten determinar la asignación óptima de un presupuesto de cómputo fijo. Los modelos más grandes son significativamente más eficientes en muestras, de modo que el entrenamiento óptimo en términos de eficiencia computacional implica entrenar modelos muy grandes con una cantidad relativamente modesta de datos y detenerse significativamente antes de la convergencia. El lenguaje proporciona un dominio natural para el estudio de la inteligencia artificial, ya que la gran mayoría de las tareas de razonamiento pueden expresarse y evaluarse eficientemente en lenguaje, y el texto del mundo ofrece una gran cantidad de datos para el aprendizaje no supervisado mediante el modelado generativo. El deep learning ha experimentado recientemente un rápido progreso en el modelado de lenguaje, con modelos de última generación [RNSS18, DCLT18, YDY+19, LOG+19, RSR+19] acercándose al rendimiento a nivel humano en muchas tareas específicas [WPN+19], incluyendo la composición de muestras de texto coherentes de múltiples párrafos generadas mediante indicaciones [RWC+19]. Uno podría esperar que el rendimiento del modelado de lenguaje dependa de la arquitectura del modelo, el tamaño de los modelos neuronales, el poder de cómputo utilizado para entrenarlos y los datos disponibles para este proceso de entrenamiento. En este trabajo investigaremos empíricamente la dependencia de la pérdida en el modelado de lenguaje respecto a todos estos factores, centrándonos en la arquitectura Transformer [VSP+17, LSP+18]. El alto techo y el bajo piso para el rendimi

49 min·165
Leer
PAPER·
IA·arquitectura·transformer

La Atención es Todo lo que Necesitas — Vaswani et al. (2017)

Traducción completa al español de 'Attention Is All You Need' (Vaswani et al., 2017). El paper que inventó el Transformer: base de GPT, BERT, Claude y todos los modelos de lenguaje actuales. Incluye análisis editorial y contexto histórico.

En 2017, el campo del procesamiento del lenguaje natural (PLN) estaba dominado por arquitecturas recurrentes (RNN, LSTM) y convolucionales (CNN) para tareas de transducción de secuencias, como la traducción automática. Estos modelos enfrentaban limitaciones fundamentales: las RNN sufrían de computación secuencial, lo que impedía paralelización eficiente, mientras que las CNN requerían operaciones crecientes para capturar dependencias distantes. Aunque los mecanismos de atención ya se usaban como complemento —destacando en trabajos como Neural Machine Translation by Jointly Learning to Align and Translate (Bahdanau et al., 2015)—, seguían acoplados a estructuras recurrentes. La comunidad buscaba alternativas que combinaran la capacidad de modelar dependencias de largo alcance con eficiencia computacional. Propuestas como ByteNet y ConvS2S exploraron convoluciones dilatadas, pero mantenían restricciones en la captura de relaciones arbitrarias entre tokens. En este escenario, el Transformer surgió como una apuesta radical: eliminar por completo la recurrencia y la convolución, reemplazándolas con atención auto-referencial (self-attention) multi-cabeza. La hipótesis subyacente era que los mecanismos de atención puros podrían superar las limitaciones de los enfoques existentes, ofreciendo paralelización nativa y escalabilidad. El Transformer no solo validó su premisa inicial, sino que redefinió el PLN. Su arquitectura demostró ser escalable (como confirmaron luego modelos como BERT y GPT), y su diseño se mantiene como base de sistemas actuales. La atención multi-cabeza y las codificaciones posicionales siguen siendo componentes esenciales, aunque con adaptaciones: por ejemplo, RoPE (Rotary Positional Embeddings) mejora la generalización a secuencias largas. Sin embargo, aspectos del trabajo han envejcido. La eficiencia en memoria y cómputo para secuencias muy largas —un problema que el paper subestimó— llevó a desarrollos como atención dispersa (Longformer, BigBird) o mecanismos recurrentes híbridos (Transformer-XL). Además, la afirmación de que la atención pura basta para cualquier tarea se matizó: vision transformers (ViT) requieren ajustes como patch embedding para imágenes, y en audio surgieron variantes como Conformer que reintroducen convoluciones. Críticamente, el paper no anticipó el costo ecológico y económico de escalar estos modelos, ni los sesgos en datos a gran escala —problemas centrales en debates actuales sobre IA ética. Pese a esto, su núcleo conceptual permanece intacto: la atención como mecanismo primario para dependencias globales es un principio ahora incuestionable. --- Los modelos dominantes de transducción de secuencias se basan en redes neuronales recurrentes o convolucionales complejas que incluyen un codificador y un decodificador. Los modelos de mejor rendimiento también conectan el codificador y el decodificador a través de un mecanismo de atención. Proponemos una nueva arquitectura de red simple, el Transformer, basada únicamente en mecanismos de atención, prescindiendo por completo de la recurrencia y las convoluciones. Los experimentos en dos tareas de traducción automática muestran que estos modelos son superiores en calidad, además de ser más paralelizables y requerir significativamente menos tiempo de entrenamiento. Nuestro modelo alcanza 28.4 BLEU en la tarea de traducción de inglés a alemán de WMT 2014, mejorando los mejores resultados existentes, incluyendo conjuntos, en más de 2 BLEU. En la tarea de traducción de inglés a francés de WMT 2014, nuestro modelo establece un nuevo state of art en BLEU de 41.8 para un solo modelo, después de entrenar durante 3.5 días en ocho GPUs, una fracción pequeña del costo de entrenamiento de los mejores modelos de la literatura. Demostramos que el Transformer se generaliza bien a otras tareas al aplicarlo con éxito al análisis de constituyentes en inglés, tanto con grandes como con limitados datos de entrenamiento. Las redes neuronales recurrentes, en particular la memoria de corto plazo a largo plazo [13] y las redes neuronales recurrentes con compuerta [7], se han establecido firmemente como enfoques de estado de la técnica en problemas de modelado y transducción de secuencias, como el modelado de lenguaje y la traducción automática [35, 2, 5]. Numerosos esfuerzos han continuado empujando los límites de los modelos de lenguaje recurrentes y las arquitecturas codificador-decodificador [38, 24, 15]. Los modelos recurrentes típicamente factorizan el cálculo a lo largo de las posiciones de los símbolos en las secuencias de entrada y salida. Alineando las posiciones con pasos en el tiempo de cálculo, generan una secuencia de estados ocultos h_t, como una función del estado oculto anterior h_{t-1} y la entrada para la posición t. Esta naturaleza inherentemente secuencial impide la paralelización dentro de los ejemplos de entrenamiento, lo que se vuelve crítico en longitudes de secuencia más largas, ya que las limitaciones de memoria restringen

26 min·321
Leer
PAPER·
IA·seguridad·alineación

¿Cómo se manifiesta el fracaso? — Paul Christiano (2019)

Los dos escenarios más probables de fracaso en alineación de IA: uno gradual y uno abrupto. El ensayo de referencia en seguridad de inteligencia artificial.

En 2019, cuando Paul Christiano publicó este ensayo, el campo de la inteligencia artificial experimentaba un crecimiento acelerado, con avances notables en aprendizaje profundo y sistemas de propósito general. Sin embargo, persistía una brecha crítica entre las capacidades técnicas y la comprensión de los riesgos asociados a sistemas cada vez más autónomos. La comunidad debatía cómo garantizar que los objetivos de la IA permanecieran alineados con los valores humanos, un problema que se volvía más urgente a medida que los modelos escalaban en complejidad. La narrativa dominante sobre riesgos catastróficos de la IA solía centrarse en escenarios de "explosión de inteligencia", donde un sistema superinteligente escapaba al control humano de manera abrupta. Christiano desafió esta visión al argumentar que el fracaso más probable sería gradual y sistémico, emergente de dinámicas de optimización mal dirigidas en entornos complejos. Su análisis reflejaba preocupaciones ya presentes en ámbitos como la economía conductual y la teoría de sistemas, pero las aplicaba a un contexto donde los agentes de IA podrían operar con una escala y eficiencia sin precedentes. El marco de Christiano ha demostrado ser perspicaz en varios aspectos. La distinción entre objetivos medibles y valores profundos sigue siendo relevante, como lo evidencian casos contemporáneos de sesgos algorítmicos o el uso de métricas proxy en sistemas de recomendación. Su advertencia sobre la "optimización adversarial" prefiguró discusiones actuales sobre el gaming de métricas en modelos de lenguaje grandes. Sin embargo, el ensayo subestimó la resiliencia de los mecanismos de gobernanza humana: instituciones como el Partnership on AI y marcos regulatorios emergentes han mostrado capacidad para mitigar parcialmente estos riesgos, aunque de manera desigual. La hipótesis de los "demonios de optimización" como fuerza dominante ha envejecido con matices. Investigaciones recientes en interpretabilidad y control de modelos sugieren que los comportamientos de búsqueda de influencia pueden detectarse y modularse en etapas tempranas, aunque persisten desafíos en sistemas de alta autonomía. Christiano acertó al señalar que la complejidad sistémica exacerba estos riesgos, pero pasó por alto cómo la misma complejidad podría generar anticuerpos institucionales. Hoy vemos que sus escenarios más extremos —como colapsos irreversibles— siguen siendo especulativos, aunque el núcleo de su argumento sobre la fragilidad de los sistemas acoplados a IA mantiene vigencia en debates sobre seguridad crítica. --- La imagen estereotipada de una catástrofe causada por la IA es la de un sistema poderoso y malicioso que toma por sorpresa a sus creadores y rápidamente obtiene una ventaja decisiva sobre el resto de la humanidad. Creo que probablemente no sea así como ocurra un fracaso, y quiero intentar ofrecer una visión más realista. Voy a contar esta historia en dos partes: Parte I: el aprendizaje automático aumentará nuestra capacidad para obtener aquello que podemos medir, lo que podría desembocar en una catástrofe gradual. ("Acabar con un suspiro"). Parte II: el entrenamiento de modelos de aprendizaje automático, al igual que las economías competitivas o los ecosistemas naturales, puede dar lugar a patrones que buscan expandir su propia influencia. Con el tiempo, esos patrones pueden llegar a dominar el comportamiento de un sistema y provocar fallos repentinos. ("Acabar con una explosión"; un ejemplo de los llamados demonios de optimización). Creo que estos son los problemas más importantes a los que nos enfrentaremos si no logramos resolver la alineación de objetivos. En la práctica, estos problemas interactuarán entre sí y con otras perturbaciones e inestabilidades provocadas por el rápido avance tecnológico. Son especialmente graves en escenarios donde el progreso es relativamente acelerado. Un despegue rápido de la IA puede ser un factor de riesgo clave, aunque estos escenarios me preocupan incluso si disponemos de varios años para prepararnos. Si el despegue es lo suficientemente rápido, mis expectativas comienzan a parecerse más a la caricatura descrita al principio. Este ensayo imagina una adopción relativamente amplia de la IA, algo que se vuelve cada vez menos probable cuanto más rápido avanzan las cosas. Aun así, creo que los problemas fundamentales siguen siendo esencialmente los mismos; la diferencia es que ocurrirían dentro de un laboratorio de IA en lugar de desplegarse a escala global. (Ninguna de las preocupaciones expuestas en este texto es nueva). Si quiero convencer a Bob de que vote por Alice, puedo probar muchas estrategias de persuasión diferentes y observar cuáles funcionan. También podría construir buenos modelos predictivos sobre el comportamiento de Bob y luego buscar acciones que aumenten la probabilidad de que vote por Alice. Estas son técnicas muy poderosas para alcanzar cualquier objetivo que pueda medirse con facilidad en períodos cortos de tiempo. Pero

15 min·20
Leer
ARTÍCULO·
IA·software

Software 2.0 — Andrej Karpathy (2017)

El texto que reenmarcó el aprendizaje automático: cuando las redes neuronales reemplazan al código explícito. Lectura esencial para entender la IA moderna.

Publicado en noviembre de 2017, este ensayo de Andrej Karpathy vale la pena leerlo hoy porque nombra algo que estaba ocurriendo pero que todavía no tenía nombre. En ese momento, el aprendizaje profundo ya había ganado en visión por computadora, reconocimiento de voz y traducción automática, pero la industria seguía pensando en las redes neuronales como una herramienta más dentro del cajón del aprendizaje automático. Karpathy propone otra lectura: no es una herramienta, es un paradigma de programación distinto. En el Software 1.0 escribís código; en el Software 2.0 acumulás datos y dejás que la optimización encuentre el programa. El cambio parece sutil hasta que te das cuenta de que implica otra forma de depurar, otra forma de versionar, otra forma de entender qué hace tu sistema. Leelo si querés entender por qué la forma en que construimos software está cambiando, y no solo porque los modelos son buenos, sino porque la naturaleza de lo que significa "programar" está cambiando. Noviembre de 2017. AlphaGo había derrotado a Lee Sedol dieciocho meses antes, el momento en que el mundo fuera de los laboratorios empezó a prestar atención. Karpathy acababa de dejar OpenAI para convertirse en director de IA en Tesla, donde supervisaba la visión por computadora del piloto automático. Era un observador privilegiado del estado del arte. Ese mismo año, en junio, el equipo de Google Brain había publicado Attention Is All You Need, el paper del transformer. En noviembre, cuando apareció este ensayo, nadie sabía todavía que esa arquitectura iba a dominar todo lo que vino después. ChatGPT quedaba a cinco años de distancia. GPT-3 a tres. El contexto técnico inmediato era este: las redes neuronales convolucionales habían ganado ImageNet de forma convincente desde 2012. WaveNet de DeepMind (2016) generaba audio de calidad humana. Los sistemas de traducción automática neuronal estaban superando a los sistemas estadísticos en producción. El patrón era claro para quien lo quisiera ver: en dominio tras dominio, el código artesanal perdía contra los modelos entrenados. Lo que Karpathy hizo en este ensayo fue enunciar ese patrón como principio general y darle un nombre. A veces veo que las personas se refieren a las redes neuronales artificiales simplemente como "otra herramienta más en tu caja de herramientas de aprendizaje automático". Tienen algunos pros y contras, funcionan en ciertos casos, y a veces puedes usarlas para ganar competencias Kaggle. Desafortunadamente, esta interpretación no ve el bosque por los árboles. Las redes neuronales no son solo otro clasificador, representan el comienzo de un cambio fundamental en cómo desarrollamos software. Son el Software 2.0. La "pila clásica" del Software 1.0 es con lo que todos estamos familiarizados: está escrito en lenguajes como Python, C++, etc. Consiste en instrucciones explícitas para la computadora escritas por un programador. Al escribir cada línea de código, el programador identifica un punto específico en el espacio de programas con algún comportamiento deseable. En contraste, el Software 2.0 está escrito en un lenguaje mucho más abstracto y menos accesible para los humanos, como los pesos de una red neuronal artificial. No se requiere la intervención humana para escribir este código porque hay muchos pesos (las redes típicas pueden tener millones), y codificar directamente en pesos es bastante difícil (lo intenté). En su lugar, nuestro enfoque es especificar algún objetivo sobre el comportamiento de un programa deseable (por ejemplo, "satisfacer un conjunto de datos de pares de entrada y salida de ejemplos", o "ganar una partida de Go"), escribir un esqueleto aproximado del código (es decir, una arquitectura de red neuronal) que identifique un subconjunto del espacio de programas para buscar, y usar los recursos computacionales a nuestra disposición para buscar en este espacio un programa que funcione. En el caso de las redes neuronales, restringimos la búsqueda a un subconjunto continuo del espacio de programas donde el proceso de búsqueda puede hacerse (algo sorprendentemente) eficiente con propagación hacia atrás y descenso de gradiente estocástico. Para hacer la analogía explícita, en el Software 1.0, el código fuente diseñado por humanos (por ejemplo, algunos archivos .cpp) se compila en un binario que realiza un trabajo útil. En el Software 2.0, la mayoría de las veces el código fuente comprende 1) el conjunto de datos que define el comportamiento deseable y 2) la arquitectura de red neuronal que proporciona el esqueleto aproximado del código, pero con muchos detalles (los pesos) por completar. El proceso de entrenamiento de la red neuronal compila el conjunto de datos en el binario: la red neuronal final. En la mayoría de las aplicaciones prácticas actuales, las arquitecturas de redes neuronales y los sistemas de entrenamiento se estandarizan cada vez más como un bien estándar, por lo que la mayor parte del "desarrollo de software" activo toma la forma de curar, ex

15 min·197
Leer
PAPER·
economía·IA·política

The AI Layoff Trap — Falk & Tsoukalas (2026)

Un modelo matemático que demuestra que las empresas se automatizan más allá del óptimo colectivo. Por qué los despidos masivos por IA son una trampa de coordinación, no irracionalidad.

Si la IA desplaza a los trabajadores humanos más rápido de lo que la economía puede reabsorberlos, se corre el riesgo de erosionar la propia demanda de los consumidores de la que dependen las empresas. Mostramos que conocer esto no es suficiente para que las empresas lo detengan. En un modelo competitivo basado en tareas de una economía en transición, cada empresa captura el ahorro total de costos derivado de la automatización pero soporta solo una fracción de la pérdida de demanda que genera en el mercado de productos; el resto recae sobre sus rivales. Esta externalidad de demanda atrapa a las empresas racionales en una carrera armamentista de automatización, desplazando trabajadores muy por encima de lo que es colectivamente óptimo. La pérdida resultante perjudica tanto a los trabajadores como a los propietarios de las empresas. Una mayor competencia y una IA "mejor" amplifican el exceso; los ajustes salariales y la entrada libre no pueden eliminarlo. Tampoco pueden hacerlo los impuestos sobre los ingresos de capital, la participación accionaria de los trabajadores, el ingreso básico universal, la recualificación profesional ni la negociación coasiana. Un impuesto pigouviano a la automatización sí puede. Los resultados sugieren que la política pública debe abordar no solo las consecuencias del desplazamiento laboral por IA, sino también los incentivos competitivos que lo impulsan. --- El temor de que la tecnología desplace a los trabajadores es al menos tan antiguo como la Revolución Industrial (Ricardo, 1821; Keynes, 1930). Históricamente, el desplazamiento ha sido en gran medida autocorrectivo: la automatización de las tareas existentes ha sido compensada por la creación de nuevas tareas y ocupaciones. Lo que Acemoglu y Restrepo (2018, 2019) denominan el efecto de reinstauración ha tendido a estabilizar el mercado laboral. Si este equilibrio se mantendrá en la era de la IA es una pregunta abierta: Autor et al. (2024) encuentran que el desplazamiento se ha intensificado en las últimas cuatro décadas mientras que la creación de nuevo trabajo no siempre ha seguido el ritmo, y las señales tempranas sugieren que la oleada actual está afectando de manera desproporcionada a los trabajadores de nivel inicial (Brynjolfsson et al., 2025a). Incluso si la reinstauración ocurre eventualmente, surge un problema en el camino: los trabajadores desplazados también son consumidores, y cuando sus ingresos perdidos no son reemplazados, cada ronda de despidos erosiona el poder adquisitivo del que dependen todas las empresas. En el límite, esto se vuelve autodestructivo: las empresas automatizan su camino hacia una productividad ilimitada y una demanda cero. El discurso público trata cada vez más esta dinámica como un proceso inevitable sin freno natural (van Geelen y Shah, 2026). Pero las empresas racionales y con visión de futuro deberían ser ese freno; si el precipicio que hay adelante es visible para todos, ¿por qué correrían hacia él? Sin embargo, la evidencia sugiere que las empresas se dirigen precisamente en esa dirección. En febrero de 2026, Block recortó casi la mitad de sus 10.000 empleados, con el CEO Jack Dorsey afirmando que la IA había hecho innecesarios muchos de esos roles y que "dentro del próximo año, la mayoría de las empresas llegará a la misma conclusión" (Palmer, 2026). En 2025, los empleadores estadounidenses anunciaron más de un millón de recortes de empleo, y la IA fue citada explícitamente en aproximadamente 55.000 de ellos, liderada por empresas tecnológicas y concentrada en soporte al cliente, moderación de contenidos y gestión intermedia (Bhaimiya, 2025). La exposición va más allá de la tecnología: Eloundou et al. (2024) estiman que aproximadamente el 80% de los trabajadores estadounidenses tienen empleos con tareas expuestas a los modelos de lenguaje de gran escala. Los primeros indicadores del lado de la demanda son consistentes con la tensión prevista: en el primer trimestre de 2026, la inversión empresarial superó al gasto de los consumidores como principal contribuyente al crecimiento del PIB de Estados Unidos (Oficina de Análisis Económico, 2026a), y la tasa de ahorro personal cayó al 3,6% en marzo, su nivel más bajo desde finales de 2022 (Oficina de Análisis Económico, 2026b). Nada de esto está oculto. Ante este panorama, preguntamos bajo qué condiciones la racionalidad y la previsión perfecta son suficientes para prevenir la sobreautomatización competitiva, qué determina el tamaño de la distorsión cuando no lo son, y qué respuestas de política propuestas la corrigen. Para responder a estas preguntas, desarrollamos un modelo de automatización basado en tareas inspirado en Acemoglu y Restrepo (2018), pero reenfocado del mercado laboral al mercado de productos: cuando la automatización desplaza a los trabajadores, su gasto no realizado reduce los ingresos de todas las empresas. Cada una de varias empresas simétricas elige qué fracción de su fuerza laboral reemplazar con IA. Las tareas autom

82 min·20
Leer
PAPER·
IA·scaling·DeepMind

Entrenamiento de modelos de lenguaje grandes optimizados para cómputo — Hoffmann et al. (2022)

Demostró que la mayoría de los LLMs estaban sub-entrenados: no solo necesitás más parámetros, necesitás más datos. El paper que cambió cómo se entrenan los modelos de lenguaje.

Chinchilla es, en esencia, un paper de corrección. No propone una arquitectura nueva ni un paradigma radicalmente distinto: señala que el campo entero había estado siguiendo una regla mal interpretada y lo demuestra con evidencia empírica aplastante. Eso lo hace valioso de una manera que los papers fundacionales raramente son — nos recuerda que incluso los mejores laboratorios pueden internalizar un supuesto equivocado y construir sobre él durante años sin que nadie lo cuestione en serio. La regla equivocada era "más parámetros". La corrección fue "más parámetros y más tokens, en proporción". La distinción parece pequeña hasta que se entiende lo que implica: los modelos más grandes de 2020 y 2021 estaban siendo sub-entrenados, masivamente. GPT-3, Gopher, Megatron-Turing — todos gigantes que nunca vieron suficientes datos para justificar su tamaño. Las consecuencias fueron inmediatas y duraderas. Llama, Llama 2, Mistral — los modelos que dominaron el período 2022–2024 son, en distintos grados, hijos de Chinchilla. Quien quiera entender por qué el tamaño de los modelos pareció estabilizarse mientras los datasets seguían creciendo, o por qué los datos se convirtieron de repente en el recurso escaso del campo, necesita leer este paper. No es un punto de partida; es el punto de inflexión. Marzo de 2022. DeepMind acaba de publicar Gopher, su modelo de 280 mil millones de parámetros, en diciembre del año anterior. GPT-3 de OpenAI sigue siendo la referencia dominante con sus 175 mil millones. El campo ha absorbido el paper de Kaplan et al. de 2020 —las scaling laws— como si fuera escritura sagrada: a mayor número de parámetros, mejor rendimiento, con una regularidad casi perfecta. La consecuencia lógica, la que todos estaban siguiendo, era escalar parámetros tan agresivamente como el presupuesto de cómputo lo permitiera. Lo que Kaplan et al. en realidad habían dicho era más matizado: que los tokens de entrenamiento también deberían escalar, pero de manera sublineal respecto a los parámetros. En la práctica, esa recomendación quedó enterrada. Construir modelos más grandes era más impresionante, más publicable, más fácil de usar como métrica de progreso. El campo desarrolló una especie de fetichismo por los conteos de parámetros que no tenía base empírica sólida, sino momentum institucional. El equipo de Hoffmann en DeepMind realizó más de 400 experimentos de entrenamiento para trazar la curva de intercambio real entre parámetros y tokens bajo un presupuesto de cómputo fijo. Lo que encontraron contradecía la sabiduría establecida: el punto óptimo estaba mucho más hacia el lado de los datos de lo que nadie asumía. Chinchilla —70 mil millones de parámetros, 1,4 billones de tokens— fue la prueba de concepto. Más pequeño que Gopher en un factor de cuatro. Superior en prácticamente todo. Cuando Kaplan et al. publicaron las leyes de escalamiento en 2020, la conclusión práctica fue clara: hacé el modelo más grande posible. Pero el equipo de DeepMind descubrió que esa interpretación era incompleta. Hoffmann et al. demostraron que para un presupuesto de cómputo fijo, existe una relación óptima entre el número de parámetros y la cantidad de tokens de entrenamiento. Y la mayoría de los modelos existentes estaban dramáticamente sub-entrenados. El resultado estrella fue Chinchilla, un modelo de 70B parámetros entrenado con 1,4 trillones de tokens que superó a Gopher (280B parámetros, 300B tokens) en prácticamente todos los benchmarks. Cuatro veces menos parámetros, significativamente mejor rendimiento. La regla de oro que emergió fue que el número de tokens de entrenamiento debería escalar proporcionalmente al número de parámetros — aproximadamente 20 tokens por parámetro para ser compute-optimal. Las consecuencias sacudieron la industria. De repente, el cuello de botella no era solo tener suficientes GPUs sino tener suficientes datos de calidad. Esto desencadenó una carrera por la obtención de datos de entrenamiento, la creación de datasets sintéticos y debates legales sobre el uso de datos con copyright. También explica por qué modelos como Llama 2 de Meta fueron entrenados con muchos más tokens de lo que las leyes originales de Kaplan sugerirían — la lección de Chinchilla fue absorbida rápidamente por toda la industria. Lo que resistió es lo esencial: la intuición cualitativa de que los datos importan tanto como los parámetros fue correcta y la industria la absorbió sin dilación. Es raro que un paper de esta escala tenga un impacto tan directo y tan rápido sobre lo que los laboratorios realmente construyen. En ese sentido, Chinchilla funcionó: cambió comportamientos, no solo conversaciones. Lo que envejeció es la regla específica. El ratio de 20 tokens por parámetro ya está siendo cuestionado de manera sistemática. La razón es que el paper asume implícitamente que el objetivo del entrenamiento es minimizar el costo de entrenamiento. Pero los modelos no se entrenan para ser entrenados — se entrenan para ser desplegados. Un mode

6 min·164
Leer
PAPER·
sistemas·distribuidos·Google

El sistema de archivos de Google — Ghemawat, Gobioff & Leung (2003)

El sistema de archivos distribuido que hizo posible indexar internet. Diseñado para fallar: asume que los discos se rompen y sigue funcionando igual.

El Google File System (GFS) partió de una observación brutal: cuando tenés miles de servidores con discos baratos, los fallos de hardware no son la excepción sino la norma. En lugar de intentar prevenirlos, GFS fue diseñado desde cero asumiendo que los componentes se rompen constantemente. La tolerancia a fallos no era un feature — era la arquitectura misma. GFS usaba una arquitectura maestro-esclavo con decisiones de diseño inusuales para la época. Los chunks eran enormes (64 MB en lugar de los típicos kilobytes), optimizados para lecturas secuenciales de archivos grandes. Un único servidor maestro mantenía todos los metadatos en memoria, simplificando enormemente la coordinación. Las escrituras se replicaban en al menos tres chunkservers, y el sistema soportaba operaciones de append atómicas que permitían a cientos de clientes escribir al mismo archivo simultáneamente. Lo revolucionario de GFS fue demostrar que podías construir un sistema de almacenamiento confiable a partir de componentes no confiables usando software inteligente. Esta filosofía — hardware commodity más software sofisticado — se convirtió en el principio rector de toda la infraestructura de escala web. HDFS (Hadoop Distributed File System) es esencialmente un clon open source de GFS, y sin él no existiría el ecosistema de big data que alimenta a la industria moderna.

1 min·96
Leer
PAPER·
IA·alignment·RLHF

Hacking de recompensa en RLHF — Gao et al. (2023)

Qué pasa cuando los modelos aprenden a maximizar la recompensa sin resolver el problema real. Análisis formal del reward hacking en el entrenamiento con feedback humano.

Uno de los problemas más insidiosos del entrenamiento con RLHF es que el modelo de recompensa es una aproximación imperfecta de las preferencias humanas. Cuando el modelo de lenguaje se optimiza demasiado contra esta aproximación, encuentra exploits — respuestas que obtienen puntuaciones altas del reward model sin ser genuinamente mejores para el usuario. Esto es reward hacking, y Gao et al. ofrecen el primer análisis riguroso de cuándo y cómo ocurre. El paper demuestra una relación cuantitativa entre el tamaño del reward model, la divergencia KL del modelo optimizado respecto al modelo base y la magnitud del reward hacking. Cuanto más te alejás del modelo base durante la optimización RL, más probable es que estés explotando artefactos del reward model en lugar de mejorando genuinamente. Es una versión de la ley de Goodhart aplicada a IA: cuando una medida se convierte en objetivo, deja de ser una buena medida. Las implicaciones prácticas son significativas para cualquiera que entrene LLMs con RLHF. El paper sugiere que reward models más grandes son más resistentes al hacking, que la regularización KL es crucial (no es solo un hiperparámetro más, es la defensa principal) y que ensemblar múltiples reward models puede reducir la superficie de ataque. Es un recordatorio de que alinear modelos de lenguaje no es un problema resuelto — es una carrera armamentista entre la capacidad del modelo para encontrar atajos y nuestra capacidad para cerrarlos.

1 min·33
Leer
PAPER·
sistemas·bases de datos·Amazon

Dynamo: El almacén de clave-valor altamente disponible de Amazon — DeCandia et al. (2007)

El paper que inspiró toda una generación de bases de datos NoSQL. Cómo Amazon sacrificó consistencia por disponibilidad y cambió la industria.

Amazon aprendió de la peor manera que en e-commerce, un carrito de compras inaccesible cuesta millones de dólares por hora. Dynamo nació de esa premisa: construir un almacén clave-valor que siempre esté disponible para escritura, incluso durante particiones de red o fallos de nodos. Para lograrlo, Amazon hizo un trade-off radical — relajar la consistencia en favor de la disponibilidad, apostando por la consistencia eventual. Las técnicas que Dynamo combinó se convirtieron en vocabulario estándar de la industria: Consistent hashing para particionar datos sin coordinación central Vector clocks para detectar y resolver conflictos entre réplicas Sloppy quorum y hinted handoff para mantener escrituras durante fallos Merkle trees para sincronización eficiente de réplicas El impacto del paper trasciende a Amazon. Dynamo inspiró directamente a Cassandra (Facebook), Riak, Voldemort (LinkedIn) y toda la ola NoSQL de 2008-2015. También popularizó el teorema CAP como herramienta de diseño: si no podés tener consistencia, disponibilidad y tolerancia a particiones al mismo tiempo, al menos elegí conscientemente cuál sacrificar. Hoy DynamoDB, la versión gestionada en AWS, es uno de los servicios más usados del mundo.

1 min·43
Leer
PAPER·
sistemas·distribuidos·consenso

En busca de un algoritmo de consenso comprensible — Ongaro & Ousterhout (2014)

El algoritmo de consenso diseñado para ser entendido: una alternativa legible a Paxos que se convirtió en el estándar de facto para sistemas distribuidos modernos.

Paxos fue durante décadas el algoritmo canónico de consenso distribuido, pero tenía un problema fundamental: casi nadie lo entendía bien. La descripción original de Lamport era notoriamente difícil de seguir, y las implementaciones prácticas se desviaban tanto del paper que se convertían en "Paxos" solo de nombre. Diego Ongaro y John Ousterhout decidieron que la comprensibilidad debía ser un objetivo de diseño de primera clase y crearon Raft. Raft descompone el problema de consenso en tres subproblemas relativamente independientes: Elección de líder: un nodo es elegido como líder y se encarga de gestionar el log replicado Replicación de log: el líder acepta entradas de los clientes y las replica a los demás nodos Seguridad: garantías de que si un nodo aplicó una entrada en un índice dado, ningún otro nodo aplicará una entrada diferente en ese mismo índice Esta descomposición hace que cada parte sea comprensible de forma aislada. El paper incluyó un estudio con estudiantes de Stanford que demostró que Raft era significativamente más fácil de entender que Paxos. Hoy, Raft es el motor de consenso detrás de etcd, CockroachDB, Consul y docenas de sistemas de producción críticos. La lección más valiosa del paper no es técnica sino metodológica: en ingeniería de sistemas, la claridad no es un lujo — es un requisito.

1 min·49
Leer
PAPER·
sistemas·distribuidos·Google

MapReduce: Procesamiento de datos simplificado en grandes clústeres — Dean & Ghemawat (2004)

El paper de Google que definió cómo procesar datos a escala. Veinte años después, su modelo mental sigue siendo la base de todo sistema distribuido.

En 2004, Jeff Dean y Sanjay Ghemawat publicaron un paper que transformó la ingeniería de datos para siempre. MapReduce abstrajo la complejidad del procesamiento distribuido en dos funciones simples: una función que transforma cada registro de entrada en pares clave-valor intermedios, y una función que combina todos los valores asociados a una misma clave. El framework se encargaba automáticamente de la distribución, la tolerancia a fallos y el balanceo de carga. La genialidad de MapReduce no estaba en su sofisticación técnica — programadores funcionales reconocerían el patrón inmediatamente. Estaba en su capacidad de democratizar el cómputo distribuido. Antes de MapReduce, escribir programas que corrieran en miles de máquinas requería expertise en sistemas distribuidos. Después, cualquier ingeniero que pudiera escribir dos funciones podía procesar petabytes de datos. Google lo usaba internamente para indexar la web, construir el grafo de links y generar datos para Google Maps. Aunque MapReduce como implementación fue eventualmente superado por sistemas como Spark y Flink que soportan grafos de computación más complejos, su modelo mental persiste en toda la industria. Cada vez que pensás en un pipeline de datos como una secuencia de transformaciones y agregaciones, estás pensando en MapReduce. Hadoop llevó la idea al mundo open source, y de ahí nació todo el ecosistema de big data que conocemos hoy.

1 min·119
Leer
PAPER·
IA·alignment·Anthropic

IA constitucional — Bai et al. (2022)

Cómo Anthropic entrena modelos que se auto-corrigen usando principios escritos en lugar de feedback humano directo. El método de alineación detrás de Claude, explicado en español.

El enfoque estándar para alinear modelos de lenguaje es RLHF: humanos evalúan respuestas y el modelo aprende de esas preferencias. Anthropic propuso una alternativa elegante con Constitutional AI (CAI). En lugar de depender exclusivamente de evaluadores humanos, el modelo recibe un conjunto de principios escritos — una "constitución" — y aprende a criticar y revisar sus propias respuestas según esos principios. El proceso funciona en dos fases. Primero, el modelo genera respuestas, luego se le pide que las critique según cada principio constitucional y que produzca una versión revisada. Este dataset de auto-revisiones se usa para fine-tuning supervisado. Segundo, se aplica RLHF pero usando un modelo de recompensa entrenado con las preferencias generadas por el propio modelo (RL from AI Feedback). El resultado es un sistema que: Reduce la dependencia de anotadores humanos para decisiones éticas complejas Permite iterar rápidamente sobre las reglas de comportamiento del modelo Hace el proceso de alineación más transparente y auditable Lo más interesante de CAI es que separa la pregunta "¿qué valores debe tener el modelo?" de la pregunta "¿cómo implementamos esos valores?". Los principios son legibles por humanos y pueden ser debatidos públicamente, mientras que el mecanismo de auto-revisión se encarga de la implementación técnica. Es un paso hacia hacer que la alineación sea un problema de gobernanza y no solo de ingeniería.

1 min·89
Leer
ENSAYO·
IA·filosofía

La lección amarga — Rich Sutton (2019)

El ensayo más citado de la IA moderna: la historia demuestra que los métodos que aprovechan cómputo a escala siempre terminan ganando. Lectura obligatoria.

Rich Sutton, uno de los padres del aprendizaje por refuerzo, escribió un ensayo breve que se convirtió en el texto filosófico más influyente de la IA contemporánea. Este ensayo fue publicado en 2019 y se ha convertido en el mantra de empresas de IA que basan su estrategia en el escalado (como OpenAI y Anthropic). Su argumento central es brutal en su simplicidad: los métodos que aprovechan la computación a escala siempre terminan superando a los métodos que incorporan conocimiento humano específico del dominio. Siempre. Sin excepciones históricas. Los ejemplos son contundentes. En ajedrez, los investigadores pasaron décadas codificando estrategias humanas hasta que la búsqueda bruta los superó. En reconocimiento de voz, los modelos acústicos artesanales fueron reemplazados por redes neuronales entrenadas con datos masivos. En visión por computadora, los detectores de bordes diseñados a mano perdieron contra ConvNets aprendidas de millones de imágenes. El patrón se repite una y otra vez: Corto plazo: el conocimiento humano da una ventaja inicial Largo plazo: los métodos generales con más cómputo ganan La lección es "amarga" porque va en contra del instinto de los investigadores. Queremos que nuestro conocimiento del dominio importe, que la elegancia de nuestras soluciones tenga valor. Pero Sutton nos dice en su tesis amarga que la computación es el único recurso que escala exponencialmente, y apostar contra esa curva es apostar contra la historia misma. ````

2 min·241
Leer
PAPER·
ia·aprendizaje automático·procesamiento de lenguaje natural

LongTraceRL: Aprendizaje de razonamiento de contexto largo desde trayectorias de agentes de búsqueda con recompensas de rúbrica — Autor (2023)

Cómo entrenar modelos de lenguaje para razonar en contextos largos usando trayectorias de agentes de búsqueda y recompensas de rúbrica. Una técnica clave para mejorar LLMs en tareas complejas.

El razonamiento de contexto largo sigue siendo un desafío central para los grandes modelos de lenguaje, que a menudo no logran localizar y integrar la información clave en contenido distractor extenso. El aprendizaje por refuerzo con recompensas verificables (RLVR) ha demostrado ser prometedor para esta tarea, sin embargo, los métodos existentes están limitados por distractores de baja confusabilidad y señales de recompensa esparsas y solo de resultado que no pueden supervisar los pasos intermedios del razonamiento. Para abordar estos problemas, presentamos LongTraceRL, que utiliza un enfoque de aprendizaje por refuerzo con feedback humano para mejorar el razonamiento de contexto largo. Para la construcción de datos, generamos preguntas de multi-salto a través de caminatas aleatorias en grafos de conocimiento y aprovechamos las trayectorias de los agentes de búsqueda para construir distractores jerárquicos: documentos que el agente leyó pero no citó (alta confusabilidad) y documentos que aparecieron en los resultados de búsqueda pero nunca se abrieron (baja confusabilidad), produciendo contextos de entrenamiento que son mucho más desafiantes que aquellos construidos por muestreo aleatorio o búsqueda de un solo disparo. Para el diseño de recompensas, proponemos una recompensa de rúbrica que utiliza las entidades doradas a lo largo de cada cadena de razonamiento como supervisión de proceso a nivel de entidad, lo que permite una evaluación más detallada del desempeño del modelo. Esta recompensa de rúbrica se aplica solo a respuestas con respuestas finales correctas (estrategia de solo positivos), lo que distingue la calidad del razonamiento entre respuestas correctas y evita el hackeo de recompensas, que se refiere a la manipulación del sistema para obtener recompensas sin realmente resolver el problema. Los experimentos en tres LLM de razonamiento (4B-30B) en cinco benchmarks de contexto largo demuestran que LongTraceRL supera consistentemente a los puntos de referencia fuertes y fomenta un razonamiento integral y basado en evidencia. Los códigos, conjuntos de datos y modelos están disponibles en https://github.com/THU-KEG/LongTraceRL. El razonamiento de contexto largo es un desafío importante en el procesamiento de lenguaje natural, ya que requiere la capacidad de localizar y integrar información clave en contenido extenso y distractor. En este trabajo, presentamos LongTraceRL, un enfoque innovador que combina aprendizaje por refuerzo con recompensas de rúbrica para mejorar el razonamiento de contexto largo en modelos de lenguaje grande. Nuestra metodología se basa en la generación de preguntas de multi-salto a través de caminatas aleatorias en grafos de conocimiento y la utilización de trayectorias de agentes de búsqueda para construir distractores jerárquicos. Luego, diseñamos una recompensa de rúbrica que utiliza las entidades doradas a lo largo de cada cadena de razonamiento como supervisión de proceso a nivel de entidad. Los experimentos en tres LLM de razonamiento (4B-30B) en cinco benchmarks de contexto largo demuestran que LongTraceRL supera consistentemente a los puntos de referencia fuertes y fomenta un razonamiento integral y basado en evidencia. En este trabajo, presentamos LongTraceRL, un enfoque innovador para mejorar el razonamiento de contexto largo en modelos de lenguaje grande. Nuestros resultados demuestran que LongTraceRL es una herramienta efectiva para mejorar la capacidad de razonamiento de los modelos de lenguaje y fomentar un razonamiento integral y basado en evidencia.

3 min·5
Leer
PAPER·
ia·ensayo·sistemas

Lumos-Nexus: Puenteo Eficiente de Frecuencia con Espacio Latente Homogéneo para Modelos Unificados de Video (2023)

Un framework unificado de generación de video que combina razonamiento de alta fidelidad visual con eficiencia de frecuencia. Cómo los modelos de IA aprenden a generar video coherente y detallado.

Los modelos unificados de video basados en conectores han demostrado una gran capacidad en la síntesis de video basada en instrucciones, pero la integración de un generador de alta fidelidad grande en el bucle de entrenamiento unificado es computacionalmente prohibitiva, lo que limita la calidad visual alcanzable. La calidad visual se refiere a la claridad y detalle de las imágenes generadas. Por lo tanto, proponemos Lumos-Nexus, un marco de generación de video unificado eficiente en entrenamiento que facilita el desarrollo de capacidades de generación impulsadas por razonamiento fuertes mientras mejora significativamente la fidelidad visual. Lumos-Nexus adopta un diseño de dos etapas: 1) Durante el entrenamiento, solo un generador ligero se alinea con el bloque de comprensión para aprender a recibir control semántico impulsado por razonamiento. Transformadores pueden ser utilizados para mejorar la comprensión del lenguaje en este bloque. 2) Durante la inferencia, introducimos el Puenteo de Frecuencia Progresivo Unificado (UPFB) para progresivamente entregar la generación a un generador preentrenado de alta capacidad en el espacio latente compartido, lo que permite un refinamiento de grueso a fino y produce videos de alta fidelidad sin comprometer la calidad del razonamiento. El espacio latente se refiere a la representación abstracta de los datos en un formato compacto. Para llenar la brecha en las pruebas de generación de video impulsadas por razonamiento, introducimos VR-Bench, que evalúa la capacidad de un modelo para traducir la intención inferida en contenido de video coherente y alineado semánticamente. Experimentos extensivos demuestran que Lumos-Nexus logra ganancias sustanciales en realismo visual y coherencia temporal en VBench, mientras exhibe un rendimiento generativo basado en razonamiento fuerte en VR-Bench. Leyes de escala pueden ser aplicadas para mejorar el rendimiento del modelo. Lumos-Nexus ofrece un enfoque innovador para la generación de video unificado, combinando la capacidad de razonamiento con alta fidelidad visual. Los resultados experimentales demuestran su eficacia en la generación de videos de alta calidad. El código y los modelos están disponibles en https://jiazheng-xing.github.io/nexus-lumos-home/.

2 min·12
Leer
PAPER·
ia·optimización·distribuida

Una Teoría Estricta de Algoritmos de Retroalimentación de Error en Optimización Distribuida — Autor (2023)

Análisis formal de cómo los errores de comunicación afectan la convergencia en sistemas de aprendizaje distribuido a gran escala.

Los costos de comunicación son un cuello de botella importante en el aprendizaje distribuido y la optimización de primer orden. Un enfoque común para aliviar este problema es comprimir la información del gradiente intercambiada entre agentes. Sin embargo, dicha compresión generalmente degrada las garantías de convergencia de los métodos basados en gradientes. Los mecanismos de retroalimentación de error proporcionan un remedio simple y barato en términos computacionales para este problema, pero se han propuesto numerosas variantes y su rendimiento relativo sigue siendo mal entendido. Este artículo proporciona análisis de convergencia estrictos para dos de los principales algoritmos de retroalimentación de error de la literatura, el método clásico de retroalimentación de error (EF) y la retroalimentación de error 21 (EF21), identificando opciones óptimas de tamaño de paso y construyendo funciones de Lyapunov óptimas adaptadas a cada método. Los resultados se mantienen de forma independiente del número de agentes y recuperan las garantías mejores conocidas posibles en el régimen de un solo agente. La optimización distribuida es un campo en constante evolución, donde los algoritmos de aprendizaje automático se utilizan para resolver problemas complejos en entornos distribuidos. Sin embargo, la comunicación entre los agentes puede ser un cuello de botella importante, ya que puede ser costosa y afectar la convergencia de los algoritmos. La compresión de la información del gradiente es una técnica común para reducir los costos de comunicación, pero puede degradar la convergencia de los métodos basados en gradientes. Los mecanismos de retroalimentación de error son una solución simple y barata para este problema, pero su rendimiento relativo sigue siendo mal entendido. La retroalimentación de error es un mecanismo que permite a los agentes corregir sus errores y mejorar su rendimiento. Sin embargo, la implementación de este mecanismo puede ser compleja, ya que requiere la identificación de opciones óptimas de tamaño de paso y la construcción de funciones de Lyapunov óptimas. El artículo analiza dos de los principales algoritmos de retroalimentación de error de la literatura, el método clásico de retroalimentación de error (EF) y la retroalimentación de error 21 (EF21), y proporciona análisis de convergencia estrictos para estos algoritmos. El artículo se centra en la análisis de convergencia de los algoritmos de retroalimentación de error en la optimización distribuida. Los autores identifican opciones óptimas de tamaño de paso y construyen funciones de Lyapunov óptimas adaptadas a cada método. La función de Lyapunov es una herramienta matemática que se utiliza para analizar la estabilidad y la convergencia de los sistemas dinámicos. En el contexto de la optimización distribuida, la función de Lyapunov se utiliza para analizar la convergencia de los algoritmos de aprendizaje automático. El artículo analiza dos algoritmos de retroalimentación de error, el método clásico de retroalimentación de error (EF) y la retroalimentación de error 21 (EF21). El método EF es un algoritmo simple y eficiente que se utiliza para corregir los errores de los agentes. La retroalimentación de error 21 (EF21) es una variante del método EF que se utiliza para mejorar la convergencia de los algoritmos en entornos distribuidos. El artículo proporciona análisis de convergencia estrictos para los algoritmos de retroalimentación de error en la optimización distribuida. Los resultados muestran que los algoritmos de retroalimentación de error pueden converger a la solución óptima en un entorno distribuido, incluso cuando el número de agentes es grande. Los autores también muestran que los algoritmos de retroalimentación de error pueden ser más eficientes que los métodos basados en gradientes en términos de convergencia y precisión. Los resultados del artículo tienen implicaciones importantes para la optimización distribuida y el aprendizaje automático. Los algoritmos de retroalimentación de error pueden ser utilizados para mejorar la convergencia y la precisión de los métodos de aprendizaje automático en entornos distribuidos. Los resultados del artículo también sugieren que los algoritmos de retroalimentación de error pueden ser más eficientes que los métodos basados en gradientes en términos de convergencia y precisión. En conclusión, el artículo proporciona análisis de convergencia estrictos para los algoritmos de retroalimentación de error en la optimización distribuida. Los resultados muestran que los algoritmos de retroalimentación de error pueden converger a la solución óptima en un entorno distribuido, incluso cuando el número de agentes es grande. Los autores también muestran que los algoritmos de retroalimentación de error pueden ser más eficientes que los métodos basados en gradientes en términos de convergencia y precisión. Los resultados del artículo tienen implicaciones importantes para la optimización distribuida y el aprendizaj

4 min·11
Leer