La mayoría de los modelos de lenguaje modernos son autoregresivos, lo que significa que generan texto un token a la vez de izquierda a derecha [S1, S6]. Aunque este enfoque escala bien, es inherentemente secuencial durante la inferencia [1].
Los modelos de difusión ofrecen un camino diferente. En lugar de generación secuencial, comienzan con una versión corrupta de una secuencia completa y la refinan gradualmente hasta obtener texto limpio [S5, S6]. Esto permite la generación paralela y la controllabilidad bidireccional [3].
Dentro de este campo, existe una división entre métodos discretos y continuos. La difusión discreta trabaja directamente sobre el vocabulario de tokens, a menudo usando máscaras o entradas aleatorias [S6, S7]. La difusión continua, en cambio, asigna los tokens a vectores de incrustación de valor real y aplica ruido gaussiano a esos vectores [S1, S6].
El auge y la caída de los métodos continuos
La difusión continua para el lenguaje ganó impulso temprano alrededor de 2022 con modelos como Diffusion-LM [1]. El atractivo estaba en la capacidad de aprovechar herramientas y maquinaria ya perfeccionadas para la generación de imágenes y videos [1].
Sin embargo, después de 2023, el campo se desplazó casi por completo hacia los métodos discretos [1]. Esta «extinción» fue impulsada por un enfoque en el rendimiento bruto y la eficiencia de entrenamiento [S1, S6]. Los primeros modelos continuos mostraron una brecha de eficiencia pronunciada; un análisis indicó que un modelo continuo basado en verosimilitud requería mucho más cómputo que una línea base autoregresiva para obtener resultados similares [6].
La difusión discreta apareció conceptualmente más cercana a la naturaleza categórica del texto y la estructura de los modelos autoregresivos [1]. A medida que los investigadores buscaban igualar el rendimiento de los modelos a gran escala, los métodos discretos se convirtieron en la ruta preferida [1].
Por qué la difusión continua está regresando
Investigaciones recientes sugieren que el bajo rendimiento previo de los modelos continuos no fue una limitación intrínseca, sino el resultado de recetas de entrenamiento y protocolos de evaluación no optimizados [4].
- Generación en pocos pasos: La difusión continua puede asignar diferentes puntos de ruido a diferentes muestras de datos, lo que hace posible la generación en un solo paso [4]. En contraste, la difusión discreta enmascarada a menudo colapsa su distribución previa en un único estado enmascarado, lo que puede provocar un «dilema de decodificación paralela» y una calidad degradada durante la generación en pocos pasos [4].
- Control: Similar a la generación de imágenes, los latentes continuos pueden manipularse semánticamente usando mecanismos de guía [4]. La difusión discreta enmascarada generalmente se limita a la edición a nivel de token, como el cloze [4].
Nuevos marcos como LangFlow han demostrado que, al optimizar los programas de ruido, usar auto‑condicionamiento y refinar el límite de verosimilitud negativa logarítmica (NLL), la difusión continua puede competir con los métodos discretos e incluso superar a los modelos autoregresivos en ciertos benchmarks de cero disparos [4].
Superando los cuellos de botella técnicos
Cerrar la brecha entre los tokens categóricos y el espacio continuo requiere maquinaria técnica específica [6].
Un desafío es la geometría del espacio de incrustación [6]. Si las incrustaciones se aprenden conjuntamente con el removedor de ruido, el modelo podría reducir el error colapsando los vectores de tokens entre sí o permitiendo que sus normas crezcan [6]. Los investigadores utilizan regularización, normalización o pérdidas de clasificación adicionales para evitar esto [6].
La programación del ruido es otro factor crítico [6]. Muchos niveles de ruido ofrecen poca señal de entrenamiento porque ya sea dejan la identidad del token demasiado intacta o la destruyen completamente [6]. Los sistemas modernos ahora adaptan el programa a la entropía del modelo o a la geometría de la incrustación, dedicando más tiempo de entrenamiento donde el removedor de ruido enfrenta incertidumbre significativa [6].
El impacto de los mapas de flujo y la consistencia
El último resurgimiento de la difusión continua está estrechamente vinculado a los mapas de flujo y los modelos de consistencia [6].
La difusión tradicional requiere muchos pequeños pasos de eliminación de ruido para producir una salida de alta calidad [5]. Un mapa de flujo aprende a aproximar el resultado de toda esa secuencia en un solo paso más grande [6]. Este enfoque es particularmente útil para la destilación [6].
Las trayectorias continuas pueden transportar relaciones a nivel de secuencia a lo largo del camino desde el ruido hasta el texto [6]. Esto brinda a la destilación mediante mapa de flujo más espacio para preservar la estructura que los modelos discretos, que a menudo asumen independencia condicional entre los tokens muestreados en la misma ronda [6].
Estos avances hacen que los modelos de lenguaje basados en difusión sean más prácticos al reducir el número de pasadas de refinamiento necesarios, lo que potencialmente disminuye los costos de energía y aumenta la velocidad de generación [5].
Si estás siguiendo la evolución de la generación no autoregresiva, explora la última investigación sobre los Modelos de Lenguaje de Difusión Riemanniana (RDLM) para ver cómo se está utilizando la geometría de variedades para unificar estos enfoques [S2, S3].
Fuentes
-
Los modelos de lenguaje de difusión continua hacen un regreso
-
Modelo de difusión continua para el modelado de lenguaje - arXiv.org
-
La difusión continua rivaliza con lo discreto en el modelado de lenguaje
-
[2502.11564] Modelo de difusión continua para el modelado de lenguaje
-
Una visión técnica de la difusión continua y discreta basada …
-
Los modelos de lenguaje de difusión continua fueron retenidos por un hábito … - Medium