A maioria dos modelos de linguagem modernos é autoregressiva, o que significa que eles geram texto um token de cada vez da esquerda para a direita [S1, S6]. Embora essa abordagem escale bem, ela é intrinsecamente sequencial durante a inferência [1].
Os modelos de difusão oferecem um caminho diferente. Em vez de geração sequencial, eles começam com uma versão corrompida de uma sequência completa e a refinam gradualmente até obter texto limpo [S5, S6]. Isso permite geração paralela e controllabilidade bidirecional [3].
Dentro desse campo, existe uma divisão entre métodos discretos e contínuos. A difusão discreta trabalha diretamente no vocabulário de tokens, frequentemente usando máscaras ou entradas aleatórias [S6, S7]. A difusão contínua, por outro lado, mapeia os tokens para vetores de incorporação de valores reais e aplica ruído gaussiano a esses vetores [S1, S6].
O Ascenso e Queda dos Métodos Contínuos
A difusão contínua para linguagem ganhou impulso inicial por volta de 2022 com modelos como Diffusion-LM [1]. O apelo estava na capacidade de aproveitar ferramentas e maquinários já aperfeiçoados para geração de imagem e vídeo [1].
No entanto, após 2023, o campo mudou quase totalmente para métodos discretos [1]. Essa ‘extinção’ foi impulsionada por um foco no desempenho bruto e na eficiência de treinamento [S1, S6]. Os primeiros modelos contínuos mostraram uma lacuna de eficiência acentuada; uma análise indicou que um modelo contínuo baseado em verossimilhança exigia muito mais computação do que uma linha de base autoregressiva para obter resultados semelhantes [6].
A difusão discreta apareceu conceptualmente mais próxima da natureza categórica do texto e da estrutura dos modelos autoregressivos [1]. À medida que os pesquisadores buscavam igualar o desempenho dos modelos de grande escala, os métodos discretos tornaram-se a rota preferida [1].
Por Que a Difusão Contínua Está Retornando
Pesquisas recentes sugerem que o baixo desempenho anterior dos modelos contínuos não foi uma limitação intrínseca, mas sim resultado de receitas de treinamento e protocolos de avaliação subotimizados [4].
Os modelos contínuos oferecem duas vantagens principais em relação aos seus contrapartes discretos:
-
Geração em poucos passos: A difusão contínua pode mapear diferentes pontos de ruído para diferentes amostras de dados, tornando possível a geração em um único passo [4]. Em contraste, a difusão discreta mascarada frequentemente colapsa sua distribuição anterior em um único estado mascarado, o que pode levar a um ‘dilema de decodificação paralela’ e à degradação da qualidade durante a geração em poucos passos [4].
-
Controlabilidade: Semelhante à geração de imagem, os latentes contínuos podem ser manipulados semanticamente usando mecanismos de orientação [4]. A difusão discreta mascarada geralmente está limitada à edição em nível de token, como o preenchimento de lacunas (clozing) [4].
Novos frameworks como LangFlow demonstraram que, ao otimizar os cronogramas de ruído, usar auto-condicionamento e refinar o limite de verossimilhança negativa logarítmica (NLL), a difusão contínua pode rivalizar com os métodos discretos e até superar os modelos autoregressivos em alguns benchmarks zero-shot [4].
Superando os Gargalos Técnicos
Preencher a lacuna entre tokens categóricos e espaço contínuo requer maquinário técnico específico [6].
Um desafio é a geometria do espaço de incorporação [6]. Se as incorporações forem aprendidas conjuntamente com o removedor de ruído, o modelo pode reduzir o erro colapsando os vetores de token juntos ou permitindo que suas normas cresçam [6]. Pesquisadores usam regularização, normalização ou perdas de classificação adicionais para evitar isso [6].
O agendamento de ruído é outro fator crítico [6]. Muitos níveis de ruído fornecem pouco sinal de treinamento porque deixam a identidade do token muito intacta ou a destroem completamente [6]. Sistemas modernos agora adaptam o cronograma à entropia do modelo ou à geometria de incorporação, gastando mais tempo de treinamento onde o removedor de ruído enfrenta incerteza significativa [6].
O Impacto dos Mapas de Fluxo e da Consistência
O último renascimento da difusão contínua está estreitamente ligado aos mapas de fluxo e aos modelos de consistência [6].
A difusão tradicional requer muitos pequenos passos de remoção de ruído para produzir saída de alta qualidade [5]. Um mapa de fluxo aprende a aproximar o resultado dessa sequência inteira em um único passo maior [6]. Essa abordagem é particularmente útil para destilação [6].
As trajetórias contínuas podem transportar relações de nível de sequência ao longo do caminho do ruído para o texto [6]. Isso dá à destilação por mapa de fluxo mais espaço para preservar a estrutura do que os modelos discretos, que frequentemente assumem independência condicional entre os tokens amostrados na mesma rodada [6].
Esses avanços tornam os modelos de linguagem baseados em difusão mais práticos, reduzindo o número de passes de refinamento necessários, potencialmente diminuindo os custos de energia e aumentando a velocidade de geração [5].
Se você está acompanhando a evolução da geração não autoregressiva, explore as pesquisas mais recentes sobre Modelos de Linguagem por Difusão Riemanniana (RDLM) para ver como a geometria de variedades está sendo usada para unificar essas abordagens [S2, S3].
- Modelos de linguagem por difusão contínua - Sander Dieleman
- Os modelos de linguagem por difusão contínua fazem um retorno
- Modelo de Difusão Contínua para Modelagem de Linguagem - arXiv.org
- Pôster ICML Modelos de Linguagem por Difusão Consistente
- Difusão Contínua Rivaliza com Discreta na Modelagem de Linguagem
- [2502.11564] Modelo de Difusão Contínua para Modelagem de Linguagem
- Uma Visão Técnica dos Modelos de Difusão Contínua e Discreta …
- Os Modelos de Linguagem por Difusão Contínua Foram Impedidos por um Hábito … - Medium