Todos os artigos
Tecnologia & TI

O Retorno dos Modelos de Linguagem por Difusão Contínua

Explore por que a difusão contínua está retornando na modelagem de linguagem e como ela desafia a dominância dos modelos autoregressivos e discretos.

  • #diffusion-models
  • #language-modeling
  • #machine-learning
  • #nlp
continuous-diffusion-language-models-comeback

A maioria dos modelos de linguagem modernos é autoregressiva, o que significa que eles geram texto um token de cada vez da esquerda para a direita [S1, S6]. Embora essa abordagem escale bem, ela é intrinsecamente sequencial durante a inferência [1].

Os modelos de difusão oferecem um caminho diferente. Em vez de geração sequencial, eles começam com uma versão corrompida de uma sequência completa e a refinam gradualmente até obter texto limpo [S5, S6]. Isso permite geração paralela e controllabilidade bidirecional [3].

Dentro desse campo, existe uma divisão entre métodos discretos e contínuos. A difusão discreta trabalha diretamente no vocabulário de tokens, frequentemente usando máscaras ou entradas aleatórias [S6, S7]. A difusão contínua, por outro lado, mapeia os tokens para vetores de incorporação de valores reais e aplica ruído gaussiano a esses vetores [S1, S6].

O Ascenso e Queda dos Métodos Contínuos

A difusão contínua para linguagem ganhou impulso inicial por volta de 2022 com modelos como Diffusion-LM [1]. O apelo estava na capacidade de aproveitar ferramentas e maquinários já aperfeiçoados para geração de imagem e vídeo [1].

No entanto, após 2023, o campo mudou quase totalmente para métodos discretos [1]. Essa ‘extinção’ foi impulsionada por um foco no desempenho bruto e na eficiência de treinamento [S1, S6]. Os primeiros modelos contínuos mostraram uma lacuna de eficiência acentuada; uma análise indicou que um modelo contínuo baseado em verossimilhança exigia muito mais computação do que uma linha de base autoregressiva para obter resultados semelhantes [6].

A difusão discreta apareceu conceptualmente mais próxima da natureza categórica do texto e da estrutura dos modelos autoregressivos [1]. À medida que os pesquisadores buscavam igualar o desempenho dos modelos de grande escala, os métodos discretos tornaram-se a rota preferida [1].

Por Que a Difusão Contínua Está Retornando

Pesquisas recentes sugerem que o baixo desempenho anterior dos modelos contínuos não foi uma limitação intrínseca, mas sim resultado de receitas de treinamento e protocolos de avaliação subotimizados [4].

Os modelos contínuos oferecem duas vantagens principais em relação aos seus contrapartes discretos:

  • Geração em poucos passos: A difusão contínua pode mapear diferentes pontos de ruído para diferentes amostras de dados, tornando possível a geração em um único passo [4]. Em contraste, a difusão discreta mascarada frequentemente colapsa sua distribuição anterior em um único estado mascarado, o que pode levar a um ‘dilema de decodificação paralela’ e à degradação da qualidade durante a geração em poucos passos [4].

  • Controlabilidade: Semelhante à geração de imagem, os latentes contínuos podem ser manipulados semanticamente usando mecanismos de orientação [4]. A difusão discreta mascarada geralmente está limitada à edição em nível de token, como o preenchimento de lacunas (clozing) [4].

Novos frameworks como LangFlow demonstraram que, ao otimizar os cronogramas de ruído, usar auto-condicionamento e refinar o limite de verossimilhança negativa logarítmica (NLL), a difusão contínua pode rivalizar com os métodos discretos e até superar os modelos autoregressivos em alguns benchmarks zero-shot [4].

Superando os Gargalos Técnicos

Preencher a lacuna entre tokens categóricos e espaço contínuo requer maquinário técnico específico [6].

Um desafio é a geometria do espaço de incorporação [6]. Se as incorporações forem aprendidas conjuntamente com o removedor de ruído, o modelo pode reduzir o erro colapsando os vetores de token juntos ou permitindo que suas normas cresçam [6]. Pesquisadores usam regularização, normalização ou perdas de classificação adicionais para evitar isso [6].

O agendamento de ruído é outro fator crítico [6]. Muitos níveis de ruído fornecem pouco sinal de treinamento porque deixam a identidade do token muito intacta ou a destroem completamente [6]. Sistemas modernos agora adaptam o cronograma à entropia do modelo ou à geometria de incorporação, gastando mais tempo de treinamento onde o removedor de ruído enfrenta incerteza significativa [6].

O Impacto dos Mapas de Fluxo e da Consistência

O último renascimento da difusão contínua está estreitamente ligado aos mapas de fluxo e aos modelos de consistência [6].

A difusão tradicional requer muitos pequenos passos de remoção de ruído para produzir saída de alta qualidade [5]. Um mapa de fluxo aprende a aproximar o resultado dessa sequência inteira em um único passo maior [6]. Essa abordagem é particularmente útil para destilação [6].

As trajetórias contínuas podem transportar relações de nível de sequência ao longo do caminho do ruído para o texto [6]. Isso dá à destilação por mapa de fluxo mais espaço para preservar a estrutura do que os modelos discretos, que frequentemente assumem independência condicional entre os tokens amostrados na mesma rodada [6].

Esses avanços tornam os modelos de linguagem baseados em difusão mais práticos, reduzindo o número de passes de refinamento necessários, potencialmente diminuindo os custos de energia e aumentando a velocidade de geração [5].

Se você está acompanhando a evolução da geração não autoregressiva, explore as pesquisas mais recentes sobre Modelos de Linguagem por Difusão Riemanniana (RDLM) para ver como a geometria de variedades está sendo usada para unificar essas abordagens [S2, S3].

  1. Modelos de linguagem por difusão contínua - Sander Dieleman
  2. Os modelos de linguagem por difusão contínua fazem um retorno
  3. Modelo de Difusão Contínua para Modelagem de Linguagem - arXiv.org
  4. Pôster ICML Modelos de Linguagem por Difusão Consistente
  5. Difusão Contínua Rivaliza com Discreta na Modelagem de Linguagem
  6. [2502.11564] Modelo de Difusão Contínua para Modelagem de Linguagem
  7. Uma Visão Técnica dos Modelos de Difusão Contínua e Discreta …
  8. Os Modelos de Linguagem por Difusão Contínua Foram Impedidos por um Hábito … - Medium
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,261 words 6 min read 8 sources
Publicado por

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
gemma4:31b , nemotron-3-super-120b-a12b
Cover image
flux.2-klein-4b
Publication workflow
Pipeline v1