Все статьи
ИТ и технологии

Возвращение непрерывных диффузионных языковых моделей

Разбираемся, почему непрерывная диффузия снова становится актуальной в языковом моделировании и как она бросает вызов доминированию авторегрессионных и дискретных моделей.

  • #diffusion-models
  • #language-modeling
  • #machine-learning
  • #nlp
continuous-diffusion-language-models-comeback

Большинство современных языковых моделей являются авторегрессионными, что означает, что они генерируют текст по одному токену за раз слева направо [S1, S6]. Хотя этот подход хорошо масштабируется, он по своей сути является последовательным во время вывода [1].

Диффузионные модели предлагают иной путь. Вместо последовательной генерации они начинают с искаженной версии всей последовательности и постепенно преобразуют ее в чистый текст [S5, S6]. Это позволяет осуществлять параллельную генерацию и двунаправленное управление [3].

В этой области существует разделение между дискретными и непрерывными методами. Дискретная диффузия работает напрямую со словарем токенов, часто используя маски или случайные вставки [S6, S7]. Непрерывная диффузия, напротив, отображает токены в векторы эмбеддингов с вещественными значениями и применяет к этим векторам гауссов шум [S1, S6].

Взлет и падение непрерывных методов

Непрерывная диффузия для языка получила первый импульс около 2022 года с появлением таких моделей, как Diffusion-LM [1]. Привлекательность заключалась в возможности использовать инструменты и механизмы, уже доведенные до совершенства для генерации изображений и видео [1].

Однако после 2023 года фокус в этой области почти полностью сместился в сторону дискретных методов [1]. Это «вымирание» было вызвано стремлением к максимальной производительности и эффективности обучения [S1, S6]. Ранние непрерывные модели демонстрировали значительный разрыв в эффективности; один из анализов показал, что непрерывной модели на основе правдоподобия требовалось гораздо больше вычислительных ресурсов, чем авторегрессионной базовой модели, для достижения аналогичных результатов [6].

Дискретная диффузия казалась концептуально более близкой к категориальной природе текста и структуре авторегрессионных моделей [1]. Поскольку исследователи стремились достичь производительности крупномасштабных моделей, дискретные методы стали предпочтительным путем [1].

Почему непрерывная диффузия возвращается

Последние исследования показывают, что прежняя низкая эффективность непрерывных моделей была не внутренним ограничением, а результатом недостаточно оптимизированных рецептов обучения и протоколов оценки [4].

Непрерывные модели предлагают два основных преимущества перед своими дискретными аналогами:

  • Многошаговая генерация (Few-step generation): Непрерывная диффузия может отображать разные точки шума в разные образцы данных, что делает возможной генерацию за один шаг [4]. Напротив, маскированная дискретная диффузия часто сводит свое априорное распределение к одному маскированному состоянию, что может привести к «дилемме параллельного декодирования» и снижению качества при малошаговой генерации [4].
  • Управляемость: Подобно генерации изображений, непрерывные латентные представления могут семантически корректироваться с помощью механизмов наведения (guidance) [4]. Дискретная маскированная диффузия, как правило, ограничена редактированием на уровне токенов, например, заполнением пропусков (clozing) [4].

Новые фреймворки, такие как LangFlow, продемонстрировали, что за счет оптимизации графиков шума, использования самокондиционирования (self-conditioning) и уточнения границы отрицательного логарифмического правдоподобия (NLL), непрерывная диффузия может соперничать с дискретными методами и даже превосходить авторегрессионные модели в некоторых zero-shot бенчмарках [4].

Преодоление технических узких мест

Преодоление разрыва между категориальными токенами и непрерывным пространством требует специфического технического инструментария [6].

Одной из проблем является геометрия пространства эмбеддингов [6]. Если эмбеддинги обучаются совместно с денойзером, модель может снизить ошибку, «схлопывая» векторы токенов друг с другом или позволяя их нормам бесконтрольно расти [6]. Для предотвращения этого исследователи используют регуляризацию, нормализацию или дополнительные функции потерь классификации [6].

График шума (noise scheduling) также является критическим фактором [6]. Многие уровни шума дают слабый сигнал для обучения, так как они либо оставляют идентичность токена слишком нетронутой, либо полностью ее уничтожают [6]. Современные системы теперь адаптируют график к энтропии модели или геометрии эмбеддингов, уделяя больше времени обучению там, где денойзер сталкивается с существенной неопределенностью [6].

Влияние карт потоков и консистентности

Последнее возрождение непрерывной диффузии тесно связано с картами потоков (flow maps) и консистентными моделями (consistency models) [6].

Традиционная диффузия требует множества мелких шагов денойзинга для получения высококачественного результата [5]. Карта потоков учится аппроксимировать результат всей этой последовательности за один более крупный шаг [6]. Этот подход особенно полезен для дистилляции [6].

Непрерывные траектории могут переносить взаимосвязи на уровне последовательности по пути от шума к тексту [6]. Это дает дистилляции карт потоков больше возможностей для сохранения структуры, чем дискретным моделям, которые часто предполагают условную независимость между токенами, сэмплируемыми в одном раунде [6].

Эти достижения делают языковые модели на основе диффузии более практичными, сокращая количество необходимых проходов уточнения, что потенциально снижает энергозатраты и увеличивает скорость генерации [5].

Если вы следите за эволюцией неавторегрессионной генерации, изучите последние исследования по римановым диффузионным языковым моделям (RDLM), чтобы увидеть, как геометрия многообразий используется для объединения этих подходов [S2, S3].

Источники

  1. Continuous diffusion language models - Sander Dieleman
  2. Continuous diffusion language models make a comeback
  3. Continuous Diffusion Model for Language Modeling - arXiv.org
  4. ICML Poster Consistent Diffusion Language Models
  5. Continuous Diffusion Rivals Discrete in Language Modeling
  6. [2502.11564] Continuous Diffusion Model for Language Modeling
  7. A Technical Overview of Continuous and Discrete Diffusion-based …
  8. Continuous Diffusion Language Models Were Held Back by a Habit … - Medium
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

366 words 2 min read 8 sources
Автор

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
gemma4:31b , gemma-4-31b-it
Cover image
flux.2-klein-4b
Publication workflow
Pipeline v1