Большинство современных языковых моделей являются авторегрессионными, что означает, что они генерируют текст по одному токену за раз слева направо [S1, S6]. Хотя этот подход хорошо масштабируется, он по своей сути является последовательным во время вывода [1].
Диффузионные модели предлагают иной путь. Вместо последовательной генерации они начинают с искаженной версии всей последовательности и постепенно преобразуют ее в чистый текст [S5, S6]. Это позволяет осуществлять параллельную генерацию и двунаправленное управление [3].
В этой области существует разделение между дискретными и непрерывными методами. Дискретная диффузия работает напрямую со словарем токенов, часто используя маски или случайные вставки [S6, S7]. Непрерывная диффузия, напротив, отображает токены в векторы эмбеддингов с вещественными значениями и применяет к этим векторам гауссов шум [S1, S6].
Взлет и падение непрерывных методов
Непрерывная диффузия для языка получила первый импульс около 2022 года с появлением таких моделей, как Diffusion-LM [1]. Привлекательность заключалась в возможности использовать инструменты и механизмы, уже доведенные до совершенства для генерации изображений и видео [1].
Однако после 2023 года фокус в этой области почти полностью сместился в сторону дискретных методов [1]. Это «вымирание» было вызвано стремлением к максимальной производительности и эффективности обучения [S1, S6]. Ранние непрерывные модели демонстрировали значительный разрыв в эффективности; один из анализов показал, что непрерывной модели на основе правдоподобия требовалось гораздо больше вычислительных ресурсов, чем авторегрессионной базовой модели, для достижения аналогичных результатов [6].
Дискретная диффузия казалась концептуально более близкой к категориальной природе текста и структуре авторегрессионных моделей [1]. Поскольку исследователи стремились достичь производительности крупномасштабных моделей, дискретные методы стали предпочтительным путем [1].
Почему непрерывная диффузия возвращается
Последние исследования показывают, что прежняя низкая эффективность непрерывных моделей была не внутренним ограничением, а результатом недостаточно оптимизированных рецептов обучения и протоколов оценки [4].
Непрерывные модели предлагают два основных преимущества перед своими дискретными аналогами:
- Многошаговая генерация (Few-step generation): Непрерывная диффузия может отображать разные точки шума в разные образцы данных, что делает возможной генерацию за один шаг [4]. Напротив, маскированная дискретная диффузия часто сводит свое априорное распределение к одному маскированному состоянию, что может привести к «дилемме параллельного декодирования» и снижению качества при малошаговой генерации [4].
- Управляемость: Подобно генерации изображений, непрерывные латентные представления могут семантически корректироваться с помощью механизмов наведения (guidance) [4]. Дискретная маскированная диффузия, как правило, ограничена редактированием на уровне токенов, например, заполнением пропусков (clozing) [4].
Новые фреймворки, такие как LangFlow, продемонстрировали, что за счет оптимизации графиков шума, использования самокондиционирования (self-conditioning) и уточнения границы отрицательного логарифмического правдоподобия (NLL), непрерывная диффузия может соперничать с дискретными методами и даже превосходить авторегрессионные модели в некоторых zero-shot бенчмарках [4].
Преодоление технических узких мест
Преодоление разрыва между категориальными токенами и непрерывным пространством требует специфического технического инструментария [6].
Одной из проблем является геометрия пространства эмбеддингов [6]. Если эмбеддинги обучаются совместно с денойзером, модель может снизить ошибку, «схлопывая» векторы токенов друг с другом или позволяя их нормам бесконтрольно расти [6]. Для предотвращения этого исследователи используют регуляризацию, нормализацию или дополнительные функции потерь классификации [6].
График шума (noise scheduling) также является критическим фактором [6]. Многие уровни шума дают слабый сигнал для обучения, так как они либо оставляют идентичность токена слишком нетронутой, либо полностью ее уничтожают [6]. Современные системы теперь адаптируют график к энтропии модели или геометрии эмбеддингов, уделяя больше времени обучению там, где денойзер сталкивается с существенной неопределенностью [6].
Влияние карт потоков и консистентности
Последнее возрождение непрерывной диффузии тесно связано с картами потоков (flow maps) и консистентными моделями (consistency models) [6].
Традиционная диффузия требует множества мелких шагов денойзинга для получения высококачественного результата [5]. Карта потоков учится аппроксимировать результат всей этой последовательности за один более крупный шаг [6]. Этот подход особенно полезен для дистилляции [6].
Непрерывные траектории могут переносить взаимосвязи на уровне последовательности по пути от шума к тексту [6]. Это дает дистилляции карт потоков больше возможностей для сохранения структуры, чем дискретным моделям, которые часто предполагают условную независимость между токенами, сэмплируемыми в одном раунде [6].
Эти достижения делают языковые модели на основе диффузии более практичными, сокращая количество необходимых проходов уточнения, что потенциально снижает энергозатраты и увеличивает скорость генерации [5].
Если вы следите за эволюцией неавторегрессионной генерации, изучите последние исследования по римановым диффузионным языковым моделям (RDLM), чтобы увидеть, как геометрия многообразий используется для объединения этих подходов [S2, S3].
Источники
- Continuous diffusion language models - Sander Dieleman
- Continuous diffusion language models make a comeback
- Continuous Diffusion Model for Language Modeling - arXiv.org
- ICML Poster Consistent Diffusion Language Models
- Continuous Diffusion Rivals Discrete in Language Modeling
- [2502.11564] Continuous Diffusion Model for Language Modeling
- A Technical Overview of Continuous and Discrete Diffusion-based …
- Continuous Diffusion Language Models Were Held Back by a Habit … - Medium