Tüm makaleler
BT ve Teknoloji

Sürekli Difüzyon Dil Modellerinin Dönüşü

Sürekli difüzyonun dil modellemesinde neden geri dönüştüğünü ve oto regresif ve diskret modellerin egemenliğine nasıl meydan okuduğunu keşfedin.

  • #diffusion-models
  • #language-modeling
  • #machine-learning
  • #nlp
continuous-diffusion-language-models-comeback

Çoğu modern dil modeli oto regresif olup, bu anlamda metni soldan sağa tek tek jeton üretir [S1, S6]. Bu yaklaşım iyi ölçeklense de, çıkarım sırasında doğal olarak sıralıdır [1].

Difüzyon modelleri farklı bir yol sunar. Sıralı üretim yerine, tam bir dizinin bozuk bir sürümünden başlar ve bunu temiz metne gradualmente dönüştürür [S5, S6]. Bu, paralel üretim ve iki yönlü kontrol olanağı sağlar [3].

Bu alanda, diskret ve sürekli yöntemler arasında bir ayrım vardır. Diskret difüzyon, jeton sözlüğü üzerinde doğrudan çalışır, genellikle maskeler veya rastgele girişler kullanarak [S6, S7]. Sürekli difüzyon ise jetonları gerçek değerli gömme vektörlerine eşler ve bu vektörlere Gauss gürültüsü uygular [S1, S6].

Sürekli Yöntemlerin Yükselişi ve Düşüşü

Dil için sürekli difüzyon, Diffusion-LM gibi modellerle 2022 civarında erken bir momentum kazandı [1]. Cazip olan, görüntü ve video üretimi için zaten mükemmel hale getirilmiş araçları ve makineleri kullanabilme yeteneğiydi [1].

Ancak 2023’ten sonra alan büyük ölçüde diskret yöntelere doğru kaydı [1]. Bu “sönüm”, ham performans ve eğitim verimliliğine odaklanmasıyla sürüklendi [S1, S6]. Erken sürekli modeller, belirgin bir verimlilik açığı gösterdi; bir analiz, olasılıklara dayalı sürekli modelin benzer sonuçlar elde etmek için oto regresif bir temellene kıyasla çok daha fazla hesaplama gücü gerektirdiğini gösterdi [6].

Diskret difüzyon, metnin kategorik doğası ve oto regresif modellerin yapısıyla kavramsal olarak daha yakın görünüyordu [1]. Araştırmacılar büyük ölçekli modellerin performansına ulaşmaya çalıştıkça, diskret yöntemler tercih edilen yol haline geldi [1].

Sürekli Difüzyon Neden Geri Dönüyor?

Son araştırmalar, sürekli modellerin önceki düşük performansının içsel bir sınırlama olmadığını, bunun yerine iyileştirilmemiş eğitim tarifleri ve değerlendirme protokollerinin sonucu olduğunu gösteriyor [4].

  • Az-adımlı üretim: Sürekli difüzyon, farklı gürültü noktalarını farklı veri örneklerine eşleyerek tek adımlı üretimi mümkün kılar [4]. Aksine, maskeli diskret difüzyon genellikle önceden dağılımını tek bir maskeli duruma daraltır, bu da az-adımlı üretim sırasında “paralel kodlama dilemması” ve kalite düşüklüğüne yol açabilir [4].

  • Kontrollabilite: Görüntü üretimine benzer şekilde, sürekli latentlar rehberlik mekanizmalarıyla semantik olarak manipüle edilebilir [4]. Maskeli diskret difüzyon genellikle jeton düzeyinde düzenlemeyle sınırlı kalır, örneğin cloze işlemi gibi [4].

LangFlow gibi yeni çerçeveler, gürültü zamanlamalarını optimize ederek, kendi kendine koşullandırarak ve negatif log-likeli (NLL) sınırını iyileştirerek, sürekli difüzyonun diskret yöntlerle rekabet edebileceğini ve hatta belirli zero-shot kıyaslamalarda oto regresif modelleri aşabileceğini gösterdi [4].

Teknik Darboğazları Aşmak

Kategorik jetonlar ile sürekli uzay arasındaki boşluğu doldurmak, spesifik teknik donanımlar gerektirir [6].

Bir zorunlu engel, gömme uzayının geometrisidir [6]. Gömme vektörleri denoiser ile birlikte öğreniliyorsa, model token vektörlerini birbirine çökerterek veya normlarını büyüterek hatayı azaltmaya çalışabilir [6]. Bunun önüne geçmek için araştırmacılar düzenleştirme, normalizasyon veya ek sınıflandırma kayıpları kullanır [6].

Gürültü zamanlaması başka bir kritik faktördür [6]. Çoğu gürültü seviyesi, jeton kimliğini çok fazla bırakıp bozmadığı için veya tamamen yok ederek az eğitim sinyali sağlar [6]. Modern sistemler şu anda zamanlamayı modelin entropisi veya gömme geometrisine göre uyarlayarak, denoiser’in anlamlı belirsizlikle karşılaştığı bölgelerde daha fazla eğitim zamanı harcar [6].

Akış Haritaları ve Tutarlılığın Etkisi

Sürekli difüzyonun en son canlanması, akış haritaları ve tutarlılık modelleriyle yakından ilişkilidir [6].

Geleneksel difüzyon, yüksek kaliteli çıktı üretmek için banyak küçük denoising adımı gerektirir [5]. Bir akış haritası, bu tüm dizinin sonucunu tek daha büyük bir adımda yaklaştırmayı öğrenir [6]. Bu yaklaşım özellikle distillation için kullanışlıdır [6].

Sürekli yörüngeler, gürültüden metne olan yol boyunca dizinseviye ilişkileri taşıyabilir [6]. Bu, akış haritası distillationına diskret modellerden daha fazla yapıyı koruma imkanı tanır; diskret modeller genellikle aynı turda örnek alınan jetonlar arasında koşullu bağımsızlık varsayar [6].

Bu gelişmeler, gereken iyileştirme geçişlerinin sayısını azaltarak difüzyon tabanlı dil modellerini daha pratik hale getirir, potansiyel olarak enerji maliyetlerini düşürüp üretim hızını artırır [5].

Oto regresif olmayan üretimin evrimini izliyorsanız, Riemannian Difüzyon Dil Modelleri (RDLM) üzerindeki en son araştırmaları inceleyerek, bu yaklaşımları birleştirmek için manifold geometrisinin nasıl kullanıldığını görebilirsiniz [S2, S3].

Kaynaklar

  1. Sürekli difüzyon dil modelleri - Sander Dieleman

  2. Sürekli difüzyon dil modelleri geri dönüyor

  3. Sürekli Difüzyon Modeli Dil Modellemesi için - arXiv.org

  4. ICML Posteri Tutarlı Difüzyon Dil Modelleri

  5. Sürekli Difüzyon Diskret Yöntlerle Dil Modellemesinde Rakip Oluyor

  6. [2502.11564] Sürekli Difüzyon Modeli Dil Modellemesi için

  7. Sürekli ve Diskret Difüzyon Temelli Yaklaşımlar Üzerine Teknik Bir Genel Bakış…

  8. Sürekli Difüzyon Dil Modelleri Bir Alışkanlık Tarafından Geri Tutuldu … - Medium

Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,225 words 6 min read 8 sources
Yayınlayan

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
gemma4:31b , nemotron-3-super-120b-a12b
Cover image
flux.2-klein-4b
Publication workflow
Pipeline v1