Yapay zeka, basit algoritmaların ötesine geçerek büyük hesaplama gücü gerektiren karmaşık sinir ağlarına evrildi. Geleneksel bilgisayar mimarileri bu iş yükleri için tasarlanmamıştı ve bu durum, özelleştirilmiş donanım hızlandırıcılarının geliştirilmesine yol açtı [1].
Bu hızlandırıcılar, makine öğrenimi, derin öğrenme ve sinir ağı yeteneklerini hızlandırmak için özel olarak tasarlanmış sistemlerdir [2]. Öncelikli olarak AI için kullanılsalar da, akışkan dinamiği simülasyonları ve moleküler modelleme gibi diğer yüksek hesaplama maliyetli paralel uygulamalara da olanak tanırlar [2].
Genel Amaçlı CPU’ların Neden Yetersiz Kaldığı
Erken AI hesaplamaları, genel amaçlı bilgi işlem ve çeşitli görevler için tasarlanmış Merkezi İşlem Birimleri (CPU’lar) üzerine dayanıyordu [3]. Ancak, AI modelleri karmaşıklık kazandıkça, CPU’nun temel tasarımı bir darboğaz haline geldi [3].
CPU’lar, görevleri birbiri ardına işleyen sıralı işlem için optimize edilmiştir [3]. Buna karşılık AI ve makine öğrenimi iş yükleri, paralel yürütme gerektiren matris çarpımları ve vektör işlemlerine dayanır [3]. Bu durum, daha düşük verimliliğe ve modern AI için gerekli yoğun paralel hesaplamaları gerçekleştirememeye yol açtı [3].
GPU’larla Paralel İşleme Geçiş
Grafik İşleme Birimleri (GPU’lar), büyük paralellik getirerek verimlilik sorununu çözdü [3]. CPU’ların aksine, GPU’lar aynı anda hesaplama yapabilen binlerce çekirdeğe sahiptir ve bu da AI modellerinin eğitim hızını büyük ölçüde artırır [3].
NVIDIA, CUDA (Compute Unified Device Architecture) tanıtarak bu geçişi öncülük etti; bu sayede geliştiriciler GPU’ları grafik dışı genel amaçlı bilgi işlemde kullanabildi [3]. Bu yenilik, derin öğrenme devrimini mümkün kıldı ve ses tanıma, doğal dil işleme ve bilgisayarlı görüdeki atılımları destekledi [3].
Özel Silikon: TPU’lar ve ASIC’ler
AI ölçeği büyüdükçe, GPU’lar bile verimlilik sınırlarıyla karşılaştı. Bu durum, genel esneklik yerine tek bir görev için tasarlanmış Uygulamaya Özel Entegre Devreler (ASIC’ler) oluşturulmasına yol açtı [2].
Google, TensorFlow hesaplamalarını hızlandırmak için özel bir ASIC olarak Tensor İşleme Birimi (TPU) geliştirdi [3]. TPU’lar, derin öğrenmenin temel yapı taşları olan tensör işlemleri için özel olarak tasarlanmıştır [3]. Amaca yönelik tasarlandıkları için, TPU’lar geleneksel CPU’lar veya GPU’lara göre watt başına daha yüksek performans sunar ve büyük ölçekli AI altyapısı için daha verimlidir [3].
Modern Hızlandırıcı Türlerinin Karşılaştırılması
Doğru donanımı seçmek, esneklik ile verimlilik arasında bir denge kurmayı gerektirir. Farklı hızlandırıcılar, mimari tasarımlarına göre farklı roller üstlenir [2].
- CPU’lar: Genel amaçlı bilgi işlem için en iyisi, ancak AI iş yüklerinde yavaştır [S2, S3].
- GPU’lar: Paralel görevler için son derece esnek ve güçlü; derin sinir ağlarının eğitiminde idealdir [S2, S3].
- FPGA’lar (Field-Programmable Gate Arrays): GPU’ların esnekliği ile ASIC’lerin verimliliği arasında bir denge sunan yeniden yapılandırılabilir donanım [S1, S2].
- ASIC’ler/TPU’lar: Belirli AI görevleri için maksimum verimlilik ve performans sağlar, ancak diğer bilgisayar tiplerine yeniden yönlendirilemez [S2, S3].
- Dataflow Hızlandırıcıları: Çeşitli iş yükleri için yapılandırılabilen esnek sistemler [2].
AI Donanımında Gelecek Sınırları
Araştırmacılar enerji tüketimini azaltıp yoğunluğu artırmaya çalıştıkça donanım evrimi devam ediyor [2]. Son zamanlarda bazı performans artışları, daha düşük sayısal hassasiyet (daha az anlamlı basamak) ve daha küçük, daha yoğun transistör tasarımları kullanılarak elde edildi [2].
Geleneksel silikonun ötesinde, insan beyninin yapısını ve işlevini taklit etmeye çalışan nöromorfik çipler ortaya çıkıyor [3]. Bu tasarımlar, AI hesaplamalarını biyolojik sinir ağlarına daha çok benzeyen şekillerde gerçekleştirmeyi hedefliyor [1].
AI modelleri daha karmaşık hale geldikçe, sektör niş uygulamalara yönelik yenilikçi hızlandırıcı tasarımları sunan yeni girişimlerin sürekli bir akışını gözlemliyor [2].