RadarMakale Bülteniai üretimi

Makale Bülteni — GaLore

Gradyan matrisini düşük dereceli alt uzaya yansıtarak optimizer bellek yükünü yüzde altmış beş azaltan ve tek GPU'da 7B ön eğitimini mümkün kılan çalışma.

Caltech, Meta AI ve UT Austin araştırmacılarının ICML 2024’te yayımladığı “GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection” başlıklı akademik makale, yapay zeka eğitimindeki en büyük finansal engele doğrudan meydan okuyor1. Pratikte bu çalışma, yedi milyar parametreli bir temel modeli sıfırdan ön eğitime (pre-training) veya tam parametreli ince ayara (full fine-tuning) sokabilmek için yüz binlerce dolarlık çoklu A100 sunucu kümelerine muhtaç olma devrini kapatmayı hedefliyor. Model ağırlıklarını dondurmak zorunda kalan LoRA gibi tavizli yöntemlerin aksine, tüm ağırlıkları serbest bırakıp optimize edici durumlarının (optimizer states) yarattığı devasa bellek faturasını gradyan seviyesinde budamayı başarıyor.

Akademik teorinin ötesinde endüstriyel eğitim kıyaslamalarına baktığımızda ortaya konan somut kazanımlar sektör için tarihi bir eşiktir. Makale, standart AdamW optimizasyonuna kıyasla tam parametre öğrenme dinamiklerini birebir korurken %65,5 optimizer bellek tasarrufu ve tek kartta 7B model eğitimi vadederken, bu ölçümler doğrudan kurumsal ve tüketici sınıfı NVIDIA RTX 4090 ve A100-80GB GPU’lar üzerinde kanıtlanmış durumda. Açık kaynak kod cephesinde ise jiaweizzhao/GaLore resmi deposunda son commit 1 ay önce, 2.500 yıldız ve 40 açık issue ile HuggingFace ekosistemine entegre olmuş çok hareketli bir geliştirici tabanı bulunuyor2.

İddia ve Gerçeklik: GaLore

Büyük dil modellerinin eğitiminde GPU belleğini en çok tüketen unsur modelin kendi ağırlıkları değildir. Asıl VRAM canavarı, AdamW gibi modern optimize edicilerin her bir parametre için saklamak zorunda olduğu momentum ve varyans gibi birinci ve ikinci derece durum tensörleridir. Yedi milyar parametreli bir modelde bu optimizer durumları tek başına elli altı gigabayt bellek kaplar ve tek bir 24 GB veya 40 GB kartın sınırlarını anında aşar. LoRA bu sorunu ağırlıkları düşük dereceli matrislerle dondurarak aşsa da, ön eğitim aşamasında model ağırlıkları düşük dereceli olmadığı için sıfırdan model üretmede tamamen çaresiz kalır. GaLore makalesinin getirdiği ana matematiksel keşif, ağırlıklar tam dereceli olsa bile gradyan matrisinin eğitim boyunca düşük dereceli bir alt uzayda hareket ettiğidir.

Yazarlar, gradyan matrisini Tekil Değer Ayrışımı (SVD) ile kompakt bir alt uzaya ($P^T G Q$) yansıtarak AdamW durumlarını yalnızca bu küçük matris üzerinde takip ettiler. Güncelleme anında ise tensör tekrar tam boyutuna yansıtılarak modelin tüm ağırlıkları serbestçe eğitilir. Üstelik 8-bit AdamW ile birleştirildiğinde bellek tasarrufu yüzde seksen beşe ulaşır ve 7B LLaMA modeli tek bir tüketici sınıfı RTX 4090 üzerinde sıfırdan eğitilebilir hale gelir. Ancak bir sistem mimarı için madalyonun diğer yüzündeki hesaplama maliyetleri dikkatle incelenmelidir.

Her iki yüz adımda bir projeksiyon matrislerini güncellemek için GPU veya CPU üzerinde SVD çalıştırmak gerekir. Bu periyodik ayrıştırma adımı, genel eğitim süresine yaklaşık yüzde on beş ile yirmi arasında ek hesaplama yükü bindirir. Dahası GaLore optimizer durumlarını budasa da aktivasyon belleğini yok edemez; bu nedenle tek GPU üzerinde eğitim yapabilmek için mutlaka katman bazlı ağırlık güncellemesi (per-layer updates) ve aktivasyon kontrol noktalaması (activation checkpointing) gibi ek bellek tekniklerinin kusursuz koordine edilmesi şarttır.

Kod ve Entegrasyon Haritası

GaLore, laboratuvar düzeyinde bırakılmayıp PyTorch ve HuggingFace kütüphaneleriyle doğrudan uyumlu çalışan modüler bir optimizer paketi olarak açık kaynak dünyasına sunuldu2. Kod tabanı incelendiğinde, geliştiricilerin standart eğitim betiklerine sadece tek bir argüman (--optimizer=galore_adamw8bit_per_layer) ekleyerek mevcut eğitim hatlarını dönüştürebildiği son derece zarif bir yazılım mimarisi göze çarpmaktadır.

Açık kaynak dünyasındaki benimsenme temposu oldukça yüksektir. HuggingFace Transformers, PEFT ve TRL ekipleri GaLore desteğini resmi repolarına dahil ederek milyonlarca geliştiricinin erişimine açmıştır3. C4 veri kümesi üzerinde yapılan kıyaslamalarda LLaMA modellerinin tam parametreli standart eğitimle tamamen aynı kayıp (loss) eğrisini yakaladığı bağımsız testlerle teyit edilmiştir. Ancak entegrasyon hattında mühendislerin karşılaşacağı operasyonel pürüzler bulunmaktadır.

Hacker News ve GitHub tartışmalarında altyapı mühendisleri, GaLore’un tek GPU üzerinde olağanüstü çalıştığını fakat çoklu GPU dağıtık eğitiminde (PyTorch DDP veya DeepSpeed ZeRO) katman bazlı güncellemelerin iletişim darboğazı yarattığından bahsetmektedir4. Çoklu GPU desteği olgunlaşma aşamasındadır. Yine de bağımsız laboratuvarlar için donanım duvarını yıkan en devrimci açık kaynak optimizer GaLore’dur.

Ticari Etki: Kimin İşine Yarar?

GaLore teknolojisi, özellikle pahalı GPU kümeleri kiralayacak bütçesi olmayan bağımsız yapay zeka girişimleri, üniversite araştırma laboratuvarları ve şirket içi özel modeller inşa etmek isteyen KOBİ’ler için doğrudan bir oyun değiştiricidir. Eskiden bir temel modeli tam parametreleriyle alana özel sıfırdan eğitmek veya derinlemesine yeniden ayarlamak için aylık on binlerce dolarlık A100 bulut faturası ödemek gerekirken, bugün ofisteki standart bir iş istasyonunda yer alan tek bir RTX 4090 ile aynı sürecin yürütülebilmesi donanım yatırımını (CapEx) adeta sıfıra indirir.

Aynı zamanda tıp, hukuk ve finans gibi hassas alanlarda kendi kapalı devre terminallerinde özel model ön eğitimi yapmak isteyen regülasyona tabi kurumlar için büyük bir stratejik avantajdır. Verileri üçüncü parti bulut sağlayıcılarına aktarmadan yerel tüketici donanımlarında tam ölçekli eğitim yapabilmek, uyumluluk maliyetlerini kökten çözer.

Buna karşın yüzlerce H100 GPU’suna sahip olan ve modelleri binlerce kartlık devasa veri paralelliğiyle (FSDP/Megatron) eğiten en üst ligdeki teknoloji devleri için GaLore’un getirdiği SVD hesaplama ek yükü tercih edilmeyebilir; çünkü bu ölçekte bellekten ziyade saf eğitim hızı önceliklidir. Özetle GaLore, donanım tekeline meydan okuyup kendi taban modelini bağımsız imkanlarla eğitmek isteyen tüm yaratıcı ve pragmatik mühendislik ekipleri için günümüzün en güçlü demokratikleştirici kaldıracıdır.

Kaynaklar

  1. GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection — arXiv
  2. GaLore Official Implementation Repository — GitHub
  3. GaLore Paper and Discussion — Hugging Face
  4. GaLore: Memory-Efficient LLM Training Discussion — Reddit LocalLLaMA