Makale Bülteni — QuaRot
Ortogonal Hadamard rotasyonlarıyla aktivasyon aykırı değerlerini yok ederek uçtan uca 4-bit (W4A4KV4) tensör çekirdeği çıkarımını başlatan çalışma.
ETH Zürih, EPFL ve IST Austria araştırmacılarının NeurIPS 2024’te sunduğu “QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs” başlıklı akademik makale, kuantizasyon dünyasında yıllardır aşılamayan aktivasyon darboğazını kıran en cesur matematiksel sistem tasarımıdır1. Pratikte bu çalışma, piyasadaki popüler yöntemlerin (AWQ, GPTQ) sadece ağırlıkları 4-bit yapıp aktivasyonları mecburen 16-bit bırakma (W4A16) ikiyüzlülüğüne son veriyor. Aktivasyon kanallarındaki kontrolsüz aykırı değerleri (outliers) rastgele ortogonal Hadamard dönüşümleriyle uzayda döndürerek tüm gizli boyuta eşit dağıtıyor; böylece ağırlıkların, aktivasyonların ve KV önbelleğinin tamamını saf 4-bit (W4A4KV4) olarak donanımsal INT4 tensör çekirdeklerinde çalıştırmayı başarıyor.
Akademik teorinin ötesinde endüstriyel çıkarım benchmark’larına baktığımızda ortaya konan kazanımlar oldukça etkileyicidir. Makale, LLaMA-2-70B gibi devasa modellerde sıfır atış (zero-shot) doğruluğunu yüzde doksan dokuz oranında korurken 2,16 kata varan çıkarım hızlanması ve %70 bellek tasarrufu vadederken, bu ölçümler doğrudan kurumsal ve üst segment tüketici kartları olan NVIDIA RTX 4090 ve A100 GPU’lar üzerinde kanıtlanmış durumda. Açık kaynak tarafında ise spcl/QuaRot deposunda son commit 1 ay önce, 530 yıldız ve 12 açık issue ile CUTLASS ve FastGEMM çekirdekleriyle entegre edilmiş çalışan bir kod tabanı yer alıyor2.
İddia ve Gerçeklik: QuaRot
Büyük dil modellerinde matris çarpımı hesaplanırken aktivasyon tensörlerinde belirli kanalların diğerlerinden yüz kat daha büyük genliklere ulaştığı bilinir. Bu devasa aykırı değerler yüzünden aktivasyonları 4-bit tamsayılara sıkıştırmaya kalktığınızda temsil aralığı çöker ve model anında halüsinasyon üreten bir hurdaya dönüşür. SmoothQuant gibi önceki yöntemler bu aykırı değerleri ağırlıklara aktarmayı denese de 4-bit seviyesinde matematiksel taşmalar kaçınılmaz oluyordu. Bu yüzden sektör bugüne kadar matris çarpımlarını hep FP16 tensör çekirdeklerinde yapmaya mahkum kaldı. QuaRot makalesinin getirdiği ana zeka pırıltısı, yapay sinir ağlarının hesaplama değişmezliği (computational invariance) prensibini kullanmaktır.
Yazarlar, gizli katman tensörlerini ortogonal bir Walsh-Hadamard matrisi ile çarparak uzayda döndürdü. Ortogonal dönüşümler vektörün uzunluğunu ve açısını koruduğu için çıktının matematiksel doğruluğu milimetrik olarak korunur; ancak tek bir kanalda toplanan devasa enerji tüm kanallara homojen biçimde saçılır. Aykırı değerler buharlaştığı için modelin tüm katmanları, ileri beslemeli blokları ve dikkat mekanizması saf INT4 formatına kuantize edilebilir. Ağırlıkların döndürülmesi çevrimdışı (offline) yapılıp model dosyasına kalıcı olarak gömüldüğünden çıkarım anında sıfır maliyet yaratır. Ancak bir sistem mimarı için madalyonun diğer yüzündeki gerçekler dikkatle tartılmalıdır.
Ağırlıklar çevrimdışı dönse de aktivasyonlar her katmanda çalışma anında (online) hızlı Hadamard dönüşümünden geçmek zorundadır. Özel SRAM düzeyinde optimize edilmiş CUDA çekirdekleri kullanılmadığında, online rotasyon adımı INT4 matmul’dan elde edilen tüm hız avantajını yutabilir. Dahası model rotasyona uğradığında içsel ağırlık temsilleri tamamen karmaşıklaşır; bu durum katman düzeyinde özellik yönlendirmesi (activation steering) veya mekanik yorumlanabilirlik analizi yapmayı imkansız hale getirir.
Kod ve Entegrasyon Haritası
QuaRot, sadece teorik simülasyonlarla yetinmeyip doğrudan donanım seviyesinde çalışan düşük seviyeli INT4 GEMM ve W4A4 KV cache çekirdekleriyle açık kaynak dünyasına sunuldu2. Kod tabanı incelendiğinde, NVIDIA CUTLASS kütüphanesi üzerine inşa edilmiş özel INT4 tensör çekirdeği entegrasyonu ve PyTorch ile doğrudan haberleşen C++ uzantıları göze çarpmaktadır. Yazarların yayımladığı fake_quant simülasyonlarının yanı sıra, gerçek dünyada hızlanma sağlayan derlenmiş kernel’lar mevcuttur.
Bununla birlikte entegrasyon hattında sistem mühendislerinin çok iyi yönetmesi gereken kritik altyapı bariyerleri bulunmaktadır. Standart HuggingFace Transformers kütüphanesindeki bir modeli alıp doğrudan QuaRot ile çalıştıramazsınız; model ağırlıklarının önce ortogonal rotasyon matrisleriyle çarpılarak özel bir kontrol noktasına dönüştürülmesi şarttır. Ayrıca vLLM ve SGLang gibi lider çıkarım motorları henüz W4A4 rotasyon çekirdeklerini varsayılan birincil arka uç olarak bünyelerine katmamıştır.
Geliştirici topluluklarında ve GitHub issue kayıtlarında mühendisler, projenin en yüksek başarımına RTX 3090, RTX 4090 ve A100 gibi donanımlarda ulaştığını, ancak NVIDIA’nın Hopper (H100) ve Blackwell mimarilerinde ağırlığı doğrudan FP8 ve FP4’e kaydırması sebebiyle INT4 ekosisteminin kurumsal veri merkezlerinde ikinci planda kalmasından yakınmaktadır3. Yine de yerel sunucularda çalışan saf 4-bit çıkarım mimarisi olarak QuaRot, akademik sınırları aşmış son derece sağlam bir mühendislik yapıtıdır.
Ticari Etki: Kimin İşine Yarar?
QuaRot teknolojisi, özellikle pahalı H100 kümelerine erişimi olmayan ve operasyonlarını Ampere veya Ada Lovelace (RTX 4090, A100, L40S) sunucu filolarında yürüten teknoloji şirketleri için doğrudan bir kurtarıcıdır. 70 milyar parametreli bir modeli yalnızca ağırlık değil, aktivasyon ve KV önbelleğiyle birlikte tek bir 24 GB GPU’ya sığdırıp iki kat daha hızlı çalıştırmak, donanım yatırımını (CapEx) radikal biçimde düşürür.
Aynı zamanda robotik sistemler, otonom araçlar ve yerel kenar (edge) yapay zeka cihazları geliştiren ekipler için W4A4 çıkarım hayati bir rekabet avantajıdır. Bellek bant genişliği ve bellek kapasitesi son derece sınırlı olan gömülü GPU’larda, model doğruluğundan neredeyse hiç ödün vermeden saf INT4 tensör çekirdeği çalıştırmak, cihaz üzerinde bağımsız büyük model çalıştırmanın önünü açar. Şirket içi dahili ağlarda veri gizliliği gerektiren durumlarda donanım maliyetini katbekat hafifletir.
Buna karşın veri merkezlerinde tamamen H100 ve H200 hızlandırıcılarıyla çalışan ve yerel FP8/FP4 matmul desteğine sahip devasa bulut laboratuvarları için QuaRot öncelikli bir yatırım değildir. Bu dev ölçekteki şirketler için ek online rotasyon adımıyla uğraşmak yerine doğrudan donanımsal FP8 çekirdeklerini kullanmak operasyonel olarak daha basittir. Özetle QuaRot, mevcut GPU parkurunu donanımın fiziksel sınırlarına kadar zorlayarak saf 4-bit çıkarım yapmak isteyen tüm pragmatik mühendislik ekipleri için günümüzün en etkileyici kuantizasyon zaferidir.