Makale Bülteni — AWQ
Aktivasyon büyüklüklerine göre ağırlıkların en kritik yüzde birini ölçekleyerek koruyan ve 4-bit ağırlık kuantizasyonunu endüstri standardı yapan çalışma.
MIT HAN Lab ekibinin kaleme aldığı ve MLSys 2024 En İyi Makale Ödülü’ne layık görülen “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration” başlıklı akademik makale, büyük dil modellerinin üretim hattındaki donanım ayak izini yarıdan fazla küçülten en etkili sistem çalışmalarından biridir1. Pratikte bu araştırma, 70 milyar parametreli bir temel modeli çalıştırabilmek için yüz binlerce dolarlık çoklu kurumsal GPU kümelerine bağımlı kalma zorunluluğunu ortadan kaldırıyor. Modeli sıfırdan yeniden eğitmeye gerek kalmadan (post-training quantization), ağırlıkları 4-bit tamsayılara sıkıştırarak tek bir üst seviye tüketici kartına veya standart kurumsal hızlandırıcıya sığdırmanın matematiksel ve donanımsal zeminini sunuyor.
Akademik teorinin ötesinde üretim ortamındaki benchmark tablolarına baktığımızda ortaya konan bilanço son derece somuttur. Makale, FP16 hassasiyetine kıyasla model başarımından (perplexity) feragat etmeden %65 daha az VRAM tüketimi ve 3,2 kata varan çıkarım hızlanması vadederken, bu kazanımlar doğrudan NVIDIA RTX 4090 ve A100 GPU’lar üzerinde doğrulanmış durumda. Açık kaynak deposu olan mit-han-lab/llm-awq ve vLLM ekosisteminin benimsediği AutoAWQ tarafında ise son commit 3 hafta önce, 170 açık issue ile iki milyondan fazla indirmeye ulaşmış devasa bir topluluk mirası bulunuyor2.
İddia ve Gerçeklik: AWQ
Model ağırlıklarını 16-bit kayan noktalı sayılardan 4-bit tamsayılara (W4A16) indirmek geçmişte iki büyük engelle karşılaşıyordu: Basit yuvarlama teknikleri (RTN) modelin akıl yürütme yeteneğini tamamen çökertiyor, ikinci derece matris optimizasyonuna dayanan GPTQ gibi yöntemler ise kalibrasyon verisine aşırı uyum (overfitting) sağlayarak karmaşık mantık testlerinde beklenmedik kalite kayıpları yaratıyordu. AWQ makalesinin getirdiği temel felsefi kırılma, modeldeki tüm ağırlıkların eşit derecede önemli olmadığı ve ağırlığın kendi mutlak büyüklüğünün yanıltıcı olduğu gözlemine dayanır. Yazarlar, modelin gerçek dünyadaki davranışını belirleyen asıl unsurun girdi aktivasyonlarının büyüklüğü olduğunu kanıtladı.
Aktivasyon büyüklüklerine bakıldığında ağırlık kanallarının sadece yüzde birinin çıktıyı domine ettiği görüldü. AWQ, bu kritik yüzde birlik kanalı tespit edip matematiksel bir kanal ölçekleme faktörü ($s > 1$) ile koruma altına alır. En zarif mühendislik dokunuşu ise bu ölçeklemenin çalışma zamanına (runtime) sıfır ek maliyet bindirmesidir; çünkü çarpan katsayısı kendisinden önce gelen LayerNorm katmanının ağırlıklarına statik olarak yedirilir. Böylece donanımda karmaşık karışık hassasiyet (mixed precision) devreleri aramaksızın homojen 4-bit matrisler elde edilir. Ancak bir CTO gözüyle bakıldığında madalyonun diğer yüzündeki gerçekler dikkatle tartılmalıdır. AWQ yalnızca ağırlıkları sıkıştırır (W4A16); aktivasyon tensörleri halen 16-bit hassasiyetinde akar.
Bu durum, çıkarımın hesaplama yoğun (compute-bound) olan prefill aşamasında neredeyse hiçbir performans artışı sağlamadığı anlamına gelir. Hızlanma yalnızca bellek bant genişliğine kilitli (memory-bound) token üretim (decode) aşamasında hissedilir. Dahası GPU tensör çekirdekleri matmul işleminden hemen önce INT4 ağırlıkları geçici olarak FP16’ya geri açmak (dequantize) zorundadır; bu da yazmaç baskısını artırarak özel fused kernel yazılmadığında beklenen hızlanmayı törpüleyebilir.
Kod ve Entegrasyon Haritası
AWQ, araştırma makalesi sınırlarını aşarak açık kaynak dünyasında modern çıkarım motorlarının fiili sıkıştırma standardına dönüşmüştür. MIT HAN Lab tarafından yayımlanan orijinal C++ ve CUDA çekirdekleri, Casper Hansen liderliğindeki topluluk tarafından geliştirilen AutoAWQ kütüphanesiyle endüstriyel boyuta taşındı3. Bugün vLLM, TensorRT-LLM, HuggingFace TGI ve SGLang gibi tüm büyük çıkarım çatıları AWQ formatını yerel olarak desteklemektedir. Hatta vLLM projesi AutoAWQ bakımını kendi resmi şemsiyesi altına (llm-compressor) alarak projenin kurumsal devamlılığını garanti altına almıştır.
Kod tabanının üretim olgunluğunu gösteren en çarpıcı faktör, HuggingFace üzerinde yayımlanmış yedi binden fazla hazır AWQ model ağırlığının bulunmasıdır. Mühendislerin sıfırdan saatlerce kalibrasyon araması yapmasına gerek kalmadan Llama, Qwen veya Mistral ailelerinin 4-bit sürümleri doğrudan saniyeler içinde ayağa kaldırılabilmektedir. Ancak entegrasyon hattı kusursuz değildir. Özellikle kalibrasyon veri setinin dil dağılımı kritik bir bağımlılıktır; sadece İngilizce metinlerle kalibre edilmiş bir AWQ modeline Türkçe veya çok dilli karmaşık sorgular yöneltildiğinde sayısal taşmalar ve anlamsal bozulmalar yaşanabilmektedir.
Ayrıca yakın dönemde geliştirilen ve saf INT4 matmul yürütmeyi hedefleyen Marlin çekirdekleriyle entegrasyon sürecinde geriye dönük ağırlık yeniden paketleme (weight repack) zorunluluğu, çıkarım sunucularında ek bir ilk yükleme gecikmesi doğurmaktadır4. Yine de kod bir araştırma prototipi değil, milyonlarca üretim çağrısını kesintisiz karşılayan çelikleşmiş bir altyapıdır.
Ticari Etki: Kimin İşine Yarar?
AWQ teknolojisi, özellikle şirket içi veri güvenliği gereksinimi duyan KOBİ’ler ve donanım bütçesi sınırlı yapay zeka girişimleri için doğrudan bir kurtarıcıdır. 70 milyar parametreli bir modeli FP16 olarak barındırmak en az iki adet 80 GB A100 GPU gerektirirken ve aylık binlerce dolar bulut faturası yaratırken, AWQ sayesinde aynı model tek bir 48 GB A6000 veya iki adet ucuz tüketici sınıfı RTX 4090 üzerinde çalışabilmektedir. Bu dönüşüm, donanım yatırımını (CapEx) doğrudan yüzde yetmiş oranında aşağı çeker.
Aynı zamanda robotik sistemler, otonom araçlar ve NVIDIA Jetson Orin benzeri kenar (edge) cihazlar geliştiren ekipler için AWQ hayati bir gerekliliktir. Kısıtlı VRAM ve düşük güç tüketimi sınırlarında çalışan yerel sistemlerde, model doğruluğundan neredeyse hiç kaybetmeden 4-bit çıkarım yapmak cihaz üzerinde tam otonom yapay zeka ajanlarının çalışmasını mümkün kılar.
Buna karşın bulutta sadece çok yüksek eşzamanlı toplu işleme (batch size > 64) yürüten ve sistemleri zaten GPU hesaplama tavanına (compute-bound) çarpan dev bulut sağlayıcıları için AWQ’nun getirdiği hızlanma marjinal kalabilir. Bu dev ölçekteki operasyonlar için FP8 gibi doğrudan tensör çekirdeği seviyesinde hesaplama yapan formatlar daha cazip bir tercihtir. Özetle AWQ, donanım maliyetlerini rasyonelleştirmek ve pahalı GPU tekeline teslim olmadan yüksek kaliteli büyük modeller çalıştırmak isteyen tüm pratik mühendislik ekipleri için vazgeçilmez bir üretim kaldıracıdır.