Makale Bülteni — DeepSeek-V2 ve MLA
Düşük dereceli ortak sıkıştırmayla (MLA) KV cache boyutunu yüzde doksanın üzerinde budayan ve çıkarım ekonomisini kökten değiştiren mimari analiz.
DeepSeek-AI araştırma ekibinin yayımladığı “DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model” başlıklı akademik makale, yapay zeka sektöründe donanım maliyetleri ve çıkarım darboğazları üzerine yazılmış en sarsıcı sistem mimarisi belgelerinden biridir1. Pratikte bu çalışma, yüz milyarlarca parametreli devasa modelleri üretim ortamında sunarken GPU belleğini yutan KV cache canavarını düşük dereceli (low-rank) bir gizil uzaya sıkıştırmayı ve böylece aynı donanım üzerinde eşzamanlı hizmet verilen kullanıcı sayısını katlamayı vadediyor. Çok başlı dikkat (MHA) ve gruplanmış sorgu dikkatinin (GQA) uzun bağlamlarda yarattığı bellek tıkanıklığına, matematiksel matris projeksiyonunu doğrudan çıkarım algoritmasına yedirerek mühendislik düzeyinde kökten bir yanıt veriyor.
Makalenin teorik çerçevesini üretim ortamındaki benchmark verileriyle karşılaştırdığımızda karşımıza çıkan tablo oldukça nettir. Resmi teknik raporda klasik dikkat mekanizmalarına kıyasla %93,3 daha az KV cache bellek tüketimi ve 5,76 kata varan throughput artışı iddia edilirken, bu kazanımlar doğrudan kurumsal bant genişliği kısıtlı 8×H800 sunucu kümelerinde ölçümlenmiş durumda. Açık kaynak tarafında ise deepseek-ai/DeepSeek-V2 resmi deposunda son commit 2 hafta önce, 184 açık issue ile canlı bir ekosistem ve yoğun bir topluluk desteği görülüyor2.
İddia ve Gerçeklik: DeepSeek-V2 ve MLA
Geleneksel Transformer modellerinde üretim anında en büyük bellek maliyeti model ağırlıklarından ziyade her token için saklanan Key ve Value tensörlerinden gelir. Bağlam uzunluğu otuz iki bin veya yüz yirmi sekiz bin token seviyesine çıktığında, KV cache boyutu model ağırlıklarını katlar ve sunucuları tek haneli batch boyutlarına mahkum eder. GQA yaklaşımı anahtar başlıklarını gruplayarak bu yükü bir nebze hafifletse de başlık sayısı azaldıkça modelin dikkat kabiliyeti hissedilir biçimde aşınır. DeepSeek ekibinin geliştirdiği Multi-Head Latent Attention (MLA) mimarisi ise Key ve Value tensörlerini ayrı ayrı saklamak yerine, düşük dereceli ortak bir projeksiyon matrisiyle çok daha küçük bir gizil vektörde (latent vector) birleştirir.
Sistemin gerçek mühendislik zekası decode adımında devreye girer. Matris çarpımının birleşme özelliği sayesinde, gizil uzaydaki sıkıştırılmış anahtar vektörü hafızada decompress edilmek zorunda kalmaz; doğrudan sorgu (Query) matrisi projeksiyon ağırlıklarıyla birleştirilerek tek hamlede hesaplanır. Böylece GPU belleğinde devasa tensörler yerine küçücük gizil vektörler tutulur. Ancak bu mimarinin arkasında gizlenen ciddi bir mühendislik faturası vardır: Döner Konumsal Gömme (RoPE) mekanizması bu sıkıştırma matrisleriyle doğrudan uyuşmaz. Yazarlar bu sorunu aşmak için konumsal bilgiyi taşıyan ayrıştırılmış ek bir RoPE anahtar vektörü (Decoupled RoPE) eklemek zorunda kalmıştır. Bu ek vektör, çıkarım motorlarının bellek yönetim mantığını karmaşıklaştırır ve standart attention çekirdeklerinin doğrudan çalışmasını engeller.
Ayrıca bu optimizasyon sonradan modele yamanabilecek bir quantization veya budama tekniği değildir. Bir modelin MLA avantajından yararlanabilmesi için sıfırdan trilyonlarca token ile bu mimaride eğitilmesi şarttır; dolayısıyla Llama veya Mistral gibi mevcut modelleri geriye dönük olarak MLA formatına geçirmek imkansızdır.
Kod ve Entegrasyon Haritası
DeepSeek-V2 modelinin mimari başarısı ilk etapta açık kaynak çıkarım motorlarında ciddi bir adaptasyon krizi yarattı. Model yayımlandığında vLLM ve TGI gibi popüler motorlar MLA için optimize edilmiş fused CUDA çekirdeklerine sahip değildi. İlk haftalarda geliştiriciler, sıkıştırılmış gizil vektörleri her dikkat katmanında geçici olarak standart tensörlere açarak (decompress) çalıştırmak zorunda kaldı; bu durum bellek tasarrufu sağlasa da hesaplama süresini uzatarak teorik hızlanmayı sıfırladı.
Ancak açık kaynak dünyasının reaksiyon hızı gecikmedi. SGLang ve FlashInfer ekipleri, MLA’nın gizil yapısını doğrudan GPU paylaşımlı belleğinde işleyen özel Triton ve CUDA kernel’ları geliştirerek depoya dahil etti3. Bugün vLLM v0.6 ve üzeri sürümlerde MLA desteği kararlı hale getirilmiş durumdadır. Resmi GitHub deposu olan deepseek-ai/DeepSeek-V2, eğitim betiklerinden çıkarım yönergelerine kadar temiz ve modüler bir kod tabanı sunmaktadır2.
Bununla birlikte entegrasyon hattında bakım maliyeti halen yüksektir. Döner gömme vektörlerinin ayrıştırılmış yapısı nedeniyle standart HuggingFace Transformers kütüphanesinde çıkarım yapmak aşırı yavaş kalmakta, üretim için mutlaka optimize edilmiş C++ ve Triton arka uçları gerekmektedir. Hacker News ve Reddit tartışmalarında mühendisler, modelin MoE yönlendirme mekanizması ile MLA bellek yönetiminin birleştiği noktalarda GPU bellek taşması (OOM) hatalarını yönetmenin zorluğundan bahsetmektedir4.
Ticari Etki: Kimin İşine Yarar?
MLA mimarisi, bulut tabanlı yapay zeka API sağlayıcıları ve büyük ölçekli RAG çözümleri sunan kurumsal girişimler için birim maliyetleri radikal biçimde aşağı çeken ticari bir silahtır. KV cache boyutunun onda bire inmesi, aynı sunucu kümesinde beş kata kadar daha yüksek eşzamanlı istek karşılanabilmesi anlamına gelir. Özellikle yüz binlerce token’lık hukuki belgeleri, finansal raporları ve kod depolarını analiz eden kurumsal uygulamalarda GPU altyapı faturası doğrudan yarıdan fazla düşmektedir.
DeepSeek’in küresel pazarda token başına maliyetleri agresif bir şekilde kırabilmesinin ve OpenAI ile Anthropic gibi devlerin fiyat politikalarını baskılayabilmesinin arkasındaki asıl teknik motor MLA mimarisidir. Altyapı yatırımlarını kısıtlı bütçelerle yönetmek zorunda olan teknoloji şirketleri için DeepSeek modellerini şirket içi sunucularda barındırmak, donanım tedarik krizine karşı en güçlü alternatiftir.
Buna karşın yerel cihazlarda veya kenar donanımlarda tek kullanıcılı küçük modeller (1B-3B) çalıştıran bağımsız geliştiriciler için MLA büyük bir dönüşüm yaratmaz. Tekil isteklerde KV cache zaten birkaç megabaytı aşmadığından, MLA’nın getirdiği ek matris çarpımı genel gecikmeye az da olsa yük bindirebilir. Özetle MLA, veri merkezlerinde milyonlarca token işleyen ve sunucu amortismanını optimize etmek isteyen büyük ölçekli çıkarım platformları için vazgeçilmez bir mühendislik standardıdır.