RadarMakale Bülteniai üretimi

Makale Bülteni — SGLang ve RadixAttention

Radix trie tabanlı dinamik KV cache yönetimiyle çok turlu ve yapısal LLM üretiminde gecikmeyi ve VRAM israfını minimize eden çalışma.

Lianmin Zheng ve UC Berkeley LMSYS ekibinin kaleme aldığı “SGLang: Efficient Execution of Structured Language Model Programs” başlıklı akademik makale, büyük dil modellerinin üretim ortamındaki en can yakıcı darboğazına, yani KV cache israfına doğrudan neşter vuruyor1. Pratikte bu çalışma, her API çağrısında veya agent döngüsünde aynı sistem prompt’larını, araç şemalarını ve sohbet geçmişini GPU belleğinde sıfırdan hesaplama saçmalığına son vermek anlamına geliyor. vLLM’in PagedAttention ile bellek parçalanmasını çözdüğü noktada, SGLang meseleyi bir adım öteye taşıyarak önbellek bloklarını dinamik bir ağaç yapısında tutuyor ve geçmiş hesaplamaları neredeyse sıfır ek maliyetle yeniden kullanıma sokuyor.

Laboratuvar iddialarının ötesinde üretim ortamına yansıyan bilançoya baktığımızda tablo gayet somut. Çalışmanın resmi testlerinde yapısal üretim senaryolarında 5 kata kadar throughput artışı, kurumsal donanım standardı olan 8×H100 sunucularda ölçümlenmiş durumda. Açık kaynak reposunda ise son commit 2 gün önce, 895 açık issue ile canlı ve agresif bir geliştirici temposu korunuyor2.

İddia ve Gerçeklik: SGLang ve RadixAttention

Klasik çıkarım (inference) motorları gelen her sorguyu doğrusal bir metin dizisi olarak ele alır. Kullanıcı her mesaj attığında veya bir yapay zeka ajanı ardışık araç çağrısı yaptığında, sistem prompt’u ve önceki mesajlar tekrar prefill aşamasından geçer. vLLM bu sorunu bellek sayfalamasıyla hafifletse de oturumlar arası veya dallanan sorgulardaki ortak önekleri (prefix) otomatik olarak tespit edip paylaşma konusunda hantal kalıyordu. SGLang makalesinin temel mimari tezi, KV cache sayfalarını doğrusal listeler yerine bir Radix Trie (sıkıştırılmış önek ağacı) veri yapısı üzerinde yönetmektir.

RadixAttention algoritmasında her GPU bellek bloğu ağaçta bir düğüme karşılık gelir. Yeni bir istek geldiğinde sistem ağaç üzerinde en uzun ortak önek eşleşmesini arar ve eşleşen düğümlerin KV tensörlerini yeniden hesaplamadan anında decode adımına bağlar. Bellek dolduğunda ise klasik işletim sistemi mantığıyla en az kullanılan (LRU) yaprak düğümler GPU’dan boşaltılır. Kağıt üzerinde bu mimari şahane görünse de gerçek dünyadaki bedeli CPU üzerindeki ağaç yönetim yüküdür. Aşırı dallanan ve kısa ömürlü milyonlarca sorguda Radix ağacının kilit mekanizmaları ile bellek havuzu senkronizasyonu Python çalışma zamanında bir darboğaza dönüşme potansiyeli taşır.

Geliştirici ekibin bu maliyeti dengelemek adına bellek yönetimini C++ ve optimize edilmiş CUDA çekirdeklerine devretmesi, teorik iddia ile pratik performans arasındaki uçurumu kapatmıştır. Ancak gerçek dünyada cache hit oranınız doğrudan trafik modelinize bağlıdır. Rastgele ve birbiriyle alakasız sorgulardan oluşan heterojen bir trafikte RadixAttention belirgin bir getiri sağlamazken, sabit sistem prompt’ları içeren kurumsal sohbet botlarında ve agentik yapılarda sunucu maliyetlerini radikal biçimde aşağı çekmektedir.

Kod ve Entegrasyon Haritası

Birçok akademik makalenin aksine SGLang, tozlu bir araştırma reposu olarak kalmadı; doğrudan kurumsal üretime aday yüksek başarımlı bir çıkarım sunucusuna dönüştü. Resmi GitHub deposu olan sgl-project/sglang, modüler Python mimarisini arka planda FlashInfer, FlashAttention ve özel Triton çekirdekleriyle destekliyor2. Kod tabanı incelendiğinde, vLLM’in erken dönemindeki mimari dağınıklığın aksine çalışma zamanı (runtime) ile üst seviye programlama arayüzünün temiz bir şekilde ayrıştırıldığı görülüyor.

Projenin üretim olgunluğunu gösteren en kritik göstergelerden biri açık kaynak ekosistemindeki derin entegrasyonudur. SGLang bugün vLLM ve TensorRT-LLM ile birlikte büyük ölçekli model sunumunda en çok tercih edilen üç motordan biri haline gelmiştir. RunPod ve LMSYS gibi altyapı sağlayıcıları Chatbot Arena trafiğinin önemli bir bölümünü SGLang kümleri üzerinde barındırmaktadır3. Ayrıca HuggingFace TGI ekibinin de benzer prefix caching stratejilerini kendi yol haritalarına dahil etmesi, makaledeki mimari kararın sektör standardına dönüştüğünün en somut kanıtıdır.

Buna karşın bağımlılık zinciri oldukça ağırdır ve altyapı mühendisleri için bakım maliyeti yaratır. PyTorch, CUDA ve FlashInfer sürümleri arasındaki hassas uyumluluk gereksinimi, özel Docker imajları olmadan orkestrasyonu zorlaştırmaktadır. Yakın dönemde raporlanan ve şablon işleme katmanındaki uzaktan kod çalıştırma risklerine işaret eden güvenlik bültenleri (CVE-2026-5760), projenin hızlı büyüme sancılarını ve kurumsal ağlarda API uç noktalarının dikkatle izole edilmesi gerektiğini hatırlatmaktadır4.

Ticari Etki: Kimin İşine Yarar?

SGLang ve getirdiği RadixAttention yaklaşımı, özellikle çok turlu konuşmalar ve yoğun JSON/şema kısıtlı çıktılar üreten yapay zeka girişimleri için doğrudan sunucu faturasını yarıya indirme potansiyeli sunar. Müşteri destek botları, kod asistanları ve RAG mimarileri çalıştıran ekiplerde prefill hesaplama maliyeti genel GPU faturasının yüzde altmışından fazlasını oluşturur. Önbellek isabet oranının yüksek olduğu bu senaryolarda aynı GPU kümesinde karşılanan eşzamanlı istek sayısı neredeyse ikiye katlanır.

Bu teknolojinin doğrudan fayda sağladığı bir diğer kesim ise agentik iş akışları tasarlayan platformlardır. Bir ajanın adım adım düşünme zincirinde (Chain-of-Thought) her adımda tüm geçmişi modele tekrar beslemek astronomik VRAM ve hesaplama maliyeti doğurur. RadixAttention sayesinde ara adımların KV cache’i GPU belleğinde hazır tutulduğundan, ilk token gecikmesi (TTFT) hissedilmeyecek seviyelere geriler. Bu durum, saniye başına yüzlerce ara çağrı yapan otonom yazılım ajanlarının ekonomik olarak sürdürülebilir hale gelmesini sağlar.

Buna karşılık tekil, kısa ve birbirinden bağımsız sorgular alan arama motoru benzeri servisler için SGLang’e geçmek büyük bir operasyonel avantaj yaratmaz. Karmaşık bellek yönetimi ve ağır altyapı bağımlılıkları, küçük çaplı ekipler için fazladan operasyonel yük anlamına gelecektir. Özetle SGLang, prompt paylaşımının ve bağlam sürekliliğinin yüksek olduğu kurumsal iş yüklerinde GPU maliyetlerini optimize etmek isteyen mühendislik ekipleri için vazgeçilmez bir üretim silahıdır.

Kaynaklar

  1. SGLang: Efficient Execution of Structured Language Model Programs — arXiv
  2. SGLang GitHub Repository — sgl-project
  3. SGLang vs vLLM: Multi-Turn Chat and KV Cache Reuse — RunPod Blog
  4. SGLang SSTI Security Analysis and Advisory — Cloud Security Alliance