Makale Bülteni — CacheBlend
RAG sistemlerinde dinamik doküman sıralamalarına rağmen KV cache'in yüzde seksen beşini yeniden kullanarak TTFT süresini dörde katlayan çalışma.
Chicago Üniversitesi araştırmacılarının ACM EuroSys 2025 En İyi Makale Ödülü’ne layık görülen “CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion” başlıklı çalışması, kurumsal RAG mimarilerinin en can yakıcı hesaplama krizine doğrudan neşter vuruyor1. Pratikte bu araştırma, bir kullanıcı soru sorduğunda vektör veri tabanından çekilen onlarca farklı doküman parçasının (chunks) sırası veya kombinasyonu değişti diye, sistemin tüm önbelleği çöpe atıp her şeyi sıfırdan hesaplama saçmalığına son veriyor. Klasik önek önbelleklemenin (prefix caching) katı sıralama zorunluluğunu kırarak, bağımsız doküman parçalarının önceden hesaplanmış KV durumlarını çalışma anında birbirine kaynaştırıp ilk token gecikmesini dramatik biçimde düşürüyor.
Akademik iddianın ötesinde gerçek dünya çıkarım testlerine baktığımızda ortaya konan performans metrikleri oldukça iddialıdır. Makale, kurumsal RAG iş yüklerinde modelin anlamsal kalitesinden taviz vermeksizin 4,5 kata varan TTFT hızlanması ve %100’e yakın önbellek isabeti vadederken, bu ölçümler doğrudan kurumsal NVIDIA A100-80GB ve L40S GPU’lar üzerinde kanıtlanmış durumda. Açık kaynak kod tarafında ise lmcache/lmcache deposunda son commit 2 gün önce, 850 yıldız ve 32 açık issue ile vLLM motoruna tek satırla entegre olabilen aktif bir üretim kütüphanesi olarak geliştiricilerin hizmetine sunulmuş durumda2.
İddia ve Gerçeklik: CacheBlend
Vektör aramasıyla zenginleştirilmiş üretim (RAG) sistemlerinde, her sorgu için veri tabanından farklı doküman parçaları çekilir. Kullanıcı A için birinci parça ve ikinci parça birleştirilirken, Kullanıcı B için ikinci parça ve üçüncü parça çağrılır. vLLM veya SGLang gibi modern motorların kullandığı önek önbellekleme mekanizmaları, metin diziliminin token sıfırdan itibaren birebir aynı sırada gelmesini şart koşar. Eğer daha önce hesaplanmış bir doküman parçası istemin başında değil de ortasında yer alıyorsa ya da sıralaması değişmişse, dikkat (attention) mekanizmasının nedensel yapısı gereği önceki parçalarla çapraz etkileşimi eksik kalır. Bu nedenle geleneksel motorlar önbelleği tamamen çöpe atarak tüm istemi baştan hesaplamak (full prefill) zorunda kalır.
Önbelleği körü körüne yeniden kullanmak ise modelin önceki parçaları görmezden gelmesine ve ağır halüsinasyonlar üretmesine yol açar. CacheBlend makalesinin getirdiği ana matematiksel ve mimari keşif, birbirine eklenen doküman parçaları arasındaki çapraz dikkatin (cross-attention) katmanlar ve token’lar boyunca son derece seyrek (sparse) olduğudur. Yazarlar, yeni bir doküman zinciri oluşturulduğunda tüm istemi yeniden hesaplamak yerine, katmanlar bazında dikkat ağırlığı en yüksek kritik yüzde on beşlik token kümesini tespit edip yalnızca bu kısmı seçici olarak yeniden hesaplayan (selective recomputation) bir füzyon mekanizması geliştirdi. Geriye kalan yüzde seksen beşlik KV önbelleği doğrudan bellekten çekilir. Ancak bir sistem mimarı için madalyonun diğer yüzündeki altyapı bedelleri dikkatle incelenmelidir.
Seçici yeniden hesaplama yaklaşımı, birbirinden bağımsız bilgi parçalarını (farklı şirket raporları, bağımsız makaleler) birleştirirken kusursuz çalışır. Fakat birbirine mantıksal olarak sıkı sıkıya bağlı metinlerde, örneğin önceki parçadaki değişken tanımlarına doğrudan bağımlı kod bloklarında veya çok adımlı matematiksel ispatlarda, yüzde on beşlik yeniden hesaplama sınırı bağlamsal akışta küçük anlamsal sapmalara yol açabilmektedir.
Kod ve Entegrasyon Haritası
CacheBlend, akademik bir deney kodu olmanın ötesine geçerek Chicago Üniversitesi ve endüstri ortakları tarafından geliştirilen LMCache projesinin resmi bileşeni olarak açık kaynak dünyasına dahil edildi2. Kod tabanı incelendiğinde, vLLM motorunun altına tak-çalıştır bir KV önbellek katmanı olarak yerleşen, Python ve C++ ile optimize edilmiş son derece modüler bir mimari göze çarpmaktadır. Geliştiriciler vLLM boru hattına sadece LMCache kütüphanesini bağlayarak CacheBlend füzyon motorunu saniyeler içinde devreye alabilmektedir3.
Açık kaynak dünyasındaki benimsenme hızı oldukça yüksektir. LMCache ekibi, HuggingFace modelleri ve kurumsal RAG boru hatları için hazır şablonlar sunarak mühendislerin sıfırdan dikkat maskesi yazma zorunluluğunu ortadan kaldırmıştır. Ancak entegrasyon hattında sistem mühendislerinin yönetmesi gereken operasyonel karmaşıklıklar bulunmaktadır.
Hacker News ve GitHub tartışmalarında altyapı mühendisleri, seçici yeniden hesaplama maskelerinin katmanlar arasında dinamik olarak oluşturulmasının vLLM zamanlayıcısına küçük bir yazılım ek yükü bindirdiğinden bahsetmektedir. Ayrıca çok büyük doküman havuzlarında KV tensörlerinin yerel GPU belleği ile CPU RAM veya Redis benzeri harici önbellek katmanları arasında taşınması sırasında bellek takası (cache eviction) politikalarının dikkatle ayarlanması şarttır. Yine de RAG sistemlerinde prefix caching kısıtını kıran en olgun açık kaynak sistem CacheBlend’dir.
Ticari Etki: Kimin İşine Yarar?
CacheBlend teknolojisi, yüz binlerce şirket içi dokümanı vektör veri tabanında tutan kurumsal arama platformları, müşteri destek botları ve hukuki mevzuat tarama yazılımları geliştiren SaaS girişimleri için doğrudan bir kâr marjı kurtarıcısıdır. Kullanıcıların soruları değiştikçe farklı doküman kombinasyonları çağıran RAG boru hatlarında, her seferinde saniyeler süren ağır prefill faturası ödemek yerine anında yanıt dönebilmek, kullanıcı deneyimini doğrudan dönüştürür. İlk token gecikmesini (TTFT) dörtte bire indirmek, aynı GPU sunucusu üzerinde üç kat daha fazla eşzamanlı sorgu karşılayabilmek anlamına gelir.
Aynı zamanda bulut maliyetlerini kısmaya çalışan teknoloji ekipleri için CacheBlend, donanım satın alma ihtiyacını (CapEx) radikal biçimde öteler. Dokuzyüz milisaniye süren bir doküman ön işlemesini iki yüz milisaniyeye çekmek, pahalı A100 kümeleri yerine L40S gibi daha ekonomik kartlarla kurumsal hizmet seviyesi anlaşmalarını (SLA) tutturmayı mümkün kılar.
Buna karşın RAG kullanmayan, yalnızca tekil ve statik sistem istemleriyle çalışan basit sohbet botları için CacheBlend devreye almak anlamsız bir mimari katman ekleyecektir. Statik öneklerin olduğu senaryolarda vLLM’in standart prefix caching mekanizması zaten fazlasıyla yeterlidir. Özetle CacheBlend, dinamik doküman parçalarını sürekli harmanlayan ve RAG sunucu faturalarını rasyonelleştirmek isteyen tüm kurumsal sistem mimarları için günümüzün en etkili önbellek füzyon silahıdır.