Makale Bülteni — Prompt Cache
Tekrarlayan istem bileşenlerini modüler dikkat blokları halinde önbelleğe alarak ilk token gecikmesini onda bire indiren çalışma.
Yale Üniversitesi araştırmacılarının MLSys 2024’te yayımladığı “Prompt Cache: Modular Attention Reuse for Low-Latency Inference” başlıklı akademik makale, kurumsal yapay zeka operasyonlarındaki en aptalca hesaplama israfına doğrudan neşter vuruyor1. Pratikte bu çalışma, her kullanıcı istek gönderdiğinde sistem prompt’unu, API şemalarını, onlarca sayfalık PDF dokümanlarını veya RAG bağlamını GPU tensör çekirdeklerinde tekrar tekrar sıfırdan hesaplama mecburiyetini ortadan kaldırıyor. Sabit metin bloklarını bağımsız modüller halinde bir kez işleyip önbelleğe alma ve gelen yeni kullanıcı sorularına bu önbelleği dikişsiz ekleme mekanizmasıyla, büyük dil modellerinde ilk kelimenin ekrana düşme süresini saniyelerden milisaniyelere indiriyor.
Akademik teorinin ötesinde üretim ortamındaki benchmark tablolarına baktığımızda ortaya çıkan performans sıçraması son derece somuttur. Makale, üç bin token’lık kurumsal istemlerde model kalitesinden hiçbir ödün vermeksizin TTFT süresinde 10 kata varan hızlanma ve 900 ms’den 90 ms’ye düşüş vadederken, bu ölçümler doğrudan kurumsal NVIDIA A100-80GB ve RTX 3090 GPU’lar üzerinde kanıtlanmış durumda. Açık kaynak kod tarafında ise yale-sys/prompt-cache resmi deposunda son commit 6 ay önce, MLSys 2024 teyitli ve 12 açık issue ile Anthropic, OpenAI ve vLLM’in bugün standart olarak sunduğu prompt caching özelliklerinin kurucu mimari temeli yer alıyor2.
İddia ve Gerçeklik: Prompt Cache
Geleneksel Transformer modellerinde dikkat mekanizması, girdi metnindeki her token’ın konumunu mutlak veya göreli konumsal gömmelerle (RoPE gibi) kodlar. Bu durum, aynı sistem prompt’u veya belge farklı bir yerde geçtiğinde ya da başka metinlerle birleştirildiğinde tüm KV tensörlerinin matematiksel olarak değişmesine yol açar. Klasik önek önbellekleme (prefix caching) yöntemleri yalnızca token sıfırdan başlayan tamamen birebir aynı öneklerde çalışırken, gerçek dünyadaki istemler modülerdir; kullanıcılar dokümanları, şablonları ve sistem talimatlarını farklı sıralarda bir araya getirir. Prompt Cache makalesinin getirdiği ana sistem tezi, istemleri bağımsız “Prompt Modülleri” halinde ayrıştırmaktır.
Sistem, sık kullanılan metin parçalarını önceden profiller, bağımsız bir modül kimliğiyle KV tensörlerini belleğe alır ve dikkat hesaplamasını konumsal bağımsızlıktan arındıracak bir serileştirme düzenine sokar. Yeni bir kullanıcı sorgusu geldiğinde, GPU daha önce işlenmiş modüllerin önbellek bloklarını bir araya getirir (stitching) ve sadece kullanıcının eklediği yeni birkaç kelime için prefill hesaplaması yapar. Böylece üç bin token’lık bir girdinin iki bin sekiz yüz token’ı anında önbellekten çekilir ve GPU hesaplama süresi neredeyse sıfırlanır. Tekrarlayan bloklar için tensör çekirdekleri boş yere terlemez. Ancak bir sistem mimarı için madalyonun diğer yüzündeki altyapı bedelleri dikkatle incelenmelidir.
Prompt Cache sihirli bir kara kutu değildir; geliştiricilerin istemlerini önceden tanımlanmış katı bir şema (Prompt Schema) disipliniyle yazmasını şart koşar. Serbest biçimli, dinamik olarak değişen değişkenlerin metin arasına serpiştirildiği dağınık istemlerde modüler ayrıştırma çöker. Dahası çok sayıda farklı modül GPU belleğine alındığında VRAM üzerinde ciddi bir tahsis baskısı oluşur; önbellek isabet oranı (cache hit rate) düştüğünde modülleri birleştirme ve bellek transferi ek yükü standart prefill’den daha yavaş kalabilmektedir.
Kod ve Entegrasyon Haritası
Prompt Cache, Yale Üniversitesi ekibi tarafından MLSys 2024 konferansında tam tekrarlanabilir açık kaynak bir sistem kütüphanesi olarak yayımlandı2. Kod tabanı incelendiğinde, HuggingFace LLaMA modellerini modüler dikkat bloklarına bölen özel dikkat maskesi yöneticileri ve Slurm tabanlı küme değerlendirme betikleri göze çarpmaktadır. Yazarların sunduğu mimari, Anthropic’in 2024 sonunda devreye aldığı Prompt Caching API’sinin ve vLLM v0.4+ sürümündeki otomatik prefix caching motorunun doğrudan ilham kaynağı olmuştur1.
Açık kaynak dünyasında projenin benimsenebilirliği oldukça yüksektir. Bugün vLLM ve SGLang gibi lider çıkarım motorları, Prompt Cache’in teorize ettiği bellek bloklarını paylaşma mantığını RadixAttention ve PagedAttention ile birleştirerek varsayılan özellik haline getirmiştir. Ancak bağımsız depoyu ham haliyle kendi altyapısına kurmak isteyen mühendisler için bazı bakım zorlukları bulunmaktadır. Kod tabanının en güncel CUDA kütüphaneleriyle senkronize edilmesi ek entegrasyon çalışması gerektirir.
Hacker News ve GitHub tartışmalarında geliştiriciler, orijinal deponun en güncel vLLM sürümleriyle geriye dönük uyumluluk güncellemelerinin yavaşlamasından ve özel RoPE hizalamalarında yaşanan küçük hassasiyet kayıplarından bahsetmektedir. Yine de modüler önbellek mimarisi olarak Prompt Cache, endüstrideki tüm modern LLM API sağlayıcılarının bugün uyguladığı fiili önbellekleme standardının akademik patentidir.
Ticari Etki: Kimin İşine Yarar?
Prompt Cache teknolojisi, özellikle uzun sistem prompt’ları ve detaylı JSON araç şemaları çalıştıran otonom yapay zeka ajanları, şirket içi dokümanlarla çalışan kurumsal RAG platformları ve müşteri destek botları için doğrudan bir kâr marjı patlamasıdır. Her kullanıcı çağrısında aynı yüz binlerce token’lık bilgi tabanını tekrar hesaplamaktan kurtulmak, ilk token gecikmesini (TTFT) onda bire indirirken GPU sunucularının eşzamanlı hizmet kapasitesini iki katına çıkarır.
Aynı zamanda bulut sağlayıcıları için Prompt Cache, token başına fiyatlandırmada yüzde elli ile yetmiş arasında indirimli önbellek tarifeleri (cached tokens) sunabilmenin ve OpenAI ile Anthropic gibi devlerle rekabet edebilmenin yegane teknik temelidir. Aynı donanım üzerinden iki kat daha fazla fatura kesebilmek, altyapı amortismanını radikal biçimde hızlandırır. Donanım maliyetleri doğrudan rasyonelleşir.
Buna karşın her gelen isteğin tamamen rastgele, tekil ve modüler tekrardan uzak olduğu genel arama motorları için Prompt Cache büyük bir finansal getiri sağlamaz. Önbellek isabetinin olmadığı senaryolarda şema orkestrasyonu fazladan mühendislik mesaisi anlamına gelecektir. Özetle Prompt Cache, yapılandırılmış kurumsal iş akışlarında gereksiz GPU prefill faturasını sıfırlamak ve kullanıcıya anlık yanıt vermek isteyen tüm ileri seviye sistem mimarları için vazgeçilmez bir altyapı silahıdır.