GitHub Radar — vLLM
İşletim sistemi sayfalandırmasını GPU HBM belleğine uyarlayan PagedAttention ve dinamik blok tablolarıyla LLM çıkarımında bellek israfını sıfırlayan motor.
vLLM, büyük dil modellerinin (LLM) üretim ortamlarında yüksek eşzamanlılıkla sunulması sırasında ortaya çıkan en kritik donanım darboğazı olan GPU yüksek bant genişlikli bellek (HBM) parçalanmasını işletim sistemlerinin sanal bellek sayfalandırma prensipleriyle çözen açık kaynaklı bir çıkarım (inference) motorudur 1. Geleneksel çıkarım kütüphanelerinin her istek için maksimum dizi uzunluğu kadar bitişik bellek rezerve ettiği, dahili ve harici parçalanma yüzünden pahalı GPU belleğinin %60 ila %80’ini atıl bıraktığı hantal mimarilere karşı vLLM; PagedAttention algoritması, kopyala-yaz (Copy-on-Write) önbellek paylaşımı ve sürekli yığınlama (continuous batching) mekanizmalarıyla sistem verimini 2 ila 4 kat artıran devrimci bir sistem altyapısıdır 2.
Yapay zeka altyapı mühendisliği ve küresel model sunum platformları dünyasında 93 bin yıldız ve son commit 1 saat önce düzeyinde endüstri standardı haline gelen depo, yüzlerce şirketin aktif katkısıyla yönetilen 2.5 bin açık issue ve kesintisiz sürümleme disiplinini kanıtlayan son sürüm v0.27.1 (Eylül 2026) metrikleriyle canlılığını korumaktadır.
Mimari Deep-Dive: vLLM
vLLM’in sistem mimarisine kazandırdığı en radikal atılım, klasik işletim sistemi tasarımında kırk yıldır kullanılan sanal bellek (virtual memory) ve dinamik sayfalandırma (paging) tekniğini doğrudan GPU’nun tensör hesaplama döngülerine entegre etmesidir. Transformer tabanlı modellerde üretim (autoregressive decoding) adımlarında üretilen her yeni belirteç (token) için anahtar ve değer tensörlerinin (Key-Value cache / KV cache) bellekte saklanması zorunludur. Geleneksel sistemler, isteklerin kaç belirteç üreteceğini önceden bilemediği için istek başına 2048 veya 4096 belirteçlik devasa ve bitişik (contiguous) GPU bellek blokları tahsis eder; bu durum belleğin büyük kısmının kullanılmadan rezerve kalmasına ve erken bellek yetersizliği (OOM) çökmelerine yol açar.
vLLM, bu yapısal problemi ortadan kaldırmak için PagedAttention algoritmasını geliştirmiştir 3. Bu mimari, KV önbelleğini sabit boyutlu fiziksel bloklara (örneğin 16 belirteçlik sayfalar) böler. İsteklerin mantıksal belirteç dizilimlerini fiziksel GPU belleğindeki dağınık bloklarla eşleştiren bir blok tablosu (block table) yönetilir 4. GPU üzerinde çalışan özel CUDA çekirdekleri (custom CUDA kernels), dikkat (attention) hesaplaması sırasında belleğin bitişik olmasını beklemez; blok tablosundaki işaretçileri takip ederek GPU HBM belleğinde dağınık duran bloklar üzerinden vektör çarpımlarını donanım hızında gerçekleştirir. Fiziksel bloklar yalnızca yeni belirteçler üretildikçe dinamik olarak tahsis edildiğinden, bellek parçalanması neredeyse sıfıra iner ve GPU bellek verimliliği %96’nın üzerine çıkar.
İkinci kritik sütun kopyala-yaz (Copy-on-Write - CoW) tabanlı bellek paylaşımıdır. Çoklu örnekleme (parallel sampling) veya ortak sistem istemi (prefix caching) kullanılan senaryolarda, ortak belirteçlerin KV önbellek blokları bellekte çoğaltılmaz; farklı istekler aynı fiziksel bellek bloklarına işaret eder. İsteklerden biri kendi özgün belirtecini ürettiğinde yalnızca değişen blok için yeni bir fiziksel sayfa tahsis edilir. Bu yaklaşım, karmaşık ajan iş akışlarında ve RAG mimarilerinde bellek tüketimini %55 oranında daha da aşağı çeker.
Üçüncü sütun ise sürekli yığınlamadır (continuous batching / iteration-level scheduling). İstek seviyesinde statik kuyruklar bekletmek yerine, her üretim adımında cevabı tamamlanan istekler GPU belleğinden derhal tahliye edilir ve yeni gelen istekler bekleyen iterasyon döngüsüne anında dahil edilir. Tensör çekirdekleri (Tensor Cores) hiçbir zaman boşta kalmaz ve donanım kullanım verimi maksimize edilir.
Kod ve Topluluk Sağlığı
vLLM, UC Berkeley Sky Computing Lab ve LMSYS ekibinden Woosuk Kwon ve Zhuohan Li liderliğinde başlatılmış olup günümüzde Red Hat, Anyscale, Google ve Nvidia gibi devlerin kıdemli sistem programcılarından oluşan küresel bir konsorsiyum tarafından yönetilmektedir 1. Proje, akademik bir araştırmanın hızla endüstriyel bir işletim katmanına dönüşmesinin en parlak açık kaynak örneğidir.
Depodaki 2.5 bin açık issue sayısı, projenin yüzlerce farklı model mimarisi (MoE, Dense, Multimodal) ve heterojen hızlandırıcı yongası (Nvidia Hopper, Blackwell, AMD ROCm, Intel Gaudi, AWS Neuron) ile entegre olmasından ileri gelmektedir. Çekirdek maintainer grubu, donanım satıcılarıyla kurulan özel çalışma grupları (SIG) üzerinden hata triyajını organize biçimde yürütmektedir. Depoya sunulan her PR; yüzlerce GPU düğümünde çalışan otomatik regresyon testlerinden, hassas doğruluk (perplexity/eval) kıyaslamalarından ve katı C++/Python linter denetimlerinden geçer 5. Sürümleme takvimi haftalık kararlı güncellemelerle mükemmel bir tempoda ilerlemektedir. health_score bu bölümden türer: issue kapanma hızı, sürüm düzeni, bakımcı ekibi. Ajanın tahminidir; künyede öyle yazılır. Projenin açık kaynak yapay zeka altyapısına yön veren konumu, kusursuz mimari dokümantasyonu ve devasa topluluk desteği dikkate alınarak health_score: 9.5 takdir edilmiştir.
Production Riski: Gerçekten Kullanılır mı?
vLLM’i üretim ortamlarına dahil etmeyi planlayan sistem mimarları için yasal ve lisanslama açısından hiçbir engel bulunmamaktadır; proje Apache 2.0 lisansı ile dağıtılmakta olup şirket içi sunucularda veya özel bulut ortamlarında tam kullanım özgürlüğü sunar 6.
vLLM’in üretimde tartışmasız hayat kurtardığı senaryolar oldukça açıktır: Kendi LLM modellerini barındıran şirketlerde GPU sunucu maliyetlerini doğrudan üçte bire indirmek, OpenAI uyumlu API uç noktalarıyla mevcut mikroservis mimarilerine sıfır sürtünmeyle bağlanmak ve yüzlerce eşzamanlı kullanıcının isteklerini düşük kuyruk gecikmesiyle karşılamak. Model ağırlıklarını ve KV önbelleğini dinamik yönetebilmesi operasyonel verimliliği zirveye taşır.
Buna karşın, dikkat edilmesi gereken ciddi operasyonel karmaşıklıklar mevcuttur. vLLM son derece karmaşık bir C++, CUDA ve Python yığını üzerine kuruludur; GPU sürücüleri, CUDA araç seti ve PyTorch sürümleri arasındaki küçük uyumsuzluklar derleme veya başlatma hatalarına yol açabilir. Ayrıca birden fazla GPU’ya dağıtık çıkarım (Tensor Parallelism) yapıldığında NCCL iletişim katmanındaki ağ darboğazları performansı düşürebilir. Doğru donanım ve sürücü yapılandırması sağlandığında vLLM, modern üretken yapay zeka altyapılarının tartışmasız en sağlam, en hızlı ve vazgeçilmez temel taşıdır.