Çözüm Mimarisi
10 bülten
İlk birkaç token'ın dikkat yutağı rolünü keşfederek sabit KV cache ile 4 milyon token boyunca kesintisiz metin akışı sağlayan çalışma.
İşletim sistemi sayfalandırmasını GPU HBM belleğine uyarlayan PagedAttention ve dinamik blok tablolarıyla LLM çıkarımında bellek israfını sıfırlayan motor.
Dikkat başlıklarını arama ve akış olarak ayrıştırıp KV cache boyutunu yüzde yetmiş azaltarak tek GPU'da milyonluk bağlamı çözdüren çalışma.
Seçici durum uzayı modeli (SSM) ve donanım farkındalıklı çekirdekle KV cache yükünü sıfırlayan, doğrusal zamanlı dizi mimarisi analizi.
Model ağırlıklarını büyüklük ve yön olarak ayrıştırıp LoRA'nın kapasite tavanını kıran ve tam ince ayar başarımı sunan adaptasyon analizi.
Bağlam dizisini GPU halkasında P2P aktararak bellek sınırını kıran ve milyon token seviyesinde çıkarımı mümkün kılan dağıtık mimari analizi.
Taban model ağırlıklarını dondurup düşük dereceli matrislerle parametreleri on bin kat küçülterek çok kiracılı LLM adaptasyonunu başlatan çalışma.
Spekülatif örneklemeyi kelime seviyesinden gizil öznitelik uzayına taşıyarak token üretim hızını üç katına çıkaran algoritma analizi.
Düşük dereceli ortak sıkıştırmayla (MLA) KV cache boyutunu yüzde doksanın üzerinde budayan ve çıkarım ekonomisini kökten değiştiren mimari analiz.
Finansal muhasebe ve transfer operasyonları için sıfır dinamik bellek tahsisi ve io_uring mimarisi üzerine kurulu deterministik OLTP veritabanı.