Selamlar, Birden fazla eşzamanlı isteği (concurrent requests) yönetmek için PagedAttention mimarisi kullanan vLLM sunucusunu Docker üzerinde ayağa kaldırdık. Triton veya TGI (Text Generation Inference) ile kıyaslandığında özellikle `continuous batching` yeteneği sayesinde GPU kullanım oranını %40'lardan %90'lara çıkarabildik. Kurulumda yaşadığınız VRAM tahsisi (gpu_memory_utilization) veya context length (max_model_len) optimizasyonu sorunları varsa yardımcı olabilirim.
vLLM ve Docker ile düşük gecikmeli model sunucu altyapısı kurma
← Tüm tartışmalara dönYorumlar
1 yorum
test test
aynen
Yorum yapmak için giriş yapın veya üye olun.