Topluluk

1 tartışma

vLLM ve Docker ile düşük gecikmeli model sunucu altyapısı kurma

Selamlar, Birden fazla eşzamanlı isteği (concurrent requests) yönetmek için PagedAttention mimarisi kullanan vLLM sunucusunu Docker üzerinde ayağa kaldırdık. Triton veya TGI (Text Generat...

@mertkan · Altyapı · 1 yorum · 2026-08-28 19:04:56