17.07.2026 00:56
#1 (Konu Sahibi)
Kuantizasyon Nedir? Q4_K_M vs Q8_0 GGUF Modelleri Arasındaki Farklar
Hugging Face üzerinden model indirirken GGUF formatındaki dosyalarda Q4_K_M, Q5_K_M veya Q8_0 gibi uzantılar görüyoruz. Bu kuantizasyon (sayısal sıkıştırma) yöntemleri tam olarak ne anlama geliyor?
Q4 (4-bit) kuantize bir model ile Q8 (8-bit) veya FP16 tam model arasındaki doğruluk (perplexity) kaybı günlük kullanımda ne kadar hissedilir? VRAM tasarrufu yapmak adına Q4_K_M seçmek mantıklı mıdır, yoksa 8-bit altına düşmemeli miyiz?
Q4 (4-bit) kuantize bir model ile Q8 (8-bit) veya FP16 tam model arasındaki doğruluk (perplexity) kaybı günlük kullanımda ne kadar hissedilir? VRAM tasarrufu yapmak adına Q4_K_M seçmek mantıklı mıdır, yoksa 8-bit altına düşmemeli miyiz?