13.07.2026 21:27
#1 (Konu Sahibi)
Yerel Donanımda Hangi Modeli Koşmalıyız? Qwen, Gemma ve SmolLM Karşılaştırması
Yerel çıkarım (local inference), gizlilik, düşük gecikme süresi ve maliyetsiz çalıştırma avantajları nedeniyle son dönemde büyük önem kazandı. Özellikle büyük dil modellerinin (LLM) yanında ortaya çıkan küçük dil modelleri (SLM), donanım gereksinimlerini asgariye indirerek ev tipi ekran kartlarında dahi yüksek performansla çalışabilmektedir. Bu incelememizde en popüler üç alternatifi ele alıyoruz: Qwen, Gemma ve SmolLM.
**Qwen (Alibaba):** Son dönemdeki 1.5B, 7B ve 14B parametreli modelleriyle açık kaynak dünyasında adeta fırtına estiriyor. Türkçe dil performansı şaşırtıcı derecede iyi olan Qwen, özellikle mantık yürütme, kod üretimi ve bağlamsal doğruluk testlerinde mükemmel sonuçlar vermektedir. 8GB VRAM'e sahip bir NVIDIA RTX 3060 veya RTX 4060 ekran kartında Qwen-2.5-7B-Instruct modelinin 4-bit kuantize edilmiş (GGUF) versiyonu saniyede 30+ token üretebilmektedir.
**Gemma (Google):** Google'ın açık kaynaklı Gemma-2 ailesi (özellikle 2B ve 9B modelleri), mimari yapısı gereği yüksek doğruluk oranlarına sahiptir. Gemma'nın Türkçe anlama kabiliyeti mükemmel olsa da, token üretim hızı Qwen'e kıyasla biraz daha hantal kalabilmektedir. Gemma-2-9B modelini yerelde tam performansla çalıştırmak için 12GB VRAM önerilmektedir. Ancak bağlamsal sadakat ve talimat takip etme (instruction following) konusunda şu an kendi sınıfının lideridir.
**SmolLM (Hugging Face):** Sadece 135M, 360M ve 1.7B parametre boyutlarında geliştirilen bu model grubu, mobil cihazlar ve çok eski donanımlar için özel olarak optimize edilmiştir. Akıllı telefonlarda veya Raspberry Pi gibi tek kartlı bilgisayarlarda yerel asistan çalıştırmak istiyorsanız SmolLM biçilmiş kaftandır. Doğal olarak karmaşık kod yazma veya ileri düzey mantık analizlerinde Qwen veya Gemma ile yarışamaz, ancak basit niyet analizi, metin sınıflandırma ve temel özetleme işlemlerinde saniyede 100+ token üreterek harikalar yaratmaktadır.
Sonuç olarak: Eğer 8GB-12GB arası VRAM'e sahipseniz, genel kullanım için Qwen-2.5-7B en dengeli seçenektir. Kod yazma ve karmaşık analizler için Gemma-2-9B'yi zorlamalısınız. 4GB altı donanım veya işlemci odaklı (CPU) çıkarımlar için ise SmolLM-1.7B en makul seçenektir.
**Qwen (Alibaba):** Son dönemdeki 1.5B, 7B ve 14B parametreli modelleriyle açık kaynak dünyasında adeta fırtına estiriyor. Türkçe dil performansı şaşırtıcı derecede iyi olan Qwen, özellikle mantık yürütme, kod üretimi ve bağlamsal doğruluk testlerinde mükemmel sonuçlar vermektedir. 8GB VRAM'e sahip bir NVIDIA RTX 3060 veya RTX 4060 ekran kartında Qwen-2.5-7B-Instruct modelinin 4-bit kuantize edilmiş (GGUF) versiyonu saniyede 30+ token üretebilmektedir.
**Gemma (Google):** Google'ın açık kaynaklı Gemma-2 ailesi (özellikle 2B ve 9B modelleri), mimari yapısı gereği yüksek doğruluk oranlarına sahiptir. Gemma'nın Türkçe anlama kabiliyeti mükemmel olsa da, token üretim hızı Qwen'e kıyasla biraz daha hantal kalabilmektedir. Gemma-2-9B modelini yerelde tam performansla çalıştırmak için 12GB VRAM önerilmektedir. Ancak bağlamsal sadakat ve talimat takip etme (instruction following) konusunda şu an kendi sınıfının lideridir.
**SmolLM (Hugging Face):** Sadece 135M, 360M ve 1.7B parametre boyutlarında geliştirilen bu model grubu, mobil cihazlar ve çok eski donanımlar için özel olarak optimize edilmiştir. Akıllı telefonlarda veya Raspberry Pi gibi tek kartlı bilgisayarlarda yerel asistan çalıştırmak istiyorsanız SmolLM biçilmiş kaftandır. Doğal olarak karmaşık kod yazma veya ileri düzey mantık analizlerinde Qwen veya Gemma ile yarışamaz, ancak basit niyet analizi, metin sınıflandırma ve temel özetleme işlemlerinde saniyede 100+ token üreterek harikalar yaratmaktadır.
Sonuç olarak: Eğer 8GB-12GB arası VRAM'e sahipseniz, genel kullanım için Qwen-2.5-7B en dengeli seçenektir. Kod yazma ve karmaşık analizler için Gemma-2-9B'yi zorlamalısınız. 4GB altı donanım veya işlemci odaklı (CPU) çıkarımlar için ise SmolLM-1.7B en makul seçenektir.