17.07.2026 01:00
#1 (Konu Sahibi)
Hugging Face Modellerini Ollama Formatına Dönüştürme ve Modelfile Yazma Rehberi
Yapay zeka teknolojilerinin hızla gelişmesiyle birlikte, **Hugging Face Modellerini Ollama Formatına Dönüştürme ve Modelfile Yazma Rehberi** konusu geliştiriciler ve sistem yöneticileri arasında en çok konuşulan konulardan biri haline gelmiştir. Özellikle açık kaynak kodlu büyük dil modellerinin (LLM) ve küçük dil modellerinin (SLM) yerel donanımlarda çalıştırılabilmesi, veri gizliliği, sıfır gecikme süresi ve bulut maliyetlerini ortadan kaldırma açısından devrim niteliğinde bir adım olarak kabul edilmektedir.
Yerel yapay zeka çıkarımı (local inference) yaparken karşılaşılan en büyük zorluk donanım darboğazlarıdır. Özellikle Llama 3, Qwen 2.5 ve Gemma 2 gibi modern modellerin çalışabilmesi için ekran kartı bellek kapasitesi (VRAM) ve sistem bellek hızı kritik derecede önemlidir. Kuantizasyon (sayısal sıkıştırma) teknikleri, 16-bit veya 32-bit hassasiyetteki model ağırlıklarını 4-bit (Q4_K_M) veya 8-bit (Q8_0) seviyesine indirerek modelin belleğe sığmasını sağlar. Bu süreç, minimum doğruluk kaybıyla çok daha az VRAM harcanmasına imkan tanır.
### Yerel LLM Yapılandırmasında Temel Parametreler ve Modelfile Ayarları
Yerel modellerin davranışlarını ve yanıt kalitesini kontrol etmek için Ollama veya LLaMA.cpp üzerinde kullanılan parametrelerin doğru seçilmesi gerekir:
- **Temperature (Sıcaklık):** Modelin üreteceği yanıtların yaratıcılığını kontrol eder. Kodlama için 0.0 - 0.2 arası, genel sohbet için 0.7 - 0.9 arası tercih edilir.
- **Top-K ve Top-P:** Yanıt üretirken dikkate alınacak en olası kelimelerin kümülatif olasılığını ve sayısını belirler. Genelde Top-P 0.9, Top-K ise 40 olarak ayarlanır.
- **Context Window (Bağlam Penceresi):** Modelin hafızasında tutabileceği maksimum token sayısıdır. Günümüzde yerel modeller 8k ile 128k arasında bağlam penceresi desteklemektedir.
Ollama üzerinde kendi özelleştirilmiş modelinizi çalıştırmak için yazmanız gereken örnek `Modelfile` yapısı şu şekildedir:
```dockerfile
FROM ./llama-3-8b-instruct.Q4_K_M.gguf
TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>
{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>
{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>
{{ .Response }}<|eot_id|>"""
PARAMETER num_predict 2048
PARAMETER temperature 0.2
PARAMETER stop "<|start_header_id|>"
PARAMETER stop "<|end_header_id|>"
PARAMETER stop "<|eot_id|>"
SYSTEM """Sen, ev.gen.tr topluluğu için geliştirilmiş yerel bir yapay zeka asistanısın. Sorulara teknik, net ve Türkçe yanıtlar vermelisin."""
```
### Yerel Çıkarım Kurulumu ve Optimizasyon Adımları
1. **Model Seçimi:** Donanımınıza uygun modeli seçin. 8GB VRAM için 7B-8B GGUF modelleri idealdir.
2. **Kuantizasyon Tercihi:** Hız ve doğruluk dengesi için her zaman Q4_K_M (4-bit Medium) sürümünü indirin.
3. **Servis Kurulumu:** Ollama veya LM Studio yükleyicisini kurarak yerel API sunucusunu (`http://localhost:11434`) ayağa kaldırın.
4. **Parametre Optimizasyonu:** Kullanım amacınıza göre (kod yazma, yaratıcı yazarlık vb.) temperature ve system prompt değerlerinizi optimize edin.
Sonuç olarak, yerel donanımda yapay zeka modelleri çalıştırmak sadece bir hobi değil, gelecekteki bağımsız ve özel web ekosistemlerinin temel yapı taşıdır. Kuantizasyon teknikleri ve Ollama gibi araçlar sayesinde, evimizdeki bilgisayarları birer yapay zeka sunucusuna dönüştürmek artık çok daha kolay ve erişilebilir. Bu alandaki gelişmeleri ev.gen.tr olarak yakından takip etmeye devam edeceğiz.
Yerel yapay zeka çıkarımı (local inference) yaparken karşılaşılan en büyük zorluk donanım darboğazlarıdır. Özellikle Llama 3, Qwen 2.5 ve Gemma 2 gibi modern modellerin çalışabilmesi için ekran kartı bellek kapasitesi (VRAM) ve sistem bellek hızı kritik derecede önemlidir. Kuantizasyon (sayısal sıkıştırma) teknikleri, 16-bit veya 32-bit hassasiyetteki model ağırlıklarını 4-bit (Q4_K_M) veya 8-bit (Q8_0) seviyesine indirerek modelin belleğe sığmasını sağlar. Bu süreç, minimum doğruluk kaybıyla çok daha az VRAM harcanmasına imkan tanır.
### Yerel LLM Yapılandırmasında Temel Parametreler ve Modelfile Ayarları
Yerel modellerin davranışlarını ve yanıt kalitesini kontrol etmek için Ollama veya LLaMA.cpp üzerinde kullanılan parametrelerin doğru seçilmesi gerekir:
- **Temperature (Sıcaklık):** Modelin üreteceği yanıtların yaratıcılığını kontrol eder. Kodlama için 0.0 - 0.2 arası, genel sohbet için 0.7 - 0.9 arası tercih edilir.
- **Top-K ve Top-P:** Yanıt üretirken dikkate alınacak en olası kelimelerin kümülatif olasılığını ve sayısını belirler. Genelde Top-P 0.9, Top-K ise 40 olarak ayarlanır.
- **Context Window (Bağlam Penceresi):** Modelin hafızasında tutabileceği maksimum token sayısıdır. Günümüzde yerel modeller 8k ile 128k arasında bağlam penceresi desteklemektedir.
Ollama üzerinde kendi özelleştirilmiş modelinizi çalıştırmak için yazmanız gereken örnek `Modelfile` yapısı şu şekildedir:
```dockerfile
FROM ./llama-3-8b-instruct.Q4_K_M.gguf
TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>
{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>
{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>
{{ .Response }}<|eot_id|>"""
PARAMETER num_predict 2048
PARAMETER temperature 0.2
PARAMETER stop "<|start_header_id|>"
PARAMETER stop "<|end_header_id|>"
PARAMETER stop "<|eot_id|>"
SYSTEM """Sen, ev.gen.tr topluluğu için geliştirilmiş yerel bir yapay zeka asistanısın. Sorulara teknik, net ve Türkçe yanıtlar vermelisin."""
```
### Yerel Çıkarım Kurulumu ve Optimizasyon Adımları
1. **Model Seçimi:** Donanımınıza uygun modeli seçin. 8GB VRAM için 7B-8B GGUF modelleri idealdir.
2. **Kuantizasyon Tercihi:** Hız ve doğruluk dengesi için her zaman Q4_K_M (4-bit Medium) sürümünü indirin.
3. **Servis Kurulumu:** Ollama veya LM Studio yükleyicisini kurarak yerel API sunucusunu (`http://localhost:11434`) ayağa kaldırın.
4. **Parametre Optimizasyonu:** Kullanım amacınıza göre (kod yazma, yaratıcı yazarlık vb.) temperature ve system prompt değerlerinizi optimize edin.
Sonuç olarak, yerel donanımda yapay zeka modelleri çalıştırmak sadece bir hobi değil, gelecekteki bağımsız ve özel web ekosistemlerinin temel yapı taşıdır. Kuantizasyon teknikleri ve Ollama gibi araçlar sayesinde, evimizdeki bilgisayarları birer yapay zeka sunucusuna dönüştürmek artık çok daha kolay ve erişilebilir. Bu alandaki gelişmeleri ev.gen.tr olarak yakından takip etmeye devam edeceğiz.