Forum » 🤖 Yapay Zeka & Yerel Modeller (LLM / SLM) » Hugging Face Modellerini Ollama Formatına Dönüştürme ve Modelfile Yazma Rehberi
17.07.2026 01:00
#1 (Konu Sahibi)

Hugging Face Modellerini Ollama Formatına Dönüştürme ve Modelfile Yazma Rehberi

Yapay zeka teknolojilerinin hızla gelişmesiyle birlikte, **Hugging Face Modellerini Ollama Formatına Dönüştürme ve Modelfile Yazma Rehberi** konusu geliştiriciler ve sistem yöneticileri arasında en çok konuşulan konulardan biri haline gelmiştir. Özellikle açık kaynak kodlu büyük dil modellerinin (LLM) ve küçük dil modellerinin (SLM) yerel donanımlarda çalıştırılabilmesi, veri gizliliği, sıfır gecikme süresi ve bulut maliyetlerini ortadan kaldırma açısından devrim niteliğinde bir adım olarak kabul edilmektedir.

Yerel yapay zeka çıkarımı (local inference) yaparken karşılaşılan en büyük zorluk donanım darboğazlarıdır. Özellikle Llama 3, Qwen 2.5 ve Gemma 2 gibi modern modellerin çalışabilmesi için ekran kartı bellek kapasitesi (VRAM) ve sistem bellek hızı kritik derecede önemlidir. Kuantizasyon (sayısal sıkıştırma) teknikleri, 16-bit veya 32-bit hassasiyetteki model ağırlıklarını 4-bit (Q4_K_M) veya 8-bit (Q8_0) seviyesine indirerek modelin belleğe sığmasını sağlar. Bu süreç, minimum doğruluk kaybıyla çok daha az VRAM harcanmasına imkan tanır.

### Yerel LLM Yapılandırmasında Temel Parametreler ve Modelfile Ayarları
Yerel modellerin davranışlarını ve yanıt kalitesini kontrol etmek için Ollama veya LLaMA.cpp üzerinde kullanılan parametrelerin doğru seçilmesi gerekir:
- **Temperature (Sıcaklık):** Modelin üreteceği yanıtların yaratıcılığını kontrol eder. Kodlama için 0.0 - 0.2 arası, genel sohbet için 0.7 - 0.9 arası tercih edilir.
- **Top-K ve Top-P:** Yanıt üretirken dikkate alınacak en olası kelimelerin kümülatif olasılığını ve sayısını belirler. Genelde Top-P 0.9, Top-K ise 40 olarak ayarlanır.
- **Context Window (Bağlam Penceresi):** Modelin hafızasında tutabileceği maksimum token sayısıdır. Günümüzde yerel modeller 8k ile 128k arasında bağlam penceresi desteklemektedir.

Ollama üzerinde kendi özelleştirilmiş modelinizi çalıştırmak için yazmanız gereken örnek `Modelfile` yapısı şu şekildedir:
```dockerfile
FROM ./llama-3-8b-instruct.Q4_K_M.gguf
TEMPLATE """{{ if .System }}<|start_header_id|>system<|end_header_id|>

{{ .System }}<|eot_id|>{{ end }}{{ if .Prompt }}<|start_header_id|>user<|end_header_id|>

{{ .Prompt }}<|eot_id|>{{ end }}<|start_header_id|>assistant<|end_header_id|>

{{ .Response }}<|eot_id|>"""
PARAMETER num_predict 2048
PARAMETER temperature 0.2
PARAMETER stop "<|start_header_id|>"
PARAMETER stop "<|end_header_id|>"
PARAMETER stop "<|eot_id|>"
SYSTEM """Sen, ev.gen.tr topluluğu için geliştirilmiş yerel bir yapay zeka asistanısın. Sorulara teknik, net ve Türkçe yanıtlar vermelisin."""
```

### Yerel Çıkarım Kurulumu ve Optimizasyon Adımları
1. **Model Seçimi:** Donanımınıza uygun modeli seçin. 8GB VRAM için 7B-8B GGUF modelleri idealdir.
2. **Kuantizasyon Tercihi:** Hız ve doğruluk dengesi için her zaman Q4_K_M (4-bit Medium) sürümünü indirin.
3. **Servis Kurulumu:** Ollama veya LM Studio yükleyicisini kurarak yerel API sunucusunu (`http://localhost:11434`) ayağa kaldırın.
4. **Parametre Optimizasyonu:** Kullanım amacınıza göre (kod yazma, yaratıcı yazarlık vb.) temperature ve system prompt değerlerinizi optimize edin.

Sonuç olarak, yerel donanımda yapay zeka modelleri çalıştırmak sadece bir hobi değil, gelecekteki bağımsız ve özel web ekosistemlerinin temel yapı taşıdır. Kuantizasyon teknikleri ve Ollama gibi araçlar sayesinde, evimizdeki bilgisayarları birer yapay zeka sunucusuna dönüştürmek artık çok daha kolay ve erişilebilir. Bu alandaki gelişmeleri ev.gen.tr olarak yakından takip etmeye devam edeceğiz.
01.07.2026 06:40
#2
Benzer bir sistemi off-grid solar panel ile denedim. 100W panel ve 12V akü ile mini PC çalıştırıyorum, sıfır maliyetle yerel çıkarım yapıyorum!
02.07.2026 00:10
#3
Continue.dev eklentisi VS Code ile mükemmel entegre oluyor. Local Ollama ve Qwen-Coder ile kod yazmak artık hem bedava hem çok konforlu.
02.07.2026 09:35
#4
Ben de local RAG üzerinde çalışıyorum. ChromaDB yerine bazen FAISS de oldukça kullanışlı olabiliyor, alternatif olarak bakabilirsiniz.
02.07.2026 11:15
#5
Kuantize modellerde Q4_K_M bence doğruluk kaybı ve hız dengesi açısından en ideali. Q8 ile aralarında hissedilir bir fark yok.
02.07.2026 12:55
#6
Bu toplulukta paylaşılan teknik bilgilerin derinliği çok yüksek. Emeği geçen herkese çok teşekkürler.
02.07.2026 17:30
#7
Docker üzerinde yerel dil modellerini ayağa kaldırmak taşınabilirlik ve sunucu yönetimi açısından çok pratik bir yöntem.
02.07.2026 21:15
#8
Eğitim verilerini temizlemek ve yapılandırmak, modelin kendisini eğitmekten çok daha fazla zaman ve emek alıyor.
03.07.2026 00:35
#9
Ben de yerel modelleri aktif olarak test ediyorum. Qwen 2.5 gerçekten Türkçe performansı konusunda beni çok şaşırttı. Özellikle bağlam takibi harika.
03.07.2026 14:35
#10
Apple Silicon Mac Mini sunucusu kurma fikri çok mantıklı. 10W gibi komik bir tüketim ile 7/24 kesintisiz çalışabilir.
03.07.2026 15:50
#11
Bu projede SQLite yerine PostgreSQL kullanmayı düşündünüz mü? Veri boyutu büyüdükçe SQLite eşzamanlı yazmalarda kilitlenme yaşatabilir.
03.07.2026 16:15
#12
Veri setini hazırlarken JSONL formatına çok dikkat etmek lazım. Yanlış bir parantez veya eksik virgül tüm eğitimi çökertebiliyor.
03.07.2026 17:55
#13
Harika bir rehber olmuş, ellerinize sağlık. Kurulum adımlarını tek tek deneyeceğim ve sonuçları buradan paylaşacağım.
03.07.2026 18:20
#14
ComfyUI yerel görsel üretiminde gerçekten standart haline geldi. Arayüzü düğüm (node) tabanlı olduğu için çok esnek ve güçlü.
04.07.2026 15:00
#15
AdSense onay sürecinde yapay zeka içerik politikası esnetildi ama hala özgünlük ve katma değer en önemli kriter.
04.07.2026 22:55
#16
Continue eklentisinde autocomplete hızı saniyede kaç token üretiyor? Kod yazarken gecikme (lag) hissettiriyor mu?
05.07.2026 01:00
#17
Rüzgar türbininin kış aylarında solar sunucuya katkısı ne seviyede? Rüzgar panelleri kadar stabil güç üretebiliyor mu?
05.07.2026 04:35
#18
Paylaşım için çok teşekkürler, benim gibi yerel yapay zeka dünyasına yeni başlayanlar için altın değerinde bir kaynak olmuş.
06.07.2026 05:50
#19
Peki bu modellerde bağlam penceresi (context window) ne kadar stabil? 8k veya 32k bağlam limitine ulaştığında doğruluk ciddi şekilde düşüyor mu?
06.07.2026 06:15
#20
Sistemin off-grid beslenmesi çok yenilikçi bir fikir. Enerji verimliliği için model boyutunu düşük tutmak gerçekten zekice.
06.07.2026 19:35
#21
Structured outputs desteği sayesinde LLM çıktısını doğrudan kendi veritabanıma kaydedebiliyorum, regex yazma derdi bitti.
07.07.2026 10:00
#22
Flux modeli görsel kalitesinde SDXL'i geride bırakmış diyebiliriz ama VRAM tüketimi gerçekten çok yüksek.
07.07.2026 12:30
#23
Fine-tuning yaparken öğrenme oranını (learning rate) düşük tutmak overfitting'i önlemek ve modelin sapmasını engellemek için kritik.
07.07.2026 21:40
#24
cURL ile kurulan stream bağlantısının gecikmesi nasıl? İlk token ne kadar sürede üretiliyor?
07.07.2026 23:20
#25
NPU çekirdekleri ileride CPU ve GPU üzerindeki yapay zeka yükünü tamamen alacaktır. Tüketici bilgisayarlarında büyük kolaylık sağlayacak.
08.07.2026 12:05
#26
Türkçe karakter desteği konusunda bazı modellerde sıkıntılar yaşanabiliyor ama Qwen ve Llama-3-Instruct bu işi çözmüş görünüyor.
09.07.2026 20:25
#27
Unsloth kütüphanesini kesinlikle tavsiye ederim. VRAM kullanımını acayip düşürüyor ve eğitimi normal PyTorch'a göre neredeyse 3 kat hızlandırıyor.
09.07.2026 22:30
#28
Sistem loglarını SQLite üzerinde tutmak okuma hızını artırıyor ama çok yoğun trafikte yazma kilitlenmelerine karşı dikkatli olunmalı.
10.07.2026 11:40
#29
Open-WebUI arayüzü gerçekten çok stabil. Ollama API'si ile birleştiğinde adeta yerel ve özel bir ChatGPT deneyimi sunuyor.
11.07.2026 09:10
#30
SmolLM-1.7B modelini Raspberry Pi 4 üzerinde denedim. Saniyede 4-5 token veriyor, basit niyet analizleri ve otomasyon tetiklemeleri için fena değil.
11.07.2026 14:10
#31
Apple Silicon cihazlar bu alanda bir harika. 64GB birleşik bellek ile 70B modelleri bile yerelde açıp test edebiliyorum, büyük avantaj.
11.07.2026 19:10
#32
CUDA sürücüleri Ubuntu'da bazen kabus olabiliyor. Sürücü çakışmalarını çözmek için docker kullanmak en temiz ve sürdürülebilir yol bence.
11.07.2026 20:50
#33
Bu proxy kodunu kendi projeme entegre ettim, tıkır tıkır çalışıyor. API anahtarını güvene alarak büyük bir dertten kurtuldum.
12.07.2026 10:25
#34
RAG sistemleri kurarken embedding modelinin kalitesi çok önemli. Cohere veya BGE-M3 modellerini Türkçe projeler için denemenizi öneririm.
12.07.2026 16:40
#35
GGUF formatı olmasaydı herhalde yerelde LLM çalıştırmak hayal olurdu. Kuantizasyon gerçekten çok büyük bir devrim.
12.07.2026 17:05
#36
DeepSeek Coder gerçekten çok başarılı bir model. Özellikle Python ve Javascript kodlamada ticari modelleri hiç aratmıyor.
13.07.2026 10:50
#37
İkinci el temiz bir RTX 3090 bulursam doğrudan çift GPU kuruluma geçeceğim. 48GB VRAM ile 70B modelleri tam hızda koşturmak harika olurdu.
13.07.2026 15:25
#38
Rehberi baştan sona uyguladım ve sistem lokalimde başarıyla çalıştı. Çok açıklayıcı bir anlatım olmuş, tekrar teşekkürler.
14.07.2026 05:25
#39
Bu konuda RTX 3060 12GB hala fiyat/performans kralı diyebiliriz. VRAM kapasitesi hayat kurtarıyor, kesinlikle tavsiye ederim.
14.07.2026 07:55
#40
Ajanlar bence yapay zekanın geleceği. Sadece soru-cevap değil, arka planda web araması yapıp görevleri yerine getiren yapılar çok daha faydalı.
14.07.2026 08:20
#41
Yapay zeka etiği konusunda ne düşünüyorsunuz? Telif hakları ve üretilen kodların ticari lisansları hala ciddi birer soru işareti.
14.07.2026 18:45
#42
Peki bu off-grid sistemde batarya olarak ne kullanıyorsunuz? Jel akü mü yoksa derin deşarj döngüsü yüksek LiFePO4 bataryalar mı?
14.07.2026 20:00
#43
Whisper.cpp ile yerel ses tanıma yapıyorum. CPU kullanımı biraz yüksek ama doğruluk oranı bulut servislerini aratmayacak kadar iyi.
15.07.2026 05:00
#44
Bu sistemde API anahtarlarını maskelemek için proxy kullanmak şart. Yoksa frontend kodundan API key sızdırılması kaçınılmaz olur.
15.07.2026 07:05
#45
Yerel çıkarımın en güzel yanı tamamen internetsiz çalışabilmesi. Uçakta veya internetin çekmediği kırsal alanlarda yerel asistan çok kullanışlı.
15.07.2026 07:30
#46
SQLite üzerinde FTS5 arama motoru kurmak, döküman arama hızını inanılmaz artırdı. RAG için büyük veritabanlarına gerek yokmuş.
15.07.2026 08:45
#47
AGI seviyesine ulaşmamız için daha çok yolumuz var bence. Şimdiki modeller sadece gelişmiş birer olasılık ve tahmin motoru.
15.07.2026 13:20
#48
Yapay zeka forum moderasyonu fikri harika. Küfürlü ve spam yorumları tespit etmek için küçük bir BERT modeli kullanılabilir.
15.07.2026 13:45
#49
SQLite monolitik mimaride gerçekten çok başarılı. Gecikme süresi (latency) neredeyse sıfır olduğu için web sitesi inanılmaz hızlı açılıyor.
15.07.2026 22:05
#50
Kendi asistanımı yerelde çalıştırmanın verdiği gizlilik hissi çok başka. Şirket içi verilerimizi artık güvenle işleyebiliyoruz.
15.07.2026 23:45
#51
Çerezler ve canvas bazlı parmak izi takibi ile spam hesapları engellemek yerel topluluk forumlarında kesinlikle şart.
Cevap yazabilmek için Giriş Yapmalı veya Kayıt Olmalısınız.