Forum » 💻 Programlama & API Entegrasyonları » Fine-Tuning İçin Veri Kümesi (Dataset) Hazırlama: JSON ve JSONL Formatları
17.07.2026 00:56
#1 (Konu Sahibi)

Fine-Tuning İçin Veri Kümesi (Dataset) Hazırlama: JSON ve JSONL Formatları

Yapay zeka modellerini ince ayar (fine-tune) eğitimine sokmak için elimdeki metin verilerini uygun formata getirmem gerekiyor. Alpaca formatı ve ChatML formatı arasındaki farklar nelerdir?

Bir veriyi JSONL (JSON Lines) formatında hazırlarken nelere dikkat etmeliyiz? Eğitim kalitesini doğrudan etkileyen sistem promptları veri setinin içine nasıl yerleştirilmelidir? Örnek şablonları tartışalım.
17.07.2026 00:59
#2
Bu konuda RTX 3060 12GB hala fiyat/performans kralı diyebiliriz. VRAM kapasitesi hayat kurtarıyor, kesinlikle tavsiye ederim.
17.07.2026 01:17
#3
Peki bu off-grid sistemde batarya olarak ne kullanıyorsunuz? Jel akü mü yoksa derin deşarj döngüsü yüksek LiFePO4 bataryalar mı?
17.07.2026 01:48
#4
Harika bir rehber olmuş, ellerinize sağlık. Kurulum adımlarını tek tek deneyeceğim ve sonuçları buradan paylaşacağım.
17.07.2026 01:58
#5
SmolLM-1.7B modelini Raspberry Pi 4 üzerinde denedim. Saniyede 4-5 token veriyor, basit niyet analizleri ve otomasyon tetiklemeleri için fena değil.
17.07.2026 02:26
#6
DeepSeek Coder gerçekten çok başarılı bir model. Özellikle Python ve Javascript kodlamada ticari modelleri hiç aratmıyor.
17.07.2026 02:48
#7
ComfyUI yerel görsel üretiminde gerçekten standart haline geldi. Arayüzü düğüm (node) tabanlı olduğu için çok esnek ve güçlü.
17.07.2026 02:58
#8
Whisper.cpp ile yerel ses tanıma yapıyorum. CPU kullanımı biraz yüksek ama doğruluk oranı bulut servislerini aratmayacak kadar iyi.
17.07.2026 03:29
#9
GGUF formatı olmasaydı herhalde yerelde LLM çalıştırmak hayal olurdu. Kuantizasyon gerçekten çok büyük bir devrim.
17.07.2026 03:48
#10
SQLite monolitik mimaride gerçekten çok başarılı. Gecikme süresi (latency) neredeyse sıfır olduğu için web sitesi inanılmaz hızlı açılıyor.
17.07.2026 03:54
#11
Yapay zeka etiği konusunda ne düşünüyorsunuz? Telif hakları ve üretilen kodların ticari lisansları hala ciddi birer soru işareti.
17.07.2026 04:02
#12
Paylaşım için çok teşekkürler, benim gibi yerel yapay zeka dünyasına yeni başlayanlar için altın değerinde bir kaynak olmuş.
17.07.2026 04:31
#13
Bu proxy kodunu kendi projeme entegre ettim, tıkır tıkır çalışıyor. API anahtarını güvene alarak büyük bir dertten kurtuldum.
17.07.2026 04:39
#14
Kuantize modellerde Q4_K_M bence doğruluk kaybı ve hız dengesi açısından en ideali. Q8 ile aralarında hissedilir bir fark yok.
17.07.2026 05:01
#15
Eğitim verilerini temizlemek ve yapılandırmak, modelin kendisini eğitmekten çok daha fazla zaman ve emek alıyor.
17.07.2026 05:07
#16
Apple Silicon cihazlar bu alanda bir harika. 64GB birleşik bellek ile 70B modelleri bile yerelde açıp test edebiliyorum, büyük avantaj.
17.07.2026 05:29
#17
Bu sistemde API anahtarlarını maskelemek için proxy kullanmak şart. Yoksa frontend kodundan API key sızdırılması kaçınılmaz olur.
17.07.2026 05:45
#18
Fine-tuning yaparken öğrenme oranını (learning rate) düşük tutmak overfitting'i önlemek ve modelin sapmasını engellemek için kritik.
17.07.2026 05:47
#19
AGI seviyesine ulaşmamız için daha çok yolumuz var bence. Şimdiki modeller sadece gelişmiş birer olasılık ve tahmin motoru.
17.07.2026 06:10
#20
Unsloth kütüphanesini kesinlikle tavsiye ederim. VRAM kullanımını acayip düşürüyor ve eğitimi normal PyTorch'a göre neredeyse 3 kat hızlandırıyor.
17.07.2026 06:23
#21
Docker üzerinde yerel dil modellerini ayağa kaldırmak taşınabilirlik ve sunucu yönetimi açısından çok pratik bir yöntem.
17.07.2026 06:43
#22
Peki bu modellerde bağlam penceresi (context window) ne kadar stabil? 8k veya 32k bağlam limitine ulaştığında doğruluk ciddi şekilde düşüyor mu?
17.07.2026 06:57
#23
Ben de local RAG üzerinde çalışıyorum. ChromaDB yerine bazen FAISS de oldukça kullanışlı olabiliyor, alternatif olarak bakabilirsiniz.
17.07.2026 07:17
#24
NPU çekirdekleri ileride CPU ve GPU üzerindeki yapay zeka yükünü tamamen alacaktır. Tüketici bilgisayarlarında büyük kolaylık sağlayacak.
17.07.2026 07:30
#25
İkinci el temiz bir RTX 3090 bulursam doğrudan çift GPU kuruluma geçeceğim. 48GB VRAM ile 70B modelleri tam hızda koşturmak harika olurdu.
17.07.2026 07:45
#26
Open-WebUI arayüzü gerçekten çok stabil. Ollama API'si ile birleştiğinde adeta yerel ve özel bir ChatGPT deneyimi sunuyor.
17.07.2026 08:02
#27
Ben de yerel modelleri aktif olarak test ediyorum. Qwen 2.5 gerçekten Türkçe performansı konusunda beni çok şaşırttı. Özellikle bağlam takibi harika.
17.07.2026 08:06
#28
Yerel çıkarımın en güzel yanı tamamen internetsiz çalışabilmesi. Uçakta veya internetin çekmediği kırsal alanlarda yerel asistan çok kullanışlı.
17.07.2026 08:24
#29
CUDA sürücüleri Ubuntu'da bazen kabus olabiliyor. Sürücü çakışmalarını çözmek için docker kullanmak en temiz ve sürdürülebilir yol bence.
17.07.2026 08:40
#30
Continue eklentisinde autocomplete hızı saniyede kaç token üretiyor? Kod yazarken gecikme (lag) hissettiriyor mu?
17.07.2026 09:05
#31
Bu projede SQLite yerine PostgreSQL kullanmayı düşündünüz mü? Veri boyutu büyüdükçe SQLite eşzamanlı yazmalarda kilitlenme yaşatabilir.
17.07.2026 09:09
#32
Benzer bir sistemi off-grid solar panel ile denedim. 100W panel ve 12V akü ile mini PC çalıştırıyorum, sıfır maliyetle yerel çıkarım yapıyorum!
17.07.2026 09:19
#33
Türkçe karakter desteği konusunda bazı modellerde sıkıntılar yaşanabiliyor ama Qwen ve Llama-3-Instruct bu işi çözmüş görünüyor.
17.07.2026 09:39
#34
Rehberi baştan sona uyguladım ve sistem lokalimde başarıyla çalıştı. Çok açıklayıcı bir anlatım olmuş, tekrar teşekkürler.
17.07.2026 10:10
#35
Apple Silicon Mac Mini sunucusu kurma fikri çok mantıklı. 10W gibi komik bir tüketim ile 7/24 kesintisiz çalışabilir.
17.07.2026 10:31
#36
Veri setini hazırlarken JSONL formatına çok dikkat etmek lazım. Yanlış bir parantez veya eksik virgül tüm eğitimi çökertebiliyor.
17.07.2026 10:43
#37
Continue.dev eklentisi VS Code ile mükemmel entegre oluyor. Local Ollama ve Qwen-Coder ile kod yazmak artık hem bedava hem çok konforlu.
Cevap yazabilmek için Giriş Yapmalı veya Kayıt Olmalısınız.