Softalica
Blog

Lokal AI Kurulumu: Ollama ile Adım Adım Yerel Yapay Zeka Çalıştırma Rehberi

Lokal yapay zeka, büyük dil modellerini doğrudan kendi bilgisayarınızda çalıştırmanıza imkan verir. Böylece verileriniz üçüncü taraf servislere gönderilmeden, internet bağlantısına ihtiyaç duymadan ve API maliyeti olmadan yapay zeka modellerini kullanabilirsiniz. Ollama, lokal yapay zeka kurulumu için en kolay araçlardan biridir.

Lokal yapay zeka, büyük dil modellerini doğrudan kendi bilgisayarınızda çalıştırmanıza imkan verir. Böylece verileriniz üçüncü taraf servislere gönderilmeden, internet bağlantısına ihtiyaç duymadan ve API maliyeti olmadan yapay zeka modellerini kullanabilirsiniz. Ollama, lokal yapay zeka kurulumu için en kolay araçlardan biridir.

Ollama sayesinde Llama, Qwen, Gemma, Mistral, DeepSeek ve benzeri birçok modeli tek komutla indirip çalıştırabilirsiniz. Ancak hangi modeli seçmeniz gerektiği ekran kartınızın VRAM kapasitesine, sistem RAM miktarına ve kullanım amacınıza göre değişir.

Ollama Nedir?

Ollama, büyük dil modellerini Windows, macOS ve Linux üzerinde lokal olarak çalıştırmayı kolaylaştıran bir model çalıştırma platformudur. Model dosyalarını indirir, gerekli çalışma ortamını hazırlar ve kullanıcıya basit bir komut satırı arayüzü sunar.

Ollama özellikle teknik detaylarla fazla uğraşmadan lokal AI kurmak isteyen kullanıcılar için uygundur. GPU destekli sistemlerde uygun donanım bulunduğunda model hesaplamalarının önemli bir bölümü ekran kartı üzerinde gerçekleştirilebilir.

Lokal AI Kurulumunda Donanım Neden Önemlidir?

Bir yapay zeka modelini lokal olarak çalıştırırken en önemli donanım bileşenlerinden biri ekran kartının VRAM kapasitesidir. Modelin parametreleri ve çalışma sırasında oluşturulan geçici veriler mümkün olduğunca VRAM içerisinde tutulur.

Model VRAM'e sığmadığında sistem RAM'i kullanılabilir ancak bu durumda performans önemli ölçüde düşebilir. Bu nedenle model seçerken yalnızca modelin parametre sayısına değil, kullanılan quantization seviyesine ve context uzunluğuna da dikkat edilmelidir.

1. Ollama Kurulumu

İlk adım Ollama'yı bilgisayarınıza kurmaktır. Windows kullanıyorsanız Ollama'nın resmi Windows kurulum paketini indirerek standart kurulum işlemini gerçekleştirebilirsiniz.

Kurulum tamamlandıktan sonra PowerShell veya Komut İstemi açarak Ollama'nın düzgün çalışıp çalışmadığını kontrol edebilirsiniz.

powershellpowershell
ollama --version

Komut bir sürüm numarası döndürüyorsa Ollama başarıyla kurulmuş demektir.

2. İlk Modelinizi İndirin

Ollama'da modeller ollama pull komutu kullanılarak indirilebilir. Örneğin küçük ve genel kullanım için uygun bir modeli indirmek için aşağıdaki yapı kullanılabilir.

powershellpowershell
ollama pull qwen3:4b

Model indirildikten sonra doğrudan çalıştırılabilir.

powershellpowershell
ollama run qwen3:4b

Bu komuttan sonra terminal içerisinde modelle konuşmaya başlayabilirsiniz.

3. Bilgisayarınızdaki Modelleri Listeleyin

Daha önce indirdiğiniz modelleri görmek için Ollama'nın listeleme komutunu kullanabilirsiniz.

powershellpowershell
ollama list

Burada model adı, model boyutu ve sistemde bulunduğu durum görülebilir.

4. Model Silme

Kullanmadığınız modeller disk üzerinde ciddi miktarda yer kaplayabilir. Bir modeli kaldırmak için rm komutu kullanılabilir.

powershellpowershell
ollama rm qwen3:4b

GPU'ya Göre Hangi Model Seçilmeli?

Model seçerken en önemli değer ekran kartınızın VRAM miktarıdır. Aşağıdaki öneriler kesin sınırlar değildir ancak pratik bir başlangıç noktası olarak kullanılabilir. Quantization seviyesi, context uzunluğu ve sistem RAM'i gerçek kullanım kapasitesini değiştirebilir.

4 GB VRAM İçin Model Seçenekleri

4 GB VRAM'e sahip ekran kartlarında küçük modeller tercih edilmelidir. 7B ve üzeri modeller bazı quantization seviyelerinde çalışabilse bile önemli miktarda RAM offload gerekebilir ve performans düşebilir.

  • Qwen 1.5B veya 3B sınıfı modeller.
  • Llama 3.x 1B veya 3B sınıfı modeller.
  • Gemma 2B veya 3B sınıfı modeller.
  • Phi Mini sınıfı modeller.
powershellpowershell
ollama run qwen3:1.7b

Bu donanım seviyesi temel sohbet, metin üretimi, basit kod açıklamaları ve küçük otomasyon görevleri için kullanılabilir.

6 GB VRAM İçin Model Seçenekleri

6 GB VRAM, küçük modeller için oldukça rahat bir alan sunar. 4B ve bazı 7B modeller quantized şekilde kullanılabilir.

  • Qwen 4B modelleri.
  • Llama 3B modelleri.
  • Gemma 4B sınıfı modeller.
  • Bazı 7B Q4 modeller.
powershellpowershell
ollama run qwen3:4b

Kodlama ve günlük sohbet için 4B sınıfındaki modeller genellikle hız ve kalite arasında iyi bir denge sağlar.

8 GB VRAM İçin Model Seçenekleri

8 GB VRAM lokal AI için oldukça kullanışlı bir başlangıç seviyesidir. Birçok 7B ve 8B model Q4 quantization ile rahat şekilde çalıştırılabilir.

  • Qwen 7B veya 8B sınıfı modeller.
  • Llama 8B modelleri.
  • Mistral 7B modelleri.
  • Gemma 7B veya benzeri modeller.
powershellpowershell
ollama run llama3.1:8b

8 GB VRAM özellikle sohbet, yazılım desteği ve genel üretken yapay zeka kullanımı için yeterli olabilir.

12 GB VRAM İçin Model Seçenekleri

12 GB VRAM ile 7B ve 8B modeller daha yüksek quantization seviyelerinde çalıştırılabilir. Bunun yanında bazı 12B, 14B ve benzeri modeller düşük quantization ile kullanılabilir.

  • Qwen 7B ve 14B modelleri.
  • Llama 8B modelleri.
  • Gemma 12B sınıfı modeller.
  • DeepSeek tabanlı küçük ve orta modeller.
powershellpowershell
ollama run qwen3:14b

14B sınıfı modellerde context büyüdükçe VRAM kullanımının artabileceği unutulmamalıdır.

16 GB VRAM İçin Model Seçenekleri

16 GB VRAM, lokal yapay zeka kullanımı için oldukça güçlü bir seviyedir. 14B modeller genellikle rahat kullanılabilir ve bazı daha büyük modeller quantized şekilde çalıştırılabilir.

  • Qwen 14B modelleri.
  • Gemma 12B modelleri.
  • Bazı 20B civarı quantized modeller.
  • Kodlama odaklı 14B coder modelleri.
powershellpowershell
ollama run qwen3:14b

Yazılım geliştirme için 14B coder sınıfındaki modeller, küçük modellerden belirgin şekilde daha iyi bağlam ve kod kalitesi sağlayabilir.

24 GB VRAM İçin Model Seçenekleri

24 GB VRAM seviyesinde kullanıcı artık oldukça büyük lokal modelleri deneyebilir. 14B modeller yüksek kaliteyle çalıştırılabilirken 27B, 30B ve 32B sınıfı modeller düşük veya orta quantization seviyelerinde kullanılabilir.

  • Qwen 14B ve 32B modelleri.
  • Coder odaklı 32B modeller.
  • Gemma 27B sınıfı modeller.
  • Bazı 30B sınıfı reasoning modelleri.
powershellpowershell
ollama run qwen3:32b

Bu seviyede özellikle kodlama, uzun doküman analizi ve daha karmaşık reasoning görevlerinde küçük modellere göre önemli kalite artışı elde edilebilir.

32 GB VRAM İçin Model Seçenekleri

32 GB VRAM, 30B civarındaki modelleri daha rahat çalıştırmak için güçlü bir seviyedir. Daha yüksek quantization kullanmak veya context değerini artırmak mümkün hale gelir.

  • Qwen 32B sınıfı modeller.
  • Coder 32B modelleri.
  • Gemma 27B modelleri.
  • Bazı daha büyük MoE modeller.

Bu seviyede model seçiminde yalnızca VRAM değil, sistem RAM'i ve disk performansı da önem kazanmaya başlar.

48 GB VRAM ve Üzeri İçin Model Seçenekleri

48 GB ve üzeri VRAM profesyonel lokal AI kullanımı için oldukça geniş seçenekler sunar. 32B modeller yüksek quantization seviyelerinde çalıştırılabilir ve 70B sınıfı modeller uygun quantization ile denenebilir.

  • Qwen 32B modelleri.
  • Llama 70B sınıfı quantized modeller.
  • Büyük coder modelleri.
  • Reasoning odaklı büyük modeller.

70B sınıfındaki modellerde VRAM yanında 64 GB veya daha yüksek sistem RAM'i kullanmak pratikte ciddi avantaj sağlayabilir.

GPU Yoksa Ollama Çalışır mı?

Evet. Ollama CPU üzerinde de model çalıştırabilir. Ancak özellikle büyük modellerde CPU performansı GPU'ya kıyasla çok daha düşük olabilir.

GPU bulunmayan sistemlerde 1B, 3B ve 4B modeller daha mantıklıdır. 7B modeller güçlü işlemcilerde kullanılabilir ancak token üretme hızı düşük olabilir.

Sistem RAM'ine Göre Model Seçimi

VRAM kadar sistem RAM'i de önemlidir. Model tamamen ekran kartına sığmadığında bazı katmanlar sistem RAM'ine taşınabilir.

  • 8 GB RAM: Küçük 1B ve 3B modeller.
  • 16 GB RAM: 3B, 4B ve bazı 7B modeller.
  • 32 GB RAM: 7B, 14B ve bazı daha büyük quantized modeller.
  • 64 GB RAM: 32B modeller ve daha büyük modeller için daha rahat çalışma alanı.
  • 128 GB RAM ve üzeri: Büyük modellerin CPU ve GPU hibrit çalıştırılması için uygun altyapı.

Quantization Nedir?

Quantization, model ağırlıklarının daha düşük bit hassasiyetinde saklanmasıdır. Böylece model daha az VRAM ve RAM kullanır. Lokal yapay zekanın yaygınlaşmasını sağlayan en önemli tekniklerden biri quantization'dır.

  • Q8: Daha yüksek kalite, daha yüksek bellek kullanımı.
  • Q6: Kalite ve bellek arasında güçlü denge.
  • Q5: Lokal kullanım için iyi denge.
  • Q4: En yaygın seçeneklerden biri, düşük bellek kullanımı ve iyi kalite dengesi.
  • Q3 ve altı: Daha düşük bellek kullanımı ancak daha fazla kalite kaybı.

Çoğu kullanıcı için Q4 veya Q5 modeller pratik başlangıç noktalarıdır.

Context Length Nedir?

Context length, modelin aynı anda dikkate alabildiği token miktarını ifade eder. Uzun context değerleri büyük dosyaları, uzun sohbetleri veya büyük kod tabanlarını analiz etmek için avantaj sağlar.

Ancak context değeri yükseldikçe özellikle KV cache nedeniyle VRAM kullanımı artabilir. Bu nedenle model VRAM'e rahat sığıyor olsa bile çok yüksek context kullanıldığında bellek yetersizliği oluşabilir.

Ollama'da Context Değeri Nasıl Ayarlanır?

Model için özel bir Modelfile oluşturarak context uzunluğu gibi parametreler değiştirilebilir.

dockerfiledockerfile
FROM qwen3:14b

PARAMETER num_ctx 16384
PARAMETER temperature 0.7

Ardından yeni modeli oluşturabilirsiniz.

powershellpowershell
ollama create qwen3-16k -f Modelfile

Yeni oluşturulan modeli çalıştırmak için aşağıdaki komut kullanılabilir.

powershellpowershell
ollama run qwen3-16k

Kodlama İçin Hangi Modeller Tercih Edilmeli?

Yazılım geliştirme amacıyla lokal AI kuruluyorsa genel sohbet modelleri yerine kodlama odaklı modeller tercih edilebilir. Bu modeller kod tamamlama, refactoring, hata tespiti, dosya analizi ve kod açıklaması gibi görevlerde daha başarılı olabilir.

  • Qwen Coder ailesi.
  • DeepSeek Coder ailesi.
  • Codestral tabanlı modeller.
  • Genel amaçlı güçlü Qwen modelleri.

8 GB VRAM'de 7B coder, 12-16 GB VRAM'de 14B coder ve 24 GB veya üzeri VRAM'de 32B coder sınıfı modeller değerlendirilebilir.

Ollama'yı API Olarak Kullanma

Ollama yalnızca terminal üzerinden kullanılmaz. Lokal bir API servisi de sağlar. Böylece kendi web uygulamalarınızdan veya masaüstü uygulamalarınızdan lokal modele bağlanabilirsiniz.

typescripttypescript
const response = await fetch("[http://localhost:11434/api/chat](http://localhost:11434/api/chat)", {
method: "POST",
headers: {
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "qwen3:4b",
messages: [
{
role: "user",
content: "Laravel nedir?"
}
],
stream: false
})
});

const data = await response.json();

console.log(data.message.content);

Bu yöntem sayesinde lokal modelinizi kendi yazılım projelerinize entegre edebilirsiniz.

Ollama'nın API Adresi

Ollama varsayılan olarak lokal makinede 11434 portunu kullanır.

texttext
[http://localhost:11434](http://localhost:11434)

Bu servis yalnızca lokal kullanım için bırakılabilir veya gerekli güvenlik önlemleri alınarak yerel ağ içerisindeki diğer cihazlara açılabilir. İnternete doğrudan ve kimlik doğrulamasız şekilde açılması önerilmez.

Ollama ile Open WebUI Kullanımı

Terminal yerine ChatGPT benzeri bir kullanıcı arayüzü kullanmak isterseniz Ollama ile Open WebUI birlikte kullanılabilir. Open WebUI tarayıcı üzerinden çalışan bir sohbet arayüzü sağlar ve lokal Ollama modellerini kullanabilir.

Docker kurulu bir sistemde Open WebUI container üzerinden çalıştırılabilir.

powershellpowershell
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Kurulum tamamlandıktan sonra tarayıcı üzerinden lokal arayüze erişebilirsiniz.

texttext
[http://localhost:3000](http://localhost:3000)

Ollama ile VS Code Kullanımı

Lokal yapay zekayı doğrudan kod editöründe kullanmak da mümkündür. Continue, Roo Code ve benzeri araçlar Ollama'nın lokal API'sine bağlanabilir. Böylece kod yazarken lokal modellerden yardım alınabilir.

Bu kullanımda güçlü bir coder modeli seçmek önemlidir. Ayrıca büyük proje klasörlerinin analizinde context uzunluğu ve modelin kod anlama kapasitesi doğrudan deneyimi etkiler.

Modelin Gerçekten GPU Kullandığını Nasıl Kontrol Edebilirsiniz?

NVIDIA ekran kartı kullanıyorsanız model çalışırken GPU kullanımını Windows Görev Yöneticisi veya nvidia-smi üzerinden kontrol edebilirsiniz.

powershellpowershell
nvidia-smi

Model çalışırken GPU belleği kullanımında artış görülmesi modelin GPU üzerinde çalıştığını gösterir.

Ollama'da Çalışan Modelleri Kontrol Etme

O anda bellekte çalışan modelleri görmek için ps komutu kullanılabilir.

powershellpowershell
ollama ps

Bu çıktı modelin ne kadar bellek kullandığı ve hangi modelin aktif olduğu hakkında bilgi sağlayabilir.

VRAM Yetmediğinde Ne Olur?

Model tamamen GPU belleğine sığmazsa Ollama modelin bazı bölümlerini sistem RAM'i üzerinde çalıştırabilir. Bu yöntem modelin yine çalışmasını sağlar ancak GPU ile RAM arasındaki veri aktarımı nedeniyle hız önemli ölçüde düşebilir.

Örneğin 16 GB VRAM'e sahip bir sistemde 32B model çalıştırmak mümkün olabilir ancak modelin önemli kısmı RAM'e taşındığında token üretme hızı 14B modele göre çok daha düşük olabilir.

En Büyük Model Her Zaman En İyi Seçim Değildir

Lokal AI sistemlerinde kullanıcıların en sık yaptığı hatalardan biri donanımın çalıştırabildiği en büyük modeli seçmektir. Bir model teknik olarak çalışabiliyor olsa bile çok yavaş çalışıyorsa günlük kullanım açısından daha küçük model daha iyi bir deneyim sunabilir.

Örneğin 32B modeli saniyede birkaç token ile kullanmak yerine 14B modeli çok daha yüksek hızda çalıştırmak kodlama veya sohbet kullanımında daha verimli olabilir.

GPU'ya Göre Pratik Model Seçim Tablosu

  • 4 GB VRAM: 1B - 3B modeller.
  • 6 GB VRAM: 3B - 4B ve bazı 7B Q4 modeller.
  • 8 GB VRAM: 7B - 8B Q4 modeller.
  • 12 GB VRAM: 8B - 14B quantized modeller.
  • 16 GB VRAM: 14B modeller ve bazı daha büyük quantized seçenekler.
  • 24 GB VRAM: 27B - 32B quantized modeller için güçlü seçenek.
  • 32 GB VRAM: 32B modeller için daha yüksek kalite ve context seçenekleri.
  • 48 GB VRAM: 32B modeller rahat, bazı 70B quantized modeller mümkün.
  • 80 GB ve üzeri VRAM: Büyük 70B sınıfı modeller için çok daha rahat çalışma alanı.

NVIDIA GPU mu AMD GPU mu?

Lokal yapay zeka ekosisteminde NVIDIA ekran kartları genellikle daha geniş yazılım desteğine sahiptir. Bunun temel sebeplerinden biri CUDA ekosisteminin yapay zeka kütüphanelerinde uzun yıllardır yaygın şekilde kullanılmasıdır.

AMD ekran kartlarında da lokal model çalıştırmak mümkündür ancak işletim sistemi, GPU modeli ve kullanılan backend'e göre uyumluluk değişebilir. Bu nedenle özellikle lokal AI amacıyla yeni bir ekran kartı seçilecekse yalnızca ham GPU performansı değil yazılım desteği de değerlendirilmelidir.

Laptop GPU'larında Nelere Dikkat Edilmeli?

Laptop ekran kartlarında model adı masaüstü ekran kartıyla aynı görünse bile VRAM miktarı ve güç limiti farklı olabilir. Lokal AI açısından GPU'nun yalnızca model adına değil gerçek VRAM miktarına bakılmalıdır.

Ayrıca uzun süreli AI kullanımı laptoplarda yüksek sıcaklık ve fan hızlarına neden olabilir. Güç profilleri ve soğutma kapasitesi performansı doğrudan etkileyebilir.

Disk Alanı Ne Kadar Gerekir?

Model dosyaları oldukça büyük olabilir. Küçük modeller birkaç GB alan kullanırken 30B ve üzeri modeller quantization seviyesine bağlı olarak onlarca GB disk alanı tüketebilir.

  • 1B - 3B modeller: Yaklaşık birkaç GB.
  • 7B - 8B modeller: Yaklaşık 4 - 10 GB.
  • 14B modeller: Yaklaşık 8 - 20 GB.
  • 32B modeller: Yaklaşık 18 - 40 GB.
  • 70B modeller: Quantization seviyesine bağlı olarak onlarca GB veya daha fazla.

Birden fazla model denemeyi planlıyorsanız en az birkaç yüz GB boş SSD alanı oldukça faydalıdır.

Lokal AI Kurulumu İçin Önerilen Adımlar

  • Adım 1: GPU VRAM miktarınızı öğrenin.
  • Adım 2: Sistem RAM miktarınızı kontrol edin.
  • Adım 3: Ollama'yı kurun.
  • Adım 4: Önce küçük bir 3B veya 4B model indirin.
  • Adım 5: Modelin GPU kullandığını kontrol edin.
  • Adım 6: Daha sonra GPU kapasitenize uygun 7B, 14B veya 32B modele geçin.
  • Adım 7: Hız ve kaliteyi karşılaştırın.
  • Adım 8: Kullanım amacınıza göre genel veya coder model seçin.
  • Adım 9: Gerekiyorsa context değerini artırın.
  • Adım 10: Open WebUI veya VS Code entegrasyonunu kurun.

Örnek Lokal AI Kurulumu

Örneğin 16 GB VRAM ve 32 GB sistem RAM'ine sahip bir bilgisayarınız olduğunu düşünelim. İlk olarak Ollama kurulur ve küçük bir modelle sistem test edilir.

powershellpowershell
ollama pull qwen3:4b
ollama run qwen3:4b

Sistem düzgün çalışıyorsa daha güçlü bir modele geçilebilir.

powershellpowershell
ollama pull qwen3:14b
ollama run qwen3:14b

Model çalışırken GPU kullanımı kontrol edilir.

powershellpowershell
nvidia-smi

14B model yeterince hızlı çalışıyorsa günlük kullanım modeli olarak tercih edilebilir. Daha büyük modele geçmek yalnızca gerçekten ihtiyaç duyulan görevlerde anlamlı olabilir.

Kodlama İçin Örnek Kurulum

Yazılım geliştirme amacıyla kullanılacak sistemde mümkün olduğunca coder odaklı bir model tercih edilmelidir.

powershellpowershell
ollama pull qwen2.5-coder:7b
ollama run qwen2.5-coder:7b

Daha güçlü ekran kartlarında daha büyük coder modellerine geçilebilir.

powershellpowershell
ollama pull qwen2.5-coder:14b
ollama run qwen2.5-coder:14b

24 GB veya üzeri VRAM bulunan sistemlerde 32B coder modelleri de değerlendirilebilir.

Sonuç

Ollama, lokal yapay zeka kurmak için en kolay ve pratik çözümlerden biridir. Karmaşık Python ortamları, CUDA paketleri veya manuel model yapılandırmalarıyla uğraşmadan birkaç komutla güçlü yapay zeka modelleri bilgisayar üzerinde çalıştırılabilir.

Başarılı bir lokal AI kurulumu için en kritik nokta doğru modeli seçmektir. Model seçimi yalnızca parametre sayısına göre yapılmamalı; GPU VRAM kapasitesi, sistem RAM'i, quantization seviyesi, context uzunluğu ve kullanım amacı birlikte değerlendirilmelidir.

4-8 GB VRAM seviyesinde küçük modeller, 12-16 GB VRAM seviyesinde 7B ve 14B modeller, 24 GB ve üzeri VRAM'de ise 30B sınıfı modeller güçlü seçenekler haline gelir. Daha büyük model her zaman daha iyi kullanıcı deneyimi anlamına gelmediği için hız ve kalite arasında denge kurulmalıdır.

Ollama'nın API desteği, Open WebUI entegrasyonu ve kod editörleriyle bağlantı kurabilmesi sayesinde lokal AI yalnızca bir sohbet aracı olarak değil; yazılım geliştirme, şirket içi bilgi sistemi, otomasyon, doküman analizi ve özel yapay zeka uygulamaları için kullanılabilecek güçlü bir altyapıya dönüşebilir.

Etiketler

Lokal AI Kurulumu: Ollama ile Adım Adım Yerel Yapay Zeka Çalıştırma Rehberi
5