Ollama na Windowsima - lokalni LLM iz terminala

Ako ste već čitali tutorijal o LM Studiju, znate o čemu se radi - lokalno pokretanje jezičnih modela, bez interneta, bez pretplate, bez slanja podataka na tuđe servere. LM Studio je odličan za početnike jer ima grafičko sučelje, ali ako vam terminal nije stran, Ollama je alat koji ćete dugoročno više koristiti. Lakše se scriptira, lakše se integrira s drugim alatima, i manje troši resurse jer nema GUI sloja koji radi u pozadini.

Ovaj tutorijal pokriva instalaciju na Windowsima, osnovne naredbe, podešavanje pohrane modela i par korisnih trikova za svakodnevni rad.


Što je Ollama i čime se razlikuje od LM Studija

I Ollama i LM Studio vrtiju modele lokalno, ali pristup im je drugačiji.

LM Studio je desktop aplikacija s grafičkim sučeljem - klikate, birate, preuzimate modele kroz GUI, i chatate unutar aplikacije. Dobro za upoznavanje s temom.

Ollama je CLI alat koji radi kao pozadinski servis. Modele preuzimate jednom naredbom, pokrećete jednom naredbom, i API imate odmah dostupan na localhost:11434. Nema prozora koji treba biti otvoren, nema klikanja - model se učita i čeka zahtjeve.

Za developere koji žele lokalni model spojiti na vlastitu aplikaciju, skriptu ili IDE ekstenziju, Ollama je prirodniji izbor. Za korisnike koji samo žele chatati s modelom i ne žele dirati terminal, LM Studio je udobniji.


Hardverski uvjeti

Isti principi kao i za LM Studio:

  • Windows 10 (22H2 ili noviji) ili Windows 11, 64-bit. ARM64 (Snapdragon) je podržan.

  • Minimum 8 GB RAM-a za male modele, 16 GB za normalan rad

  • SSD za razumno brzo učitavanje modela

  • GPU s barem 4-6 GB VRAM-a za pristojnu brzinu - bez GPU-a inferenca ide na CPU-u i može biti spora

Ollama automatski prepoznaje NVIDIA GPU-ove putem CUDA-e, AMD GPU-ove putem ROCm-a ili Vulkana, i Intel integrirane GPU-ove putem Vulkana. Ništa ne morate ručno konfigurirati.


Instalacija

Idite na ollama.com i preuzmite Windows installer (OllamaSetup.exe). Instalacija ne zahtijeva administratorske ovlasti - sve se instalira u vaš korisnički direktorij.

Pokrenite installer, pratite korake, i to je to. Nakon instalacije Ollama se pokreće kao servis u pozadini i pojavljuje se ikona u system trayu. ollama naredba postaje dostupna u cmd-u, PowerShellu i Windows Terminalu.

Provjera:

ollama --version

Ako vrati verziju, instalacija je uspjela.


Osnovne naredbe

Preuzimanje modela

ollama pull llama3.2

Ovo preuzima model s Ollama library-ja (koji je zapravo Hugging Face repozitorij ispod haube). Modeli se pohranjuju u C:\Users\<korisnik>\.ollama\models po defaultu.

Za specifičnu veličinu modela koristite tag:

ollama pull llama3.2:3b
ollama pull llama3.2:1b

Bez taga uvijek dobivate :latest varijantu, što obično znači srednju veličinu. Uvijek navedite tag ako znate što hoćete.

Pokretanje interaktivnog chata

ollama run llama3.2

Ovo otvara interaktivnu sesiju direktno u terminalu. Tipkate, model odgovara. Za izlaz iz sesije upišite /bye.

Ako model nije preuzet, ollama run će ga automatski preuzeti pa pokrenuti - zgodno za brzo testiranje.

Popis preuzetih modela

ollama list

Brisanje modela

ollama rm llama3.2

Informacije o modelu

ollama show llama3.2

Vraća detalje: veličinu, kvantizaciju, context length, parametar count.


Promjena lokacije modela

Po defaultu modeli idu na C:\ particiju, što brzo postane problem jer 7B model u Q4 kvantizaciji zauzima 4-5 GB, a 13B model 8-10 GB. Ako imate veću particiju ili vanjski SSD, vrijedi premjestiti.

Otvorite Windows Settings i potražite “environment variables” (ili kroz Control Panel). Kliknite “Edit environment variables for your account” i dodajte novu varijablu:

Naziv varijable: OLLAMA_MODELS
Vrijednost: D:\ollama-models

Direktorij ne mora unaprijed postojati - Ollama će ga kreirati. Nakon promjene, desni klik na Ollama ikonu u system trayu → Quit, pa je ponovo pokrenite iz Start menija. Od tog trenutka svi novi modeli idu na novu lokaciju.


Modeli za početnike

Na ollama.com/library nalazit ćete sve dostupne modele. Nekoliko preporuka za početak:

Za chat i opće pitanje-odgovor:

  • llama3.2:3b - mali, brz, dobar za testiranje na slabijim mašinama

  • mistral - klasičan 7B model, pouzdan i dobro dokumentiran

  • qwen2.5:7b - odlično razumijevanje uputa, pristojno na hrvatskom

Za pisanje koda:

  • qwen2.5-coder:7b - jedan od boljih modela specijaliziranih za kod

  • qwen2.5-coder:1.5b - ako vam treba nešto stvarno malo i brzo

Za eksperimentiranje s reasoning modelima:

  • deepseek-r1:7b - reasoning model koji “razmišlja” naglas

Modelfile - vlastiti model profil

Ollama podržava Modelfile format koji vam omogućava da definirate prilagođenu varijantu modela s unaprijed postavljenim system promptom, temperaturom i ostalim parametrima.

Kreirajte tekstualnu datoteku npr. Modelfile bez ekstenzije:

FROM llama3.2

PARAMETER temperature 0.3
PARAMETER num_ctx 4096

SYSTEM """
Ti si iskusan Linux sistem administrator. Odgovaraš koncizno i uvijek navodiš konkretne naredbe s objašnjenjem. Koristiš Markdown za formatiranje koda.
"""

Zatim izgradite model:

ollama create sysadmin-assistant -f Modelfile

I pokrenite ga kao i bilo koji drugi model:

ollama run sysadmin-assistant

Ovaj pristup je koristan kad imate specifičan workflow i ne želite svaki put pisati isti system prompt.


API

Ollama automatski servira REST API na http://localhost:11434. Nije potrebno ništa posebno pokretati - servis radi u pozadini čim je Ollama instalirana.

Primjer poziva s curl-om:

powershell

Invoke-WebRequest -Method POST `
  -Uri http://localhost:11434/api/generate `
  -Body '{"model":"llama3.2","prompt":"Što je Docker?","stream":false}' `
  -ContentType "application/json" | Select-Object -ExpandProperty Content

Ili s Pythonom:

python

import requests

response = requests.post("http://localhost:11434/api/chat", json={
    "model": "llama3.2",
    "messages": [{"role": "user", "content": "Što je Docker?"}],
    "stream": False
})

print(response.json()["message"]["content"])

Ollama API nije identičan OpenAI API formatu, ali Ollama podržava i OpenAI-kompatibilni endpoint na /v1/chat/completions - korisno ako koristite alate koji očekuju OpenAI format.


Česti problemi

“ollama” nije prepoznata naredba. Zatvorite terminal koji ste imali otvoren prije instalacije i otvorite novi. PATH se osvježava tek za nove terminalne sesije.

Model se preuzima sporo ili zastaje. Normalno za veće modele - 7B model je 4-5 GB. Preuzimanje se može nastaviti ako ga prekinete; ollama pull nastavlja od mjesta gdje je stalo.

GPU se ne koristi. Pokrenite ollama run <model> i pogledajte output - Ollama ispisuje koji backend koristi (CUDA, ROCm, Vulkan, CPU). Ako piše CPU, ažurirajte GPU drajvere. Za NVIDIA, potreban je relativno nov drajver koji podržava CUDA 12.x.

Ollama automatski ažurira samu sebe. Da, to je by design i nema načina da se isključi kroz konfiguraciju. Ako vam smeta, koristite standalone zip distribuciju s GitHuba umjesto instalera.

Gdje su logovi? %LOCALAPPDATA%\Ollama\app.log za aplikacijske logove, %LOCALAPPDATA%\Ollama\server.log za serverske logove. Korisno za dijagnostiku.