LM Studio na Windowsima - od instalacije do prvog razgovora s modelom

Ako ste ikad htjeli vrtiti jezični model lokalno, bez slanja podataka u oblak i bez mjesečnih pretplata, LM Studio je trenutno jedan od najlakših načina da to napravite. Grafičko sučelje, pretraživanje i preuzimanje modela unutar aplikacije, lokalni API server koji govori OpenAI protokolom - sve na jednom mjestu, bez diranja terminala osim ako to sami hoćete.

Ovaj tutorijal prolazi kroz sve redom: zašto uopće, što vam treba od hardvera, instalacija, odabir i preuzimanje modela, podešavanje i lokalni server.


Zašto lokalno, zašto LM Studio

Postoji nekoliko razloga zašto netko bira lokalno pokretanje modela umjesto ChatGPT-a ili sličnih servisa:

Privatnost. Sve što unesete ostaje na vašoj mašini. Nema logova na tuđim serverima, nema konteksta koji odlazi u trening dataset.

Cijena. Jednom kad imate dovoljno jak hardver, nema daljnjih troškova. Nema API poziva, nema tokena.

Kontrola. Birate koji model koristite, možete ga fine-tunati, mijenjate parametre kako hoćete. Nema content filtera koji blokira legitiman tehnički upit.

Offline rad. Kad server ili API pada, vaš model i dalje radi.

LM Studio nije jedina opcija u tom prostoru - Ollama je popularna alternativa, posebno za CLI korisnike i server deploymente - ali za desktop koristnika koji želi GUI bez konfiguriranja YAML fileova, LM Studio je najmanji otpor.


Što vam treba od hardvera

Ovo je dio gdje treba biti realan, jer performanse direktno ovise o onome što imate ispod haube.

Operacijski sustav

Windows 10 (verzija 22H2 ili novija) ili Windows 11, 64-bit. ARM (Snapdragon X Elite) je također podržan.

Procesor

Za x64 sustave obavezan je AVX2 skup instrukcija. Praktično, svaki Intel Core od 4. generacije (Haswell, 2013.) nadalje i svaki AMD Ryzen od prve generacije to ima. Ako koristite nešto starije od toga, aplikacija će se pokrenuti ali inferenca na CPU-u bit će znatno sporija jer pada na scalar kod.

Ako niste sigurni, provjerite: Win + Rmsinfo32 → pogledajte puni naziv procesora → Google “naziv procesora AVX2”.

RAM

Minimalno 8 GB za male modele u testnom načinu. 16 GB je stvarna preporučena granica za ugodniji rad - imate otvorene browser tabove, editor, i model istovremeno bez da se sve počne pagirati na disk. Na 32 GB možete bez brige vrtiti modele do 13B parametara.

Ključno je razumjeti da model mora stati u memoriju - u RAM, u VRAM, ili u kombinaciju. Ako model ne stane u VRAM, dio se offloa na RAM, ali to usporava generiranje tokena.

GPU i VRAM

Ovo je najvažniji faktor za brzinu. LM Studio podržava:

  • NVIDIA GPU-ove putem CUDA-e (preporučeno, najzrelija podrška)

  • AMD GPU-ove putem Vulkana i ROCm-a

  • Intel integrirane GPU-ove putem Vulkana

Bez GPU-a, inferenca ide na CPU-u i može biti nekoliko minuta po odgovoru za veće modele. S GPU-om koji ima dovoljno VRAM-a, isti model odgovara za nekoliko sekundi.

Gruba tablica orijentacije:

Veličina modela Kvantizacija Potreban VRAM (samo GPU)
7B Q4 ~4–5 GB
7B Q8 ~8 GB
13B Q4 ~8 GB
13B Q8 ~14 GB
70B Q4 ~35–40 GB

Ako imate 8 GB VRAM-a (recimo RTX 3070 ili 4060), ugodno ćete vrtiti 7B modele u Q4/Q8 kvantizaciji, a 13B modele s manjom kvantizacijom uz manji kontekst.

Disk

Sam LM Studio zauzima manje od 400 MB. Modeli su drugi par rukava - 7B model u Q4 kvantizaciji je otprilike 4-5 GB, a 70B model može biti i 40+ GB. Planirajte slobodnih barem 50-100 GB ako planirate eksperimentirati s više modela. SSD je praktički obavezan jer učitavanje modela s HDD-a traje vječnost.


Instalacija

Preuzimanje

Idite na lmstudio.ai i preuzmite Windows installer (.exe datoteka). Nema potrebe za Python virtualenvironmentima, CUDA toolkitima niti ičim sličnim - sve je bundleano unutar aplikacije.

Pokretanje installera

Pokrenite preuzeti .exe. Instalacija je standardna - prihvatite lokaciju, pričekajte par minuta. Aplikacija se nakon instalacije sama pokreće.

Napomena: neki antivirusni programi znaju prijaviti lažno upozorenje na .exe installere koji nisu digitalno potpisani od velikih korporacija. Ako se to dogodi, radi se o false positivu - LM Studio je open source projekt s javnim GitHub repom.

Prvo pokretanje

LM Studio pri prvom pokretanju provjerava sustav i postavlja direktorijsku strukturu u C:\Users\<vašeime>\.lmstudio\. Tu će se kasnije nalaziti preuzeti modeli. Nije potrebna registracija niti korisnički račun.

Sučelje se sastoji od nekoliko sekcija u lijevoj navigaciji - pretraga modela, chat, lokalni server i postavke.


Odabir i preuzimanje modela

Što je kvantizacija i zašto je važna

Originalni modeli su trenirani u float32 ili bfloat16 preciznosti - to su ogromne datoteke. Kvantizacija komprimira težine modela na manji broj bita (Q4, Q5, Q8…) čime se drastično smanjuje veličina i potreban VRAM, uz minimalan gubitak kvalitete koji je u praksi često neznatan.

Format koji ćete najčešće vidjeti je GGUF - to je standardni format za lokalne modele, optimiziran za CPU i GPU inferencu putem llama.cpp backenda koji LM Studio koristi ispod haube.

Opće pravilo: Q4_K_M je dobar balans između veličine i kvalitete za svakodnevnu upotrebu. Ako imate više VRAM-a i hoćete bolju kvalitetu, idite na Q5_K_M ili Q8_0.

Pretraživanje modela u aplikaciji

U lijevoj navigaciji kliknite na ikonu pretrage (Discover/Search). Direktno unutar LM Studija možete pretraživati Hugging Face repozitorij i preuzimati modele. Upišite npr. llama, mistral, gemma, qwen ili phi i vidjet ćete dostupne varijante.

LM Studio pokazuje i indikator kompatibilnosti s vašim hardverom - zeleno znači da model stane u VRAM, žuto da će se djelomično offloa na RAM (sporije), crveno da model neće raditi funkcionalno na vašoj konfiguraciji.

Preporuke za početak

Za prvi kontakt preporučam nešto malo što brzo odgovara i ne jede sav VRAM:

  • Llama 3.2 3B (Q8) - mali, brz, dobar za testiranje

  • Mistral 7B Instruct (Q4_K_M) - klasičan izbor, dobra ravnoteža

  • Qwen 2.5 7B Instruct (Q4_K_M) - odlično prati upute, dobro na hrvatskom

  • Phi-3 Mini (Q4) - iznimno mali (3.8B), iznenađujuće sposoban za svoju veličinu

Klikom na model i “Download” preuzimanje kreće. Brzina ovisi o internetu, modeli su obično između 2 i 8 GB.


Podešavanje i chat

Učitavanje modela

Nakon preuzimanja, idite u Chat sekciju. Na vrhu stranice nalazit će se dropdown za odabir modela - kliknite, odaberite preuzeti model i pričekajte da se učita u memoriju (par sekundi do par minuta ovisno o veličini modela i brzini diska).

Parametri koji utječu na generiranje

Kad je model učitan, na desnoj strani su klizači za parametre. Najvažniji:

Temperature - koliko je model “kreativan”. Vrijednost 0.0 daje deterministične odgovore, 1.0 i više unosi više varijabilnosti. Za tehničke upite i kod, držite oko 0.3-0.5. Za kreativno pisanje, 0.7-1.0.

Context Length - koliko tokena konteksta model “pamti” u razgovoru. Veći kontekst troši više VRAM-a. Ako aplikacija počinje lagati ili model počne buncati pri dugim razgovorima, smanjite kontekst.

System Prompt - tekst koji model prima kao uputu prije razgovora. Ovdje možete definirati ton, jezik, ili mu reći da je specijalist za određenu domenu. Npr.: “Ti si iskusan Linux sistem administrator. Odgovaraj koncizno i uvijek navedi konkretne naredbe.”

GPU Offloading

U postavkama modela (pri učitavanju) nalazi se klizač za broj slojeva koji se offloada na GPU. Ako imate GPU, postavite na maksimum (ili “Max”) - to osigurava da što više modela sjedi u brzom VRAM-u. Ako dobijete out-of-memory grešku, smanjujte broj slojeva dok ne prođe.


Lokalni API server

Ovo je jedna od najkorisnijih funkcija za developere. LM Studio može servirati lokalni REST API na http://localhost:1234/v1 koji je kompatibilan s OpenAI API shemom.

Pokretanje servera

U lijevoj navigaciji kliknite na ikonu servera (Developer/Local Server). Kliknite Start Server. Zeleni indikator potvrđuje da server radi.

Pritom mora biti učitan barem jedan model u Chatu.

Korištenje

Budući da server implementira OpenAI Chat Completions endpoint, svaki alat ili kod koji već koristi OpenAI API radi s minimalnom promjenom - samo zamijenite base URL:

python

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio"  # string mora biti non-empty, server ga ignorira
)

response = client.chat.completions.create(
    model="local-model",
    messages=[
        {"role": "system", "content": "Odgovaraj na hrvatskom."},
        {"role": "user", "content": "Objasni što je kvantizacija modela."}
    ],
    temperature=0.5
)

print(response.choices[0].message.content)

Isti princip vrijedi za JavaScript, curl, LangChain, ili bilo koji drugi klijent koji prima base_url parametar.

Server nema autentikaciju po defaultu, što znači da je dostupan svima na lokalnoj mreži ako promijeniš bind adresu s 127.0.0.1 na 0.0.0.0. Za LAN deploymente, zaštiti port na razini firewalla.


Česti problemi

Model se učitava ali odgovori su nevjerojatno spori. Vjerojatno je GPU offloading isključen ili je samo mali dio modela na GPU-u. Provjerite u postavkama učitavanja i postavite GPU layers na maksimum.

Out of memory greška pri učitavanju. Model ne stane u VRAM. Opcije: odaberite manju kvantizaciju (Q4 umjesto Q8), smanjite Context Length, ili koristite manji model.

Model brblja ili ponavlja sam sebe pri dugim razgovorima. Context window je premali za duljinu razgovora, model “gubi nit”. Povećajte Context Length (uz prihvaćanje većeg VRAM utroška) ili krenite novi razgovor.

Antivirusni program blokira instalaciju. False positive. Dodajte iznimku za LM Studio installer i instalacijski direktorij, ili privremeno isključite real-time zaštitu za vrijeme instalacije.

GPU se ne koristi (NVIDIA). Provjerite jesu li NVIDIA drajveri ažurni. LM Studio ne zahtijeva zasebnu CUDA instalaciju, ali drajver mora biti dovoljno novog datuma da podržava CUDA 12.x.


Korak dalje

Kad jednom uhvatite ritam s osnovnim chatom i API serverom, vrijedi pogledati:

  • RAG (Retrieval Augmented Generation) - LM Studio podržava upload lokalnih dokumenata (PDF, DOCX, TXT) koje model koristi kao kontekst, korisno za rad s internom dokumentacijom

  • Model splitting - za velike modele koji ne stanu u VRAM, LM Studio može rasporediti slojeve između VRAM-a i RAM-a

  • llmster - LM Studio CLI daemon za headless/server pokretanje bez GUI-a, korisno za automatizacije

  • Testiranje različitih modela za istu namjenu - performanse variraju dramatično ovisno o zadatku, isplati se usporediti Mistral, Qwen i Llama na konkretnim upitima koji vas zanimaju