AI na Linux serveru

Veštačka inteligencija je za sistem inženjera pre svega još jedan servis koji treba instalirati, konfigurisati, obezbediti i nadgledati. Ovaj serijal upravo tako i pristupa temi: bez marketinga i bez matematike, sa fokusom na to kako se otvoreni AI modeli pokreću na Linux serveru i kako se stvarno koriste u svakodnevnom radu.

Kroz šest faza i trideset dva teksta ideš od osnovnih pojmova, preko pripreme hardvera i instalacije alata, do integracije modela u sopstvene skripte i produkcione postavke. Serijal je kompletan — svi tekstovi su objavljeni.

Za koga je ovaj serijal

  • Sistem inženjere i administratore koji žele AI model na sopstvenoj infrastrukturi, bez slanja podataka trećim stranama.
  • DevOps inženjere koji AI uvode u postojeći stack (Docker, Kubernetes, CI/CD).
  • Sve koji žele da razumeju šta se krije iza pojmova LLM, token, kvantizacija i inferencija.

Preduslovi: osnovno snalaženje u terminalu, rad sa paketima i systemd servisima. Ako ti to nedostaje, prvo prođi Linux osnove.

Faza 1 — Uvod: šta AI zapravo jeste

Pojmovi i pregled tržišta. Bez ovog dela kasnije nećeš znati koji model uopšte da preuzmeš.

  1. Šta je AI model — objašnjenje za sistem inženjere — kako model funkcioniše iz ugla nekoga ko ga hostuje.
  2. Rečnik AI pojmova za sistem inženjere — podsetnik na koji ćeš se vraćati kroz ceo serijal.
  3. Otvoreni i zatvoreni modeli — open-weight, licence i praktične posledice.
  4. Pregled aktuelnih open-weight modela — Qwen, GLM, DeepSeek, gpt-oss, Gemma i Mistral, i za šta je koji dobar.

Faza 2 — Priprema servera

Hardver, drajveri i realna procena onoga što tvoj server može da izgura.

  1. Koliko VRAM-a ti stvarno treba — kako izračunati zahteve modela pre nego što ga preuzmeš.
  2. CPU inferencija naspram GPU inferencije — kada je koja dovoljna i koliko je razlika velika.
  3. Instalacija NVIDIA drajvera i CUDA toolkit-a — Debian, Ubuntu, RHEL i Fedora, korak po korak.
  4. nvidia-smi i nvtop — praćenje GPU-a iz terminala — šta znače kolone i kako se prepoznaje zagušenje.
  5. Kvantizacija u praksi: GGUF, Q4_K_M i AWQ — kako da model stane u manje memorije i šta se pritom gubi.

Faza 3 — Instalacija i pokretanje

Središnji deo serijala. Od prazne mašine do modela koji odgovara na zahteve.

  1. Ollama: instalacija na Linux serveru od nule — najbrži put do prvog modela koji radi.
  2. Ollama kao systemd servis — pokretanje na boot, mrežni pristup i promenljive okruženja.
  3. llama.cpp — kompajliranje i llama-server — puna kontrola nad parametrima inferencije.
  4. Hugging Face CLI — preuzimanje modela — gde modeli žive i kako da ti disk ne pukne.
  5. vLLM — produkciona inferencija — kada Ollama više nije dovoljna.
  6. Ollama u Dockeru sa GPU passthrough-om — nvidia-container-toolkit i izolovano okruženje.
  7. Open WebUI — web interfejs za lokalne modele — pristup iz pregledača, nalozi, istorija razgovora.

16b. LibreChat — alternativa Open WebUI — kada ti treba MIT licenca ili rad sa više provajdera uporedo. Dodatak uz prethodni tekst, nije zaseban korak.

Faza 4 — Korišćenje i integracija

Model koji radi je tek pola posla. Ovde ga uvodiš u svakodnevni rad na serveru.

  1. OpenAI-kompatibilan API na svom serveru — struktura zahteva i odgovora, kroz curl.
  2. Nginx reverse proxy i HTTPS ispred lokalnog LLM-a — siguran pristup spolja.
  3. Zaštita API-ja: ključevi, firewall i ograničavanje pristupa — zašto otvoren port sa modelom nije bezazlen.
  4. Python skripta koja komunicira sa lokalnim modelom — klijent koji dalje nadograđuješ.
  5. AI u bash skriptama — automatska analiza logova — model kao još jedna karika u pipe-u.
  6. journalctl i LLM: objašnjenje grešaka jednom komandom — alatka koju ćeš zaista koristiti.
  7. RAG nad sopstvenom dokumentacijom — embeddings, vektorska baza i odgovori zasnovani na tvojim fajlovima.

Faza 5 — Produkcija

Merenje, nadzor, bezbednost i trošak. Deo koji odvaja demo od servisa.

  1. Benchmark: koliko tokena u sekundi zaista dobijaš — kako se meri i sa čim se poredi.
  2. Monitoring inferencije sa Prometheusom i Grafanom — metrike GPU-a i servisa na jednom mestu.
  3. Deploy modela na Kubernetes — GPU node-ovi, resource limiti i skaliranje.
  4. Bezbednost: prompt injection i curenje podataka — zašto self-hosting nije automatski siguran.
  5. Sopstveni server ili API — realan obračun troškova — hardver, struja i vreme naspram računa po tokenu.

Faza 6 — Napredne teme

Zaokruživanje serijala i pravci u kojima dalje možeš da ideš.

  1. MCP — kako model dobija pristup tvojim alatima — standard za povezivanje sa spoljnim servisima.
  2. Fine-tuning za administratore: kada ima smisla — LoRA, priprema podataka i realna očekivanja.
  3. Praktičan primer od A do Š: AI asistent za sopstveni server — sve iz serijala spojeno u jedno rešenje.

Kako pratiti serijal

Ako ti je cilj da što pre dobiješ model koji radi, kreni od Faze 2 i Faze 3, a uvodne tekstove čitaj usput. Ako te zanima šira slika, idi redom od prvog teksta.

Ako već imaš postavku koja radi, a zanima te šta bi trebalo da doradiš, kreni od teksta o bezbednosti — u njemu je lista od dvanaest provera.

Najbrža moguća putanja do rezultata: drajveri → Ollama → API → skripte.

Napomena: pregled modela je jedini tekst koji ima rok trajanja, jer se spisak menja na svakih nekoliko meseci. Sve ostalo je pisano tako da važi i dalje.


Povezane stranice:

Comments

Popular posts from this blog

Početak u Linuxu — šta je i zašto se uči

groupadd

Konverzija tipova podataka u Pythonu