AI na Linux serveru

Veštačka inteligencija je za sistem inženjera pre svega još jedan servis koji treba instalirati, konfigurisati, obezbediti i nadgledati. Ovaj serijal upravo tako i pristupa temi: bez marketinga i bez matematike, sa fokusom na to kako se otvoreni AI modeli pokreću na Linux serveru i kako se stvarno koriste u svakodnevnom radu.

Kroz šest faza ideš od osnovnih pojmova, preko pripreme hardvera i instalacije alata, do integracije modela u sopstvene skripte i produkcione postavke.

Za koga je ovaj serijal

  • Sistem inženjere i administratore koji žele AI model na sopstvenoj infrastrukturi, bez slanja podataka trećim stranama.
  • DevOps inženjere koji AI uvode u postojeći stack (Docker, Kubernetes, CI/CD).
  • Sve koji žele da razumeju šta se krije iza pojmova LLM, token, kvantizacija i inferencija.

Preduslovi: osnovno snalaženje u terminalu, rad sa paketima i systemd servisima. Ako ti to nedostaje, prvo prođi Linux osnove (link dodati).

Faza 1 — Uvod: šta AI zapravo jeste

Pojmovi i pregled tržišta. Bez ovog dela kasnije nećeš znati koji model uopšte da preuzmeš.

  1. Šta je AI model — objašnjenje za sistem inženjere, bez matematike — kako model funkcioniše iz ugla nekoga ko ga hostuje. (u pripremi)
  2. Rečnik AI pojmova: token, kontekst, parametri, temperatura — mali podsetnik na koji ćeš se vraćati kroz ceo serijal. (u pripremi)
  3. Otvoreni i zatvoreni modeli — šta možeš da hostuješ na svom serveru — open-weight, licence i praktične posledice. (u pripremi)
  4. Pregled aktuelnih open-weight modela — Qwen, GLM, DeepSeek, gpt-oss, Gemma i Mistral, i za šta je koji dobar. (u pripremi)

Faza 2 — Priprema servera

Hardver, drajveri i realna procena onoga što tvoj server može da izgura.

  1. Koliko VRAM-a ti stvarno treba — kako izračunati zahteve modela pre nego što ga preuzmeš. (u pripremi)
  2. CPU inferencija naspram GPU inferencije — kada je koja dovoljna i koliko je razlika velika. (u pripremi)
  3. Instalacija NVIDIA drajvera i CUDA toolkit-a na Linux serveru — Debian/Ubuntu i RHEL/Fedora, korak po korak. (u pripremi)
  4. nvidia-smi i nvtop — praćenje GPU-a iz terminala — šta znače kolone i kako se prepoznaje zagušenje. (u pripremi)
  5. Kvantizacija u praksi: GGUF, Q4_K_M i AWQ — kako da model stane u manje memorije i šta se pritom gubi. (u pripremi)

Faza 3 — Instalacija i pokretanje

Središnji deo serijala. Od prazne mašine do modela koji odgovara na zahteve.

  1. Ollama: instalacija na Linux serveru od nule — najbrži put do prvog modela koji radi. (u pripremi)
  2. Ollama kao systemd servis — pokretanje na boot, mrežni pristup i podešavanje varijabli okruženja. (u pripremi)
  3. llama.cpp — kompajliranje iz izvornog koda i pokretanje llama-server — puna kontrola nad parametrima inferencije. (u pripremi)
  4. Hugging Face CLI — preuzimanje modela i organizacija na disku — gde modeli žive i kako da ti disk ne pukne. (u pripremi)
  5. vLLM — produkciona inferencija sa više paralelnih zahteva — kada Ollama više nije dovoljna. (u pripremi)
  6. Ollama u Dockeru sa GPU passthrough-om — nvidia-container-toolkit i izolovano okruženje. (u pripremi)
  7. Open WebUI — web interfejs za tvoje lokalne modele — pristup iz pregledača, korisnički nalozi, istorija razgovora. (u pripremi)

Faza 4 — Korišćenje i integracija

Model koji radi je tek pola posla. Ovde ga uvodiš u svakodnevni rad na serveru.

  1. OpenAI-kompatibilan API na svom serveru — prvi zahtevi kroz curl i struktura odgovora. (u pripremi)
  2. Nginx reverse proxy i HTTPS ispred lokalnog LLM-a — siguran pristup spolja. (u pripremi)
  3. Zaštita API-ja: ključevi, firewall i ograničavanje pristupa — zašto otvoren port sa modelom nije bezazlen. (u pripremi)
  4. Python skripta koja komunicira sa lokalnim modelom — osnovni klijent koji dalje nadograđuješ. (u pripremi)
  5. AI u bash skriptama — automatska analiza logova — model kao još jedna karika u pipe-u. (u pripremi)
  6. journalctl i LLM: objašnjenje sistemskih grešaka jednom komandom — praktična alatka koju ćeš zaista koristiti. (u pripremi)
  7. RAG nad sopstvenom dokumentacijom — embeddings, vektorska baza i odgovori zasnovani na tvojim fajlovima. (u pripremi)

Faza 5 — Produkcija

Merenje, nadzor, bezbednost i trošak. Deo koji odvaja demo od servisa.

  1. Benchmark lokalnog modela: koliko tokena u sekundi zaista dobijaš — kako se meri i sa čim se poredi. (u pripremi)
  2. Monitoring inferencije sa Prometheusom i Grafanom — metrike GPU-a i servisa na jednom mestu. (u pripremi)
  3. Deploy modela na Kubernetes — GPU node-ovi, resource limiti i skaliranje. (u pripremi)
  4. Bezbednost: prompt injection i curenje podataka — zašto self-hosting nije automatski siguran. (u pripremi)
  5. Sopstveni server ili API — realan obračun troškova — struja, hardver i amortizacija naspram računa po tokenu. (u pripremi)

Faza 6 — Napredne teme

Zaokruživanje serijala i pravci u kojima dalje možeš da ideš.

  1. MCP (Model Context Protocol) — kako model dobija pristup tvojim alatima — standard za povezivanje modela sa spoljnim servisima. (u pripremi)
  2. Fine-tuning za administratore: kada ima smisla, a kada ne — LoRA, priprema podataka i realna očekivanja. (u pripremi)
  3. Praktičan primer od A do Š: AI asistent za sopstveni server — sve iz serijala spojeno u jedno rešenje. (u pripremi)

Kako pratiti serijal

Ako ti je cilj da što pre dobiješ model koji radi, kreni od Faze 2 i Faze 3, a uvodne tekstove čitaj usput. Ako te zanima šira slika, idi redom od prvog posta.

Serijal se dopunjava, pa ovu stranicu drži u obeleživačima — svaki novi tekst se dodaje ovde.


Povezane stranice:

  • Počni odavde — uvod u blog i redosled učenja (link dodati)
  • Linux osnove — komande i pojmovi koji su preduslov za ovaj serijal (link dodati)
  • Administracija i servisi — systemd, mreža, korisnici i logovi (link dodati)
  • DevOps — Docker, Kubernetes i automatizacija (link dodati)
  • Programiranje — Bash, Python i skriptovanje (link dodati)

Comments

Popular posts from this blog

Početak u Linuxu — šta je i zašto se uči

Konverzija tipova podataka u Pythonu

groupadd