AI na Linux serveru
Veštačka inteligencija je za sistem inženjera pre svega još jedan servis koji treba instalirati, konfigurisati, obezbediti i nadgledati. Ovaj serijal upravo tako i pristupa temi: bez marketinga i bez matematike, sa fokusom na to kako se otvoreni AI modeli pokreću na Linux serveru i kako se stvarno koriste u svakodnevnom radu.
Kroz šest faza ideš od osnovnih pojmova, preko pripreme hardvera i instalacije alata, do integracije modela u sopstvene skripte i produkcione postavke.
Za koga je ovaj serijal
- Sistem inženjere i administratore koji žele AI model na sopstvenoj infrastrukturi, bez slanja podataka trećim stranama.
- DevOps inženjere koji AI uvode u postojeći stack (Docker, Kubernetes, CI/CD).
- Sve koji žele da razumeju šta se krije iza pojmova LLM, token, kvantizacija i inferencija.
Preduslovi: osnovno snalaženje u terminalu, rad sa paketima i systemd servisima. Ako ti to nedostaje, prvo prođi Linux osnove (link dodati).
Faza 1 — Uvod: šta AI zapravo jeste
Pojmovi i pregled tržišta. Bez ovog dela kasnije nećeš znati koji model uopšte da preuzmeš.
- Šta je AI model — objašnjenje za sistem inženjere, bez matematike — kako model funkcioniše iz ugla nekoga ko ga hostuje. (u pripremi)
- Rečnik AI pojmova: token, kontekst, parametri, temperatura — mali podsetnik na koji ćeš se vraćati kroz ceo serijal. (u pripremi)
- Otvoreni i zatvoreni modeli — šta možeš da hostuješ na svom serveru — open-weight, licence i praktične posledice. (u pripremi)
- Pregled aktuelnih open-weight modela — Qwen, GLM, DeepSeek, gpt-oss, Gemma i Mistral, i za šta je koji dobar. (u pripremi)
Faza 2 — Priprema servera
Hardver, drajveri i realna procena onoga što tvoj server može da izgura.
- Koliko VRAM-a ti stvarno treba — kako izračunati zahteve modela pre nego što ga preuzmeš. (u pripremi)
- CPU inferencija naspram GPU inferencije — kada je koja dovoljna i koliko je razlika velika. (u pripremi)
- Instalacija NVIDIA drajvera i CUDA toolkit-a na Linux serveru — Debian/Ubuntu i RHEL/Fedora, korak po korak. (u pripremi)
- nvidia-smi i nvtop — praćenje GPU-a iz terminala — šta znače kolone i kako se prepoznaje zagušenje. (u pripremi)
- Kvantizacija u praksi: GGUF, Q4_K_M i AWQ — kako da model stane u manje memorije i šta se pritom gubi. (u pripremi)
Faza 3 — Instalacija i pokretanje
Središnji deo serijala. Od prazne mašine do modela koji odgovara na zahteve.
- Ollama: instalacija na Linux serveru od nule — najbrži put do prvog modela koji radi. (u pripremi)
- Ollama kao systemd servis — pokretanje na boot, mrežni pristup i podešavanje varijabli okruženja. (u pripremi)
- llama.cpp — kompajliranje iz izvornog koda i pokretanje llama-server — puna kontrola nad parametrima inferencije. (u pripremi)
- Hugging Face CLI — preuzimanje modela i organizacija na disku — gde modeli žive i kako da ti disk ne pukne. (u pripremi)
- vLLM — produkciona inferencija sa više paralelnih zahteva — kada Ollama više nije dovoljna. (u pripremi)
- Ollama u Dockeru sa GPU passthrough-om — nvidia-container-toolkit i izolovano okruženje. (u pripremi)
- Open WebUI — web interfejs za tvoje lokalne modele — pristup iz pregledača, korisnički nalozi, istorija razgovora. (u pripremi)
Faza 4 — Korišćenje i integracija
Model koji radi je tek pola posla. Ovde ga uvodiš u svakodnevni rad na serveru.
- OpenAI-kompatibilan API na svom serveru — prvi zahtevi kroz curl i struktura odgovora. (u pripremi)
- Nginx reverse proxy i HTTPS ispred lokalnog LLM-a — siguran pristup spolja. (u pripremi)
- Zaštita API-ja: ključevi, firewall i ograničavanje pristupa — zašto otvoren port sa modelom nije bezazlen. (u pripremi)
- Python skripta koja komunicira sa lokalnim modelom — osnovni klijent koji dalje nadograđuješ. (u pripremi)
- AI u bash skriptama — automatska analiza logova — model kao još jedna karika u pipe-u. (u pripremi)
- journalctl i LLM: objašnjenje sistemskih grešaka jednom komandom — praktična alatka koju ćeš zaista koristiti. (u pripremi)
- RAG nad sopstvenom dokumentacijom — embeddings, vektorska baza i odgovori zasnovani na tvojim fajlovima. (u pripremi)
Faza 5 — Produkcija
Merenje, nadzor, bezbednost i trošak. Deo koji odvaja demo od servisa.
- Benchmark lokalnog modela: koliko tokena u sekundi zaista dobijaš — kako se meri i sa čim se poredi. (u pripremi)
- Monitoring inferencije sa Prometheusom i Grafanom — metrike GPU-a i servisa na jednom mestu. (u pripremi)
- Deploy modela na Kubernetes — GPU node-ovi, resource limiti i skaliranje. (u pripremi)
- Bezbednost: prompt injection i curenje podataka — zašto self-hosting nije automatski siguran. (u pripremi)
- Sopstveni server ili API — realan obračun troškova — struja, hardver i amortizacija naspram računa po tokenu. (u pripremi)
Faza 6 — Napredne teme
Zaokruživanje serijala i pravci u kojima dalje možeš da ideš.
- MCP (Model Context Protocol) — kako model dobija pristup tvojim alatima — standard za povezivanje modela sa spoljnim servisima. (u pripremi)
- Fine-tuning za administratore: kada ima smisla, a kada ne — LoRA, priprema podataka i realna očekivanja. (u pripremi)
- Praktičan primer od A do Š: AI asistent za sopstveni server — sve iz serijala spojeno u jedno rešenje. (u pripremi)
Kako pratiti serijal
Ako ti je cilj da što pre dobiješ model koji radi, kreni od Faze 2 i Faze 3, a uvodne tekstove čitaj usput. Ako te zanima šira slika, idi redom od prvog posta.
Serijal se dopunjava, pa ovu stranicu drži u obeleživačima — svaki novi tekst se dodaje ovde.
Povezane stranice:
- Počni odavde — uvod u blog i redosled učenja (link dodati)
- Linux osnove — komande i pojmovi koji su preduslov za ovaj serijal (link dodati)
- Administracija i servisi — systemd, mreža, korisnici i logovi (link dodati)
- DevOps — Docker, Kubernetes i automatizacija (link dodati)
- Programiranje — Bash, Python i skriptovanje (link dodati)
Comments
Post a Comment