Posts

nvidia-smi i nvtop — praćenje GPU-a iz terminala

Kada model radi sporije nego što bi trebalo, odgovor je gotovo uvek u ispisu nvidia-smi . Problem je što taj ispis na prvi pogled deluje kao gomila brojeva bez hijerarhije, pa se gleda samo zauzeće memorije — a to je često najmanje zanimljiva kolona. Ovaj tekst objašnjava šta se stvarno čita, kojim redom i šta koja vrednost znači za inferenciju. Anatomija ispisa $ nvidia-smi +-----------------------------------------------------------------------------+ | NVIDIA-SMI 570.133.07 Driver Version: 570.133.07 CUDA Version: 12.8 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | |===============================+======================+======================| | 0 NVIDIA GeForce RTX 3090 On | 00000000:01:00.0 Off | N/A | | 68% 71C P2 287W / 350W | 18432MiB / 24576...

Instalacija NVIDIA drajvera i CUDA toolkit-a na Linux serveru

Bez ispravnog drajvera nijedan alat iz ovog serijala neće videti grafičku karticu. Neće prijaviti grešku — samo će tiho preći na procesor i raditi deset puta sporije, o čemu govori prethodni tekst . Postupak je kratak kada se zna redosled, i mučan kada se ne zna. Ovaj tekst pokriva četiri distribucije, proveru da je sve stvarno legalo i tri greške koje odnose najviše vremena. Šta ti zapravo treba Ovde se gubi najviše vremena bez potrebe, pa da odmah raščistimo. Komponenta Šta radi Treba li ti Kernel drajver Omogućava sistemu da vidi karticu Uvek CUDA runtime Biblioteke za izvršavanje CUDA koda Dolazi uz drajver CUDA toolkit Kompajler nvcc i razvojna zaglavlja Samo ako sam kompajliraš Za Ollamu i vLLM dovoljan je drajver. Toolkit od nekoliko gigabajta koji svi instaliraju „za svaki slučaj" treba ti tek ako kompajliraš llama.cpp iz izvornog koda . Kreni bez njega. Verzija drajvera odre...

CPU inferencija naspram GPU inferencije

Pitanje „može li ovo bez grafičke kartice" ima kratak odgovor: može, i to na svakom serveru koji imaš. Duži odgovor je da razlika u brzini nije nekoliko procenata nego red veličine, i da to menja spisak zadataka za koje je model upotrebljiv. Ovaj tekst objašnjava odakle razlika dolazi, gde je granica upotrebljivosti i kako se prepoznaje najgori slučaj — postavka u kojoj model radi delom na kartici, a delom na procesoru, i to bez tvog znanja. Odakle razlika Uobičajeno objašnjenje je da kartica ima više jezgara. Tačno je, ali nije glavni razlog. Inferencija je ograničena propusnošću memorije, ne računom. Da bi model izbacio jedan token, mora da pročita sve svoje težine iz memorije. Model od 16 GB znači šesnaest gigabajta pročitanih po tokenu. Sa dvadeset tokena u sekundi to je preko trista gigabajta u sekundi, samo za čitanje. Tip memorije Okvirna propusnost DDR4, dvokanalno 40 – 50 GB/s DDR5, dvokanalno 70 – 90 GB/s ...

Koliko VRAM-a ti stvarno treba

Najčešća greška pri prvom pokretanju modela ide ovako: čovek pogleda veličinu fajla, uporedi je sa memorijom kartice, vidi da staje — i onda mu sve pukne na trećoj poruci u razgovoru. Razlog je jednostavan. Težine su samo jedna od tri stavke koje troše VRAM , a ona jedina koja je konstantna. Druge dve rastu tokom rada. Ovaj tekst pokazuje kako se sve tri izračunaju unapred, pa da znaš šta ti hardver nosi pre nego što potrošiš vreme na preuzimanje. Ako ti pojmovi KV keš i kvantizacija još ne znače mnogo, pri ruci drži rečnik AI pojmova . Tri stavke Ukupno zauzeće = težine + KV keš + režija težine — konstantne, zavise od modela i kvantizacije KV keš — raste sa dužinom konteksta i brojem korisnika režija — CUDA kontekst, aktivacije, sam servis (oko 1 GB) Zapamti ovaj obrazac. Sve dalje u tekstu je razrada njegova tri člana. 1. Težine Veličina fajla je broj parametara pomnožen brojem bajtova po parametru. Bajtovi zavise od kvantizacije. Kvantizacija ...

Pregled aktuelnih open-weight modela (avgust 2026)

Ovo je jedini tekst u serijalu koji ima rok trajanja. Sve ostalo — kako radi inferencija, kako se instalira Ollama, kako se štiti API — važiće i za dve godine. Spisak modela neće. Stanje opisano ovde je od avgusta 2026. Da bi se steklo osećanje za tempo: tokom 2026. Alibaba je izbacio tri generacije Qwena, jedna je ostala zatvorena, a poslednja je stigla sredinom avgusta. Zato ovaj tekst ima dva dela — konkretne modele, koji zastarevaju, i način razmišljanja o izboru, koji ne zastareva. Drugi deo je važniji. Ako još nisi pročitao tekst o otvorenim i zatvorenim modelima , prođi ga prvo, jer se ovde oslanjam na podelu licenci odatle. Kako se čita naziv modela Qwen3.8-27B-Instruct │ │ │ └── obučen za praćenje uputstava │ │ └────── 27 milijardi parametara, dense │ └────────── generacija └─────────────── porodica Qwen3.8-2.4T-A95B │ └── 95 milijardi aktivnih po tokenu └───── 2.4 biliona ukupno (MoE) Oznaka A je ono što se najčešće pog...

Otvoreni i zatvoreni modeli — šta možeš da hostuješ na svom serveru

Prva odluka u svakom AI projektu nije koji model, nego gde model radi. Sve ostalo — hardver, budžet, bezbednosna politika, pa i to koliko posla imaš — sledi iz tog izbora. Podela se u razgovoru najčešće svede na „otvoreni" i „zatvoreni", ali to je previše grubo. Postoje tri različite stvari koje ljudi zovu otvorenim, i jedna od njih ti ne daje ništa. Ako ti terminologija još nije sasvim jasna, pri ruci drži rečnik AI pojmova . Tri nivoa otvorenosti Zatvoren model postoji samo kao servis. Šalješ zahtev na tuđi API, dobijaš odgovor, plaćaš po tokenu. Težine ne vidiš i ne možeš ih preuzeti. Ovde spadaju najpoznatija komercijalna imena. Open-weight model ima težine dostupne za preuzimanje. Skineš fajlove, pokreneš ih na svom serveru i dalje ne zavisiš ni od koga. Ono što se ne objavljuje je skup podataka na kome je model treniran i kod kojim je treniran — dobio si rezultat, ne recept. Open source model u strogom smislu znači da su objavljeni i težine, i podaci, i po...

Rečnik AI pojmova za sistem inženjere

Dokumentacija alata za pokretanje AI modela pretpostavlja da ti je terminologija poznata. Nije, i nema razloga da bude — reč je o oblasti koja je svoj rečnik gradila u istraživačkim radovima, pa ga onda prosula po README fajlovima. Ovaj tekst je referenca na koju ćeš se vraćati kroz ceo serijal. Nije za čitanje u jednom dahu; prođi ga jednom da vidiš šta gde stoji, pa se vrati kada ti neki pojam zatreba. Ako još nisi pročitao šta je AI model , počni odatle, jer se ovde na taj tekst oslanjam. Model i njegovi fajlovi LLM ( large language model , veliki jezički model) je opšti naziv za modele koji obrađuju i generišu tekst. Kada u ovom serijalu piše „model", misli se na LLM, osim ako nije izričito rečeno drugačije. Parametri ili težine su brojevi koji čine model. Oznaka u nazivu govori koliko ih ima: 8B je osam milijardi, 27B dvadeset sedam milijardi. MoE ( mixture of experts ) je arhitektura kod koje se za svaki token aktivira samo deo mreže. Zato ćeš viđati zapise pop...