Pregled aktuelnih open-weight modela (avgust 2026)
Ovo je jedini tekst u serijalu koji ima rok trajanja. Sve ostalo — kako radi inferencija, kako se instalira Ollama, kako se štiti API — važiće i za dve godine. Spisak modela neće.
Stanje opisano ovde je od avgusta 2026. Da bi se steklo osećanje za tempo: tokom 2026. Alibaba je izbacio tri generacije Qwena, jedna je ostala zatvorena, a poslednja je stigla sredinom avgusta. Zato ovaj tekst ima dva dela — konkretne modele, koji zastarevaju, i način razmišljanja o izboru, koji ne zastareva. Drugi deo je važniji.
Ako još nisi pročitao tekst o otvorenim i zatvorenim modelima, prođi ga prvo, jer se ovde oslanjam na podelu licenci odatle.
Kako se čita naziv modela
Qwen3.8-27B-Instruct
│ │ │ └── obučen za praćenje uputstava
│ │ └────── 27 milijardi parametara, dense
│ └────────── generacija
└─────────────── porodica
Qwen3.8-2.4T-A95B
│ └── 95 milijardi aktivnih po tokenu
└───── 2.4 biliona ukupno (MoE)
Oznaka A je ono što se najčešće pogrešno pročita. Kod MoE modela u memoriju mora da stane ukupan broj parametara, a brzina odgovara aktivnom delu. Model označen kao 2.4T-A95B nije „model od 95 milijardi" — on je model od 2.4 biliona koji radi brzinom modela od 95 milijardi.
Izbor po hardveru
Praktičan redosled je uvek isti: prvo utvrdi šta tvoja kartica nosi, pa tek onda gledaj spisak. Brojevi ispod su za Q4_K_M kvantizaciju i odnose se samo na težine — na to ide keš konteksta, koji računa tekst o proceni VRAM-a.
| Raspoloživo | Klasa modela | Za šta je upotrebljivo |
|---|---|---|
| Bez kartice, samo procesor | 1B – 4B | Klasifikacija, izvlačenje podataka iz teksta, prosti zadaci |
| 8 GB VRAM | 7B – 9B | Sažimanje, analiza logova, pomoć u terminalu |
| 16 GB VRAM | 12B – 20B | Solidan opšti asistent, jednostavniji kod |
| 24 GB VRAM | 27B – 35B | Ozbiljan rad, kod, duži kontekst — najbolji odnos ulaganja i rezultata |
| 48 – 80 GB VRAM | 70B – 120B | Blizu komercijalnih modela na većini zadataka |
| Više serverskih kartica | 400B i naviše | Vrh otvorenog sveta, retko izvodljivo u jednoj firmi |
Kartica od 24 GB je slatka tačka i to se nije promenilo već duže vreme. Ispod nje gubiš previše, iznad nje cena raste brže od koristi.
Porodice modela
Qwen (Alibaba)
Najšira porodica i najbezbedniji podrazumevani izbor, jer ista arhitektura izlazi u svim veličinama — od modela za telefon do flagship MoE varijante. Zbog toga oko nje postoji i najviše kvantizacija, uputstava i gotovih recepata za pokretanje.
Aktuelna generacija je Qwen 3.8. Dense varijanta od 27B je pod Apache 2.0, prima sliku i video, ima kontekst od 262 hiljade tokena i staje u oko 17 GB u Q4_K_M — dakle udobno na karticu od 24 GB. Flagship varijanta sa 2.4 biliona ukupnih parametara je takođe otvorena, ali pod posebnom licencom koja nije Apache, i traži klaster.
Ako biraš na slepo i imaš karticu od 24 GB, ovo je model od koga se kreće.
GLM (Z.ai)
GLM-5.2 je MoE sa 754 milijarde ukupnih i 40 milijardi aktivnih parametara, pod čistom MIT licencom i sa kontekstom od milion tokena. Više nezavisnih poređenja ga stavlja na vrh onoga što se realno može hostovati na jednoj mašini, naročito za rad sa kodom i duge agentske zadatke.
Zahtev je ozbiljan — računaj na nekoliko serverskih kartica. Ali licenca je najčistija u ovoj klasi, što ga čini prvim kandidatom kada firma ima hardver i pravnika koji ne voli iznenađenja.
DeepSeek
DeepSeek-V4 je frontier MoE sa oko 1.6 biliona ukupnih i pedesetak milijardi aktivnih parametara, sa milionskim kontekstom. Porodica je poznata po permisivnom licenciranju i po tome što je vratila rasuđivanje u otvoreni svet. Za samostalan hosting je prevelik za većinu, ali se lako nalazi kroz jeftine API servise i community kvantizacije.
gpt-oss (OpenAI)
Dve veličine, 120B i 20B, obe pod Apache 2.0. Njihova prednost je odnos sposobnosti i hardvera: veća varijanta staje na jednu serversku karticu od 80 GB, manja u šesnaest gigabajta. Modeli su tekstualni — ako ti treba obrada slika, gledaj drugu porodicu.
Gemma (Google)
Gemma 4 je prešla na Apache 2.0, što je bila najveća licencna vest te porodice. Jaka je u malim i srednjim veličinama, sa nativnom obradom slike, a pojedine varijante primaju i zvuk. Dobar izbor kada ti treba multimodalnost na jednoj potrošačkoj kartici.
Mistral
Evropska porodica, bitna svima kojima je važno gde podaci fizički stoje i ko stoji iza modela. Mistral Small 4 je efikasan MoE pod Apache 2.0, sa kontekstom od 256 hiljada tokena i multimodalnošću. Postoji i veći otvoreni flagship pod izmenjenom MIT licencom. Mistral svoje modele izričito označava kao otvorene ili isključivo API — pogledaj oznaku pre nego što planiraš hosting.
Llama (Meta)
Porodica koja je otvorila celu ovu oblast i i dalje ima ogroman ekosistem alata i fine-tune varijanti. Licenca nije Apache ni MIT nego Metina zajedničarska, sa uslovima koje treba pročitati — među njima i prag broja korisnika. Nije prepreka za većinu, ali jeste stvar koju svesno prihvataš.
Kimi (Moonshot)
Kimi K3 drži vrh otvorenih rang-lista, sa 2.8 biliona ukupnih i oko 104 milijarde aktivnih parametara. Na približno 1.4 terabajta on je, iskreno rečeno, API model koji se slučajno može preuzeti. Licenca je pisana po meri. Vredi znati da postoji; hostovaće ga malo ko.
Licence na jednom mestu
| Porodica | Licenca | Komercijalno bez uslova |
|---|---|---|
| Qwen (manje i srednje veličine) | Apache 2.0 | Da |
| Qwen flagship | Posebna licenca | Pročitati uslove |
| GLM-5.2 | MIT | Da |
| gpt-oss | Apache 2.0 | Da |
| Gemma 4 | Apache 2.0 | Da |
| Mistral (otvorena linija) | Apache 2.0 ili izmenjena MIT | Uglavnom da |
| Llama 4 | Meta community | Uz uslove i prag korisnika |
| Kimi K3 | Posebna licenca | Pročitati uslove |
Tabela je orijentir, ne pravni savet. Licence se menjaju između verzija istog modela, u oba smera — Gemma je prešla na permisivniju, pojedine porodice su išle obrnuto. Uvek proveri LICENSE fajl one verzije koju stvarno preuzimaš.
Specijalizovani modeli
Opšti model nije uvek pravi alat.
- Modeli za kod — obučeni na velikom udelu izvornog koda, sa naglaskom na rad kroz više fajlova i pozivanje alata. Za pomoć pri programiranju nadmašuju opšti model iste veličine.
- Embedding modeli — ne generišu tekst nego prave numerički zapis značenja. Mali su, brzi i neophodni za RAG. Model za razgovor ovaj posao ne radi.
- Vision modeli — primaju sliku uz tekst. Korisno za čitanje snimaka ekrana, dijagrama i skeniranih dokumenata.
- Reasoning varijante — troše dodatne tokene na razmišljanje pre odgovora. Tačnije su na složenim zadacima, ali sporije i skuplje po upitu.
Kako sam da proveriš stanje
Pošto spisak zastareva, važnije je znati gde se gleda nego zapamtiti imena.
- Ollama biblioteka modela — ono što je spremno za pokretanje jednom komandom, sa veličinama kvantizacija.
- Hugging Face, sortiranje po preuzimanjima u poslednjih mesec dana — najbolji pokazatelj šta ljudi zaista koriste, za razliku od onoga o čemu se piše.
- Nezavisne rang-liste — korisne za grubo poređenje, ali im ne veruj do decimale; testovi se optimizuju.
- Sopstveni test — jedini merodavan. Uzmi dvadesetak stvarnih upita sa svog posla i propusti ih kroz dva kandidata.
To poslednje je ključno. Rang-lista meri prosečnog korisnika na engleskom; ti imaš svoje logove, svoju dokumentaciju i najčešće srpski jezik u igri. Model koji je drugi na listi ume da bude prvi na tvom poslu. Kako se meri brzina, pokazuje tekst o benchmarku.
Praktični scenariji
Scenario 1: kartica od 24 GB, opšta upotreba
Uzmi dense model klase 27B iz Qwen ili Gemma porodice, u Q4_K_M. Ostavi bar pet gigabajta za kontekst. Ovo pokriva ogromnu većinu potreba.
Scenario 2: server bez grafičke kartice
Model klase 4B na procesoru radi, ali sporo — računaj na nekoliko tokena u sekundi. Upotrebljivo za obradu u pozadini, neupotrebljivo za razgovor. Više u tekstu o CPU i GPU inferenciji.
Scenario 3: model za rad na srpskom
Sve velike porodice deklarišu podršku za višejezičnost, ali kvalitet na našem jeziku osetno varira i retko je meren. Testiraj sam, na svojim tekstovima. Po pravilu veći model bolje podnosi našu morfologiju od manjeg iz iste porodice.
Scenario 4: proizvod koji ide u prodaju
Suzi izbor na Apache 2.0 i MIT, pa tek onda biraj po kvalitetu. Uštedećeš sebi razgovor koji ne želiš da vodiš kasnije.
Scenario 5: model iz teksta više ne postoji
Očekivano. Pređi na deo o tome kako se proverava stanje, primeni tabelu po hardveru i biraj tekuću generaciju iste porodice.
Kratka referenca
- Qwen — najšira porodica, dobar podrazumevani izbor, uglavnom Apache 2.0
- GLM — vrh onoga što se hostuje na jednoj mašini, MIT licenca
- DeepSeek — frontier MoE, permisivan, prevelik za većinu
- gpt-oss — najbolji odnos sposobnosti i hardvera, Apache 2.0, samo tekst
- Gemma — jaka u malim veličinama, multimodalna, Apache 2.0
- Mistral — evropska, efikasna, otvorena i API linija odvojene
- Llama — najveći ekosistem, licenca sa uslovima
- Kimi — vrh rang-lista, zahteva klaster
- Oznaka A — aktivni parametri kod MoE modela; memorija ide po ukupnom broju
- 24 GB VRAM — najbolji odnos ulaganja i rezultata
- Provera stanja — Ollama biblioteka, Hugging Face po preuzimanjima, sopstveni test
Vežba
- Za model označen kao
122B-A10Bizračunaj potrebnu memoriju u Q4 i objasni zašto brzina ne odgovara toj veličini. - Utvrdi koliko VRAM-a imaš na raspolaganju i odredi klasu modela iz tabele.
- Otvori Hugging Face, sortiraj tekstualne modele po preuzimanjima u poslednjih mesec dana i uporedi prvih pet sa spiskom iz ovog teksta.
- Sastavi listu od dvadeset stvarnih upita sa svog posla. To je tvoj test za sve buduće modele — sačuvaj je.
- Izaberi dva modela iste veličine iz različitih porodica i pronađi im licence. Koji bi pustio u komercijalni proizvod i zašto?
Sledeći tekst u serijalu: Koliko VRAM-a ti stvarno treba
Povezano:
- AI na Linux serveru — pregled celog serijala
- Otvoreni i zatvoreni modeli — prethodni tekst
- Ollama: instalacija na Linux serveru — kako se ovi modeli pokreću
Comments
Post a Comment