Pregled aktuelnih open-weight modela (avgust 2026)

Ovo je jedini tekst u serijalu koji ima rok trajanja. Sve ostalo — kako radi inferencija, kako se instalira Ollama, kako se štiti API — važiće i za dve godine. Spisak modela neće.

Stanje opisano ovde je od avgusta 2026. Da bi se steklo osećanje za tempo: tokom 2026. Alibaba je izbacio tri generacije Qwena, jedna je ostala zatvorena, a poslednja je stigla sredinom avgusta. Zato ovaj tekst ima dva dela — konkretne modele, koji zastarevaju, i način razmišljanja o izboru, koji ne zastareva. Drugi deo je važniji.

Ako još nisi pročitao tekst o otvorenim i zatvorenim modelima, prođi ga prvo, jer se ovde oslanjam na podelu licenci odatle.

Kako se čita naziv modela

Qwen3.8-27B-Instruct
│    │   │   └── obučen za praćenje uputstava
│    │   └────── 27 milijardi parametara, dense
│    └────────── generacija
└─────────────── porodica

Qwen3.8-2.4T-A95B
              │  └── 95 milijardi aktivnih po tokenu
              └───── 2.4 biliona ukupno (MoE)

Oznaka A je ono što se najčešće pogrešno pročita. Kod MoE modela u memoriju mora da stane ukupan broj parametara, a brzina odgovara aktivnom delu. Model označen kao 2.4T-A95B nije „model od 95 milijardi" — on je model od 2.4 biliona koji radi brzinom modela od 95 milijardi.

Izbor po hardveru

Praktičan redosled je uvek isti: prvo utvrdi šta tvoja kartica nosi, pa tek onda gledaj spisak. Brojevi ispod su za Q4_K_M kvantizaciju i odnose se samo na težine — na to ide keš konteksta, koji računa tekst o proceni VRAM-a.

Raspoloživo Klasa modela Za šta je upotrebljivo
Bez kartice, samo procesor 1B – 4B Klasifikacija, izvlačenje podataka iz teksta, prosti zadaci
8 GB VRAM 7B – 9B Sažimanje, analiza logova, pomoć u terminalu
16 GB VRAM 12B – 20B Solidan opšti asistent, jednostavniji kod
24 GB VRAM 27B – 35B Ozbiljan rad, kod, duži kontekst — najbolji odnos ulaganja i rezultata
48 – 80 GB VRAM 70B – 120B Blizu komercijalnih modela na većini zadataka
Više serverskih kartica 400B i naviše Vrh otvorenog sveta, retko izvodljivo u jednoj firmi

Kartica od 24 GB je slatka tačka i to se nije promenilo već duže vreme. Ispod nje gubiš previše, iznad nje cena raste brže od koristi.

Porodice modela

Qwen (Alibaba)

Najšira porodica i najbezbedniji podrazumevani izbor, jer ista arhitektura izlazi u svim veličinama — od modela za telefon do flagship MoE varijante. Zbog toga oko nje postoji i najviše kvantizacija, uputstava i gotovih recepata za pokretanje.

Aktuelna generacija je Qwen 3.8. Dense varijanta od 27B je pod Apache 2.0, prima sliku i video, ima kontekst od 262 hiljade tokena i staje u oko 17 GB u Q4_K_M — dakle udobno na karticu od 24 GB. Flagship varijanta sa 2.4 biliona ukupnih parametara je takođe otvorena, ali pod posebnom licencom koja nije Apache, i traži klaster.

Ako biraš na slepo i imaš karticu od 24 GB, ovo je model od koga se kreće.

GLM (Z.ai)

GLM-5.2 je MoE sa 754 milijarde ukupnih i 40 milijardi aktivnih parametara, pod čistom MIT licencom i sa kontekstom od milion tokena. Više nezavisnih poređenja ga stavlja na vrh onoga što se realno može hostovati na jednoj mašini, naročito za rad sa kodom i duge agentske zadatke.

Zahtev je ozbiljan — računaj na nekoliko serverskih kartica. Ali licenca je najčistija u ovoj klasi, što ga čini prvim kandidatom kada firma ima hardver i pravnika koji ne voli iznenađenja.

DeepSeek

DeepSeek-V4 je frontier MoE sa oko 1.6 biliona ukupnih i pedesetak milijardi aktivnih parametara, sa milionskim kontekstom. Porodica je poznata po permisivnom licenciranju i po tome što je vratila rasuđivanje u otvoreni svet. Za samostalan hosting je prevelik za većinu, ali se lako nalazi kroz jeftine API servise i community kvantizacije.

gpt-oss (OpenAI)

Dve veličine, 120B i 20B, obe pod Apache 2.0. Njihova prednost je odnos sposobnosti i hardvera: veća varijanta staje na jednu serversku karticu od 80 GB, manja u šesnaest gigabajta. Modeli su tekstualni — ako ti treba obrada slika, gledaj drugu porodicu.

Gemma (Google)

Gemma 4 je prešla na Apache 2.0, što je bila najveća licencna vest te porodice. Jaka je u malim i srednjim veličinama, sa nativnom obradom slike, a pojedine varijante primaju i zvuk. Dobar izbor kada ti treba multimodalnost na jednoj potrošačkoj kartici.

Mistral

Evropska porodica, bitna svima kojima je važno gde podaci fizički stoje i ko stoji iza modela. Mistral Small 4 je efikasan MoE pod Apache 2.0, sa kontekstom od 256 hiljada tokena i multimodalnošću. Postoji i veći otvoreni flagship pod izmenjenom MIT licencom. Mistral svoje modele izričito označava kao otvorene ili isključivo API — pogledaj oznaku pre nego što planiraš hosting.

Llama (Meta)

Porodica koja je otvorila celu ovu oblast i i dalje ima ogroman ekosistem alata i fine-tune varijanti. Licenca nije Apache ni MIT nego Metina zajedničarska, sa uslovima koje treba pročitati — među njima i prag broja korisnika. Nije prepreka za većinu, ali jeste stvar koju svesno prihvataš.

Kimi (Moonshot)

Kimi K3 drži vrh otvorenih rang-lista, sa 2.8 biliona ukupnih i oko 104 milijarde aktivnih parametara. Na približno 1.4 terabajta on je, iskreno rečeno, API model koji se slučajno može preuzeti. Licenca je pisana po meri. Vredi znati da postoji; hostovaće ga malo ko.

Licence na jednom mestu

Porodica Licenca Komercijalno bez uslova
Qwen (manje i srednje veličine) Apache 2.0 Da
Qwen flagship Posebna licenca Pročitati uslove
GLM-5.2 MIT Da
gpt-oss Apache 2.0 Da
Gemma 4 Apache 2.0 Da
Mistral (otvorena linija) Apache 2.0 ili izmenjena MIT Uglavnom da
Llama 4 Meta community Uz uslove i prag korisnika
Kimi K3 Posebna licenca Pročitati uslove

Tabela je orijentir, ne pravni savet. Licence se menjaju između verzija istog modela, u oba smera — Gemma je prešla na permisivniju, pojedine porodice su išle obrnuto. Uvek proveri LICENSE fajl one verzije koju stvarno preuzimaš.

Specijalizovani modeli

Opšti model nije uvek pravi alat.

  • Modeli za kod — obučeni na velikom udelu izvornog koda, sa naglaskom na rad kroz više fajlova i pozivanje alata. Za pomoć pri programiranju nadmašuju opšti model iste veličine.
  • Embedding modeli — ne generišu tekst nego prave numerički zapis značenja. Mali su, brzi i neophodni za RAG. Model za razgovor ovaj posao ne radi.
  • Vision modeli — primaju sliku uz tekst. Korisno za čitanje snimaka ekrana, dijagrama i skeniranih dokumenata.
  • Reasoning varijante — troše dodatne tokene na razmišljanje pre odgovora. Tačnije su na složenim zadacima, ali sporije i skuplje po upitu.

Kako sam da proveriš stanje

Pošto spisak zastareva, važnije je znati gde se gleda nego zapamtiti imena.

  • Ollama biblioteka modela — ono što je spremno za pokretanje jednom komandom, sa veličinama kvantizacija.
  • Hugging Face, sortiranje po preuzimanjima u poslednjih mesec dana — najbolji pokazatelj šta ljudi zaista koriste, za razliku od onoga o čemu se piše.
  • Nezavisne rang-liste — korisne za grubo poređenje, ali im ne veruj do decimale; testovi se optimizuju.
  • Sopstveni test — jedini merodavan. Uzmi dvadesetak stvarnih upita sa svog posla i propusti ih kroz dva kandidata.

To poslednje je ključno. Rang-lista meri prosečnog korisnika na engleskom; ti imaš svoje logove, svoju dokumentaciju i najčešće srpski jezik u igri. Model koji je drugi na listi ume da bude prvi na tvom poslu. Kako se meri brzina, pokazuje tekst o benchmarku.

Praktični scenariji

Scenario 1: kartica od 24 GB, opšta upotreba

Uzmi dense model klase 27B iz Qwen ili Gemma porodice, u Q4_K_M. Ostavi bar pet gigabajta za kontekst. Ovo pokriva ogromnu većinu potreba.

Scenario 2: server bez grafičke kartice

Model klase 4B na procesoru radi, ali sporo — računaj na nekoliko tokena u sekundi. Upotrebljivo za obradu u pozadini, neupotrebljivo za razgovor. Više u tekstu o CPU i GPU inferenciji.

Scenario 3: model za rad na srpskom

Sve velike porodice deklarišu podršku za višejezičnost, ali kvalitet na našem jeziku osetno varira i retko je meren. Testiraj sam, na svojim tekstovima. Po pravilu veći model bolje podnosi našu morfologiju od manjeg iz iste porodice.

Scenario 4: proizvod koji ide u prodaju

Suzi izbor na Apache 2.0 i MIT, pa tek onda biraj po kvalitetu. Uštedećeš sebi razgovor koji ne želiš da vodiš kasnije.

Scenario 5: model iz teksta više ne postoji

Očekivano. Pređi na deo o tome kako se proverava stanje, primeni tabelu po hardveru i biraj tekuću generaciju iste porodice.

Kratka referenca

  • Qwen — najšira porodica, dobar podrazumevani izbor, uglavnom Apache 2.0
  • GLM — vrh onoga što se hostuje na jednoj mašini, MIT licenca
  • DeepSeek — frontier MoE, permisivan, prevelik za većinu
  • gpt-oss — najbolji odnos sposobnosti i hardvera, Apache 2.0, samo tekst
  • Gemma — jaka u malim veličinama, multimodalna, Apache 2.0
  • Mistral — evropska, efikasna, otvorena i API linija odvojene
  • Llama — najveći ekosistem, licenca sa uslovima
  • Kimi — vrh rang-lista, zahteva klaster
  • Oznaka A — aktivni parametri kod MoE modela; memorija ide po ukupnom broju
  • 24 GB VRAM — najbolji odnos ulaganja i rezultata
  • Provera stanja — Ollama biblioteka, Hugging Face po preuzimanjima, sopstveni test

Vežba

  1. Za model označen kao 122B-A10B izračunaj potrebnu memoriju u Q4 i objasni zašto brzina ne odgovara toj veličini.
  2. Utvrdi koliko VRAM-a imaš na raspolaganju i odredi klasu modela iz tabele.
  3. Otvori Hugging Face, sortiraj tekstualne modele po preuzimanjima u poslednjih mesec dana i uporedi prvih pet sa spiskom iz ovog teksta.
  4. Sastavi listu od dvadeset stvarnih upita sa svog posla. To je tvoj test za sve buduće modele — sačuvaj je.
  5. Izaberi dva modela iste veličine iz različitih porodica i pronađi im licence. Koji bi pustio u komercijalni proizvod i zašto?

Sledeći tekst u serijalu: Koliko VRAM-a ti stvarno treba

Povezano:

Comments

Popular posts from this blog

Početak u Linuxu — šta je i zašto se uči

Konverzija tipova podataka u Pythonu

groupadd