Benchmark lokalnog modela: koliko tokena u sekundi zaista dobijaš
„Sporo je" nije podatak. Bez broja ne znaš da li je model loše izabran, da li se deo slojeva preliva na procesor, ili je sve normalno i očekivanja su bila pogrešna. Ovaj tekst pokazuje šta se meri, čime i kako se rezultat čita. Sve dalje u Fazi 5 — nadzor, kapacitet, trošak — počiva na brojevima odavde. Šta se meri Dve faze rade po različitim pravilima, kako je objašnjeno u tekstu o CPU i GPU inferenciji : Mera Šta govori Ograničena čime Prefill (pp) Brzina čitanja prompta Računom Decode (tg) Brzina generisanja odgovora Propusnošću memorije TTFT Čekanje na prvi znak Dužinom prompta Propusnost Ukupno tokena u sekundi, svi korisnici Postavkom servisa Jedan broj ne opisuje postavku. Model može da generiše šezdeset tokena u sekundi, a da korisnik čeka pola minuta na prvi znak jer je prompt dugačak. Za razgovor je bitan TTFT plus decode; za paketnu obradu jedino ukupna p...