Sopstveni server ili API — realan obračun troškova
Najčešća greška u ovoj računici je poređenje cene kartice sa mesečnim računom za API. To su različite stvari — jedna je jednokratno ulaganje, druga trošak koji teče, a između njih stoje struja, amortizacija i tvoje vreme.
Ovaj tekst postavlja obrazac u koji ubaciš svoje brojeve. Konkretne cene ovde su iz avgusta 2026. i služe kao ilustracija; metod je ono što traje.
Šta ulazi u računicu
| Sopstveni server | API |
|---|---|
| Kartica i ostatak mašine | Cena po milion tokena |
| Struja, neprekidno | — |
| Prostor, hlađenje, mreža | — |
| Postavljanje i održavanje | Integracija |
| Zamena hardvera | — |
| — | Rizik promene cene i uslova |
Red o održavanju je onaj koji se najčešće izostavi, a često je najveći.
Koliko ti tokena treba
Bez ovog broja računica ne postoji. Meri ga, ne procenjuj.
Ako već imaš postavku, podatak je u usage polju svakog odgovora, o čemu govori tekst o API-ju. Iz proxy loga se izvlači ovako:
$ awk '/chat\/completions/ {n++} END {print n" zahteva"}' \
/var/log/nginx/ai-access.log
Ako tek planiraš, računaj po slučaju upotrebe:
| Namena | Tokena po zahtevu | Mesečno |
|---|---|---|
| Pomoć u terminalu, 1 čovek | 500 – 2 000 | 1 – 3 M |
| Tim od pet ljudi | 1 000 – 4 000 | 10 – 30 M |
| Dnevna analiza logova | 5 000 – 20 000 | 0.5 – 2 M |
| Klasifikacija, 5 000 dnevno | 300 – 800 | 50 – 120 M |
| RAG nad dokumentacijom | 3 000 – 10 000 | zavisi od broja upita |
RAG je skuplji nego što deluje jer u svaki prompt ulaze pronađeni delovi. Isto i razgovor sa dugačkom istorijom — ceo dosadašnji tok se šalje ponovo pri svakoj poruci.
Strana servera
Hardver
Kartica RTX 3090, 24 GB, polovna 600 EUR
Ostatak mašine 400 EUR
Napajanje 850 W 100 EUR
---------
Ukupno 1 100 EUR
Kartica od 24 GB je i dalje najbolji odnos ulaganja i rezultata, kako stoji u pregledu modela. Nova kartica iste klase je dvostruko skuplja bez srazmerne koristi za inferenciju.
Amortizacija na tri godine: oko 30 EUR mesečno. Kartica posle tri godine i dalje radi i ima neku vrednost, pa je ovo konzervativno.
Struja
Ovde se najviše greši. Model ne troši maksimum stalno — troši ga samo dok generiše.
Mirovanje: 40 W (kartica u P8, uz ostatak sistema oko 100 W) Inferencija: 350 W Realno: 4 sata rada dnevno Dnevno: (100 W × 20 h) + (450 W × 4 h) = 2.0 + 1.8 = 3.8 kWh Mesečno: 114 kWh
Uz cenu od 0.12 EUR po kilovat-satu: oko 14 EUR mesečno. Uz 0.30 EUR, kolika je u delovima Evrope, to je 34 EUR.
Izmeri sam umesto da procenjuješ — podatak već prikupljaš ako si prošao tekst o monitoringu:
avg_over_time(DCGM_FI_DEV_POWER_USAGE[30d]) * 24 * 30 / 1000
Ograničenje potrošnje iz teksta o nvidia-smi ovde direktno štedi:
$ sudo nvidia-smi -pl 280
Tvoje vreme
Ovo je stavka koju firme uporno izostave, a često premašuje sve ostalo.
Postavljanje 16 h (jednokratno) Održavanje mesečno 2 h Otklanjanje problema 1 h Po 25 EUR/h: postavljanje 400 EUR, mesečno 75 EUR
Sedamdeset pet evra mesečno u vremenu je više nego hardver i struja zajedno. Ako to vreme ne bi bilo naplaćeno nikome, izostavi ga — ali onda budi svestan da si ga ipak potrošio.
Zbir
Amortizacija hardvera 30 EUR
Struja 14 EUR
Održavanje 75 EUR
---------
Mesečno 119 EUR
Prva godina: 1 100 + 400 + (119 × 12) = 2 928 EUR
Bez naplaćenog vremena: 44 EUR mesečno. Ta razlika je razlog zbog kog isti server nekome deluje jeftino, a nekome skupo.
Strana API-ja
Cene se razlikuju po redovima veličine, u zavisnosti od klase modela. Okvirno, za milion tokena:
| Klasa | Ulaz | Izlaz |
|---|---|---|
| Otvoreni model kod provajdera | 0.05 – 0.30 | 0.10 – 0.60 |
| Srednja klasa | 0.30 – 1.50 | 1.00 – 5.00 |
| Vrhunski modeli | 2.00 – 8.00 | 10.00 – 40.00 |
Izlaz je višestruko skuplji od ulaza, iz razloga objašnjenog u tekstu o inferenciji — prefill je brz i paralelan, decode ide token po token.
Praktična posledica: dugačak dokument u promptu je jeftin, dugačak odgovor nije. Ograničavanje max_tokens je direktna ušteda.
Za pošteno poređenje uzmi model uporediv sa onim koji bi hostovao. Model klase 8B ne poredi se sa vrhunskim komercijalnim modelom, nego sa istim tim modelom kod provajdera.
Tri primera
Jedan administrator, pomoć u terminalu
Potrošnja: 2 M tokena mesečno, odnos ulaz/izlaz 3:1 API (otvoreni model kod provajdera): 1.5 M ulaz × 0.15 = 0.23 EUR 0.5 M izlaz × 0.30 = 0.15 EUR Ukupno: 0.38 EUR mesečno Sopstveni server: 44 – 119 EUR mesečno
API je jeftiniji stostruko. Za ovaj slučaj sopstveni server ima smisla samo iz drugih razloga — privatnost, učenje, rad bez interneta.
Klasifikacija tiketa, 5 000 dnevno
Potrošnja: 90 M tokena mesečno, kratki odgovori API: 80 M ulaz × 0.15 = 12.00 EUR 10 M izlaz × 0.30 = 3.00 EUR Ukupno: 15.00 EUR mesečno Sopstveni server: 44 – 119 EUR mesečno
API i dalje jeftiniji, ali razlika više nije dramatična. Ako podaci ne smeju napolje, doplata je razumna cena.
Tim od dvadeset ljudi
Potrošnja: 400 M tokena mesečno API (srednja klasa): 300 M ulaz × 0.60 = 180 EUR 100 M izlaz × 2.00 = 200 EUR Ukupno: 380 EUR mesečno Sopstveni server (dve kartice, jači model): Hardver 2 500 EUR → 70 EUR amortizacije Struja 30 EUR Održavanje 100 EUR Ukupno: 200 EUR mesečno
Ovde se server isplati. Ulaganje se vraća za oko sedam meseci, a razlika raste sa svakim novim korisnikom.
Gde je granica
Iz ovih primera vidi se obrazac. Uz mesečni trošak servera od stotinak evra i cenu API-ja od nekoliko desetih dela evra po milionu tokena, prelomna tačka je negde oko sto do dvesta miliona tokena mesečno, uz uporedivu klasu modela.
Ispod toga API je jeftiniji, često znatno. Iznad toga server. Ali taj broj proveri sa svojim cenama — struja i satnica se razlikuju višestruko.
Ono što se ne meri novcem
Računica nije ceo argument, u oba smera.
Za server: podaci ostaju kod tebe, cena je fiksna i predvidiva, verzija modela se ne menja bez tvoje odluke, radi bez interneta, nema ograničenja broja zahteva. Kod regulisanih delatnosti prvi razlog sam zatvara raspravu.
Za API: nema kapitalnog ulaganja, pristup vrhunskim modelima koje ne možeš hostovati, nula održavanja, trenutno skaliranje. Za proveru ideje nema takmičenja.
Hibrid je ono što firme obično i završe: osetljivo i masovno na lokalnom modelu, teški i retki zadaci na API-ju. Ako ideš tim putem, pravilo šta ide kuda sprovedi u kodu, ne u dogovoru.
Skrivene stavke
Nekoliko stvari koje se pojave tek posle nekoliko meseci.
Neiskorišćenost. Kartica kupljena za osmočasovni radni dan stoji dve trećine vremena. Ako ima još poslova za nju — klaster, noćna obrada — iskoristi je.
Rezervni hardver. Kada kartica otkaže, nabavka traje. Za produkciju to znači ili rezervu, ili API kao zamenu — što je jedan od boljih argumenata za hibrid.
Rast potrošnje. Kada ljudi shvate da je besplatno, potrošnja poraste višestruko. Kod API-ja se to vidi na računu; kod servera se vidi kao red čekanja.
Zastarevanje. Model koji je danas dobar za dve godine je osrednji. Kartica ostaje ista, a zahtevi rastu.
Promena cena. API cene su u proseku padale, ali uslovi i dostupnost modela se menjaju bez tvoje saglasnosti.
Praktični scenariji
Scenario 1: šef traži broj
Izmeri stvarnu potrošnju tokena mesec dana. Sve ostalo je nagađanje.
Scenario 2: račun za API raste
Pre kupovine hardvera proveri odnos ulaza i izlaza. Skraćivanje istorije razgovora i ograničavanje max_tokens često prepolove račun.
Scenario 3: server kupljen, potrošnja mala
Nađi mu još posla — noćna obrada, klasifikacija, RAG. Kartica koja stoji je najskuplji mogući izbor.
Scenario 4: poređenje deluje nepošteno
Verovatno porediš modele različite klase. Uzmi isti model kod provajdera.
Scenario 5: računica je tesna
Onda odlučuju ostali razlozi — privatnost, predvidivost, održavanje. Kod tesne razlike novac nije argument.
Scenario 6: struja skuplja nego što si računao
$ sudo nvidia-smi -pl 280
Osamdeset posto ograničenja jedva se oseti u brzini, a osetno smanjuje potrošnju.
Kratka referenca
- Izmeri potrošnju tokena pre svake računice
- Hardver → amortizacija na tri godine
- Struja: mirovanje plus stvarno vreme rada, ne maksimum stalno
- Održavanje često premašuje hardver i struju
usagepolje — pouzdan broj tokenaavg_over_time(DCGM_FI_DEV_POWER_USAGE[30d])— stvarna potrošnja- Izlaz je višestruko skuplji od ulaza kod API-ja
- Poredi uporedive klase modela
- Prelomna tačka: oko 100 – 200 M tokena mesečno
- Ispod → API, iznad → server, uz proveru svojim cenama
nvidia-smi -pl 280— direktna ušteda na struji- Privatnost i predvidivost se ne mere novcem
Vežba
- Izmeri koliko tokena stvarno potrošiš u nedelju dana i pomnoži na mesec.
- Izračunaj mesečni trošak svog servera sa i bez naplaćenog vremena.
- Izmeri stvarnu potrošnju struje umesto da je procenjuješ.
- Nađi cenu istog modela kod tri provajdera i izračunaj mesečni račun.
- Odredi svoju prelomnu tačku u milionima tokena.
- Nabroj tri razloga van računice koji kod tebe prevagnu, u jednom ili drugom smeru.
Sledeći tekst u serijalu: MCP — kako model dobija pristup tvojim alatima
Povezano:
- AI na Linux serveru — pregled celog serijala
- Bezbednost: prompt injection i curenje podataka — prethodni tekst
- Otvoreni i zatvoreni modeli — argumenti van računice
- Monitoring inferencije — odakle brojevi za potrošnju
- Benchmark lokalnog modela — koliko kartica stvarno nosi
Comments
Post a Comment