Sopstveni server ili API — realan obračun troškova

Najčešća greška u ovoj računici je poređenje cene kartice sa mesečnim računom za API. To su različite stvari — jedna je jednokratno ulaganje, druga trošak koji teče, a između njih stoje struja, amortizacija i tvoje vreme.

Ovaj tekst postavlja obrazac u koji ubaciš svoje brojeve. Konkretne cene ovde su iz avgusta 2026. i služe kao ilustracija; metod je ono što traje.

Šta ulazi u računicu

Sopstveni server API
Kartica i ostatak mašine Cena po milion tokena
Struja, neprekidno
Prostor, hlađenje, mreža
Postavljanje i održavanje Integracija
Zamena hardvera
Rizik promene cene i uslova

Red o održavanju je onaj koji se najčešće izostavi, a često je najveći.

Koliko ti tokena treba

Bez ovog broja računica ne postoji. Meri ga, ne procenjuj.

Ako već imaš postavku, podatak je u usage polju svakog odgovora, o čemu govori tekst o API-ju. Iz proxy loga se izvlači ovako:

$ awk '/chat\/completions/ {n++} END {print n" zahteva"}' \
    /var/log/nginx/ai-access.log

Ako tek planiraš, računaj po slučaju upotrebe:

Namena Tokena po zahtevu Mesečno
Pomoć u terminalu, 1 čovek 500 – 2 000 1 – 3 M
Tim od pet ljudi 1 000 – 4 000 10 – 30 M
Dnevna analiza logova 5 000 – 20 000 0.5 – 2 M
Klasifikacija, 5 000 dnevno 300 – 800 50 – 120 M
RAG nad dokumentacijom 3 000 – 10 000 zavisi od broja upita

RAG je skuplji nego što deluje jer u svaki prompt ulaze pronađeni delovi. Isto i razgovor sa dugačkom istorijom — ceo dosadašnji tok se šalje ponovo pri svakoj poruci.

Strana servera

Hardver

Kartica RTX 3090, 24 GB, polovna     600 EUR
Ostatak mašine                       400 EUR
Napajanje 850 W                      100 EUR
                                   ---------
Ukupno                             1 100 EUR

Kartica od 24 GB je i dalje najbolji odnos ulaganja i rezultata, kako stoji u pregledu modela. Nova kartica iste klase je dvostruko skuplja bez srazmerne koristi za inferenciju.

Amortizacija na tri godine: oko 30 EUR mesečno. Kartica posle tri godine i dalje radi i ima neku vrednost, pa je ovo konzervativno.

Struja

Ovde se najviše greši. Model ne troši maksimum stalno — troši ga samo dok generiše.

Mirovanje:     40 W  (kartica u P8, uz ostatak sistema oko 100 W)
Inferencija:  350 W

Realno: 4 sata rada dnevno

Dnevno:  (100 W × 20 h) + (450 W × 4 h) = 2.0 + 1.8 = 3.8 kWh
Mesečno: 114 kWh

Uz cenu od 0.12 EUR po kilovat-satu: oko 14 EUR mesečno. Uz 0.30 EUR, kolika je u delovima Evrope, to je 34 EUR.

Izmeri sam umesto da procenjuješ — podatak već prikupljaš ako si prošao tekst o monitoringu:

avg_over_time(DCGM_FI_DEV_POWER_USAGE[30d]) * 24 * 30 / 1000

Ograničenje potrošnje iz teksta o nvidia-smi ovde direktno štedi:

$ sudo nvidia-smi -pl 280

Tvoje vreme

Ovo je stavka koju firme uporno izostave, a često premašuje sve ostalo.

Postavljanje                    16 h  (jednokratno)
Održavanje mesečno               2 h
Otklanjanje problema             1 h

Po 25 EUR/h:  postavljanje 400 EUR, mesečno 75 EUR

Sedamdeset pet evra mesečno u vremenu je više nego hardver i struja zajedno. Ako to vreme ne bi bilo naplaćeno nikome, izostavi ga — ali onda budi svestan da si ga ipak potrošio.

Zbir

Amortizacija hardvera      30 EUR
Struja                     14 EUR
Održavanje                 75 EUR
                        ---------
Mesečno                   119 EUR

Prva godina: 1 100 + 400 + (119 × 12) = 2 928 EUR

Bez naplaćenog vremena: 44 EUR mesečno. Ta razlika je razlog zbog kog isti server nekome deluje jeftino, a nekome skupo.

Strana API-ja

Cene se razlikuju po redovima veličine, u zavisnosti od klase modela. Okvirno, za milion tokena:

Klasa Ulaz Izlaz
Otvoreni model kod provajdera 0.05 – 0.30 0.10 – 0.60
Srednja klasa 0.30 – 1.50 1.00 – 5.00
Vrhunski modeli 2.00 – 8.00 10.00 – 40.00

Izlaz je višestruko skuplji od ulaza, iz razloga objašnjenog u tekstu o inferenciji — prefill je brz i paralelan, decode ide token po token.

Praktična posledica: dugačak dokument u promptu je jeftin, dugačak odgovor nije. Ograničavanje max_tokens je direktna ušteda.

Za pošteno poređenje uzmi model uporediv sa onim koji bi hostovao. Model klase 8B ne poredi se sa vrhunskim komercijalnim modelom, nego sa istim tim modelom kod provajdera.

Tri primera

Jedan administrator, pomoć u terminalu

Potrošnja:  2 M tokena mesečno, odnos ulaz/izlaz 3:1

API (otvoreni model kod provajdera):
  1.5 M ulaz × 0.15  = 0.23 EUR
  0.5 M izlaz × 0.30 = 0.15 EUR
  Ukupno:              0.38 EUR mesečno

Sopstveni server:  44 – 119 EUR mesečno

API je jeftiniji stostruko. Za ovaj slučaj sopstveni server ima smisla samo iz drugih razloga — privatnost, učenje, rad bez interneta.

Klasifikacija tiketa, 5 000 dnevno

Potrošnja:  90 M tokena mesečno, kratki odgovori

API:
  80 M ulaz × 0.15  = 12.00 EUR
  10 M izlaz × 0.30 =  3.00 EUR
  Ukupno:             15.00 EUR mesečno

Sopstveni server:  44 – 119 EUR mesečno

API i dalje jeftiniji, ali razlika više nije dramatična. Ako podaci ne smeju napolje, doplata je razumna cena.

Tim od dvadeset ljudi

Potrošnja:  400 M tokena mesečno

API (srednja klasa):
  300 M ulaz × 0.60  = 180 EUR
  100 M izlaz × 2.00 = 200 EUR
  Ukupno:              380 EUR mesečno

Sopstveni server (dve kartice, jači model):
  Hardver 2 500 EUR → 70 EUR amortizacije
  Struja                30 EUR
  Održavanje           100 EUR
  Ukupno:              200 EUR mesečno

Ovde se server isplati. Ulaganje se vraća za oko sedam meseci, a razlika raste sa svakim novim korisnikom.

Gde je granica

Iz ovih primera vidi se obrazac. Uz mesečni trošak servera od stotinak evra i cenu API-ja od nekoliko desetih dela evra po milionu tokena, prelomna tačka je negde oko sto do dvesta miliona tokena mesečno, uz uporedivu klasu modela.

Ispod toga API je jeftiniji, često znatno. Iznad toga server. Ali taj broj proveri sa svojim cenama — struja i satnica se razlikuju višestruko.

Ono što se ne meri novcem

Računica nije ceo argument, u oba smera.

Za server: podaci ostaju kod tebe, cena je fiksna i predvidiva, verzija modela se ne menja bez tvoje odluke, radi bez interneta, nema ograničenja broja zahteva. Kod regulisanih delatnosti prvi razlog sam zatvara raspravu.

Za API: nema kapitalnog ulaganja, pristup vrhunskim modelima koje ne možeš hostovati, nula održavanja, trenutno skaliranje. Za proveru ideje nema takmičenja.

Hibrid je ono što firme obično i završe: osetljivo i masovno na lokalnom modelu, teški i retki zadaci na API-ju. Ako ideš tim putem, pravilo šta ide kuda sprovedi u kodu, ne u dogovoru.

Skrivene stavke

Nekoliko stvari koje se pojave tek posle nekoliko meseci.

Neiskorišćenost. Kartica kupljena za osmočasovni radni dan stoji dve trećine vremena. Ako ima još poslova za nju — klaster, noćna obrada — iskoristi je.

Rezervni hardver. Kada kartica otkaže, nabavka traje. Za produkciju to znači ili rezervu, ili API kao zamenu — što je jedan od boljih argumenata za hibrid.

Rast potrošnje. Kada ljudi shvate da je besplatno, potrošnja poraste višestruko. Kod API-ja se to vidi na računu; kod servera se vidi kao red čekanja.

Zastarevanje. Model koji je danas dobar za dve godine je osrednji. Kartica ostaje ista, a zahtevi rastu.

Promena cena. API cene su u proseku padale, ali uslovi i dostupnost modela se menjaju bez tvoje saglasnosti.

Praktični scenariji

Scenario 1: šef traži broj

Izmeri stvarnu potrošnju tokena mesec dana. Sve ostalo je nagađanje.

Scenario 2: račun za API raste

Pre kupovine hardvera proveri odnos ulaza i izlaza. Skraćivanje istorije razgovora i ograničavanje max_tokens često prepolove račun.

Scenario 3: server kupljen, potrošnja mala

Nađi mu još posla — noćna obrada, klasifikacija, RAG. Kartica koja stoji je najskuplji mogući izbor.

Scenario 4: poređenje deluje nepošteno

Verovatno porediš modele različite klase. Uzmi isti model kod provajdera.

Scenario 5: računica je tesna

Onda odlučuju ostali razlozi — privatnost, predvidivost, održavanje. Kod tesne razlike novac nije argument.

Scenario 6: struja skuplja nego što si računao

$ sudo nvidia-smi -pl 280

Osamdeset posto ograničenja jedva se oseti u brzini, a osetno smanjuje potrošnju.

Kratka referenca

  • Izmeri potrošnju tokena pre svake računice
  • Hardver → amortizacija na tri godine
  • Struja: mirovanje plus stvarno vreme rada, ne maksimum stalno
  • Održavanje često premašuje hardver i struju
  • usage polje — pouzdan broj tokena
  • avg_over_time(DCGM_FI_DEV_POWER_USAGE[30d]) — stvarna potrošnja
  • Izlaz je višestruko skuplji od ulaza kod API-ja
  • Poredi uporedive klase modela
  • Prelomna tačka: oko 100 – 200 M tokena mesečno
  • Ispod → API, iznad → server, uz proveru svojim cenama
  • nvidia-smi -pl 280 — direktna ušteda na struji
  • Privatnost i predvidivost se ne mere novcem

Vežba

  1. Izmeri koliko tokena stvarno potrošiš u nedelju dana i pomnoži na mesec.
  2. Izračunaj mesečni trošak svog servera sa i bez naplaćenog vremena.
  3. Izmeri stvarnu potrošnju struje umesto da je procenjuješ.
  4. Nađi cenu istog modela kod tri provajdera i izračunaj mesečni račun.
  5. Odredi svoju prelomnu tačku u milionima tokena.
  6. Nabroj tri razloga van računice koji kod tebe prevagnu, u jednom ili drugom smeru.

Sledeći tekst u serijalu: MCP — kako model dobija pristup tvojim alatima

Povezano:

Comments

Popular posts from this blog

Početak u Linuxu — šta je i zašto se uči

Konverzija tipova podataka u Pythonu

groupadd