Deploy modela na Kubernetes
Kubernetes ne ubrzava inferenciju i ne rešava nijedan problem koji si do sada imao. Ono što donosi je raspoređivanje: kada imaš više servera sa karticama i više modela, neko mora da odluči šta ide gde — i da to ponovo uradi kad node otkaže. Ovaj tekst pokazuje kako se model pokreće u klasteru i gde se GPU postavka razlikuje od svega ostalog što tamo vrtiš. Kada ovo ima smisla Ima smisla Nema smisla Više servera sa karticama Jedan server, jedan model Klaster već postoji i drži ostalo Klaster bi se dizao samo zbog ovoga Više modela deli isti skup kartica Nema rezervnog hardvera Opterećenje se menja kroz dan Stalno, predvidivo opterećenje Za jedan server systemd jedinica ostaje bolje rešenje. Kubernetes uvodi sloj koji treba održavati, a ako imaš tačno jednu karticu, raspoređivati nema šta. Preduslov je poznavanje osnovnih pojmova — pod , deployment , servis . Device plugin Kubernetes ne zna za...