Što se dogodilo
DeepSeekov jeftiniji model nadmašio vlastiti skuplji AI

Dvadeset osam centi po milijunu izlaznih tokena. Toliko danas košta poziv modelu koji rješava programerske i agentske zadatke bolje nego DeepSeekov vlastiti, veći i skuplji model iz iste obitelji. Kad je to objavljeno, dvije rasprave o tome istog su dana same od sebe dospjele na naslovnicu Hacker Newsa, jedna sa 507, druga sa 353 glasa, što u praksi znači da programere ovo zanima stvarno, ne samo zato što je netko platio marketing.
Riječ je o DeepSeek-V4-Flash-0731, verziji koju je kineska tvrtka DeepSeek 31. srpnja objavila na Hugging Faceu pod MIT licencom (dakle otvorenih težina, svatko ih smije preuzeti i koristiti), a 1. kolovoza je i službeni API za taj model izašao iz pretpregleda u javnu betu. Arhitektura i veličina modela nisu se promijenile, i dalje je riječ o takozvanom mixture-of-experts modelu s 284 milijarde parametara od kojih se u svakom trenutku koristi samo 13 milijardi, pa cijeli skok u sposobnostima dolazi isključivo od ponovnog treniranja na kraju procesa, ne od novog dizajna. Taj skok ipak nije mali: rezultat na Terminal-Bench 2.1 testu popeo se s 61,8 na 82,7, a na DeepSWE testu agentskog programiranja sa 7,3 na čak 54,4.
Ono što ovu priču čini pomalo neobičnom jest da je taj manji, jeftiniji Flash model nadmašio DeepSeekov vlastiti veći i skuplji V4-Pro-Preview model na svih devet objavljenih agentskih i programerskih testova. Manji model koji je bolji od starijeg brata iz iste kuće nije nešto što se svaki dan vidi, i dio zajednice na Hacker Newsu i X-u to je dočekao s podozrenjem, postavljajući pitanje otkud točno dolazi taj napredak kad su svi brojevi DeepSeekovi vlastiti, bez nezavisne usporedbe s GPT-5.6 ili Claude Sonnetom 5. Sam DeepSeek je pritom bio prilično jasan: ova nadogradnja vrijedi samo za Flash API, dok V4-Pro API i aplikacija ostaju nepromijenjeni do vlastitog službenog izdanja, najavljenog kao skoro.
Cijena je ostala ista kao u pretpregledu: 0,14 dolara po milijunu ulaznih tokena, samo 0,0028 dolara ako je riječ o već viđenom dijelu razgovora (takozvani cache hit), i 0,28 dolara po milijunu izlaznih tokena. Za malu hrvatsku tvrtku koja razmišlja o automatizaciji korisničke podrške, generiranju sadržaja ili AI pomoći pri programiranju, to je tek djelić cijene koju bi platila za usporedivi rad kod GPT-5.6 ili Claude Sonneta 5, i to bez ikakvog vlastitog poslužitelja, model se jednostavno zove preko API-ja. Zato što su težine otvorene, tehnički potkovaniji timovi mogu ga pokrenuti i lokalno; pojedini programeri već su ga na X-u testirali na MacBooku sa 128 GB memorije i dobili brzinu od 35 do 39 tokena u sekundi, što je za model te veličine iznenađujuće upotrebljivo.
Tu ipak treba dodati i ono što niska cijena sama po sebi ne rješava. DeepSeek je kineska tvrtka, a njezini raniji modeli već su bili pod povećalom europskih regulatora: talijansko tijelo za zaštitu podataka ranije je blokiralo DeepSeekovu aplikaciju u Italiji, navodeći nejasnu pravnu osnovu za obradu podataka i izostanak izričite privole korisnika za korištenje razgovora u treniranju modela, uz podatke koji se, prema vlastitoj politici privatnosti tvrtke, pohranjuju na poslužiteljima u Kini. Ništa od toga nije novo niti se odnosi posebno na ovu Flash nadogradnju, ali ista tvrtka i iste politike vrijede i dalje, pa za firmu koja bi kroz ovaj API provlačila podatke europskih kupaca to nije sitnica koju vrijedi preskočiti samo zato što je cijena upadljivo niska.
Na Savladaj.ai ćemo posebno pratiti koji od ovih jeftinijih AI modela ima smisla za manje hrvatske tvrtke, ne samo po cijeni po tokenu nego i po tome kamo ti tokeni zapravo putuju. Ozbiljna AI sposobnost danas se plaća u centima, a jedino što ostaje jednako skupo jest provjeriti kome zapravo šaljete svoje podatke.
