Veliki model za telefon je otvoren, MiniCPM-V 4.6 je zaista vrhunski.
Pokretanje velikih modela na telefonu je ranije uvek podsećalo na „konceptni auto" — na prezentaciji je super, u svakodnevnom životu nemoguć. Nije da je model prevelik za telefon, uglavnom što radi previše sporo.
Ali nedavno otvoreni MiniCPM-V 4.6 kompanije OpenBMB promenio mi je mišljenje.
1.3B parametara, može da gleda slike i razume video, radi na mom telefonu, brzina je veoma visoka. Još apsurdnije, ovako mali model, multimodalne sveobuhvatne sposobnosti su ovako jake.

U današnjem članku, planiram da MiniCPM-V 4.6 očetam od početka do kraja.
Ne gledamo samo benchmark rezultate, već ćemo objasniti i nekoliko stvari koje vas možda zanimaju, a nisu jasne:
- Da li telefon sa 8GB memorije zaista može da pokrene koliki model?
- Šta je zapravo kvantizacija?
- Zašto je 1B do 2B možda optimalna tačka za modele na ivici uređaja?
Kada ovo razumeš, pa onda gledaš moć ovog 1.3B malog topa, osećaj je potpuno drugačiji.
01. Rezultati MiniCPM-V
MiniCPM-V 4.6 nudi dva režima korišćenja/evaluacije: Instruct i Thinking.
Na sveobuhvatne sposobnosti, u većini zadataka razumevanja slike i teksta, verzija 4.6 prevazilazi Qwen3.5-0.8B; stranica projekta OpenBMB takođe pominje da u performansama prevazilazi veći Gemma4-E2B-it.
Nije jaka u jednoj stvari, već sveobuhvatno jaka.

Na benchmark-u Artificial Analysis Intelligence Index, MiniCPM-V 4.6 je osvojio 13 poena, a Qwen3.5-0.8B 10 poena.
Još konkretnije, na OpenCompass, RefCOCO, HallusionBench, MUIRBench, OCRBench ovim benchmark-ima, verzija 4.6 je dosegla deo opsega sposobnosti verzije Qwen3.5 2B. Obratite pažnju, to je delimično vizuelno-jezičke zadatke koji se približavaju nivou 2B, ne znači da sve sposobnosti prevazilaze 2B.
Originalni tekst Artificial Analysis-a ima i jedan veoma zanimljiv detalj: da bi se kompletan Intelligence Index završio, MiniCPM-V 4.6 Instruct je potrošio samo 5.4M output tokena, dok Qwen3.5-0.8B ne-reasoning verzija troši 101M, a Thinking verzija 233M.
Šta to znači?
Ne znači da ćete ga vi u svakodnevnoj upotrebi svaki put potrošiti 19 puta manje tokena, već da u istom setu evaluacija, on sa kraćim izlazom postiže više ocene. Za scenarije na ivici uređaja i visokog saobraćaja, ovaj indikator je ključan, jer manje tokena obično znači da su latencija, računarska snaga i potrošnja energije bolji.

Vredno pomena je i latencija prvog odgovora.
Za obradu slike visoke rezolucije od 3136×3136, prvi odgovor zahteva samo 75.7ms, 2.2 puta brže od Qwen3.5-0.8B. Najviše me iznenadilo to što je kriva latencije prema rezoluciji na zvaničnoj slici veoma ravna — kada rezolucija raste, TTFT ne prati eksplozivno. Ova karakteristika je za stvarne primene ključna, bez obzira koje veličine sliku korisnik upload-uje, iskustvo je kontrolisanije.
02. Koliko veliki model telefon može da pokrene
Nakon završetka obuke modela, podrazumevano se čuva u 16-bitnom floating point formatu (FP16).
Za čisto jezičke modele, jedan parametar zauzima 2 bajta, 1.3B parametara je 2.6GB, 8B parametara je 16GB. Model od 671B poput DeepSeek R1 u originalnom stanju zahteva 1342GB memorije, ali su ranije mnogi sa Mac-om od 192GB uspeli da ga pokrenu — upravo zahvaljujući kvantizaciji.
Šta je kvantizacija?
To je smanjenje broja bita za čuvanje svakog parametra, sažimanje težina modela.
FP16 koristi 16 bita za čuvanje decimalnog broja, može da predstavi 65536 različitih vrednosti. Sažeto na 8 bita (Q8 ili INT8), može predstaviti samo 256 vrednosti, prostor za čuvanje se prepolovljava. Sažeto na 4 bita (Q4 ili INT4), može predstaviti samo 16 vrednosti, prostor se ponovo prepolavlja.
Koja je cena? Preciznost opada, model postaje gluplji.
Q4, INT4, AWQ, GPTQ deluju kao četiri potpuno različite stvari, zapravo sve mogu da se svrstaju u 4-bit kvantizaciju. Samo se ne mogu direktno izjednačiti, jer se granularnost kvantizacije, metod kalibracije, format težina, framework za zaključivanje razlikuju.

Da sažmem:
- Q serija (Q2, Q3, Q4, Q5, Q8) je GGUF format koji koriste llama.cpp i Ollama, lokalno raspoređivanje na telefonu i PC ide ovim putem.
- INT serija (INT4, INT8) je standardna celobrojna kvantizacija koju koriste vLLM i TensorRT, raspoređivanje u oblaku ide ovim putem.
- Q4_K_M, Q8_0 su česti tipovi kvantizacije u GGUF-u, koji pripadaju 4-bit i 8-bit kategoriji.
- AWQ i GPTQ su takođe česte 4-bit šeme kvantizacije, ali su različiti post-training metodi kvantizacije, ne može se prosto reći da im je preciznost nužno jednaka nekom Q4 formatu.
Sada kada je kvantizacija jasna, vraćamo se na ključno pitanje: sa 8GB memorije mainstream telefona, koliki model može da se pokrene?
Odgovor je možda manji nego što mislite.
Sistem i stalni App-ovi obično pojede deo memorije, prostor koji zaista ostaje za veliki model nije tako širok kao što izgleda na tabeli parametara. Pri INT4 kvantizaciji, težine čisto jezičkog modela od 1.3B mogu se grubo kompresovati ispod GB nivoa, ali MiniCPM-V je multimodalni model, mora se računati i vizuelni enkoder, vizuelni tokeni, KV Cache i sam framework za zaključivanje.
Zato više volim da to shvatim kao inženjersku slatku tačku: 1.3B je dovoljno mali, toliko mali da ima šansu da stane u telefon i auto sistem; ali ujedno nije onaj model-igračka koji samo može jednostavna pitanja i odgovore, on može da gleda slike, gleda video, radi OCR i razumevanje više slika.
Za slučaj mid-range telefona sa samo 6GB RAM-a, 1B je verovatno jedina opcija.

Da navedem konkretan primer, da osetite.
Gledano samo po težinama parametara grubo, model od 1.3B pri 4-bit kvantizaciji zauzima otprilike 0.65GB nivoa. Ali ovo je samo procena koja pomaže da izgradite intuiciju, ne znači da stvarni App u radu zahteva samo toliko memorije.
Stvarno zaključivanje mora dodati i KV Cache, vizuelni enkoder, vizuelne tokene, bafer framework-a, sistemsko preklapanje. Model od 8B i pri 4-bit kvantizaciji može imati težine na nivou od 4GB, a uz kontekst i runtime overhead, za telefon sa 8GB memorije je veoma neprijateljski. Ovde nije da ne može da se pokrene, već što u radu lako žrtvuje dužinu konteksta, brzinu i stabilnost.
Govoreći o memoriji, moram da dopunim još jedan koncept: KV Cache.

Kada se model pokrene, sve kontekstne informacije se u memoriji čuvaju u obliku tokena, po jedan Key i po jedan Value, za izračunavanje attention-a, stalno izvodeći šta je sledeći Token. Što je kontekst duži, KV Cache zauzima više memorije.
Zato mnogi modeli imaju ograničenje „maksimalnog konteksta", i zašto neke platforme naplaćuju dodatno kada je kontekst predug.
Multimodalni modeli imaju još jedan dodatni trošak: vizuelni tokeni.
Slika pre nego što uđe u model se kodira u skup tokena, kao i tekst zauzima KV Cache, količina zavisi od rezolucije slike i načina kompresije. Što je rezolucija viša, više vizuelnih tokena, veća zauzeća memorije. Zato MiniCPM-V 4.6 ulaže tolike napore u kompresiju vizuelnih tokena.
03. Zašto je MiniCPM-V 4.6 ovako brz
MiniCPM-V 4.6 radi brzo, u pozadini su dve ključne tehničke inovacije.
Prva je LLaVA-UHD v4 arhitektura.
Tradicionalni multimodalni modeli pri obradi slika visoke rezolucije imaju to da vizuelni tokeni brzo rastu sa rezolucijom, a attention računica unutar vizuelnog enkodera se takođe usporava. Ranije su mnoga rešenja radila kompresiju Token-a nakon ViT-a (Vision Transformer, vizuelni enkoder). Problem je što to olakšava samo teret downstream jezičkog modela, a količina računanja unutar vizuelnog enkodera se nimalo ne smanjuje.
LLaVA-UHD v4 je okrenuo pristup naopačke: kompresiju Token-a pomerio je unapred u plitke slojeve unutar ViT-a. Što ranije kompresuješ, to je manje Tokena koje treba obraditi kasnije, i ukupna količina računanja je niža.
Ovaj dizajn pristup ima jednu tehničku teškoću pri implementaciji: plitki slojevi ViT-a su već naučili mnogo vizuelnih reprezentacija, direktno ubacivanje random-inicijalizovanog modula za down-sampling će razbiti te već naučene reprezentacije, što rezultira visokom cenom obuke.
Rad OpenBMB/Make-intelligence tima (arXiv: 2605.08985) daje elegantno rešenje: umesto random inicijalizacije, attention projekciju i MLP težine modula za kompresiju kopira iz susednih prethodno istreniranih slojeva. Tako modul za kompresiju od prvog koraka obuke radi na prethodno istreniranom representation manifold-u, ne mora potpuno iznova da uči.

Rezultat je da količina floating point operacija u fazi vizuelnog enkodiranja pada sa 3555G na 1573G, pad od 55.8%, uz zadržavanje efekta koliko je moguće. Uz kombinaciju sa 4x post-ViT MLP kompresijom, ukupno je 16x kompresija.
Druga inovacija je 4x/16x hibridna kompresija.
Prethodne verzije su mogle samo da biraju između 4x i 16x, verzija 4.6 je obe uradila. Za preciznost koristi 4x kompresiju, za brzinu 16x kompresiju. Jedan model, dva režima, u oblaku može sa izuzetno niskim troškovima da primi visokosaobraćajni opterećenje.
Ovde postoji važan nalaz iz rada: slice encoding je bolji od global encoding. Nakon brojnih kontrolisanih eksperimenata, istraživački tim je otkrio da pri global encoding tekst, grafikoni i drugi fini elementi lako bivaju razblaženi globalnim informacijama. Slice encoding omogućava enkoderu da se fokusira na fine šeme unutar svake male oblasti, i što je rezolucija viša, prednost je veća.
04. Fino podešavanje i na potrošačkoj grafičkoj kartici
Framework za fino podešavanje podržava ms-swift i LLaMA-Factory, dok deploy zaključivanja podržava vLLM, SGLang, llama.cpp, Ollama. Mainstream framework je potpuno pokriven, pripremi podatke, izmeni nekoliko linija konfiguracije i možeš da počneš obuku.
Ovde moram da budem precizan.
„Potrošačka grafička kartica može da radi fino podešavanje" ne znači „bilo koja 4090 može da radi puno parametarsko fino podešavanje". Punoparametarsko fino podešavanje zavisi i od batch size, dužine konteksta, rezolucije slike, statusa optimizer-a, da li se koristi ZeRO, da li se koristi gradient checkpointing. Uz malo nepažnje, VRAM eksplodira.
Ali LoRA, QLoRA i ovakva laka fino podešavanja su realnija. Na primer, želimo samo da ga prilagodimo određenom vertikalnom scenariju: prepoznavanje slika tiketa, razumevanje interfejsa auto sistema, čitanje računa, gledanje slika proizvoda, pravljenje seta internog OCR-a za poslovne forme. Tada nema potrebe sve parametre trenirati iznova, dovoljno je dodati low-rank adaptacioni sloj, tako da model nauči izraz ove vrste slika i instrukcija.
Prednost malih modela je upravo ovde.
Za istu industrijsku prilagodbu, veliki model je naravno jači, ali su troškovi obuke, raspoređivanja i iteracije takođe veći. Model od 1.3B poput MiniCPM-V 4.6 pogodan je ne za to da „zameni najjači model u oblaku", već da se postavi na ivicu uređaja i u privatno okruženje, i prvo preuzme visokofrekventne, niskolatentne, osetljive na privatnost vizuelne zadatke.
Make-intelligence je pažljivo pružio i pre-kvantizovane modele u više kvantizacionih formata i tutorijale za raspoređivanje:
- vLLM raspoređivanje: github.com/OpenSQZ/MiniCPM-V-CookBook/.../vllm
- llama.cpp raspoređivanje: github.com/OpenSQZ/MiniCPM-V-CookBook/.../llama.cpp
- Ollama raspoređivanje: github.com/OpenSQZ/MiniCPM-V-CookBook/.../ollama
Sam model koristi Apache-2.0 licencu otvorenog koda, komercijalna upotreba takođe nije problem.

Format modela na HuggingFace je Safetensors, podržava BF16 preciznost, istovremeno nudi više kvantizovanih verzija GGUF, BNB, AWQ, GPTQ. Do 14. maja 2026, stranica modela HuggingFace openbmb/MiniCPM-V-4.6 pokazuje mesečni broj preuzimanja od 3494 puta, repozitorijum GitHub OpenBMB/MiniCPM-V pokuje oko 24.8k Star.
05. Od Kuaishou-a do auto sistema
Gledajući samo benchmark rezultate i podatke iz radova, možda i dalje deluje pomalo „laboratorijski". Zato pogledajmo stvarnu primenu.
Kuaishou-ov OneRec model preporuka, pri obradi multimodalnih informacija kao što su naslovne slike kratkih video klipova, titlovi, OCR, ASR, koristi prethodnu generaciju MiniCPM-V-8B. Javno dostupni OneRec tehnički materijali pominju da OneRec u glavnom onlajn scenariju preuzima oko 25% QPS-a.
Ovo nam pokazuje jednu stvar: putanja MiniCPM-V nije ostala samo u demo-u. Scenarij preporuke kratkih video klipova je veoma osetljiv na protok, stabilnost i troškove — što je ubačeno u ovakav link, samo po sebi pokazuje da inženjerska vrednost malog modela nije prosta „mali parametri pa jeftino".

Pored Kuaishou-a, MiniCPM set modela ima i javne primene u oblasti auto sistema. U javnim izveštajima pominje se da su Geely, Changan, Volkswagen i druge kompanije ili modeli vozila integrisali multimodalne modele na ivici uređaja. Ovde nećemo detaljno istraživati slučajeve kompanija, shvatite to kao važan pravac primene modela na ivici uređaja.
Auto sistem zahtevanja prema modelu su slična kao kod telefona: ograničena memorija, ograničena računarska snaga, nestabilna mreža, mnoge interakcije se žele lokalno završiti. Na primer, prepoznavanje statusa instrument table, razumevanje sadržaja centralnog ekrana, višeturnus interakcija kombinovana sa glasom, nastavak odgovora na korisnika u uslovima slabe mreže — sve to nije pogodno za potpuno oslanjanje na oblak.
Mislim da je vrednost MiniCPM-V 4.6 upravo ovde.
On ne reklamira trik „i na telefonu možete da pokrenete veliki model", već pritiska multimodalni model ka stvarnim hardverskim ograničenjima: parametri moraju biti mali, vizuelnih tokena malo, latencija stabilna, framework za raspoređivanje potpun, licenca mora biti labava. Bez jednog uslova, developer-ima je teško da ga zaista iskoriste.

