GPT-5.4 test: Codex + Chrome MCP kontroliše pretraživač, konačno rešio ovaj teški Bug
GPT-5.3-Codex se još nije ni ohladio, a OpenAI je zvanično izdao GPT-5.4.
Ovo nije obično ažuriranje modela, već model koji je OpenAI pozicionirao kao prvi objedinjeni model za AI digitalne radnike. Integriše rezonovanje, programiranje i kontekst od milion tokena, nativno podržava rad na računaru, trošak Agent zadatka je direktno smanjen za 47%.
Rezultati na benchmark-ima su prilično impresivni: SWE-Bench Pro 57.7%, MMMU-Pro 81.2%, BrowseComp čak 82.7%. U internom testu investicionog bankarstva, rezultat GPT-5.4 je sa 43.4% kod GPT-5 skočio na 87.3%.

Developeri na X-u već pršte.
Neko kaže da je GPT-5.4 jednak sposobnostima kodiranja GPT-5.3 Codex + svetsko znanje jače od GPT-5.2 + jače izvršenje Agent-a, pravi heksagonalni ratnik. Neko se žali da je cena previsoka, jedan „Hi" može da potroši 80 dolara.
Ja sam u prvom trenutku prebacio model ispod Codex-a na GPT-5.4. Uz podršku Chrome DevTools MCP-a nadogradio sam PaiCongming RAG projekat, efekat je zaista malo preteran.

Neke Bug-ove ni snimak ekrana, ni opis teksta ne mogu da reše. Prepusti Codex-u da sam kontroliše pretraživač i reprodukuje Bug, ovaj pristaz u suštini može locirati sve teške Bug-ove.
Ja sam jutros naišao na tipičan primer. Dok sam radio na PDF preview funkciji PaiCongming RAG baze znanja, jedan Bug me je dosta mučio, a onda je GPT-5.4 brzo rešio problem upravljanjem pretraživačem.

Danas ću zabeležiti kompletan proces, uključujući mesta pada i konačno rešenje, kao referencu.
Prvo da objasnim pozadinu.
Radio sam na PDF preview funkciji PaiCongming RAG baze znanja. Funkcionalnost je: korisnik klikne na link za citat u prozoru za ćaskanje i može direktno da pregleda originalni tekst na odgovarajućem mestu u PDF-u.
Ali problem je: tokom PDF preview-a, sadržaj uporno ne izlazi.

Čudno je da prilikom promene širine stranice pretraživača, sadržaj iznenada iskoči.
Nakon iskakanja, ponovljena promena ponekad izazove grešku „PDF stranica nije uspela da se renderuje, pokušajte ponovo kasnije".

Ovakav Bug je najgori. Nije uvek reproduktivan, ima obrazac ali se ne može razlučiti. Kažeš da je pokvaren, prevučeš i opet je dobar. Kažeš da je dobar, prevučeš i prijavi grešku.
Prvo sam koristio konvencionalan način — opis teksta + snimak ekrana, da komuniciram sa Codex-om.

Codex je uradio nekoliko slepih popravki, promenio nekoliko mesta u kodu, ali nije rešio problem.

Na kraju nije čak ni on bio siguran u sebe, pa je rekao:
Ako se ponovo reprodukuje, sledeći put više neću raditi slepe popravke, direktno ću štampati životni ciklus PDF renderovanja u konzolu, izlazeći sa brojem verzije i širinom za svaki schedule/cancel/render/success/fail, da brzo zakucam poslednju trku.
Nisam mogao da se suzdržim kada sam pročitao ovu rečenicu.
Zar je GPT-5.4 zaista toliko slab? Da li je to GPT-5.4 kojeg svi blogeri hvale? Ne može da reši ni ovakav problem, zaista smešno.
U tom trenutku sam zaista imao takvu pomisao.
Ali kad sam se smirio i razmislio, nije da GPT-5.4 nije dobar, već što nisam dao dovoljno informacija. Snimci ekrana i tekstualni opisi, za dinamičke probleme poput redosleda renderovanja, su već neadekvatni.
Zato sam prepustio Codex-u da sam kontroliše pretraživač i sam testira Bug.

Ovog puta, Codex se zaista podigao.
Prvo je kreirao stranicu za reprodukciju, kako ne bi ometao postojeće fajlove projekta. Zatim je pozvao Chrome DevTools MCP alat da otvori stranicu.

Počeo je da reprodukuje problem.

Prvo je otvorio front-end stranicu:
1: http://localhost:9527/#/chat
2: http://127.0.0.1:9527/#/login
3: http://127.0.0.1:9527/pdf-debug.html [selected]Zatim je kontrolisao pretraživač i počeo da upravlja kao čovek:
uid=1_57 button "P37..."
uid=1_58 StaticText "stranica 6"
uid=1_59 StaticText "referentna stranica"Ovaj proces možemo sasvim dobro pratiti. Zaboravio sam da snimim ekran, ali slike su tu.

Obratite pažnju, ispod trake sa adresom Chrome pretraživača stoji linija: Chrome kontroše automatizovani softver za testiranje.
Ovo je Codex, odnosno GPT-5.4, koji kontroliše pretraživač i sprovodi testiranje.
Ovog puta je problem zaista lociran.
Kroz upravljanje pretraživačem, Codex je stabilno reprodukovao fenomen: PDF sažetak i brojevi stranica su tu, ali canvas tela je beo. To pokazuje da su dokument i tekstualni sloj dobro, problem je u samom rezultatu renderovanja canvas-a.
Stranica za reprodukciju je stabilno reprodukovala fenomen: PDF sažetak i brojevi stranica su tu, ali canvas tela je beo. To pokazuje da su dokument i tekstualni sloj dobro, problem je u samom rezultatu renderovanja canvas-a. U nastavku direktno hvatam trenutnu veličinu, status canvas-a i konzolu.
Počeo je da popravlja problem, ali nažalost, prvi put nije uspeo.

Codex nije odustao, započeo je drugi ciklus upravljanja pretraživačem radi testiranja.
Još jedan krug traženja problema:
Log je već locirao konkretanije: forceRender je zaista ušao u flushRenderQueue:enter, ali nakon toga nema renderCurrentPage:start. To znači da renderovanje još nije ni počelo, zaglavilo se ispred flushRenderQueue ili je ranije vratilo rezultat. Da pogledam detaljna polja ovih log objekata.

Nastavi, nastavi, ovog puta je problem zaista rešen.

Nakon izmene koda, sledi još jedan krug testiranja.

Veoma rigorozno.
Predati inicijativu za testiranje Codex-u ima očigledne prednosti:
GPT-5.4 može dobiti informacije koje želi, umesto informacija koje si ti izabrao. Redosled renderovanja, DOM status, Network zahtevi, Console logovi — on sam hvata, sam analizira.
Smanjenje troškova komunikacije između čoveka i AI. Ne moraš rečima da opišeš dinamički fenomen kako sadržaj iznenada iskoči prilikom prevlačenja prozora, Codex sam upravlja, sam posmatra, sam sumira obrasce.
Precizno lociranje, bez slepih popravki. Prethodni krugovi slepih popravki su bili zasnovani na nagađanju, ovog puta na stvarnim podacima iz runtajm-a.
Kontinuirana iteracija, bez straha od neuspeha. Prvi put je pogrešio, Codex to sam zna i odmah započinje drugi krug testiranja. Ne moraš da ga podstičeš, ne moraš da objašnjavaš, on sam prelazi u sledeći krug.
Ova sposobnost samostalnog debagovanja ključna je razlika GPT-5.4 u odnosu na prethodne verzije. Ne u tome da brže piše kod, već u tome što može samostalno da zatvori petlju debagovanja: otkrivanje problema → formulisanje strategije → izvršenje testova → analiza rezultata → prilagođavanje plana → verifikacija popravke.
Ranije je ovu petlju pokretao čovek, sada AI sam može da je pokrene.

Efekat nakon popravke je: u prozoru za ćaskanje klikneš na link za citat (plavo slovo),

i otvoriće se preview prozor gde možeš videti originalni tekst na odgovarajućem mestu u PDF-u.

Stvarno povezuje rezultate u RAG-u sa originalnim tekstom na koji se pozivaju.

Ova praktična borba mi je duboko ukazala na moć GPT-5.4.
Ne u sposobnosti pisanja koda, već u sposobnosti samostalnog debagovanja.
Može da razume problem, formuliše strategiju, upravlja alatima, analizira rezultate, prilagođava plan, i tako u krug dok problem ne reši. Ova sposobnost Agent petlje je nešto gde domaći modeli još uvek zaostaju.
Oni koji su stvarno iskusili Coding bi trebalo da ovo duboko osete.
Domaći modeli su trenutno uglavnom na nivou dopunjavanja koda i jednostavnog refaktoringa. Daš mu deo koda i zatražiš optimizaciju, može to da uradi. Ali daš mu fenomen Bug-a i zatražiš da sam locira, sam testira, sam popravi, razlika postaje očigledna.
Nije da model sam po sebi nije dovoljno pametan, već cela ekosistema nije pratila. GPT-5.4 je jak, ne samo zato što je model jak, već zato što je OpenAI povezao alate (Codex, MCP, DevTools), formirajući kompletan Agent radni tok.
Naravno, GPT-5.4 nije svemoguć. Ako mu ne dam dozvolu za DevTools MCP i dozvolim mu da gleda samo snimke ekrana i tekst, može samo da radi slepe popravke. Stepen usavršenosti alata direktno određuje gornju granicu AI sposobnosti.
Zato domaći modeli moraju da prestižu, ne samo parametre modela, već i izgradnju celokupnog ekosistema alata za programere.
Sledeće što treba da uradim je da nastavim da optimizujem PaiCongming RAG projekat, da dostigne standarde za puštanje u rad.

Zatim ga stvarno rasporedim na svoj server, kako bi ga svi mogli koristiti.
Embedding model koji stoji u pozadini, kao i potrošnja DeepSeek modela, takođe će biti dostavljeni svima na besplatno korišćenje.
Naravno, zbog troškova, sigurno će se kontrolisati potrošnja tokena.
Ovo debagovanje Bug-a, od prvobitnog „smešno" do konačnog „stvarno je moćan", promena stava je prilično velika.
Na samom početku, kada video da Codex ne može da se izbori, zaista sam sumnjao da je GPT-5.4 precenjen. Tek kasnije sam shvatio da problem nije u modelu, već u načinu komunikacije.
Snimci ekrana i tekst su dovoljni za statičke probleme. Ali za dinamičke probleme poput redosleda renderovanja i trka uslova, oni su već neefikasan nosilac informacija. Što detaljnije opisuješ, to je veći gubitak informacija.
Prepustiti Codex-u da sam upravlja pretraživačem je u suštini omogućavanje AI-u da direktno opaža svet, umesto preko tvojih prepričavanja.
To je kao učiti nekoga da vozi. Pored njega rečima opisuješ „okani volan za pola kruga levo", ne umesto da ga pustiš da sam sedne u vozačko sedište i stisne volan. Telesna percepcija je hiljadu puta preciznija od jezičkog opisa.
AI ne treba samo više informacija, treba mu direktnija percepcija.
GPT-5.4 uz Chrome DevTools MCP pruža AI-ju ovu sposobnost percepcije. Može da čita konzolu, da hvata mrežne zahteve, da manipuliše DOM-om, da posmatra redosled renderovanja.
Ovo nije pomoć programeru u pisanju koda, ovo je pomoć programeru u debagovanju. Pisanje koda je samo deo razvoja, debagovanje je glavni deo. Posebno oni čudni Bug-ovi gde lokalno nema problema, a nakon puštanja u rad sve pada, vreme debagovanja može da čini 70% celokupnog razvoja.
AI neće zameniti programere, ali polako preuzima one najvremenski zahtevnije, najdosadnije, najmučnije delove. Preostali kreativni rad, projektovanje arhitekture, razumevanje biznisa, to je prava vrednost ljudskih programera.
PaiCongming RAG je u zavrnoj pripremi pre puštanja u rad, dobrodošli da iskusite nakon puštanja. Tada će PDF preview, pronalaženje izvora citata, pitanja i odgovori baze znanja biti spremni za upotrebu.
Vidimo se u sledećem.
