Iskreno, Claude Code + DeepSeek V4 je najjači domaći Agent.
DeepSeek V4 (preview) konačno je stigao krajem aprila!
Očekivano.
Prošle godine nakon izdavanja V3 svi su počeli da nagađaju kada će izaći V4. Razlog za tako dugo čekanje je jednostavan — promenjene su kartice, ceo trening framework V4 prebačen je na Ascend.
Znat ćete, duboki thinking mod DeepSeek-a apsolutno je bio u prvom ešalonu tadašnjih velikih modela, čak i lider.
. Kako god bilo, konačno je tu.
Ne dozvoljavam da me pohvale zavedu, ne plašim se kleveta, idem putem i ispravljam sebe.
V4 je poslužen, V4.1 je blizu, sjajno, oh ne, V5 sigurno neće trajati tako dugo.
Napomena, V4 je ovaj put puno lansiran, ne treba čekati u redu za kvalifikaciju, samo promenite parametar modela u API-ju i možete koristiti.
Pro verzija je promenjena u deepseek-v4-pro, flash verzija u deepseek-v4-flash, deepseek-chat i deepseek-reasoner se ukidaju do 24. jula.

Što se tiče cena, pro je prilično skup, ali flash je kao i uvek pristupačan. Bez Coding Plan-a, pro završi jedan razvoj, cena je prihvatljiva, ali pomalo skupa.
Ostale gluposti neću puno pričati, odmah da testiramo.
Nećemo pisati nikakav demo, direktno ubacimo DeepSeek V4 u Claude Code i neka užurbano radi.
01. Claude Code + DeepSeek V4
Iskreno, Claude Code + DeepSeek V4 je najjači domaći Agent.

Nakon promene osnovnog modela, ponovo otvorite terminal, unesite /claude da pokrenete.

Možete koristiti /status da potvrdite da li je konfiguracija na snazi.

Prompt: ulaz za chat Pai Pametnog http://localhost:9527/#/chat je trenutno single-window modus, želim da ga promenim u multi-window — može da otvara novi razgovor, a stari razgovori se direktno arhiviraju.

V4 je prvo pročitao strukturu koda celog projekta. Nakon čitanja dao je plan transformacije.
Koje strukture dodati, koje klase ažurirati, gde refaktorisati storage, kako podesiti raspored stranice, sve jasno nabrojano.


Pratio sam potrošnju tokena sve vreme.

Pročitao toliko koda, plus obim izlaznog plana, nešto više od jednog dolara.
Zatim je počeo da radi. V4 je isplanirao pet zadataka, prvo napad na backend, pa frontend.



Izmenio je 7 fajlova na backend-u, 5 na frontend-u, za oko 15 minuta.


Kompajliranje je prošlo direktno, ima grešaka i sam ih ispravio.
Zatim sam ga naterao da sam koristi CDP da se poveže na Chrome i pokrene test.
Prompt: možeš li sam da putem CDP-a kontrolišeš moj Chrome i testiraš: http://localhost:9527/#/chat

Klika dugmiće, validira funkcije.

Pronađe problem i sam ga popravi.

Nakon popravke nastavlja sa testiranjem funkcije arhiviranja.

Na kraju sam ga naterao i da optimizuje raspored.

Od početka do kraja, Pro je ukupno potrošio oko 10.

Prihvatljivo.
Naravno, iskreno, frontend estetika je zaista još uvek gruba. Raspored je upotrebljiv ali se ne može reći elegantan.

Funkcionalno nema nikakvih problema.
Dobar model, uparen sa top Harness arhitekturom kao Claude Code, može mnogo toga.
Claude Code je toliko moćan jer.
On ne samo da prosleđuje vaš prompt modelu, već u sred dodaje sposobnosti kao što su raščlanjivanje zadataka, čitanje i pisanje fajlova, operacije terminala, automatsko ispravljanje grešaka. Zato isti Harness sa različitim osnovnim modelom jasno pokazuje razliku između modela.
10 za završetak kompletnog razvoja funkcije, od koda do testiranja do popravki bug-ova, ovaj trošak nije skup.

Ali nije ni jeftino, obratite pažnju na malog lika na gornjoj slici, nakon nadgradnje kartice u drugoj polovini godine, cena pro će značajno pasti.
Radujem se sledećoj verziji.
02. Pai Pametan RAG integracija sa DeepSeek V4
Pošto smo u Pai Pametan RAG radili upravljanje modelima.
Odmah sam ubacio Pro i Flash da isprobam.

Postavio sam potpuno isto pitanje: "Šta je Pai Pametan?"
Odgovor Flash-a je ovakav:

Pai Pametan je projekat enterprise-level RAG (Retrieval Augmented Generation) baze znanja, prvobitno deo tehničkog praktičnog projekta za razgovor sa AI velikim modelom (bez retrieval augmentation), kasnije se nezavisno razvio i zadržao ime "Pai Pametan", sa namerom da nastavi autentičnu kraljevsku liniju.
Odgovor Pro-a je ovakav:

Pai Pametan je enterprise-level RAG (Retrieval Augmented Generation) sistem baze znanja, koji na osnovu enterprise dokumenata ostvaruje precizno inteligentno Q&A i upravljanje znanjem. Prvobitno je bio AI chat modul u tehničkom praktičnom projektu (bez retrieval augmentation), kasnije se nezavisno razvio i zadržao ime "Pai Pametan", sa namerom da nastavi projektnu ortodoksnost. Core sposobnosti sistema uključuju: automatsko parsiranje i shrednju dokumenata, Doubao Embedding vektorizaciju, hibridnu pretragu ključnih reči i semantike, generisanje odgovora zasnovano na DeepSeek modelu, Self-RAG mehanizam samoverifikacije, JWT+RBAC izolaciju dozvola više zakupaca, SSE streaming push itd. Kroz end-to-end petlju, efikasno rešava problem raspršenog znanja i kašnjenja u ažuriranju, izbegava "halucinacije" velikih modela, može se primeniti u korisničkoj podršci, obuci, proveri usklađenosti i drugim scenarijima. Pai Pametan je potpuno open source (MIT licenca), tutorijali su hostovani na Pai Tech platformi, podržava privatni deployment i sekundarno proširenje za enterprise.
Jedan koncizan, jedan detaljan.
Na kraju krajeva, Pro ima 49B aktivnih parametara, Flash samo 13B, razlika je skoro 4 puta.
Ali fokus nije na tome ko odgovara duže.
U RAG scenariju, kvalitet pretrage je plafon, a sposobnost modela određuje koliko se od tog plafona iskoristi. Odgovor Flash-a je iako kratak, uhvatio je sve ključne informacije — poreklo projekta, poreklo imena, pozicioniranje. Ono što Pro dodaje (Self-RAG, JWT+RBAC, SSE streaming push), zapravo je sve sadržaj originalnih dokumenata preuzet iz baze znanja, on je samo organizovaniji.
Drugim rečima, ako su dokumenti u vašoj bazi znanja visokog kvaliteta i razumno shrednuti, Flash je sasvim dovoljan.
03. DeepSeek V4 vredan razgovora
Mehanizam pažnje tradicionalnog Transformer-a, svaki token mora da izračuna sličnost sa svim prethodnim tokenima.
Što kontekst može da se povuče sa 100 hiljada na milion, to je osnovni razlog zašto dugi kontekst nije mogao da se pokrene.

DeepSeek-ovo rešenje je da podeli pažnju na dve vrste, naizmenično slagane.
Prva se zove CSA, pun naziv Compressed Sparse Attention, kompresovana sparse pažnja.
Njegova logika je da prvo spoji KV keš svaka 4 tokena u jedan sažetak, a zatim koristi Lightning Indexer za brzo ocenjivanje relevantnosti, čineći da svaki query bira top-1024 najrelevantnijih od ovih sažetaka za računanje.

Drugi se zove HCA, pun naziv Heavily Compressed Attention, jako kompresovana pažnja.
Svakih 128 tokena se spoji u jedan, ali se ne radi sparse selekcija, svi kompresovani sažeci učestvuju u izračunavanju. Pozicija HCA-e je da održi globalnu perspektivu, garantujući da model ne izgubi kontrolu nad celim tekstom.
Dodamo li klizni prozor od 128 tokena za lokalne zavisnosti.
Dakle, CSA je zadužen za finu pretragu, HCA za globalno sagledvanje, klizni prozor za ono pred očima.
Ovaj dizajn možemo ovako razumeti:
Čitanje knjige od 1000 strana, tradicionalna pažnja upoređuje svaku stranicu sa svim prethodnim, kada dođete do 1000. strane morate istovremeno da zapamtite detalje prethodnih 999, kapacitet mozka direktno eksplodira.
CSA pristup je da na svaka 4 strane zalepi post-it, samo sa sažetkom, a zatim kada čitate neku stranicu samo listate 1024 najrelevantnija post-ita.
HCA pristup je još drastičniji — na svakih 128 stranica tek zalepi jedan post-it, ali pregleda sve post-ite. Uz stranicu koju držite u ruci (klizni prozor), imate lokalne detalje, srednjeročnu logiku i globalni tok, ali potrošnja kapaciteta mozga je samo desetina originalne.
04. DeepSeek je zaista uzdržan
Ono što me je najviše iznenadilo je DeepSeek-ova zvanična formulacija ovaj put.
U objavi piše:
Iskustvo korišćenja je bolje od Sonnet 4.5, kvalitet isporuke je blizak Opus 4.6 ne-thinking modusu, ali i dalje postoji određeni jaz u odnosu na Opus 4.6 thinking modus.

Nema "potpuno nadmašio", nema "zgazio", nema "daleko ispred".
U vremenu prepunom "prešao GPT", "najsnačniji na svetu", "proboj prekretnice", ova izjava "zaista smo još uvek daleko" je zaista iskrena.
"Ne dozvoljavam da me pohvale zavedu, ne plašim se kleveta, idem putem i ispravljam sebe."
V4 nije savršen model.
Prema mom sopstvenom iskustvu korišćenja, obrada frontend-a je po mom mišljenju i dalje ostavila mnogo prostora za napredak.
Ovaj stil čvrstih linija za raspored, pomalo vraća na suštinu.

Sledeća verzija ne žuri, radite svojim tempom.
