Claude Code Token sloboda, plus DeepSeek V4+Seedance2 — ByteDance Agent Plan nudi zaista vrhunsku vrednost za novac!
Svi Coding Plan planovi na tržištu trenutno nude samo jezičke modele.
Drugim rečima, ako vašem Agentu treba zvučna sposobnost, morate dodatno priključiti TTS model;
treba vam RAG, morate dodatno priključiti model za ugradnju (embedding); za generisanje videa ili slika morate dodatno priključiti vizuelni model. A to još ne uključuje pretraživanje interneta, memoriju i ostale Harness sposobnosti.
Prava gnjavaža.
Zato je ByteDance (poznat u žargonu kao „svemirska fabrika“) stupio na scenu — Volc Engine je predstavio prvi industrijski Agent paket: Ark Agent Plan.

Snimio sam ekran sa konačnim rezultatima, neka prvo osetite utisak.
[Video]
Zaista, od kodiranja do konačne orkestracije radnog toka, sve je rešeno.
Time se konačno razbijaju ograničenja uobičajenih mesečnih pretplata koje nude samo jezičke modele, i pružaju sveobuhvatne višemodalne Agent sposobnosti.
To uključuje, između ostalog:
- Vodeće domaće velike modele poput DeepSeek V4 Pro, GLM-5.1 i Doubao-Seed-2.0-pro;
- Uz besplatni paket pretraživanja interneta, istog porekla kao Doubao; kao i model za ugradnju Doubao-embedding-vision za memoriju i RAG;
- Seedance 2.0 za generisanje slika i videa.
Eto, kompletni arsenal alata koji Agentu treba za rad je sada na okupu.
Članak vodi korak po korak kroz celu priču. Zavežite pojaseve, krećemo.
01. Povezivanje Claude Code sa Ark Agent Planom
Kupio sam Medium paket od 200 juana; posle celodnevne intenzivne upotrebe mogu reći da je sasvim dovoljan.
Adresa pretplate:

Zainteresovani mogu probati.
Način povezivanja je veoma jednostavan. Ja koristim sopstveni PaiSwitch, proizvod iste kategorije kao i CC Switch.

U base URL upišite https://ark.cn-beijing.volces.com/api/plan, a API Key je onaj specifični API Key iz konfiguracije Ark Agent Plana.
Putanja za preuzimanje prikazana je na sledećoj slici:

Za veliki jezički model možete upisati ark-code-latest; podrazumevano se koristi Auto režim, pri čemu Ark na osnovu složenosti trenutnog zadatka automatski bira najprikladniji model.
Za jednostavna dopunjavanja koristi se laki model, dok se za složene izmene više fajlova angažuje teška artiljerija poput DeepSeek V4 Pro, čime se balansiraju brzina i kvalitet.

Naravno, možete direktno upisati DeepSeek-V4 ili GLM-5.1 i fiksirati željeni model.
Kada završite konfiguraciju, kliknite na[Testiraj vezu]; ako prođe, to znači da je podešavanje uspešno.
Ako niste sigurni, nakon pokretanja Claude Code unesite /status — videćete da base URL pokazuje na Ark Agent Plan, što potvrđuje uspešno povezivanje.

Zatim.
Možemo da krenemo u puni rad.
Zadatak ovog puta je: integrisati Ark Agent Plan u PaiAgent. Nakon što korisnik jednom konfiguriše Agent Plan, radni tok može ponovo da koristi jezički model, pretraživanje interneta, bazu znanja, generisanje slika i generisanje videa, dok ReAct Agent poziva te sposobnosti po potrebi.

PS: PaiAgent je moj projekat otvorenog koda za orkestraciju radnih tokova, sličan Kouzi-ju. Obuhvata razne tehnološke stekove potrebne za razvoj Agenta, poput SpringAI, LangGraph4j, ReAct, MCP, RAG, tool call, Skills i slično.
Možete pratiti i učiti uz projekat: https://github.com/itwanger/PaiAgent

Da sumiramo sposobnosti koje ovog puta dodajemo:
- U globalnu konfiguraciju se dodaje „Ark Agent Plan“.
- Proširuju se Harness sposobnosti, uključujući pretraživanje interneta (dostupno preko MCP-a).
- Dodaju se višemodalni čvorovi za generisanje slika i videa.
- LLM čvor dobija podršku za ReAct, MCP i RAG bazu znanja.
Zatim predajemo Claude Code-u i krećemo u posao.

Obim razvoja ovog puta nije mali.



OK, gotovo.
Ukupna potrošnja je prilično razumna; naravno, naknadno sam ispravio i neke bagove, ali neću za svaki prikazivati sliku.

Utisak mi je da je pisanje koda sa Claude Code + DeepSeek V4 veoma glatko, sa malo prepravki.
02. PaiAgent se povezuje sa Ark Agent Planom
Pisanje koda je tek prvi korak; sada sledi glavni deo — da se pun set sposobnosti Ark Agent Plana pokrene u okviru PaiAgenta.
Cilj nam je: istovremeno realizovati ReAct, MCP pretraživanje interneta, bazu znanja sa Embedding-om, generisanje slika i generisanje videa.
Hajde da ih povežemo jedno po jedno.
Prvi korak je dodavanje provajdera Ark Agent Plan u globalnu konfiguraciju.

API adresa: https://ark.cn-beijing.volces.com/api/plan/v3
API ključ je isti kao i kod prethodnog podešavanja Claude Code-a.
Da objasnim zašto je potrebno podesiti još jednom u PaiAgentu. Claude Code služi za pisanje koda i troši kvotu jezičkog modela. PaiAgent služi za pokretanje radnih tokova; pored jezičkog modela, koristi i pretraživanje interneta, model za ugradnju, generisanje slika i videa.
Zatim sledi konfiguracija modela za slike i video.

Za model generisanja slika upišite doubao-seedream-5.0-lite, a za model generisanja videa doubao-seedance-2.0; možete ih preuzeti klikom na[Vizuelni modeli]unutar[Konfiguracija modela i base URL-a].

Za model ugradnje upišite doubao-embedding-vision; dostupan je pod[Model za vektorizaciju]unutar[Konfiguracija modela i base URL-a].

Zaista vodič korak po korak; samo pratite i praktično radite.
03. Povezivanje pretraživanja interneta iz Ark Agent Plana
Sposobnost pretraživanja interneta je za Agenta od presudnog značaja. Podaci za obuku velikog modela imaju rok isteka — pitajte ga „da li svinje u 2026. još uvek penju se na drveće“ i neće znati; pitajte ga „koja je najnovija verzija Spring AI-a“ i verovatno će dati zastareo odgovor. Sa pretraživanjem interneta, LLM tokom rezonovanja može sam da pretražuje, preuzima najnovije informacije i tek onda odgovara.
Prethodno LLM čvor u PaiAgentu nije podržavao pretraživanje interneta; bilo je potrebno posebno priključiti tu sposobnost.

Sada, pošto Ark Agent Plan besplatno uključuje kvotu za pretraživanje interneta istog porekla kao Doubao, možemo je pozivati direktno iz LLM čvora.
Kako se koristi?
U PaiAgentu kliknite na[MCP konfiguracija], dodajte MCP za pretraživanje interneta i upišite API Key za pretraživanje.

Možete ga preuzeti klikom na[Prikaži API key za pretragu]unutar[Konfiguracija Harness-a].

Nakon uspešnog dodavanja pojaviće se novi MCP alat za pretraživanje interneta.

Možete kliknuti[Testiraj]da proverite, npr. pretražite ključnu reč[Chenmo Wang Er Java bloger]i vidite da li će pronaći relevantne informacije.

OK, pronašao je, i informacije su veoma tačne. To znači da je pretraživanje interneta, od konfiguracije do poziva, potpuno operativno.
Iz konfiguracije Harness-a takođe se vidi da se kvota za pretraživanje menja, što potvrđuje da zaista troši besplatnu kvotu pretraživanja iz Ark Agent Plana.

Konfiguracija je gotova, a sada u praksi pokrećemo jedan zanimljiv slučaj. Dizajnirao sam radni tok „AI generator autoportreta“: unosi se ime osobe, LLM prvo pretražuje internet za javne informacije o toj osobi, a zatim na osnovu pronađenog generise prompt za sliku.
Vratimo se na uređivanje radnog toka, napravimo novi radni tok i u LLM čvor uključimo pretraživanje interneta.

U prompt unesite:
Ti si profesionalni dizajner promptova za generisanje portreta.
Osoba koju je korisnik uneo je: {{input}}
Koristi pretraživanje interneta da dobiješ javne informacije o toj osobi, sa fokusom na:
1. Stvarni identitet i profesionalne oznake
2. Fizičke karakteristike na osnovu javnih fotografija ili lične stranice
3. Uobičajeni stil odeće, aura, starosna grupa, izraz lica i okruženje
4. Simboli identiteta ili elementi pozadine usko povezani sa osobom
Nakon pretrage, na osnovu javnih informacija generiši „prompt za autoportret“ pogodan za model za generisanje slika.
Zahtevi:
- Ne izmišljaj konkretne detalje lica koji se ne mogu zaključiti iz javnih informacija
- Ako javnih podataka nedostaje, koristi izraz „identitet i aura vidljivi iz javnih informacija + razumna generalizovana pojava“
- Prompt treba da bude spreman za direktan prosleđivanje čvoru za generisanje slika
- Stil: portret stvarne osobe, prirodna svetlost, polu-figura, profesionalno ali pristupačno
- Ne ispisuj proces pretrage
- Ne ispisuj objašnjenja
- Ispiši samo konačni prompt za generisanje slike
Izlazni format:
Portret kineskog tehničkog blogera/pisca zasnovan na javnim informacijama, osoba je {{input}}, …Zatim unosimo[Chenmo Wang Er], tako da LLM prvo pretražuje internet radi javnih informacija, pa tek onda generiše prompt.

Prompt je veoma tačan; LLM je nakon pretrage mojih javnih informacija automatski izvukao ključne elemente kao što su fizičke karakteristike, stil odeće i profesionalne oznake, i organizovao ih u prompt pogodan za model za generisanje slika.
Portret kineskog tehničkog blogera/pisca zasnovan na javnim informacijama — osoba je Chenmo Wang Er (nadimak „Erge“), muški programer starosti oko 30–40 godina, sa crnim okvirom naočara, kratkom kosom, lepog i pristupačnog lica, sa osmehom, odeven u ležerni programerski stil (bela ili svetla majica / karirana košulja), polu-figura, prirodno meko svetlo, jednostavna i blaga pozadina (ili sa policama za knjige i ekranom računara), profesionalna ali pristupačna aura, stil fotografije portreta stvarne osobe, žiža 85 mm, umerena dubinska oštrina, prirodan kontakt očima.Iz evidencije pretrage takođe se vidi da je LLM zaista pozvao pretraživanje interneta web_search i preuzeo ispravne podatke.

Kasnije, kada povežemo čvor za generisanje slika, videćemo efekte ovog prompta.
04. Povezivanje modela za ugradnju iz Ark Agent Plana
Pretraživanje interneta rešava problem pribavljanja informacija u realnom vremenu, ali šta ako imamo sopstvenu privatnu bazu znanja?
Na primer, interne tehničke dokumente kompanije, uputstva za proizvode, podatke o klijentima — to se na internetu ne može pronaći, a nema ih ni u podacima za obuku LLM-a. Tada nam treba baza znanja: dokumenti se vektorizuju i uskladište, a LLM po potrebi pretražuje relevantne delove — to je RAG.

Napravimo novu bazu znanja i ubacimo prethodni dokument sa zahtevima za razvoj.

Izaberite model za ugradnju doubao-embedding-vision iz Ark Agent Plana.

Izaberite fajl, kliknite na Upload i uvoz.

Kliknite na pregled isečaka da pogledate. Strategija sečenja je podrazumevano po pasusima, ali možete podesiti i veličinu isečka i prozor preklapanja. Za tehničku dokumentaciju podrazumevana podešavanja su sasvim dovoljna.

Kada potvrdite da je sve u redu, kliknite na[Izgradi indeks]da završite vektorizaciju. Ovde se koristi model doubao-embedding-vision iz Ark Agent Plana, bez dodatne naplate.

Zatim kliknemo na[Test pretrage], unesemo upit, na primer[kako se radi pretraživanje interneta?], da vidimo da li će pronaći relevantan sadržaj dokumenta.

OK, rezultati pretrage su veoma precizni; izvukao je pasuse iz dokumenta zahteva koji se odnose na pretraživanje interneta.
Naravno, ovaj deo se može dodatno optimizovati — parametri poput strategije sečenja, praga sličnosti i broja povučenih rezultata mogu se podesiti kako bi se poboljšala preciznost pretrage i relevantnost povučenog.
Sledeće je testiranje. Vratimo se u radni tok, označimo ovu bazu znanja u LLM-u i vidimo da li u radnom toku može normalno da pozove pretragu vektora, odnosno da LLM odgovara na pitanja na osnovu sadržaja baze znanja.

Na primer[Ko je Chenmo Wang Er?], da vidimo da li će pronaći relevantan sadržaj.

Dobro, LLM je pošteno odgovorio da „u bazi znanja nisu pronađene relevantne informacije“, nije izmišljao. To je veoma važno — ako nema pogotka, onda nema pogotka; ne sme se izmišljati odgovor.
Probajmo drugi upit, na primer[kako se radi pretraživanje interneta?].

U evidenciji izvršavanja vidi se da je LLM zaista pozvao pretragu vektora baze znanja, pogodio relevantne isečke, a zatim na osnovu rezultata pretrage generisao odgovor. Ceo RAG tok je u redu.
Deo rezultata je sledeći:
Na osnovu trenutne baze znanja, način korišćenja pretraživanja interneta u PaiAgent-one je sledeći:
1. Preduslovi konfiguracije
Potrebno je prvo u globalnoj konfiguraciji izabrati provajdera „Volc Engine Agent Plan“ (volcengine_agent_plan)
Uključiti prekidač web_search_enabled da bi se aktivirala sposobnost pretraživanja interneta
Agent Plan besplatno uključuje kvotu za pretraživanje interneta istog porekla kao Doubao; odmah po aktivaciji dostupne su ažurne i autoritativne informacije
2. Način korišćenja 1: orkestracija čvorova
Sposobnost pretrage se može ostvariti preko novog čvora za pretragu:
čvor web_search (opšta pretraga)
Ulazni parametri: query (ključna reč za pretragu), limit (broj rezultata), freshness (aktuelnost), siteFilter (filter lokacije), language (jezik)
Sadržaj izlaza: results (lista rezultata pretrage), summary (sažetak rezultata), citations (izvori), query (originalni upit)
….
Zaista dobro. I pretraživanje interneta i pretraga vektora baze znanja, te dve glavne sposobnosti pribavljanja informacija, uspešno su povezane, i LLM ih u radnom toku može pozivati po potrebi.
05. Povezivanje vizuelnih modela iz Ark Agent Plana
Zatim dolazi višemodalna generacija — slike i video.
Dizajniran radni tok izgleda ovako: prvo LLM pretragom interneta pribavlja informacije o osobi, generiše prompt za sliku i prompt za video, a zatim taj prompt direktno prosleđuje čvoru za generisanje slika, odnosno čvoru za generisanje videa. Jedan unos, automatski nastaju slika i video.
Najpre radnom toku dodajemo čvor za generisanje slika; njegov ulazni prompt referencira prompt generisan u prethodnom LLM koraku.

Pogledajmo konačni izlaz — neverovatno, pomalo mi se učinilo da sam video živu osobu.

Kvalitet je potpuno prevazišao moja očekivanja, posebno kada su u pitanju detalji poput naočara, frizure i aure. Sposobnost izrade slika modela Seedream 5.0 je zaista na nivou.
Dobro, generisanje slika je rešeno, a sada dodajmo LLM čvor + čvor za generisanje videa, da vidimo efekte generisanja videa pomoću Seedance 2.0.

LLM prompt je sledeći:
Ti si profesionalni dizajner promptova za generisanje videa. Na osnovu unosa korisnika, generiši kineski prompt za video pogodan za AI model za generisanje videa.
Zahtevi:
1. Ispiši samo konačni prompt za video, bez objašnjenja, bez nabrajanja po tačkama.
2. Prompt treba da sadrži subjekt, scenu, radnju, pokret kamere, svetlost, stil slike i zahteve za kvalitetom.
3. Slika treba da bude realna i prirodna, pogodna za generisanje kratkih videa.
4. Izbegavaj pojavu teksta, vodenih žigova, logotipa, titlova, deformisanih udova i treperenja slike.
5. Ako korisnik navede samo osobu ili temu, dopuni razumnom scenom i izrazom kamere.
Korisnički unos: {{input}}
Ispiši jedan kompletan prompt za generisanje videa.Unos je opet[Chenmo Wang Er], da vidimo efekte video prompta.

Generisanje videa se razlikuje od generisanja slika — slika se vraća sinhrono, gotovo trenutno. Ali generisanje videa je asinhrono: nakon slanja zadatka potrebno je malo sačekati, obično između 30 sekundi i 2 minuta, u zavisnosti od dužine videa i složenosti slike. PaiAgent ovde implementira SSE push, tako da se promene statusa zadatka u realnom vremenu prikazuju na frontendu.
I video ću priložiti, da osetite utisak.
[Video2]
06. Kako upisati PaiAgent u biografiju?
Do sada smo pomoću Ark Agent Plana u potpunosti pokrenuli pretraživanje interneta, generisanje slika, generisanje videa i pretragu vektora baze znanja.
Jezički model, model za ugradnju i vizuelni model — tri vrste modela objedinjene su na jednom mestu i u radnom toku se pozivaju po želji, bez potrebe da po različitim platformama tražite API ključeve; to je zaista bezbrižno iskustvo.

Da sumiramo kako se ovo upisuje u biografiju:
Naziv projekta: PaiAgent — platforma za orkestraciju AI radnih tokova slična Kouzi-ju
Kratak opis: Omogućava izgradnju složenih AI procesa povlačenjem i puštanjem; podržava orkestraciju višemodalnih sposobnosti poput povezivanja više modela, pretraživanja interneta, RAG baze znanja, te generisanja slika i videa.
Tehnološki stek: Java 21, Spring AI 1.0, LangGraph4j, MySQL, MinIO, Redis
Ključne odgovornosti:
- Pretraživanje interneta: na osnovu MCP protokola enkapsuliran je API za pretraživanje interneta iz Ark Agent Plana, čime je omogućeno pozivanje pretraživanja interneta iz LLM čvora po potrebi. Rezultati pretrage se automatski ubacuju u Prompt kontekst, tako da LLM može da pribavi informacije u realnom vremenu, a tek onda da rezonuje.
- Integrisani su čvor za generisanje slika Seedream i čvor za generisanje videa Seedance, uz podršku za paralelno lančano povezivanje „LLM generiše prompt → generisanje slike → generisanje videa“ unutar radnog toka; video i slike se objedinjeno čuvaju u MinIO.
- Pretraga vektora: integrisan je model za ugradnju Doubao-embedding-vision, čime je ostvaren kompletan RAG tok: otpremanje dokumenta → automatsko sečenje → vektorizacija → izgradnja indeksa. LLM čvor može izabrati bazu znanja radi topK vektorskog vraćanja rezultata, koji zatim kao kontekst učestvuju u rezonovanju.
- Implementiran je izvršilac Agent čvora u ReAct režimu, sa podrškom za do 20 koraka iteracije rezonovanja i dinamičku registraciju alata; devet ugrađenih alata (pretraživanje interneta, pretraga baze znanja, vraćanje memorije itd.) enkapsulirano je kao sposobnosti koje Agent samostalno poziva.
- Na osnovu Spring AI integrisan je Ark Agent Plan, čime je omogućena konfiguraciona promena između više jezičkih modela poput DeepSeek V4 Pro i GLM-5.1; jedan API pokriva četiri vrste modela: jezičke, vektorske, slikovne i video.
