I spent a week organizing this AI Agent learning roadmap; backend programmers transitioning can copy it directly
U privatnim porukama koje nedavno dobijam, polovina postavlja isto pitanje: "Erge, želim da pređem na AI, ali ne znam odakle da počnem."
Iskreno, previše dobro razumem taj osećaj. Otvorite Bilibili i tražite AI learning roadmap, a gomila videa vam kaže da prvo morate naučiti Transformer, prvo pročitati rad "Attention is All You Need", prvo razumeti backpropagation. Posle gledanja osetite da vam matematika nije dovoljna, okrenete se i zatvorite pregledač.
Ali istina je — većina ljudi meša dve stvari.
Ono što želite je AI application development, a ne odlazak u ByteDance AI Lab da trenirate modele. Razlika u learning roadmap-u ova dva pravca toliko je velika da izgleda kao da su dva zanimanja.
U današnjem tekstu potrošio sam poprilično vremena da sredim i od početka do kraja raščlanim learning roadmap za AI Agent. Posle čitanja bi trebalo da razjasnite tri stvari: šta učiti, šta prvo a šta kasnije, i šta trenutno uopšte ne morate da dodirnete.
Nemojte da vas anksioznost koju prodaju marketing naloga skrene s puta. Na kraju krajeva, učenje AI application development-a nije suštinski drugačije od učenja Java back-end-a nekada — u oba slučaja radi se o razumevanju osnovnih pojmova, upoznavanju sa tech stack-om, i zatim vežbanju kroz projekte.
[Insert AI Agent learning roadmap panoramic view here: Screenshot target: show a panoramic view of the layered structure of the AI tech stack; Keywords: AI tech stack, layered architecture, panoramic view; Suggested position: mind map or architecture diagram]
01. AI Engineer ≠ Algorithm Engineer
Kada mnogi programeri čuju za AI, prva slika koja im iskoči u glavi je: matematičke formule, radovi, treniranje modela, podešavanje loss funkcije. Zatim odmah odustanu — zaboravi, moja matematika nije dovoljna.
Ovo je najveća zabluda o AI inženjerima.
U AI polju postoje dve potpuno različite uloge. AI algorithm engineer istražuje arhitekturu modela, trenira modele i optimizuje njihove efekte; zaista zahteva čvrste matematičke osnove i iskustvo u deep learning-u — ono što oni rade je pravljenje motora. AI application engineer (u industriji se često naziva i Agent engineer) na osnovu postojećih large modela gradi AI-pokretane aplikacije i sisteme; ono što mu treba je inženjerska sposobnost i znanje AI application layer-a — ono što oni rade je pravljenje automobila.
Ne moramo da umemo da napravimo engine baze podataka da bismo koristili MySQL za izgradnju sistema; isto tako, ne moramo da umemo da treniramo GPT da bismo koristili large modele za izgradnju aplikacija.
Ono što industriji sada najviše nedostaje nisu ljudi koji mogu da treniraju modele — to je posao AI Lab-ova velikih kompanija i kompanija za modele. Najviše nedostaju ljudi koji mogu dobro iskoristiti modele i pretvoriti AI sposobnosti u proizvode. A to je upravo ono u čemu programeri najviše briljiraju.
Uzmimo za primer radno mesto AI Agent engineer-a u Alibaba-i: suštinski, zahtevi za zapošljavanje svode se na osnove back-end inženjera + AI application sposobnosti. Ako ste radili na 1-2 duboka RAG ili Agent projekta, u osnovi ćete pokriti odgovarajući tech stack.
[Insert Alibaba AI Agent engineer job posting screenshot here: Screenshot target: prove that AI engineer positions focus primarily on engineering ability; Keywords: hiring requirements, AI Agent, back-end foundation; Suggested position: job website page]
Dakle, cilj ovog članka je jasan: dati vam panoramsku mapu AI tehničkog polja, plus izvodljiv learning roadmap. Posle čitanja bi trebalo da bude jasno — šta postoji, kakav je odnos između tih stvari, šta prvo učiti a šta kasnije, i šta trenutno ne morate da dodirnete.
Prvo ću vam dati sliku, da ne biste posle gomile pojmova ostali ne znajući šta naučeno može da radi.
Nakon Phase 1 (oko 3 nedelje), moći ćemo da napišemo terminal chat bota — unesete pitanje, model streaming-om vraća odgovor, kao ChatGPT. Nakon Phase 2 (oko 2 meseca), moći ćete da napravite internal document Q&A sistem za tim — kolega pita u grupi "Kakav je naš deployment proces?", AI ga direktno pretražuje iz biblioteke dokumenata i odgovara. Dalje, nakon Phase 3, moći ćete da napravite automatizovani weekly report Agent koji sam pregleda Git commit zapise i status zadataka, sastavi nedeljni izveštaj i pošalje ga u Feishu grupu.
Ovo nije prazno obećanje; u svakoj narednoj fazi ću vam reći kako korak po korak da to ostvarite.
02. AI Technical Panorama — Understand the six-layer architecture
AI tehnički sistem ima mnogo pojmova, ali oni nisu raštrkani — imaju jasnu slojevitu strukturu. Kao što back-end tech stack ima layer baze podataka, caching layer, service layer i gateway layer, AI tech stack se takođe nadograđuje sloj po sloj.
Layer 1: Model layer (foundation layer)
Ovaj sloj je temelj celog AI tech stack-a; sve gornje sposobnosti građene su na large modelima. Ali za programera je pozicija jednostavna: dovoljno je znati koji modeli postoje, koja im je veličina parametara i kako ih odabrati. Ne morate da ulazite duboko u principe treniranja i arhitekturu modela — baš kao što za korišćenje MySQL-a ne morate čitati InnoDB source code.
Brzo lociranje nekoliko ključnih pojmova. LLM (Large Language Model) je model koji može razumeti i generisati prirodni jezik — npr. GPT, Claude, DeepSeek — i trenutno je core engine AI aplikacija. Embedding Model pretvara tekst u vektore (niz brojeva) za semantic search i izračunavanje sličnosti; koristiće se kasnije kada govorimo o RAG-u. Multimodalni modeli pored konvencionalnog LLM-a mogu obrađivati i slike, audio i video.
Način nabavke modela deli se u dve vrste: open-source modeli (DeepSeek, Qwen, LLaMA) mogu se preuzeti za lokalni deployment, dok se closed-source modeli (GPT, Claude) mogu pozivati samo preko API-ja. Svaki ima svoje scenarije primene — nije prosto pitanje ko je bolji.
Početnici treba da zapamte samo jedno: model je super-snažna funkcija za obradu teksta; ne moramo da ga pravimo, samo da umemo da ga pozovemo. U fazi učenja dovoljno je pokrenuti open-source model lokalno pomoću Ollama-e — besplatno je i ne zavisi od mreže.
[Insert mainstream large model comparison chart here: Screenshot target: show comparison of current mainstream open-source and closed-source models; Keywords: GPT, Claude, DeepSeek, Qwen, parameter scale; Suggested position: table or comparison chart]
Layer 2: Model interface and communication layer
Problem koji ovaj sloj rešava je: kako razgovarati sa modelom. Za programera je large model u suštini HTTP servis — pošaljete zahtev, dobijete rezultat.
Chat Completion API je najvažniji interfejs. Svaka poruka ima oznaku uloge: system (sistemsko podešavanje), user (korisnički unos), assistant (odgovor modela); ove tri uloge čine potpun kontekst razgovora. Gotovo sve AI aplikacije izgrađene su na ovom interfejsu.
Trenutno postoje dva glavna API standarda — OpenAI format i Anthropic format. Većina kineskih modela (DeepSeek, Qwen, Zhipu itd.) kompatibilna je sa OpenAI formatom, što znači da zamena modela često zahteva samo promenu base_url-a i API Key-a.
[Insert Chat Completion API call example screenshot here: Screenshot target: show the simplest API call code and its return result; Keywords: Chat API, request/response, role tags; Suggested position: code editor or terminal]
Function Calling / Tool Use omogućava modelu da tokom odgovaranja poziva alate — npr. pretražuje bazu podataka ili poziva weather API. Model zapravo ne izvršava kod, već vraća strukturisanu nameru poziva (koju funkciju da pozove, koje parametre da prosledi); naš program je taj koji izvršava i vraća rezultat modelu. Ovo je osnovna sposobnost za izgradnju Agent-a.
[Insert Function Calling flowchart here: Screenshot target: show the complete call chain user → model → tool → model → user; Keywords: Function Calling, tool call, structured output; Suggested position: flowchart]
Nekoliko ključnih parametara morate razjasniti. Token je osnovna jedinica kojom model obrađuje tekst; API se naplaćuje posebno po ulaznom/izlaznom Token-u. Context Window je maksimalan broj Token-a koji model može obraditi u jednom pozivu — GPT-4o ima 128K, Claude Opus 4 ima 200K. Temperature kontroliše nasumičnost izlaza: što je niža, to je izlaz određeniji i pogodniji za činjenične zadatke; što je viša, to je kreativniji.
[Insert OpenAI Tokenizer tool screenshot here: Screenshot target: show the effect of splitting the same piece of Chinese text into Tokens; Keywords: Token, tokenizer, Tokenizer; Suggested position: OpenAI official Tokenizer page]
Početnici treba da zapamte samo jedno: large model je samo HTTP interfejs — pošaljete JSON zahtev, primate JSON odgovor. Ako umete da pozivate REST API, umete da pozivate large model; nema ničeg novog.
Ovaj sloj je polazna tačka za programere koji ulaze u AI. Nakon savladavanja ovog sloja, sa nekoliko desetina linija koda moći ćete da napišete program koji razgovara sa large modelom.
Layer 3: Data and retrieval layer — the main battlefield of RAG
Large model ima urođenu manu: zna samo ono što je video tokom treniranja; ne zna naše interne dokumente kompanije, najnovije poslovne podatke niti politiku objavljenu juče.
Osnovna ideja se zove RAG (Retrieval-Augmented Generation): prvo se iz knowledge base-a pretraži relevantan sadržaj, zatim se taj sadržaj ubaci u Prompt kako bi model generisao odgovor. Razumite to kao open-book ispit za model — prvo neka lista po knjizi, pa neka odgovara. Ovo je trenutno najzastupljeniji i najpraktičniji obrazac AI aplikacija.
Kompletan RAG sistem deli se u dva pipeline-a:
[Offline indexing] Raw docs → Parse → Chunk → Embedding → Store in vector DB
[Online query] User question → Embedding → Retrieve relevant chunks → (Rerank) → Assemble into Prompt → Model generates answerU fazi pripreme podataka treba dobro srediti "knjigu". Document parsing pretvara sirovi fajl u čist tekst — zvuči jednostavno, ali je zapravo najprljaviji i najnaporniji deo: skenirane dokumente treba obraditi OCR-om, a tabele i slike zahtevaju posebnu obradu. Document chunking seče dugačke dokumente na male segmente; strategija chunking-a direktno utiče na kvalitet pretrage: ako sečenje bude preveliko, pretraga nije precizna; ako bude premalo, gubi se kontekst.
U fazi vektorizacije i skladištenja, Embedding model pretvara komad teksta u high-dimensional vector; tekstovi sa sličnom semantikom imaju vektore koji su međusobno blizu u prostoru. Zatim se čuvaju u vector database — glavne opcije su Pgvector (PostgreSQL ekstenzija, najjednostavniji), Milvus/Qdrant (namenska vector baza podataka, jače performanse).
[Insert vector similarity visualization screenshot here: Screenshot target: show the effect that semantically similar texts are closer together in vector space; Keywords: Embedding, vector space, semantic similarity; Suggested position: vector visualization tool or diagram]
U fazi pretrage i rangiranja, i korisničko pitanje se pretvara u Embedding, pa se u vector bazi pronalaze najbliži fragmenti dokumenta. Hybrid search istovremeno koristi vector search i keyword search, pa nadoknađuju slabosti jedni drugih. Reranker (re-ranking model) precizno ocenjuje preliminarne rezultate i stavlja najrelevantnije na vrh.
[Insert hybrid search comparison screenshot here: Screenshot target: compare the difference in search results between pure vector search and hybrid search; Keywords: hybrid search, vector search, keyword search, Reranker; Suggested position: search results comparison table]
[Insert RAG flow architecture diagram here: Screenshot target: intuitively show the complete data flow of a RAG system; Keywords: RAG, vector database, Embedding, retrieval; Suggested position: flowchart]
Početnici treba da zapamte samo jedno: RAG je jednostavno "prvo pretraži, pa odgovori" — korisnik postavi pitanje, mi prvo pretražimo relevantan sadržaj iz naše biblioteke dokumenata, a zatim model odgovara na osnovu tog sadržaja. Pretraga koristi vektore (ne ključne reči), pa može razumeti semantiku.
Layer 4: Capability extension and agent layer
Prva tri sloja omogućavaju AI-u da razgovara i pretražuje materijale. Ovaj sloj omogućava AI-u da radi — ne samo da odgovara na pitanja, već i da razume cilj, pravi plan, poziva alate i samostalno dovršava zadatke.
Prompt Engineering prolazi kroz sve faze. Sa istim modelom, različiti načini postavljanja pitanja daju odgovore različitog kvaliteta. System Prompt postavlja ulogu modela; Few-shot daje nekoliko primera koje model imitira; Chain of Thought navodi model da korak po korak izvodi zaključke.
Agent je jezgro ovog sloja. On se ne završava jednim pozivom modela, već je loop sistem: percepcija ulaza → razmišljanje i zaključivanje → preduzimanje akcije → posmatranje rezultata → nastavak razmišljanja → … → završetak zadatka.
ReAct obrazac je klasična Agent radna paradigma — model prvo razmisli "šta treba da uradim", zatim izvrši akciju (npr. pozove search alat), posmatra rezultat, pa odlučuje o sledećem koraku. Većina Agent okvira zasnovana je na ovom obrascu.
Prilikom stvarnog građenja AI aplikacija treba razlikovati Workflow i Agent kao dve ideje za orkestraciju. Workflow unapred definiše fiksan tok, lako se kontroliše i pogodan je za scenarije sa jasnim procesom. Agent sam odlučuje šta je sledeći korak, fleksibilan je ali nosi veću neizvesnost. U stvarnim projektima se dvoje često meša.
[Insert Agent work loop diagram here: Screenshot target: show the cyclic decision-making process of an Agent under ReAct pattern; Keywords: ReAct, planning, execution, observation; Suggested position: flowchart]
Početnici treba da zapamte samo jedno: Agent je AI zaposleni koji sam misli, sam radi i sam proverava. Mi mu damo cilj i alate, a on odlučuje kako da završi zadatak.
Layer 5: Engineering and infrastructure layer
To što AI aplikacija radi u Notebook-u i to što radi u production-u nisu ista stvar. Ovaj sloj rešava pitanja odlaska u production — pouzdanost, sigurnost, trošak, observability — a to je upravo oblast koju back-end programeri najbolje poznaju.
AI Gateway objedinjuje upravljanje svim AI zahtevima, zadužen za autentifikaciju, rate limiting, logove i rutiranje — gotovo identično API Gateway-u koji poznajemo. Model routing i fallback na osnovu složenosti zadatka inteligentno biraju model: jednostavna pitanja idu na jeftin mali model, a složena na jači model.
Safety guardrail layer sprečava AI da se prevrne. Prompt Injection odbrana je SQL injection AI aplikacija — ista napadačka i odbrambena logika, samo se medijum promenio iz SQL-a u prirodni jezik. Hallucination detekcija zaustavlja ponašanje modela koji ozbiljnim tonom izmišlja činjenice.
Observability obuhvata osnovno praćenje (latencija, stopa grešaka) i AI-specifično chain tracing — jedan Agent poziv može interno pokrenuti više krugova model poziva, plus više tool poziva, plus više pretraga, pa je potreban potpun call chain da bi se problem otklonio.
[Insert LangSmith chain tracing screenshot here: Screenshot target: show the complete Trace chain of one Agent call (multiple rounds of LLM calls + tool calls); Keywords: LangSmith, Trace, chain tracing, observability; Suggested position: LangSmith or Langfuse console]
Početnici treba da zapamte samo jedno: ono što radi ovaj sloj je potpuno isto kao gateway, monitoring i caching u tradicionalnom back-end-u; jedino se servis kome se uslužuje promenio iz mikroservisa u large model. Učenici sa jakim back-end osnovama ovde će imati prirodnu prednost.
Layer 6: Application layer
Prvih pet slojeva su tehničke komponente i inženjerske sposobnosti, a ovaj sloj je njihov konačan oblik isporuke. Knowledge base Q&A sistem je najtipičniji scenario sletanja za RAG; Text-to-SQL omogućava i netehničkim ljudima da prirodnim jezikom pretražuju podatke; AI Copilot pomaže kod kodiranja i razvoja; inteligentni workflow pokreće delove poslovnog procesa koji zahtevaju razumevanje i prosuđivanje.
[Insert AI application forms overview diagram here: Screenshot target: show typical application forms such as knowledge base Q&A, Text-to-SQL, AI Copilot; Keywords: application layer, knowledge base Q&A, Text-to-SQL, AI Copilot; Suggested position: application classification diagram]
Za programere su Layer 2, 3, 4 i 5 glavno bojište. Layer 2 je ulaz; Layer 3 i Layer 4 su core skills; Layer 5 je ključ za iskorišćavanje back-end prednosti da AI aplikacije zaista slete.
03. Concept relationship overview — don't study in a scattered way
Panoramska mapa rešava pitanje "šta postoji", ali pojmovi nisu izolovani. Ova sekcija povezuje nekoliko najvažnijih linija.
Complexity evolution chain
Polazeći od najjednostavnijeg LLM poziva, svaki korak je nadogradnja na prethodni:
LLM API call → + Prompt Engineering → + RAG → + Function Calling → + Agent → + Multi-AgentU većini poslovnih scenarija, već RAG + Function Calling može rešiti problem; ne morate odmah da krenete na Multi-Agent.
[Insert complexity evolution ladder diagram here: Screenshot target: show the step-by-step progressive relationship from LLM API to Multi-Agent; Keywords: complexity evolution, progressive relationship, capability stacking; Suggested position: ladder or layered diagram]
Three ways to make the model better
Prompt Engineering je postavljanje boljih pitanja — analogno tome da sa pametnim čovekom komunicirate efikasnije. RAG je davanje referentnog materijala modelu — analogno tome da mu date šemu referentnih dokumenata za open-book ispit. Fine-tuning je činjenje da model sam postane stručniji — analogno tome da ga pošaljete na obuku u trening centar.
Preporučena strategija je da pokušavate redom, bez preskakanja: prvo optimizujte Prompt (80% problema se reši u ovom koraku); ako efekat nije dovoljan, dodajte RAG da uvede eksterno znanje; ako i dalje nije dovoljno, tek onda razmislite o Fine-tuning-u.
Česta zabluda: misliti da Fine-tuning može naučiti model da zapamti sadržaj enterprise knowledge base-a. U stvari, za ubacivanje znanja RAG je prikladniji; Fine-tuning je pogodniji za podešavanje obrasca ponašanja modela.
[Insert Prompt/RAG/Fine-tuning comparison table screenshot here: Screenshot target: a table comparing cost, effect and applicable scenarios of three optimization methods; Keywords: Prompt Engineering, RAG, Fine-tuning, comparison; Suggested position: comparison table]
Workflow vs Agent vs Multi-Agent
Ovo troje su u progresivnom odnosu — što je veća autonomija, to je veća sposobnost, ali i veća neizvesnost. Što se može rešiti sa Workflow-om, to rešite sa Workflow-om (kontrolisano, predvidljivo, lako za održavanje); za fleksibilno prosuđivanje koristite Agent; na Multi-Agent prelazite tek kada jedan Agent nije dovoljan.
Čest obrazac u production-u je hibridna arhitektura: celina je deterministički proces Workflow-a, a u delovima koji zahtevaju fleksibilno prosuđivanje ugrađen je Agent. Ne krećite odmah na Multi-Agent — cena debug-ovanja je izuzetno visoka.
[Insert concept relationship comparison table here: Screenshot target: clearly compare the applicable scenarios of Workflow/Agent/Multi-Agent; Keywords: Workflow, Agent, Multi-Agent, selection; Suggested position: comparison table]
04. Learning path planning — go in three phases
Postoji samo jedno osnovno načelo: prvo neka radi, pa onda optimizuj; prvo savladaj primenu, pa onda dopuni principe.
Phase 1: Get the basic chain running (3-4 weeks)
Vremensko ulaganje je oko 20-30 sati; amaterski, sa 1-2 sata dnevno, to je oko 3-4 nedelje. Cilj ove faze je jasan: omogućiti nam da razgovaramo sa large modelom — i to pomoću koda.
Step 1: Understand the basic concepts (2-3 hours)
Ne morate da čitate radove, ali nekoliko pojmova morate umeti svojim rečima da objasnite. LLM je u suštini funkcija koja prima tekst i vraća tekst — samo što je ta funkcija izuzetno moćna. Token je najmanja jedinica kojom model obrađuje tekst i određuje dve stvari — gornju granicu dužine konteksta i cenu. Prompt je ulazni tekst koji se šalje modelu. Temperature kontroliše nasumičnost izlaza modela: 0 uvek bira najsigurniju opciju, a što je vrednost veća, model je spremaniji da pokuša s izražajima koji su noviji.
Step 2: Set up a local development environment (2-3 hours)
Pre nego što pozovete bilo koji paid API, prvo lokalno pokrenite okruženje. Instalirajte Ollama — jedna komanda za instalaciju, jedna komanda za povlačenje modela, jedna komanda za pokretanje servisa. Preporučujem da prvo povučete qwen2.5:8b ili deepseek-r1:8b; model sa 8B parametara može da radi na mašini sa 16GB RAM-a, a efekat je dovoljan za učenje.
Zašto prvo lokalno okruženje? Besplatno, bez mrežnih ograničenja, ne zahteva API Key. Kada bude potrebna jača efikasnost, prebacite se na cloud API — pošto Ollama nudi OpenAI-kompatibilan interfejs, kod se gotovo ne menja, samo zamenite URL i Key.
Usput: nakon što instalirate Ollama, predlažem da instalirate i AI Coding alat (npr. besplatni TRAE, ili Claude Code) — kasnije će vam se efikasnost pri pisanju koda udvostručiti. Detaljno poređenje alata i preporuke za Coding Plan pakete nalaze se u Chapter 06; ovde je dovoljno da znate da to postoji.
[Insert Ollama local run screenshot here: Screenshot target: show Ollama pulling a model and running it with one command; Keywords: Ollama, local deployment, model running; Suggested position: terminal command line]
Step 3: Get the Chat API working with code (3-5 hours)
Izaberite okvir i kodom implementirajte kompletan tok "pošalji poruku → primi odgovor". Za Java developere preporučujem Spring AI (prednost Spring ekosistema) ili LangChain4j (bogatija funkcionalnost). Ne dvoumite predugo oko izbora okvira — uzmite jedan i koristite ga, kasnije ga lako zamenite.
Na primeru Spring AI-ja, zaista je toliko jednostavno. Prvo u pom.xml dodajte jednu zavisnost:
<dependency>
<groupId>org.springframework.ai</groupId>
<artifactId>spring-ai-openai-spring-boot-starter</artifactId>
</dependency>Zatim u application.yml podesite adresu lokalnog Ollama modela (bez trošenja ijednog centa):
spring:
ai:
openai:
base-url: http://localhost:11434
api-key: ollama
chat:
options:
model: qwen2.5:8bNapišite Controller sa tri linije core koda:
@GetMapping("/chat")
public String chat(@RequestParam String message) {
return chatModel.call(message);
}Pokrenite ga, u pregledaču posetite localhost:8080/chat?message=hello, i model će odgovoriti. To je to — nema nikakve razlike u odnosu na poziv običnog REST interfejsa.
[Insert Spring AI first chat Demo running screenshot here: Screenshot target: show the effect of the model returning an answer after the browser accesses the interface; Keywords: Spring AI, first Demo, API call; Suggested position: browser + terminal]
Step 4: Implement streaming output (2-3 hours)
Large model može potrošiti 5-15 sekundi da generiše potpun odgovor. Ako sačekate da se sve generiše pre nego što vratite rezultat, korisnik će pomisliti da se sistem zaglavio. Streaming output čini da se odgovor pojavljuje slovo po slovo, kao na pisaćoj mašini. Tehnički, to je upravo SSE (Server-Sent Events); za AI aplikacije orijentisane na interakciju sa korisnikom, streaming output nije opcija već obaveza.
[Insert streaming output effect screenshot here: Screenshot target: show the typewriter effect of streaming output, with the answer appearing character by character; Keywords: streaming output, SSE, typewriter effect; Suggested position: web chat interface]
Step 5: Introduction to Prompt Engineering (5-8 hours)
Ovo je veština sa najboljim odnosom uloženog i dobijenog. System Prompt postavlja ulogu i granice modela; Few-shot u Promptu daje nekoliko primera koje model imitira; structured output navodi model da odgovara u određenom formatu kao što je JSON. Pišite Prompt kao ugovor o interfejsu — jasno odredite ulazni format, izlazni format, granične uslove i obradu izuzetaka. Iskustvo pisanja API dokumentacije ovde se direktno ponovo koristi.
Preporučeni resursi: OpenAI zvanični Prompt Engineering Guide (pretražite "OpenAI prompt engineering", prvi rezultat je taj) — napisan je koncizno i praktično, za 2 sata se može pročitati. Andrew Ng-ov besplatni kurs ChatGPT Prompt Engineering na DeepLearning.AI takođe vredi pogledati — 1 sat videa uz praktične vežbe.
[Insert Prompt comparison effect screenshot here: Screenshot target: show different quality answers to the same question using a plain Prompt and an optimized Prompt; Keywords: Prompt optimization, System Prompt, Few-shot, effect comparison; Suggested position: chat window comparison]
Fazni milestone: sposobnost da se pokrene kompletan chat Demo — korisnik unese pitanje → back-end pozove model API → streaming odgovor. Da kod može jasno da objasni šta svaka linija radi.
Phase 2: Master the two core patterns of RAG + Agent (6-8 weeks)
Vremensko ulaganje je oko 60-80 sati. Ako je Phase 1 bila sposobnost da se razgovara sa modelom, Phase 2 znači da model zaista može da radi.
RAG deo — omogućiti modelu da odgovara na pitanja o privatnim podacima
Prvo razumite Embedding i vector search (5-8 sati). Napravite Embedding za nekoliko desetina tekstova, zatim pomoću cosine similarity pronađite 5 najsličnijih — intuitivno osetite efekat i ograničenja vector search-a. U fazi učenja, Pgvector je dovoljan kao vector baza podataka.
Preporučeni resursi: Spring AI zvanična dokumentacija (spring.io/projects/spring-ai) ima kompletan RAG tutorial i primer koda — prateći ga moći ćete da ga pokrenete. U GitHub repository-ju LangChain4j-a, direktorijum examples sadrži i mnogo out-of-the-box Demo-a. Ako želite video, na Bilibili-ju tražite "Spring AI RAG practical" i pronaći ćete poprilično dobrih tutorijala.
Zatim prođite kroz kompletan RAG tok (15-20 sati). Ovo je jezgro jezgra Phase 2: document loading → text chunking → Embedding vektorizacija → čuvanje u vector database → korisničko pitanje → vector search → izdvajanje relevantnih fragmenata → sklapanje Prompt-a → slanje LLM-u → generisanje odgovora.
Predloženi vežbovni projekat: uzmite tehničku dokumentaciju svog tima ili PDF poznate tehničke knjige i napravite knowledge base Q&A sistem. Testiranje sa sadržajem koji dobro poznajete omogućava vam da brzo procenite da li je efekat dobar i lakše locirate u kom koraku nastaje problem.
[Insert RAG knowledge base Q&A system Demo screenshot here: Screenshot target: show a runnable knowledge base Q&A system interface; Keywords: knowledge base Q&A, RAG, document retrieval; Suggested position: web application interface]
Agent deo — omogućiti modelu da poziva alate i radi
Prvo savladajte Function Calling / Tool Use (8-10 sati). Core mehanizam je da se modelu saopšti opis dostupnih alata, a model na osnovu korisnikove namere odlučuje koji da pozove i koje parametre da prosledi. Sam model ne izvršava alat — on samo ispisuje strukturisanu instrukciju poziva, a naš kod vrši stvarno izvršenje. Suštinski, interfejse koje ste napisali registrujete modelu u obliku opisa alata, dok model služi kao pametni orchestrator poziva interfejsa.
Zatim naučite osnove Agent-a (8-10 sati). Razumite Agent loop: percepcija → planiranje → izvršenje → posmatranje → odlučivanje. Okvirom implementirajte Agent koji može dovršiti višekoračni zadatak, npr. pretraži cenu neke akcije za poslednju nedelju, izračunaj pad/rast i generiši analitički izveštaj.
[Insert Agent multi-step execution log screenshot here: Screenshot target: show the execution process of an Agent autonomously planning and step-by-step calling tools to complete a task; Keywords: Agent loop, multi-step execution, tool call log; Suggested position: terminal or log output]
Zatim dodajte Memory razgovora (5-8 sati). Kratkoročno pamćenje održava kontekst trenutnog razgovora, slično Session-u; dugoročno pamćenje pamti korisničke preferencije kroz sesije, slično user profilu.
[Insert Memory mechanism diagram here: Screenshot target: compare working methods of short-term memory (Session) and long-term memory (database persistence); Keywords: short-term memory, long-term memory, context window; Suggested position: architecture diagram]
Fazni milestone: u RAG dimenziji sposobnost da samostalno razvijete knowledge base Q&A sistem; u Agent dimenziji sposobnost da implementirate multi-step Agent. Sa ova dva projekta na intervjuu ili prezentaciji timu, dovoljno je da dokažete sposobnost za AI application development.
Phase 3: Advanced patterns + production-grade engineering (ongoing)
Phase 2 nas čini sposobnim da napravimo; Phase 3 nas čini sposobnim da napravimo dobro i da odemo u production.
RAG effect optimization obuhvata tuning strategije chunking-a (biranje najprikladnijeg načina sečenja prema tipu dokumenta), hybrid search (vector search + keyword search nadoknađuju slabosti, optimizacioni metod sa najboljim odnosom cena/kvalitet), Reranker re-ranking (precizno izdvajanje Top 5 iz Top 20) i query rewriting (LLM-om preoblikovanje kolokvijalnog pitanja u oblik pogodniji za pretragu).
Agent advanced obuhvata Workflow dizajn (deterministička orkestracija toka rada), Multi-Agent kolaboraciju (više specijalizovanih Agent-a dele posao oko složenih zadataka) i MCP protokol (standardizovani protokol koji je predložio Anthropic, USB-C priključak AI sveta — pružalac alata implementira MCP Server samo jednom, a svi klijenti koji podržavaju MCP mogu odmah da ga koriste).
Engineering all-in-one jeste gde back-end programeri imaju diferencijalnu konkurentnost. Safety guardrails, AI Gateway, observability, effect evaluation, semantic cache, cost management — ovo se gotovo jedno-na-jedno poklapa sa onim u tradicionalnoj back-end arhitekturi; promenite kontekst i možete ga odmah ponovo iskoristiti.
[Insert AI application engineering architecture diagram here: Screenshot target: show the complete engineering architecture of a production-grade AI application; Keywords: AI Gateway, safety guardrails, observability, semantic cache; Suggested position: architecture diagram]
05. Quick technology selection overview
Bez duljenja u analizu, direktno dajem zaključke.
Java programeri biraju između Spring AI i LangChain4j (Spring AI se sa Spring Boot-om integriše najprirodnije; LangChain4j pokriva funkcionalnosti potpunije i brže iterira), uz Ollama-u za lokalni razvoj, a za vector bazu podataka Pgvector ili Milvus.
Što se tiče izbora modela: u fazi učenja koristite Ollama-u sa 7B/8B distill verzijama Qwen2.5 ili DeepSeek-R1 (radi sa 16GB RAM-a, besplatno, lokalno, bez mreže). U production-u birajte prema scenariju — za efekat koristite GPT/Claude API; za odnos cene i kvaliteta DeepSeek, MiniMax, Qwen, GLM API; za scenarije osetljive na podatke, privatni deployment open-source modela.
Za vector bazu podataka, krenite sa Pgvector (PostgreSQL ekstenzija, najjednostavniji); kada količina podataka poraste ili postoje zahtevi za performansama, pređite na Milvus.
Da li učiti Python? Dovoljno je da umete da čitate; ne morate namenski da ga učite. Python primer koda je najzastupljeniji u AI polju, pa razumevanje olakšava traženje materijala i pojmova, ali za pisanje projekta prioritetno koristite svoj glavni jezik.
Low-code platforme poput Dify-ja i Coze-a samo upoznajte — pogodne su za brzu proveru ideja i pravljenje prototipova, ali za prilagođene production aplikacije ipak morate da pišete kod.
[Insert technology selection comparison table here: Screenshot target: compare AI development framework selection across different languages; Keywords: Spring AI, LangChain4j, Ollama, technology selection; Suggested position: comparison table]
06. Tools — AI Coding tools + Coding Plan packages
Učiti AI application development — samo umeti pisati kod nije dovoljno; morate umeti i da koristite AI za pisanje koda.
Ovo nije preplitanje jezika. Godina je 2026; ako još uvek potpuno ručno kucate kod, efikasnost vam je barem tri puta manja. AI Coding alati su od "novost" prešli u "infrastruktura" — baš kao onda kada smo sa pisanja koda u Notepad-u prešli na IDEA, nema povratka.
Four major AI Coding tools
Claude Code je alat koji trenutno najviše koristim. Nije IDE plugin, već command-line Agent — direktno u terminalu razgovarate sa njim, on može čitati kod, menjati kod, pokretati testove, commit-ovati na Git; pokriva ceo razvojni proces. Najjači su Skills i Hooks mehanizmi, koji omogućavaju da se često korišćeni workflow zadrži i ponovo iskoristi. Pisanje članaka, konkurentsko istraživanje, pa čak i upravljanje projektnom dokumentacijom — sve radim pomoću Claude Code-a. Mana je što zahteva pretplatu na Claude Pro (20 USD/mesec) ili Max (100/200 USD/mesec), a Token-i se prilično brzo troše.
[Insert Claude Code terminal operation screenshot here: Screenshot target: show the interactive process of Claude Code reading and writing code in the terminal; Keywords: Claude Code, terminal, Agent coding; Suggested position: terminal session window]
Codex (OpenAI) je Agent coding alat koji je lansirao OpenAI, slične pozicije kao Claude Code, takođe u command-line režimu. Podržava celu seriju OpenAI modela — o3 i o4-mini se mogu koristiti. Njegova prednost je što je OpenAI ekosistem potpuniji, a Function Calling i Structured Output podržani su ranije i stabilnije. Ako je glavni model tima serija GPT, Codex će biti prirodniji.
[Insert Codex terminal operation screenshot here: Screenshot target: show the interactive interface of Codex executing code tasks in the terminal; Keywords: Codex, OpenAI, terminal coding; Suggested position: terminal session window]
TRAE (ByteDance) je AI IDE koji je napravio ByteDance, baziran na modifikovanom VS Code-u, sa ugrađenim AI chat-om i code completion-om. Najveća prednost je direktan pristup iz Kine, bez potrebe za VPN-om, što kineskim developerima daje vrlo gladak doživljaj. Podržava povezivanje sa Doubao large modelom, a može se konfigurisati i sa drugim modelima. Besplatna kvota je prilično darežljiva, pogodna za prijatelje sa ograničenim budžetom.
[Insert TRAE editor interface screenshot here: Screenshot target: show TRAE's AI chat panel and code completion features; Keywords: TRAE, ByteDance, AI IDE, code completion; Suggested position: IDE editor interface]
Qoder je open-source AI Coding Agent koji podržava više model backend-a. Njegova odlika je da se može lokalno postaviti, pa podaci ne napuštaju server — dobra opcija za timove osetljive na sigurnost podataka. Zajednica je prilično aktivna, a iteracija funkcija je takođe brza.
[Insert Qoder usage screenshot here: Screenshot target: show the code generation or editing interaction process of Qoder; Keywords: Qoder, open-source, local deployment, AI coding; Suggested position: terminal or editor]
Kako izabrati? Ne dvoumite. Claude Code i Codex su prvi tim; koji ćete izabrati zavisi od ekosistema modela koji koristite. TRAE je pogodan za kinesko mrežno okruženje i scenarije sa ograničenim budžetom. Qoder odgovara timovima sa zahtevima za sigurnost podataka. Uzmite jedan i počnite da ga koristite; kada ga dobro savladate, nije kasno da zamenite.
Coding Plan packages — the right way to burn Tokens
AI Coding alati imaju jedno pitanje koje se ne može zaobići: trošenje Token-a.
Pisanje koda u Claude Code-u po nekoliko sati dnevno lako potroši stotine hiljada Token-a. Po API cenama, mesečni trošak nije mali. I Codex je sličan; cena reasoning Token-a za o3 model posebno boli.
Zato su veliki proizvođači modela lansirali Coding Plan pakete — mesečne/godišnje scheme dizajnirane posebno za AI coding scenarije.
Claude Pro/Max: Anthropic zvanična pretplata; Pro košta 20 USD mesečno, Max dolazi u dva nivoa, 100 USD i 200 USD. Pro ima ograničenu kvotu, za intenzivnu upotrebu preporučujem da odmah pređete na Max. Claude Code ga podržava nativno, out-of-the-box.
Zhipu GLM Coding Plan: jedna od najisplativijih opcija u Kini. Lite verzija košta 49 RMB mesečno, za fazu učenja sasvim dovoljna. GLM-5 serija modela dobro radi u kineskom jezičkom scenariju, a u kombinaciji sa Claude Code-om efekat je iznenađujuće dobar (da, Claude Code se može povezati sa GLM modelom).
DeepSeek API: cena je izuzetno niska; input cena DeepSeek-V3 je samo nekoliko desetina puta jeftinija od GPT-4o. Mana je što u peak periodu povremeno mora da čeka u redu. U fazi učenja i za ne-core scenarije, sasvim je u redu da bude glavni.
Qwen API: large model servis Alibaba Cloud-a; Qwen serija modela ima dosta veliku besplatnu kvotu, a nakon prekoračenja naplata po potrošnji je takođe jeftina. Dobra integracija sa Alibaba Cloud ekosistemom — enterprise korisnici mogu razmisliti.
Moj savet je: u fazi učenja koristite Ollama za lokalno pokretanje besplatnih modela + DeepSeek API kao dopunu — sasvim dovoljno. Tek kada uđete u fazu razvoja projekta, po potrebi pređite na Claude Max ili GLM Coding Plan. Ne kupujte odmah najskuplji paket; prvo dobro savladajte lokalno okruženje.
[Insert Coding Plan price comparison table here: Screenshot target: compare prices and quotas of various Coding Plan packages; Keywords: Claude Max, GLM Plan, DeepSeek, price comparison; Suggested position: comparison table]
07. Hands-on projects — string the entire learning roadmap together with three projects
Nakon toliko pojmova i alata, na kraju se sve svodi na projekte.
Uvek smatram da je najveća greška u učenju AI-a gledati bez vežbanja. Posle čitanja principa RAG-a pomislite "aha, razumem", ali tek kada stvarno krenete shvatate — document parsing izbaci gomilu smeća, strategija chunking-a se podešava tri dana a efekat i dalje loš, vector search vraća rezultate koji s pitanjem nemaju nikakve veze.
Ove zamke nećete nikada zakoračiti ako ne prionete na rad. A tek kada ih zakoračite, zaista razumete.
Ispod preporučujem u dve kategorije: prvo zero-barrier open-source projekti koje clone-ujete i odmah pokrenete, pogodni za početničku vežbu; zatim tri napredna projekta koje sam radio sa članovima moje zajednice, pogodna za one koji žele da idu duboko i temeljno, i da ih ponesu na intervju.
Zero-barrier open-source project recommendations
Ako samo želite brzo da primite osećaj šta su RAG i Agent, ovi open-source projekti se mogu clone-ovati i odmah pokrenuti:
RAG za početnike: GitHub repository LangChain4j-a (pretražite "langchain4j") sadrži direktorijum examples sa svim primerima koda, od najjednostavnijeg Chat-a do kompletnog RAG toka — Java programerima je ovo najbrži put. I Spring AI zvanično ima spring-ai-examples repository, koji pokriva scenarije poput razgovora, RAG-a, Function Calling-a itd.
Agent za početnike: Na GitHub-u pretražite "spring-ai-agent-example" ili "langchain4j-agent" i pronaći ćete poprilično community doprinosih entry-level Agent Demo-a. Izaberite jedan sa visokim brojem zvezdica, clone-ujte ga i probajte, da biste razumeli kako Agent loop radi.
Prednost ovih projekata je nula troškova, nula barijera i rezultat u nekoliko minuta. Mana je što su funkcionalnosti prilično jednostavne, pa na intervjuu nisu dovoljno ubedljive.
Ako želite kompletnije projekte bliže production nivou, pogledajte sledeća tri.
[Insert LangChain4j Examples directory screenshot here: Screenshot target: show the examples directory structure of the LangChain4j open-source repository; Keywords: LangChain4j, open-source examples, GitHub; Suggested position: GitHub repository page]
PaiSmart (PaiCongming) — RAG knowledge base system
Ovo je prvi AI praktični projekat koji sam radio sa članovima moje zajednice, pozicioniran kao enterprise-level RAG knowledge base Q&A sistem.
Tech stack je Spring Boot 3.4 + Spring Data JPA + Elasticsearch 8.10 (za vector search) + Redis + Kafka + MinIO. Large model je povezan sa DeepSeek API-jem i lokalnim Ollama modelom; Embedding koristi Doubao.
Kompletan RAG pipeline — od upload-a dokumenata, parsiranja (Apache Tika podržava PDF/Word/Markdown itd.), chunking-a, Embedding vektorizacije, čuvanja u Elasticsearch, pa do semantic search-a pri korisničkom pitanju, re-ranking-a, Prompt sklapanja i LLM generisanja odgovora — protiče kroz ceo lanac.
Najveća vrednost ovog projekta je u tome što on nije Demo, već sistem koji zaista radi. Ima kompletnu autentifikaciju korisnika (Spring Security + JWT), upravljanje knowledge base-om, organizaciju dokumenata i real-time WebSocket komunikaciju. Kada ga ponesete na intervju, intervjuer ne vidi samo "ume da pozove RAG API", već kompletnu inženjersku sposobnost.
Već je poprilično članova moje zajednice ovim projektom dobilo offer od kompanija poput Xiaohongshu, NetEase, Zhipu, Baidu i drugih. Otvoreno rečeno, kada intervjuer pita o RAG-u, odgovor koji spaja sopstvene zamke koje ste zakoračali hiljadu puta je ubedljiviji nego učenje napamet.
[Insert PaiSmart project architecture diagram here: Screenshot target: show the overall architecture of the PaiSmart RAG system; Keywords: PaiSmart, RAG, Spring Boot, Elasticsearch; Suggested position: architecture diagram or project homepage]
PaiFlow — Agent workflow orchestration platform
PaiSmart rešava problem "omogućiti modelu da pretražuje materijale", a PaiFlow rešava problem "omogućiti modelu da radi".
PaiFlow je pozicioniran kao enterprise-level AI Agent workflow orchestration platform, sličan Dify/Coze/n8n, ali implementiran od nule u Java tech stack-u. Core tech stack je Java 21 + Spring Boot 3.4 + Spring AI + LangGraph4j.
Prva faza implementira podcast workflow — unos teksta → LLM obrada → TTS sinteza glasa → audio izlaz, uz podršku za paralelno izvršenje i SSE real-time streaming povratnu informaciju. Deluje jednostavno, ali ovaj lanac povezuje sve core pojmove Agent workflow-a: definiciju čvorova, DAG execution engine (topološko sortiranje + detekcija ciklusa), state machine orkestraciju i conditional grane.
Druga faza je još tvrđa: OCR čvor, code branch, RAG integracija, Agent autonomous odlučivanje, MCP tool protokol. Ako je PaiSmart najbolji projekat za učenje RAG-a, PaiFlow je najbolji projekat za učenje Agent workflow-a.
Ovaj projekat prati tutorijal od 190.000 reči i preko 200 pitanja za intervju, pokrivajući Agent/Skills, Spring AI, LangGraph4j i distribuirane sisteme. Za pripremu jesenjih intervjua, u suštini, možete odgovoriti na pitanja iz oblasti AI application development.
[Insert PaiFlow workflow editor screenshot here: Screenshot target: show PaiFlow's visual workflow editing interface; Keywords: PaiFlow, workflow, visual orchestration, node; Suggested position: web application interface]
PaiAgent — open-source AI Agent platform
PaiAgent je open-source projekat koji sam napravio, a koji objedinjuje core sposobnosti PaiSmart-a i PaiFlow-a.
Podržava vizualno prevlačenje za građenje AI workflow-a; frontend implementira flow editor pomoću React + ReactFlow, a backend sa Spring Boot + Spring AI objedinjuje povezivanje sa više large modela (OpenAI, DeepSeek, Qwen, GLM — sve podržano). Ugrađen je dvostruki execution engine — sopstveni DAG engine i LangGraph4j state graph engine — koji se automatski rutira na osnovu složenosti workflow-a.
Tu je i Skills sistem koji deklarativno definiše veštine pomoću YAML + Markdown, uz podršku za trostepeno progresivno učitavanje (summary → detail → reference). Ovaj dizajn se referencira na Skills mehanizam Claude Code-a.
Open-source adresa nalazi se na GitHub-u; zainteresovani prijatelji mogu direktno da je clone-uju i pokrenu. Dok učite, možete istovremeno čitati source code i upoređivati sa learning roadmap-om — svaki modul odgovara kom sloju learning roadmap-a, jasno je na prvi pogled.
[Insert PaiAgent GitHub repository screenshot here: Screenshot target: show the GitHub homepage and star count of the PaiAgent open-source project; Keywords: PaiAgent, GitHub, open-source, Star; Suggested position: GitHub repository page]
How the three projects connect
PaiSmart (RAG) → PaiFlow (Agent workflow) → PaiAgent (Integrated platform)
Phase 2 Phase 3 Integrated practicePrvo napravite PaiSmart i temeljno savladajte kompletan RAG lanac. Zatim PaiFlow, da razumete Agent workflow orkestraciju. Na kraju pregledajte source code PaiAgent-a, kako biste naučili kako da RAG i Agent objedinite u kompletan platform-level proizvod.
Nakon ova tri projekta, bilo na intervjuu bilo u poslu sletanja AI aplikacija, samopouzdanje će vam biti puno.
[Insert three-projects relationship diagram here: Screenshot target: show the progressive relationship PaiSmart → PaiFlow → PaiAgent; Keywords: hands-on projects, learning path, progressive relationship; Suggested position: flowchart]
08. Deferred learning area — knowing what not to study is equally important
Znati šta sada ne učiti isto je toliko važno kao i znati šta sada učiti. Sledeće spada u znanje model layer-a i algorithm layer-a; učiti ga sada ima veoma nizak odnos cene i kvaliteta, a lako je zapasti i ne moći izaći.
Fine-tuning / LoRA / QLoRA je sekundarno treniranje postojećih modela — dirajte ih tek kada RAG + Prompt Engineering ne mogu da reše. Knowledge distillation prenosi sposobnosti velikog modela na mali model — ostavite to za kad bude potrebno edge deployment. RLHF / DPO koristi povratnu informaciju ljudskih preferenci za poravnanje ponašanja modela; većina application developera neće naići na taj korak.
Transformer arhitektura i attention mechanism su osnovni principi large modela — možete ih pogledati iz radoznalosti, ali nisu obavezni za application development. Pre-training je treniranje large modela od nule — to je posao kompanija za modele. Distribuirano treniranje i DeepSpeed potrebni su samo ako se bavite treniranjem modela.
To ne znači da ove stvari nemaju vrednost — naprotiv, one su core tehnologije AI polja. Ali učenje ima prioritete; vreme treba potrošiti tamo gde je najbliže poslovnom rezultatu. Prvo temeljno savladajte application layer i sposobnost da isporučite projekat, a zatim po potrebi kopajte ka nižim slojevima. Kao i kod učenja back-end-a — prvo naučite da koristite Spring Boot za pisanje interfejsa i izlazak online, pa onda čitajte Spring source code i bavite se JVM tuning-om.
09. Common pitfalls — don't step in them
"Morate savršeno ovladati matematikom da biste se bavili AI-jem" — za AI application nije potrebno. Linearna algebra i teorija verovatnoće potrebni su onima koji treniraju modele. Pozivanje API-ja, pravljenje RAG-a, Agent — sa matematikom gotovo da nemaju veze.
"Morate prvo učiti Python" — nije potrebno. Java okviri poput Spring AI i LangChain4j već su prilično zreli; najbrže je krenuti sa jezikom koji najbolje poznajete.
"Trebate krenuti od rada o Transformer-u" — nikako. To je kao kad želite da naučite da kuvate, pa prvo proučavate kako se pravi šerpa.
"RAG može rešiti sve probleme" — ne može. RAG je dobar u odgovaranju na pitanja na osnovu postojećih dokumenata. Ako je potrebno da model nauči potpuno novi način rezonovanja ili stil izlaza, RAG ne pomaže — to je scenario za fine-tuning.
"Agent je samo automatizacioni skript" — daleko od toga. Automatizacioni skript je if-else ukrućen, a core razlika Agent-a je u tome što je proces odlučivanja dinamičan. Ali nemojte ga ni posvetiti — Agent zavisi od unapred definisanog skupa alata, pa ako je loše dizajniran, i dalje se prevrće.
"Što je model veći, to je efekat bolji" — ne nužno. U mnogim scenarijima, mali model + dobar Prompt + RAG daje mnogo bolji efekat nego veliki model koji radi sam. Pri izboru modela gledajte konkretni scenario, ne jurite slepo velike.
"Prompt Engineering je jednostavan i nema tehničke sadržine" — naprotiv, to je jedna od core veština AI application inženjera. Dobar Prompt može značajno poboljšati kvalitet izlaza istog modela, pa čak i odrediti može li funkcija ući u production.
[Insert study time planning table here: Screenshot target: show the comparison of study time and deliverables across the three phases; Keywords: study phase, time investment, deliverables; Suggested position: table]
10. Action recommendations for two types of readers
Za apsolvente: fokusirajte se na Phase 1 i Phase 2, napravite kompletan RAG projekat za biografiju. Da biste projekat odradili temeljito, možete proaktivno posegnuti za optimacionim metodama iz Phase 3 — npr. hybrid search, Reranker — što će projekat jasno razlikovati od konkurenata koji samo "pokrenu i gotovo". Na intervjuu najubedljiviji odgovor nije napamet naučeni pojam, već spoj pojma i prakse: "Napravio sam knowledge base Q&A sistem; u početku je pretraga imala tačnost od samo 60%, a zatim sam, podešavanjem strategije chunking-a i dodavanjem Reranker-a, povećao na 85%." AI projekat u biografiji treba da pokaže inženjersku sposobnost, ne samo pozivanje API-ja.
Za zaposlene back-end programere: Phase 1 brzo pređite — sa inženjerskim osnovama i iskustvom u API razvoju, trebalo bi da u roku od nedelju dana pokrenete sve Demo-e. Fokusirajte se na Phase 2 i Phase 3, posebno na engineering deo — AI Gateway, observability, effect evaluation, safety guardrails. To je najveća diferencijalna prednost u poređenju sa drugima koji prelaze. Što pre pronađite tačku sletanja AI-a u stvarnom poslu; nakon Phase 2, možete predložiti u timu mali projekat knowledge base Q&A ili intelektualizacije internog alata.
Tri stvari koje možete uraditi od danas: instalirajte Ollama, lokalno pokrenite DeepSeek ili Qwen i razgovarajte sa njim preko API-ja — završite za pola sata. Rešite AI-jem jedan stvarni problem na poslu, makar tako što ćete RAG-om omogućiti modelu da odgovara na FAQ projekta. Potrošite dva sata na izučavanje Prompt Engineering-a i odmah ga primenite u svakodnevnom radu.
ending
Iskreno, dok sam pisao ovaj članak, neprestano sam razmišljao o jednom pitanju.
Pre dve godine još smo raspravljali da li će AI zameniti programere; sada, kada osvrnemo, sama rasprava je lažna teza. AI nije zamenio nikoga, ali jeste promenio način na koji pišemo kod.
Kao što smo pre deset godina počeli da učimo kontejnerizaciju i mikroserise, sada je upravo vreme za učenje AI application development. Pravac je siguran, a putanja jasna.
Video sam previše ljudi obuzetih anksioznošću — upisali su gomilu kurseva, preuzeli gomilu materijala, sačuvali gomilu tutorijala, a na kraju nisu napisali ni jednu liniju koda. Video sam i ljude koji su samo instalirali Ollama, lokalno pokrenuli mali model, i za vikend napravili knowledge base Q&A Demo, pa ga odneli šefu da pogleda. Šef kaže: "Nije loše, sledećeg meseca interni probni period u timu."
[Razlika nije u tome koliko znate, već u tome da li ste prionuli na rad.]
AI inženjer nije potpuno novo zanimanje; to je prirodna evolucija zanimanja programera. Naša inženjerska sposobnost, razmišljanje o dizajnu sistema, iskustvo u debug-ovanju — ono što smo godinama akumulirali, nimalo neće biti izgubljeno.
Samo što su se alatkama sada dodale nove stvari — large model, RAG, Agent.
Naučiti ih koristiti je kao onda kada smo naučili da koristimo Redis ili Docker. Nije tako teško, nije ni tako misteriozno.
Prvo instalirajte Ollama, pa onda pokrenite.
Vidimo se u sledećem.
