Zbirka od 258 pitanja za intervju za AI Agent
Poslao sam prijavu u desetak velikih firmi, jedva dobio jedan intervju, a onda intervjuer odmah prvo pita: "Da li si radio neki Agent projekat?"
Otvorio sam usta, ali nisam uspeo da izgovorim ni reč.
Proveo sam tri nedelje prolazeći kroz sva Agent/RAG/Prompt/LLM/MCP pitanja za intervju koja se često pojavljuju na Nowcoder-u i u Planeta znanya, i po učestalosti pojave × težini sam izdvojio 258 pitanja (kasnije ću nastaviti da dodajem na osnovu povratnih informacija).
Ova pitanja ćemo povezati sa tri praktična projekta.
- PaiAgent (platforma za orkestraciju tokova rada zasnovana na LangGraph4j + Spring AI)
- PaiCongming (RAG baza znanja zasnovana na ES hibridnoj pretrazi)
- PaiCLI (Java Agent alatka za komandnu liniju, uporediva sa Claude Code).
Pored toga, tu su i NLP, Transformer, LangChain, fino podešavanje i treniranje, kao i novi trendovi u AI Coding. Kasnije ću razložiti svako pitanje i dati doteran odgovor; u ovom tekstu najpre donosim svih 258 pitanja, kako bi mogli da ih sačuvate i pratite mapu.
Težina pitanja je podeljena u tri nivoa: 🟢 osnove, 🟡 napredno, 🔴 duboko.
Odgovori će, koliko god je moguće, biti mapirani na stvarne scenarije odgovora u projektima PaiCongming, PaiAgent i PaiCLI, kako bi se izbegla čisto klasična pitanja za intervju.😄
01. Agent jezgro
Agent je apsolutni centar pažnje u ovom krugu AI intervjua.
1. Šta je Agent? Kakva je suštinska razlika u odnosu na direktno pozivanje API-ja velikog modela?
Veliki model samo "primi ulaz → generiši izlaz", dok Agent na to dodaje sposobnost opažanja okruženja, autonomnog odlučivanja, pozivanja alata i iterativne povratne sprege. Jedno je pasivni mašina za pitanja i odgovore, drugo je inteligentni entitet koji sam može da obavlja posao.
Odgovor na pitanje: what-is-agent.md
Tehnička strana: https://paicoding.com/what-is-agent
🟢 Osnove | → PaiCLI | ByteDance, Tencent, Alibaba
2. Koja je najveća razlika između Agent-a i chatbot-a? Ako bi se ChatBot razvio u Agent-a koji samostalno kompletira zadatke, koje ključne sposobnosti treba da dopuni?
Može se odgovoriti prema jednom zatvorenom ciklusu zadatka: prvo razumeti cilj korisnika i napraviti plan (Planning), zatim održavati kontekst i dugoročno pamćenje (Memory), po potrebi birati spoljne alate (Tool Use), izvršavati akcije i na osnovu zapažanja nastaviti iteraciju (Action/Observation).
U PaiCLI-ju, Plan-and-Execute je zadužen za razlaganje zadatka, Memory upravlja kontekstom i dugoročnim informacijama, MCP priključuje spoljne alate, a ReAct petlja vraća rezultate alata natrag kako bi se nastavilo odlučivanje.
🟢 Osnove | → PaiCLI | ByteDance, Alibaba Cloud
Odgovor na pitanje: agent-chatbot-difference.md
Tehnička strana: https://paicoding.com/agent-chatbot-difference
3. Koja je razlika između Workflow i Agent?
Agent je inteligentni entitet koji sam odlučuje i poziva Tools; Workflow je orkestracija više Agent-a ili koraka po unapred zadatom toku. PaiAgent je proizvod na nivou Workflow-a, PaiCLI je proizvod na nivou Agent-a, a oba pozivaju razne Tools.
Odgovor na pitanje: workflow-vs-agent.md
Tehnička strana: https://paicoding.com/workflow-vs-agent
🟢 Osnove | → PaiCLI (Agent)
4. Šta je zapravo ReAct? Koja je razlika u odnosu na CoT?
Najčešće pitanje na intervjuima, bez izuzetka. Minimum je znati objasniti mehanizam petlje Thought→Action→Observation; ono što donosi dodatne poene je znati opisati kako se u sopstvenom projektu kontroliše maksimalan broj iteracija i kako se tretiraju izuzeci u povratnoj vrednosti alata.
Odgovor na pitanje: what-is-react.md
Tehnička strana: https://paicoding.com/what-is-react
🟡 Napredno | → PaiCLI | Taobao/Tmall, Tencent, ByteDance, Baidu
5. Da li ReAct može da upadne u beskonačnu petlju?
Odgovor na pitanje: react-death-loop.md
Tehnička strana: https://paicoding.com/react-death-loop
5. Šta je Plan-and-Execute?
ReAct i Plan-and-Execute su dve paradigme za napredovanje kroz zadatak: ReAct ide po petlji Thought→Action→Observation i pogodan je za zadatke gde su informacije nesigurne i gde treba paralelno proveravati i ocenjivati; Plan-and-Execute pravi globalni plan, zatim postepeno izvršava i po potrebi ponovo planira, što odgovara složenim zadacima sa jasnim ciljem i više koraka.
Odgovor na pitanje: plan-and-execute.md
Tehnička strana: https://paicoding.com/plan-and-execute
🟡 Napredno | → PaiCLI | Taobao/Tmall, Tencent
6. Koje ključne komponente ima jedan Agent?
- Opažanje: kombinacija strukturirane ekstrakcije, OCR, HTML parsiranja i parsiranja logova; ključno je smanjiti buku koja ulazi u kontekst.
- Uobičajene implementacije: CoT, ReAct, Plan-and-Execute, pretraga stablom (LATS), graf zadatka.
- Pamćenje: sažimanje, praćenje izvora, rešavanje konflikata u pamćenju, dozvole i privatnost.
- Alati: princip najmanje dozvole, validacija parametara, vraćanje poruka o greškama u model.
- Izvršenje: stvarno pozivanje alata ili okidanje promena u okruženju, uz obradu timeout-a, retry-ja, idempotentnosti i drugih inženjerskih pitanja.
- Refleksija: "Nabroj tri rizika u ovom zaključku i ispravi ih".
Odgovor na pitanje: agent-core-components.md
🟢 Osnove | → PaiCLI | ByteDance, Alibaba
7. Kako se implementira Multi-Agent saradnja?
Odgovor na pitanje: multi-agent-collaboration.md
Tehnička strana: https://paicoding.com/multi-agent-collaboration
🟡 Napredno | → PaiCLI | ByteDance, Alibaba Cloud, Ant Group, Xiaohongshu
8. Objasni kako radi Agent.
- Obrada ulaza: prepoznavanje namere, razrešavanje koreferenci, bezbednosno filtriranje, učitavanje relevantnog pamćenja i dokumenata.
- Razlaganje zadatka: generisanje liste podzadataka ili stabla odlučivanja.
- Pozivanje alata: pozivanje spoljnih API-ja, baza, pretraživača, okruženja za izvršavanje koda itd.
- Obrada rezultata: prikupljanje rezultata alata, uz neophodno formatiranje i validaciju.
Odgovor na pitanje: how-agent-works.md
Tehnička strana: https://paicoding.com/how-agent-works
🟡 Napredno | → PaiCLI | ByteDance, Taobao/Tmall, Alibaba Cloud
9. Kako Agent izbegava eksploziju konteksta?
Kada dijalog ima mnogo rundi, token-i eksplodiraju. Uobičajena rešenja su klizni prozor, sažimanje i ekstrakcija ključnih informacija.
Odgovor na pitanje: agent-context-explosion.md
Tehnička strana: https://paicoding.com/agent-context-explosion
🟡 Napredno | → PaiCLI | Kuaishou, Baidu, ByteDance, Alibaba Cloud, Ant Group
10. Zašto kontekstni prozor LLM-a ne može beskonačno da raste?
Odgovor na pitanje: llm-context-window-limit.md
Tehnička strana: https://paicoding.com/llm-context-window-limit
11. Šta je Prompt Engineering?
Odgovor na pitanje: what-is-prompt-engineering.md
Tehnička strana: https://paicoding.com/what-is-prompt-engineering
12. Šta je Context Engineering?
Dodatno pitanje: zašto polako zamenjuje Prompt Engineering?
Odgovor na pitanje: what-is-context-engineering.md
Tehnička strana: https://paicoding.com/what-is-context-engineering
13. Šta je Harness Engineering?
Odgovor na pitanje: what-is-harness-engineering.md
Tehnička strana: https://paicoding.com/what-is-harness-engineering
14. Šta je Loop Engineering?
Odgovor na pitanje: what-is-loop-engineering.md
Tehnička strana: https://paicoding.com/what-is-loop-engineering
15. Zašto LLM nema pamćenje?
Odgovor na pitanje: why-llm-has-no-memory.md
Tehnička strana: https://paicoding.com/why-llm-has-no-memory
16. Šta je kontekstni prozor Agent-a?
Odgovor na pitanje: what-is-context-window.md
Tehnička strana: https://paicoding.com/what-is-context-window
17. Kako dati Agent-u pamćenje?
Odgovor na pitanje: how-to-give-agent-memory.md
Tehnička strana: https://paicoding.com/how-to-give-agent-memory
18. Kako implementirati kratkoročno pamćenje Agent-a?
Odgovor na pitanje: agent-short-term-memory.md
Tehnička strana: https://paicoding.com/agent-short-term-memory
19. Kako je implementirano kratkoročno pamćenje u Claude Code?
Odgovor na pitanje: claude-code-short-term-memory.md
Tehnička strana: https://paicoding.com/claude-code-short-term-memory
20. Kako je implementirano kratkoročno pamćenje u Codex?
Odgovor na pitanje: codex-short-term-memory.md
Tehnička strana: https://paicoding.com/codex-short-term-memory
21. Zašto Agent tokom razgovora postane gluplji?
Odgovor na pitanje: why-agent-gets-dumber.md
Tehnička strana: https://paicoding.com/why-agent-gets-dumber.md
22. Kako radi dugoročno pamćenje Agent-a?
Odgovor na pitanje: agent-long-term-memory.md
Tehnička strana: https://paicoding.com/agent-long-term-memory.md
23. Kako je implementirano dugoročno pamćenje u Claude Code?
Odgovor na pitanje: claude-code-long-term-memory.md
Tehnička strana: https://paicoding.com/claude-code-long-term-memory.md
24. Kako zapravo napisati CLAUDE.md da bude koristan?
Odgovor na pitanje: how-to-write-claudemd.md
Tehnička strana: https://paicoding.com/how-to-write-claudemd.md
25. Kako Claude Code pretražuje dugoročno pamćenje?
Odgovor na pitanje: claude-code-memory-retrieval.md
Tehnička strana: https://paicoding.com/claude-code-memory-retrieval.md
18. Kako naterati LLM da vraća strukturirani sadržaj? Na primer, mapiranje polja Java objekta jedan-na-jedan?
Ključna informacija: .entity() iz Spring AI.
17. Šta uraditi kada LLM sadržaj bude presečen?
10. Kako implementirati kratkoročno i dugoročno pamćenje Agent-a?
Kratkoročno pamćenje je trenutni kontekst razgovora, dok dugoročno pamćenje zahteva trajno čuvanje činjenica koje prelaze okvire jedne sesije.
🟡 Napredno | → PaiCLI | Taobao/Tmall, Kuaishou
11. Koje metode se obično koriste za sažimanje pamćenja Agent-a?
Tri glavne: sažimanje (10 rundi razgovora se sabije u jedan pasus), ekstrakcija entiteta (čuvaju se samo ključni entiteti i relacije), vektorizacija (pamćenje se pretvara u vektore i priziva po sličnosti).
🟡 Napredno | → PaiCLI | Tencent
12. Koje probleme ima FIFO izbacivanje dugoročnog pamćenja? Kako ga optimizovati?
Najveća zamka FIFO-a je što izbaci važna, ali retko korišćena sećanja.
🔴 Duboko | → PaiCLI | Tencent
13. Kada se alat poziva više puta, kako oceniti da li treba nastaviti ili stati?
Dve strategije: prvo, model procenjuje sam (zaustavlja se kada povratni finish_reason ne sadrži tool_calls); drugo, inženjerska zaštita na nivou projekta (maksimalan broj iteracija).
🟡 Napredno | → PaiCLI | Taobao/Tmall
14. Koje implementacije ima Planning modul Agent-a?
Dve glavne: Step-by-step (korak po korak, slično ReAct) i Plan-and-execute (prvo kompletan plan, zatim postepena izvršenja). Naprednija je petlja Plan→Execute→Replan — ako se tokom izvršenja ispostavi da plan nije dobar, radi se ponovno planiranje. Plan-and-Execute režim PaiCLI-ja podržava dinamičko preplaniranje.
🟡 Napredno | → PaiCLI
15. Šta je mehanizam refleksije Agent-a? Zašto je potrebna refleksija?
Refleksija znači da Agent ocenjuje kvalitet sopstvenog izlaza i, ako uoči grešku, sam je ispravlja. Bez refleksije, Agent koji jednom pogreši ide krivim putem do kraja.
🟡 Napredno | → PaiCLI
16. Zašto si odabrao da Agent gradiš "od nule" bez okvira?
Okviri (LangChain, LlamaIndex) previše uveličavaju apstrakciju.
🟡 Napredno | → PaiCLI
17. Kako Agent akumulira iskustvo i uči sam?
Skill.
🔴 Duboko | → PaiCLI
18. Kako se izmiruju sukobi mišljenja u Multi-Agent saradnji?
Uobičajena rešenja: glasanje (većina odlučuje), Agent-sudija (specijalizovan za konačnu odluku), hijerarhijsko delegiranje (nadređeni Agent donosi odluku).
🔴 Duboko | → PaiCLI | ByteDance, Alibaba
02. Kompletan RAG tok (20 pitanja)
RAG je drugi najpopularniji pravac na AI intervjuima.
19. Zašto je RAG potreban? Zašto dokumenta ne proslediti direktno velikom modelu?
Kontekstni prozor je ograničen; previše token-a košta i usporava; model neravnomerno raspoređuje "pažnju" po dugom dokumentu (srednji sadržaj se lako zanemari). Srž vrednosti RAG-a je "prvo pretraži, pa generiši" — modelu se proslede samo najrelevantniji fragmenti.
🟢 Osnove | → arhitektura PaiCongming | ByteDance, Taobao/Tmall
20. Kako birati između RAG-a i finog podešavanja? Koje scenarije pokrivaju?
RAG je pogodan za scene gde se znanje često ažurira i gde je potrebno praćenje izvora (korisnička podrška, Q&A nad dokumentima); fino podešavanje je pogodno kada treba promeniti ponašanje i stil modela u fiksnoj oblasti (medicinski, pravni termini). Može se prvo fino podesiti da model upozna terminologiju oblasti, a onda primeniti RAG za najnovije znanje.
🟢 Osnove | → PaiCongming (RAG linija)
21. Opisi kompletan tok rada RAG sistema.
Indeksiranje dokumenata (parsiranje → deljenje na chunk-e → vektorizacija → upis) → obrada upita (vektorizacija upita → KNN prizivanje → pretraga ključnih reči i filtriranje dozvola → BM25 rescore) → generisanje (spajanje rezultata pretrage + korisničkog pitanja → LLM generiše → navođenje izvora).
🟢 Osnove | → kompletna implementacija PaiCongming | ByteDance, Kuaishou
22. Kako dizajnirati strategiju deljenja dokumenata na chunk-e? Kako odrediti veličinu chunk-a?
🟡 Napredno | → PaiCongming ParseService | Kuaishou, ByteDance, Moka, Alibaba
23. Kako izbeći da semantika bude presečena?
Tri sredstva: preklapajuće deljenje (susedni chunk-i imaju preklapajući deo), deljenje po prirodnim semantičkim granicama (pasus, tačka, naslov), rekurzivno deljenje (prvo po velikoj strukturi, pa ako ne zadovoljava, dalje cepati).
🟡 Napredno | → PaiCongming
24. Kako birati Embedding model? Da li je više dimenzija uvek bolje?
Nije. Više dimenzija znači veći trošak skladištenja i sporiju pretragu.
🟡 Napredno | → PaiCongming Embedding 2048 dimenzija | Kuaishou, Alibaba
25. Koje vrste algoritama postoje za Embedding? Koje su im karakteristike?
Word2Vec (statički vektori reči, ne uzima u obzir kontekst), BERT porodica (dvosmerno kodiranje, pogodno za semantičko uparivanje kratkih tekstova), Sentence Transformers (specijalizovani za nivo rečenice), BGE/GTE serija (optimizovano za kineski, pri vrhu MTEB liste). PaiCongming podrazumevano ide na Alibaba text-embedding-v4, 2048 dimenzija, a ostavljen je i put za prelazak na provajdere poput Zhipu embedding-3 koji su OpenAI-kompatibilni.
🟡 Napredno | → kriterijum izbora PaiCongming
26. Kako birati vektorsku bazu? Koju koristi vaš projekat?
Glavne opcije: Milvus (masovno distribuirano), Qdrant (Rust, visoke performanse), Weaviate (GraphQL friendly), Elasticsearch (ako se već koristi ES klaster, direktno ga iskoristiti), Chroma/FAISS (lagana prototipska provera). PaiCongming je odabrao ES jer je tim već upoznat sa ES ekosistemom i nema potrebe za uvođenjem nove komponente.
🟡 Napredno | → PaiCongming ES 8.10 + dense_vector | ByteDance, Kuaishou
27. Kako se radi hibridna pretraga vektorske i ključne reči?
HybridSearchService u PaiCongming-u prvo radi KNN vektorsko prizivanje sa prozorom topK×30; istovremeno koristi textContent match za ograničenje ključnih reči, dodaje filtriranje dozvola po userId, public, orgTag, i konačno radi drugu fazu rangiranja kroz BM25 rescore. Čista vektorska pretraga lako propušta precizne ključne reči, a čista pretraga po ključnoj reči nema semantičko razumevanje — hibridna pretraga pokriva oba.
🟡 Napredno | → PaiCongming HybridSearchService KNN + BM25 | Kuaishou, ByteDance
28. Šta je Query Rewrite? Zašto prepravljati korisnički upit?
Korisnička pitanja su često usmena, nejasna i višeznačna. Query Rewrite prepravlja originalno pitanje u oblik pogodniji za pretragu — dopunjavanje instrukcija, razlaganje namere, proširenje sinonima. PaiCongming trenutno radi vektorizacija upita + KNN/BM25 hibridna pretraga, a Query Rewrite se može dodati kao tačka za pojačavanje pretrage.
🟡 Napredno | → PaiCongming proširivo | Kuaishou, Alibaba
29. Šta je više-putno prizivanje? Kako se konkretno radi?
Jedan upit ide kroz više kanala pretrage (vektorsko prizivanje, prizivanje po ključnoj reči, prizivanje iz grafa znanja); svaki kanal vraća skup kandidata, koji se na kraju spajaju, deduplikuju i rangiraju. PaiCongming je trenutno preciznije rečeno KNN prizivanje sa ograničenjem ključne reči i BM25 rescore, a ne potpuno nezavisno više-putno prizivanje; kasnije se može proširiti na spajanje kandidata iz vektorske, ključne reči i grafa znanja. Vrednost više-putnog prizivanja je u smanjenju rizika da jedan put propusti relevantne rezultate.
🟡 Napredno | → PaiCongming KNN + BM25 rescore, proširivo na više-putno | Kuaishou, ByteDance
30. Zašto posle pretrage treba i Rerank?
Vektorska pretraga je "grubo ceđenje" — veliki priziv, ali rangiranje nije dovoljno precizno. Rerank koristi ukrstni enkoder da precizno oceni upit i svaki kandidat-dokument, te najrelevantnije stavlja na vrh. PaiCongming trenutno posle KNN prizivanja koristi BM25 rescore kao drugu fazu rangiranja; nezavisni Rerank se može dodati kasnije.
🟡 Napredno | → PaiCongming KNN priziv + BM25 rescore | Kuaishou
31. Kako odrediti Top-K za Rerank?
Nema srebrnog metka. Obično se prvo postavi veliki prozor prizivanja, zatim se na test skupu postepeno sužava dok se ne nađe balans između preciznosti i latencije. Prevelik K povećava trošak rangiranja i slivanja konteksta; premali K može propustiti relevantne dokumente. PaiCongming trenutno povećava topK prozor prizivanja, a onda BM25 rescore precizira rezultat.
🟡 Napredno | → PaiCongming prozor prizivanja i težina rescore-a | Kuaishou
32. Kako ocenjivati RAG sistem? Koje su ključne metrike?
U fazi pretrage gledamo Recall, Precision i MRR (srednji obrnuti rang). U fazi generisanja gledamo Faithfulness (da li odgovor počiva na pronađenom sadržaju) i Relevancy (relevantnost). RAGAS okvir je standardizovao ovaj sistem ocenjivanja.
🟡 Napredno | → PaiCongming RAG metrike ocene | Kuaishou, Moka
33. Kako primeniti vremensko opadanje na stare dokumente u vektorskoj bazi?
Informacije u starim dokumentima su možda zastarele, ali vektorska sličnost ne opada s vremenom. Rešenje: množiti ocenu pretrage faktorom vremenskog opadanja (npr. eksponencijalno), ili dodati vremensko polje u indeks i raditi filter.
🟡 Napredno | → PaiCongming ES proširivo filtriranje metapodataka | Kuaishou
34. U kojim scenarijima se grafovska baza koristi za pojačavanje vektorske pretrage?
Kada između znanja postoje složene relacije (npr. "Firma A je kupila Firmu B; CEO firme B je C"), čista vektorska pretraga teško hvata takve veze. Grafovska baza (Neo4j, NebulaGraph) je specijalizovana za upite nad relacijama između entiteta, pa u kombinaciji sa vektorskom pretragom može odgovoriti na pitanja koja zahtevaju rezonovanje poput "U kojoj firmi C sada radi".
🔴 Duboko | → PaiCongming budući pravac proširenja
35. Koja je ključna razlika između Agentic RAG i tradicionalnog RAG-a?
Tradicionalni RAG je jednokrati tok "pretraga → generisanje". Agentic RAG dodaje Agent sposobnosti: model može oceniti "rezultat pretrage nije dovoljno dobar, promenimo ključnu reč i pretražimo ponovo", ili "ovo pitanje zahteva prvo A, pa B, pa sintezu". ReAct petlja u PaiCongming-u i alat search_knowledge u AgentToolRegistry upravo pretvaraju pretragu baze znanja u alat koji Agent može da pozove.
🟡 Napredno | → PaiCongming ReAct + alat search_knowledge
36. Kako izbeći OOM pri obradi dugih dokumenata?
PaiCongming u ParseService-u ima dva ključna dizajna: prvo, protočno deljenje na chunk-e, čime se izbegava učitavanje celog dokumenta u memoriju odjednom; drugo, zaštita pragom memorije — kada zauzeće pređe 80%, prvo se okine GC, a ako je nakon provere i dalje iznad praga, odbija se dalja obrada. Za velike fajlove ovo je stabilnije od pukog povećavanja JVM heap-a.
🟡 Napredno | → PaiCongming protočna obrada + zaštita pragom memorije
37. Kako implementirati dinamičko ažuriranje RAG baze znanja?
Nakon izmene dokumenta mora se ažurirati i vektorski indeks. PaiCongming preko Kafka-e asinhrono obrađuje red za učitavanje fajlova (podrazumevani topic je file-processing-topic1); novi dokument se nakon učitavanja automatski provlači kroz kompletan tok "parsiranje → chunk-ovanje → vektorizacija → upis", bez ručne obnove indeksa. Brisanje dokumenta sinhrono čisti odgovarajuće vektorske zapise.
🟡 Napredno | → PaiCongming Kafka asinhrono ažuriranje
38. Kako se radi izolacija dozvola u RAG-u u više-zakupca okruženju?
PaiCongming koristi tri sloja filtriranja dozvola: userId (privatni dokumenti korisnika), orgTag (izolacija na nivou organizacije), isPublic (indikator javnosti). Pri pretrazi se u ES upit dodaje uslov filter-a, čime se osigurava da korisnik firme A ne može da nađe dokumente firme B. Ovo pitanje se često pojavljuje na intervjuima za ToB firme.
🟡 Napredno | → PaiCongming userId + orgTag + isPublic trostruki filter
03. LLM osnove i inženjering (25 pitanja)
Ovih 25 pitanja vodi od Transformer arhitekture do deployments modela, pokrivajući osnovne principe i inženjersku praksu velikih modela. Ne morate na svako odgovoriti duboko kao iz naučnog rada, ali Transformer, mehanizam pažnje i KV Cache se skoro uvek pitaju. Tamo gde možete, odgovarajte na osnovu iskustva iz projekata; za čisto teorijska, objasnite ključni mehanizam.
39. Šta je veliki jezički model? Koja je razlika u odnosu na klasične NLP modele?
Klasični NLP modeli (LSTM, CRF) se treniraju za specifičan zadatak i pri promeni zadatka moraju ponovo. Veliki jezički model masovnim pretreningom stiče opštu jezičku sposobnost, pa jedan model može da obrađuje prevod, sažetak, Q&A, generisanje koda i sl., samo vođen Prompt-om.
🟢 Osnove
40. Opiši osnovnu arhitekturu Transformer-a. Šta radi Encoder, a šta Decoder?
Encoder razume ulaz (kodira tekst u semantičke vektore), Decoder generiše izlaz (na osnovu semantičkih vektora, generiše tekst token po token). GPT serija koristi samo Decoder, BERT samo Encoder, a T5 pun Encoder-Decoder. Današnji glavni veliki jezički modeli uglavnom su Decoder-only arhitekture.
🟢 Osnove | ByteDance, Tencent
41. Koja ograničenja ima Multi-Head Attention (MHA)? Kako to rešavaju MQA, GQA, Flash Attention?
MHA: svaka glava ima nezavisne KV matrice, velika zauzeća VRAM-a. MQA (Multi-Query Attention): sve glave dele jedan skup KV, štedi VRAM ali se gubi na kvalitetu. GQA (Grouped-Query Attention): kompromis — nekoliko glava deli jedan skup KV. Flash Attention optimizuje na nivou izračunavanja, smanjuje broj HBM pristupa bez promene samog mehanizma pažnje.
🟡 Napredno | ByteDance, Tencent
42. Čemu služi poziciono kodiranje? Koja je razlika između RoPE i ALiBi?
Sam Transformer ne opaža redosled token-a; poziciono kodiranje govori modelu "koja reč je na kojoj poziciji". RoPE (rotaciono poziciono kodiranje) putem rotacione matrice kodira relativnu poziciju i dobro ekstrapolira. ALiBi direktno na ocenu pažnje dodaje pomak koji zavisi od rastojanja — implementacija je jednostavna i ne zahteva dodatne parametre.
🟡 Napredno
43. Šta je tokenizer? Koja je razlika između BPE, WordPiece i SentencePiece?
Tokenizer razlaže tekst na token-e (najmanja jedinica koju model razume). BPE (Byte Pair Encoding) kreće od karaktera i postepeno spaja učestale parove; koristi ga GPT serija. WordPiece je sličan BPE ali bira parove za spajanje na osnovu verovatnoće; koristi ga BERT. SentencePiece se trenira direktno na sirovom tekstu, bez zavisnosti od prethodnog tokenizovanja i prijateljski je nastrojen prema višejezičnosti.
🟡 Napredno
44. Kako se trenira veliki model? Opiši tri faze: pretrening → SFT → RLHF.
Pretrening (na ogromnom neoznačenom tekstu stiče jezičku sposobnost) → SFT (fino se podešava na ručno označene parove instrukcija-odgovor, uči da "sluša") → RLHF (kalibracija vrednosti na osnovu povratne informacije o ljudskim preferencama, uči da "govori ljudski"). Troškovi tri faze opadaju, ali značaj raste.
🟡 Napredno | ByteDance, Tencent
45. Šta je Scaling Law? Šta su emergentne sposobnosti velikih modela?
Scaling Law kaže da se performanse modela predvidljivo menjaju po stepenom zakonu sa brojem parametara, količinom podataka i računarskom snagom. Emergentne sposobnosti su one koje se iznenada pojave kada model pređe određeni prag (npr. lančano rezonovanje) — mali modeli ih uopšte nemaju, a veliki ih iznenada dobiju.
🟡 Napredno
46. Koje varijante finog podešavanja velikih modela postoje? Koji je princip LoRA-e?
Puno fino podešavanje (izmena svih parametara, skupo), LoRA (zamrzne originalne težine i trenira samo matrice niskog ranga, sa preko 99% manje parametara), QLoRA (kvantizacija + LoRA, još manje VRAM-a), Adapter (umetanje malih modula između slojeva), Prefix Tuning (podešavanje samo prefiks vektora). LoRA je trenutno najisplativije rešenje.
🟡 Napredno | ByteDance, Alibaba
47. Šta posle SFT-a sledi u Post-Training? Kako se odnose RLHF, DPO, GRPO?
SFT uči model formatu i osnovnim sposobnostima; Post-Training uči model "koji je odgovor bolji". RLHF koristi reward model + PPO; DPO odbacuje reward model i trenira direktno na parovima preferenci; GRPO uklanja Critic mrežu i koristi relativno poređenje unutar grupe. Evolucija ide ka sve jednostavnijem toku treniranja.
🔴 Duboko | Zuoyebang, Tencent
48. Koja je razlika između DPO i PPO?
PPO zahteva prethodno treniran reward model, a zatim optimizuje politiku na osnovu njegovih ocena — proces je složen. DPO direktno koristi podatke o preferencama (dobro vs. loše) i implicitno ugrađuje reward model u funkciju gubitka, čime je treniranje jednostavnije i stabilnije.
🔴 Duboko | Tencent, 37 Interactive Entertainment
49. Koje strategije dekodiranja koriste veliki modeli pri generisanju teksta?
Pohlepna pretraga (u svakom koraku bira token sa najvećom verovatnoćom, deterministički ali dosadno), beam search (zadržava top-k putanja), temperatura uzorkovanje (temperature kontroliše slučajnost), Top-P uzorkovanje (nucleus sampling, dinamički odseca niskoverovatne token-e), Top-K uzorkovanje (uzorkuje se samo iz prvih K token-a).
🟡 Napredno
50. Šta su Temperature, Top-P i Top-K? Kako ih podesiti?
Temperature kontroliše "glačanje" distribucije verovatnoća (nisko → konzervativno, visoko → razbacano); Top-P kontroliše prag kumulativne verovatnoće; Top-K kontroliše veličinu skupa kandidata. Za generisanje koda preporučuje se nizak temperature (0.1–0.3), za kreativno pisanje visok (0.7–1.0). Podrazumevana temperatura u PaiAgent ChatClientFactory je 0.7.
🟡 Napredno | → PaiAgent ChatClientFactory konfiguracija temperature
51. Šta je KV Cache? A šta Prompt Caching?
KV Cache čuva već izračunate matrice Key/Value i izbegava ponovno računanje pažnje za sve prethodne token-e pri generisanju svakog novog. Prompt Caching ide korak više — kešira rezultat izračunavanja istog prefiksa Prompt-a, tako da više zahteva dele isti keš. PaiCLI podržava vizualizaciju Prompt Cache-a, tako da korisnik vidi stopu pogodaka keša.
🟡 Napredno | → PaiCLI vizualizacija Prompt Cache
52. Šta je kvantizacija velikih modela? Kako birati INT8/INT4/AWQ/GPTQ?
Parametri modela se kompresuju sa FP16 na INT8/INT4, čime se VRAM prepolovi ili smanji za četvrtinu. GPTQ je post-trening kvantizacija (brz, ali malo veći gubitak preciznosti), AWQ (Activation-aware) uzima u obzir distribuciju aktivacija (bolja preciznost), INT4 najviše štedi VRAM ali ima najveći gubitak. Izbor zavisi od VRAM-a vaše grafičke kartice i zahteva za preciznošću.
🟡 Napredno
53. Koja rešenja postoje za kompresiju dugog konteksta?
Tri glavna: sažimanje razgovora (istoriju sažme u jedan pasus), ekstrakcija ključnih informacija (zadržava bitne činjenice i odluke), klizni prozor (zadržava samo poslednjih N rundi). PaiCLI podržava modele sa prozorom od 1M token-a, uz dinamčku strategiju kompresije koja se automatski okida kada se prozor skoro napuni.
🟡 Napredno | → PaiCLI dinamička kompresija + prozor od 1M token-a | Kuaishou, Taobao/Tmall, Pinduoduo, Tencent
54. Kako smanjiti problem halucinacija velikih modela?
RAG je jedno od najefikasnijih rešenja — model odgovara na osnovu pronađenih stvarnih dokumenata, umesto da "slobodno improvizuje". PaiCongming preko generationId povezuje referenceMappings i čuva detalje citata u ChatGenerationStateService / ConversationService; frontend može klikom na "izvor" prikazati pogodak chunk-a. Druga sredstva: smanjiti temperature, ojačati ograničenja u system prompt-u, dozvoliti modelu da kaže "nisam siguran".
🟡 Napredno | → PaiCongming generationId + referenceMappings praćenje citata | Alibaba Cloud, JD.com, Ant Group
55. Šta je CoT (lanac misli)? Zašto dobro radi? Koja su ograničenja?
CoT tera model da "razmišlja korak po korak" umesto da odmah da odgovor, čime se proces rezonovanja eksplicira. Radi dobro jer razlaže složen problem na više jednostavnih koraka. Ograničenja: povećava potrošnju token-a i latenciju, a model može generisati rezonovanje koje "deluje razumno ali je pogrešno".
🟡 Napredno
56. Šta je MoE (Mixture of Experts)? Zašto DeepSeek i Qwen koriste MoE?
MoE razlaže jedan veliki model na više "ekspertskih" podmreža, od kojih se pri svakom izvođenju aktivira samo nekoliko. Prednost: ukupan broj parametara je velik (bogata baza znanja), ali je količina izračunavanja po zaključivanju mala (koristi se samo deo eksperata). DeepSeek V3 koristi MoE — 671B ukupnih parametara, ali pri svakom zaključivanju aktivira samo 37B.
🟡 Napredno
57. Kako implementirati dinamičko prebacivanje modela, bez restarta servisa?
PaiAgent ChatClientFactory pri svakom pozivu kreira novi ChatClient (bez Spring singleton-a). Svaki čvor može imati drugačiji apiUrl i model — prvi čvor npr. koristi DeepSeek za osnovnu analizu, drugi GPT za finu obradu; promena konfiguracije deluje već pri sledećem izvršenju.
🟡 Napredno | → PaiAgent ChatClientFactory dinamička fabrika | Shopee, Tencent, Moka
58. Šta je OpenAI-kompatibilan protokol? Gde su razlike između pojedinih velikih modela?
Format zahteva je ujedinjen preko /v1/chat/completions, a razlike su u base_url i api_key. Većina polja u odgovoru je ista, sa sitnim razlikama — npr. statistika token-a se kod nekih zove prompt_tokens, kod drugih input_tokens. PaiAgent koristi OpenAiChatModel iz Spring AI da ujednači pristup OpenAI-u, DeepSeek-u i Tongyi Qianwen.
🟡 Napredno | → PaiAgent OpenAiApi ujednačavanje više dobrih modela
59. Kako napisati dobar Prompt? Podeli praktično iskustvo iz Prompt inženjeringa.
Ključni principi: postavljanje uloge ("Ti si senior Java inženjer"), jasan zadatak (konkretno šta treba uraditi), ograničenje formata izlaza (JSON/Markdown), Few-shot primeri (nekoliko primera), ograničenja (šta ne raditi). PaiCLI ima slojevit dizajn Prompt-a, od sistemskog nivoa do nivoa Skill-a — što viši nivo, to viši prioritet.
🟡 Napredno | → PaiCLI mehanizam slojevitog preklapanja Prompt-a
60. Kako dizajnirati protočni izlaz (SSE / WebSocket)?
PaiCongming koristi WebSocket za dugo trajanje veze, u kombinaciji sa protočnim interfejsom DeepSeek-a, čime se postiže "efekat pisaće mašine" — model svaki generisani token odmah šalje frontend-u. Podržano je i aktivno zaustavljanje generisanja od strane korisnika. Tehnički detalji obuhvataju održavanje veze (heartbeat), ponovno povezivanje i obradu backpressure-a.
🟡 Napredno | → PaiCongming WebSocket + protočni interfejs DeepSeek | Kuaishou
61. Kako upravljati Token budžetom?
Pre poziva modela proceniti potrošnju token-a za taj zahtev; ako premašuje budžet, prvo kompresovati kontekst. PaiCLI podržava vizualizaciju Prompt Cache-a, pa korisnik vidi raspodelu potrošnje po zahtevu (koliko system prompt, koliko istorija razgovora, koliko opis alata), što olakšava ciljano optimizovanje.
🟡 Napredno | → PaiCLI dinamički budžet + vizualizacija Prompt Cache
62. Koje su glavne opcije za deployments velikih modela? Kako birati vLLM, TGI, llama.cpp?
vLLM (PagedAttention, visoka iskorišćenost VRAM-a, pogodan za visokoprotne onlajn servise), TGI (HuggingFace-ov proizvod, dobra integracija sa HF ekosistemom), llama.cpp (C++ implementacija, radi i na CPU/jednostavnijim GPU-ima), SGLang (RadixAttention, pogodan za scene sa složenim ponovljenim Prompt-ima). Za produkciono okruženje pod opterećenjem, vLLM je prvi izbor.
🟡 Napredno
63. Uporedi glavne velike modele koje si koristio. Šta ste na kraju izabrali u projektu?
PaiAgent podržava OpenAI, DeepSeek, Tongyi Qianwen i Zhipu. PaiCLI je povezan sa GLM, DeepSeek V4, Kimi, StepFun i sl. Princip izbora: za generisanje kode prednost dajemo DeepSeek/Claude, za kineski razgovor Tongyi Qianwen/GLM, za odnos cena/kvalitet DeepSeek. Nema najboljeg modela — samo onog koji najviše odgovara sceni.
🟡 Napredno | → PaiAgent četiri modela / PaiCLI višemodelna adaptacija | Shopee, Tencent
04. MCP i poziv alata (14 pitanja)
MCP (Model Context Protocol) jeste najpopularniji AI infrastrukturni protokol od 2025. godine, koji je predložio Anthropic, a za kojim su krenuli veliki provajderi. Ovih 14 pitanja pokrivaju od osnovnih principa Function Calling-a, preko inženjerske primene MCP-a, do novih protokola poput A2A. PaiCLI je od prvog dana duboko integrisao MCP, podržava automatsku registraciju 60+ alata — na intervjuu moći objasniti principe i iskustvo iz primene svakako donosi poene.
64. Kako je Function Calling implementiran na niskom nivou?
Model u fazi treniranja vidi mnogo primera para "opis funkcije → parametri poziva", pa pri zaključivanju, na osnovu namere korisnika, generiše strukturirani JSON poziva funkcije. U PaiAgent-u se svaki alat registruje preko FunctionCallback interfejsa Spring AI; trojka getName/getDescription/getInputTypeSchema je standardni protokol Function Calling-a.
🟡 Napredno | → PaiAgent FunctionCallback implementacija | ByteDance, Alibaba
65. Kako LLM uči da poziva spoljne alate? Kako se trenira sposobnost Function Call?
Dva puta: prvi, u SFT fazi fino podesiti na mnogo primera oblika "korisničko pitanje → poziv alata → rezultat alata → konačan odgovor"; drugi, u Prompt opisati alate i dati Few-shot primere, koristeći In-Context Learning. Prvi daje stabilnije rezultate, drugi ne zahteva ponovno treniranje. GPT serija ide prvim putem.
🟡 Napredno
66. Šta je MCP? Koji problem rešava?
MCP je standardizovani komunikacioni protokol "model ↔ alat" koji AI aplikacijama omogućava da priključe spoljne alate plug-and-play, poput USB-a. Ranije, za svaki alat je trebalo napisati poseban adapter; sa MCP-om, provajder alata ga jednom zapakuje po protokolu i svi MCP-podržavajući Agent-i ga mogu odmah koristiti.
🟡 Napredno | → PaiCLI MCP integracija / PaiAgent konfiguracija MCP alata | Tencent, Ant Group, ByteDance
67. Od kojih se delova sastoji MCP?
Tri komponente: MCP Server (server koji pruža alate/resurse), MCP Client (klijent na strani Agent-a, inicira poziv) i specifikacija protokola (format opisa alata, formati zahteva/odgovora, način prenosa). PaiCLI istovremeno implementira Client stranu (za poziv spoljnih MCP Server-a) i kompletnu podršku za protokol.
🟡 Napredno | → PaiCLI MCP Client implementacija
68. Koja je razlika između MCP i Function Calling?
Function Calling je sposobnost na nivou modela — model odlučuje koju funkciju poziva i sa kojim parametrima. MCP je protokol na transportnom sloju — definiše kako alat opisuje sebe, kako prima poziv i kako vraća rezultat. Može se razumeti kao: Function Calling je "odluka mozga", MCP je "kanal izvršenja ruku i nogu".
🟡 Napredno | → PaiAgent (Function Calling) + PaiCLI (MCP transport) | Zuoyebang, Tencent
69. Koja je razlika između Function Calling, Skill i MCP?
FC je sloj odlučivanja modela (koji alat pozvati), MCP je transportni sloj (kako alati komuniciraju), Skill je sloj znanja (predefinisani vodič kroz najbolje prakse). Tri se ne isključuju; jedan potpun poziv alata može obuhvatiti sve tri: Skill kaže modelu "u ovoj sceni koristi alat pretrage", model putem FC generiše parametre poziva, a MCP šalje zahtev servisu za pretragu.
🟡 Napredno | → PaiAgent (FC + Skill) + PaiCLI (FC + MCP + Skill)
70. Kako se koriste stdio i HTTP režim MCP Server-a?
stdio režim komunicira kroz podproces, pogodan za lokalne alate (operacije nad fajlovima, Git komande i sl.) — nizak latency ali samo na jednoj mašini. HTTP režim ide preko mreže, pogodan za udaljene servise (baze, third-party API), podržava distribuirano podešavanje ali ima mrežni overhead. PaiCLI podržava oba i automatski otkriva i registruje listu alata MCP Server-a.
🟡 Napredno | → PaiCLI stdio + HTTP dvorežim
71. Zašto neki modeli za rezonovanje ne podržavaju MCP?
Modeli za rezonovanje (npr. o1, DeepSeek-R1) su u dizajnu optimizovani za dugačko lančano rezonovanje, ali su žrtvovali sposobnost poziva alata. Njihovi podaci za treniranje i RLHF tok više pažnje posvećuju "razmisli pa odgovori" nego "pozivaj alate i odgovaraj". Rešenje: koristiti model za rezonovanje za planiranje, a običan model za pozivanje alata.
🟡 Napredno
72. Šta je A2A protokol? Koja je razlika prema MCP?
A2A (Agent-to-Agent) je protokol za komunikaciju između Agent-a koji je predložio Google, a rešava pitanje "kako Agent-i razgovaraju jedni sa drugima". MCP rešava "kako Agent komunicira sa alatima". Jedno je horizontalna saradnja između Agent-a, drugo je poziv alata nadole.
🟡 Napredno
73. Koja je razlika između WebSocket i SSE komunikacije? Kako se koriste u AI scenama?
SSE je jednosmeran (server → klijent), pogodan za protočni izlaz modela. WebSocket je dvosmeran, pogodan za scene gde klijent u svakom trenutku šalje poruke (npr. prekid generisanja). PaiCongming koristi WebSocket upravo zato što mora da podrži aktivno zaustavljanje generisanja od strane korisnika.
🟡 Napredno | → PaiCongming WebSocket dvosmerna komunikacija
74. Kako napisati Tool Description da bi model tačno pozivao?
Ključno je opisati "kada koristiti ovaj alat", a ne samo "šta ovaj alat radi". Npr. opis search_code ne treba da bude "pretraži kod", već "koristi se kada treba u bazi koda pronaći specifičnu funkciju, ime promenljive ili fragment koda". FunctionCallback.getDescription() u PaiAgent-u sledi upravo taj princip.
🟡 Napredno | → PaiAgent FunctionCallback dizajn opisa
75. Kako se radi bezbednosna kontrola osetljivih alata?
PaiCLI implementira kompletan bezbednosni mehanizam: HITL (Human-in-the-Loop) odobrenje od strane čoveka — pre izvršenja visokorizične operacije traži se pristanak korisnika; path fence — operacije nad fajlovima su ograničene na direktorijum projekta; blocklista komandi — zabranjuje opasne komande poput rm -rf /; strukturirani audit log — svaki poziv alata je sledljiv.
🟡 Napredno | → PaiCLI HITL + path fence + blocklista komandi | Kuaishou
76. Kako sprečiti da model izmišlja nepostojeće pozive alata (halucinacija alata)?
Dva sredstva: prvo, allowlista validacija nad listom alata — ako povratni tool_calls nije među registrovanim, odbacuje se; drugo, optimizovati opise alata da model tačnije razume granice alata. NodeExecutorFactory u PaiAgent-u, preko Map registra, prirodno implementira allowlistu.
🟡 Napredno | → PaiAgent NodeExecutorFactory allowlista | Taobao/Tmall
77. Da li si koristio okvire za LLM gateway? Šta gateway sloj rešava?
LLM gateway (npr. LiteLLM, OneAPI) objedinjuje upravljanje API ključevima više provajdera, rutiranje zahteva, rate limit, retry, load balancing. ChatClientFactory u PaiAgent-u zapravo delimično preuzima ulogu gateway-a, dinamički rutirajući zahteve ka različitim servisima modela na osnovu konfiguracije čvora. U produkcionom okruženju preporučuje se uvoditi namenski gateway.
🟡 Napredno | → PaiAgent ChatClientFactory funkcija rutiranja
05. AI Coding (8 pitanja)
AI Coding je pravac koji u poslednjih pola godine najbrže raste na intervjuima. PaiCLI, kao pandan Claude Code-u, kompletan je Java Agent CLI proizvod — od generisanja koda, AST analize do bezbednog Git rollback-a, tako da je korišćenje za odgovore u ovom pravcu pravo olakšanje.
78. Kako AI-om potpomognuto programiranje povećava efikasnost u stvarnom radu?
Ovo pitanje ne proverava dubinu poznavanja tehnologije, već stvarno iskustvo korišćenja. PaiCLI u svakodnevnom razvoju omogućava: opis zahteva na prirodnom jeziku → automatsko generisanje koda → provera kompilacije → automatska ispravka grešaka → commit u Git. Ključ nije koliko je generisanje koda tačno, već efikasnost petlje "generiši → povratna informacija → ispravi".
🟡 Napredno | → PaiCLI kompletan tok svakodnevnog razvoja | Xiaohongshu, Ant Group, Insta360
79. Čemu služi AST analiza u sceni generisanja koda?
AST (apstraktno sintaksno stablo) omogućava Agent-u da razume strukturu koda, a ne samo tekst. PaiCLI integriše JavaParser za AST analizu i može tačno locirati klasu, metod i polje i njihove odnose, što je mnogo pouzdanije od regex-a. Pri generisanju koda osigurava ispravan položaj umetanja i očuvanje postojeće strukture koda.
🟡 Napredno | → PaiCLI JavaParser AST analiza
80. Koji problem rešava ubacivanje LSP dijagnostike u AI Coding?
LSP (Language Server Protocol) pruža dijagnostiku u realnom vremenu: greške pri kompilaciji, provere tipova, neiskorišćene promenljive i sl. PaiCLI ubacuje LSP dijagnostiku u kontekst Agent-a, čime model pri generisanju i izmeni koda "vidi" IDE-nivo grešaka, što drastično povećava tačnost popravki.
🟡 Napredno | → PaiCLI ubacivanje LSP dijagnostike
81. Kako obezbediti bezbednost AI izmena koda? Kako radi Git snapshot rollback?
AI pogrešno menja kod često; ključno je brzo vraćanje. PaiCLI implementira Git Side-History mehanizam: pre svake AI izmene automatski kreira snapshot, a ako se nešto pokvari, jednim klikom se vraća stanje pre izmene. Kao save/load u igrama — psihološki teret odmah nestaje.
🟡 Napredno | → PaiCLI Git Side-History snapshot rollback
82. Kako radi vektorizacija i semantička pretraga baze koda?
Fajlove koda se seče po funkcijama/klasama u chunk-e, generišu se vektori i upisuju u bazu, a pri pretrazi se na osnovu opisa na prirodnom jeziku pronalazi semantički najsličniji fragment koda. PaiCLI koristi SQLite za trajno čuvanje vektora koda i gradi graf odnosa u kodu, čime se razumeju odnosi poziva između funkcija.
🟡 Napredno | → PaiCLI SQLite vektorsko skladište + graf odnosa u kodu
83. Kako se AI pregled koda i ljudski pregled koda međusobno dopunjuju?
AI pregled je dobar u: proveri konzistentnosti stila, prepoznavanju uobičajenih šablona bug-ova, skeniranju bezbednosnih propusta, oceni složenosti koda. Ljudski pregled je dobar u: ispravnosti poslovne logike, arhitektonskoj ispravnosti i proceni održivosti. Najbolja praksa je da AI prvo odradi automatski pregled, a čovek se fokusira samo na problematična mesta i poslovnu logiku.
🟡 Napredno
84. Kako se upravlja kontekstom pri editovanju više fajlova?
AI izmena jedne funkcionalnosti može zahvatiti 5–10 fajlova; ako se sve ubaci u kontekst, token-i eksplodiraju. PaiCLI prvo pomoću Glob/Grep-a tačno locira relevantne fajlove i segmente, u kontekst ubacuje samo neophodne fragmente, a nakon izmene jednog fajla oslobađa taj deo konteksta. Graf odnosa u kodu ovde pomaže — automatski pronalazi "izmena A fajla povlači i izmene B i C".
🟡 Napredno | → PaiCLI Glob/Grep + graf odnosa u kodu
85. Koje su prednosti i mane CLI Agent-a u odnosu na IDE plugin?
CLI oblik (PaiCLI, Claude Code): ne vezuje se za određeni IDE, univerzalan je i pogodan za full-stack i DevOps scene, ali nema GUI interakciju. IDE plugin oblik (GitHub Copilot, Tongyi Lingma): duboko integrisan sa editorom, dobro dopunjivanje, ali vezan za određeni IDE. PaiCLI je izabrao CLI jer Java programeri koriste previše različite IDE-e (IntelliJ, Eclipse, VS Code).
🟡 Napredno | → PaiCLI dizajnerske smernice CLI oblika
06. Inženjering i produkciona primena (15 pitanja)
Poslednjih 15 pitanja fokusira se na "kako Agent pretvoriti iz demo-a u proizvod". Cilj intervjuera je proveriti da li ste stvarno postavili Agent-a u produkciju, izdržali opterećenje i rešavali produkcione incidente. PaiAgent i PaiCLI su projekti koji rade u produkciji — uzeti ih za primer daje čvrstinu.
86. Koji procesi su potrebni da Agent sistem iz demo-a stigne do produkcionog nivoa?
Definicija zahteva → izbor tehnologije → validacija prototipa → integracija alata → izgradnja sistema ocenjivanja → bezbednosna revizija → phased rollout → monitoring i alarmi. Kompletan proces uvođenja PaiAgent-a prošao je kroz ove faze, a prelazak sa jednog DNW čvora na LangGraph4j dvomotorni sistem sam po sebi je dobar materijal za intervju.
🟡 Napredno | → PaiAgent evolucija od DAG-a do LangGraph4j | Wanlei Zhisheng, Ant Group, ByteDance, Tencent
87. Kako oceniti efekat izvršenja Agent-a?
Tri dimenzije: stopa završetka zadatka (da li Agent uspe da završi posao), kvalitet odgovora (da li je izlaz tačan i koristan), zadovoljstvo korisnika (ručno ocenjivanje ili implicitna povratna informacija). Zapisi o izvršenju PaiAgent-a upisuju se u bazu sa statusom uspeh/neuspeh, čime se olakšava kasnija statistika. Kandidata koji ume izneti kvantitativne metrike je veoma malo.
🔴 Duboko | → PaiAgent zapisi izvršenja + praćenje stanja | Shukun Tech, ByteDance
88. Koje metrike služe za ocenu sposobnosti velikih modela?
Opšta sposobnost: MMLU (znanje iz više disciplina), HumanEval (generisanje koda), GSM8K (matematičko rezonovanje). Za kineske scene: C-Eval, CMMLU. Sposobnost dijaloga: MT-Bench, Chatbot Arena ELO rang. RAG scene: RAGAS. Pri izboru ne gledati samo jednu listu — raditi privatnu ocenu za svoj scenario.
🟡 Napredno
89. Kako optimizovati Agent čija je reakcija prespora?
Inženjerski: paralelizacija poziva alata, keširanje učestalih upita, protočni izlaz radi smanjenja osećaja čekanja. Na strani baze modela: za prvobitnu analizu koristiti brži model (npr. Haiku), a za složenije zadate pozivati veći model. TTS modul PaiAgent-a koristi CompletableFuture za paralelnu obradu, tako da se više audio isečaka generiše istovremeno.
🟡 Napredno | → PaiAgent CompletableFuture paralela / PaiCLI višemodelno prebacivanje
90. Koje bezbednosne rizike ima Agent sistem? Kako ih sprečiti?
Tri glavna rizika: Prompt Injection (ubacivanje zlonamernih instrukcija), bekstvo iz sandbox-a (Agent izvrši sistemske komande koje ne bi smeo), neovlašćene operacije (Agent pristupi podacima kojima ne bi smeo). PaiCLI sistem odbrane čine četiri linije: HITL odobrenje, path fence, blocklista komandi i strukturirani audit log.
🔴 Duboko | → PaiCLI četiri bezbednosne linije
91. Šta je mehanizam Skill (paket predefinisanog znanja) i kako se dizajnira?
Skill pakuje najbolje prakse određene stručne oblasti u strukturiran paket znanja, koji Agent automatski učitava pri izvršenju zadatka. SkillRegistry u PaiAgent-u pri pokretanju aplikacije odjednom učita sve Skill-ove u ConcurrentHashMap i podržava potpuno ubacivanje i postepeno učitavanje. PaiCLI ima nezavisan Skill sistem, sa dodatnom moći akumulacije biblioteke iskustava sajta.
🟡 Napredno | → PaiAgent SkillRegistry / PaiCLI Skill + iskustvo sajta
92. Kako dizajnirati engine za raspoređivanje više alata? Kako tretirati zavisnosti između alata?
Srž je topološko sortiranje. Prvo se analiziraju ulazno-izlazne zavisnosti između alata, gradi se DAG, a zatim izvršava po topološkom redu. GraphBuilder u PaiAgent-u radi upravo to — preko odnosa source/target na granama gradi graf izvršenja, a čvorovi bez ulaznih grana izvršavaju se prvi.
🔴 Duboko | → PaiAgent GraphBuilder topološko građenje | ByteDance, Alibaba Cloud
93. Kako dizajnirati protočni izlaz Agent-a? Kako poboljšati korisničko iskustvo?
Dok model još "razmišlja", korisniku se već prikazuju međurezultati. PaiCLI u ReAct petlji prikazuje u realnom vremenu Thought ("Razmišljam..."), Action ("Pozivam alat xxx"), Observation ("Alat je vratio..."), čime korisnik vidi proces razmišljanja Agent-a umesto da suvo čeka konačan rezultat.
🟡 Napredno | → PaiCLI vizualizacija ReAct procesa
94. Kako se radi observabilnost Agent sistema? Koje metrike prčiti?
Ključne metrike: stopa uspešnosti zahteva, prosečno vreme odziva, potrošnja token-a, stopa uspešnosti poziva alata, stopa grešaka API-ja modela. Svako izvršenje toka rada PaiAgent-a zapisuje kompletan log (ulaz/izlaz, vreme trajanja i status po čvoru), čime se pri problemu brzo locira koji je čvor pao.
🟡 Napredno | → PaiAgent log izvršenja + praćenje na nivou čvora
95. Kako se radi phased rollout Agent-a?
Ne treba novi Agent odjednom gurnuti svim korisnicima. Uobičajena praksa je bucketing po ID-u korisnika ili po procentu saobraćaja — pusti se novi verzija na 5% korisnika, posmatra se (stopa grešaka, zadovoljstvo), pa ako je u redu, postepeno povećava. PaiAgent preko konfiguracije toka rada može da radi A/B testiranje — isti zadatak ide kroz dva različita rasporeda čvorova.
🟡 Napredno | → PaiAgent A/B konfiguracija toka rada
96. Kako kontrolisati troškove Agent sistema?
API velikih modela se naplaćuje po token-u, pa gubitak kontrole nad troškovima predstavlja realan rizik. Kontrole: token kvota po korisniku, mali model za osnovno ceđenje (PaiCLI podržava prebacivanje više modela), Prompt Cache za smanjenje ponovljenih izračunavanja, batch objedinjavanje zahteva. PaiCongming postavlja ograničenje brzine od 30 poruka u minuti po razgovoru.
🟡 Napredno | → PaiCLI višemodelno prebacivanje / PaiCongming ograničenje brzine
97. Kako Agent sistem radi toleranciju na greške? Šta sa single point of failure?
Pri padu poziva alata treba retry i degradaciona strategija; pri padu API-ja modela automatski preći na rezervni model; red poruka osigurava da asinhroni zadaci ne ostanu izgubljeni. Pri neuspehu čvora PaiAgent postavlja status na FAILED i zapisuje errorMessage, na osnovu čega viši sloj odlučuje da li retry-uje ili preskače.
🟡 Napredno | → PaiAgent FAILED status + evidentiranje grešaka
98. Koliko je vačno označavanje podataka u Agent projektu i kako se radi?
Skup za ocenu zahteva ručno označavanje "tačnih odgovora"; optimizacija Prompt-a zahteva označavanje "dobro vs. loše"; fino podešavanje zahteva kvalitetne parove instrukcija-odgovor. Kvalitet označavanja direktno određuje gornju granicu efekta modela. Može se koristiti AI za asistenciju (prvo generisanje verzije, zatim ručna korekcija), čime se efikasnost povećava 3–5 puta.
🟡 Napredno
99. Kako Agent projekat tretira usklađenost i privatnost korisnika?
Korisnički unos može sadržati osetljive podatke (lični podaci, poslovne tajne) i ne sme se direktno čuvati ili proslediti third-party modelu. Tretman: desenzitizacija ulaza, šifrovanje audit log-a, izbor domaćih provajdera modela čiji podaci ne napuštaju zemlju, uključivanje prikupljanja podataka tek nakon izričite saglasnosti korisnika. Višezakupna izolacija PaiCongming-a takođe je deo zahteva usklađenosti.
🟡 Napredno | → PaiCongming višezakupna izolacija
100. Koja je najveća tehnička challenga s kojom si se susreo u Agent projektu?
Otvoreno pitanje, ali najbolje pokazuje stvarni nivo kandidata. Preporučuje se pripremiti 2–3 stvarna primera: jedan na nivou arhitekture (npr. proces odlučivanja prelaska PaiAgent-a sa DAG engine-a na LangGraph4j dvomotorni sistem), jedan na nivou inženjeringa (npr. rešenje optimizacije eksplozije konteksta u PaiCLI-ju), jedan na nivou biznisa (npr. promena zahteva oko višezakupne izolacije dozvola u PaiCongming-u).
🔴 Duboko | → za svaki od tri projekta spremiti po jedan slučaj
07. Dopuna znanja za tri projekta (158 pitanja)
Ovaj deo je dopuna zasnovana na projektima PaiCongming, PaiAgent i PaiCLI. Kriterijum je deduplikacija po "ključnom znanju", a ne po naslovu pitanja: ako prvih 100 projektno-orijentisanih pitanja već pokrivaju istu klasu znanja ili intervjuerskih nuspoitanja, ne ponavljamo; ovde su zadržani detaljni principi, mehanizmi okvira i inženjerske scene koje lokalna lista još uvek nije očigledno pokrila.
Primeri znanja koje su obuhvatila prva 100 pitanja: osnovni RAG tok, deljenje dokumenata, izbor Embedding modela, izbor vektorske baze, hibridna pretraga, Rerank, osnovna Agent arhitektura, ReAct, kratkoročno/dugoročno pamćenje, MCP osnove, Function Calling, LoRA/QLoRA osnove, osnovna struktura Prompt-a.
NLP i osnove klasičnih modela (29 pitanja)
101. Šta je Word Embedding? Koje su uobičajene metode za Word Embedding?
🟡 Srednje | NLP / Word Embedding / Word2Vec | → PaiCLI / PaiAgent osnova primene velikih modela
102. Da li si trenirao podatke sa Word2Vec? Kako pri tome doći do korpusa? Kako birati hiperparametre? Kako odrediti korpus, vokabular i dimenziju? Kako proceniti dužinu treniranja?
🔴 Teško | NLP / Word Embedding / Word2Vec | → PaiCLI / PaiAgent osnova primene velikih modela
103. Koje metode za ubrzanje ima Word2Vec?
🔴 Teško | NLP / Word Embedding / Word2Vec | → PaiCLI / PaiAgent osnova primene velikih modela
104. Objasni tok hierarchical softmax i koje su mu prednosti?
🔴 Teško | NLP / Word Embedding / Word2Vec / hierarchical softmax | → PaiCLI / PaiAgent osnova primene velikih modela
105. Opiši primenu negativnog uzorkovanja u Word2Vec.
🟡 Srednje | NLP / Word Embedding / Word2Vec / negativno uzorkovanje | → PaiCLI / PaiAgent osnova primene velikih modela
106. Za koje scenarije su CBOW, a za koje Skip-gram pogodniji?
🟡 Srednje | NLP / CBOW / Skip-gram | → PaiCLI / PaiAgent osnova primene velikih modela
107. Opiši GloVE — kako se trenira? Koje su scene primene? Prednosti i mane u odnosu na Word2Vec?
🔴 Teško | NLP / Word2Vec / GloVE | → PaiCLI / PaiAgent osnova primene velikih modela
108. Opiši FastText — da li je bolji od Word2Vec? U kojim scenarijima je prikladniji?
🔴 Teško | NLP / Word2Vec / FastText | → PaiCLI / PaiAgent osnova primene velikih modela
109. O ELMo-u — koje su mu prednosti i mane? Može li obraditi višeznačnost reči? Zašto?
🔴 Teško | NLP / ELMo | → PaiCLI / PaiAgent osnova primene velikih modela
110. Opiši osnovne principe LSTM.
🟢 Lako | NLP / LSTM | → PaiCLI / PaiAgent osnova primene velikih modela
111. Kako LSTM, u poređenju sa rekurentnim neuronskim mrežama (RNN), rešava problem nestajanja gradijenta?
🟡 Srednje | NLP / LSTM / RNN / nestajanje gradijenta | → PaiCLI / PaiAgent osnova primene velikih modela
112. Objasni osnovne sastavne delove LSTM ćelije (LSTM cell) i njihove uloge.
🟡 Srednje | NLP / LSTM | → PaiCLI / PaiAgent osnova primene velikih modela
113. U LSTM-u, koja je razlika između hidden state i cell state?
🟡 Srednje | NLP / LSTM | → PaiCLI / PaiAgent osnova primene velikih modela
114. Koja je razlika između LSTM i GRU?
🟡 Srednje | NLP / LSTM / GRU | → PaiCLI / PaiAgent osnova primene velikih modela
115. Opiši arhitekturu i scene primene BERT modela.
🟡 Srednje | NLP / BERT | → PaiCLI / PaiAgent osnova primene velikih modela
116. Kako BERT tretira neuobičajene ili retke reči u tekstu na prirodnom jeziku?
🟡 Srednje | NLP / BERT | → PaiCLI / PaiAgent osnova primene velikih modela
117. Kakvo poboljšanje donosi BERT u odnosu na Word2Vec?
🟡 Srednje | NLP / BERT / Word2Vec | → PaiCLI / PaiAgent osnova primene velikih modela
118. Kako BERT radi maskiranje i koja je razlika u odnosu na CBOW?
🟡 Srednje | NLP / BERT / CBOW | → PaiCLI / PaiAgent osnova primene velikih modela
119. Koje metode mogu dobro da reše ograničenje dužine ulaza u BERT?
🔴 Teško | NLP / BERT | → PaiCLI / PaiAgent osnova primene velikih modela
120. Kako si efikasno optimizovao i fino podesio BERT za specifične NLP zadatke koje si radio?
🔴 Teško | NLP / BERT | → PaiCLI / PaiAgent osnova primene velikih modela
121. Kako upoređivati sličnost teksta?
🟢 Lako | NLP / klasifikacija teksta | → PaiCLI / PaiAgent osnova primene velikih modela
122. Da li se potporne vektorske mašine (SVM) mogu koristiti za klasifikaciju teksta? Ako da, objasni.
🟢 Lako | NLP / klasifikacija teksta / SVM | → PaiCLI / PaiAgent osnova primene velikih modela
123. U zadacima klasifikacije teksta, kako tretirati visokodimenzionalne i retke podatke?
🟡 Srednje | NLP / klasifikacija teksta | → PaiCLI / PaiAgent osnova primene velikih modela
124. U zadacima klasifikacije teksta, kako rešiti problem nebalansiranosti uzoraka (klasa)?
🟡 Srednje | NLP / klasifikacija teksta | → PaiCLI / PaiAgent osnova primene velikih modela
125. Koje izazove postojeći algoritmi za klasifikaciju teksta mogu imati pri obradi višejezičnih tekstualnih podataka?
🟡 Srednje | NLP / klasifikacija teksta | → PaiCLI / PaiAgent osnova primene velikih modela
126. Ukratko, kako se Word Embedding može primeniti u zadacima klasifikacije teksta?
🟡 Srednje | NLP / klasifikacija teksta / Word Embedding | → PaiCLI / PaiAgent osnova primene velikih modela
127. Ukratko opiši osnovne principe LLaMA (Large Language Model Meta AI).
🟡 Srednje | NLP / veliki jezički model | → PaiCLI / PaiAgent osnova primene velikih modela
128. U LLaMA modelu, da li dužina ulazne rečenice teorijski može biti beskonačna?
🔴 Teško | NLP / veliki jezički model | → PaiCLI / PaiAgent osnova primene velikih modela
129. Koje stvarne primene ima LLaMA?
🟢 Lako | NLP / veliki jezički model | → PaiCLI / PaiAgent osnova primene velikih modela
Transformer detalji i više modova (21 pitanja)
130. Da li Transformer kod izračunavanja attention-a koristi skalarni proizvod ili sabiranje? Obrazloži.
🟡 Srednje | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
131. Čemu služe K i Q u self-attention-u?
🟢 Lako | Transformer / mehanizam self-attention | → PaiAgent / PaiCLI pozadina izbora modela
132. Mogu li K i Q imati istu vrednost i dobiti se skalarnim proizvodom vektora sa samim sobom?
🟡 Srednje | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
133. Ako K i Q postanu ista matrica, kakav uticaj to ima na performanse modela?
🔴 Teško | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
134. Ako se zanemari količina izračunavanja, da li broj head-ova može beskonačno rasti?
🟡 Srednje | Transformer / multi-head attention | → PaiAgent / PaiCLI pozadina izbora modela
135. Kod multi-head attention-a, da li treba smanjiti dimenziju svakog head-a?
🟡 Srednje | Transformer / multi-head attention | → PaiAgent / PaiCLI pozadina izbora modela
136. Izloži svoje razumevanje Encoder modula u Transformer-u.
🟡 Srednje | Transformer / Encoder | → PaiAgent / PaiCLI pozadina izbora modela
137. U Transformer-u, da li je multi-head self-attention u fazi Decoder-a isti kao u fazi Encoder-a?
🟡 Srednje | Transformer / Encoder / Decoder / multi-head self-attention | → PaiAgent / PaiCLI pozadina izbora modela
138. Da li poznaješ Gradient Clipping u treniranju Transformer modela?
🟡 Srednje | Transformer / Gradient Clipping | → PaiAgent / PaiCLI pozadina izbora modela
139. Zašto Transformer koristi Layer Normalization umesto Batch Normalization?
🟡 Srednje | Transformer / normalization | → PaiAgent / PaiCLI pozadina izbora modela
140. Koji je princip rada Attention Masking u Transformer-u?
🟡 Srednje | Transformer / Attention Masking | → PaiAgent / PaiCLI pozadina izbora modela
141. Šta je autoregresivno svojstvo (autoregressive property)?
🟡 Srednje | Transformer / autoregresivno svojstvo | → PaiAgent / PaiCLI pozadina izbora modela
142. Mogu li "rezidualne veze" (residual connections) u Transformer-u ublažiti problem nestajanja gradijenta?
🟡 Srednje | Transformer / residual connections / nestajanje gradijenta | → PaiAgent / PaiCLI pozadina izbora modela
143. U Transformer-u, kako tretirati velike skupove podataka?
🟡 Srednje | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
144. Nakon završenog treniranja Transformer modela, kako oceniti njegove performanse i efekat?
🟡 Srednje | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
145. Gde je usko grlo u performansama Transformer modela?
🟡 Srednje | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
146. Kako bi mogao ublažiti to usko grlo performansi?
🔴 Teško | Transformer | → PaiAgent / PaiCLI pozadina izbora modela
147. Da li poznaješ ViT (Vision Transformer)?
🟡 Srednje | Vision Transformer | → PaiAgent / PaiCLI pozadina izbora modela
148. Da li poznaješ ViLT (Vision-and-Language Transformer)?
🔴 Teško | ViLT | → PaiAgent / PaiCLI pozadina izbora modela
149. Kako ViLT model primenjuje Transformer na zadatke prepoznavanja slika?
🟡 Srednje | ViLT / prepoznavanje slika | → PaiAgent / PaiCLI pozadina izbora modela
150. Koja je strukturna razlika između chatGLM i GPT?
🟡 Srednje | Transformer / jezički model | → PaiAgent / PaiCLI pozadina izbora modela
RAG detalji pretrage i produkciona optimizacija (19 pitanja)
151. U RAG aplikacijama, kako radi čišćenje i predobrada podataka radi povećanja preciznosti pretrage?
🟡 Srednje | AI / veliki model / RAG | → PaiCongming
152. Šta je self-querying? Zašto je u RAG-u potrebno?
🟢 Lako | AI / veliki model / RAG | → PaiCongming
153. Šta je prompt compression? Zašto je u RAG-u potrebna?
🟢 Lako | AI / veliki model / RAG | → PaiCongming
154. U RAG-u, kako radite parsiranje dokumenata u procesu indeksiranja?
🟡 Srednje | AI / veliki model / RAG | → PaiCongming
155. Šta u vektorskoj bazi znače HNSW, LSH i PQ?
🟡 Srednje | AI / veliki model / RAG / vektorska baza | → PaiCongming
156. Šta je ANN u vektorskoj bazi? Zašto je potreban?
🟡 Srednje | AI / veliki model / RAG / vektorska baza | → PaiCongming
157. Koje su uobičajene metode vektorske pretrage u vektorskoj bazi — šta su kosinusna sličnost, euklidsko rastojanje i Menhetenovo rastojanje? Koje su razlike?
🟡 Srednje | AI / veliki model / RAG / vektorska baza | → PaiCongming
158. Šta je Advanced RAG?
🟡 Srednje | AI / veliki model / RAG | → PaiCongming
159. Šta je Modular RAG?
🟡 Srednje | AI / veliki model / RAG | → PaiCongming
160. Šta je kontekstna pojačanja upita (Contextual Query Augmentation)? Kakva joj je uloga? Kako na osnovu Spring AI implementirati kontekstnu pojačanja upita za obradu nevezanih pitanja?
🟡 Srednje | backend | → PaiCongming
161. Šta je modularna RAG arhitektura koju predlaže Spring AI? Šta radi pre-retrieval, šta retrieval, a šta post-retrieval faza?
🟡 Srednje | backend | → PaiCongming
162. Imaš više baza znanja — pri RAG-u kako obezbeđuješ slaganje efikasnosti i tačnosti, uz što manje halucinacija?
🟡 Srednje | AI / veliki model / RAG | → PaiCongming
163. Kako RAG sistem tretira dokumente različitih formata — PDF, Word, Markdown?
🟡 Srednje | RAG / obrada dokumenata | → PaiCongming
164. Kako napraviti i koristiti vektorski indeks? Koja je razlika između HNSW i IVF?
🟡 Srednje | RAG / vektorski indeks | → PaiCongming
165. Kako podesiti prag sličnosti pri RAG pretrazi? Kakve posledice ima neodgovarajuće podešavanje?
🟡 Srednje | RAG / prag sličnosti | → PaiCongming
166. Kako RAG sistem koristi filtriranje metapodataka za povećanje preciznosti pretrage?
🟡 Srednje | RAG / filtriranje metapodataka | → PaiCongming
167. Kako postupiti kada RAG ne pronađe relevantne dokumente?
🟡 Srednje | RAG / obrada neuspeha pretrage | → PaiCongming
168. Kako RAG sistem označava izvor informacija i daje citate?
🟡 Srednje | RAG / navođenje izvora | → PaiCongming
169. Kako RAG sistem u produkciji optimizovati performanse i sniziti troškove?
🔴 Teško | RAG / optimizacija performansi | → PaiCongming
Agent protokoli, okviri i inženjerske granice (38 pitanja)
170. Kako integrisati MCP u okvir Spring AI?
🟢 Lako | veliki model / AI / MCP / Spring / Spring AI / Java | → PaiAgent (Spring AI) / PaiCLI (MCP poređenje)
171. Koje slojeve obuhvata bezbednosni dizajn MCP protokola?
🟢 Lako | veliki model / AI / MCP / bezbednost | → PaiAgent / PaiCLI
172. Kako postojeću aplikaciju pretvoriti u MCP servis?
🟢 Lako | veliki model / AI / MCP / razvojna praksa | → PaiAgent / PaiCLI
173. Šta je guardrails (tehnika zaštitnih ograda)?
🟢 Lako | AI / veliki model | → PaiAgent / PaiCLI
174. Šta su GPT Structured Outputs?
🟢 Lako | AI / veliki model | → PaiAgent / PaiCLI
175. Šta je LangGraph?
🟢 Lako | AI / veliki model / LangGraph / orkestracija toka rada | → PaiAgent
176. Koji je princip orkestracije u LangGraph-u?
🟢 Lako | AI / veliki model / LangGraph / orkestracija toka rada | → PaiAgent
177. Koja je razlika između LangChain i LangGraph?
🟢 Lako | AI / veliki model / LangGraph / orkestracija toka rada | → PaiAgent
178. Šta je Manus? Opiši svoje razumevanje.
🟢 Lako | AI / veliki model / Manus | → PaiAgent / PaiCLI
179. Šta je Computer Use? Opiši princip.
🟡 Srednje | AI / veliki model | → PaiAgent / PaiCLI
180. Koja je razlika između Copilot režima i Agent režima?
🟡 Srednje | AI / veliki model | → PaiAgent / PaiCLI
181. Kako LLM Agent izvodi rezonovanje u višemodalnim zadacima?
🔴 Teško | veliki model / AI / Agent | → PaiAgent / PaiCLI
182. Koji su glavni LLM Agent okviri na tržištu? Koje su im karakteristike?
🟢 Lako | veliki model / AI / Agent | → PaiAgent / PaiCLI
183. Kako se LlamaIndex može kombinovati sa LangChain?
🔴 Teško | veliki model / AI / Agent / LangChain / LlamaIndex | → PaiAgent poređenje izbora okvira
184. Kako AutoGPT implementira autonomno odlučivanje?
🔴 Teško | veliki model / AI / Agent / AutoGPT | → PaiCLI / PaiAgent poređenje Agent paradigmi
185. Šta je A2A protokol, koje su mu ključne arhitekture i glavne komponente?
🟡 Srednje | veliki model / AI / A2A / sistemska arhitektura | → PaiAgent / PaiCLI
186. Kojih pet dizajnerskih principa ima A2A protokol?
🟡 Srednje | veliki model / AI / A2A / sistemska arhitektura | → PaiAgent / PaiCLI
187. Šta je Google ADK?
🟢 Lako | AI / veliki model | → PaiAgent / PaiCLI
188. Šta je Spring AI okvir? Koje su mu ključne karakteristike?
🟢 Lako | backend / Spring AI | → PaiAgent
189. Šta je strukturirani izlaz? Kako Spring AI implementira strukturirani izlaz?
🟡 Srednje | backend / Spring AI | → PaiAgent
190. Šta je Re-Reading? Kako na osnovu Spring AI implementirati Re-Reading Advisor?
🟡 Srednje | backend / Spring AI | → PaiAgent
191. Šta je Tool Calling (poziv alata)? Kako iskoristiti Spring AI za poziv alata?
🟡 Srednje | backend / Spring AI | → PaiAgent
192. Šta je OpenManus? Koji mu je princip implementacije?
🔴 Teško | backend | → PaiAgent / PaiCLI
193. Da li si susreo problem beskonačne petlje Agent-a? Kako ga rešiti?
🟡 Srednje | backend / AI / veliki model / problemska pitanja | → PaiAgent / PaiCLI
194. OpenClaw je ovih dana veoma popularan — da li poznaješ njegove principe?
🟢 Lako | AI / OpenClaw / razvoj aplikacija velikih modela / Agent razvoj / razvoj AI aplikacija | → PaiAgent / PaiCLI
195. Šta je OpenClaw? Koji problem rešava? Koje su mu ključne sposobnosti?
🟢 Lako | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
196. Koje su ključne komponente OpenClaw-a? Opišite međusobne odnose.
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
197. Ako Agent sistem treba istovremeno da podrži Web, Feishu, DingTalk i druge kanale, kako bi dizajnirao sloj apstrakcije kanala? Kako je dizajniran Channel Plugin interfejs u OpenClaw-u?
🟢 Lako | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
198. Koja je razlika između MCP i Skills? U kojim scenarijima se koji koristi?
🟢 Lako | AI / veliki model / Agent / Skills | → PaiAgent / PaiCLI
199. Kako dizajnirati i upravljati sistemom Skills za AI Agent? Koje izazove ima u stvarnim projektima?
🟡 Srednje | AI / veliki model / Agent / Skills | → PaiAgent / PaiCLI
200. U jednom sistemu može biti više Agent-a; poruke različitih grupa korisnika na različitim kanalima moraju se rutirati ka različitim Agent-ima. Kako bi dizajnirao to rutiranje? Kako izgleda prioritet podudaranja rutiranja u OpenClaw-u?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / Agent razvoj / razvoj AI aplikacija | → PaiAgent / PaiCLI
201. Kada isti korisnik razgovara sa Agent-om u privatnom i u grupnom chatu, da li sesiju deliti ili izolovati? Kako OpenClaw dizajnira nivo izolacije sesije?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
202. Isti alat (npr. "izvrši komandu") u različitim scenama treba da ima različite dozvole. Kako bi dizajnirao kontrolu dozvola alata? Kako je stratifikovan tool policy pipeline u OpenClaw-u?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
203. Različiti LLM provajderi ne podržavaju Tool Schema na isti način — kako tretiraš te razlike? Kako OpenClaw radi Schema adaptaciju?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija | → PaiAgent / PaiCLI
204. Čemu služi Hook middleware šablon u Agent sistemu? Nabroj nekoliko tipičnih scenarija. Kako je dizajniran Hook sistem u OpenClaw-u?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
205. Kada roditelj Agent spawn-uje dete Agent-a, koje granične probleme treba razmotriti? Koja ograničenja i zaštitu OpenClaw pruža?
🟡 Srednje | AI / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
206. OpenClaw koristi plugin arhitekturu — treće strane mogu registrovati nove kanale, alate i Hook-ove. Koja ključna pitanja treba razmotriti pri dizajnu plugin sistema? Kako izgleda plugin API OpenClaw-a?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
207. Gateway u OpenClaw-u radi idempotentnost Agent zahteva. Zašto Agent sistem posebno zahteva idempotentnost? Šta kada alat već proizvede sporedne efekte?
🟡 Srednje | AI / OpenClaw / razvoj aplikacija velikih modela / razvoj AI aplikacija / Agent razvoj | → PaiAgent / PaiCLI
Prompt inženjering — detaljne metode (12 pitanja)
208. Koju ulogu imaju separatori u promptu? Kako se koriste?
🟢 Lako | Prompt / separatori | → PaiCLI / PaiAgent
209. Šta je System Prompt? Koja je razlika u odnosu na korisnički prompt?
🟢 Lako | Prompt / System Prompt | → PaiCLI / PaiAgent
210. Šta je Few-shot Learning? Koja je razlika između Zero-shot, One-shot i Few-shot?
🟡 Srednje | Prompt / Few-shot Learning | → PaiCLI / PaiAgent
211. Kako odabrati i dizajnirati Few-shot primer radi boljeg efekta?
🟡 Srednje | Prompt / dizajn Few-shot primera | → PaiCLI / PaiAgent
212. Šta je self-consistency? Kako se primenjuje?
🟡 Srednje | Prompt / self-consistency | → PaiCLI / PaiAgent
213. Šta je negativni prompt? U kojim scenama se koristi?
🟡 Srednje | Prompt / negativni prompt | → PaiCLI / PaiAgent
214. Šta je prompt linking? Kako se implementira?
🟡 Srednje | Prompt / prompt linking | → PaiCLI / PaiAgent
215. Kako dizajnirati specijalne promptove za različite oblasti — npr. programiranje, pisanje, analiza podataka?
🟡 Srednje | Prompt / promptovi posebni za oblast | → PaiCLI / PaiAgent
216. Kako sistemski ocenjivati i optimizovati efekat prompta?
🔴 Teško | Prompt / ocena efekta | → PaiCLI / PaiAgent
217. Šta je napad ubacivanja prompta (prompt injection)? Kako se sprečava?
🔴 Teško | Prompt / bezbednost | → PaiCLI / PaiAgent
218. U stvarnom projektu kako se radi A/B testiranje i iteracija promptova?
🔴 Teško | Prompt / A/B testiranje | → PaiCLI / PaiAgent
219. Šta je Tree of Thoughts (stablo misli)? Koje prednosti ima u odnosu na CoT?
🔴 Teško | Prompt / Tree of Thoughts | → PaiCLI / PaiAgent
LangChain detalji okvira (13 pitanja)
220. Šta je Chain u LangChain-u? Koje su uobičajene vrste?
🟢 Lako | LangChain / Chain (ulančavanje) | → PaiAgent poređenje izbora okvira
221. Koju ulogu ima Memory komponenta u LangChain-u? Koje su uobičajene vrste Memory?
🟡 Srednje | LangChain / mehanizam Memory (pamćenja) | → PaiAgent poređenje izbora okvira
222. Kako u LangChain-u implementirati protočni izlaz?
🟡 Srednje | LangChain / protočni izlaz | → PaiAgent poređenje izbora okvira
223. Kako u LangChain-u definisati sopstveni Tool?
🟡 Srednje | LangChain / Tool | → PaiAgent poređenje izbora okvira
224. Koja je razlika između LangChain i LlamaIndex? U kojim scenarijima koji više odgovara?
🟡 Srednje | LangChain / LlamaIndex / poređenje okvira | → PaiAgent poređenje izbora okvira
225. Koje vrste DocumentLoader postoje u LangChain-u? Kako odabrati?
🟢 Lako | LangChain / DocumentLoader (učitavanje dokumenata) | → PaiAgent poređenje izbora okvira
226. Koju ulogu ima OutputParser u LangChain-u? Koje su uobičajene vrste?
🟢 Lako | LangChain / OutputParser (parsiranje izlaza) | → PaiAgent poređenje izbora okvira
227. Šta je Callback mehanizam u LangChain-u? Čemu služi?
🟡 Srednje | LangChain / Callback | → PaiAgent poređenje izbora okvira
228. Šta je LCEL (izrazni jezik) u LangChain-u? Koje prednosti ima?
🟡 Srednje | LangChain / LCEL | → PaiAgent poređenje izbora okvira
229. Kako u LangChain-u implementirati uslovne grane i dinamičko rutiranje?
🟡 Srednje | LangChain / uslovno rutiranje | → PaiAgent poređenje izbora okvira
230. Koje vrste Retriever-a ima LangChain? Koje su im karakteristike?
🟡 Srednje | LangChain / Retriever | → PaiAgent poređenje izbora okvira
231. Kako tretirati greške i izuzetke u LangChain aplikacijama?
🟡 Srednje | LangChain / obrada izuzetaka | → PaiAgent poređenje izbora okvira
232. Kako obezbediti kvalitet i konzistentnost izlaza LangChain aplikacija?
🔴 Teško | LangChain / osiguranje kvaliteta | → PaiAgent poređenje izbora okvira
Fino podešavanje, treniranje i kompresija modela (17 pitanja)
233. Koji se optimizatori uobičajeno koriste pri finom podešavanju?
🟡 Srednje | veliki model / AI / fino podešavanje / optimizator | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
234. Kako se rizik preprilagođavanja (overfitting) pri finom podešavanju ublažava regularizacijom?
🔴 Teško | veliki model / AI / fino podešavanje | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
235. U višemodalnom finom podešavanju (npr. generisanje slike-teksta), kako obezbediti kvalitet poravnanja tekstualnih i slikovnih podataka?
🔴 Teško | veliki model / AI / fino podešavanje / više modova | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
236. Kako parameter-efficient fine-tuning (PEFT) smanjuje računarske troškove?
🔴 Teško | veliki model / AI / fino podešavanje | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
237. Koja je uloga zamrznutih slojeva u finom podešavanju?
🔴 Teško | veliki model / AI / fino podešavanje | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
238. Zašto je potrebno treniranje u mešanoj preciznosti (mixed precision)?
🔴 Teško | veliki model / AI / fino podešavanje | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
239. Kako fino podešavanje rešava problem ponavljanja izlaza i halucinacija?
🔴 Teško | veliki model / AI / fino podešavanje | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
240. Kakav hardver je potreban za fino podešavanje velikih modela? Koliko VRAM-a zahtevaju 7B i 70B modeli?
🟢 Lako | veliki model / fino podešavanje / procena VRAM-a | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
241. Koje su glavne alatke za fino podešavanje u 2026. godini? Šta karakteriše Unsloth, Axolotl i TRL?
🟢 Lako | veliki model / alatke za fino podešavanje / Unsloth / Axolotl / TRL | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
242. Kako podesiti hiperparametre LoRA-e? Koja su iskustvena pravila?
🟢 Lako | veliki model / LoRA / hiperparametri | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
243. Upoređujući LoRA, QLoRA, DoRA i puno fino podešavanje — kako birati u različitim scenama?
🟢 Lako | veliki model / LoRA / QLoRA / DoRA / puno fino podešavanje | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
244. U višemodalnom finom podešavanju, kako obezbediti kvalitet poravnanja tekstualnih i slikovnih podataka? Koje tehničke izazove ima?
🟢 Lako | veliki model / višemodalno fino podešavanje / poravnanje podataka | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
245. Šta je ORPO? Kako objedinjuje instrukcijsko fino podešavanje i poravnanje preferenci?
🟢 Lako | veliki model / ORPO / poravnanje preferenci | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
246. Kako izgraditi kvalitetan SFT skup za fino podešavanje? Da li je važniji kvalitet ili količina podataka?
🟢 Lako | veliki model / SFT / izgradnja skupa podataka | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
247. Šta je Knowledge Distillation (destilacija znanja)? Koja je razlika u odnosu na kvantizaciju modela?
🟢 Lako | veliki model / destilacija modela / kvantizacija modela | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
248. Šta su treniranje i šta izvođenje (inference) velikih modela? Koja je razlika u zahtevima za računarskim resursima?
🟢 Lako | veliki model / treniranje / izvođenje / procena resursa | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
249. Šta je broj parametara velikog modela? Kakav je odnos između broja parametara i sposobnosti modela?
🟢 Lako | veliki model / broj parametara / sposobnost modela | → PaiAgent / PaiCLI proširenje intervjua model-inženjeringa
LLM inženjering i novi trendovi AI Coding (9 pitanja)
250. Šta je GPTCache?
🟢 Lako | AI / veliki model | → PaiCLI / PaiAgent
251. Ako GPU klaster ima propusnost od 1000 tokena/s, da li kod istovremenog pristupa 1000 korisnika svaki dobija samo 1 token/s? Kako analizirati usko grlo performansi?
🟡 Srednje | backend / problemska pitanja / veliki model | → PaiCLI / PaiAgent
252. Šta je Agentic Engineering? Koja je razlika u odnosu na Vibe Coding?
🟢 Lako | AI Coding / Agentic Engineering / Vibe Coding | → PaiCLI / PaiAgent
253. Šta je ACP protokol? Koja dva različita značenja ima?
🟢 Lako | AI Coding / ACP protokol / Agent protokol | → PaiCLI / PaiAgent
254. Šta su Deep Thinking i Adaptive Thinking? Koju primenu imaju u AI programiranju?
🟢 Lako | AI Coding / Deep Thinking / Adaptive Thinking | → PaiCLI / PaiAgent
255. Šta je Token velikih modela? Koja je razlika u naplaćivanju između ulaznog i izlaznog Token-a?
🟢 Lako | veliki model / Token / model naplate | → PaiCLI / PaiAgent
256. Šta je Background Agent? Kakav način rada u AI programiranju menja?
🟢 Lako | AI Coding / Background Agent / asinhroni zadaci | → PaiCLI / PaiAgent
257. Šta je mehanizam Token keširanja? Kako pomaže u snižavanju troškova AI aplikacija?
🟢 Lako | veliki model / Token keširanje / optimizacija troškova | → PaiCLI / PaiAgent
258. Šta je Auto-fix Loop u AI programiranju? Kako dizajnirati tok rada i strategiju izlaska?
🟢 Lako | AI Coding / Auto-fix Loop / strategija izlaska | → PaiCLI / PaiAgent
ending
258 pitanja, 14 pravaca, 3 praktična projekta.
Prvih 100 pitanja je 6 projektno orijentisanih jezgro pravaca: Agent, RAG, LLM, MCP, AI Coding i inženjering.
Ostalih 158 pitanja dopunjuje 8 detaljnih pravaca oko PaiCongming, PaiAgent i PaiCLI: NLP i osnove klasičnih modela, Transformer detalji i više modova, RAG detalji pretrage i produkciona optimizacija, Agent protokoli/okviri/inženjerske granice, Prompt inženjering — detaljne metode, LangChain detalji okvira, fino podešavanje i treniranje i kompresija modela, LLM inženjering i novi trendovi AI Coding.
Ovo nije pitanja-banka za napamet učenje,
već ratna karta sa projektima.
Pita intervjuer za Transformer — ti od mehanizma pažnje pređeš na dinamičko prebacivanje modela u PaiAgent-u.
Pita za RAG deljenje na chunk-e — ti kažeš zašto je PaiCongming izabrao 512 znakova sa preklapanjem od 100 znakova.
Pita za MCP — ti kažeš da PaiCLI istovremeno podržava stdio i HTTP, sa preko 60 alata plug-and-play.
Pita za LoRA — ti povežeš kompletan put od treniranja do deployments-a.
Iza svakog pitanja stoje stvarni kod, stvarne greške i stvarni podaci.
Kasnije ću razložiti pitanja pojedinačno i dati doterane odgovore,
pri čemu će svaki tekst pokriti 5–8 pitanja, sa kodom, arhitektonskim dijagramom i razmišljanjem za odgovor na intervjuerska nuspoitanja.
[Sačuvaj ovaj tekst, isplati se]
