advanced
RAG basics
Combine retrieval, chunking, context windows, citations, and evaluation to ground model answers in source data.
Retrieval-Augmented Generation (RAG) grounds LLM answers in retrieved source chunks instead of parametric memory alone. Flow: ingest documents → chunk and embed → store in vector (and often keyword) index → on user question, retrieve top-k → assemble prompt with citations → generate answer.
question → retrieve(k) → prompt(context + question) → LLM → answer + sources
Quality levers: chunk size/overlap, hybrid retrieval, reranking, metadata filters, prompt template, max context budget, and offline eval (faithfulness, citation accuracy, refusal when evidence is missing).
On interviews: diagram the pipeline end-to-end; explain failure modes (wrong chunk, stale index, hallucination despite context); describe how you would measure improvement.
Common pitfalls: chunks that split tables or code mid-block; no citation ids in the prompt; trusting ANN alone for exact policy numbers; skipping access-control at retrieval; no feedback loop from bad answers.
The trade-off is fresher, attributable answers versus pipeline complexity, latency (retrieve + generate), and ongoing eval/maintenance—not a one-time vector dump.
Checklist:
- Draw ingest → chunk → embed → retrieve → generate.
- Name hybrid search and rerank role.
- State context window and citation format.
- List eval metrics: groundedness, citation hit rate.
- Enforce ACL on retrieved chunks.