advanced

RAG basics

Combine retrieval, chunking, context windows, citations, and evaluation to ground model answers in source data.

Retrieval-Augmented Generation (RAG) grounds LLM answers in retrieved source chunks instead of parametric memory alone. Flow: ingest documents → chunk and embed → store in vector (and often keyword) index → on user question, retrieve top-k → assemble prompt with citations → generate answer.

					question → retrieve(k) → prompt(context + question) → LLM → answer + sources
				

Quality levers: chunk size/overlap, hybrid retrieval, reranking, metadata filters, prompt template, max context budget, and offline eval (faithfulness, citation accuracy, refusal when evidence is missing).

On interviews: diagram the pipeline end-to-end; explain failure modes (wrong chunk, stale index, hallucination despite context); describe how you would measure improvement.

Common pitfalls: chunks that split tables or code mid-block; no citation ids in the prompt; trusting ANN alone for exact policy numbers; skipping access-control at retrieval; no feedback loop from bad answers.

The trade-off is fresher, attributable answers versus pipeline complexity, latency (retrieve + generate), and ongoing eval/maintenance—not a one-time vector dump.

Checklist:

  • Draw ingest → chunk → embed → retrieve → generate.
  • Name hybrid search and rerank role.
  • State context window and citation format.
  • List eval metrics: groundedness, citation hit rate.
  • Enforce ACL on retrieved chunks.