advanced
RAG basics
Комбинируйте retrieval, chunking, context windows, citations и evaluation, чтобы ground model answers in source data.
RAG (Retrieval-Augmented Generation) опирает ответы LLM на извлечённые фрагменты источников, а не только на параметрическую память модели. Поток: ingest документов → chunk и embed → индекс векторов (часто плюс keyword) → на вопрос пользователя top-k → промпт с цитатами → генерация ответа.
вопрос → retrieve(k) → prompt(контекст + вопрос) → LLM → ответ + источники
Рычаги качества: размер/overlap чанков, гибридный retrieval, rerank, metadata-фильтры, шаблон промпта, бюджет контекста и offline-оценка (faithfulness, точность цитат, отказ при отсутствии evidence).
На интервью: нарисуйте конвейер end-to-end; failure modes (неверный чанк, устаревший индекс, галлюцинация при наличии контекста); как измерять улучшение.
Типовые ошибки: чанки, рвущие таблицы или код; нет id цитат в промпте; доверие только ANN для точных цифр политики; пропуск ACL при retrieval; нет feedback loop от плохих ответов.
Компромисс — более свежие и проверяемые ответы против сложности конвейера, латентности (retrieve + generate) и постоянной eval/поддержки — это не разовая заливка векторов.
Чеклист:
- Нарисуйте ingest → chunk → embed → retrieve → generate.
- Назовите роль hybrid search и rerank.
- Укажите context window и формат цитат.
- Перечислите метрики: groundedness, citation hit rate.
- Применяйте ACL к извлечённым чанкам.