advanced
Embeddings
Представляйте text или objects как vectors, distance которых approximates semantic similarity for retrieval tasks.
Эмбеддинги — плотные числовые векторы, представляющие текст, изображения или другие объекты так, что семантическая близость приближает расстояние в векторном пространстве. Модель сближает «политику возврата» и «гарантию возврата денег» даже без общих ключевых слов.
Типичный поток: выбрать модель эмбеддингов (OpenAI, Cohere, open-source sentence transformers), нарезать контент на чанки, batch-кодировать offline или при записи, хранить векторы с метаданными (id источника, tenant, ACL) и искать, кодируя вопрос пользователя и находя ближайших соседей.
| Аспект | Следствие | |--------|-----------| | Версия модели | При смене — re-embed всего корпуса | | Размерность | Память индекса и хранение растут линейно | | Язык/домен | Общие модели промахиваются по нише | | Стоимость | API vs свой GPU |
На интервью: объясните эмбеддинги как выученные семантические координаты, а не магию; когда keyword search всё ещё лучше (SKU, точные коды); нормализацию и выбор метрики расстояния.
Типовые ошибки: крошечные чанки без контекста; устаревшие векторы после правок; смешение моделей в одном индексе; игнор metadata-фильтров в multi-tenant; вера, что эмбеддинги заменяют оценку качества.
Компромисс — семантический recall для перефразировок и понятий против стоимости модели, нагрузки на reindex, непрозрачности релевантности и необходимости гибридного keyword + vector в проде.
Чеклист:
- Определите эмбеддинг как семантический вектор фиксированной длины.
- Назовите chunking, выбор модели и триггеры re-embed.
- Сравните с keyword search на инвертированном индексе.
- Укажите метрику расстояния и нормализацию.
- Свяжите векторы с метаданными и контролем доступа.