advanced

Embeddings

Представляйте text или objects как vectors, distance которых approximates semantic similarity for retrieval tasks.

Эмбеддинги — плотные числовые векторы, представляющие текст, изображения или другие объекты так, что семантическая близость приближает расстояние в векторном пространстве. Модель сближает «политику возврата» и «гарантию возврата денег» даже без общих ключевых слов.

Типичный поток: выбрать модель эмбеддингов (OpenAI, Cohere, open-source sentence transformers), нарезать контент на чанки, batch-кодировать offline или при записи, хранить векторы с метаданными (id источника, tenant, ACL) и искать, кодируя вопрос пользователя и находя ближайших соседей.

| Аспект | Следствие | |--------|-----------| | Версия модели | При смене — re-embed всего корпуса | | Размерность | Память индекса и хранение растут линейно | | Язык/домен | Общие модели промахиваются по нише | | Стоимость | API vs свой GPU |

На интервью: объясните эмбеддинги как выученные семантические координаты, а не магию; когда keyword search всё ещё лучше (SKU, точные коды); нормализацию и выбор метрики расстояния.

Типовые ошибки: крошечные чанки без контекста; устаревшие векторы после правок; смешение моделей в одном индексе; игнор metadata-фильтров в multi-tenant; вера, что эмбеддинги заменяют оценку качества.

Компромисс — семантический recall для перефразировок и понятий против стоимости модели, нагрузки на reindex, непрозрачности релевантности и необходимости гибридного keyword + vector в проде.

Чеклист:

  • Определите эмбеддинг как семантический вектор фиксированной длины.
  • Назовите chunking, выбор модели и триггеры re-embed.
  • Сравните с keyword search на инвертированном индексе.
  • Укажите метрику расстояния и нормализацию.
  • Свяжите векторы с метаданными и контролем доступа.