Retrieval-Augmented Generation (RAG) — архитектурный паттерн, который позволяет LLM-моделям работать с вашими данными. Разбираемся, как это работает.

Как работает RAG

При получении вопроса система сначала ищет релевантные документы в векторной базе данных, а затем передаёт их LLM вместе с запросом для генерации ответа.

Компоненты

• Векторная БД (Pinecone, Qdrant, pgvector)
• Эмбеддер для векторизации текстов
• LLM для генерации ответов
• Пайплайн индексации документов

Где применять

RAG идеален для чат-ботов технической поддержки, корпоративных баз знаний и AI-ассистентов, работающих с документацией компании.

Читайте также