Задача: AI-функция может отвечать убедительно даже при слабом источнике или неверном поиске. Разрозненных ручных проверок недостаточно: после смены модели или промпта старые ошибки возвращаются.
Решение: Пользовательская оценка связывается с вопросом, ответом, моделью, найденными источниками и trace. Негативные примеры превращаются в контрольные сценарии.
Benchmark-набор запускается на новой версии. Verifier проверяет опору ответа на найденный контекст и блокирует результат, если утверждения нельзя подтвердить.
Результат: Команда видит плохой ответ вместе с входными данными, retrieval и версией модели.
Изменение промпта или поиска проходит одинаковые контрольные вопросы вместо выборочной оценки на глаз.
https://habab.ru/ai/ai_quality_assurance