image
Задача: AI-функция может отвечать убедительно даже при слабом источнике или неверном поиске. Разрозненных ручных проверок недостаточно: после смены модели или промпта старые ошибки возвращаются. Решение: Пользовательская оценка связывается с вопросом, ответом, моделью, найденными источниками и trace. Негативные примеры превращаются в контрольные сценарии. Benchmark-набор запускается на новой версии. Verifier проверяет опору ответа на найденный контекст и блокирует результат, если утверждения нельзя подтвердить. Результат: Команда видит плохой ответ вместе с входными данными, retrieval и версией модели. Изменение промпта или поиска проходит одинаковые контрольные вопросы вместо выборочной оценки на глаз.
https://habab.ru/ai/ai_quality_assurance