Сначала аудит: где именно ассистент теряет точность на определении машины и на проверке применимости детали. Дальше замерный стенд, который гоняет набор запросов и даёт метрики по каждому шагу, плюс работа над стоимостью прогона. Оплаченный блок принят полностью, доработку фильтра честно отложили до логов клиента, а не стали угадывать.
Стек: Python, LLM, оценочный харнесс, метрики точности.