image
Таблица приёмочных испытаний. Приложена файлом. Это описание метода приёмки, не отчёт по выполненному проекту. Главное возражение к любому решению на языковой модели: как принять работу, если один и тот же вопрос дважды даёт разные ответы. Обычная приёмка через «работает или нет» здесь не проходит, и пока на этот вопрос нет ответа, сдавать нечем. Как это решается. До начала работы собирается список проверок: вопрос или входящий документ, что агент должен сделать, что считается верным результатом. Список закрывается цифрой - какая доля проверок должна пройти. Цифра согласуется до старта и идёт в техническое задание приложением к договору. На приёмке проходим по списку вместе с заказчиком. Результат каждой проверки фиксируется, доля считается и сравнивается с согласованной. Критерий назван заранее обеими сторонами, поэтому спор «нравится или не нравится» на приёмке не начинается. Критерии в списке разные. Где работает обычная логика - создание записи, отмена, проверка занятости - допустима полная проходимость. Где модель интерпретирует живой текст, порог ставится ниже: требовать безошибочности от интерпретации нечестно по отношению к обеим сторонам. 3 проверки я ставлю в список отдельно: вопрос вне базы знаний, просьба об условиях вне прайса, два разных запроса в одном сообщении. В список от заказчика они попадают редко - там проверяют, что агент умеет, а не как он ведёт себя на входе, которого не ждали.