Заказчик прислал архив сканов со своей разметкой и спросил, какая у его распознавателя точность и сколько будет стоить её поднять.
Первое, что я проверил, - не модель, а саму разметку. Во всех 110 спорных строках «правильный ответ» оказался копией того, что выдал один из движков. По такому набору точность не считается вообще: сравнивать модель не с чем, любая цифра будет выдумкой. Заказчик про это не знал.
Дальше стало видно, почему движки спорят. Мелкий скан с фоновым узором не читается ни машиной, ни человеком, пока картинку не почистить: медианный фильтр гасит узор, отклонение от цвета фона даёт маску цифры, автоконтраст и увеличение делают штрих читаемым. После чистки спорные места разбираются глазами и становится ясно, где ошибается движок, а где метка.
Что получил заказчик: разбор с цифрами и понятный первый шаг - сначала собрать настоящую разметку по сотне строк, а потом уже мерить и улучшать модель. Тратить деньги на дообучение по сломанному эталону смысла нет.
Имя заказчика и его файлы не показываю: работа шла по закрытому архиву.