Нужен специалист по Machine Learning / анализу данных для работы с существующей SQLite-базой строк и разработки модели классификации.
Сейчас база содержит около 185000 строк. Пользователи работают через Excel, который используется как оболочка, сама база хранится в SQLite. Строки имеют специальный формат, например:
«под т6 ростом фп1ф8 вместе и о1т6 вместе и фп1 вниз о1 рост схождение и ф8т4 вместе и т6 вниз о1 рост схождение»
Строки разбиваются на признаки:
— ключи/обозначения (фп1, т6 и т.д.);
— слова (рост, вниз и т.д.);
— пары и комбинации признаков.
Необходимо:
1. Найти скрытые закономерности и паттерны в данных.
2. Определить, какие признаки и комбинации отвечают за определённые типы строк.
3. Разработать ML-модель для классификации новых строк, которых ещё нет в базе.
4. Рассмотреть разные подходы и архитектуры моделей, а не ограничиваться текущей реализацией.
Что уже сделано:
— реализована SQLite-база;
— есть алгоритм подсчёта комбинаций;
— база интегрирована с Excel;
— предпринимались попытки обучения моделей на CatBoost, включая разные варианты архитектур.
Текущий результат не устраивает:
— низкая точность классификации по части классов;
— некоторые классы модель практически не различает;
— есть подозрение, что текущий подход с бинарными моделями реализован неверно.
Классы и данные уже размечаются человеком после получения обратной связи. После этого строки добавляются в базу и участвуют в дальнейшем обучении и перерасчёте.
Задача связана с прогнозированием и использованием результатов для принятия финансовых решений, поэтому приоритет — максимально возможная точность модели, а не просто базовая реализация.
Дополнительные файлы, текущие наработки, логи моделей, примеры базы, часть ТЗ и доступ к коду/SQLite готовы предоставить исполнителю после обсуждения деталей.
Опубликован 29.05.2026 в 09:13
Заказ находится в архиве