Заказ закрыт
ML-модель для анализа и классификации строк

Бюджет: по договоренности
Нужен специалист по Machine Learning / анализу данных для работы с существующей SQLite-базой строк и разработки модели классификации.

Сейчас база содержит около 185000 строк. Пользователи работают через Excel, который используется как оболочка, сама база хранится в SQLite. Строки имеют специальный формат, например:

«под т6 ростом фп1ф8 вместе и о1т6 вместе и фп1 вниз о1 рост схождение и ф8т4 вместе и т6 вниз о1 рост схождение»

Строки разбиваются на признаки:
— ключи/обозначения (фп1, т6 и т.д.);
— слова (рост, вниз и т.д.);
— пары и комбинации признаков.

Необходимо:

1. Найти скрытые закономерности и паттерны в данных.
2. Определить, какие признаки и комбинации отвечают за определённые типы строк.
3. Разработать ML-модель для классификации новых строк, которых ещё нет в базе.
4. Рассмотреть разные подходы и архитектуры моделей, а не ограничиваться текущей реализацией.

Что уже сделано:
— реализована SQLite-база;
— есть алгоритм подсчёта комбинаций;
— база интегрирована с Excel;
— предпринимались попытки обучения моделей на CatBoost, включая разные варианты архитектур.

Текущий результат не устраивает:
— низкая точность классификации по части классов;
— некоторые классы модель практически не различает;
— есть подозрение, что текущий подход с бинарными моделями реализован неверно.

Классы и данные уже размечаются человеком после получения обратной связи. После этого строки добавляются в базу и участвуют в дальнейшем обучении и перерасчёте.

Задача связана с прогнозированием и использованием результатов для принятия финансовых решений, поэтому приоритет — максимально возможная точность модели, а не просто базовая реализация.

Дополнительные файлы, текущие наработки, логи моделей, примеры базы, часть ТЗ и доступ к коду/SQLite готовы предоставить исполнителю после обсуждения деталей.
Опубликован 29.05.2026 в 09:13
Заказ находится в архиве

Выберите способ верификации:

Обновите страницу после прохождения верификации.