Классификация и оценка вероятности события на Python

Ссылка на работу
image image image
Демонстрационный Data Science-проект по прогнозированию успешного исхода события на примере посадки первой ступени ракеты SpaceX. Выполнен полный цикл работы с данными: сбор через API и веб-источники, очистка и преобразование, исследовательский анализ, подготовка признаков, стандартизация и разделение выборки на обучающую и тестовую. Построены и сравнены четыре модели классификации: Logistic Regression, SVM, Decision Tree и KNN. Для каждой модели выполнен подбор гиперпараметров с помощью GridSearchCV и 10-кратной кросс-валидации. Лучший результат на кросс-валидации показало дерево решений — около 87,7%. Точность на тестовой выборке составила 83,3%. Качество модели дополнительно проверено по матрице ошибок. Результаты оформлены в Jupyter Notebook и презентации с описанием методологии, анализа данных и сравнения алгоритмов. Использованы Python, Pandas, NumPy, Scikit-learn, Matplotlib, Seaborn, Plotly и Jupyter Notebook. Такой подход применяется в задачах классификации клиентов, заявок, операций и других событий, где требуется определить класс результата по имеющимся признакам.
https://github.com/tina-ds/Applied-Data-Science-Capstone