Демонстрационный Data Science-проект по прогнозированию успешного исхода события на примере посадки первой ступени ракеты SpaceX.
Выполнен полный цикл работы с данными: сбор через API и веб-источники, очистка и преобразование, исследовательский анализ, подготовка признаков, стандартизация и разделение выборки на обучающую и тестовую.
Построены и сравнены четыре модели классификации: Logistic Regression, SVM, Decision Tree и KNN. Для каждой модели выполнен подбор гиперпараметров с помощью GridSearchCV и 10-кратной кросс-валидации. Лучший результат на кросс-валидации показало дерево решений — около 87,7%. Точность на тестовой выборке составила 83,3%.
Качество модели дополнительно проверено по матрице ошибок. Результаты оформлены в Jupyter Notebook и презентации с описанием методологии, анализа данных и сравнения алгоритмов.
Использованы Python, Pandas, NumPy, Scikit-learn, Matplotlib, Seaborn, Plotly и Jupyter Notebook.
Такой подход применяется в задачах классификации клиентов, заявок, операций и других событий, где требуется определить класс результата по имеющимся признакам.
https://github.com/tina-ds/Applied-Data-Science-Capstone