Машинное обучение для анализа данных

Курс «Анализ данных с машинным обучением»

Строим модели, которые прогнозируют, на реальных кейсах компаний Кыргызстана

Для кого: аналитики, выпускники курса SQL DATUM, сотрудники банков, телекома, ритейла и госсектора, студенты экономических и IT-направлений.
Требования: базовый Python и pandas. Вводный модуль-разминка входит в курс.
Формат: 6 модулей, 18 уроков, видео, практика в Google Colab (без установки), квизы, задания, финальный экзамен и проект.
Стоимость: 20 000 сом (единоразово) + регулярные очные консультации для всех студентов.

Результаты курса

После курса вы сможете:

  • поставить бизнес-задачу как задачу ML и выбрать метрику;
  • подготовить данные и собрать pipeline в scikit-learn;
  • строить и сравнивать модели регрессии, классификации и кластеризации;
  • объяснить модель руководителю (SHAP, важность признаков);
  • показать в портфолио 6 проектов на локальных данных.

Программа

Модуль 0. Разминка: Python и pandas для ML (необязательный)

Модуль 1. Первая модель: от данных к прогнозу
Кейс: агентство недвижимости «BishkekDom»

  • 1.1 Что такое ML: задачи, типы обучения, жизненный цикл модели
  • 1.2 EDA и подготовка данных: пропуски, выбросы, кодирование, масштабирование
  • 1.3 Первая модель и train/test split; утечка данных и переобучение

Модуль 2. Регрессия: прогнозируем числа
Кейс: энергокомпания «ЭнергоСбыт KG» — прогноз потребления

  • 2.1 Линейная регрессия и интерпретация коэффициентов
  • 2.2 Метрики MAE, RMSE, R²; регуляризация Ridge/Lasso
  • 2.3 Feature engineering и Pipeline

Модуль 3. Классификация: да или нет?
Кейс: МФО «Капитал Кредит» — кредитный скоринг

  • 3.1 Логистическая регрессия и kNN
  • 3.2 Матрица ошибок, precision/recall, ROC-AUC
  • 3.3 Дисбаланс классов и выбор порога по стоимости ошибки

Модуль 4. Деревья, ансамбли и настройка моделей
Кейс: телеком «MegaCell» — прогноз оттока клиентов

  • 4.1 Деревья решений и Random Forest
  • 4.2 Градиентный бустинг (CatBoost/LightGBM)
  • 4.3 Кросс-валидация и подбор гиперпараметров

Модуль 5. Обучение без учителя
Кейс: сеть «Народный» — сегментация покупателей

  • 5.1 K-means и выбор числа кластеров
  • 5.2 Иерархическая кластеризация и PCA
  • 5.3 Превращаем сегменты в маркетинговые решения

Модуль 6. Финальный проект: от модели к бизнесу
Кейс: «Ала-Тоо Страхование» — прогноз страховых убытков

  • 6.1 Интерпретация моделей: SHAP и важность признаков
  • 6.2 Ответственный ML: смещение, справедливость, ИИ-ассистенты в работе
  • 6.3 Проект под ключ: модель, бизнес-меморандум, демо в Streamlit
  • Финальный экзамен: 25 вопросов

Каждый модуль включает

Вводную страницу с кейсом, 3 урока (видео + ноутбук Colab), квиз LearnDash, практическое задание и датасет компании.

Сертификат

Выдаётся после сдачи экзамена и защиты финального проекта.

Программа курса

Модуль 2. Регрессия: прогнозируем числа
4 Темы
1 Тест
2.1 Линейная регрессия изнутри: МНК, множественная регрессия, коэффициенты
2.2 Метрики и регуляризация: MAE, RMSE, R², Ridge и Lasso
2.3 Feature engineering: пороговые признаки и взаимодействия
2.4 Практическое задание модуля 2
Квиз. Модуль 2: Регрессия
Модуль 3. Классификация: да или нет?
4 Темы
1 Тест
3.1 Логистическая регрессия и kNN: вероятности и отношения шансов
3.2 Метрики классификации: матрица ошибок, precision, recall, ROC-AUC
3.3 Дисбаланс классов и выбор порога: стоимость ошибок и кривая прибыли
3.4 Практическое задание модуля 3
Квиз. Модуль 3: Классификация
Модуль 4. Деревья, ансамбли и настройка моделей
4 Темы
1 Тест
4.1 Деревья решений и Random Forest: правила, переобучение, важность признаков
4.2 Градиентный бустинг: LightGBM, кривая обучения и ранняя остановка
4.3 Кросс-валидация и подбор гиперпараметров: RandomizedSearchCV, lift и прибыль
4.4 Практическое задание модуля 4
Квиз. Модуль 4: Деревья, ансамбли и настройка моделей
Модуль 5. Обучение без учителя: сегментация покупателей
4 Темы
1 Тест
5.1 K-means и выбор числа кластеров: RFM, метод локтя и силуэт
5.2 Иерархическая кластеризация и PCA: дендрограмма, ARI, главные компоненты
5.3 Превращаем сегменты в решения: профили, имена, правила и план действий
5.4 Практическое задание модуля 5
Квиз. Модуль 5: Обучение без учителя
Модуль 6. Финальный проект: от модели к бизнесу
4 Темы
6.1 Интерпретация моделей: SHAP
6.2 Ответственный ML: защищённые признаки, прокси и справедливость
6.3 Проект под ключ: тариф по риску, меморандум и Streamlit
6.4 Финальный проект курса
Final Тест
Финальный экзамен. Машинное обучение для анализа данных