Модуль 1. Первая модель: от данных к прогнозу
Модуль 1 из 6 · 3 урока · ≈ 4 часа · Уровень: начальный
Инструменты: Python, pandas, scikit-learn, Google Colab
Первая модель: от данных к прогнозу
Каждый день агент по недвижимости отвечает на один и тот же вопрос: «Сколько стоит моя квартира?». Опытный агент отвечает по интуиции. Новичок ошибается на десятки тысяч долларов. Машинное обучение позволяет превратить опыт тысяч сделок в модель, которая называет обоснованную цену за секунду.
В этом модуле вы пройдёте весь путь создания ML-модели: от сырой таблицы объявлений до работающего прогноза. К концу модуля у вас будет первый проект для портфолио.
Чему вы научитесь
| Навык | Что это даёт на работе |
|---|---|
| Ставить бизнес-задачу как задачу ML | Понимать, где модель поможет, а где нет |
| Проводить разведочный анализ (EDA) | Находить ошибки и закономерности в данных до моделирования |
| Чистить данные: дубликаты, выбросы, пропуски | Модель учится на правде, а не на опечатках |
| Собирать pipeline в scikit-learn | Воспроизводимая обработка данных без ручных шагов |
| Строить baseline и первую модель | Доказывать ценность модели цифрами |
| Распознавать утечку данных и переобучение | Избегать двух самых дорогих ошибок в ML |
Кейс модуля: агентство недвижимости «BishkekDom»
BishkekDom работает во всех четырёх районах Бишкека. Руководитель хочет дать агентам инструмент, который прогнозирует цену квартиры при приёме объявления. У вас есть выгрузка из 1 500 объявлений за 2025–2026 годы.
Что есть в данных:
- Расположение: район (Октябрьский, Первомайский, Ленинский, Свердловский) и расстояние до центра.
- Дом: серия (104, 105, 106, элитка, индивидуалка), год постройки, этажность, тип отопления, парковка.
- Квартира: число комнат, площадь, этаж, состояние (ПСО, среднее, хорошее, евроремонт).
- Цена: цена в долларах США — то, что будем прогнозировать.
Как и в реальной работе, данные «грязные»: в них есть дубликаты, пропуски и ошибки ввода.
Уроки модуля
Урок 1.1. Что такое машинное обучение
Типы задач ML, признаки и целевая переменная, жизненный цикл модели. Ставим задачу BishkekDom.
Урок 1.2. EDA и подготовка данных
Ищем дубликаты, выбросы и пропуски. Кодируем категории, масштабируем числа, собираем ColumnTransformer.
Урок 1.3. Первая модель
Train/test split, baseline, линейная регрессия, метрика MAE. Две ловушки: утечка данных и переобучение.
Примеры задач модуля
- Найдите в данных объявления с ошибками ввода и решите, что с ними делать.
- Постройте модель и сравните её с baseline: на сколько процентов она точнее?
- Объясните руководителю BishkekDom, почему модель с MAE $2 900 хуже модели с MAE $5 800.
Что понадобится
- Аккаунт Google (для бесплатного Google Colab). Устанавливать ничего не нужно.
- Файлы модуля: module_1_files.zip (ноутбук
module_1_notebook_bishkekdom.ipynb+ данные) или отдельно bishkekdom_listings.csv. - Базовый Python и pandas. Если нужно освежить, пройдите Модуль 0.
Готовы построить свою первую модель? Начните с урока 1.1 — через час вы будете понимать, как работает любая ML-модель.
