Модуль 1. Первая модель: от данных к прогнозу

Модуль 1 из 6 · 3 урока · ≈ 4 часа · Уровень: начальный

Инструменты: Python, pandas, scikit-learn, Google Colab

Первая модель: от данных к прогнозу

Каждый день агент по недвижимости отвечает на один и тот же вопрос: «Сколько стоит моя квартира?». Опытный агент отвечает по интуиции. Новичок ошибается на десятки тысяч долларов. Машинное обучение позволяет превратить опыт тысяч сделок в модель, которая называет обоснованную цену за секунду.

В этом модуле вы пройдёте весь путь создания ML-модели: от сырой таблицы объявлений до работающего прогноза. К концу модуля у вас будет первый проект для портфолио.

Чему вы научитесь

Навык Что это даёт на работе
Ставить бизнес-задачу как задачу ML Понимать, где модель поможет, а где нет
Проводить разведочный анализ (EDA) Находить ошибки и закономерности в данных до моделирования
Чистить данные: дубликаты, выбросы, пропуски Модель учится на правде, а не на опечатках
Собирать pipeline в scikit-learn Воспроизводимая обработка данных без ручных шагов
Строить baseline и первую модель Доказывать ценность модели цифрами
Распознавать утечку данных и переобучение Избегать двух самых дорогих ошибок в ML

Кейс модуля: агентство недвижимости «BishkekDom»

BishkekDom работает во всех четырёх районах Бишкека. Руководитель хочет дать агентам инструмент, который прогнозирует цену квартиры при приёме объявления. У вас есть выгрузка из 1 500 объявлений за 2025–2026 годы.

Что есть в данных:

  • Расположение: район (Октябрьский, Первомайский, Ленинский, Свердловский) и расстояние до центра.
  • Дом: серия (104, 105, 106, элитка, индивидуалка), год постройки, этажность, тип отопления, парковка.
  • Квартира: число комнат, площадь, этаж, состояние (ПСО, среднее, хорошее, евроремонт).
  • Цена: цена в долларах США — то, что будем прогнозировать.

Как и в реальной работе, данные «грязные»: в них есть дубликаты, пропуски и ошибки ввода.

Уроки модуля

Урок 1.1. Что такое машинное обучение

Типы задач ML, признаки и целевая переменная, жизненный цикл модели. Ставим задачу BishkekDom.

Урок 1.2. EDA и подготовка данных

Ищем дубликаты, выбросы и пропуски. Кодируем категории, масштабируем числа, собираем ColumnTransformer.

Урок 1.3. Первая модель

Train/test split, baseline, линейная регрессия, метрика MAE. Две ловушки: утечка данных и переобучение.

Примеры задач модуля

  • Найдите в данных объявления с ошибками ввода и решите, что с ними делать.
  • Постройте модель и сравните её с baseline: на сколько процентов она точнее?
  • Объясните руководителю BishkekDom, почему модель с MAE $2 900 хуже модели с MAE $5 800.

Что понадобится

  • Аккаунт Google (для бесплатного Google Colab). Устанавливать ничего не нужно.
  • Файлы модуля: module_1_files.zip (ноутбук module_1_notebook_bishkekdom.ipynb + данные) или отдельно bishkekdom_listings.csv.
  • Базовый Python и pandas. Если нужно освежить, пройдите Модуль 0.

Готовы построить свою первую модель? Начните с урока 1.1 — через час вы будете понимать, как работает любая ML-модель.