Поделиться в MAX

Курс "Специалист по искусственному интеллекту". Урок 7. Выбросы, кодирование категорий, визуализация данных

Аватар автора
Леонид Лукин
Седьмой урок курса «Специалист по искусственному интеллекту». Подробно разбираем математический метод очистки выбросов IQR, особенности кодирования категорий (Label Encoding vs One-Hot Encoding), боремся с «проклятием размерности» и проводим продвинутую визуализацию (jointplot, pairplot) в Seaborn. В этой лекции мы подробно обсудим: – Понятие выбросов (Outliers) и их влияние на качество обучения (почему выбросы критически вредят весам линейных моделей). – Эффект Билла Гейтса в баре: разницу между средним арифметическим и медианой в статистике. – Как визуализировать выбросы с помощью графиков Box Plot («ящик с усами»). – Математический метод IQR (межквартильного размаха): расчет границ нормального распределения. – Реализацию итеративного алгоритма очистки выбросов стоимости жилья по категориям комнат. – Категориальные признаки: почему машины понимают только числа и как оцифровать текст. – Метод Label Encoding (Порядковое кодирование): когда его уместно использовать и почему он создает ложную иерархию на номинальных данных. – Метод One-Hot Encoding (дамми-кодирование) и его преимущества. – Понятие «проклятия размерности» (Curse of Dimensionality) как главного недостатка OHE-кодирования. – Практическую реализацию дамми-кодирования в Pandas при помощи метода pd.get_dummies(). – Зачем отбрасывать первый признак (параметр drop_first=True) и как это борется с избыточностью информации (мультиколлинеарностью). – Финальную очистку и экспорт подготовленного датасета в файл...

0/0


0/0

0/0

0/0

0/0