DamiRocK

Gradient boosting для squared loss: первый residual-step

Для y=(2,4,8), начального постоянного прогноза 14/3 residuals=(-8/3,-2/3,10/3). Следующее дерево учится предсказывать именно их.

Задача

Squared-loss gradient boosting начинается с лучшего постоянного прогноза для y=(2,4,8). Найдите initial prediction и pseudo-residuals.

Начальная константа

Для squared loss лучшая константа — среднее:

F₀=14/3≈4,6667.

Negative gradients

Для L=(1/2)(y−F)² negative gradient равен y−F. Поэтому residuals:

(−8/3, −2/3, 10/3).

Следующий learner

Новое дерево/модель обучается приближать эти residuals по признакам. После этого ensemble обновляется F₁=F₀+ηh₁(x).

Learning rate

η<1 уменьшает размер каждого шага и часто требует больше деревьев, но может улучшать generalization. Gradient boosting не «исправляет» residuals полностью одним деревом, если base learner ограничен по глубине.

Редакционная практика по gradient boosting в тематике mlearn_pro · CC BY 4.0.

Reading preferences

Appearance
Contrast
More options

Saved only in this browser. Your device’s reduced-motion setting is always respected. Browser zoom works throughout the site.