Задача
Squared-loss gradient boosting начинается с лучшего постоянного прогноза для y=(2,4,8). Найдите initial prediction и pseudo-residuals.
Начальная константа
Для squared loss лучшая константа — среднее:
F₀=14/3≈4,6667.
Negative gradients
Для L=(1/2)(y−F)² negative gradient равен y−F. Поэтому residuals:
(−8/3, −2/3, 10/3).
Следующий learner
Новое дерево/модель обучается приближать эти residuals по признакам. После этого ensemble обновляется F₁=F₀+ηh₁(x).
Learning rate
η<1 уменьшает размер каждого шага и часто требует больше деревьев, но может улучшать generalization. Gradient boosting не «исправляет» residuals полностью одним деревом, если base learner ограничен по глубине.
Редакционная практика по gradient boosting в тематике mlearn_pro · CC BY 4.0.