K_ij=exp(−γ||x_i−x_j||²); γ→∞ ⇒ K→I
Задача источника
Есть 100 единичных взаимно ортогональных «иголок», 42 из них помечены повреждёнными. Можно ли при любом расположении меток провести гиперплоскость, отделяющую повреждённые от целых? И почему Gaussian kernel при достаточно большом γ способен разделить практически любую конечную выборку различных точек?
Ответ источника
Да в обоих случаях.
Явная гиперплоскость
Представим иголки стандартными базисными векторами e₁,…,e₁₀₀. Зададим wᵢ=+1 для повреждённой иголки и wᵢ=−1 для целой. Тогда
wᵀeᵢ=wᵢ∈{−1,+1}.
Гиперплоскость wᵀx=0 идеально разделяет любые назначенные метки.
Gaussian kernel
K(x,x′)=exp(−γ||x−x′||²). Для различных xᵢ при γ→∞ диагональные элементы Gram-матрицы остаются 1, а внедиагональные стремятся к 0. Значит, K→I.
Feature-векторы становятся почти ортогональными, и конечную произвольную разметку можно реализовать линейной функцией в этом пространстве при достаточно большом γ, если Gram-матрица остаётся невырожденной.
Исключение
Совпадающие входы с противоречащими метками разделить невозможно: kernel отображает один и тот же x в один и тот же feature-вектор. Именно это исключение подразумевает формулировка источника.
Практический смысл
Способность идеально разделить training set не означает хороший прогноз. Слишком большой γ делает RBF-модель локальной и может резко повысить variance, поэтому параметр выбирают по вневыборочному критерию.
Борис Демешев и участники · mlearn_pro, задача 62 · CC BY 4.0. Оба ответа источника сохранены; линейная конструкция и Gram-предел развёрнуты.