Чтобы построить лучший линейный прогноз, не обязательно знать всё совместное распределение. Достаточно первых и вторых моментов. Но результат оптимален среди прямых, а не автоматически среди любых функций наблюдения.
b*=Cov(X,Y)/Var(X); a*=E[Y]−b*E[X]
Условие
Наблюдается X, а Y неизвестна. Известно E(X) = 2, E(Y) = 3, Var(X) = 3, Var(Y) = 8, Cov(X, Y) = −3. Нужно выбрать прогноз Ŷ = aX + b, минимизирующий E[(Y − Ŷ)²].
В источнике решение не заполнено; ниже — редакционный вывод.
Сначала находим свободный член
Разложим среднюю квадратичную ошибку на дисперсию ошибки и квадрат её среднего. При фиксированном a дисперсия не зависит от b, а среднее равно 3 − 2a − b.
Минимум квадрата достигается при нулевом среднем ошибки, поэтому b = 3 − 2a. Прямая прогноза обязательно проходит через точку средних (2; 3).
Затем находим наклон
При найденном b ошибка центрирована, и её средний квадрат равен:
Var(Y − aX) = 8 + 3a² − 2a · (−3) = 3(a + 1)² + 5.
Квадрат неотрицателен и обращается в ноль при a = −1. Тогда b = 5. Получаем:
Ŷ = 5 − X; минимальная средняя квадратичная ошибка = 5.
Если игнорировать X и всегда прогнозировать среднее 3, ошибка составит Var(Y) = 8. Наблюдение X уменьшает минимальную линейную ошибку на 3.
Проверка остатка
Остаток R = Y − Ŷ = Y + X − 5 имеет E(R) = 3 + 2 − 5 = 0. Его ковариация с наблюдением:
Cov(R, X) = Cov(Y, X) + Var(X) = −3 + 3 = 0.
Ортогональность остатка константам и X означает, что добавление ещё одного линейного поправочного члена не может уменьшить ошибку.
Общая формула и её границы
При конечных вторых моментах и Var(X) > 0 лучший линейный наклон равен Cov(X, Y)/Var(X), а свободный член — E(Y) минус наклон, умноженный на E(X).
Не следует без дополнительных предпосылок объявлять 5 − X условным ожиданием E(Y | X). Условное ожидание оптимально среди всех квадратично интегрируемых функций X и может быть нелинейным. Из одних заданных моментов его вид не определяется.
Б. Демешев и участники · probability_pro, 16.10 · CC BY 4.0. Условие адаптировано; решение редакции.