DamiRocK

Cross-entropy бинарной нейросети = минус log-likelihood

Для наблюдений 0,1,1 и прогнозов p(theta,x_i) максимизация Bernoulli likelihood эквивалентна минимизации binary cross-entropy.

Условие

Нейросеть выдаёт p_i=p(θ,x_i)=P(y_i=1). Наблюдаются y=(0,1,1). Сравните целевую функцию максимального правдоподобия и cross-entropy.

Правдоподобие

При условной независимости бинарных наблюдений

L(θ)=(1−p₁)p₂p₃,

logL=ln(1−p₁)+lnp₂+lnp₃.

Cross-entropy

Средняя binary cross-entropy:

CE=−(1/3)Σ[y_i lnp_i+(1−y_i)ln(1−p_i)]

=−[ln(1−p₁)+lnp₂+lnp₃]/3.

Ответ источника

Функции отличаются знаком — и при использовании среднего дополнительно постоянным положительным множителем 1/n. Поэтому максимум log-likelihood и минимум cross-entropy имеют одни и те же оптимальные θ.

Равенство относится к Bernoulli cross-entropy с one-hot/0–1 метками и вероятностными выходами. Добавление регуляризации меняет полную целевую функцию, хотя data-fit часть остаётся той же.

Борис Демешев и участники · mlearn_pro, задача 87 · CC BY 4.0. Ответ источника сохранён; две функции выписаны явно.

Reading preferences

Appearance
Contrast
More options

Saved only in this browser. Your device’s reduced-motion setting is always respected. Browser zoom works throughout the site.