DamiRocK

Одинаковые классы, разные вероятности: accuracy не проверяет калибровку

Две модели могут давать один и тот же бинарный прогноз при пороге 0,5, но сильно различаться log-loss, Brier score и калибровкой вероятностей.

Идея задачи

Два классификатора для каждого объекта могут выдавать вероятности по одну сторону порога 0,5 и поэтому принимать одинаковые решения о классе. Означает ли это одинаковое качество вероятностных прогнозов?

Ответ источника

Нет. Совпадение классов не означает совпадения оценённых вероятностей или их калибровки.

Почему accuracy может быть одинаковой

Пороговая метрика видит только знак p−0,5. Вероятности 0,51 и 0,99 обе превращаются в класс 1, хотя выражают совершенно разную уверенность.

Proper scoring rules используют величину p

Для положительного исхода log-loss равна −ln p, Brier loss — (1−p)². Уверенный правильный прогноз 0,99 получает меньшую потерю, чем 0,51. Но если истинный класс 0, чрезмерно уверенные 0,99 будут наказаны гораздо сильнее.

Калибровка

Если среди объектов с прогнозом около 0,8 примерно 80% действительно положительны, такой прогноз калиброван в этом диапазоне. Accuracy сама по себе эту характеристику не измеряет.

Выбор метрики зависит от задачи: когда важны только решения при конкретном пороге, threshold-метрики уместны; когда вероятности идут в последующие решения, нужно оценивать и вероятность, а не только класс.

Борис Демешев и участники · mlearn_pro, задача 133 · CC BY 4.0. Качественный ответ источника сохранён; метрики пояснены.

Reading preferences

Appearance
Contrast
More options

Saved only in this browser. Your device’s reduced-motion setting is always respected. Browser zoom works throughout the site.