Перечень вопросов
- Что изучает эконометрика и чем зависимость отличается от причинности?
- Как записать линейную модель и отличить ошибку от остатка?
- Как выводятся оценки парной регрессии?
- Как устроен МНК в матричной форме?
- Почему важен полный ранг матрицы регрессоров?
- Что означает экзогенность?
- Что утверждает теорема Гаусса — Маркова?
- Для чего нужна нормальность ошибок?
- Как оценить дисперсию ошибок и стандартные ошибки коэффициентов?
- Как провести t-тест и построить доверительный интервал?
- Как проверить несколько линейных ограничений F-тестом?
- Как интерпретировать R² и скорректированный R²?
- Как интерпретировать коэффициенты при логарифмах?
- Как использовать фиктивные переменные?
- Что показывает взаимодействие регрессоров?
- Что утверждает теорема Фриша — Во — Ловелла?
- Как возникает смещение из-за пропущенной переменной?
- Что такое мультиколлинеарность и VIF?
- Как гетероскедастичность меняет свойства МНК?
- Что исправляют робастные стандартные ошибки?
- Почему важна автокорреляция ошибок?
- Чем GLS и WLS отличаются от МНК?
- Что такое эндогенность?
- Каким условиям должна удовлетворять инструментальная переменная?
- Как работает двухшаговый МНК?
- Как сравнивать спецификации и использовать тест Чоу?
- Чем интервал прогноза отличается от интервала среднего?
- Как выглядит содержательная проверка модели?
Ответы к экзамену
1. Что изучает эконометрика и чем зависимость отличается от причинности?
Эконометрика оценивает количественные связи по данным и проверяет гипотезы о моделях. Регрессия может описывать условное среднее E(y|x), но её коэффициент не становится причинным эффектом автоматически. Для причинного вывода нужен обоснованный механизм идентификации: например, рандомизация или допустимый инструмент. Большой R² и маленькое p-значение не устраняют обратную причинность и пропущенные факторы.
2. Как записать линейную модель и отличить ошибку от остатка?
Модель yᵢ=xᵢᵀβ+uᵢ линейна по параметрам β. В x могут входить квадраты и логарифмы исходных переменных. Ошибка uᵢ — ненаблюдаемое отклонение от модели с истинным β. Остаток ûᵢ=yᵢ−xᵢᵀβ̂ вычисляется после оценивания. У остатков есть алгебраические ограничения МНК, поэтому их свойства нельзя безоговорочно переносить на истинные ошибки.
3. Как выводятся оценки парной регрессии?
Для yᵢ=α+βxᵢ+uᵢ МНК минимизирует Σ(yᵢ−α−βxᵢ)². Если Σ(xᵢ−x̄)²>0, получаем β̂=Σ(xᵢ−x̄)(yᵢ−ȳ)/Σ(xᵢ−x̄)² и α̂=ȳ−β̂x̄. Прямая проходит через (x̄,ȳ). При одинаковых x наклон отдельно от константы не определяется: знаменатель равен нулю.
4. Как устроен МНК в матричной форме?
Для y=Xβ+u при полном столбцовом ранге X оценка β̂=(XᵀX)⁻¹Xᵀy. Нормальные уравнения Xᵀ(y−Xβ̂)=0 означают ортогональность остатков всем столбцам X. Прогноз ŷ — ортогональная проекция y на пространство столбцов. Если столбец единиц есть в X, сумма остатков равна нулю. Это результат минимизации, а не доказательство экзогенности.
5. Почему важен полный ранг матрицы регрессоров?
Полный ранг означает отсутствие точной линейной зависимости между столбцами X. Тогда XᵀX обратима и коэффициенты МНК определены однозначно. Если один признак — точная комбинация других, индивидуальные коэффициенты не идентифицированы. При этом прогнозы на обучающих данных могут быть однозначными. Удаление лишнего столбца или изменение параметризации решает точную зависимость, но не доказывает содержательную правильность модели.
6. Что означает экзогенность?
Для условной несмещённости МНК достаточно E(u|X)=0: ошибки имеют нулевое среднее при заданной всей матрице регрессоров. Для состоятельности в подходящей модели случайной выборки используют момент E(xᵢuᵢ)=0, регулярность и невырожденность E(xᵢxᵢᵀ). Это разные уровни предпосылок. Равенство Xᵀû=0 проверяется алгебраически для любой МНК-регрессии и не подтверждает экзогенность истинного u.
7. Что утверждает теорема Гаусса — Маркова?
При модели y=Xβ+u, полном ранге X, E(u|X)=0 и Var(u|X)=σ²I оценка МНК — лучшая линейная несмещённая оценка условно на X. «Лучшая» означает минимальную ковариационную матрицу в этом классе. Нормальность ошибок не требуется. Теорема не говорит о превосходстве над всеми смещёнными или нелинейными оценками и не обеспечивает причинную интерпретацию β.
8. Для чего нужна нормальность ошибок?
При условно нормальных ошибках с ковариацией σ²I стандартизованные оценки дают точные t- и F-распределения в конечной выборке. Без нормальности МНК может оставаться несмещённым и эффективным в смысле Гаусса — Маркова; для статистического вывода часто используют асимптотику. Нормальность остатков на графике не заменяет проверку экзогенности, независимости и правильной спецификации.
9. Как оценить дисперсию ошибок и стандартные ошибки коэффициентов?
При n наблюдениях и k оцениваемых коэффициентах, включая константу, классическая оценка s²=Σûᵢ²/(n−k). Матрица оценённых дисперсий β̂ равна s²(XᵀX)⁻¹; стандартная ошибка коэффициента — квадратный корень диагонального элемента. Формулы требуют классической ковариационной структуры. Деление на n вместо n−k даёт другую оценку и занижает несмещённую оценку дисперсии в конечной выборке.
10. Как провести t-тест и построить доверительный интервал?
Для H₀:βⱼ=b₀ статистика t=(β̂ⱼ−b₀)/se(β̂ⱼ). В классической нормальной модели её сравнивают с t(n−k); двусторонний интервал уровня 1−α равен β̂ⱼ±t₁₋α/₂·se. Односторонний тест использует другую критическую область. Неотвержение H₀ не доказывает её истинность. Доверительный уровень относится к покрытию процедуры в повторных выборках, а не к вероятности фиксированного параметра после расчёта.
11. Как проверить несколько линейных ограничений F-тестом?
Пусть H₀:Rβ=r содержит q независимых ограничений. В нормальной гомоскедастичной модели F=[(SSRᵣ−SSRᵤ)/q]/[SSRᵤ/(n−kᵤ)] имеет распределение F(q,n−kᵤ) при H₀. Модели должны быть вложены и оценены на одной выборке с одной зависимой переменной. Несколько отдельных t-тестов не заменяют совместный тест. При робастной ковариации применяют соответствующий тест Вальда.
12. Как интерпретировать R² и скорректированный R²?
Для МНК с константой R²=1−SSR/TSS, где TSS=Σ(yᵢ−ȳ)²>0; тогда 0≤R²≤1. Добавление регрессора не уменьшает R² на той же выборке. Скорректированный показатель равен 1−[SSR/(n−k)]/[TSS/(n−1)] и может уменьшиться. Без константы центрированное R² может быть отрицательным. Высокий показатель не доказывает причинность и не гарантирует прогноз на новых данных.
13. Как интерпретировать коэффициенты при логарифмах?
В модели y=α+βx+u коэффициент показывает изменение условного среднего y при увеличении x на единицу. В log y=α+βx+u изменение x на Δ даёт множитель eᵝΔ для условной геометрической характеристики; 100β% — локальное приближение при Δ=1. В log y=α+β log x+u коэффициент — эластичность. Возврат от прогноза log y к среднему y требует учёта распределения ошибки; простое экспоненцирование даёт не всегда условное среднее.
14. Как использовать фиктивные переменные?
Бинарный индикатор D с коэффициентом δ в модели y=α+δD+… сдвигает условное среднее относительно базовой группы. Для категориального признака с m уровнями и константой включают обычно m−1 индикаторов. Все m индикаторов вместе с константой образуют точную линейную зависимость. Выбор базовой группы меняет запись коэффициентов, но не fitted values при эквивалентной параметризации.
15. Что показывает взаимодействие регрессоров?
В модели y=α+βx+δD+γxD+u наклон по x равен β при D=0 и β+γ при D=1. Разница между группами при данном x равна δ+γx. Коэффициент γ проверяет различие наклонов, а δ — различие при x=0. Если ноль x не имеет содержательного смысла, центрирование делает интерпретацию константы и δ удобнее, не меняя прогнозов.
16. Что утверждает теорема Фриша — Во — Ловелла?
В регрессии y на интересующий признак x и контрольные столбцы C коэффициент x равен коэффициенту регрессии остатка y после проекции на C на остаток x после той же проекции. Остаточную регрессию записывают без дополнительной константы, если константа уже входила в C. Теорема — точное алгебраическое равенство; она не гарантирует, что выбранные контроли устраняют эндогенность.
17. Как возникает смещение из-за пропущенной переменной?
Если истинная модель y=α+βx+γz+u, а z пропущена, при стандартных условиях предельный наклон короткой регрессии равен β+γCov(x,z)/Var(x). Смещение зависит и от влияния z на y, и от её связи с x. Если одна из этих составляющих нулевая, соответствующего смещения нет. Знак нельзя определить только по знаку γ. Добавлять любой доступный контроль тоже неверно: некоторые контроли меняют причинную постановку.
18. Что такое мультиколлинеарность и VIF?
Точная коллинеарность нарушает ранг. Сильная, но неточная, связь регрессоров повышает дисперсии оценок, не создавая сама по себе смещения при экзогенности. Для регрессора j VIFⱼ=1/(1−Rⱼ²), где Rⱼ² получено из его вспомогательной регрессии на остальные регрессоры с константой. Большой VIF — сигнал неточной индивидуальной оценки, а не автоматическое основание удалить содержательно важный фактор.
19. Как гетероскедастичность меняет свойства МНК?
При гетероскедастичности Var(uᵢ|X) зависит от наблюдения. Если E(u|X)=0, коэффициенты МНК остаются условно несмещёнными, но классическая формула их ковариации обычно неверна и эффективность Гаусса — Маркова теряется. Остаточные графики и тесты Бройша — Пагана или Уайта помогают диагностике. Сам факт изменения разброса не доказывает, что нарушена экзогенность.
20. Что исправляют робастные стандартные ошибки?
Гетероскедастически робастная ковариация имеет форму (XᵀX)⁻¹[Σxᵢxᵢᵀûᵢ²](XᵀX)⁻¹ с возможными поправками. Она меняет стандартные ошибки и тесты, сохраняя сами коэффициенты МНК. Надёжность обычно асимптотическая при подходящих условиях. При кластерной зависимости нужны кластерные ошибки; обычные HC-ошибки не устраняют произвольную зависимость наблюдений и не исправляют эндогенность.
21. Почему важна автокорреляция ошибок?
Если ошибки разных периодов коррелируют, матрица Var(u|X) имеет ненулевые внедиагональные элементы. При строгой экзогенности МНК может сохранять несмещённость, но классические стандартные ошибки ненадёжны. HAC-оценки учитывают временную зависимость и гетероскедастичность в рамках своих условий. При лаговой зависимой переменной и автокоррелированных ошибках экзогенность может нарушаться; тогда исправления ковариации недостаточно.
22. Чем GLS и WLS отличаются от МНК?
При известной положительно определённой Ω=Var(u|X)/σ² обобщённый МНК равен (XᵀΩ⁻¹X)⁻¹XᵀΩ⁻¹y. WLS — частный случай диагональной Ω: наблюдения взвешивают обратно пропорционально их дисперсиям. Если Ω оценивается, получается feasible GLS, свойства которого зависят от качества модели ковариации. Нельзя выбирать веса только для получения желаемой значимости коэффициентов.
23. Что такое эндогенность?
Эндогенность означает связь регрессора с ошибкой, например E(xᵢuᵢ)≠0. Причины: пропущенные общие факторы, обратная причинность, некоторые ошибки измерения и отбор выборки. Тогда МНК обычно несостоятелен для нужного структурного параметра. Увеличение выборки делает оценку точнее вокруг неверного предела. Робастные стандартные ошибки исправляют оценку неопределённости, но не идентификацию.
24. Каким условиям должна удовлетворять инструментальная переменная?
Инструмент z должен быть релевантен: иметь достаточную связь с эндогенным регрессором; и допустим: удовлетворять исключению и моменту E(zu)=0 в выбранной структурной модели. Во второй части нельзя ограничиться одной корреляционной таблицей — нужна содержательная аргументация. В простом случае с константой β̂IV=выборочная Cov(z,y)/Cov(z,x). Малый знаменатель означает слабый инструмент и нестабильный вывод.
25. Как работает двухшаговый МНК?
Сначала эндогенные регрессоры проектируют на все инструменты и экзогенные регрессоры модели. Затем структурную зависимую переменную регрессируют на полученные прогнозы и экзогенные переменные. При выполнении условий идентификации это 2SLS. Стандартные ошибки нельзя брать как для обычной второй МНК-регрессии: нужна ковариация IV/2SLS. Релевантность каждого инструмента по отдельности не заменяет нужное ранговое условие для нескольких эндогенных регрессоров.
26. Как сравнивать спецификации и использовать тест Чоу?
Для вложенных моделей на одной выборке используют совместный тест ограничений. Тест Чоу для заранее заданных групп проверяет равенство коэффициентов при предпосылках классического F-теста, включая одинаковую дисперсию ошибок для стандартной версии. Модели с разными зависимыми переменными или разными выборками нельзя сравнивать обычным R² напрямую. Прогнозное качество оценивают на данных, не использованных для подбора.
27. Чем интервал прогноза отличается от интервала среднего?
Для нового x₀ оценка среднего равна x₀ᵀβ̂. Её дисперсия в классической модели — σ²x₀ᵀ(XᵀX)⁻¹x₀. Для нового наблюдения добавляется дисперсия новой ошибки σ², поэтому предиктивный интервал шире. Это требует соответствующей независимости и корректной модели. Экстраполяция далеко за область наблюдаемых x может быть ненадёжной даже при узком вычисленном интервале.
28. Как выглядит содержательная проверка модели?
Проверьте единицы измерения, выборку, пропуски, функциональную форму, ранг и предполагаемый механизм экзогенности. Затем изучите остатки, неопределённость оценок, устойчивость к разумным спецификациям и качество на отложенных данных. Разделяйте описание, прогноз и причинный вывод: они требуют разных проверок. Набор «все тесты не отвергают» не является доказательством истинности модели; тесты могут иметь низкую мощность.
Разобранный пример и проверка
| x | y |
|---|---|
| 0 | 1 |
| 1 | 2 |
| 2 | 2 |
| 3 | 4 |
| 4 | 6 |
Для парной регрессии с константой x̄=2, ȳ=3, Σ(x−x̄)²=10, Σ(x−x̄)(y−ȳ)=12. Получаем β̂=6/5=1,2, α̂=3/5=0,6; прогноз ŷ=0,6+1,2x. Остатки: 2/5,1/5,−1,−1/5,3/5. Их сумма и сумма xᵢûᵢ равны нулю.
SSR=8/5=1,6, TSS=16, R²=9/10=0,9. При n=5,k=2 имеем s²=8/15 и se(β̂)=√(4/75)≈0,23094. Если дополнительно принять нормальные независимые гомоскедастичные ошибки и условную экзогенность, 95%-й интервал наклона использует t(3)≈3,18245: 1,2±0,73495, то есть примерно [0,465;1,935]. Эти предпосылки нельзя подтвердить пятью числами из таблицы.
Все оценки, остатки, SSR и R² проверены точной рациональной арифметикой; квантиль t(3) проверен через его функцию распределения. Высокое R² в этом учебном наборе не доказывает причинного влияния x на y.
Как готовить устный ответ
Сначала сформулируйте определение и условия результата. Затем объясните, зачем он нужен, приведите короткий пример и назовите типичную ошибку. Формулу проверяйте на простом или граничном случае. У преподавателя может быть другой перечень тем; сопоставьте его с оглавлением этой страницы.
Источники тематического охвата
Перечень вопросов и все ответы составлены редакцией damirock.com. Официальные программы ниже использованы для сверки тем, а не как источник готовых ответов. Проверка источников: 8 октября 2026 года. НИУ ВШЭ: вводная «Эконометрика», программа 2023/2024; НИУ ВШЭ: «Эконометрика».
Проверить понимание на задачах
Выберите разбор по теме: условие, ход решения, проверка и типичная ошибка приведены отдельно.