МНОЖЕСТВЕННАЯ ЛИНЕЙНАЯ РЕГРЕССИЯ
6.1. Определение параметров уравнения регрессии
На любой экономический показатель практически всегда оказывает влияние не один, а несколько факторов. Например, спрос на некоторое благо определяется не только ценой данного блага, но и ценами на замещающие и дополняющие блага, доходом потребителей и многими другими факторами. В этом случае вместо парной регрессии M(Y I х) = f(x) рассматривается множественная регрессия
M(Y|xi,x
2, ...,x
m) = f(x
bx
2, ...,x
m). (6.1)
Задача оценки статистической взаимосвязи переменных Y и Хі, Х
2, ..., Х
т формулируется аналогично случаю парной регрессии. Уравнение множественной регрессии может быть представлено в виде
Y = f(P,X) + s, (6.2)
где X = (Хі, Х
2, ..., Х
т) - вектор независимых (объясняющих) переменныхр - вектор параметров (подлежащих определению); s - случайная ошибка (отклонение); Y - зависимая (объясняемая) переменная. Предполагается, что для данной генеральной совокупности именно функция f связывает исследуемую переменную Y с вектором независимых переменных X.
Рассмотрим самую употребляемую и наиболее простую из моделей множественной регрессии - модель множественной линейной регрессии.
Теоретическое линейное уравнение регрессии имеет вид:
Y = Ро + РА + р
2Х
2 + ... + p
mX
m + s (6.3)
или для индивидуальных наблюдений і, і = 1, 2, ..., n:
Уі = Ро + PlX.il + р
2Х
і2 + ... + p
mx
m + Еі. (6.4)
Здесь Р = (Ро, Рі, ..., р
т) - вектор размерности (m +1) неизвестных параметров. Pj, j = 1, 2, ..., m, называетсяj-м теоретическим коэффициентом регрессии (частичным коэффициентом регрессии). Он характеризует чувствительность величины Y к изменению Х
? Другими словами, он отражает влияние на условное математическое ожидание M(Y|xi, х
2, ..., х
т) зависимой переменной Y объясняющей переменной X, при условии, что все другие объясняющие переменные модели остаются постоянными. р
0 - свободный член, определяющий значение Y, в случае, когда все объясняющие переменные Xj равны нулю.
После выбора линейной функции в качестве модели зависимости необходимо оценить параметры регрессии.
Пусть имеется и наблюдений вектора объясняющих переменных X = (Хі, Х
2, ..., Х
т) и зависимой переменной Y:
(Хі1,Хі2, ...,Хйп, Уі), і= 1,2,
Для того чтобы однозначно можно было бы решить задачу отыскания параметров р
0, Ръ • ••, Рт(т. е. найти некоторый наилучший вектор Р), должно выполняться неравенство п > ш + 1. Если это неравенство не будет выполняться, то существует бесконечно много различных векторов параметров, при которых линейная формула связи между X и Y будет абсолютно точно соответствовать имеющимся наблюдениям. При этом, если п = ш + 1, то оценки коэффициентов вектора Р рассчитываются единственным образом - путем решения системы m + 1 линейного уравнения:
Уі = Ро+ Ріхц + р
2х
і2+ ... + P
mx
im , i= 1,2, ...,m+1. (6.5)
Например, для однозначного определения оценок параметров уравнения регрессии Y = р
0 + РіХ
х + р
2Х
2 достаточно иметь выборку из трех наблюдений (х ц,х
l2, х
і3, у,), і = 1, 2, 3. Но в этом случае найденные значения параметров р
0, Рі, р
2 определяют такую плоскость Y = Ро + РіХ
2 + р
2Х в трехмерном пространстве, которая пройдет именно через имеющиеся три точки. С другой стороны, добавление в выборку к имеющимся трем наблюдениям еще одного приведет к тому, что четвертая точка (х
4і,х
42, х
43, у
4) практически наверняка будет лежать вне построенной плоскости (и, возможно, достаточно далеко). Это потребует определенной переоценки параметров. Таким образом, вполне логичен следующий вывод:
если число наблюдений больше минимально необходимого, т. е. 11 > 1П+1, то уже нельзя подобрать линейную форму, в точности удовлетворяющую всем наблюдениям, и возникает необходимость оптимизации, т. е. оценивания параметров осо, оц, ..., a
m, при которых формула дает наилучшее приближение для имеющихся наблюдений.
В данном случае число ? = п — ш — 1 называется числом степеней свободы. Нетрудно заметить, что если число степеней свободы невелико, то статистическая надежность оцениваемой формулы невысока. Например, вероятность верного вывода (получения более точных оценок) по трем наблюдениям существенно ниже, чем по тридцати. Считается, что при оценивании множественной линейной регрессии для обеспечения статистической надежности требуется, чтобы число наблюдений, по крайней мере, в 3 раза превосходило число оцениваемых параметров.
Самым распространенным методом оценки параметров уравнения множественной линейной регрессии является метод наименьших квадратов (МНК). Напомним, что его суть состоит в минимизации суммы квадратов отклонений наблюдаемых значений зависимой переменной Y от ее значений Y, получаемых по уравнению регрессии.
Прежде чем перейти к описанию алгоритма нахождения оценок коэффициентов регрессии, напомним о желательности выполнимости ряда предпосылок МНК, которые позволят проводить анализ в рамках классической линейной регрессионной модели. Эти предпосылки подробно обсуждались в разделе 5.1. Напомним ряд из них.
Предпосылки МНК
1°. Математическое ожидание случайного отклонения s, равно нулю: M(s) = 0 для всех наблюдений.
2°. Гомоскедастичностъ (постоянство дисперсии отклонений). Дисперсия случайных отклонений s, постоянна:
D(sO = D(sj) = а
2 для любых наблюдений і и j.
3°. Отсутствие автокорреляции.
от
Случайные отклонения 8! и s, являются независимыми друг друга для всех і ф j.
У
еіе, =cov(e
1,e
J)
J 0, если і ф j; \у
2, если і = j.
4°. Случайное отклонение должно бытъ независимо от объясняющих переменных.
У«Л
= 0-
5°. Модель является линейной относительно параметров.
Для случая множественной линейной регрессии существенной является еще одна предпосылка.
6°. Отсутствие мулътиколлинеарности.
Между объясняющими переменными отсутствует строгая (сильная) линейная зависимость.
7°. Ошибки Si имеют нормальное распределение (s, ~N(0, о)).
Выполнимость данной предпосылки важна для проверки статистических гипотез и построения интервальных оценок.
Как и в случае парной регрессии, истинные значения параметров Р, по выборке получить невозможно. В этом случае вместо теоретического уравнения регрессии (6.3) оценивается так называемое эмпирическое уравнение регрессии. Эмпирическое уравнение регрессии представим в виде:
Y = Ьо + ЬцХ] + Ь
2Х
2 + ... + b
mX
m + е. (6.6)
Здесь Ьо, Ьі, ..., b
m - оценки теоретических значений р
ь р
2, ..., р
т коэффициентов регрессии {эмпирические коэффициенты регрессии); е - оценка отклонения s. Для индивидуальных наблюдений имеем:
У, = Ь
0 + bjXii + ... + b
mx
im + ві. (6.7)
Оцененное уравнение в первую очередь должно описывать общий тренд (направление) изменения зависимой переменной Y. При этом необходимо иметь возможность рассчитать отклонения от этого тренда.
По данным выборки объема и: (x
lb x
l2,... , x
m, у,), i = 1, 2, ... ,n требуется оценить значения параметров Р, вектора Р, т. е. провести параметризацию выбранной модели (здесь Ху, j = 1, 2, ... , m - значение переменной Xj в і-м наблюдении).
При выполнении предпосылок МНК относительно ошибок с, оценки Ьо, Ьі, ..., b
m параметров Pi, р
2, ..., p
m множественной линейной регрессии по МНК являются несмещенными, эффективными и состоятельными (т. е. BLUE-оценками).
На основании (6.7) отклонение е
х значения у, зависимой переменной Y от модельного значения у,, соответствующего уравнению регрессии в і-м наблюдении (і = 1,2, ..., н), рассчитывается по формуле:
еі = Уі - b
0 - ЬіХіі - ... - b
mx
im. (6.8)
Тогда по МНК для нахождения оценок bo, bi, ..., b
m минимизируется следующая функция:
Q=Ie? = i(y
1-(b
0 + Zb
1x
11))
2. (6.9)
i=i i=i j=i ' '
Данная функция является квадратичной относительно неизвестных величин bj, j = 0, 1, ..., m. Она ограничена снизу, следовательно, имеет минимум. Необходимым условием минимума функции Q является равенство нулю всех ее частных производных по Ь,. Частные производные квадратичной функции (6.9) являются линейными функциями
8Q
8Ъ
0
8Q
-2Z(y
1-(b
0 + Zb,x
1|)),
(6.10)
Приравнивая их к нулю, мы получаем систему (пт +1) линейного уравнения с (т +1) неизвестным:
I(y
1-(b
0 + Ib
1x
11)) = 0,
(6.11)
НУі-(Ь
0 + IbjXy))
Xy =0, j = 1,2,...,m.
Такая система имеет обычно единственное решение. В исключительных случаях, когда столбцы системы линейных уравнений линейно зависимы, она имеет бесконечно много решений или не имеет решения вовсе. Однако данные реальных статистических наблюдений к таким исключительным случаям практически никогда не приводят. Система (6.11) называется системой нормальных уравнений. Ее решение в явном виде наиболее наглядно представимо в векторноматричной форме.
6.2. Расчет коэффициентов множественной линейной регрессии
|
Представим данные наблюдений и соответствующие коэффициенты в матричной форме. |
|
|
|
|
"Уі" |
|
'1 |
Х11 |
Х12 |
- Х1,п~ |
|
"V |
|
~еГ |
|
Y = |
у2 |
, х = |
1 |
Х21 |
Х22 |
- Х2т |
, в = |
Ьі |
, е = |
е2 |
|
|
_Уп_ |
|
1 |
Х„1 |
Х„2 • |
V
пт _ |
|
_Ьт _ |
|
_еп_ |
Здесь Y - вектор-столбец размерности п наблюдений зависимой переменной Y; X - матрица размерности п х (ш + 1), в которой і-я строка (і = 1, 2, ... , п) представляет наблюдение вектора значений независимых переменных Х
ь Х
2, ... , Х
т; единица соответствует переменной при свободном члене Ьо; В - вектор-столбец размерности (ш + + 1) параметров уравнения регрессии (6.6); е - вектор-столбец размерности и отклонений выборочных (реальных) значений уі зависимой переменной Y от значений у
;, получаемых по уравнению регрессии
Уі = bo + biXi + b
2X
2 + ... + b
mX
m. (6.12)
Нетрудно заметить, что функция Q = в матричной форме
і=і
представима как произведение вектор-строки е
1 = ( еі, е
2,..., е
п) на вектор-столбец е. Вектор-столбец е, в свою очередь, может быть записан в следующем виде:
е = У-ХВ. (6.13)
Отсюда
Q = е е = (Y - ХВ)
Т ( Y -ХВ) = Y
T Y -В
т Х
т Y -Y
T ХВ +В
Т Х
т ХВ =
= Y
TY-2B
TX
TY + B
TX
TXB (6.14)
Здесь е
т, В
г, Х
т, Y
T - векторы и матрицы, транспонированные к е, в, х, Y соответственно. При выводе формулы (6.14) мы воспользовались известными соотношениями линейной алгебры:
(Y - ХВ)
Т = Y
T - (ХВ)
Т; (ХВ)
Т = В
ГХ
Т; В
1 Х
т Y = Y
T ХВ. (6.15)
Эти соотношения легко проверить, записав поэлементно все матрицы и выполнив с ними нужные действия.
Необходимым условием экстремума функции Q является равен-
aQ к
ство нулю ее частных производных —- по всем параметрам bj,
0Q
ЭВ
j = 0, 1, ... ,ш. Покажем, что вектор-столбец
частных производ
ных в матричном виде имеет следующий вид:
(6.16)
— = -2X
TY + 2(Х
Т Х)В
ЭВ
Для упрощения изложения обозначим матрицу Х
т X размерности (ш + 1) х (ш + 1) через Z. Тогда
|
|
f |
|
Л |
|
|
|
|
Z11 Z12 ••• Z1111+1 |
|
|
о
X) |
|
S = BZB = |
(Ьо, Ьj, ...,bm) |
Z21 Z22 ••• Z2 m+1 |
|
|
bi |
|
|
|
_Zm+l 1 Z m+12 ••• Z m+1 m+1 _ |
|
|
bm |
|
|
|
|
J |
|
f 111 111 111 ^
 |
|
bni |
Zb;Z
1+1 j, Sb;Z
1+1 2 ¦> ¦¦¦¦> Ib
lZl+1 m+1
Vi=0 1=0 1=0 у
mm mm
= Zb, • Ib
lZl+ll+1 = Z Zbjb
lZl+ll+1.
j=0 ' 1=0 ' j=0 1=0 '
as
Следовательно, частная производная-= 2 Z^Zj
i+ij+i •
аь
;
i=0
as
В результате имеем —=2(Х
ТХ)В.
ав
Обозначим вектор-столбец Х
ТУ размерности (т +1) через R.
Тогда В
1 Х
Т Y = B
TR = Z а ,г
1+1, где ij
+1 - соответствующий элемент
.і=о ' '
вектора R. Поэтому -= R = X
TY.
ав
л Ал, „ ^(Y
TY) „
Y Y от В не зависит, и значит -= О.
д В
aQ
Следовательно, формула (6.16) справедлива. Приравняв - ну-
ав
лю, получим общую формулу (6.18) вычисления коэффициентов множественной линейной регрессии:
(6.17)
(6.18)
-2 X
TY + 2(Х
Т Х)В = 0 X
TY = (Х
т Х)В
В = (X
TX)
_1X
TY. Здесь (Х
ТХ)
_1 - матрица, обратная к Х
ТХ.
Полученные общие соотношения справедливы для уравнений регрессии с произвольным количеством m объясняющих переменных. Проанализируем полученные результаты для случаев m = 1, m = 2.
Для парной регрессии Y = bo + biX + e имеем:
|
|
|
е1 |
|
Уі |
|
1 Х1 |
|
е2 |
= |
у2 |
— |
1 х2 |
|
еп |
|
Уп |
|
1 хп |
bi |
(6.13) => e = Y-XB <z>
|
|
|
|
|
|
'1 |
х1~ |
|
|
|
|
"1 1 . |
.. 1" |
|
1 |
Х2 |
|
11 |
ХхГ |
|
Xj х2 . |
|
|
1 |
х„. |
|
ІХ, |
Sxf_ |
Ixf
IXj |
z = xx
nZ xf-(Zx,)2 nlxf-dx,)2 ZXj n
"nSxf-CSx,)2 nZx2-(Ix,)2 |
|
R = X Y |
|
|
|
|
Уі |
|
|
1 |
1 ... г |
|
У2 |
|
" Ху. " |
|
*
ю
*
3
1_ |
|
|
|
_ХхіУі_ |
|
|
|
|
_Уп. |
|
|
|
Zxfly, |
ІХіХХіУі |
ПIXj -(Xxj) nlXj -(2ХД
¦ + ¦
nlxy, |
Тжгч-1
z~
l=(x
Lxy
l =
В = (X
T X)
_1X
TY =
(6.18)
Ix.Iy,
nlxj -(Sxj) n?xj -(Xxj)"
|
ZxfZyi -ЕхіЕхіУі |
|
|
|
nXxf -(ІхД2 |
|
X)
1
|>>
1_ |
|
ь0 |
|
пХхіУі -ХхіХУі |
|
Ь1 |
|
_ьі_ |
|
nZxj -(ІХіД |
(4.13)
|
~Уі" |
|
'1 |
х1~ |
|
|
|
V |
|
У2 |
х = |
1 |
х2 |
, В = |
"ь0" |
, е = |
е2 |
|
Уз |
|
|
|
|
Л_ |
|
|
|
_У 4 _ |
|
1 |
х„. |
|
|
|
_еп_ |
Сравнивая диагональные элементы zl- матрицы Z
1 = (Х
ТХ)
1 с формулами (5.12), (5.13), замечаем, что S^ = S
2 • z'--, j = 0, 1.
Рассуждая аналогично, можно вывести формулы (осуществление выкладок рекомендуем в качестве упражнения) определения коэффициентов регрессии для уравнения с двумя объясняющими переменными (ш = 2). Соотношение (6.17) в этом случае в расширенной форме имеет вид системы трех линейных уравнений с тремя неизвестными bo, bi, b
2:
= nb
0 + b
1Ix
ll + Ь
21х
й,
\ Т.*пУі =b
0Ix
ll+b
1Ixf
1+b
2Ix
llx
l2 (6.19)
5
хі2Уі = b
01 x
l2 + Ъ
х I x
nx
l2 + b
21X
2, .
Решение данной системы имеет вид: b
0 =У-Ь
1х
1 + Ь
2х
2,
ь = Дхн -XtXy - у) • Пх
12 -Х
2)
2 - Z(
xl2 -Х
2)(у -у) • Их,! -Х
1)(х
і2 -х
2)
Дхц — Xj)
2Z(X;
2 -Х
2)
2 -(Пх
п -х
1)(х
і2 -х
2))
2
ь _ Z(Xj
2 -х
2)(у -y)-Z(x, | -X
t)
2 -Я*п -Xi)(y -y)-Z(x,| -x
t)(^
2 -х
2)
Н*П-X
|)
2Z(X
l2 -X
2)
2 -(Х(х
п -У, Ху
2 -Х
2))
2
6.3. Дисперсии и стандартные ошибки коэффициентов
Знание дисперсий и стандартных ошибок позволяет анализировать точность оценок, строить доверительные интервалы для теоретических коэффициентов, проверять соответствующие гипотезы.
Наиболее удобно формулы расчета данных характеристик приводить в матричной форме. Попутно заметим, что три первые предпосылки МНК в матричной форме будут иметь вид:
1°. М(8) = 0;
2°. D(s) = ст
2І;
3°. К(8) = М(88
Т) = сг
2Е.
D0l) У
еіе
2
|
|
|
|
"еі" |
|
"Г |
|
'1 |
0 |
... 0" |
|
Здесь s — |
е2 |
, І=[1]пх1 = |
1 |
, Е Е п х п |
0 |
1 |
... 0 |
|
|
_еп. |
|
1 |
|
0 |
0 |
0 1 |
У elen
У e2en |
К(е)
У e
2ej
D(e
2)
D(e„)
Как показано выше, эмпирические коэффициенты множественной линейной регрессии определяются по формуле (6.18)
В = (Х
ТХ)
_1Х
ТУ.
Подставляя теоретические значения Y = Хр + 8 в данное соотношение, имеем:
В = (Х
ТХ)
_1Х
Т(ХР + 8) = (Х
ТХ)
_1(Х
ТХ)Р + (Х
ТХ)
_1Х
Т8 =
= р + (Х
ТХ)
_1Х
Т8.
Следовательно, р - В = (Х
ТХ)
_1Х
Т?.
Построим дисперсионно-ковариационную матрицу
К(р) = М((Р - В)( р - В)
т) = М[((Х
ТХ) ¦
1X
Ts)((X
TX) ¦
1x
Ts)
T] =
= М(Х
Т X)
_1х
т88
т Х(Х
Т X)"
1.
В силу того, что X, не являются случайными величинами, имеем: К(Р) = (Х
тХ)
_1Х
тМ(?8
Т) Х(Х
ТХ)
_1 = (Х
тХ)“
1х?еХ(Х
тХ)“
1 =
= ст
2(Х
т X)
-1 =>

(6.21)
Напомним, что z- j-й диагональный элемент матрицы Z
! =
= (Х
ТХ)
_1.
Поскольку истинное значение дисперсии а
2 по выборке определить невозможно, оно заменяется соответствующей несмещенной оценкой
|
S2 |  |
(6.22)
где m - количество объясняющих переменных модели. Отметим, что иногда в формуле (6.22) знаменатель представляют в виде n - m - 1 = = 11 - к, подразумевая под к число параметров модели (подлежащих определению коэффициентов регрессии).
Следовательно, по выборке мы можем определить лишь выборочные дисперсии эмпирических коэффициентов регрессии:
(6.23)
S
2 = S
2 z',=
Как и в случае парной регрессии, S = Vs
2" называется стандартной ошибкой регрессии. S
b = ^S
ь. называется стандартной ошибкой коэффициента регрессии.
В частности, для уравнения Y = b
0 + bjXj + Ь
2Х
2 с двумя объясняющими переменными дисперсии и стандартные ошибки коэффициентов вычисляются по следующим формулам:
1
| X1 Ij(
xj2
X2)
X2 ^ (
Xi 1
Xl) 2
xi
x2IX
Xii
xl)(
xi2
X2)
n KxH-Xi^Kx^-^^-^Xij-XjXx^-^))
2
Sb =
Do
• s-
s
2 -
I(x
l2-x
2)
2
І(Х
П -
Xi)
2I(x
i2 -x
2)
2 -(I(
Xll -
Xl)(x
l2 -x
2))
2
(6.24)
S
2 =
1 IX
хіі -Xj)
2 •(! -r
12)
Kxa-xO
2
St =
•S
2 <Z>
І(Хц -XjfKx^ -x
2)
2 -(I(
Xil -
Xl)(x
l2 -x
2))
:
s
2
Sb2 Z(x,
2-x
2)
2-(l-r
2)
s„ = ,/s
Su =J s
’bn ’
Здесь Гі2 = r
X[X2 - выборочный коэффициент корреляции между
объясняющими переменными Хі и Х
2.
Ковариация между коэффициентами рассчитывается по формуле:
(6.25)
-
Г12 ' S“
Cov(bi, b
2) =
(l-r
12)
A/l(x
ll -
Xl)
2 ?(х
й -x
2)
2
6.4. Интервальные оценки коэффициентов теоретического уравнения регрессии
По аналогии с парной регрессией (см. параграф 5.4) после определения точечных оценок bj коэффициентов P
1 (j = 0, 1, ..., m) теоретического уравнения регрессии могут быть рассчитаны интервальные оценки указанных коэффициентов. Для построения интервальной оценки коэффициента Pj строится t-статистика
(6.26)
bj-
Bj
имеющая распределение Стьюдента с числом степеней свободы ? =
= и - m - 1 (и - объем выборки, m - количество объясняющих переменных в модели).
Пусть необходимо построить 100(1 - а)%-ный доверительный интервал для коэффициента Р,. Тогда по таблице критических точек распределения Стьюдента по требуемому уровню значимости а и числу степеней свободы ? находят критическую точку t
6
—, 11-rn-i 2
удовлетворяющую условию
Р( 111 < t
6 ) = P(-t
6 <t<t
6 )=l-a. (6.27)
—, n-iii-i —, n-iii-i —, n-iii-i
2 2 2
Подставляя (6.26) в (6.27), получаем
p(-t
6 < Vi<
te )=і-б,
— n-m-1 V — n-m-1
2 °b,
2
или после преобразования
P( ь, - t
(6.28)
6 ,A, < Bj < b,+ t
6 -s
b ) = l-6.
— ,11-111-1
1 — ,11-111-1
1 2 2
Напомним, что S
b рассчитывается по формуле
Sef
1=1
(6.29)
Sk = S • JZ'; =
Таким образом, доверительный интервал, накрывающий с надежностью (1 - а) неизвестное значение параметра Pj, определяется неравенством
<
BJ < b, + t
6
2
(6.30)



n-m-1
He вдаваясь в детали, отметим, что по аналогии с парной регрессией (см. раздел 5.5) может быть построена интервальная оценка для среднего значения предсказания:
Vt
6 ' S(Y ) < M(Y Хр) < Y +1
6
—,n-m-l r r r —
n_
m_l
2 2
.
py ,.
p .
1 S( Y ). (6.31)
—,n-m-
1 2
В матричной форме это неравенство имеет вид:
%-и
—,n-m-1
• syXp (х
тх)
_1 Х
р < м(^ Х
р) < Y
p +1Q ^
2’
П m
•S
A/X
pT(X
TX)-
1Xp
(6.32)
6.5. Анализ качества эмпирического уравнения множественной линейной регрессии
Построение эмпирического уравнения регрессии является начальным этапом эконометрического анализа. Первое же построенное по выборке уравнение регрессии очень редко является удовлетворительным по тем или иным характеристикам. Поэтому следующей важнейшей задачей эконометрического анализа является проверка качества уравнения регрессии. В эконометрике принята устоявшаяся схема такой проверки (по крайней мере, на начальной стадии). Это нашло отражение практически во всех современных эконометрических пакетах.
Проверка статистического качества оцененного уравнения рег-рес- сии проводится по следующим направлениям:
• проверка статистической значимости коэффициентов уравнения регрессии;
• проверка общего качества уравнения регрессии;
• проверка свойств данных, выполнимость которых предполагалась при оценивании уравнения (проверка выполнимости предпосылок МНК).
6.6. Проверка статистической значимости коэффициентов уравнения регрессии
Как и в случае парной регрессии (см. раздел 5.3, формула (5.16)), статистическая значимость коэффициентов множественной линейной регрессии с m объясняющими переменными проверяется на основе t-статистики:

имеющей в данной ситуации распределение Стьюдента с числом степеней свободы ? = п- ш-1(п- объем выборки). При требуемом уровне значимости а наблюдаемое значение t-статистики сравнивается с критической точкой t
6 распределения Стьюдента.
—, n—m—1 2
Если 111 > t
б , то коэффициент Ь, считается статистически
—, п-111-1 2
значимым.
В противном случае (111 < t
6 ) коэффициент b, считается
—, п-111-1 2
статистически незначимым (статистически близким к нулю). Это означает, что фактор Xj фактически линейно не связан с зависимой переменной Y. Его наличие среди объясняющих переменных не оправдано со статистической точки зрения. Не оказывая сколь-нибудь серьезного влияния на зависимую переменную, он лишь искажает реальную картину взаимосвязи. Поэтому после установления того факта, что коэффициент Ь, статистически незначим, рекомендуется исключить из уравнения регрессии переменную Xj. Это не приведет к существенной потере качества модели, но сделает ее более конкретной.
Зачастую строгая проверка значимости коэффициентов заменяется простым сравнительным анализом.
• Если 111 < 1 ( bj < S
b ), то коэффициент статистически незначим.
• Если 1 < 111 < 2 ( b, < 2 S
b ), то коэффициент относительно значим.
В данном случае рекомендуется воспользоваться таблицами.
• Если 2 < 111 < 3, то коэффициент значим. Это утверждение является гарантированным при числе степеней ?>20и а >0.05 (см. таблицу критических точек распределения Стьюдента).
• Если 111 > 3, то коэффициент считается сильно значимым. Вероятность ошибки в данном случае при достаточном числе наблюдений не превосходит 0.001.
6.7. Проверка общего качества уравнения регрессии
После проверки значимости каждого коэффициента регрессии обычно проверяется общее качество уравнения регрессии. Для этой цели, как и в случае парной регрессии, используется коэффициент детерминации R
2, который в общем случае рассчитывается по формуле:

R
2
(6.34)
Ку,-у)
2'
Суть данного коэффициента как доли общего разброса значений зависимой переменной Y, объясненного уравнением регрессии, подробно рассмотрена в разделе 5.6. Как отмечалось, в общем случае О < R
2 < 1. Чем ближе этот коэффициент к единице, тем больше уравнение регрессии объясняет поведение Y. Поэтому естественно желание построить регрессию с наибольшим R
2.
Для множественной регрессии коэффициент детерминации является неубывающей функцией числа объясняющих переменных. Добавление новой объясняющей переменной никогда не уменьшает значение R
2. Действительно, каждая следующая объясняющая переменная может лишь дополнить, но никак не сократить информацию, объясняющую поведение зависимой переменной. Это уменьшает (в худшем случае не увеличивает) область неопределенности в поведении Y.
Иногда при расчете коэффициента детерминации для получения несмещенных оценок в числителе и знаменателе вычитаемой из единицы дроби делается поправка на число степеней свободы. Вводится так называемый скорректированный (исправленный) коэффициент детерминации'.
(6.35)
|Г2
=1 Іе
2/(п-ш-1)
Ку,-у)
2/(п-1)'
_^ 2
Можно заметить, что Ку,
-у) /(п-1) является несмещенной
оценкой общей дисперсии - дисперсии отклонений значений переменной Y от у. При этом число ее степеней свободы равно (n -1). Одна степень свободы теряется при вычислении у.
Хе
2/(н-ш-1) является несмещенной оценкой остаточной дисперсии - дисперсии случайных отклонений (отклонений точек наблюдений от линии регрессии). Ее число степеней свободы равно (п-ш-1). Потеря (ш + 1) степени свободы связана с необходимостью решения системы (m +1) линейного уравнения при определении коэффициентов эмпирического уравнения регрессии. Попутно заметим, что несмещенная оценка объясненной дисперсии (дисперсии отклонений точек на линии регрессии от у) имеет число степеней свободы, равное разности степеней свободы общей дисперсии и остаточной дисперсии: (и - 1) - (п - іи - 1) = 111.
Соотношение (6.35) может быть представлено в следующем виде:
R
2=l-(1-R
2)
11-1 . (6.36)
11 - in -1
Из (6.36) очевидно, что R
2 < R
2 для m > 1. С ростом значения m скорректированный коэффициент детерминации R
2 растет медленнее, чем (обычный) коэффициент детерминации R
2. Другими словами, он корректируется в сторону уменьшения с ростом числа объясняющих переменных. Нетрудно заметить, что R
2 =R
2 только при R
2 = 1. R
2 может принимать отрицательные значения (например, при R
2 = 0).
Доказано, что R
2 увеличивается при добавлении новой объясняющей переменной тогда и только тогда, когда t-статистика для этой переменной по модулю больше единицы. Поэтому добавление в модель новых объясняющих переменных осуществляется до тех пор, пока растет скорректированный коэффициент детерминации.
Обычно в эконометрических пакетах приводятся данные как по R
2, так и по R
2, являющиеся суммарными мерами общего качества уравнения регрессии. Однако не следует абсолютизировать значимость коэффициентов детерминации. Существует достаточно примеров неправильно специфицированных моделей, имеющих высокие коэффициенты детерминации (обсудим данную ситуацию позже). Поэтому коэффициент детерминации в настоящее время рассматривается лишь как один из ряда показателей, который нужно проанализировать, чтобы уточнить строящуюся модель.
6.7.1. Анализ статистической значимости коэффициента детерминации
После оценки индивидуальной статистической значимости каждого из коэффициентов регрессии обычно анализируется совокупная значимость коэффициентов. Такой анализ осуществляется на основе проверки гипотезы об общей значимости - гипотезы об одновременном равенстве нулю всех коэффициентов регрессии при объясняющих переменных:
Но: Pi = Р2
= • • •
= Pm
= 0.
Если данная гипотеза не отклоняется, то делается вывод о том, что совокупное влияние всех ш объясняющих переменных Xi, Х2, ..., X
m модели на зависимую переменную Y можно считать статистически несущественным, а общее качество уравнения регрессии - невысоким.
Проверка данной гипотезы осуществляется на основе дисперсионного анализа - сравнения объясненной и остаточной дисперсий.
Н
0: (объясненная дисперсия) = (остаточная дисперсия),
Ну (объясненная дисперсия) > (остаточная дисперсия).
Для этого строится F-статистика:
F _ Ik?/m _ І(Уі-у)
2/т „
3?)
?ef/(n-m-l) 1(у;-у;)
2/(п-т-1) ’
где Xkf/m - объясненная дисперсия; Xef/(n-m-l)
_ остаточная дисперсия. При выполнении предпосылок МНК построенная F-статистика имеет распределение Фишера с числами степеней свободы ?і = = m, v
2 = n - m - 1. Поэтому, если при требуемом уровне значимости а Fнабл. > F
Kp = F
a;m;n_
m_i (где F
a;m;n_
m_i - критическая точка распределения Фишера), то Но отклоняется в пользу Hi. Это означает, что объясненная дисперсия существенно больше остаточной дисперсии, а следовательно, уравнение регрессии достаточно качественно отражает динамику изменения зависимой переменной Y. Если F
Ha&I < F
Kp =
= F
a;m;n_
m_i, то нет оснований для отклонения Но Значит, объясненная дисперсия соизмерима с дисперсией, вызванной случайными факторами. Это дает основания считать, что совокупное влияние объясняющих переменных модели несущественно, а следовательно, общее качество модели невысоко.
Однако на практике чаще вместо указанной гипотезы проверяют тесно связанную с ней гипотезу о статистической значимости коэффициента детерминации R
2:
Н
0: R
2 = 0,
Н
0: R
2 > 0.
Для проверки данной гипотезы используется следующая F-статистика:
R
2 n - m -1 1 - R
2 m
(6.38)
Величина F при выполнении предпосылок MHK и при справедливости Но имеет распределение Фишера аналогичное F-статистике
(6.37) . Действительно, разделив числитель и знаменатель дроби в
(6.37) на общую сумму квадратов отклонений ?(Уі - у)
2 , мы получим
(6.38) :
Р _ Zkf/ІХУі - у)
2 (и-т-1)
= R
2 11 - іи -1 ~Іе?/І(
Уі-у)
2 ' in 1-R
2 m
Из (6.38) очевидно, что показатели F и R
2 равны или не равны нулю одновременно. Если F = 0, то R
2 = 0, и линия регрессии Y = у является наилучшей по МНК, и, следовательно, величина Y линейно не зависит от Хі, Хг, ..., Х
т. Для проверки нулевой гипотезы Но: F= О при заданном уровне значимости а по таблицам критических точек распределения Фишера находится критическое значение F
Kp = Fгг пт—m—1. Нулевая гипотеза отклоняется, если F > F
Kp. Это равносильно тому, что R
2 > 0, т. е. R
2 статистически значим.
Анализ статистики F позволяет сделать вывод о том, что для принятия гипотезы об одновременном равенстве нулю всех коэффициентов линейной регрессии, коэффициент детерминации R
2 не должен существенно отличаться от нуля. Его критическое значение уменьшается при росте числа наблюдений и может стать сколь угодно малым.
Пусть, например, при оценке регрессии с двумя объясняющими переменны-
2 0.65 30-2-1
ми по 30 наблюдениям R = 0.65. Тогда F =---« 25.07. По таблицам
0.35 2
критических точек распределения Фишера найдем Fo 05;2;27
= 3.36; Fo,oi;2;27
= =
5.49. Поскольку F
Ha6
n = 25.07 > F
KpiIT как при 5%, так и при 1% уровне значимо-
^ 2
сти, то нулевая гипотеза в обоих случаях отклоняется. Если в той же ситуации R 0.4 27
= 0.4, то F =---= 9 . Предположение о незначимости связи отвергается и
0.6 2
здесь.
Отметим, что в случае парной регрессии проверка нулевой гипотезы для F-статистики равносильна проверке нулевой гипотезы для
г -л/п-2 t-статистики t = —-г—
1-4
коэффициента корреляции (см. раздел
3.5.6). В этом случае F-статистика равна квадрату t-статистики. Самостоятельную важность коэффициент R
2 приобретает в случае множественной линейной регрессии.
6.7.2. Проверка равенства двух коэффициентов детерминации
Другим важным направлением использования статистики Фишера является проверка гипотезы о равенстве нулю не всех коэффициентов регрессии одновременно, а только некоторой части этих коэффициентов. Данное использование статистики F позволяет оценить обоснованность исключения или добавления в уравнение регрессии некоторых наборов объясняющих переменных, что особенно важно при совершенствовании линейной регрессионной модели.
Пусть первоначально построенное по п наблюдениям уравнение регрессии имеет вид
Y = Ьо + ЬіХі + Ь
2Х
2 + ... + b
m_
kX
m_
k + ... + b
mX
m, (6.39)
и коэффициент детерминации для этой модели равен R
2. Исключим из рассмотрения к объясняющих переменных (не нарушая общности, положим, что это будут к последних переменных). По первоначальным п наблюдениям для оставшихся факторов построим другое уравнение регрессии:
Y = Со + СіХі + СгХ
2 + ... + c
m.
kX
m.
k, (6.40)
для которого коэффициент детерминации равен R^. Очевидно,
Ro <Rf, так как каждая дополнительная переменная объясняет часть (пусть незначительную) рассеивания зависимой переменной. Возникает вопрос: существенно ли ухудшилось качество описания поведения зависимой переменной Y. На него можно ответить, проверяя гипотезу Hq: R
2 - R
2 = 0 и используя статистику
(6.41)
Rf - R2 11 - m -1 1 - R“ k
В случае справедливости Но приведенная статистика F имеет распределение Фишера с числами степеней свободы Vi = k , ?2 = п - ш - 1. Действительно, соотношение (6.41) может быть переписано в виде
(6.42)
(Rl-RoVk
(l-R
2 )/(n-m-l)
Здесь (R
2 - Rt) - потеря качества уравнения в результате отбрасывания к объясняющих переменных; к - число дополнительно появившихся степеней свободы; (1 - R
2 )/(n - m -1) - необъясненная дисперсия первоначального уравнения. Следовательно, мы попадаем в ситуацию аналогичную (6.37).
По таблицам критических точек распределения Фишера находят F
Kp = F
a;m;n_
m_i (a - требуемый уровень значимости). Если рассчитанное значение F
Ha&I статистики (6.41) превосходит F
Kp, то нулевая гипотеза о равенстве коэффициентов детерминации (фактически об одновременном равенстве нулю отброшенных к коэффициентов регрессии) должна быть отклонена. В этом случае одновременное исключение из рассмотрения к объясняющих переменных некорректно, так
как Ry существенно превышаетRy. Это означает, что общее качество первоначального уравнения регрессии существенно лучше качества уравнения регрессии с отброшенными переменными, так как оно объясняет гораздо большую долю разброса зависимой переменной. Если же, наоборот, наблюдаемая F-статистика невелика (т. е. меньше, чем F
Kp), то это означает, что разность Ry- R^ незначительна. Следова
тельно, можно сделать вывод, что в этом случае одновременное отбрасывание к объясняющих переменных не привело к существенному ухудшению общего качества уравнения регрессии, и оно вполне допустимо.
Аналогичные рассуждения могут быть использованы и по поводу обоснованности включения новых к объясняющих переменных. В этом случае рассчитывается F-статистика
°~
ш~
1. (6.43)
F= Rj-Rf
l-R; к
Если она превышает критическое значение F
Kp, то включение новых переменных объясняет существенную часть необъясненной ранее дисперсии зависимой переменной. Поэтому такое добавление оправдано. Однако отметим, что добавлять переменные целесообразно, как правило, по одной. Кроме того, при добавлении объясняющих переменных в уравнение регрессии логично использовать скорректированный коэффициент детерминации (6.35), т. к. обычный R
2 всегда растет при добавлении новой переменной; а в скорректированном R
2 одновременно растет величина ш, уменьшающая его.
Если увеличение доли объясненной дисперсии при добавлении новой переменной незначительно, то R
2 может уменьшиться. В этом случае добавление указанной переменной нецелесообразно.
Заметим, что для сравнения качества двух уравнений регрессии по коэффициенту детерминации R
2 обязательным является требование, чтобы зависимая переменная была представлена в одной и той же форме, и число наблюдений п для обеих моделей было одинаковым.
Например, пусть один и тот же показатель Y моделируется двумя уравнениями:
линейным Y = Ро + РіХі + Р2Х2 + s и
лог-линейным I11Y = р
0 + Р1Х1 + р
2Х
2 + s.
Тогда их коэффициенты детерминации R
2 и R
2 рассчитываются по формулам:
R? = 1--^
е‘
2 и R
2 = 1--_, .
І(У, - У) ~ І(1п
Уі - In У)
Так как знаменатели дробей в приведенных соотношениях различны, то прямое сравнение коэффициентов детерминации в этом случае будет некорректным.
6.7.3. Проверка гипотезы о совпадении уравнений регрессии для двух выборок
Еще одним направлением использования F-статистики является проверка гипотезы о совпадении уравнений регрессии для отдельных групп наблюдений. Одним из распространенных тестов проверки данной гипотезы является тест Чоу, суть которого состоит в следующем.
Пусть имеются две выборки объемами щ и п
2 соответственно.
Для каждой из этих выборок оценено уравнение регрессии вида:
Y = b
ok + bikXi + b
2kX
2 + ... + ЬщкХщ + e
k, k=l,2. (6.44)
Проверяется нулевая гипотеза о равенстве друг другу соответствующих коэффициентов регрессии
Н
0: bji = b
j2, j = 0, 1,..., m.
Другими словами, будет ли уравнение регрессии одним и тем же для обеих выборок?
Пусть суммы Yj е* (к = 1,2) квадратов отклонений значений у,
1
от линий регрессии равны Si и S2 соответственно для первого и второго уравнений регрессии.
Пусть по объединенной выборке объема (ііі + 112) оценено еще одно уравнение регрессии, для которого сумма квадратов отклонений У! от уравнения регрессии равна So.
Для проверки Но в этом случае строится следующая F-статистика:
S, - S
2 lij + n
2 - 2m - 2
F=
S«
(6.45)
111 +1
Sj + S
2
В случае справедливости H
0 построенная F-статистика имеет распределение Фишера с числами степеней свободы Vi = m + 1; V2 = щ + + n
2 - 2 m - 2 .
Очевидно, F-статистика близка к нулю, если So « Si + S2 , и это фактически означает, что уравнения регрессии для обеих выборок практически одинаковы. В этом случае F < F
KpHT=F
6. . Если же F >
> Fкрит.5 то нулевая гипотеза отклоняется. Приведенные выше рассуждения особенно важны для ответа на вопрос, можно ли за весь рассматриваемый период времени построить единое уравнение регрессии (рис. 6.1, а), или же нужно разбить временной интервал на части и на каждой из них строить свое уравнение регрессии (рис. 6.1, б).
 |
Рис. 6.1
Некоторые причины необходимости использования различных уравнений регрессии для описания изменения одной и той же зависимой переменной на различных временных интервалах будут анализи- |
роваться ниже при рассмотрении фиктивных переменных и временных рядов.
6.8. Проверка выполнимости предпосылок МНК.
Статистика Дарбина-Уотсона
Статистическая значимость коэффициентов регрессии и близкое к единице значение коэффициента детерминации R
2 не гарантируют высокое качество уравнения регрессии. Для иллюстрации этого факта весьма нагляден пример из [3], в котором анализируется зависимость реального объема потребления CONS (млрд долл. 1982) от численности населения POP (млн чел.) в США 1931-1990 гг. Корреляционное поле статистических данных изображено на рис. 6.2.
 |
Рис. 6.2
Линейное уравнение регрессии, построенное по МНК по реальным статистическим данным, имеет вид: |
CONS = -1817.3 + 16.7РОР.
Стандартные ошибки коэффициентов S
b = 84.7, S
b = 0.46. Следовательно, их t-статистики t
b = -21.4 , t
b = 36.8. Эти значения существенно превышают 3, что свидетельствует о статистической значимости коэффициентов. Коэффициент детерминации R
2 = 0.96 (т. е. уравнение “объясняет” 96% дисперсии объема потребления). Однако по расположению точек на корреляционном поле видно, что зависимость между POP и CONS явно не является линейной, а будет скорее экспоненциальной. Для качественного прогноза уровня потребления линейная функция, безусловно, не может быть использована. За рассматриваемый период времени население США росло почти линейно (с постоянными годовыми приростами), а объем потребления - по экспоненте (с почти постоянными темпами прироста), т. е. за рассматриваемый период существенно выросло потребление на душу населения.
Таким образом, при весьма хороших значениях t-статистик и F-статистики предложенное уравнение регрессии не может быть признано удовлетворительным (отметим, что R
2 = 0.96, скорее всего, в силу того, что и CONS и POP имели временный тренд). Можно ли определить причину этого?
Нетрудно заметить, что в данном случае не выполняются необходимые предпосылки МНК об отклонениях s, точек наблюдений от линии регрессии (см. параграф 6.1). Эти отклонения явно не обладают постоянной дисперсией и не являются взаимно независимыми. Нарушение необходимых предпосылок делает неточными полученные оценки коэффициентов регрессии, увеличивая их стандартные ошибки, и обычно свидетельствует о неверной спецификации самого уравнения. Поэтому следующим этапом проверки качества уравнения регрессии является проверка выполнимости предпосылок МНК. Причины невыполнимости этих предпосылок, их последствия и методы корректировки будут подробно рассмотрены в последующих главах. В данном разделе мы лишь обозначим эти проблемы, а также обсудим весьма популярную в регрессионном анализе статистику Дарбина-Уотсона.
Оценивая линейное уравнение регрессии, мы предполагаем, что реальная взаимосвязь переменных линейна, а отклонения от регрессионной прямой являются случайными, независимыми друг от друга величинами с нулевым математическим ожиданием и постоянной дисперсией. Если эти предположения не выполняются, то оценки коэффициентов регрессии не обладают свойствами несмещенности, эффективности и состоятельности, и анализ их значимости будет неточным.
Причинами, по которым отклонения не обладают перечисленными выше свойствами, могут быть либо нелинейный характер зависимости между рассматриваемыми переменными, либо наличие неучтенного в уравнении существенного фактора. Действительно, при нелинейной зависимости между переменными (рис. 6.2) отклонения от прямой регрессии не случайно распределены вокруг нее, а обладают определенными закономерностями, которые зачастую выражаются в существенном преобладании числа пар соседних отклонений Ем и s, с совпадающими знаками над числом пар с противоположными знаками. Отсутствие в уравнении регрессии какого-либо существенного фактора может также служить причиной устойчивых отклонений зависимой переменной от линии регрессии в ту или иную сторону. Добиться выполнимости предпосылок МНК в этих ситуациях можно либо путем оценивания какой-то другой нелинейной формулы, либо включением в уравнение регрессии новой объясняющей переменной. Это позволит реалистичнее отразить поведение зависимой переменной.
При статистическом анализе уравнения регрессии на начальном этапе чаще других проверяют выполнимость одной предпосылки, а именно, условия статистической независимости отклонений между собой. Поскольку значения s, теоретического уравнения регрессии Y = Ро + РіХ + s остаются неизвестными ввиду неопределенности истинных значений коэффициентов регрессии, то проверяется статистическая независимость их оценок - отклонений е„ і = 1, 2, ..., п. При этом обычно проверяется их некоррелированность, являющаяся необходимым, но недостаточным условием независимости. Причем проверяется некоррелированность не любых, а только соседних величин еь Соседними обычно считаются соседние во времени (при рассмотрении временных рядов) или по возрастанию объясняющей переменной X (в случае перекрестной выборки) значения еь Для этих величин несложно рассчитать коэффициент корреляции, называемый в этом случае коэффициентом автокорреляции первого порядка,
|
Х(е,-М(е,))(е1_І^М(еы)) = Хе, е,^ ^ ^ |
 |
При этом учитывается, что М(е,) = 0, і = 1, 2, ..., п.
На практике для анализа коррелированности отклонений вместо коэффициента корреляции используют тесно с ним связанную статистику Дарбина-Уотсона DW, рассчитываемую по формуле:
(6.47)
DW = ^
е2-^
Хе,2
|
Действительно, |
 |
Здесь сделано допущение, что при больших и выполняется соотношение: Zef ~ Іе?_і .
Тогда
2(Xef-Xe
1e
1_
1)
Sef
=
2(
1-W,)-
DW
(6.48)
Нетрудно заметить, что если е, = е,_], то г
е е = 1 и DW = 0.
Если еі = -е,, то г
е е = -1, и DW = 4. Во всех других случаях 0 < DW < 4 .
К этому же результату можно подойти с другой стороны. Если каждое следующее отклонение е, приблизительно равно предыдущему е
ьі, то каждое слагаемое (е, - ем) в числителе дроби (6.47) близко нулю. Тогда, очевидно, числитель дроби (6.47) будет существенно меньше знаменателя и, следовательно, статистика DW окажется близкой к нулю. Например, для зависимости CONS и POP (рис. 6.2) DW = = 0.045, что очень близко к нулю и подтверждает наличие положительной автокорреляции остатков первого порядка (линейной зависимости между остатками).
В другом крайнем случае, когда точки наблюдений поочередно отклоняются в разные стороны от линии регрессии ( е, « -ем ),
_S(2ei)
2 =4Se
i
еі - ем * 2еі и DW
= 4. Это случай отрицательной
Xе,
автокорреляции остатков первого порядка.
При случайном поведении отклонений можно предположить, что в одной половине случаев знаки последовательных отклонений совпадают, а в другой - противоположны. Так как абсолютная величина отклонений в среднем предполагается одинаковой, то можно считать, что в половине случаев е, « ем, а в другой е, * -ем • Тогда
sWe,)
2
М
lef
2.
= 0.5-4
DW
Sef
Таким образом, необходимым условием независимости случайных отклонений является близость к двойке значения статистики Дар-бина-Уотсона.
Тогда, если DW* 2, мы считаем отклонения от регрессии случайными (хотя они в действительности могут и не быть таковыми). Это означает, что построенная линейная регрессия, вероятно, отражает реальную зависимость. Скорее всего, не осталось неучтенных существенных факторов, влияющих на зависимую переменную. Какая-либо другая нелинейная формула не превосходит по статистическим характеристикам предложенную линейную. В этом случае, даже когда R
2 невелико, вполне вероятно, что необъясненная дисперсия вызвана влиянием на зависимую переменную большого числа различных факторов, индивидуально слабо влияющих на исследуемую переменную, и может быть описана как случайная нормальная ошибка.
Возникает вопрос, какие значения DW можно считать статистически близкими к двум?
Для ответа на этот вопрос разработаны специальные таблицы (приложение 6) критических точек статистики Дарбина-Уотсона, позволяющие при данном числе наблюдений п, количестве объясняющих переменных ш и заданном уровне значимости а определять границы приемлемости (критические точки) наблюдаемой статистики DW.
Для заданных а, и, ш в таблице (приложение 6) указываются два числа: Д - нижняя граница и d
u - верхняя граница. Для проверки гипотезы об отсутствии автокорреляции остатков используется следующий отрезок.
 |
автокорреляция
неопределенности
автокорреляция
Рис. 6.3 |
Выводы осуществляются по следующей схеме.
Если DW < Д , то это свидетельствует о положительной автокорреляции остатков.
Если DW > 4 - di, то это свидетельствует об отрицательной автокорреляции остатков.
При d
u < DW < 4 - d
u гипотеза об отсутствии автокорреляции остатков принимается.
Если di < DW < d
u или 4 - d
u < DW < 4— di, то гипотеза об отсутствии автокорреляции не может быть ни принята, ни отклонена.
Не обращаясь к таблице критических точек Дарбина-Уотсона, можно пользоваться “грубым” правилом и считать, что автокорреляция остатков отсутствует, если 1.5 < DW < 2.5. Для более надежного вывода целесообразно обращаться к таблицам.
При наличии автокорреляции остатков полученное уравнение регрессии обычно считается неудовлетворительным.
В рассмотренном выше примере зависимости реального потребления от численности населения введение новой объясняющей переменной DINC - располагаемого дохода - позволяет существенно увеличить статистику DW. В этом случае переменная POP становится незначимой (ее t-статистика равна 0.16) и ее целесообразно исключить из рассмотрения. Высокий уровень R
2 в первоначальном уравнении объяснялся не тем, что динамика численности населения определяла динамику объема реального потребления, а тем, что обе эти переменные имели выраженную тенденцию (тренд) возрастания в рассматриваемый период.
Подробно проблема автокорреляции и другие свойства отклонений рассматриваются в главе 9.
Конечно, статистический анализ построенной регрессии является достаточно сложным и многоступенчатым процессом, имеющим определенную специфику в каждом конкретном случае. Однако базовыми пунктами такого анализа, отраженными во всех эконометрических пакетах, являются описанные в данной главе проверка статистической значимости коэффициентов регрессии и коэффициента детерминации, анализ статистики Дарбина-Уотсона.
Пример 6.1. Анализируется объем S сбережений некого домохозяйства за 10 лет. Предполагается, что его размер St в текущем году t зависит от величины
yt-і располагаемого дохода Y в предыдущем году и от величины ц реальной процентной ставки R в рассматриваемом году. Статистические данные представлены в табл. 6.1.
|
Таблица 6.1 |
|
|
|
Год |
80 |
81 |
82 |
83 |
84 |
85 |
86 |
87 |
88 |
89 |
90 |
|
У(тыс. у.е.) |
100 |
ПО |
140 |
150 |
160 |
160 |
180 |
200 |
230 |
250 |
260 |
|
Z(%) |
2 |
2 |
3 |
2 |
3 |
4 |
4 |
3 |
4 |
5 |
5 |
|
S(Tbic. у.е.) |
20 |
25 |
30 |
30 |
35 |
38 |
40 |
38 |
44 |
50 |
55 |
Необходимо:
а) по МНК оценить коэффициенты линейной регрессии S = Ро + PiY + P2Z;
б) оценить статистическую значимость найденных эмпирических коэффициентов регрессии t>o, Ьц Ьг;
в) построить 95%-ные доверительные интервалы для найденных коэффициентов;
2
г) вычислить коэффициент детерминации R и оценить его статистическую значимость при а = 0.05;
д) определить, какой процент разброса зависимой переменной объясняется данной регрессией;
2
е) сравнить коэффициент детерминации R со скорректированным коэффи-циентом детерминации R ;
ж) вычислить статистику DW Дарбина-Уотсона и оценить наличие автокорреляции;
з) сделать выводы по качеству построенной модели;
и) оценить предельную склонность MPS к сбережению, существенно ли она отличается от 0.5;
к) увеличивается или уменьшается объем сбережений с ростом процентной ставки; будет ли ответ статистически обоснованным;
л) спрогнозируйте средний объем сбережений в 1991 г., если предполагаемый доход составит 270 тыс. у. е., а процентная ставка будет равна 5.5.
|
а) Для наглядности изложения приведем таблицы промежуточных вычислений: |
|
|
|
Год |
Y |
Z |
S |
Y2 |
Z2 |
YZ |
YS |
ZS |
|
80 |
100 |
2 |
20 |
10000 |
4 |
200 |
2000 |
40 |
|
81 |
ПО |
2 |
25 |
12100 |
4 |
220 |
2750 |
50 |
|
82 |
140 |
3 |
30 |
19600 |
9 |
420 |
4200 |
90 |
|
83 |
150 |
2 |
30 |
22500 |
4 |
300 |
4500 |
60 |
|
84 |
160 |
3 |
35 |
25600 |
9 |
480 |
5600 |
105 |
|
85 |
160 |
4 |
38 |
25600 |
16 |
640 |
6080 |
152 |
|
86 |
180 |
4 |
40 |
32400 |
16 |
720 |
7200 |
160 |
|
87 |
200 |
3 |
38 |
40000 |
9 |
600 |
7600 |
114 |
|
88 |
230 |
4 |
44 |
52900 |
16 |
920 |
10120 |
176 |
|
89 |
250 |
5 |
50 |
62500 |
25 |
1250 |
12500 |
250 |
|
90 |
260 |
5 |
55 |
67600 |
25 |
1300 |
14300 |
275 |
|
Сумма |
1940 |
37 |
405 |
370800 |
137 |
7050 |
76850 |
1472 |
|
Среднее |
176.3636 |
3.3636 |
36.8182 |
33709.0909 |
12.4546 |
640.9091 |
6986.3636 |
133.8182 |
|
Ку, -у)2 |
Е(л -z)2 |
H^-s)2 |
IN"
1
1
И |
Х(Уі - y)(si -s) |
?(Zi -z)(Si -s) |
|
28654.55 |
12.5455 |
1087.636 |
524.5451 |
5422.727 |
109.7272 |
Ьо = 2.9619423
Ьі = 0.124189
b
2 = 3.553841
Таким образом, эмпирическое уравнение регрессии имеет вид:
s
t =2.9619423 + 0.124189- y
t + 3.553841-z
t.
пе
Найденное уравнение позволяет рассчитать модельные значения st зависимой
семенной S и вычислить отклонения gj реальных значений от модельных: |
|
|
|
Год |
S |
S |
еі |
2
е
1 |
еі Сі-і |
(еі - ем)2 |
|
80 |
20 |
22.48852 |
-2.48852 |
6.19273 |
- |
- |
|
81 |
25 |
23.73041 |
1.269594 |
1.61187 |
3.75811 |
14.12339 |
|
82 |
30 |
31.00991 |
-1.00991 |
1.01992 |
-2.27950 |
5.19612 |
|
83 |
30 |
28.69796 |
1.30204 |
1.69523 |
2.31194 |
5.34507 |
|
84 |
35 |
33.49369 |
1.50631 |
2.26896 |
0.20427 |
0.04173 |
|
85 |
38 |
37.04753 |
0.95247 |
0.90719 |
-0.55384 |
0.30674 |
|
86 |
40 |
39.53131 |
0.46869 |
0.21967 |
-0.48378 |
0.23404 |
|
87 |
38 |
38.46125 |
-0.46125 |
0.21275 |
-0.92994 |
0.86479 |
|
88 |
44 |
45.74076 |
-1.74076 |
3.03024 |
-1.27951 |
1.63714 |
|
89 |
50 |
51.77838 |
-1.77838 |
3.16263 |
-0.03762 |
0.00141 |
|
90 |
55 |
53.02027 |
1.97973 |
3.91933 |
3.75811 |
14.12332 |
|
Сумма |
405 |
405 |
« 0 |
24.24058 |
- |
41.87375 |
|
Среднее |
36.81818 |
36.81818 |
- |
- |
- |
- |
б) Проанализируем статистическую значимость коэффициентов регрессии, предварительно рассчитав их стандартные ошибки по формулам (6.24). Попутно заметим, что дисперсия регрессии вычисляется по формуле (6.22):
2
Ее,
24.24058
S
2 =
= 3.03.
и - ш - 1 8
Тогда стандартная ошибка регрессии S = 1.7407.
Следовательно, дисперсии и стандартные ошибки коэффициентов равны:
I 31104.119-12.54545 + 11.314- 28654.55 - 2 • 176.3636 • 3.3636 • 524.5451
— +-
II
Su =
•3.03= 3.5832;
28654.55 • 12.54545 - 275147.56 12.54545
Sb = -
1 28654.55-12.54545-275147.56
3.03 = 0.00045;
28654.55
Su =
•3.03 = 1.0294.
28654.55 • 12.54545 - 275147.56
S
b2 =1.0146.
S
bo = 1.8929; S
bj =0.0212;
Рассчитаем по формуле (6.33) соответствующие t-статистики:
t
b = 1.565; t
b[ = 5.858; t
b = 3.503.
На первый взгляд (используя “грубое” правило) только статистическая значимость свободного члена вызывает сомнения. Два других коэффициента имеют t-статистики, превышающие тройку, что является признаком их высокой статистической значимости. Однако убедимся в таком выводе на основе более детального
анализа. Для использования таблиц критических точек необходимо выбрать требуемый уровень значимости. Обычно это прерогатива исследователя. Часто требуемая точность анализа определяется субъектами, для которых этот анализ осуществляется. В нашем примере мы возьмем в качестве уровней значимости самые популярные в экономическом анализе значения: ос = 0.05; а = 0.01. Тогда для определения статистической значимости коэффициентов по таблице критических точек распределения Стьюдента (приложение 2) определяются соответствующие КрИТИЧеСКИе ТОЧКИ t
Kp = t g : to.025;8 = 2.306, to.005; 8 = 3.355.
—. n — m — 1
2
Таким образом, |t
b | > t
Kp., |t
b I > t
Kp. при обоих уровнях значимости. Следовательно, оба этих коэффициента статистически значимы, а значит, переменные Y и
< t
Kp, то bo статисти
R имеют существенное линейное влияние на S. Так как
чески незначим (значимость свободного члена невысока), и он на данном этапе может не использоваться в модели. Однако наличие свободного члена в линейном уравнении может лишь уточнить вид зависимости. В экономическом смысле свободный член отражает экзогенную среду. Поэтому, если нет серьезных причин для удаления свободного члена из уравнения регрессии, то лучше его использовать в модели.
в) 95 %-ные доверительные интервалы для коэффициентов определяем по формуле (6.30):
2.9619423 -2.306-1.8929 < р
0< 2.9619423 + 2.306-1.8929;
0.124189-2.306-0.0212 < рі< 0.124189 +2.306-0.0212; 3.553841 -2.306-1.0146 < (3
2 < 3.553841 + 2.306-1.0146.
-1.4031 <Ро< 7.3270; 0.0753 < Рі < 0.1731; 1.2142 < р
2 < 5.8935.
г) Коэффициент детерминации R
2 рассчитывается по формуле (6.34):
= 0.9777.
24.2408
1087.636
2
Анализ статистической значимости коэффициента детерминации R осуществляется на основе F-статистики (6.38):
= 175.3732.
0.9777 8
1-0.9777 2
Для определения статистической значимости F-статистики сравним ее с соответствующей критической точкой распределения Фишера (приложение 4):
F
Kp. Fa; m; n-m-1 Fo 05;2;8 4.46.
Так как F
Hag
n = 175.3732 > F
Kp = 4.46, то статистика F, а следовательно, и коэффициент детерминации R статистически значимы Это означает, что совокупное влияние переменных Y и SR на переменную S существенно. Этот же вывод можно было бы сделать без особых проверок только по уровню коэффициента детерминации. Он весьма близок к единице.
д) На основе проведенных рассуждений и вычислений можно сделать вывод, что построенное уравнение регрессии объясняет 97.77 % разброса зависимой переменной S. Однако напомним, что коэффициент детерминации может быть достаточно высоким и при наличии совпадающих трендов у рассматриваемых переменных. Поэтому для уверенности в его обоснованности необходимы дополнительные исследования, например, по величине статистики Дарбина-Уотсона.
е) Скорректированный коэффициент детерминации R
2 рассчитывается по формуле (6.36):
R
2 = 1 - (1 -0.9777)--^—^ = 0.9721.
8
Как и следовало ожидать, он меньше обычного коэффициента детерминации.
ж) Статистику DW Дарбина-Уотсона вычислим по формуле (6.47):
DW
1.72742.
41.87375
24.24058
Для проверки статистической значимости DW воспользуемся таблицей критических точек Дарбина-Уотсона (приложение 5). При уровне значимости а = 0.05 и числе наблюдений п = 11 имеем:
ф = 0.658; d
u= 1.604.
Так как 1.604 < DW < 2.396 (d
u < DW < 4 - d
u), то гипотеза об отсутствии автокорреляции не отклоняется, т. е. имеются основания считать, что автокорреляция остатков отсутствует. Это является одним из подтверждений высокого качества модели. Здесь, правда, необходимо отметить, что для обоснованного вывода о наличии автокорреляции число наблюдений должно быть достаточно велико. В реальности обычно число наблюдений п существенно превышает число наблюдений для нашего примера, и предложенная схема анализа весьма эффективна.
з) По всем статистическим показателям модель может быть признана удовлетворительной. У нее высокие t-статистики. Очень хороший коэффициент детерминации R . В модели отсутствует автокорреляция остатков. Все это дает основание считать построенную модель весьма удачной. Она может быть использована для целей анализа и прогнозирования.
и) Склонность к сбережению MPS в данной модели отражается через коэффициент Ьі, определяющий, на какую величину вырастет объем сбережений при росте располагаемого дохода на одну единицу. Таким образом, MPS = 0.124189.
Для анализа, существенно или нет MPS отличается от 0.5, используем схему проверки следующей гипотезы:
Н
0: М(Рі) = 0.5,
Ир M(Pi) < 0.5.
Для проверки данной гипотезы воспользуемся статистикой (6.26), которая при справедливости Но имеет распределение Стьюдента с числом степеней свободы ?= 11-2-1 =8.
= -17.7269.
0.124189-0.5
0.0212
Критическая точка t
Kp = t
a; n-m-l для проверки гипотезы отыскивается по таблице критических точек распределения Стьюдента (приложение 2): to o5; 8
= 1.860.
Так как I T
HagJ
= 17.7269 > 1.860 = t
Kp , то Но должна быть отклонена в пользу Hi. Действительно гипотетическая склонность к сбережению в 50 % явно завышена по сравнению с модельными (полученными по реальным данным) в 12.4 %.
к) В силу того, что коэффициент Ьг является статистически значимым, то можно утверждать, что с ростом процентной ставки увеличивается объем сбережений (коэффициент 1)2 имеет положительный знак). Ответ будет статистически обоснованным
л) Средний объем сбережений в 1991 г., если предполагаемый доход составит 270 тыс. у. е., а процентная ставка будет равна 5.5,
M(S| Y = 270,RS = 5.5) = 2.9619423 + 0.124189-270 + 3.553841-5.5 = 56.039.
Полученная точечная оценка условного математического ожидания может быть дополнена интервальной оценкой, получаемой по формуле (6.32). Для наглядности приведем ряд промежуточных результатов:
|
|
|
'1.182602134 |
-0.005314218 |
- 0.04592’ |
|
1 |
|
-0.00531422 |
0.000148755 |
- 0.00622 |
; Хі99і - |
270 |
|
- 0.04592002 |
-0.006219683 |
0.339765 |
|
5.5 |
|
Х,'99| = [і 270 5.5]; Х^991(ХТХ) !Х1991 = 0.45 7 4 75. |
Тогда при уровне значимости а = 0.05 по формуле (6.32) имеем:
56.039 - 2.306-1.7407 ?о.457475 < M(S I Х1991) < 56.039 + 2.306-1.7407 л/о.457475 ;
53.324 < M(S I X1991) < 58.754.
Таким образом, среднее значение потребления S в 1991 г. при планируемых уровне дохода Y = 270 и процентной ставке SR = 5.5 с вероятностью 95 % будет находиться в интервале (53.324; 58.754).
Вопросы для самопроверки
1. Как определяется модель множественной линейной регрессии?
2. Перечислите предпосылки МНК. Каковы последствия их невыполнимости?
3. Что характеризуют коэффициенты регрессии?
4. В чем суть МНК для построения множественного линейного уравнения регрессии?
5. Опишите алгоритм определения коэффициентов множественной линейной регрессии по МНК в матричной форме.
6. Приведите формулы расчета дисперсий и стандартных ошибок коэффициентов регрессии.
7. Как определяется статистическая значимость коэффициентов регрессии?
8. Как строятся интервальные оценки коэффициентов регрессии и в чем их суть?
2
9. В чем суть коэффициента детерминации R ?
10. Чем скорректированный коэффициент детерминации отличается от обычного?
11. Какие значения могут принимать обычный и скорректированный коэффициент детерминации при наличии свободного члена в уравнении регрессии?
12. Как осуществляется анализ статистической значимости коэффициента детерминации?
13. Как используется F-статистика в регрессионном анализе?
14. Что такое автокорреляция остатков и каковы ее виды?
15. В чем суть статистики Дарбина-Уотсона и как она связана с коэффициентом корреляции между соседними отклонениями?
16. Как анализируется статистическая значимость статистики Дарбина-Уотсона?
17. Определите с приведением соответствующих аргументов истинны, ложны или являются неопределенными следующие утверждения:
а) МНК является наилучшим методом определения коэффициентов множественной линейной регрессии;
б) выполнение соответствующих предпосылок является обязательным условием применения МНК;
в) близость к нулю коэффициента детерминации означает его статистическую незначимость;
г) стандартные ошибки коэффициентов регрессии определяются значениями всех коэффициентов регрессии;
д) скорректированный и обычный коэффициенты детерминации совпадают
2 2
только в случаях, когда R = 1 или R = 0;
е) значения t-статистик для коэффициентов регрессии во многом определяются числом степеней свободы;
ж) чем больше число степеней свободы, тем точнее оценки коэффициентов регрессии;
2
з) если коэффициент детерминации R статистически значим, то статистически значимы и все коэффициенты регрессии и наоборот;
и) если R
2 = 1, то F = 1; если R
2 = 0, то F = 0;
к) если для уравнения регрессии все t-статистики, статистики F и DW являются высокими, то уравнение регрессии является качественным;
л) для статистики Дарбина-Уотсона всегда выполняется соотношение 0 < DW < 4;
м) число степеней свободы для общей суммы квадратов отклонений при любом числе объясняющих переменных равно (п —1) при объеме выборки п;
2
и) в качественном уравнении регрессии коэффициент детерминации R всегда больше, чем 0.9;
о) увеличение количества объясняющих переменных всегда увеличивает скорректированный коэффициент детерминации;
и) коэффициент детерминации является мерой сравнения качества любых регрессионных моделей.
18. Дано уравнение множественной регрессии Y = Ро + РіХ] + Р2Х2 + (З3Х3 + в.
Как проверить гипотезы Н
(): Pi = Р2; Н
(): (Зз = 2?
Упражнения и задачи
Вычислите величину стандартной ошибки регрессии, если
а) Хе^ = 750; n = 50; т = 3;
б) = 600; п = 25; т = 3; модель не содержит свободного члена.
По следующим статистическим данным постройте три регрессионные модели
|
Y |
Хі |
Х2 |
|
1 |
0 |
3 |
|
3 |
1 |
1 |
|
5 |
3 |
0 |
|
11 |
4 |
-2 |
а) Y = ао + аіХі+ s,
б) Y = уо + у
2Х
2 + 8,
B)Y = po + PiX
1 + p
2X
2 + s.
а) Будут ли справедливы гипотезы Но: ад = Рі; Но: у
2= р
2?
б) Каковы выводы из построенных моделей?
Проверяются две регрессии для описания поведения зависимой переменной Y:
Y = ао + аіХі+ ?,
Y = Ро + PiXi + р
2Х
2 + s.
При каких условиях будут справедливы следующие утверждения для оценок данных регрессий:
а) аі =Ьі;
б) Eef<Evf;
в) коэффициент аі статистически значим при 5 %-ном уровне значимости, а коэффициент Ьі - нет;
г) коэффициент Ьі статистически значим при 5 %-ном уровне значимости, а коэффициент аі - нет.
Предполагается, что объем Q предложения некоторого блага для функционирующей в условиях конкуренции фирмы зависит линейно от цены Р данного блага и заработной платы W сотрудников фирмы, производящих данное благо:
Q = Ро + РіР + P
2W
2 + s.
Статистические данные, собранные за 16 месяцев, занесены в следующую таблицу:
|
|
|
Q |
20 |
35 |
30 |
45 |
60 |
69 |
75 |
90 |
105 |
ПО |
120 |
130 |
130 |
130 |
135 |
140 |
|
Р |
10 |
15 |
20 |
25 |
40 |
37 |
43 |
35 |
38 |
55 |
50 |
35 |
40 |
55 |
45 |
65 |
|
W |
12 |
10 |
9 |
9 |
8 |
8 |
6 |
4 |
4 |
5 |
3 |
1 |
2 |
3 |
1 |
2 |
|
а) Оцените по МНК коэффициенты уравнения регрессии. |
б) Проверьте гипотезы о том, что при прочих равных условиях рост цены товара увеличивает предложение; рост заработной платы снижает предложение.
в) Определите интервальные оценки коэффициентов при уровне значимости а = 0.1. Как с их помощью проверить гипотезу о статистической значимости коэффициентов регрессии.
г) Оцените общее качество уравнения регрессии.
д) Является ли статистически значимым коэффициент детерминации R ?
е) Проверьте гипотезу об отсутствии автокорреляции остатков.
ж) Сделайте выводы по построенной модели.
5. Для объяснения изменения ВНП за 10 лет строится регрессионная модель с объясняющими переменными - потреблением (С) и инвестициями (I). Получены следующие статистические данные:
|
С( $млрд) |
8 |
9.5 |
11 |
12 |
13 |
14 |
15 |
16.5 |
17 |
18 |
|
I ($млрд) |
1.65 |
1.8 |
2.0 |
2.1 |
2.2 |
2.4 |
2.65 |
2.85 |
3.2 |
3.55 |
|
ВНП($млрд) |
14 |
16 |
18 |
20 |
23 |
23.5 |
25 |
26.5 |
28.5 |
30.5 |
а) Оцените, используя матричную алгебру, коэффициенты линейной регрессионной модели
ВНП = ро + РіІ + р
2С + в.
б) Оцените стандартную ошибку регрессии и стандартные ошибки коэффициентов.
2
в) Вычислите коэффициент детерминации R и скорректированный коэффициент детерминации R
2; сравните их значения. Оцените статистическую значимость R при уровне значимости 0.01.
г) Определите значение статистики DW Дарбина-Уотсона. Имеет ли место автокорреляция остатков?
д) Сделайте вывод по качеству модели.
е) Через три года предполагаются следующие уровни потребления и инвестиций: С = 22,1 = 3.8. Какой уровень ВНП ожидается при этом?
6. По 20 наблюдениям получены следующие результаты:
Z хц = 4.88; Ехц = 2.518; Т,х
й = 26Л; ?xf
2 = 75.15; Е
Уі = 44.7; 1хихй= 13.75; Z хііуі = 22.1; Z х
і2Уі= 125.75; Zy? = 210.4; Zef = 0.015.
а) Оцените коэффициенты линейной регрессии Y = Ро + PiXi + Р
2Х
2 + s.
б) Определите стандартные ошибки коэффициентов.
в) Вычислите R и R
2 .
г) Оцените 95 %-ные доверительные интервалы для коэффициентов Рі и р
2 .
д) Оцените статистическую значимость коэффициентов регрессии и детерминации при уровне значимости а = 0.05.
е) Сделайте выводы по модели.
7. По результатам одинакового количества наблюдений построены два уравнения регрессии:
Y = 1 + 2Хі + е, R
2 = 0.2;
(t) = (2) (4)
Y = 1.5 + ЗХі + 4Х
2 + е, R3=0.6;
(t)= (1.8) (2) (3)
Определите размер выборки. Произошло ли существенное улучшение качества модели?
8. По 25 наблюдениям оценена парная линейная регрессия со свободным членом. При этом R = 0.8. В уравнение добавили еще одну объясняющую переменную и оценили по тем же 25 наблюдениям новое уравнение. Коэффициент детерминации для новой модели составил 0.9, а оцененный коэффициент регрессии при добавленной переменной оказался равным -2.0. Какова дисперсия оценки?
9. По 20 наблюдениям получены следующие результаты:
х
1=7.3; х
2 = 420.7; у = 350.3; ?(
Уі - у)
2 = 62050.35; ?(x
n-хД
2 = 265.52;
E(x
l2 -х
2)
2 =92845.072; Z(x
n -хД^ -х
2) = 4803.5;
E(x
1i-x
1)(y
1-y) = 3950.9; Z(x
l2 - х
2)(
Уі - у) = 75380.645.
Необходимо:
а) оценить коэффициенты линейной регрессии Y = Ро + PiXi + р
2Х
2 + s;
б) оценить статистическую значимость коэффициентов;
в) определить коэффициент детерминации R и скорректированный коэффициент детерминации R
2;
г) оценить общее качество модели.
10. Докажите, что формула (6.18) расчета коэффициента Ьі идентична следующей формуле:
b _ I (У 1 ~ У)[(
хіі ~ хі) ~ b
12 (ха - x
2)] _
1 S[(xii -x
1)-b
12(x
l2 -x
2)f _ ковариация между Xj и Y, очищенная от влияния Х
2 разброс X], очищенный от влияния Х
2
где Ьі
2 - коэффициент регрессии Хі на Х
2: Хі = а + Ьі
2Х
2.
11. Рассматриваются две модели:
А: Y = ро + РіХі + р
2Х
2 + в.
Б: (Y - Х
2) = (Хо + аіХі + а
2Х
2 + ?.
а) Совпадут ли оценки МНК для свободных членов Ро и ао?
б) Совпадут ли оценки МНК для Рі и аі?
в) Как будут связаны коэффициенты Р2 и 0,2
9
г) Можем ли мы сравнивать качество построенных моделей, опираясь на коэффициенты детерминации?
12. Оценивается по МНК регрессионная модель Y = Ро + РіХі + Р2Х2 + Р3Х3 + в. По 25 наблюдениям получена следующая регрессия:
y
t = 4 + 7x
tl + 1.4x
t2 + 4.2x
t3, R
2 = 0.978.
(t) = (1.9) (2.3) (3)
По тем же данным построена модель с ограничением Рі = Рг-y
t = 3 + 5.8(x
tl + x
t2) — 1.3x
t3, R
2 = 0.864.
(t)= (2.7) (2.5)
а) Проверьте гипотезу Ho: Pi = P2. Какую статистику вы использовали и при каких условиях данная проверка обоснована?
б) При отбрасывании из модели Х2 произойдет ли уменьшение скорректированного коэффициента детерминации R
2 ?
в) Уменьшится или увеличится при этом коэффициент детерминации R ?
г) Какую бы из моделей вы отобрали для объяснения поведения зависимой переменной Y?
13. Рассматривается модель линейной регрессии без свободного члена:
Y=piX! + p2X
2+ в.
а) В каких случаях она используется?
б) Как в этом случае оцениваются коэффициенты регрессии?
в) Будут ли справедливы для этой модели следующие равенства:
Е
е! = 0; Ее
іХі1=0; Ze;x
i2=0?
14. Оценена регрессия Y = 10 + 5Хі + O.I6X2 + в. = 2.15; = 0.056;
Со?(Ьц Ьг) = 0.05.
Необходимо проверить гипотезу о том, что коэффициенты Ьі и 1)2 являются обратными числами.
15. Для оценки коэффициентов уравнения регрессии Y = (Зо + РіХ] + Р2Х2 + в вычисления проведены в матричной форме при п =15:
|
20 |
32800 |
140 |
|
31240 |
|
32800 |
72560 |
290540 |
т
; X Y = |
66300920 |
|
140 |
290540 |
1280 |
|
255430 |
|
У = |
2010; х |
, = 2200; |
х2 =10. |
|
а) Определите эмпирические коэффициенты регрессии.
б) Оцените их дисперсию и ковариацию Со?(Ьц Ьг).
в) Проверьте гипотезу Hq: Pi = Р2 = 0.
16. По 30 наблюдениям оценивается уравнение регрессии Y = Ро + PiXj+ Р2Х2 + s. Есть основания считать, что модель будет более реалистичной, если весь интервал наблюдений разбить на два подынтервала и оценивать свою регрессию для каждого из них отдельно. Это связано с изменением институциональных условий между 20 и 21 наблюдениями. Рассчитаны суммы квадратов отклонений So, Si, S2 для общей выборки, для первого и второго подынтервалов соответственно.
S
0 = 150, Si = 90, S
2 = 40.
Есть ли основания считать, что проведенное разбиение целесообразно для повышения качества модели?
17. Для регрессионной модели с тремя объясняющими переменными имеется следующая информация:
|
Сумма квадратов отклонений |
Значение |
Степень свободы |
Дисперсия |
|
Объясненная (^ kf ) Необъясненная (^ ef ) |
84320 |
|
|
|
Общая |
87540 |
19 |
|
а) Проставьте в таблице отсутствующие данные
б) Определите коэффициент детерминации R и скорректированный коэффициент детерминации R
2.
в) Проверьте гипотезу Но: Рі = Р2
= Рз
= 0.
г) Что можно сказать об индивидуальном влиянии каждой из объясняющих переменных на зависимую переменную Y?
18. По месячным данным за 6 лет была построена следующая регрессия:
Y = -12.23 + 0.91 • DINC - 2.1-SR, R
2 = 0.976, t= (-3.38) (123.7) (-3.2) DW = 1.79.
Здесь Y- потребление; DINC - располагаемый доход; SR - процентная банковская ставка по вкладам.
а) Оцените, не прибегая к таблицам, качество построенной модели.
б) Совпадает ли направление влияния объясняющих переменных с теоретическим?
в) Можно ли по модели оценить предельную склонность к потреблению?
г) Есть ли основания считать, что практически весь доход уходит на потребление?
д) Рассчитайте стандартные ошибки коэффициентов.
е) Рассчитайте F-статистику для коэффициента детерминации и оцените его статистическую значимость.
ж) Определите, имеет ли место автокорреляция остатков первого порядка, з) Имеет ли смысл добавить в уравнение регрессии еще какую-либо объясняющую переменную?
Все публикации раздела