СТАТИСТИЧЕСКИЕ ВЫВОДЫ: ОЦЕНКИ И ПРОВЕРКА ГИПОТЕЗ
Статистические выводы - это заключения о генеральной совокупности (т. е. о законе распределения исследуемой СВ и его параметрах, либо о наличии и силе связи между исследуемыми переменными) на основе выборки, случайно отобранной из генеральной совокупности. Например, анализ дохода (X) населения некоторого двухмиллионного города реально может быть осуществлен только на базе выборки ограниченного объема (пусть п = 1000). В данном случае не
составит большого труда оценить средний доход х = X
х, /
п и разброс
і=і
2
П — 2 /
S = Z(
xi
_х) /
п в доходах субъектов, попавших в выборку. Далее
і=і
встает вопрос: можно ли считать, что полученные значения будут такими же для всего города. Другими словами, обобщение результатов, полученных по выборке, на генеральную совокупность и есть суть статистических выводов. При исследовании различных параметров генеральной совокупности на основе выборки возможно лишь получение оценок этих параметров. Эти оценки получаются из ограниченного набора данных, что влечет за собой вероятность погрешности. Заметим, что значения оценок могут изменяться от выборки к выборке. Процесс нахождения оценок по определенному правилу (формуле) будем называть оцениванием. Цель любого оценивания - получение наиболее точного значения оцениваемой характеристики. Можно выделить два вида оценивания: оценивание вида распределения и оценивание параметров распределения. В качестве оценки вида распределения (в силу закона больших чисел) можно взять выборочное распределение, подсчитав частоты попадания рассматриваемой СВ в заданные подынтервалы интервального статистического ряда. Процедура оценивания всегда однотипна. На основе выборки с помощью соответствующей формулы рассчитывается оценка исследуемой характеристики. В качестве оценок параметров распределения генеральной совокупности берутся их выборочные оценки. При этом различают два вида оценок - точечные и интервальные.
После определения оценок обычно встает вопрос об их качестве и статистической значимости. С другой стороны, часто до определения оценок выдвигаются предположения о значениях исследуемых параметров. Анализ соответствия результатов выборки выдвигаемым предположениям и определение статистической значимости полученных выводов обычно осуществляются по схеме статистической проверки гипотез, что также требует рассмотрения.
3.1. Точечные оценки и их свойства
Пусть оценивается некоторый параметр ? наблюдаемой СВ X генеральной совокупности. Пусть из генеральной совокупности извлечена выборка объема п: хі, хг, ..., х
п, по которой может быть найдена оценка ? параметра ?. Например, для нормального закона распределения с плотностью вероятности
|
f(x) |  |
(x-m)
2 2у
2
параметрами являются математическое ожидание m и среднее квадратическое отклонение а.
Точечной оценкой ? параметра ? называется числовое значение этого параметра, полученное по выборке объема н.
* _ 1
п
Например, оценками m и а(х) могут быть m =х = —X
х! и
ш=і
* 11
п _ о
а =ав= , -і(Хі-х) соответственно.
V п 1=1
Нетрудно заметить, что оценка ? является функцией от выборки, т. е. ? = ? (хі, х
2, ..., х
п). Так как выборка носит случайный характер, то оценка ? является СВ, принимающей различные значения для различных выборок. Любую оценку ? = ? (хі, х
2, ..., x
n ) называют статистикой или статистической оценкой параметра ?.
Число s такое, что I ? - ? I < s называется точностью оценки. Естественно стремление получить по возможности наиболее точную оценку при данном объеме выборки.
Приведем свойства, выполнимость которых желательна для того, чтобы оценка была признана удовлетворительной.
В силу случайности точечной оценки ? она может рассматриваться как СВ со своими числовыми характеристиками - математическим ожиданием М(? ) и дисперсией D(0 ). Чем ближе М(? ) к истинному значению ? и чем меньше D(0 ), тем лучше будет оценка (при прочих равных условиях). Таким образом, качество оценок характеризуется следующими основными свойствами: несмещенность, эффективность и состоятельность.
Оценка ? называется несмещенной оценкой параметра ?, если ее математическое ожидание равно оцениваемому параметру: М(? ) =?.
Хотя каждая отдельная оценка лишь в редких случаях совпадает с соответствующей характеристикой генеральной совокупности, при “аккуратном” оценивании многократное осуществление выборок одного объема 11 обеспечивает совпадение среднего значения оценки по всем выборкам с истинным значением оцениваемого параметра.
Разность М(?) - ? называется смещением или систематической ошибкой оценивания. Для несмещенных оценок систематическая ошибка равна нулю.
Свойство несмещенности оценки является важнейшим, но не единственным. Зачастую существует несколько возможных оценок одного и того же параметра. Какая из них лучше? Очевидно, выбор будет сделан в пользу той из них, вероятность совпадения которой с истинным значением оцениваемого параметра выше. Оценка должна иметь такую плотность вероятности, которая наиболее “сжата” вокруг истинного значения оцениваемого параметра. Нетрудно заметить, что в этом случае она будет иметь наименьшую среди других оценок дисперсию. Оценка ? называется эффективной оценкой параметра ?, если ее дисперсия D(0 ) меньше дисперсии любой другой альтернативной оценки при фиксированном объеме выборки п, т. е. D(0 ) = D
mm. На рис. 3.1 приведена схема, наглядно демонстрирующая преимущество эффективной оценки и^по сравнению с неэффективной оценкой
и*
2 параметра 0.

Каждая отдельная эффективная оценка не гарантирует того, что она дает более точное значение исследуемого параметра, чем менее эффективная. Однако вероятность такого исхода превышает 0.5.
Оценка называется асимптотически эффективной, если с увеличением объема выборки ее дисперсия стремится к нулю, т. е. D(h* )—>0 при п —Э'ОО (индекс п в оценке и* применяется для подчеркивания объема выборки).
Оценка и* называется состоятельной оценкой параметра ?, если и* сходится по вероятности к ? при п —» со, т. е. для любого s > 0
при п—> со Р( I и* - ? I < s) —> 1. Другими словами, состоятельной называется такая оценка, которая дает истинное значение при достаточно большом объеме выборки вне зависимости от значений входящих в нее конкретных наблюдений.
Схема возможного улучшения точности (несмещенности) состоятельной оценки приведена на рис. 3.2.

В большинстве случаев несмещенная оценка является и состоятельной. С другой стороны, состоятельные оценки (возможно, не являющиеся несмещенными при малых объемах выборок) с увеличением объема выборки будут приближаться и лежать все “плотнее” к истинному значению (рис. 3.2). Это указывает на асимптотическую несмещенность состоятельной оценки. Поэтому при невозможности получения несмещенной оценки целесообразно найти хотя бы состоятельную оценку.
Справедливо следующее утверждение: если М(и^) —» ? и D(h^ )—> 0 при и —> со, то и^ - состоятельная оценка параметра ?.
Оценки, являющиеся линейными функциями от выборочных наблюдений, называются линейными.
Очень важную роль в эконометрике играют так называемые наилучшие линейные несмещенные оценки, или коротко BLUE-оценки (Best Linear Unbiased Estimators). Такие оценки, являясь линейными и несмещенными, имеют наименьшую дисперсию среди всех возможных оценок данного класса.
Наиболее употребляемыми методами нахождения точечных оценок являются метод моментов, метод максимального правдоподобия, метод наименьших квадратов, описание которых можно найти в любом учебнике по математической статистике.
3.2. Свойства выборочных оценок
На начальном этапе в качестве оценки той или иной числовой характеристики (математического ожидания, дисперсии и т. п.) берется выборочная числовая характеристика. Затем, исследуя свойства этой оценки, ее уточняют таким образом, чтобы она удовлетворяла описанным выше свойствам.
_ In
Доказано, что выборочная средняя х
в= — Х
хі является несме-
П і=1
щенной и состоятельной оценкой математического ожидания М(Х) генеральной совокупности.
1 п _
2
Выборочная дисперсия D
B = — Х(
хі
-хв) является смещенной
П і=1
оценкой дисперсии D(X) = а
2 СВ X генеральной совокупности, т. к. доказано, что D
B = а
2 ——- . То есть выборочная дисперсия оценивает
н
генеральную дисперсию с недостатком. Хотя при п —» оо ——- —» 1,
н
и оценка D
B является асимптотически несмещенной, но в качестве оценки дисперсии D(X) удобнее брать исправленную дисперсию:
к
Хп
1(х
1
11
S
2 =
— \2
¦XU
2
(3.1)
D
T
Х0т-х
в)
іі-1
11 - 1 і=1
11-11=1
Исправленная дисперсия S
2 является несмещенной и состоятельной оценкой дисперсии D(X) СВ X.
Аналогично вводится исправленное среднее квадратическое от-клонение или так называемый эмпирический стандарт S:
s = Vs
1 = -АА(х, - Х
В)
2 = ,р- Іп,(
Хі - х
в)
2 . (3.2)
V п -11=1 V п -1 і=і
Отметим, что при и > 30 различие между D
B и S
2 (ст
в и S) практически незначимо. Поэтому при большом объеме выборки и ту и другую оценки можно считать несмещенными. В дальнейшем оценки дисперсии D(X) и среднего квадратического отклонения ст(Х) будем обозначать S
2 и S соответственно.
Относительная частота — является несмещенной и состоятель-
н
ной оценкой вероятности Р(Х = х,). Аналогично эмпирическая функ-
* н
ция распределения F (х) = —-
1- (накопленная относительная частота)
11
является несмещенной и состоятельной оценкой (теоретической) функции распределения F(x) = Р(Х < х).
3.3. Интервальные оценки
После получения точечной оценки ? желательно иметь данные о надежности такой оценки. Особенно важно иметь сведения о точности оценок для небольших выборок (поскольку с возрастанием объема п выборки несмещенность и состоятельность основных оценок гарантируется утверждениями математической статистики). Поэтому точечная оценка может быть дополнена интервальной оценкой - интервалом (?ь ?
2), внутри которого с наперед заданной вероятностью у находится точное значение оцениваемого параметра ?. Задачу определения такого интервала называют интервальным оцениванием, а сам интервал - доверительным интервалом. При этом у называют доверительной вероятностью или надежностью, с которой оцениваемый параметр ? попадает в интервал (?і, ?
2).
Зачастую для определения доверительного интервала заранее выбирают число а = 1 - у, 0< а < 1, называемое уровнем значимости, и находят два числа ?і и ?
2, зависящих от точечной оценки ? такие, что
Р(?і < ? < ?
2) = 1 - а = у. (3.3)
В этом случае говорят, что интервал (?і, ?2) накрывает неизвестный параметр ? с вероятностью (1 - а) или в 100(1 - а)% случаев. Границы интервала ?і и ?2 называются доверительными, и они обычно находятся из условия Р( 0 < ?і) = Р( 0 > ?2) = а/2 .
|
Р(?і < ? < ?2) = 1 - а |
 |
|
Рис. 3.3 |
Длина доверительного интервала, характеризующая точность интервальной оценки, зависит от объема выборки п и надежности у (уровня значимости а = 1 - у). При увеличении величины п длина доверительного интервала уменьшается, а с приближением надежности у к единице - увеличивается. Выбор а (или у = 1 - а) определяется конкретными условиями. Обычно используется а = 0.1; 0.05; 0.01, что соответствует 90, 95, 99 % -ным доверительным интервалам.
Общая схема построения доверительного интервала следующая:
1. Из генеральной совокупности с известным распределением СВ X f(x, 0) извлекается выборка объема и, по которой находится точечная оценка 0 параметра 0.
2. Строится СВ Y(0), связанная с параметром 0 и имеющая известную плотность вероятности f(y, 0).
3. Задается уровень значимости а.
4. Используя плотность вероятности СВ Y, определяются два числа Сі и С2 такие, что
Р(сі < Y(0) < с
2) = jf(y,H)dy = 1 - а (3.4)
сі
Значения щ и С2 выбираются, как правило, из условий P(Y(0) < сі) = а/2; P(Y(0) > с
2) = а/2 .
Неравенство Сі < Y(0) < С2 преобразуется в равносильное 0*- 5 < 0 < 0 + 5 такое, что Р(?*- 5 < 0 < ?*+ 5) = 1 - а.
Полученный интервал (? - 5, ?*+ 8), накрывающий неизвестный параметр ? с вероятностью 1 - а, и является интервальной оценкой параметра ?.
Интервальная оценка также носит случайный характер, так как она напрямую связана с результатами выборки. Однако она позволяет нам сделать следующий вывод. Если построен доверительный интервал, который с надежностью у = 1 - а накрывает неизвестный параметр, и его границы рассчитываются по К выборкам одинакового объема п, то в (1 - а)-К случаях построенные интервалы накроют истинное значение исследуемого параметра.
Поскольку в эконометрических задачах часто приходится находить доверительные интервалы параметров СВ, имеющих нормальное распределение, приведем схемы их определения.
3.3.1. Доверительный интервал для математического ожидания нормальной СВ при известной дисперсии
Пусть количественный признак X генеральной совокупности имеет нормальное распределение с заданной дисперсией а
2 и неизвестным математическим ожиданием m (X ~ N(m, а)). Построим доверительный интервал для т.
1. Пусть для оценки m извлечена выборка хі, хг, ..., х
п объема п.
* 1 П _
Тогда m = — ?Xj = х .
П і=1
х — m
2. Составим СВ U =-— . Нетрудно показать, что СВ U имеет стандартизированное нормальное распределение, т. е. U ~ N(0, 1)
№) ?2р
6 2 }
3. Зададим уровень значимости а.
4. Применяя формулу нахождения вероятности отклонения нормальной величины от математического ожидания, имеем:
X -111
P(|U|<u
6) = P( 2
= Р(х —Ug
У 2
<и
б ) = 2
У
(3.5)
)=1-б.
< 111 < X + 11


Это означает, что доверительный интервал ( х-іі
б
2
накрывает неизвестный параметр m с надежностью 1 - а . Точность

оценки определяется величиной 5 = и
б •
2
Отметим, что число и
б определяется по таблице функции Лап-
2
ласа (приложение 1) из равенства Ф( и
б) = -—— = —.
2
2 2
 |
|
Рис. 3.4 |
Пример 3.1. На основе продолжительных наблюдений за весом X пакетов орешков, заполняемых автоматически, установлено, что стандартное отклонение веса пакетов а = 10 г. Взвешено 25 пакетов, при этом их средний вес составил х = 244 г. В каком интервале с надежностью 95 % лежит истинное значение среднего веса пакетов?
Логично считать, что СВ X имеет нормальный закон распределения:
X ~ N(m, 10). Для определения 95 % -го доверительного интервала найдем критическую точку и
б = uo 025 из приложения 1 по соотношению
2
0.95
Ф(и 0.025)--= 0.475. => и 0 025 - 1 96.
2
Тогда по формуле (3.5) построим доверительный интервал:
10 10
(244- 1.96- — ; 244+ 1.96-— ) = (240.8; 247.92).
5 5
3.3.2. Доверительный интервал для математического ожидания нормальной СВ при неизвестной дисперсии В реальности истинное значение дисперсии исследуемой СВ, скорее всего, известно не будет. Это приводит к необходимости ис-
пользования другой формулы при определении доверительного интервала для математического ожидания СВ, имеющей нормальное распределение.
Пусть X ~ N(m, а
2), причем m и а
2 - неизвестны. Необходимо построить доверительный интервал, накрывающий с надежностью у = 1 - а истинное значение параметра іи.
Для этого из генеральной совокупности СВ X извлекается выборка объема и: х
ь х
2,..., х
п.
1. В качестве точечной оценки математического ожидания m используется выборочное среднее х, а в качестве оценки дисперсии
2 2 1 п _
2
а - исправленная выборочная дисперсия S =-Z(
xi
-x) ,
и — 1 І=1
которой соответствует стандартное отклонение S = Vs
2".
2. Для нахождения доверительного интервала строится статистика Т =——^г, имеющая в этом случае распределение Стьюдейта с
S/Vn
числом степеней свободы ? = и - 1 независимо от значений параметров m и а
2.
3. Задается требуемый уровень значимости а.
4. Применяется следующая формула расчета вероятности
Р( I т I < t
6 ) = P(-t
6 < Т < t
6 ) = 1 - а,
,п-1
,п-1
,11-1
(3.6)
2 2 2
где t
6 - критическая точка распределения Стью дейта, которая
,ц-і
находится по соответствующей таблице (приложение 2). Тогда
х — m
рЫб <T<t
6 ) = P(-t
6 <-^<t
6 ) =
2’
П-1 2’
П_1 2’
П_1 S/^
n 2’
П_1
(3.7)
s s
= P(x-t
6 • —j= < m < x +1
6 •—i=)=l-a.
-,n-i yn -,n-i yn
Это означает, что интервал (х -1
®,n-l
2
:х + t
®,n-l
2
) накрывает
неизвестный параметр m с надежностью 1 - а.
3.3.3. Доверительный интервал для дисперсии нормальной СВ Пусть X ~ N(m, а
2), причем m ист
2- неизвестны. Пусть для оценки а
2 извлечена выборка объема и: х
ь х
2, х
п .
1. В качестве точечной оценки дисперсии D(X) используется ис-
2 1
п _ 2
правленная выборочная дисперсия S =-Z(
xi
-x) , которой
И — 1 і=1
S = V? .
соответствует стандартное отклонение
2. Для нахождения доверительного интервала для дисперсии в
2 (n-l)S
3 2
этом случае вводится статистика ч =-~-, имеющая х -рас-
У
пределение с числом степеней свободы ? = и - 1 независимо от значения параметра а
2.
3. Задается требуемый уровень значимости а.
4. Тогда, используя таблицу критических точек х
2-распределения,
нетрудно указать критические точки ч
2 , ч
2
1
6 1
6 1 1--,п-1 . п-1
2 2
торых будет выполняться следующее равенство:
, для ко
) = 1-б.
Р( ч
:
(3.8)
< ч < ч‘
,п-1
1 — ,п—і 2
Подставив вместо х соответствующее значение, получим Р(ч
2 <ч
2<ч
2 ) = Р( ч
2 <
(п ~ < ч
2 ) =
R б б
Лг
2 б
—,n-l 1—,п—1 У — ,п-1
2 2 2
1--,п-1
2
S
2(и — 1) 2 S
2(и — 1) ,
г
= Р(^--<у --) = 1-б.
(3.9)
6 1 —,п-1
2
іДп-1
2
тт S
2(n-1) 2 S
2(n-1)
Неравенство —j--<у <-Д
1-- может быть преобразовано в
1-
б,п-1
2
, п-1
следующее неравенство:
S
п-1
п-1
(3.10)
<у< S
,п—і
1-—, 11-1 2
Таким образом, доверительный интервал (
S
2 (п — 1) S
2 (п — 1)
іДп-1
2
накрывает неизвестный параметр а
2 с надежностью 1 - а . А доверительный интервал (S —^—— , S
п-1
) с надежностью 1 - а
,п—і
накрывает неизвестный параметр а.
3.4. Статистическая проверка гипотез
3.4.1. Основные понятия
Большинство эконометрических моделей требуют многократного улучшения и уточнения. Для этого требуется проведение соответствующих расчетов, связанных с установлением выполнимости или невыполнимости тех или иных предпосылок, анализом качества найденных оценок, достоверностью полученных выводов. Обычно эти расчеты проводятся по схеме статистической проверки гипотез. Поэтому знание основных принципов проверки гипотез является обязательным для эконометриста.
Во многих случаях необходимо знать закон распределения генеральной совокупности. Если закон распределения неизвестен, но есть основания предположить, что он имеет определенный вид (назовем его А), выдвигают гипотезу: генеральная совокупность (СВ X) распределена по закону А. Например, можно выдвинуть предположение, что доход населения, ежедневное количество покупателей в магазине, размер выпускаемых деталей имеют нормальный закон распределения.
Возможен случай, когда закон распределения известен, а его параметры неизвестны. Если есть основания предположить, что неизвестный параметр ? равен ожидаемому числу ?о, выдвигают гипотезу: ? = ?о. Например, можно выдвинуть предположение о величине среднего дохода населения, среднего ожидаемого дохода по акциям, о разбросе в доходах и т. д.
Статистической называют гипотезу о виде закона распределения или о параметрах известного распределения. В первом случае гипотеза называется непараметрической, а во втором - параметрической.
Гипотеза Н
0, подлежащая проверке, называется нулевой (основной). Наряду с нулевой рассматривают гипотезу Н
ь которая будет приниматься, если отклоняется Но. Такая гипотеза называется альтернативной (конкурирующей). Например, если проверяется гипотеза о равенстве параметра ? некоторому значению ?о, т. е. Н
0: ? = ?о, то в качестве альтернативной могут рассматриваться следующие гипотезы:
Н^іи^Ио; Н|
2):и>и
0; Н|
3):и<и
0; Н|
4) :и = и
т (и
г ф и
0).
Выбор альтернативной гипотезы определяется конкретной формулировкой задачи, а нулевая гипотеза часто специально подбирается так, чтобы отвергнуть ее и принять тем самым альтернативную гипотезу. Для того чтобы принять гипотезу о наличии корреляции между двумя экономическими показателями (например, между инфляцией и безработицей), можно опровергнуть гипотезу об отсутствии такой корреляции, взяв ее в качестве нулевой гипотезы.
Гипотезу называют простой, если она содержит одно конкретное
предположение (Н
0 :и = и
0, Hj
4) :и = иД. Гипотезу называют сложной, если она состоит из конечного или бесконечного числа простых гипотез (Hj
!) : иФ и
0; Н|
2):и>и
0; Н|
3) :и < и
0. ).
Сущность проверки статистической гипотезы заключается в том, чтобы установить, согласуются или нет данные наблюдений и выдвинутая гипотеза. Можно ли расхождение между гипотезой и результатом выборочных наблюдений отнести за счет случайной погрешности, обусловленной механизмом случайного отбора? Эта задача решается с помощью специальных методов математической статистики - методов статистической проверки гипотез.
При проверке гипотезы выборочные данные могут противоречить гипотезе Но. Тогда она отклоняется. Если же статистические данные согласуются с выдвинутой гипотезой, то она не отклоняется. На практике часто в таких случаях говорят, что нулевая гипотеза принимается (такая формулировка не совсем точна, однако она широко распространена). Статистическая проверка гипотез на основании выборочных данных неизбежно связана с риском принятия ложного решения. При этом возможны ошибки двух родов.
Ошибка первого рода состоит в том, что будет отвергнута правильная нулевая гипотеза.
Ошибка второго рода состоит в том, что будет принята нулевая гипотеза, в то время как в действительности верна альтернативная гипотеза.
Возможные результаты статистических выводов представлены следующей таблицей:
|
Таблица 3.1 |
|
|
|
Результаты проверки гипотезы |
Возможные состояния гипотезы |
|
верна Но |
верна Hi |
|
Гипотеза Но отклоняется |
Ошибка первого рода |
Правильный вывод |
|
Г ипотеза Но не отклоняется |
Правильный вывод |
Ошибка второго рода |
В большинстве случаев последствия указанных ошибок неравнозначны. Первая приводит к более осторожному, консервативному решению, вторая - к неоправданному риску. Что лучше или хуже - зависит от конкретной постановки задачи и содержания нулевой гипотезы. Например, если Н
0 состоит в признании продукции предприятия качественной, и допущена ошибка первого рода, то будет забракована годная продукция. Допустив ошибку второго рода, мы отправим потребителю брак. Очевидно, последствия второй ошибки более серьезны с точки зрения имиджа фирмы и ее долгосрочных перспектив.
Исключить ошибки первого и второго рода невозможно в силу ограниченности выборки. Поэтому стремятся минимизировать потери от этих ошибок. Отметим, что одновременное уменьшение вероятностей данных ошибок невозможно, так как задачи их уменьшения являются конкурирующими, и уменьшение вероятности допустить одну из них влечет за собой увеличение вероятности допустить другую. В большинстве случаев единственный способ уменьшения вероятности ошибок состоит в увеличении объема выборки.
Вероятность совершить ошибку первого рода принято обозначать буквой а, и ее называют уровнем значимости. Вероятность совершить ошибку второго рода обозначают (5. Тогда вероятность несовершения ошибки второго рода (1 - Р) называется мощностью критерия.
Обычно значения а задают заранее круглыми числами (например, 0.1; 0.05; 0.01 и т. и ), а затем стремятся построить критерий наибольшей мощности. Таким образом, если а = 0.05, то это означает, что исследователь не хочет совершить ошибку первого рода более чем в 5 случаях из 100.
3.4.2. Критерии проверки. Критическая облаетъ
Проверку статистической гипотезы осуществляют на основании данных выборки. Для этого используют специально подобранную СВ (статистику, критерий), точное или приближенное значение которой известно. Эту величину обозначают:
Z (или U) - если она имеет стандартизированное нормальное распределение;
Т - если она распределена по закону Стьюдейта;
X
2 - если она распределена по закону х
2;
F - если она имеет распределение Фишера.
В этом параграфе в целях общности будем обозначать такую СВ через К.
Таким образом, статистическим критерием называют СВ К, которая служит для проверки нулевой гипотезы. После выбора определенного критерия множество всех его возможных значений разбивают на два непересекающихся подмножества: одно из них содержит значения критерия, при которых нулевая гипотеза отклоняется, другое -при которых она не отклоняется. Совокупность значений критерия, при которых нулевую гипотезу отклоняют, называют критической областью. Совокупность значений критерия, при которых нулевую гипотезу не отклоняют, называют областью принятия гипотезы.
Основной принцип проверки статистических гипотез можно сформулировать так: если наблюдаемое значение критерия К (вычисленное по выборке) принадлежит критической области, то нулевую гипотезу отклоняют. Если же наблюдаемое значение критерия К принадлежит области принятия гипотезы, то нулевую гипотезу не отклоняют (принимают).
Точки, разделяющие критическую область и область принятия гипотезы, называют критическими.
Перейдем к определению критических точек, а следовательно, и критической области. В основу этого определения положен принцип практической невозможности маловероятных событий.
Пусть для проверки нулевой гипотезы Но служит критерий К. Предположим, что плотность распределения вероятности СВ К в случае справедливости Но имеет вид f(k|Ho), а математическое ожидание К равно ко. Тогда вероятность того, что СВ К попадет в произвольный
интервал (кі_
а/2, к
а/2), можно найти по формуле:
кб/2
Р(к,_
6/2<К<к
б/2) = Jf(k|H
0)dk. (3.11)
к і-б/2
Зададим эту вероятность равной 1 - а и вычислим критические точки (квантили) К-распределения кі_
а/
2, к
а/
2 из условий:
к1 — 6/2 fj
P(K<k,_
a2)= f f(k|H
0)dk = —,
(3.12)
P(K>k
6G) = f f(k I H
0)dk =
Следовательно,
Р(к,-б/2 < К <кб/2) = 1 - б, a P((K <k,^)u(К > k6/2))=6.
Зададим вероятность а настолько малой (0.05; 0.01), чтобы попадание СВ К за пределы интервала (ki_a/2, ka/2) можно было бы считать маловероятным событием. Тогда, исходя из принципа практической невозможности маловероятных событий, можно считать, что если Н0 справедлива, то при ее проверке с помощью критерия К по данным одной выборки наблюдаемое значение К должно наверняка попасть в интервал (k!_a/2, ka/2). Если же наблюдаемое значение К попадает за пределы указанного интервала, то произойдет маловероятное, практически невозможное событие. Это дает основание считать, что с вероятностью 1 - а нулевая гипотеза Но несправедлива.
Точки ki_a/2, ka/2 являются критическими.

Критическая область (-oo,k1_6/2)u(k6/2,+oo) называется двусторонней критической областью. Она определяется в случае, когда альтернативная гипотеза имеет вид: Ну ? Ф ?о. Кроме двусторонней, рассматривают также односторонние критические области - правостороннюю и левостороннюю.
Правосторонней называют критическую область (ka, +оо), определяемую из соотношения Р(К > ka) = а. Она используется в случае, когда альтернативная гипотеза имеет вид: Ну ? > ?о (рис. 3.6, а).
Левосторонней называют критическую область (-со, кі_а), определяемую из соотношения Р( К < кі_а) = а. Она используется в случае, когда альтернативная гипотеза имеет вид: Ну ? < ?о (рис. 3.6, б).
 |
|
Рис. 3.6 |
Общая схема проверки гипотез
1. Формулировка проверяемой (нулевой - Но) и альтернативной (Hi) гипотез;
2. Выбор соответствующего уровня значимости а;
3. Определение объема выборки и;
4. Выбор критерия К для проверки Н0;
5. Определение критической области и области принятия гипотезы;
6. Вычисление наблюдаемого значения критерия Кнабл;
7. Принятие статистического решения.
Проверка гипотез и доверительные интервалы
Проверка гипотез при двусторонней критической области тесно связана с интервальным оцениванием. При одном и том же уровне значимости а и объеме выборки и попадание гипотетического значения исследуемого параметра в доверительный интервал равносильно попаданию соответствующего критерия в область принятия гипотезы. Поэтому для проверки гипотезы в этом случае можно использовать доверительный интервал. Если гипотетическое значение исследуемого параметра попадает в этот интервал, то делают вывод, что нет оснований для отклонения выдвигаемой гипотезы. Более подробно данная связь рассмотрена в примерах 3.2 - 3.8.
3.5. Примеры проверки гипотез
Рассмотрим применение общей схемы проверки гипотез к конкретным задачам проверки гипотез о математическом ожидании, дисперсии, коэффициенте корреляции, часто встречающимся в эконометрическом анализе. Для каждой из этих гипотез конкретизируем выбор статистики (критерия) и определения критической области.
3.5.1. Проверка гипотезы о математическом ожидании нормальной СВ при известной дисперсии Пусть генеральная совокупность X распределена нормально, причем ее математическое ожидание m неизвестно, а дисперсия а2 известна. Также есть основания предполагать, что m = піо. Тогда
Н0: m = m0,
Hj1} : m ф m0 (Н(2): m > m0; Hf}: m < m0).
Для проверки H0 извлекается выборка объема п: хі, х2, ... , хп и в качестве критерия строится статистика
(3.13)
U = х - т0
- 1 п гг
где х= — Ххі, У = ?у • Доказано, что если Н0 справедлива, то стати-
11 і=і
стика U имеет стандартизированное нормальное распределение (U~N(0,1)).
ловия Ц(иб/2)
1) Пусть в качестве альтернативной рассматривается гипотеза И, : іи Ф іп0. Тогда критические точки иа/2 и иі_а/2 = -иа/2 будут определяться по таблице функций Лапласа (приложение 1) из ус-1-6
X - 111
Если U
іб/2 - нет оснований для отклонения Н0.
>иб/2- гипотеза Н0 отклоняется в пользу альтернативной гипотезы Н[ .
2) При Hj2): in > m0
критической области находят из равенства Ц(иб)
< ІЪ
набл.
Если |U
набл.
критическую точку иа правосторонней
1-26
Если инабл < ua - нет оснований для отклонения Н0.
Если инабл ^ Ua “ Н0 ОТКЛОНЯЮТ В ПОЛЬЗУ Hj2).
3) При Н|3): m < m0 критическая точка Ui_a = -ua.
Если инабл > Ui_a - нет оснований для отклонения Н0.
Если инабл ^ Ui_a - Н0 ОТКЛОНЯЮТ В ПОЛЬЗУ Н|3) .
Пример 3.2. В условиях примера 3.1 проверить гипотезу М(Х) = 250 г при уровне значимости a = 0.05. Если данное утверждение неверно, то станок-автомат требует подналадки.
Н0: m = 250;
Ну m Ф 250.
244-250 10/л/25
-3. В
По формуле (3.13) по данным выборки строим статистику U
данном случае используется двусторонняя критическая область. По таблице функции Лапласа найдем критическую точку ua/2 = и о.о25 = 1.96 Так как | инабл. I = = 3 > 1.96 = иКр., то Но должна быть отклонена в пользу Ну Это свидетельствует о том, что станок требует подналадки. Аналогичный ответ можно получить, используя интервальную оценку (240.8; 247.92), найденную в примере 3.1. Если гипотетическое значение 250 не принадлежит данному интервалу, то обоснован вывод о ложности гипотезы Но.
3.5.2. Проверка гипотезы о математическом ожидании нормальной СВ при неизвестной дисперсии Пусть генеральная совокупность X имеет нормальное распределение, причем ее математическое ожидание m и дисперсия а2 неизвестны. Данная ситуация более реалистична по сравнению с предыдущей. Пусть есть основания утверждать, что m = mo. Тогда строятся следующие гипотезы:
Н0: m = т0,
Н(11): т ф т0 (Hj2) : in > in0; Hf}: m < m0).
Для проверки H0 извлекается выборка объема и: Хі, х2, ... , хп; вы-
_ 1 п
числяются выборочное среднее х = — ?хА и исправленная выборочная
11 і=і
2 1 п _ ?
дисперсия S =-і(Хі-х) , которой соответствует стандартное
п-I і=і
отклонение S = y/s2". Далее строится следующая t-статистика:
х ~ m0
(3.14)
S/Vn ’
имеющая при справедливости Н0 распределение Стьюдейта с и = и -1 степенями свободы. Критическая область строится в зависимости от вида альтернативной гипотезы по аналогии с разделом 3.5.1.
1) При Hj : m ф m0 по таблице критических точек распределения Стьюдента (приложение 2) по заданному уровню значимости а и числу степеней свободы и = и -1 находятся критические точ-
КИ 16/2.П-1 И 11-6/2, п-1 = “16/2.П-1 •
Х ~ 1П0
S/Vn
Если X
Но.
< t6/2 пЧ - нет оснований для отклонения - Но отклоняют в пользу Hj!).
набл.
Если X
>t
6/2.П-1
набл.
2) При Н |2): іи > іп0 определяют критическую точку t(/n_i правосторонней критической области.
Если Тнабл < t6 п_! - нет оснований для отклонения Н0.
Если Тнабл > t6 п_| - Н0 отклоняется в пользу Ну1.
3) При Н|3): іи < іп0 определяют критическую точку ti_aai_i =
= - tan_i левосторонней критической области.
Если Тнабл > -t6 п_, - нет оснований для отклонения Н0.
Если Тнабл < -t6 n_j - Н0 отклоняется в пользу Hj3).
Пример 3.3. Анализируется доход X фирм в отрасли, имеющий нормальное распределение Предполагается, что средний доход в данной отрасли составляет не менее $1 млн По выборке из 49 фирм получены следующие данные: х= $0.9 млн и S = $1.15 млн. Не противоречат ли эти результаты выдвинутой гипотезе при уровне значимости a = 0.01?
Н0: ш= 1;
Ну ш < 1.
0.9-1
Для проверки гипотезы Но строим критерий ТнабЛ =-= -4.67.
0.15/7
Критическую точку левосторонней критической области определяем по таблице критических точек распределения Стьюдента tKp. = - to.oi, 48 = - 2.404. Поскольку Тнабл. 4.67 < —2.404 = tKp, то Но должна быть отклонена в пользу Ну что дает основание считать, что средний доход в отрасли меньше, чем $1 млн.
3.5.3. Проверка гипотезы о величине дисперсии нормальной СВ Многие экономические решения связаны с анализом возможных результатов, точнее, с разбросом возможных результатов. Например, при покупке акций какой-либо компании весьма важно оценить риск от такого вложения, который определяется рассеиванием годовых дивидендов по данным акциям за продолжительный период времени. Такую оценку можно осуществлять на базе анализа дисперсии СВ -размера дивидендов. Следовательно, при изучении многих экономических проблем приходится иметь дело с выдвижением и проверкой гипотез о величине дисперсии. Одной из самых распространенных является гипотеза о величине дисперсии нормальной СВ.
Пусть СВ X ~ N(m, a2); m и а2 неизвестны. Проверяется гипотеза о равенстве дисперсии а2 нормально распределенной генеральной совокупности X гипотетическому (предполагаемому) значению у2. Тогда:
Н0: у2 =Уо>
Н|‘’:у*Уо (Н|2):у >у^; Н<3):у<у2).
Для проверки Н0 извлекается выборка объема и: хь х2, ... , хп; вы-
_ 1 п
числяются выборочное среднее х = — ?xj, исправленная выборочная
И і=1
2 1 п _ ?
дисперсия S =-І(Хі-х) . Тогда критерий проверки Н0 имеет
п-1 і=і
вид:
(3.15)
2 _ (n-l)-S2 Уо
При справедливости Н0 построенная статистика /2 имеет /^распределение с н = и -1 степенями свободы.
1) При Н|!) :у2 Фуі по таблице критических точек /^распределения (приложение 3) по заданному уровню значимости а и числу степеней свободы и = и -1 находят критические точки
ч2_б/2 п_! и 4g/2 п_| двусторонней критической области.
Если ч2_б/2 п_! < ч2абл < 4g/2 n_j - нет оснований для отклонения Н0. Если ч2абл < ч2_б/2 п_] или ч2абл > и 6/2.11-! - Но отклоняется в пользу
н|Г).
2) При Н|2) :у2 > у2 находят критическую точку ч2 п_, правосторонней критической области.
Если ч2набл < Чд п-1 - нет оснований для отклонения Н0.
Если ч2абл > ч2 п_! - Н0 должна быть отклонена в пользу Н||2).
3) При Н|3):у2<у2 находят критическую точку 42_6n_j левосторонней критической области.
Если ч2абл > ч2_б п-1 - нет оснований для отклонения Н0.
Если ч2абл < ч2_б п-1 - Н0 отклоняется в пользу Hj3).
Пример 3.4. Точность работы станка-автомата, заполняющего пакеты порошком, определяется совпадением веса пакетов. Дисперсия веса не должна превышать 25 (г)2 По выборке из 20 пакетов определена исправленная дисперсия
2 1 -О 9 2
S2=-E(XJ -х)2 = 30(г)2.
20-1 і=і
Определите, требуется ли срочная подналадка станка? Принять а = 0.05.
Сформулируем нулевую и альтернативную гипотезы, соответствующие условию задачи:
Но : а2 = 25;
Hi : а2 >25.
2
Рассчитаем наблюдаемое значение критерия у в соответствии с (3.15):
7 19-30 9 2
чнабл. 22-8- Чкр. “ ч0.05; 19. “ 30.14.
25
2 2
Так как чнабл = 22.8 < 30.14 = чкр , то нет оснований для отклонения Но. Другими
словами, имеющиеся данные не дают основания считать, что станок требует срочной подналадки.
3.5.4. Проверка гипотезы о равенстве математических ожиданий двух нормальных СВ при известных дисперсиях При анализе многих экономических показателей приходится сравнивать две генеральные совокупности. Например, можно сравнивать уровни жизни в двух странах по размеру дохода на душу населения; можно сравнивать два варианта инвестирования по размерам средних дивидендов; качество знаний студентов двух университетов -по среднему баллу на комплексном тестовом экзамене. В этих случаях логично провести сравнение по схеме анализа равенства математических ожиданий двух генеральных совокупностей X и Y.
Пусть X ~ N(mx,y:) и Y ~ N(my,y(), причем их дисперсии у2 и у2
известны (например, из предшествующих наблюдений или определены теоретически). По двум выборкам х1;х2, ... , хп и уь у2, ..., уь объемов и и к соответственно необходимо проверить гипотезу М(Х) = M(Y), т. е.
Н0: М(Х) = M(Y),
Hi0 : М(Х) ф M(Y) (Н(2): М(Х) > M(Y); Hf}: М(Х) < M(Y)) В качестве критерия проверки Но принимается СВ U:
(3.16)
х-у
іуі+уІ
и к
При справедливости Н0 СВ U ~ N(0, 1).
1) При Hj ': М(Х) ф М(Y) по таблице функции Лапласа (приложение 1) определяют две критические точки Ui_a/2 и ua/2 из условий
тт/ Ч_1"б
Н111б/2І_ 2 ’ Ul-6/2_U6/2-
Если |инабл I < иб/2 - нет оснований для отклонения Н0.
Если |инабл I > иб/2 - Н0 отклоняется в пользу Н j1 ’.
2) При НІ2): М(Х) >M(Y) критическую точку ua правосторон-
1-26
ней критической области находят из равенства П,(иб) = ———.
Если инабл < иб - нет оснований для отклонения Н0.
Если инабл > иб - Н0 отклоняется в пользу Н||2).
3) При Н|3): М(Х) < M(Y) критическая точка Ui_a левосторонней критической области определяется из соотношения Uj_6 = - иб . Если инабл > Uj_6 - нет оснований для отклонения Н0.
Если инабл < Uj_6 - Н0 отклоняется в пользу Hj3).
3.5.5. Проверка гипотезы о равенстве математических ожиданий двух нормальных СВ при неизвестных дисперсиях Более реалистичной по сравнению с предыдущей ситуацией является случай, когда дисперсии рассматриваемых СВ неизвестны.
Пусть X ~ N(mx,y2) и Y ~ N(my,y2), причем их дисперсии
у2 и у2 неизвестны. Выдвигается гипотеза о равенстве математических ожиданий:
Н0: М(Х) = M(Y),
Hi0 : М(Х) ф M(Y) (Н(2): М(Х) > M(Y); Hf}: М(Х) < M(Y)).
При этих условиях в качестве критерия проверки Но принимают СВ Т:
hi • к • (и + к - 2)
х-у
(3.17)
(n-l)-S“ +(k-l)-S;
где іі, к - объемы выборок хкх2,... , хп и уь у2,... ,ук соответственно;
1 к 9
\—7І(Уі"У) •
к -1 і=і
1 п 9 x=-ix,,s;
іі і=і
1 П , 1 к
-rZ(x,-x)2,y = rZy1,S.
п-I 1=1 к і=і
При справедливости Но построенная статистика Т имеет t-pacnpe-деление Стьюдейта с и = п + к - 2 степенями свободы.
1) При Hj : М(Х) ф M(Y) по таблице критических точек распределения Стьюдента (приложение 2) по заданному уровню значимости а и числу степеней свободы и = п + к - 2 определяются критические точки ^_б/2,п+к_2 и t6/2n+k_2 (tH/2jll+k_2= -t6/2,n+k_2)
двусторонней критической области.
Если |Тнабл I < t6/2 n+k_2 - нет оснований для отклонения Н0.
Если |Тнабл I > t6/2 n+k_2 - Н0 отклоняется в пользу Н,м.
2) При Н|2): М(Х) > M(Y) находят критическую точку t(/n+k_2 правосторонней критической области.
Если Тнабл < t6n+k_2 - нет оснований для отклонения Н0.
Если Тнабл > t6 n+k_2 - Н0 отклоняется в пользу Н|2).
3) При Hi3): М(Х) < M(Y) находят критическую точку tj_6 n+k_2 = -t6 n+k_2 левосторонней критической области.
Если Тнабл > -t6n+k_2 - нет оснований для отклонения Н0.
Если Тнабл < -t6 n+k_2 - Н0 отклоняется в пользу Н|3).
Пример 3.5. В университете проведен анализ успеваемости среди студентов и студенток за последние 25 лет. СВ X и Y - их суммарный балл за время
учебы. Получены следующие результаты: х = 400; S* = 300; у = 420; = 150.
Можно ли утверждать, что девушки в среднем учатся лучше ребят? Принять а = = 0.05.
Для ответа на данный вопрос фактически необходимо проверить следующую гипотезу:
Но : М(Х) = M(Y);
Hi : М(Х) < M(Y).
к = 25: "to.05;25+25-2
-1.68.
По формуле (3.17) строим статистику Т с учетом, что и
400-420 /25- 25• (25 + 25-2)
Тнабл. / = • л — — 4.71; tKp -
л/24-300 + 24-150 V 25 + 25
Поскольку Тнабл = - 4.71 < -1.68 = tKp, то Но должна быть отклонена в пользу Hi, что дает основание утверждать, что в данном университете девушки в среднем учатся лучше ребят.
3.5.6. Проверка гипотезы о равенстве дисперсий
двух нормальных СВ
Зачастую при сравнении двух экономических показателей на первый план выходит анализ разброса значений рассматриваемых СВ. Например, при решении вопроса об инвестировании в одну из двух отраслей остро стоит проблема риска вложений. При сравнении уровней жизни в двух странах среднедушевой доход может оказаться приблизительно равным. Сопоставив разброс в доходах, мы получаем более точное представление об интересуемом нас вопросе. Анализ, аналогичный описанному выше, целесообразно проводить путем сравнения дисперсий исследуемых СВ.
Пусть X ~ N(mx,y3) и Y ~ N(my,yy), причем их дисперсии у^ и у у неизвестны. Выдвигается гипотеза о равенстве дисперсий у \ иуу:
Н0 :Ух =Уу>
тт(1) 2 2 /тт(2) 2 2 \
Н1 -Ух *Уу(Щ -ух >УУ).
По независимым выборкам хцх2, ... , хп и уь у2, ... , Ук объемов и и к соответственно определяются х, у, S2 и S2 (для однозначности
пусть S2 > Sy. В противном случае эти величины можно переобозна-чить).
В качестве критерия проверки Но принимают СВ

определяемой отношением большей исправленной выборочной дисперсии к меньшей. Если Но верна, то данная статистика F имеет F-распределение Фишера с нт = и -1 и н2 = к -1 степенями свободы.
1) При Н|!) :ух ^Уу п0 таблицам критических точек распределения Фишера (приложение 4) по уровню значимости а и числам
степеней свободы ?і и ?2 определяется критическая точка
^6/2,Hj,h, •
Если FHa6]I < F6/2 іь - нет оснований для отклонения Н0.
Если FHa6]I > F6/2 іь - Н0 отклоняется в пользу Н j1 ’.
2) При Н(2): уі > у у определяется критическая точка F6 ІЬ .
Если FHa6]I < F6 и2 - нет оснований для отклонения Н0.
Если FHa6]I > F6 ІЬ - Н0 отклоняется в пользу Н'2'.
Заметим, что при проверке гипотезы о равенстве дисперсий в качестве альтернативной гипотезы в большинстве случаев используется
гипотеза Н|2).
Пример 3.6. В условиях примера 3.5 определите, есть ли основания считать, что дисперсии двух СВ X и Y существенно отличаются друг от друга (т. е. разброс оценок у студентов больше, чем у студенток).
Из условий задачи строится следующая гипотеза:
ТТ 2 2
Н0 - Ух =Уу>
тт 2 2
Н1 :Ух >Уу-
Для проверки гипотезы по формуле (3.18) строится статистика FHa(-) r =
= 300/150 = 2. Критическая точка распределения Фишера FKp= Fo o5; 24; 24 = 1.98. Поскольку FHa6n = 2 > 1.98 = FKp , то Но должна быть отклонена в пользу Hi, и имеются основания считать, что разброс в оценках у студентов данного университета существенно больше разброса в оценках у студенток.
3.5.7. Проверка гипотезы о значимости коэффициента корреляции
Одним из важнейших элементов эконометрического анализа является установление наличия связи между различными показателями (между ценой и спросом, доходом и потреблением, инфляцией и безработицей). Обычно анализ начинают с простейшей - линейной зависимости. Для того чтобы установить наличие значимой линейной связи между двумя СВ X и Y, следует проверить гипотезу о статистической значимости коэффициента корреляции. В этом случае используется следующая гипотеза:
Но : Сху - 0’
Д” :сху *0.
Для проверки Н0 по выборке (х1; уД, (х2, у2), , (хп, уп) объема и
строится статистика

(3.19)

где гх? - выборочный коэффициент корреляции.
При справедливости Но статистика Т имеет распределение Стью-дента с н=п-2 степенями свободы. По таблице критических точек распределения Стьюдента (приложение 2) по заданному уровню значимости а и числу степеней свободы и - 2 определяем критическую точку ta/2,n_2.
К-у -?п-2
л/1-4
Если X
то нет оснований для отклоне
6/2,п-2
набл.
ния Но. Если Т
то Но отклоняется в пользу альтернатив
набл
б/2,п-2
ной н|!).
Если Но отклоняется, то фактически это означает, что коэффициент корреляции статистически значим (существенно отличен от нуля). Следовательно, X и Y - коррелированы, т. е. между ними существует линейная связь.
Пример 3.7. Определяется наличие линейной зависимости между уровнями инфляции (X) и безработицы (Y) в некоторой стране за 11 лет. По статистическим данным рассчитан выборочный (эмпирический) коэффициент корреляции гх? = = - 0.34. Существует ли значимая линейная связь между указанными показателями в данной стране на рассматриваемом временном интервале (а = 0.02)?
Для ответа на вопрос проанализируем следующую гипотезу:
Н„ : с„ = О,
НГ’:с„*0.
По формуле (3.19) построим Т-статистику ТнабЛ = —Q 34 = _з 254.
V1 - (-°-34)2
По таблице критических точек распределения Стьюдента определим ta/2;n—2 = = tool; 9 = 2.821. Поскольку I Тна5д I = 3.254 > 2.821 = tKp., то коэффициент корреляции гХу статистически значим. Следовательно, рХу существенно отличается от нуля, и между уровнями инфляции (X) и безработицы (Y) существует определенная отрицательная линейная зависимость.
Вопросы для самопроверки
1. Что такое точечная оценка и каковы желательные свойства?
2. Дайте определение несмещенности, эффективности и состоятельности оценок.
3. В чем различие между несмещенностью и асимптотической несмещенностью? Приведите примеры асимптотически несмещенных оценок.
4. Какие оценки называются наилучшими линейными несмещенными (BLUE-оценками)?
5. Что такое интервальная оценка? Как она строится?
6. Чем отличаются интервальные оценки для математического ожидания нормальной СВ при известной и неизвестной дисперсиях?
7. Как строятся доверительные интервалы для дисперсии и среднего квадратического отклонения нормальной СВ?
8. Что такое статистическая гипотеза?
9. Какова цель проверки гипотез?
10. В чем отличие параметрических и непараметрических гипотез?
11. Что такое нулевая и альтернативная гипотезы? Назовите принципы их построения.
12. Что такое статистический критерий? Приведите конкретные примеры критериев.
13. Сформулируйте общую схему проверки гипотез.
14. Что такое ошибки первого и второго рода? Как можно уменьшить вероятности этих ошибок?
15. Что такое уровень значимости?
16. Что определяет мощность критерия?
17. Приведите примеры проверки гипотез в экономике. Какими критериями можно воспользоваться при их проверке?
18. К проверке каких гипотез сводятся исследования среднего дохода населения и анализ разброса в уровне дохода?
Упражнения и задачи
1. Приведена статистика по годовым темпам (%) инфляции в стране за последние 10 лет: 2.8; 3.2; 5.1; 1.8; -0.6; 0.7; 2.1; 2.7; 4.1; 3.5. Необходимо найти несмещенные оценки среднего темпа инфляции, дисперсии и среднего квадратического отклонения.
2. Оценивается годовой доход (X, $ тыс.) на душу населения в некотором городе. Случайная выборка из 16 обследованных человек дала следующие результаты: 8.5; 10.5; 12.25; 7.0; 17.0; 8.75; 10.0; 9.3; 8.0; 11.5; 10.0; 12.0; 9.0; 6.5; 13.0; 10.2. Оцените среднедушевой доход в городе и разброс в доходах. Будут ли такими же значения для всего города?
3. Предполагается, что месячный доход граждан страны имеет нормальное
2
распределение с математическим ожиданием m = $1000 и дисперсией а =
2
= 40000($) . По выборке из 500 человек определили выборочный средний доход х = $900.
а) Постройте 90 и 95 %-ные доверительные интервалы для среднедушевого дохода в стране.
б) Следует ли на основании построенных доверительных интервалов отклонить предположение об ежемесячном доходе в $ 1000?
в) Как проверить то же предположение на основании общей схемы проверки гипотез? Какую альтернативную гипотезу вы выбрали и почему?
4. Для изучения влияния двухнедельной диеты и соответствующего комплекса упражнений на изменение веса спортивный клуб провел анализ по двум выборкам из 7 человек до и после диеты и упражнений. Отбор и в том и в другом случаях осуществлялся случайным образом по членским карточкам. Получены следующие результаты (буквы - инициалы испытуемого, цифры -вес, кг).
I выборка: АГ 85.5; ВТ 92.7; ДИ 79; КД 68.6; КЛ 102.5; МА 88.3; ТВ 82.7.
II выборка: БП 90.5; ДИ 77.5; ИВ 85.3; КР 72.5; ЛМ 108.7; МТ 80.3; ЯК 79.
а) Определите 95 %-ные доверительные интервалы для 1) среднего веса до диеты; 2) среднего веса после диеты; 3) для среднего изменения веса за время диеты
б) Можно ли по имеющимся данным достаточно объективно оценить результаты диеты и упражнений? Да или нет, почему?
в) Для того же анализа в повторную выборку отобрали тех же людей, что и в первую выборку, и получили следующие данные: АГ 83; ВТ 90.5; ДИ 79; КД 68; КЛ 94.5; МА 85; ТВ 80.5. По этим данным постройте 95 %-ный доверительный интервал для потери веса.
г) Есть ли основания не доверять рекламному проспекту клуба, обещающему потерю веса в 3 кг?
5. Станок-автомат заполняет пакеты чипсами по 250 г. Считается, что станок требует подналадки, если стандартное отклонение от номинального веса превышает 5 г. Контрольное взвешивание 10 пакетов дало следующие результаты: 245, 248, 250, 250, 252, 256, 243, 251, 244, 253.
а) Постройте 95 и 99 %-ные доверительные интервалы для стандартного отклонения от номинального веса.
б) Можно ли по этим интервалам судить о необходимости подналадки станка? Как ответить на этот вопрос на основе использования статистической проверки гипотез?
6. Расход (X) бензина автомобилей некоторой фирмы имеет нормальный закон распределения с тх = 7.5 л и ах = 0.5 л Выпустив новую модификацию автомобиля, фирма утверждает, что у него средний расход ту топлива снижен до 7 л при том же а. Выборки из 15 автомобилей каждой модели дали следующие средние расходы х = 7.45; у = 7.15. Можно ли по этим данным доверять рекламе фирмы?
7.
Два университета (А и В) готовят специалистов аналогичных специальностей. Министерство образования решило проверить качество подготовки в обоих университетах, подготовив для этого объемный тестовый экзамен для студентов пятого курса. Отобранные случайным образом студенты показали следующие суммы баллов:
А: 41, 50, 35, 45, 53, 30, 57, 20, 50, 44, 36, 48, 55, 28, 40, 50.
В: 40, 57, 52, 38, 25, 47, 52, 48, 55, 48, 53, 39, 46, 51, 45, 55, 43, 51, 55, 40.
а) Каковы точечные оценки средних баллов и дисперсий результатов для обоих университетов?
б) Можно ли утверждать при уровне значимости а = 0.05, что один из университетов обеспечивает лучшую подготовку? Какие тесты целесообразно использовать для такого рода анализа?
в) Сравните разброс в знаниях студентов этих университетов.
г) Были бы выводы такими же при уровне значимости а = 0.01?
8. На сновании наблюдений за работой 25 кандидатов на должность секретаря-референта установлено, что в среднем они тратили 7 минут на набор одной страницы сложного текста на компьютере при выборочном стандартном отклонении S = 2 минуты При предположении, что время (X) набора текста имеет нормальный закон распределения:
а) определите 90 и 99 %-ные доверительные интервалы для математического ожидания тх и среднего квадратического отклонения ах.
б) Оцените количество претендентов на работу, которые набрали текст быстрее, чем за 5 минут.
в) Предполагалось, что среднее время набора страницы текста должно составить 5.5 минут. Не противоречат ли полученные данные этой гипотезе?
9. Предполагается, что месячная зарплата сотрудников фирмы составляет $1000 при стандартном отклонении а = 100. Выборка из 36 человек дала следующие результаты: х = $900 и S = $150. Можно ли по результатам проведенных наблюдений утверждать, что средняя зарплата сотрудников фирмы меньше рекламируемой, а разброс в зарплатах больше? Какие критические области вы в этом случае использовали?
10. Расход бензина по паспортным данным автомобиля должен составлять 10 л на 100 км. На новую модель автомобиля устанавливается модернизированный двигатель, обеспечивающий расход в 9 л на 100 км. Данное утверждение считается неверным, если х >9.4. Найти вероятности ошибок первого и второго рода, если решение принимается по выборке п = 25.
11. Обследование 25 человек показало, что их средний доход составил $1200 при среднем отклонении S = $120. Полагая, что доход имеет нормальный закон распределения, определите:
а) 90 % -ные интервальные оценки для математического ожидания m и среднего квадратического отклонения а.
б) С какой вероятностью можно утверждать, что абсолютное значение ошибки оценивания m не превзойдет $50?
в) Каким должно быть количество обследованных, чтобы абсолютное значение ошибки оценивания m не превзошло $50 с вероятностью 0.9?
12. Клиенты банка в среднем снимают со своего счета $100 при среднем квадратическом отклонении а = $50. Если выплаты отдельным клиентам независимы, то сколько денег должно быть зарезервировано в банке на выплаты клиентам, чтобы их хватило на 100 человек с вероятностью 0.95? Каков будет при этом остаток денег, гарантированный с той же надежностью, если для выплат зарезервировано $6000?
13. При анализе зависимости между двумя показателями X и Y по 25 наблюдениям получены следующие данные: х = 100; у = 75;X(Xj -х)2 = 625; ?х;у; =
= 187000; 2(у; — у)" = 484. Оценить наличие линейной зависимости между X и Y. Будет ли коэффициент корреляции рХу статистически значимым?
14. Проверить значимость коэффициента корреляции по следующим данным:
а) гху = -0.43, п = 60, а = 0.1 при альтернативной гипотезе Нр рхт < 0;
б) гху = 0.2, п = 45, а = 0.05 при альтернативной гипотезе Нр рху Ф 0;
в) гху = -0.35, п = 100, а = 0.01 при альтернативной гипотезе Нр рху Ф 0.
15. Исследуется зависимость между количеством (N) покупателей в ювелирном магазине и количеством (Q) проданных товаров. За 10 дней наблюдений получены следующие данные:
|
|
|
N |
50 |
61 |
72 |
43 |
60 |
65 |
76 |
55 |
62 |
40 |
|
Q |
10 |
12 |
20 |
9 |
15 |
15 |
21 |
14 |
18 |
7 |
|
Оцените наличие и степень линейной зависимости между N и Q. |
16. Пусть СВ X - ежемесячный доход(млн руб.) определенной группы населе-
2
ния. При этом X ~ N(m = 25, а = 36). Производится случайная выборка из 25 представителей данной группы. Какова вероятность, что их средний доход лежит в интервале от 15 до 30 млн руб.?
17. Анализируется зависимость между доходом горожан (СВ X), имеющих индивидуальные домовладения, и рыночной стоимостью их домов (СВ Y). По случайной выборке из 450 горожан данной категории получены следующие результаты:
Ххі = 25200; ЕУі= 110500; ?(х; -х)2 = 72300;
КУ, -У)2 = 1500200; Е(Хі -х)(уі -у)2 =201350.
а) Вычислите выборочные средние и стандартные отклонения для обоих показателей.
б) Можно ли было ожидать, что стандартные отклонения для рассматриваемых случайных величин приблизительно равны между собой? Проверьте это предположение при уровне значимости а = 0.05.
в) Постройте 95%-ный доверительный интервал для средней стоимости домов. Какое предположение вы сделали при этом?
г) Проверьте гипотезу о наличии сильной линейной зависимости между исследуемыми показателями (а = 0.01).
Все публикации раздела