представляет собой стандартную ошибку коэффициента a,
- выборочная дисперсия.
Утверждение 2. Статистика распределена по закону
Стьюдента с n-2 степенями свободы, здесь:
, (1.1.10)
представляет собой стандартную ошибку коэффициента b,
- выборочная дисперсия.
Утверждение 3. Если y и x некоррелированы, то
статистика:
(1.1.11)
распределена по закону Стьюдента с n-2 степенями
свободы. Здесь r
(x,y) - теоретический коэффициент парной корреляции, rxy- выборочный
коэффициент парной корреляции:
, (1.1.12)
где
,
- выборочные дисперсии x и y соответственно, Cov(x,y)-
выборочная ковариация между x и y.
1.2 Показатели качества регрессии
Коэффициент детерминации является одной из наиболее эффективных оценок адекватности регрессионной модели, т. е. мерой качества уравнения регрессии (соответствия регрессионной модели эмпирическим данным).
После построения выборочного уравнения регрессии, как уже указывалось выше, значение зависимой переменной y в каждом наблюдении можно разложить на две составляющие:
i=`yi+ei, i=`1,n,
здесь остаток ei представляет собой ту
часть зависимой переменной y, которую невозможно «объяснить» с помощью
выборочной регрессии. Можно показать, что выборочная дисперсия наблюдений yi
может быть представлена в виде суммы:
, (1.2.1)
в которой первое слагаемое
представляет собой часть,
«объясненную» регрессионным уравнением (или обусловленную регрессией), а второе
слагаемое
- «необъясненную» часть, характеризующую влияние неучтенных
факторов и т. п. Необходимо заметить, что такое разложение справедливо только в
том случае, когда в уравнение регрессии включена константа a, при этом
.
Разложение (1.2.1) часто записываю в следующем виде:
, (1.2.2)
где
представляет собой общую сумму квадратов отклонений зависимой
переменной от средней,
есть сумма квадратов отклонений, обусловленная регрессией, а
- остаточная сумма квадратов.
Коэффициент детерминации определяется по формуле:
. (1.2.3)
Величина R2, как видно из формул (1) и (3), представляет собой часть (долю) вариации (разброса, дисперсии) зависимой переменной, обусловленную («объясненную») уравнением регрессии (иногда говорят - обусловленную вариацией объясняющей переменной).
Свойства коэффициента детерминации:
Свойство 1. 0 £R2£ 1;
Свойство 2. Чем ближе R2 к единице, тем лучше регрессия аппроксимирует эмпирические данные, т. е. эмпирические наблюдения ближе к линии выборочной регрессии. Если R2,=1 то между x и y есть линейная функциональная зависимость, в этом случае все эмпирические точки наблюдений лежат на прямой регрессии;
Заметим, что коэффициент детерминации R2 имеет смысл рассматривать только при наличии свободного члена в уравнении регрессии, так как лишь в этом случае справедливо равенство (1.2.1).
Оценка качества соответствия выборочного равнения
регрессии наблюдаемым данным может производиться и с помощью средней ошибки
аппроксимации регрессии по формуле:
. (1.2.4)
Как указывают некоторые авторы, в практических исследованиях значение этой ошибки в пределах 5-7 % свидетельствует о хорошем соответствии модели эмпирическим данным.
Коэффициент регрессии b, как уже отмечалось выше, показывает, на сколько единиц в среднем изменяется значение показателя y, когда фактор x увеличивается на одну единицу, поэтому он также может служить мерой тесноты связи между x и y. Однако b зависит от единиц измерения переменных. Именно поэтому удобно использовать некоторую «стандартную» систему единиц измерения тесноты связи, в которой различные данные были бы сравнимы между собой. В качестве единиц измерения такой системы используется среднее квадратическое отклонение переменных, а показателем тесноты связи служит коэффициент корреляции.
Действительно, используя понятия выборочных дисперсий,
ковариации и корреляции, оценки МНК можно записать специальным образом:
,
,(1.2.5)
где
,
- выборочные средние,
,
- выборочные дисперсии, rxy -
выборочный коэффициент корреляции (см. (1.2.5)).
Следовательно, парная эмпирическая линейная регрессия
может быть записана в виде:
. (1.2.6)
Таким образом, величина
(1.2.7)
показывает, на сколько величин Sy изменится (в среднем) y, если x увеличится на одно sx, поэтому выборочный коэффициент корреляции rxy также является показателем тесноты связи (более точно - характеризует тесноту линейной зависимости) между переменными.
Выборочный коэффициент корреляции является безразмерной величиной и обладает следующими свойствами:
Свойство 1. -1£ rxy £1;
Свойство 2. При rxy = ± 1 корреляционная зависимость представляет собой линейную функциональную зависимость (все наблюдаемые значения располагаются на прямой линии регрессии);
Свойство 3. При rxy = 0 линейная корреляционная связь отсутствует (линия регрессии параллельна оси Ox).
Заметим, что выборочный коэффициент корреляции rxy полностью оценивает тесноту связи только в случае совместного нормального распределения случайных величин x и y, в других случаях выборочный коэффициент корреляции является оценкой меры только линейной зависимости.
Практически наиболее удобна следующая формула
вычисления rxy (которая непосредственно может быть получена из
определения):
(1.2.8)
В случае парной линейной регрессии между коэффициентом детерминации R2и коэффициентом корреляции rxy существует следующая связь:
2 = r2xy. (1.2.9)
2. Проверка статистической значимости
в парной линейной регрессии
Проверка значимости (статистической) уравнения регрессии означает проверку соответствия модели, выражающей зависимость между переменными, экспериментальным данным, а также проверку достаточности включенных в уравнение объясняющих переменных для описания зависимой переменной.
Правило проверки статистической значимости оценок a и b основывается на статистических свойствах оценок МНК и проверке статистических гипотез H0: a=0, H1: a¹0 и H0: b=0, H1: b¹0. Невозможность отклонения нулевой гипотезы означает статистическую незначимость соответствующего коэффициента и наоборот, отклонение нулевой гипотезы по сравнению с альтернативной означает, что соответствующий коэффициент статистически значим.
Как всегда, проверка статистических гипотез осуществляется при некотором уровне значимости. В практических эконометрических исследованиях наиболее часто используются 5 и 1 %-ный уровни значимости. Выбор того или иного уровня значимости определяется исследователем.
Напомним, что если нулевая гипотеза отклоняется при 1 %-ном уровне значимости, то она автоматически отклоняется и при 5 %-ном уровне.
Если нулевая гипотеза принимается при 5 %-ном уровне значимости, то она принимается и при 1 %-ном уровне.
Если же при 5 %-ном уровне значимости нулевая гипотеза отклоняется, то необходимо проверить ее при 1 %-ном уровне, и если при этом уровне она принимается, то результаты проверки гипотезы приводятся для двух уровней значимости.
. Правило проверки значимости коэффициента b
Статистика tb=b/mb при выполнении гипотезы H0:b=0 распределена по закону Стьюдента с n-2 степенями свободы.
Из таблицы распределения Стьюдента с n-2 степенями свободы по заданному уровню значимости выбирается значение t как критическая точка, соответствующая двусторонней критической области. Тогда:
) если | tb | ≥ t, то гипотезу H0:b=0 следует отклонить и, следовательно, признать коэффициент b статистически значимым;
) если | tb | £ t, то гипотезу H0:b=0 следует принять и, следовательно, признать коэффициент b статистически незначимым.
. Правило проверки значимости коэффициента a
Статистика ta=a/ma при выполнении гипотезы H0:a=0 распределена по закону Стьюдента с n-2 степенями свободы.
Из таблицы распределения Стьюдента с n-2 степенями свободы по заданному уровню значимости выбирается значение t как критическая точка, соответствующая двусторонней критической области. Тогда:
) если | ta | ≥ t, то гипотезу H0:a=0 следует отклонить и, следовательно, признать коэффициент a статистически значимым;
) если | ta | £ t, то гипотезу H0:a=0 следует принять и, следовательно, признать коэффициент a статистически незначимым.
. Правило проверки значимости коэффициента корреляции rxy
Статистика
при выполнении гипотезы H0:
rxy =0 (т. е. при отсутствии корреляционной связи, здесь -
генеральный коэффициент корреляции) распределена по закону Стьюдента с n-2
степенями свободы.
Из таблицы распределения Стьюдента с n-2 степенями свободы по заданному уровню значимости выбирается значение t как критическая точка, соответствующая двусторонней критической области. Тогда:
) если | tr | ≥ t, то гипотезу H0: rxy =0 следует отклонить и, следовательно, признать коэффициент rxy статистически значимым;
) если | tr | £ t, то гипотезу H0: rxy =0 следует принять и, следовательно, признать коэффициент rxy статистически незначимым.
Проверка значимости коэффициента b одновременно является проверкой значимости парной линейной регрессии в целом. Еще один способ проверки значимости парной линейной регрессии основан на коэффициенте детерминации R2 и статистике, распределенной по закону Фишера с числом степеней свободы числителя, равном 1, и числом степеней свободы знаменателя, равном n-2.
. Правило проверки значимости линейной регрессии в целом (гипотезы H0: b =0) с использованием F статистики
Если выполнены предпосылки регрессионного анализа, то
при выполнении гипотезы H0: b =0 (что означает отсутствие
взаимосвязи между x и y, а также статистическую незначимость построенной парной
регрессии) статистика
распределена по закону Фишера с числом степеней свободы числителя, равном 1, и числом степеней свободы знаменателя, равном n-2.
По таблице распределения Фишера-Снедекора при заданном уровне значимости определяется значение Fтабл как критическая точка при числе степеней свободы числителя, равном 1, и числе степеней свободы знаменателя, равном n-2. Тогда:
) если F≥Fтабл, то гипотезу H0: b =0 следует отклонить и, следовательно, признать построенное уравнение линейной регрессии статистически значимым;
) если F<Fтабл, то гипотезу H0: b =0 следует принять и,
следовательно, признать построенное уравнение статистически незначимым.
2.1 Реализация регрессионного анализа
в программе MS Excel
Для проведения расчетов по линейному методу МНК можно использовать программу Microsoft Excel (входит в программный пакет Microsoft Office). Наиболее просто реализуется вычисления коэффициентов линейной математической модели типа. Для этого можно использовать следующие встроенные функций MS Excel:
. ОТРЕЗОК (диапозон_Y; диапазон_X)
. НАКЛОН (диапазон_Y; диапазон_X)
. КОРРЕЛ (диапазон_Y; диапазон_X)
Первая функция вычисляет свободный член уравнения регрессии (b0 в y = bo + b1 · x), вторая - наклон прямой (b1 в y = bo + b1 · x). Третья функция позволяет вычислить коэффициент корреляции r.
Каждая из функций принимает два аргумента, разделяемых знаком точка с запятой “;”. Каждый из аргументов определяет диапазон ячеек, в котором находятся значения зависимой (диапазон_Y) и независимой (диапазон_Х) переменных. Диапазоны должны быть одинаковой формы (вектор-строка или вектор-столбец одинаковой длины).
В более общем виде линейный МНК может быть реализован с помощью встроенной функции ЛИНЕЙН, которая производит вычисления коэффициентов регрессии линейной математической модели с несколькими переменными типа и дополнительно рассчитывает ряд статистических показателей. Вычисленные коэффициенты регрессии и статистики возвращаются в виде массива чисел. Поскольку возвращается массив значений, функция должна задаваться в виде формулы массива.
Запишем модель в следующем виде:
Функция ЛИНЕЙН может принимать от одного до четырех аргументов. Обязателен только первый аргумент, остальные - необязательные:
ЛИНЕЙН (диапазон_Y, [диапазон_X], [константа], [статистика])
Диапазон_Y - Обязательный аргумент. Диапазон ячеек, содержащий множество значений зависимой переменной (y);
Диапазон_Х - Диапазон ячеек, содержащий множество значений независимых переменных. Если переменных несколько, то они должны располагаться в смежных ячейках. Каждое диапазон значений независимой переменной должен иметь форму, аналогичную диапазону_Y.
Константа. Необязательный аргумент. Логическое значение, которое указывает, требуется ли, чтобы константа b0 была равна 0. Если аргумент константа имеет значение ИСТИНА или опущен, то свободный член b0 вычисляется обычным образом.
Если аргумент константа имеет значение ЛОЖЬ, то значение b0 полагается равным 0 и значения коэффициентов регрессии подбираются с этим условием.
Статистика. Необязательный аргумент. Логическое
значение, которое указывает, требуется ли возвратить дополнительную
регрессионную статистику. Если аргумент статистика имеет значение ИСТИНА,
функция ЛИНЕЙН возвращает дополнительную регрессионную статистику. Возвращаемый
массив чисел будет иметь следующий вид, рис. 2: