Содержание
Введение
. Понятие регрессии
1.1 Оценка параметров модели
.2 Показатели качества регрессии
. Проверка статистической значимости в парной линейной регрессии
.1 Реализация регрессионного
анализа в программе MS Excel
Введение
В процессе проведения различных научных исследований возникает проблема определения причинно-следственных связей между отдельными элементами и возможность выделения закономерностей возникновения таких связей. Корреляционно-регрессионный анализ позволяет проводить изучение по выборочным данным статистической зависимости ряда величин; некоторые из которых являются случайными. При статистической зависимости величины не связаны функционально, но как случайные величины заданы совместным распределением вероятностей. Исследование взаимосвязи случайных величин биржевых ставок приводит к теории корреляции, как разделу теории вероятностей и корреляционному анализу, как разделу математической статистики. Исследование зависимости случайных величин приводит к моделям регрессии и регрессионному анализу на базе выборочных данных. Теория вероятностей и математическая статистика представляют лишь инструмент для изучения статистической зависимости, но не ставят своей целью установление причинной связи. Представления и гипотезы о причинной связи должны быть привнесены из некоторой другой теории, которая позволяет содержательно объяснить изучаемое явление.
Основными задачами корреляционно-регрессионного анализа являются:
. Выбор спецификации модели, т. е. формулировки вида модели, исходя из соответствующей теории связи между переменными;
. Из всех факторов, влияющих на результативный признак, необходимо выделить наиболее существенно влияющие факторы;
. Парная регрессия достаточна, если имеется доминирующий фактор, который и используется в качестве объясняющей переменной. Поэтому необходимо знать, какие остальные факторы предполагаются неизменными, так как в дальнейшем анализе их придется учесть в модели и от простой регрессии перейти к множественной;
. Исследовать, как изменение одного признака меняет вариацию другого.
Методы и методология корреляционно-регрессионного
анализа сформированы ведущими математическими исследователями, которые были
дополнены экономистами, статистиками и даже социологами и психологами.
1. Понятие регрессии
Понятие регрессия произошло от латинского слова regressio, что означает обратное движение, отход.
Этот термин впервые был использован Френсисом Гальтоном в 1886 году при исследовании вопросов наследования физических характеристик человека. В качестве ведущей характеристики ученым был взят рост человека. Исследования показали, что сыновья высоких отцов, как ни странно, оказались более высокими, чем сыновья отцов с низким ростом. Более интересным оказалось то, что разброс в росте сыновей был меньшим, чем разброс в росте отцов. Так проявлялась тенденция возвращения роста сыновей к среднему - regression to mediocrity, то есть «регресс».
Результаты исследований были продемонстрированы расчетом среднего роста сыновей отцов, рост которых равен 56 дюймам, расчетом среднего роста сыновей отцов, рост которых равен 58 дюймам, и т. д. Затем, полученные результаты были изображены на плоскости. Здесь по оси ординат <https://ru.wikipedia.org/wiki/%D0%9E%D1%80%D0%B4%D0%B8%D0%BD%D0%B0%D1%82%D0%B0> откладывались показатели среднего роста сыновей, а по оси абсцисс <https://ru.wikipedia.org/wiki/%D0%90%D0%B1%D1%81%D1%86%D0%B8%D1%81%D1%81%D0%B0> - показатели среднего роста отцов. Полученные точки приближённо походили на прямую линию с положительным углом наклона меньше 45°. При этом, важно отметить, что регрессия была линейной.
В
случае парной регрессии рассматривается один объясняющий фактор: через у
обозначим изучаемый эконометрический показатель; через х - объясняющий фактор.
Эконометрическая модель парной регрессии имеет следующий вид:
y=f(x)+e, (1.1)
где f(x) - неизвестная функциональная зависимость (теоретическая регрессия); e - возмущение, случайное слагаемое, представляющее собой совокупное действие не включенных в модель факторов, погрешностей.
Основная задача эконометрического моделирования -
построение по выборке эмпирической модели, выборочной парной регрессии `f(x), являющейся оценкой
теоретической регрессии (функции f(x)):
`y=`f(x), (1.2)
здесь - f(x) эмпирическая (выборочная) регрессия, описывающая усредненную по x зависимость между изучаемым показателем и объясняющим фактором. После построения выборочной регрессии обычно производится верификация модели - проверка статистической значимости и адекватности построенной парной регрессии имеющимся эмпирическим данным.
Экспериментальная основа построения парной эмпирической регрессии - двумерная выборка: (x1,y1), …, (xn, yn), где - объем выборки (объем массива экспериментальных данных).
Основная задача спецификации модели парной регрессии -
выбор вида функциональной зависимости. В случае парной регрессии обычно
рассматриваются функциональные зависимости следующего вида, таблица 1.
Таблица 1 - Классификация моделей регрессии
|
Функция |
Уравнение |
|
|
Линейная |
y=a+bx |
(1.3) |
|
Параболическая |
y= a+b1x+b2x2 |
(1.4) |
|
Гиперболическая |
|
(1.5) |
|
Показательная |
|
(1.6) |
|
Степенная |
|
(1.7) |
|
Экспоненциальная |
|
|
|
Полиномиальная |
|
|
А также некоторые другие. Заметим, что функциональные зависимости (1.3), (1.4) и (1.5) линейны по своим параметрам a и b.
Основные методы выбора функциональной зависимости f(x):
) геометрический; эмпирический;
) аналитический.
Геометрический метод выбора функциональной зависимости сводится к следующему. На координатной плоскости Oxy наносятся точки (xi, yi), i=1,... n, соответствующие выборке. Полученное графическое изображение называется полем корреляции (диаграммой рассеяния).
Исходя из получившейся конфигурации точек, выбирается
наиболее подходящий вид параметрической функциональной зависимости f(x). На
рис. 1 приведен пример поля корреляции для некоторой выборки наблюдений, где
каждому наблюдению соответствует одна точка, с графиками двух функциональных
зависимостей - линейной функции и параболы.

Рис. 1. Пример корреляционного поля
Эмпирический метод состоит в следующем. Выбирается
некоторая параметрическая функциональная зависимость f(x) (см., например,
(1.3-1.7)). Для построения по выборке оценки `f(x) этой зависимости чаще всего используется метод
наименьших квадратов (МНК). Согласно методу наименьших квадратов значения
параметров функции `f(x)
(будем обозначать их через a и b) выбираются таким образом, чтобы сумма
квадратов отклонений выборочных значений yi от значений была
минимальной
, (1.8)
минимум ищется по параметрам a и b, которые входят в зависимость f(x).
Найденные значения параметров, которые минимизируют указанную сумму квадратов разностей, называются оценками неизвестных параметров регрессии по методу наименьших квадратов (оценками МНК). Выборочная регрессия `y=`f(x), (или `yi=`f(xi), i=1, …, n), в которую подставлены найденные значения, уже не содержит неизвестных параметров и является оценкой теоретической регрессии. Именно эту зависимость `f(x) будем рассматривать как эмпирическую усредненную зависимость изучаемого показателя от объясняющего фактора.
После нахождения эмпирического уравнения регрессии
вычисляются значения `yi=`f(xi) и остатки ei=yi-`yi, i=`1,n. По величине остаточной суммы
квадратов
можно судить о качестве соответствия эмпирической функции `f(x) имеющимся в наличии
статистическим наблюдениям. Перебирая разные функциональные зависимости и
каждый раз действуя подобным образом, можно практически подобрать наиболее
подходящую функцию для описания имеющихся данных.
Аналитический метод сводится к попытке выяснения содержательного смысла зависимости изучаемого показателя от объясняющего фактора и последующего выбора на этой основе соответствующей функциональной зависимости.
В практике эконометрического анализа часто используют
линейную парную регрессию. В модели парной линейной регрессии зависимость (1.1)
между переменными представляется в виде:
, (1.9)
т. е. теоретическая регрессия имеет вид (1.3).
На основе выборочных наблюдений оценка теоретической
регрессии - выборочная (эмпирическая) регрессия `у строится в виде:
, (1.10)
где a и b, являются оценками параметров теоретической регрессии.
регрессия линейный детерминация статистический
Рассматривается модель парной линейной регрессии
, i=`1,n.
На основе эмпирических наблюдений построим оценку
теоретической регрессии - найдем выборочное уравнение регрессии
i=1,n.
Оценки a и b параметров определяются по методу
наименьших квадратов из соотношения:
, (1.1.1)
т. е. a и b, выбираются таким образом, чтобы сумма
квадратов отклонений наблюдаемых (выборочных) значений показателя yi
от расчетных ` yi
была минимальной.
Вычисляя производные по параметрам a и b, и
приравнивая их к нулю, приходим к следующей системе из двух уравнений (система
нормальных уравнений):
(1.1.2)
Решение этой системы уравнений называется оценкой
неизвестных параметров по методу наименьших квадратов, его можно найти по
формулам:
(1.1.3)
где
,
,
,
Таким образом, парная эмпирическая линейная регрессия
имеет вид:
(1.1.4)
где коэффициенты a и b определяются по формуле (1.1.3).
Коэффициенту b при объясняющем факторе x в парной линейной регрессии можно дать естественную экономическую интерпретацию. Коэффициент b показывает, на какую величину изменяется в среднем изучаемый эконометрический показатель при увеличении объясняющего фактора на одну единицу.
Нетрудно найти значения показателя, рассчитанные по
выборочной линейной регрессии для тех значений объясняющего фактора, которые
содержатся в выборке:
, i=`1,n. (1.1.5)
Особое значение для проверки статистической значимости парной линейной регрессии имеют остатки (разности между истинными значениями показателя и значениями, вычисленными по уравнению линейной регрессии):
i=yi -`yi, i=`1,n. (1.1.6)
Основные предположения регрессионного анализа относятся к случайной компоненте e и имеют решающее значение для правильного и обоснованного применения регрессионного анализа в эконометрических исследованиях.
В классической модели регрессионного анализа предполагаются выполненными следующие предпосылки (условия Гаусса-Маркова):
. Условие Величины ei являются случайными.
. Условие Математическое ожидание возмущений равно нулю: E(ei)=0.
. Условие Возмущения ei и ej некоррелированы: E(ei, ej)=0, i¹j.
. Условие Дисперсия возмущения ei одна и та же для каждого наблюдения j: D(ei)=s2. Это условие одинаковости дисперсий возмущений называется условием гомоскедастичности. Нарушение этого условия называется гетероскедастичностью.
. Условие Величины ei взаимно независимы со всеми значениями объясняющих переменных xi. Обычно считают, что объясняющие переменные являются неслучайными величинами.
Здесь, во всех условиях i=1,2,…,n.
Эти предпосылки образуют первую группу предпосылок, необходимых для проведения регрессионного анализа в рамках классической модели.
Вторая группа предпосылок дает достаточные условия для обоснованного проведения проверки статистической значимости эмпирических регрессий:
. Условие Совместное распределение случайных величин e1, …, en является нормальным.
При выполнении предпосылок первой и второй групп случайные величины e1, …, en оказываются взаимно независимыми, одинаково распределенными случайными величинами, подчиняющимися нормальному распределению с нулевым математическим ожиданием и дисперсией s2. Модель (1.9), удовлетворяющая приведенным выше условиям, называется классической нормальной линейной моделью парной регрессии.
Возможно использование теоремы Гаусса-Маркова
если регрессионная модель
, удовлетворяет условиям, то оценки МНК a и b, (1.3) имеют
наименьшую дисперсию в классе всех линейных несмещенных оценок.
Заметим, что после построения уравнения выборочной регрессии, наблюдаемые значения yi можно представить в виде
i=`yi+ei, i=`1,n, (1.1.7)
где
i=1,n, коэффициенты a и b, определяются по формуле (1.3).
Остатки ei, являются, в отличие от возмущений ei, наблюдаемыми величинами, с помощью которых можно
оценить воздействие неучтенных факторов и ошибок наблюдений. Говорят, что ei
является выборочной оценкой возмущения ei.
Можно показать, что статистика (выборочная остаточная
дисперсия), определяемая с помощью остатков ei (см. (6)):
(1.1.8)
является несмещенной оценкой дисперсии s2 - дисперсии возмущений (теоретической остаточной дисперсии).
При выполнении условий Гаусса-Маркова первой и второй групп справедливы утверждения:
Утверждение 1. Статистика распределена по закону
Стьюдента с n-2 степенями свободы, здесь:
, (1.1.9)