Курсовая работа (т): Статистическая значимость в парной линейной регрессии

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Статистическая значимость в парной линейной регрессии

Содержание

Введение

. Понятие регрессии

1.1 Оценка параметров модели

.2 Показатели качества регрессии

. Проверка статистической значимости в парной линейной регрессии

.1 Реализация регрессионного анализа в программе MS Excel

Введение

В процессе проведения различных научных исследований возникает проблема определения причинно-следственных связей между отдельными элементами и возможность выделения закономерностей возникновения таких связей. Корреляционно-регрессионный анализ позволяет проводить изучение по выборочным данным статистической зависимости ряда величин; некоторые из которых являются случайными. При статистической зависимости величины не связаны функционально, но как случайные величины заданы совместным распределением вероятностей. Исследование взаимосвязи случайных величин биржевых ставок приводит к теории корреляции, как разделу теории вероятностей и корреляционному анализу, как разделу математической статистики. Исследование зависимости случайных величин приводит к моделям регрессии и регрессионному анализу на базе выборочных данных. Теория вероятностей и математическая статистика представляют лишь инструмент для изучения статистической зависимости, но не ставят своей целью установление причинной связи. Представления и гипотезы о причинной связи должны быть привнесены из некоторой другой теории, которая позволяет содержательно объяснить изучаемое явление.

Основными задачами корреляционно-регрессионного анализа являются:

.        Выбор спецификации модели, т. е. формулировки вида модели, исходя из соответствующей теории связи между переменными;

.        Из всех факторов, влияющих на результативный признак, необходимо выделить наиболее существенно влияющие факторы;

.        Парная регрессия достаточна, если имеется доминирующий фактор, который и используется в качестве объясняющей переменной. Поэтому необходимо знать, какие остальные факторы предполагаются неизменными, так как в дальнейшем анализе их придется учесть в модели и от простой регрессии перейти к множественной;

.        Исследовать, как изменение одного признака меняет вариацию другого.

Методы и методология корреляционно-регрессионного анализа сформированы ведущими математическими исследователями, которые были дополнены экономистами, статистиками и даже социологами и психологами.

1. Понятие регрессии

Понятие регрессия произошло от латинского слова regressio, что означает обратное движение, отход.

Этот термин впервые был использован Френсисом Гальтоном в 1886 году при исследовании вопросов наследования физических характеристик человека. В качестве ведущей характеристики ученым был взят рост человека. Исследования показали, что сыновья высоких отцов, как ни странно, оказались более высокими, чем сыновья отцов с низким ростом. Более интересным оказалось то, что разброс в росте сыновей был меньшим, чем разброс в росте отцов. Так проявлялась тенденция возвращения роста сыновей к среднему - regression to mediocrity, то есть «регресс».

Результаты исследований были продемонстрированы расчетом среднего роста сыновей отцов, рост которых равен 56 дюймам, расчетом среднего роста сыновей отцов, рост которых равен 58 дюймам, и т. д. Затем, полученные результаты были изображены на плоскости. Здесь по оси ординат <https://ru.wikipedia.org/wiki/%D0%9E%D1%80%D0%B4%D0%B8%D0%BD%D0%B0%D1%82%D0%B0> откладывались показатели среднего роста сыновей, а по оси абсцисс <https://ru.wikipedia.org/wiki/%D0%90%D0%B1%D1%81%D1%86%D0%B8%D1%81%D1%81%D0%B0> - показатели среднего роста отцов. Полученные точки приближённо походили на прямую линию с положительным углом наклона меньше 45°. При этом, важно отметить, что регрессия была линейной.

В случае парной регрессии рассматривается один объясняющий фактор: через у обозначим изучаемый эконометрический показатель; через х - объясняющий фактор. Эконометрическая модель парной регрессии имеет следующий вид:

y=f(x)+e, (1.1)

где f(x) - неизвестная функциональная зависимость (теоретическая регрессия); e - возмущение, случайное слагаемое, представляющее собой совокупное действие не включенных в модель факторов, погрешностей.

Основная задача эконометрического моделирования - построение по выборке эмпирической модели, выборочной парной регрессии `f(x), являющейся оценкой теоретической регрессии (функции f(x)):

`y=`f(x), (1.2)

здесь - f(x) эмпирическая (выборочная) регрессия, описывающая усредненную по x зависимость между изучаемым показателем и объясняющим фактором. После построения выборочной регрессии обычно производится верификация модели - проверка статистической значимости и адекватности построенной парной регрессии имеющимся эмпирическим данным.

Экспериментальная основа построения парной эмпирической регрессии - двумерная выборка: (x1,y1), …, (xn, yn), где - объем выборки (объем массива экспериментальных данных).

Основная задача спецификации модели парной регрессии - выбор вида функциональной зависимости. В случае парной регрессии обычно рассматриваются функциональные зависимости следующего вида, таблица 1.

Таблица 1 - Классификация моделей регрессии

Функция

Уравнение


Линейная

y=a+bx

(1.3)

Параболическая

y= a+b1x+b2x2

(1.4)

Гиперболическая

(1.5)

Показательная

(1.6)

Степенная

(1.7)

Экспоненциальная


Полиномиальная



А также некоторые другие. Заметим, что функциональные зависимости (1.3), (1.4) и (1.5) линейны по своим параметрам a и b.

Основные методы выбора функциональной зависимости f(x):

) геометрический; эмпирический;

) аналитический.

Геометрический метод выбора функциональной зависимости сводится к следующему. На координатной плоскости Oxy наносятся точки (xi, yi), i=1,... n, соответствующие выборке. Полученное графическое изображение называется полем корреляции (диаграммой рассеяния).

Исходя из получившейся конфигурации точек, выбирается наиболее подходящий вид параметрической функциональной зависимости f(x). На рис. 1 приведен пример поля корреляции для некоторой выборки наблюдений, где каждому наблюдению соответствует одна точка, с графиками двух функциональных зависимостей - линейной функции и параболы.

Рис. 1. Пример корреляционного поля

Эмпирический метод состоит в следующем. Выбирается некоторая параметрическая функциональная зависимость f(x) (см., например, (1.3-1.7)). Для построения по выборке оценки `f(x) этой зависимости чаще всего используется метод наименьших квадратов (МНК). Согласно методу наименьших квадратов значения параметров функции `f(x) (будем обозначать их через a и b) выбираются таким образом, чтобы сумма квадратов отклонений выборочных значений yi от значений была минимальной

, (1.8)

минимум ищется по параметрам a и b, которые входят в зависимость f(x).

Найденные значения параметров, которые минимизируют указанную сумму квадратов разностей, называются оценками неизвестных параметров регрессии по методу наименьших квадратов (оценками МНК). Выборочная регрессия `y=`f(x), (или `yi=`f(xi), i=1, …, n), в которую подставлены найденные значения, уже не содержит неизвестных параметров и является оценкой теоретической регрессии. Именно эту зависимость `f(x) будем рассматривать как эмпирическую усредненную зависимость изучаемого показателя от объясняющего фактора.

После нахождения эмпирического уравнения регрессии вычисляются значения `yi=`f(xi) и остатки ei=yi-`yi, i=`1,n. По величине остаточной суммы квадратов  можно судить о качестве соответствия эмпирической функции `f(x) имеющимся в наличии статистическим наблюдениям. Перебирая разные функциональные зависимости и каждый раз действуя подобным образом, можно практически подобрать наиболее подходящую функцию для описания имеющихся данных.

Аналитический метод сводится к попытке выяснения содержательного смысла зависимости изучаемого показателя от объясняющего фактора и последующего выбора на этой основе соответствующей функциональной зависимости.

В практике эконометрического анализа часто используют линейную парную регрессию. В модели парной линейной регрессии зависимость (1.1) между переменными представляется в виде:

, (1.9)

т. е. теоретическая регрессия имеет вид (1.3).

На основе выборочных наблюдений оценка теоретической регрессии - выборочная (эмпирическая) регрессия `у строится в виде:

, (1.10)

где a и b, являются оценками параметров теоретической регрессии.

регрессия линейный детерминация статистический


Рассматривается модель парной линейной регрессии

, i=`1,n.

На основе эмпирических наблюдений построим оценку теоретической регрессии - найдем выборочное уравнение регрессии

i=1,n.

Оценки a и b параметров определяются по методу наименьших квадратов из соотношения:

, (1.1.1)

т. е. a и b, выбираются таким образом, чтобы сумма квадратов отклонений наблюдаемых (выборочных) значений показателя yi от расчетных ` yi была минимальной.

Вычисляя производные по параметрам a и b, и приравнивая их к нулю, приходим к следующей системе из двух уравнений (система нормальных уравнений):

(1.1.2)

Решение этой системы уравнений называется оценкой неизвестных параметров по методу наименьших квадратов, его можно найти по формулам:

(1.1.3)

где , , ,

Таким образом, парная эмпирическая линейная регрессия имеет вид:

(1.1.4)

где коэффициенты a и b определяются по формуле (1.1.3).

Коэффициенту b при объясняющем факторе x в парной линейной регрессии можно дать естественную экономическую интерпретацию. Коэффициент b показывает, на какую величину изменяется в среднем изучаемый эконометрический показатель при увеличении объясняющего фактора на одну единицу.

Нетрудно найти значения показателя, рассчитанные по выборочной линейной регрессии для тех значений объясняющего фактора, которые содержатся в выборке:

, i=`1,n. (1.1.5)

Особое значение для проверки статистической значимости парной линейной регрессии имеют остатки (разности между истинными значениями показателя и значениями, вычисленными по уравнению линейной регрессии):

i=yi -`yi, i=`1,n. (1.1.6)

Основные предположения регрессионного анализа относятся к случайной компоненте e и имеют решающее значение для правильного и обоснованного применения регрессионного анализа в эконометрических исследованиях.

В классической модели регрессионного анализа предполагаются выполненными следующие предпосылки (условия Гаусса-Маркова):

.        Условие Величины ei являются случайными.

.        Условие Математическое ожидание возмущений равно нулю: E(ei)=0.

.        Условие Возмущения ei и ej некоррелированы: E(ei, ej)=0, i¹j.

.        Условие Дисперсия возмущения ei одна и та же для каждого наблюдения j: D(ei)=s2. Это условие одинаковости дисперсий возмущений называется условием гомоскедастичности. Нарушение этого условия называется гетероскедастичностью.

.        Условие Величины ei взаимно независимы со всеми значениями объясняющих переменных xi. Обычно считают, что объясняющие переменные являются неслучайными величинами.

Здесь, во всех условиях i=1,2,…,n.

Эти предпосылки образуют первую группу предпосылок, необходимых для проведения регрессионного анализа в рамках классической модели.

Вторая группа предпосылок дает достаточные условия для обоснованного проведения проверки статистической значимости эмпирических регрессий:

.        Условие Совместное распределение случайных величин e1, …, en является нормальным.

При выполнении предпосылок первой и второй групп случайные величины e1, …, en оказываются взаимно независимыми, одинаково распределенными случайными величинами, подчиняющимися нормальному распределению с нулевым математическим ожиданием и дисперсией s2. Модель (1.9), удовлетворяющая приведенным выше условиям, называется классической нормальной линейной моделью парной регрессии.

Возможно использование теоремы Гаусса-Маркова если регрессионная модель , удовлетворяет условиям, то оценки МНК a и b, (1.3) имеют наименьшую дисперсию в классе всех линейных несмещенных оценок.

Заметим, что после построения уравнения выборочной регрессии, наблюдаемые значения yi можно представить в виде

i=`yi+ei, i=`1,n, (1.1.7)

где i=1,n, коэффициенты a и b, определяются по формуле (1.3). Остатки ei, являются, в отличие от возмущений ei, наблюдаемыми величинами, с помощью которых можно оценить воздействие неучтенных факторов и ошибок наблюдений. Говорят, что ei является выборочной оценкой возмущения ei.

Можно показать, что статистика (выборочная остаточная дисперсия), определяемая с помощью остатков ei (см. (6)):

(1.1.8)

является несмещенной оценкой дисперсии s2 - дисперсии возмущений (теоретической остаточной дисперсии).

При выполнении условий Гаусса-Маркова первой и второй групп справедливы утверждения:

Утверждение 1. Статистика распределена по закону Стьюдента с n-2 степенями свободы, здесь:

, (1.1.9)

Источник: https://www.bibliofond.ru/detail.aspx?id=827157