Материал: Методические указания к лабораторным работам №1-4 по дисциплине «Современные технологии обработки информации». Разинкин К.А

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

где Y (зависимая переменная) — общий доход от проданных билетов, млн руб.; , — средства на развитие компаний в регионе, млн руб.; х2 — число конкурирующих компаний; процент пассажиров, летавших бесплатно.

Найти уравнение множественной регрессии. Проверить значимость и адекватность регрессионной модели. Существенно ли влияет на доход чис­ло пассажиров, летавших бесплатно? Какой доход (в среднем) может ожи­дать компания, вложившая в развитие 2,5 млн руб., если число конкуриру­ющих компаний в регионе равно десяти, а число пассажиров, летавших бесплатно по разным причинам, составляет 3 %. Принять уровень значи­мости а = 0,05.

Решение в пакете STATISTICA. Проведите те же операции в модуле Multiple Regression, что и в работе 1: введите данные: Variables: dependent var- Y, independent var-Xl, X2, X3, OK -> Regression Summary. Результаты регрессионного анализа приведены на рис. 12.

Уравнение множественной регрессии имеет вид: .

Из данной таблицы видно, что гипотеза принимается на уровне значимости р=0,267, так как р> = 0,05. Остальные коэффициен­ты регрессионной модели значимы.

Рис.12. Результаты регрессионного анализа

Проверим гипотезу о незначимости регрессионной модели. Для этого используем опцию Analysis of Variance (дисперсионный анализ).

Результаты дисперсионного анализа приведены в таблице (рис. 13). Из таблицы видно, что статистика критерия Фишера, вычисляемая по формуле

равна F(3,ll) =34,821, так как р = 0,000007, что меньше, чем а = 0,05, то ги­потеза о незначимости модели отклоняется.

Так как коэффициент р3 незначим, пересчитаем уравнение множест­венной регрессии используя два фактора х1 и х2. Результаты регрессионно­го анализа (Regression Summary for Dependent Variable)приводятся на рис. 14.

Уравнение множественной регрессии имеет вид:

Коэффициенты регрессионной модели значимы (соответству­ющие уровни значимости равны соответственно: 0,009; 0,00017; 0,0059).

Рис. 13. Таблица дисперсионного анализа

Рис. 14. Результаты регрессионного анализа

Регрессионная модель значима: F= 50,022, уровень значимости р = 0,000002.

Чтобы проверить выполнение предположений регрессионного анализа и адекватность модели рассмотрим остатки. Для этого используем опцию Residual Analysis (анализ остатков).

Начнем с проверки гипотезы о том, что все сериальные корреляции в последовательности остатков равны нулю (гипотеза Н0). Для проверки этой гипотезы используется критерий Дарбина—Уотсона (рис.15).

Рис.15. Окно для вычисления статистика Дарбина -Уотсона

Чтобы проверить гипотезу Н0, в окне Multiple Regression Results выберите опцию Residual Analysis (рис. 15), а затем — Durbin-Watson stat. Результат приводится на рис. 16.

Рис.16. Статистика Дарбина-Уотсона

В данном случае статистика Дарбина—Уотсона d = 1,8969, что больше табличного значения d2 = 1,75 (см. Приложение 2), следовательно, гипотеза Н0: все сериальные корреляции равны нулю принимается на уровне значи­мости 2 = 0,1.

Построим график остатков. Для этого в окне Residual Analysis нужно выбрать опцию Casewise plot of residual. Результаты приводятся на рис. 17.

Все остатки укладываются в симметричную относительно нулевой ли­нии полосу шириной ±2S. Это означает, что, по-видимому, дисперсии ошибок наблюдений постоянны.

Рис.17. График остатков

Теперь проверим гипотезу о нормальности распределения остатков. Для этого в том же окне (Residual Analysis) необходимо выбрать опцию Nor­mal Probability Plot of Residuals. Результаты выполнения процедуры пред­ставлены на специальном графике (рис. 18).

Рис. 18. Выбор опции опцию Nor­mal Probability Plot of Residuals

Рис.19. Остатки на графике Normal Probability Plot

Из графика (рис. 19) видно, что точки расположены близко к прямой, значит, можно предположить, что остатки распределены по нормальному закону. Гипотезу о нормальном распределении остатков можно также про­верить по критерию или критерию Колмогорова—Смирнова.

Таким образом, можно считать, что предположения регрессионного анализа выполняются. Распределение остатков на рис. 17 (случайное, без каких-либо закономерностей) показывает, что регрессионная модель адек­ватна результатам наблюдений и может быть использована для прогнозиро­вания. Для выполнения прогноза в окне Multiple Regression Results нужно выбрать опцию Predict Dependent Var, в появившемся окне нужно ввести значения факторов х1, х2 и задать уровень значимости = 0,05.

В появившемся окне (рис. 20) приведены результаты прогноза: при = 2,5, х2 = 10: в первом столбце приведены оценки параметров регрессии = 1, 2; во втором — значения факторов .

Рис. 20. Результаты прогноза

Предсказываемое значение Y выведено в строке Predicted, ниже вычис­лены 95 % доверительные интервалы для среднего предсказанного значе­ния Y=90,518.

Задания для самостоятельного решения

Решите следующие задачи и проведите полный статистический анализ результатов.

Задачи.

1. Используя приведенные ниже данные, найдите уравнение множест­венной регрессии и ответьте на следующие вопросы:

- каковы оценки коэффициентов регрессии и стандартные ошибки этих оценок?

- каков коэффициент детерминации?

- каково ожидаемое или прогнозируемое значение для Y при ?

Y

64,7

3,5

5,3

8,5

80,9

7,4

1,6

2,6

24,6

2,5

6,3

4,5

43,9

3,7

9,4

8,8

77,7

5,5

1,4

3,6

20,6

8,3

9,2

2,5

66,9

6,7

2,5

2,7

34,3

1,2

2,2

1,3

2. Используя приведенные ниже данные, найдите уравнение множест­венной регрессии и ответьте на следующие вопросы: каковы оценки коэффициентов регрессии и стандартные ошибки этих оценок? Каков коэффициент детерминации? Каков 95%-й доверительный интервал для предсказанного среднего значения Y при и , равных 52,4; 41,6; 35,8; 3 соответственно?

Y

21,4

62,9

21,9

-2

22,8

51,7

40,7

42,9

5

93,7

41,8

81,8

69,8

2

64,9

11,8

41,0

90,9

-4

19,2

71,6

22,6

12,9

8

55,8

91,9

61,5

30,9

1

23,1

3. Владелец бухгалтерской фирмы считает, что целесообразно прогно­зировать заранее количество налоговых деклараций, приходящихся на пе­риод с 1 марта по 15 апреля, так как в этом случае он сможет лучше спла­нировать работу на этот период. Он предполагает, что при таком прогнозе могут быть использованы следующие факторы. Данные об этих факторах и количестве налоговых деклараций приведены ниже[4]:

Экономичес-кий индекс,

Население в радиусе

1 км от фирмы, ,

тыс. чел.

Средний доход

в районе, ,

тыс. руб.

Количество деклараций на период с 1 марта по 15 апреля, Y, тыс.

99

10,188

21,465

2,306

106

8,566

22,228

1,266

100

10,557

27,665

1,422

129

10,219

25,200

1,721

179

9,662

26,300

2,544

Источник: https://studfile.net/preview/16568137/