где
Y
(зависимая переменная) — общий доход
от проданных билетов, млн руб.;
,
— средства на развитие компаний в
регионе, млн руб.; х2
— число
конкурирующих компаний;
—
процент пассажиров, летавших бесплатно.
Найти уравнение множественной регрессии. Проверить значимость и адекватность регрессионной модели. Существенно ли влияет на доход число пассажиров, летавших бесплатно? Какой доход (в среднем) может ожидать компания, вложившая в развитие 2,5 млн руб., если число конкурирующих компаний в регионе равно десяти, а число пассажиров, летавших бесплатно по разным причинам, составляет 3 %. Принять уровень значимости а = 0,05.
Решение в пакете STATISTICA. Проведите те же операции в модуле Multiple Regression, что и в работе 1: введите данные: Variables: dependent var- Y, independent var-Xl, X2, X3, OK -> Regression Summary. Результаты регрессионного анализа приведены на рис. 12.
Уравнение
множественной регрессии имеет вид:
.
Из данной таблицы
видно, что гипотеза
принимается на уровне значимости
р=0,267,
так как р>
= 0,05. Остальные
коэффициенты регрессионной модели
значимы.
Рис.12. Результаты регрессионного анализа
Проверим гипотезу о незначимости регрессионной модели. Для этого используем опцию Analysis of Variance (дисперсионный анализ).
Результаты дисперсионного анализа приведены в таблице (рис. 13). Из таблицы видно, что статистика критерия Фишера, вычисляемая по формуле
равна F(3,ll) =34,821, так как р = 0,000007, что меньше, чем а = 0,05, то гипотеза о незначимости модели отклоняется.
Так как коэффициент р3 незначим, пересчитаем уравнение множественной регрессии используя два фактора х1 и х2. Результаты регрессионного анализа (Regression Summary for Dependent Variable)приводятся на рис. 14.
Уравнение
множественной регрессии имеет вид:
Коэффициенты
регрессионной модели
значимы
(соответствующие уровни значимости
равны соответственно: 0,009; 0,00017; 0,0059).
Рис. 13. Таблица дисперсионного анализа
Рис. 14. Результаты регрессионного анализа
Регрессионная модель значима: F= 50,022, уровень значимости р = 0,000002.
Чтобы проверить выполнение предположений регрессионного анализа и адекватность модели рассмотрим остатки. Для этого используем опцию Residual Analysis (анализ остатков).
Начнем с проверки гипотезы о том, что все сериальные корреляции в последовательности остатков равны нулю (гипотеза Н0). Для проверки этой гипотезы используется критерий Дарбина—Уотсона (рис.15).
Рис.15. Окно для вычисления статистика Дарбина -Уотсона
Чтобы проверить гипотезу Н0, в окне Multiple Regression Results выберите опцию Residual Analysis (рис. 15), а затем — Durbin-Watson stat. Результат приводится на рис. 16.
Рис.16. Статистика Дарбина-Уотсона
В данном случае статистика Дарбина—Уотсона d = 1,8969, что больше табличного значения d2 = 1,75 (см. Приложение 2), следовательно, гипотеза Н0: все сериальные корреляции равны нулю принимается на уровне значимости 2 = 0,1.
Построим график остатков. Для этого в окне Residual Analysis нужно выбрать опцию Casewise plot of residual. Результаты приводятся на рис. 17.
Все остатки укладываются в симметричную относительно нулевой линии полосу шириной ±2S. Это означает, что, по-видимому, дисперсии ошибок наблюдений постоянны.
Рис.17. График остатков
Теперь проверим гипотезу о нормальности распределения остатков. Для этого в том же окне (Residual Analysis) необходимо выбрать опцию Normal Probability Plot of Residuals. Результаты выполнения процедуры представлены на специальном графике (рис. 18).
Рис. 18. Выбор опции опцию Normal Probability Plot of Residuals
Рис.19. Остатки на графике Normal Probability Plot
Из графика (рис. 19) видно, что точки расположены близко к прямой, значит, можно предположить, что остатки распределены по нормальному закону. Гипотезу о нормальном распределении остатков можно также проверить по критерию или критерию Колмогорова—Смирнова.
Таким образом, можно считать, что предположения регрессионного анализа выполняются. Распределение остатков на рис. 17 (случайное, без каких-либо закономерностей) показывает, что регрессионная модель адекватна результатам наблюдений и может быть использована для прогнозирования. Для выполнения прогноза в окне Multiple Regression Results нужно выбрать опцию Predict Dependent Var, в появившемся окне нужно ввести значения факторов х1, х2 и задать уровень значимости = 0,05.
В появившемся окне
(рис. 20) приведены результаты прогноза:
при
=
2,5, х2
= 10: в первом
столбце приведены оценки параметров
регрессии
=
1, 2; во втором — значения факторов
.
Рис. 20. Результаты прогноза
Предсказываемое значение Y выведено в строке Predicted, ниже вычислены 95 % доверительные интервалы для среднего предсказанного значения Y=90,518.
Решите следующие задачи и проведите полный статистический анализ результатов.
Задачи.
1. Используя приведенные ниже данные, найдите уравнение множественной регрессии и ответьте на следующие вопросы:
- каковы оценки коэффициентов регрессии и стандартные ошибки этих оценок?
- каков коэффициент детерминации?
- каково ожидаемое
или прогнозируемое значение для Y
при
?
Y |
|
|
|
64,7 |
3,5 |
5,3 |
8,5 |
80,9 |
7,4 |
1,6 |
2,6 |
24,6 |
2,5 |
6,3 |
4,5 |
43,9 |
3,7 |
9,4 |
8,8 |
77,7 |
5,5 |
1,4 |
3,6 |
20,6 |
8,3 |
9,2 |
2,5 |
66,9 |
6,7 |
2,5 |
2,7 |
34,3 |
1,2 |
2,2 |
1,3 |
2. Используя
приведенные ниже данные, найдите
уравнение множественной регрессии
и ответьте на следующие вопросы: каковы
оценки коэффициентов регрессии и
стандартные ошибки этих оценок? Каков
коэффициент детерминации? Каков 95%-й
доверительный интервал для предсказанного
среднего значения Y при
и
,
равных 52,4; 41,6; 35,8; 3 соответственно?
|
|
|
|
Y |
21,4 |
62,9 |
21,9 |
-2 |
22,8 |
51,7 |
40,7 |
42,9 |
5 |
93,7 |
41,8 |
81,8 |
69,8 |
2 |
64,9 |
11,8 |
41,0 |
90,9 |
-4 |
19,2 |
71,6 |
22,6 |
12,9 |
8 |
55,8 |
91,9 |
61,5 |
30,9 |
1 |
23,1 |
3. Владелец бухгалтерской фирмы считает, что целесообразно прогнозировать заранее количество налоговых деклараций, приходящихся на период с 1 марта по 15 апреля, так как в этом случае он сможет лучше спланировать работу на этот период. Он предполагает, что при таком прогнозе могут быть использованы следующие факторы. Данные об этих факторах и количестве налоговых деклараций приведены ниже[4]:
Экономичес-кий
индекс,
|
Население в радиусе 1 км от фирмы, , тыс. чел. |
Средний доход в районе, , тыс. руб. |
Количество деклараций на период с 1 марта по 15 апреля, Y, тыс. |
99 |
10,188 |
21,465 |
2,306 |
106 |
8,566 |
22,228 |
1,266 |
100 |
10,557 |
27,665 |
1,422 |
129 |
10,219 |
25,200 |
1,721 |
179 |
9,662 |
26,300 |
2,544 |