Дипломная работа: Факторы экономического успеха зарубежных кинокартин: стратегии компаний и предпочтения зрителей

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

По оси ординат следующей гистограммы также отражена частота появления значений параметра в выбранном диапазоне, но на оси абсцисс отражены диапазоны логарифмов киносборов и бюджета кинофильма соответственно. Ситуация улучшилась: оба распределения приблизились к нормальному, однако они всё ещё могут привести к несоблюдению предпосылки о нормальности остатков в модели.

Гистограмма 1.10Логарифмы сборов и бюджета фильма; млн. дол. США.

Если предположить, что в дальнейшем выборка будет расширяться (корректируя её на инфляцию при расширении временного коридора) и также ссылаясь на центральную предельную теорему, то, скорее, переменные кассовых сборов и бюджета картины являются величинами, распределенными нормально (при дальнейших исследованиях предполагается переход к отклонению от среднего).

Интересно также рассмотреть и оценить вид связи (линейная или нет) в распределении киносборов с бюджета кинокартины и с оценками кинокритиков на точечной диаграмме 1.11.

Точечная диаграмма 1.11Киносборы/бюджет и киносборы/оценка кинокритиков

На оси ординат отражены кассовые сборы, а на оси абсцисс значения бюджета кинофильма (слева) и оценки кинокритиков (справа) в млн. долларов.

Как видно на обеих точных диаграммах, наблюдается прямая положительная зависимость между стоимостью картины, оценками кинокритиков и её сборами, а так же выбросы, которые возможно, в случае с моделью сборов кинокартины, можно оставить в модели. Эта связь появляется после преодоления величины бюджета картины примерно в 25 млн. долларов США.

Стоит отметить, что регрессант рентабельности кинокартины имеет 5 значений-выбросов, которые выше 900%: 1304,12%; 2259,67%; 2650,13%; 3248,21%; 22764,41%. Это уникальные примеры малобюджетных кинокартин с большими кассовыми сборами. На графике рентабельности и бюджетных затрат (диаграмма 1.12) можно выделить область до 5 млн. долларов бюджета фильма, которым скорее соответствуют пять супер рентабельных фильмов, убрав которые можно перейти от гиперболы к линейной функции, не изменяя форму нашего регрессанта.

Точечная диаграмма 1.12Рентабельность/бюджет и рентабельность/оценка кинокритиков.

По оси ординат отражен параметр рентабельности, а по оси абсцисс -значения бюджета кинофильма (слева) и оценки кинокритиков (справа) в млн. долларов.

На точечной диаграмме 1.12 справа не обнаруживается связи между оценкой фильма критиками и рентабельностью. Скорее всего, переменная оценки кинокритиков будет незначима во второй нашей регрессионной модели.

Описание теоретических моделей

Планируется оценить две модели:

1) Модель кассовых сборов кинокартины:

(1)

2) Модель рентабельности кинокартины:

(2)

Первая модель оценивает абсолютный успех кинокартины в денежном эквиваленте и является основной в нашем анализе. Вторая модель оценивает успех в относительном виде - рентабельности кинокартины и является вспомогательной. Главное различие этих моделей в том, что для создания второй модели мы берём переменную бюджета кинокартины (PC) из регрессоров и делим наш регрессант кассовые сборы (BO) на эту переменную, получая тем самым рентабельность.

Выборка для первой модели составляет 100 наблюдений, а для второй модели ограничена 95 наблюдениями, исключая пять супер рентабельных кинокартин, которые идут как исключения из нашего анализа .

Для предварительного анализа степени связей между переменными воспользуемся парным корреляционным анализом. (табл. 1.13)

Таблица 1.13Корреляционная матрица.

В таблице представлена корреляционная матрица всех наших параметров. В ней указаны символом «*» значимые (на 5% уровне значимости) значения парных корреляций.

Обнаруживается высокая и значимая корреляция кассовых сборов (BO) и таких показателей как: бюджет кинокартины (PC), количество фильмов в кинофраншизе (FU) и оценка кинокритиков (PR). Менее высокий, но значимый уровень корреляции отображают показатели: жанр кинокартины (GN) и возрастной рейтинг американской киноакадемии (RT).

Нет значимой корреляции между кассовыми сборами и актёрским составом. Стоит учесть, что к проблеме мультиколлинеарности мы вернёмся позже, первичный анализ пока не выявил этой проблемы.

Если рассматривать основным регрессором рентабельность, то значимая корреляция проявляется только с издержками на кинокартину и известным актёрским составом. Возможно, вторая модель будет обладать низкой объясняющей способностью.

Глава 2: Эконометрическая оценка детерминант успеха фильма

2.1 Регрессионный анализ

Первичная оценка моделей. Проведём первичную регрессионную оценку модели №1:

Таблица 2.1 Регрессионная статистика по модели №1.

Оценим первичную модель (1): гипотеза о неадекватности всей регрессионной модели отвергается на любом адекватном уровне значимости . Объяснено более половины вариации кассовых сборов, что для микроданных очень хороший результат. Значимыми оказались только три параметра регрессионной модели: бюджет, кинофраншиза и оценка кинокритиков. Рассмотрим регрессионную статистику для модели №2.

Таблица 2.2 Регрессионная статистика по модели №2.

Оценим первичную модель (2): гипотеза о неадекватности всей регрессионной модели отвергается на любом адекватном уровне значимости . Объяснено 16% вариации рентабельности кинокартины, что для микроданных неплохой результат. Значимыми оказались только три параметра и константа: кинофраншиза, жанр и актёрский состав.

Тестировать гипотезы и доверять полученным результат оценки модели мы ещё не имеем права, необходимо провести проверку регрессионной модели на соответствие основным предпосылкам теоремы Гаусса-Маркова и ряд дополнительных проверок.

Проведение спецификации модели. Выберем правильную функциональную форму для модели (1) и (2). В приложение №3 представлена процедура спецификации обеих моделей.

Для модели №1 более адекватно использовать логарифмы денежных переменных (бюджет кинофильма и киносборы), как указывалась в пункте 2.1; также стоит оценивать переменную возрастного рейтинга кинофильма не как одну переменную из 4-х категорий, а как три искусственных переменных (одна категория убирается - ловушка искусственных переменных).

Для модели №2 мы рассмотрим переменную возрастного рейтинга кинофильма как три отдельные искусственные переменные и посмотрим на изменение нормированного коэффициента детерминации. Если он вырастет, то модель с отдельными возрастными рейтингами будет предпочтительнее.

Специфицированная форма до тестирования для модели 1:

Специфицированная форма до тестирования для модели 2:

В обеих моделях ряд переменных является незначимым, спецификация модели с такими переменными неадекватна и противоречит первому условию ТГМ. Однако до тестирования соблюдения остальных условий ТГМ мы не знаем, действительно ли параметры незначимы потому, что они обладают малой объясняющей силой для наших регрессантов или же потому, что они незначимы из-за несоблюдения условий ТГМ. Именно поэтому принято тестировать полученные результаты на адекватность и устойчивость.

Дальнейшая часть исследования ставит своей задачей проверить следующее утверждение: «действительно ли ряд параметров нашей модели незначимы сами по себе, или это последствия ряда эконометрических проблем»?

2.2 Тестирование качества параметров модели

Во-первых, протестируем отсутствие в нашей модели мультиколлинеарности. Она приводит к неустойчивости оценок в модели.

Общепринятого теста на мультиколлинеарность нет, однако принято проверять значения парных коэффициентов корреляции у регрессоров и для тех из них, у кого значение корреляции выше 0,8 строить индекс вздутия дисперсии (VIF). Он строится при помощи вспомогательной регрессии оцениваемого регрессора на остальные регрессоры в модели. Если значение индекса VIF окажется в интервале [1;3] мы столкнулись со слабой мультиколлинеарностью и устранять её нет необходимости. Стоит учесть, что мультиколлинеарность присутствует в любой модели построенной по не искусственным данным - наша задача состоит лишь в том, чтобы определить её степень). , , где - коэффициент множественной детерминации в регрессии фактора на все остальные факторы.

Таблица 2.3 Тестирование мультиколлинеарности.

Название параметра или индекса

Модель №1

Модель №2

VIF (lnPC)

1.68

-

VIF (FU)

1.17

1.17

VIF (GN)

1.36

1.23

VIF (SP)

1.60

1.21

VIF (PR)

1.21

1.13

VIF (RT-PG)

28.15

26.73

VIF (RT-PG13)

15.72

14.84

VIF (RT-R)

26.28

24.53

Корреляционная матрица:

В обеих моделях обнаружена сильная мультиколлинеарность по параметрам возрастного рейтинга, т.к. их VIF-ы больше 7-ми, однако чисто структурно мы всегда можем перейти к старому виду этой переменной, который не отражает три отдельные переменные. Более того по форме данных видно, что мы столкнулись скорее с проблемой маленькой выборки по этой переменной, чем с проблемой мультиколлинеарности. Предполагается, что при увеличении выборки проблема мультиколлинеарности исчезнет, и на данной стадии мы можем её проигнорировать, но необходимо учесть, что оценки параметров по этим переменным неустойчивы, а их дисперсии сильно раздуты. Однако если мы выкинем эти параметры из модели, качество её подгонки значимо просядет.

Во-вторых, протестируем отсутствие в нашей модели гетероскедастичности. Это проблема неоднородности наблюдений, выражающаяся в непостоянной дисперсии случайной составляющей (ошибки) регрессионной модели (т.е. не выполняется свойство ). Следствие гетероскедастичности - неэффективность оценок, полученных с помощью МНК. Более того, оценка ковариационной матрицы параметров модели оказывается смещённой и несостоятельной. В итоге, любые выводы о качестве параметров могут быть неадекватными.

Воспользуемся тестами Уайта и Бройша-Пагана. Гипотезы для тестов:

(гомоскедастичность);

(гетероскедастичность).

Таблица 2.4 Проверка гетероскедастичности.

Модель №1

Модель №2

Статистика Уайта

41,04

23,96

P-value (Уайт)

0,0862

0,3491

Вывод

Гетероскедастичность

Гомоскедастичность

Статистика Бройша-Пагана

3,75

15,65

P-value (Бройш-Паган)

0,8789

0,0285

Вывод

Гомоскедастичность

Гетероскедастичность

Процедуры тестов и расчёты представлены в приложениях №3 и №4.Так как для обеих моделей хотя бы один тест выдал значение P-value меньше уровня значимости в 10%, то в обеих моделях присутствует гетероскедастичность ошибок. Её устранение проводится в приложении №6.

В-третьих, протестируем Наличие нормальности в распределении ошибок (). В случае отсутствия нормальности остатков мы не можем полагаться на выводы статистических тестов (таких как t, F, ч2), так как их асимптотическое распределение не будет стремиться к нормальному. То есть, мы не сможем тестировать гипотезы и говорить о значимости тех или иных переменных в модели, используя эти статистики. Другими словами, из нормальности ошибок будет следовать то, что у нас нормально распределены также и а это значит, что мы сможем тестировать различные гипотезы, так как t, F и распределения являются функциями от нормального. И мы сможем доверять полученным результатам тестирования.

Проведём тест на нормальность ошибок, используя тест Шапиро-Вилка.

Гипотезы: Ho: Остатки распределены нормально; H1: Остатки не распределены нормально.

Таблица 2.5 Тест Шапиро-Вилка на нормальность остатков.

Нулевая гипотеза о нормальном распределении ошибок в модели отвергается для обеих моделей на 5% уровне значимости. В приложении № 7 можно ознакомится с графиками ядерной оценки распределения Кернела, сравнив их с нормальным. Только для первой модели они более или менее соответствуют нормальному распределению.

Поскольку для обеих моделей P-value (Prob>z) меньше 5%, то основная гипотеза отвергается, и остатки нашей модели распределены ненормально. Так как по ЦПТ: «сумма достаточно большого количества слабо зависимых случайных величин, имеющих примерно одинаковые масштабы (ни одно из слагаемых не доминирует, не вносит в сумму определяющего вклада), имеет распределение, близкое к нормальному» Вентцель Е.С. Теория вероятностей: Учеб. для вузов. -- 6-е изд. стер. -- М.: Высш. шк., 1999.-- стр. 116, мы не станем исправлять данную проблему, а просто уточним, что потом, когда мы начнём увеличивать выборку (с каждым добавляемым годом мы получаем больше данных) данная проблема самоустранится. И надёжность результатов тестирования гипотез не будет подвергаться сомнению. Более того, вторая модель является вспомогательной и, в крайнем случае, её выводами можно будет пренебречь.

В-четвёртых, проанализируем выбросы в моделях. Сначала проведём проверку на наличие вертикальных выбросов. Воспользуемся остатками по Стьюденту:

Источник: https://otherreferats.allbest.ru/download/1395490/