Материал: Основы корреляционного анализа

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Найдём выборочные средние, дисперсии и корреляционный коэффициент для примера 1, рассмотренного выше.

Расчёты будем проводить двумя способами. В первом случае мы воспользуемся статистическими данными (выборкой), приведёнными в табл.1. Второй вариант расчёта будет основан на корреляционной таблице (табл.2), которую для удобства представим в более удобном для вычисления виде, соответствующем выборочному закону распределения (табл.3). Результаты вычислений приведены в табл.4

Таблица 3 Выборочный закон распределения для примера 1.

l \ k

810,5

972,5

1134,5

1296,5

1458,5

1620,5

nl

160

1

0

0

0

0

0

1

170

2

0

0

0

0

0

2

175

1

0

0

0

0

0

1

180

2

1

0

0

0

0

3

185

1

0

0

0

0

0

1

190

0

2

0

0

0

0

2

195

0

1

0

0

0

0

1

200

0

0

1

0

0

0

1

205

0

1

0

0

0

0

1

210

0

1

1

0

0

0

2

215

0

0

1

0

0

0

1

220

0

1

1

2

0

0

4

225

0

0

0

1

0

0

1

230

0

0

0

2

0

0

2

235

0

0

0

0

2

0

2

240

0

0

0

0

1

1

2

250

0

0

0

0

0

1

1

260

0

0

0

0

0

1

1

270

0

0

0

0

0

1

1

nk

7

7

4

5

3

4

30

Таблица 4

Выборочные средние, дисперсии и корреляционный. коэффициент . .

 

 

 

 

 

 

 

 

 

 

Варианты

 

 

 

 

 

 

Dξ

Dη

rξη

 

 

 

 

 

 

расчётов

 

 

 

 

 

 

 

 

 

1

210.3

1142.0

786.6

82576

0.9485

2

210.3

1145.3

786.6

76866

0.9406

Более точным следует признать первый вариант расчёта. Второй вариант вычислений связан с предварительной группировкой статистических данных. Результаты расчётов естественно зависят от выбранного способа группировки. Это объясняет некоторые отличия выборочных моментов, полученных по второму варианту расчёта, от их точных значений для данной выборки.

Однако, следует отметить, что в рассмотренном примере отличия оказываются незначительными. Так корреляционный коэффициент, вычисленный по второму варианту расчёта (0.9406), меньше точного значения (0.9485) всего на 0.8%.

11

1.3. Проверка статической гипотезы о значимости корреляционной связи.

Мало найти коэффициент корреляции, необходимо подкрепить значимость соответствующей зависимости путём проверки статистической гипотезы.

Проверка гипотезы о наличии корреляции осуществляется следующим образом. Основная гипотеза – отсутствие линейной статистической связи H0: rξη =0, альтернативной гипотезой может выступать любая из трех возможных:

rξη 0

H1 : rξη 0,

rξη 0

В тех случаях, когда справедливо предположение о нормальном распределении выборки, в качестве статистического критерия выберем случайную величину

 

r

 

 

 

 

 

n 2

 

 

Z

η

 

 

,

(1.11)

 

 

 

 

1 r 2

 

 

 

ξη

 

 

где rξη- выборочный коэффициент корреляции,

n - объем выборки.

 

Случайная величина Z имеет распределение Стьюдента [ 2 ] c n-2 степенями свободы

St(n-2).

Пусть α - уровень значимости, который равен вероятности ошибочного отклонения (отвержения) гипотезы H0: rξη =0, в то время как она на самом деле верна.

Рассмотрим в качестве примера альтернативную гипотезу H1: rξη ≠0. В этом случае критическая область, удовлетворяющая условию p(|Z|>Zα)=α, является двусторонней, поскольку состоит из двух частей Z< -Zα и Z> +Zα (рис. 4).

 

 

 

 

 

 

 

 

 

 

 

 

 

6

 

 

fSt

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

5

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

4

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

3

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S = 1 -α

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Критическая область

 

 

 

 

2

 

 

 

 

 

 

 

Критическая область

 

 

 

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

S =α/2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S =α/2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

-25

-20

-15

-10-Zα

-5

 

0

5

Zα10

15

20

25

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Рис. 4

12

Вероятность попадания критерия Z в каждую из половин критической области равна α/2. Поэтому Zα определяется из соотношения p(Z>Zα)=α/2. Вычислим Z, подставив в формулу (1.11) найденное для исследуемой выборки значение выборочного коэффициента корреляции rξη. Нулевую гипотезу H0 можно принять, если |Z|< Zα, и следует отвергнуть в случае |Z| > Zα.

Если альтернативная гипотеза H1: rξη >0, то критическая область удовлетворяет условию p(Z>Zα)=α и является правосторонней Z> +Zα (рис. 5).

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

6

 

 

fSt

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

5

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

4

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

3

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S = 1 -α

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

Критическая область

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

S

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

-25

-20

-15

-10

-5

 

0

5

Zα10

15

20

25

Рис. 5

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Величина Zα

определяется из соотношения p(Z>Zα)=α.. Нулевую гипотезу H0 прини-

мают, если Z<

Zα,

и отвергают в противоположном случае Z> Zα

[ 2 ].

 

 

 

 

 

Проиллюстрируем вышесказанное на нашем примере 1. Выберем уровень значимости α = 0.01. Сначала рассмотрим двустороннюю критическую область. Значение Zα можно найти либо из таблицы критических точек для распределения Стьюдента с 28 степенями свободы (p(Z>Zα) = 0.005), либо из таблицы квантилей распределения Стьюдента (p(Z<Zα) = 0.995). В результате получим (см., например, таблицу 2 из ПРИЛОЖЕНИЯ):

Z t ,n t ,28 t ,28 2.7633.

Для правосторонней критической области величина Zα находится из условия p(Z>Zα) = 0.01 (по таблице критических точек) или из соотношения p(Z<Zα) = 0.99 (по таблице квантилей).

Врезультате для правосторонней критической области Zα = t 0.99, 28 = 2.4671.

Впримере 1 выборочный корреляционный коэффициент, вычисленный первым ( более точным) способом, равен 0,9485, тогда

 

 

 

 

 

 

 

 

Z

0.9485 28 2

 

4.8364

15.27.

 

 

 

0.3168

1 0.94852

 

 

 

13

В результате, т.к. Z>> Zα (15.27 >> 2.7633 в случае двусторонней критической области и 15.27 >> 2.4671 для односторонней критической обрасти), можно сделать вывод, что в нашем случае гипотезу об отсутствии линейной зависимости между случайными ве-

личинами ξ и η следует отбросить и корреляционная связь является значимой.

Отметим, что при объёмах выборки n>30 квантили распределения Стьюдента

tγ,n (тут p(t <tγ,n) = γ, где n - число степеней свободы) можно находить по приближённой формуле, используя квантили нормального распределения Uγ:

t ,n

 

Uγ

 

 

.

(1.12)

 

 

 

 

 

1 (1/ 4n))2

(Uγ )2

/ 2n

 

 

 

 

Преобразование Фишера

Статистика Стьюдента не позволяет получить надёжных выводов о значимости корреляционных зависимостей в случае малых значений выборочного корреляционного коэффициента и относительно небольших выборках. Менее чувствительной к объему выборки является статистика, основанная на преобразовании Фишера:

 

1

 

1 r

 

V

ln

ξη

(1.13)

 

 

.

2

1 r

 

 

 

ξη

 

Фишером было показано, что при n ≥30 случайная величина V имеет приближенно нормальное распределение с независящей от rξηдисперсией

 

σ2

1

 

 

 

 

 

 

 

 

 

 

 

 

n 3

 

 

 

V

 

 

 

 

 

 

 

 

 

 

и математическим ожиданием

 

 

 

 

 

 

 

 

m 1 ln1 ρ

 

ρ

,

 

 

V

2

1 ρ

2n 2

 

 

 

lim m

1 ln1 ρ ,

(1.14)

n

V

2

 

 

1 ρ

 

 

 

 

 

 

 

 

,

 

 

 

где ρ – истинное (но неизвестное) значение коэффициента корреляции rξη .

Величина

V mV

 

 

 

 

 

 

U

 

 

N (0,1),

(1.15)

 

 

 

 

 

σV

 

 

 

 

 

 

где N(0,1) - нормальное распределение с нулевым математическим ожиданием и единичной дисперсией.

Заметим, что с помощью указанной статистики можно проверять более общую гипотезу о сравнении с эталоном H0:ρ = ρ0 при любой из трёх альтернативных гипотез

14

 

ρ0

 

 

 

 

 

H : ρ

0

.

1

 

 

 

ρ0

 

В этом случае mV заменяется на условное математическое ожидание

 

 

 

1

ln

 

1 ρ0

 

 

M V | H0

 

2

1

ρ0

 

 

 

 

и центрирование статистики V в формуле (1.15) осуществляется на эту величину.

Возвращаясь к нашему примеру 1, проверим значимость найденного выборочного коэффициента корреляции. Тогда основная гипотеза H0:ρ = 0 – отсутствие линейной статистической связи, условное математическое ожидание M[V|H0]=0 и

 

 

 

 

1 rξη

U

 

n 3

 

 

 

ln

 

: N (0,1).

 

2

1 r

 

 

 

 

ξη

 

Вычислим U, полагая rξη= 0.9485 и n = 30,

U 30 3 ln 1 0, 9485 2.5981ln(37.8350) 9.4395. .

2 1 0, 9485

Критические точки Uα находим для уровня значимости α = 0.01 из таблицы квантилей нормального распределения: (например, используя функции Лапласа Φ0(x) из таблицы 1 ПРИЛОЖЕНИЯ: Φ0(Uα) = 0.5 - α для односторонней области и Φ0(Uα) = 0.5 - α/2 для двусторонней. В первом случае Uα = 2.32 , во втором - Uα = 2.58. В обоих случаях Uпопадает в критическую область (U>Uα), гипотезу об отсутствии линейной статистической связи следует отбросить. Вероятностью ошибки при этом равна α = 0.01.

1.4. Доверительный интервал для корреляционного коэффициента.

Воспользовавшись преобразованием Фишера (1.13) и соотношением (1.15), можно построить доверительный интервал для выборочного коэффициента корреляции.

Действительно,

 

1

 

1 r

 

V

ln

ξη

,

2

1 r

 

 

 

ξη

 

V = arcth(rξη) - гиперболический арктангенс, возрастающая нечётная функция:

V(-rξη) = -V(rξη).

Распределение вероятностей значений V приближается (тем более точно, чем больше объём выборки n) нормальным распределением N(mVV) с параметрами

15

Источник: https://studfile.net/preview/16431523/