Допустим, что из серии экспериментов
мы получили
мерных
векторов
. Наша
задача - найти коэффициенты
. Опять же будем считать, что все
ошибки заключены в
.
Поставленная задача решается путем минимизации невязки, но уже методами матричного исчисления. Соответствующие формулы можно найти в литературе, которую я привел в начале курса.
Под величинами
можно
понимать какие-то функции, например, разложение функции
в виде ряда
по степеням
, или по
каким-то другим функциям, например, синусам - косинусам - тогда это есть ряд
Фурье для представления искомой функции и т.д. Важной особенностью обсуждаемого
представления является то, что искомые параметры - коэффициенты
- входят в
модельное представление линейным образом. Поэтому такие модели называются
линейными. Подчеркну еще раз: зависимость
от
может быть нелинейной, но если
искомые коэффициенты
входят
линейно, то модель называется линейной. Выделенность линейной модели связана с
тем, что в этом случае есть однозначный рецепт, как искать параметры модели и
как рассчитывать погрешности.
Как поступать, если искомые
коэффициенты входят нелинейно? В некоторых случаях задача имеет скрытую
линейность и может быть приведена к линейной путем замены переменных. Например:
Очевидно,
путем логарифмирования получаем:
. Далее в качестве зависимой
переменой выбирается
, а вместо
искомой величины
ищется
. Очевидно,
модель в действительности является линейной. Однако, здесь надо помнить, что
законы распределения
и
отличаются.
Впрочем, это требуется для детального расчета погрешностей. Если ограничиться
простейшим подходом, то эти тонкости можно опустить.
Как поступать, если задача не приводится к линейной, т.е. является существенно нелинейной. Здесь возникают, по крайней мере, 2 проблемы.
. Как найти минимум невязки? Здесь, в свою очередь, возникают 2 вопроса.
Во-первых, с помощью какого алгоритма искать минимум? Существуют специальные методы поиска минимумов в случае многомерных нелинейных задач.
Во-вторых, минимумов может быть несколько. Действительно, в линейной модели невязка есть квадратичная форма от искомых параметров. В этом случае минимум будет единственный. В нелинейной модели, как уже говорилось, минимумов может быть несколько. Спрашивается, какой минимум принять за решение? Ответ может быть двоякий. Либо ищется глобальный минимум, либо выбирается тот минимум, который отвечает дополнительным связям.
. Как вычислить ошибки? Аналитических выражений для ошибок в общем случае нет. Ошибки ищутся путем линеаризации невязки по искомым параметрам вблизи минимума.
Пример. Определение параметров
галактического вращения.
аналогично:
метод наименьший квадрат регрессия
Разлагаем в ряд Тейлора угловую
скорость:
![]()
;
.
Разлагая угловую скорость до любого
порядка, в принципе, можно найти кривую вращения для любых расстояний с любой
точностью. Ограничения накладываются имеющимися данными и требованием, чтобы
коэффициенты были достоверные.
Доверительные интервалы для оценок
МНК
После построения регрессии нужно еще определить ее качество.
Начнем с рассмотрения доверительных
интервалов для искомых коэффициентов. Мы нашли уже стандартные отклонения для
коэффициентов a и b:
;
.
Для определения доверительных
интервалов воспользуемся критерием Стьюдента. Назначим какой-то уровень
надежности,
(скажем,
). Находим
по таблицам соответствующее значение
. Тогда доверительные интервалы
будут:
;
.
Теперь мы можем проверить следующую
гипотезу: предположим, что для коэффициентов мы ожидаем некоторое значение.
По-видимому, наиболее актуально - нулевое значение того или иного параметра.
Скажем, в задаче Хаббла о законе расширения Вселенной, коэффициент a равен нулю.
Допустим, что, не зная этого из теории, как оно и было в истории с Хабблом, мы
предположили общую линейную модель со свободным членом, отличным от нуля. После
обработки экспериментов, мы находим оба коэффициента. Определяем доверительные
интервалы. И теперь можем рассмотреть нуль гипотезу:
(в частном
случае
) против
альтернативы
. Идея
такая: вычисляется
.
Это значение
сравнивается
с табличным
. Очевидно,
если
, то
- гипотеза
отбрасывается. Впрочем, Если
не попадает в интервал
, то это и
означает, что на принятом уровне вероятности
-гипотеза отвергается.
Аналогичная работа проводится с
другими коэффициентами. После того, как недостоверные коэффициенты установлены,
их следует исключить из рассмотрений и повторить расчеты. И т.д. Однако на этом
обработка не заканчивается. Поясню сказанное следующим примером. Предположим,
мы рассматриваем следующую модель:
.
При этом, нам заранее не известна
наибольшая степень показателя k. Более того, какие-то слагаемые в этой сумме могут
и не присутствовать, иными словами, какие-то коэффициенты bi могут быть
равными нулю. Как определить максимальную степень икса, и какие коэффициенты
следует исключить из рассмотрения. Во-первых, указанием на включение или не
включение того или иного слагаемого может служить критерий Стьюдента.
Во-вторых, для окончательного решения вопроса следует убедиться, что та или
иная аппроксимация является наилучшей (по крайней мере, среди рассмотренных
вариантов).
Дисперсионный анализ
Начнем с понятия о дисперсионном
анализе регрессии. Разберем это понятие на примере линейной зависимости.
Согласно МНК можем представить:
, где
.
Здесь второе соотношение - найденное
уравнение регрессии,
есть
случайная величина со средним, равным нулю. Усредняя, находим:
.
Введем:
и
. Обратить
внимание на малые и большие буквы. Через эти обозначения уравнение регрессии
можно записать так:
. Кроме того:
.
Вычислим теперь такую сумму:
.
Покажем, что средняя сумма равна
нулю.
В принятых обозначениях
, поэтому
действительно
.
Окончательно интересующая нас сумма
может быть разбита на 2 части:
Чтобы проанализировать смысл
полученного разбиения, нарисуем график:
Во-первых, заметим, что регрессионная прямая всегда проходит через средние значения.
Во-вторых, смысл первой суммы есть вариация
зависимой переменной около среднего значения, которая объясняется регрессией.
Вторая сумма - это та часть вариации, которая регрессией не объясняется. Отсюда
видно, что качество регрессии тем лучше, чем меньше доля второй суммы по
отношению к исходной. Для случая зависимости от одной переменной (ее еще
называют предиктором), можно показать, что:
,
где
есть коэффициент корреляции между х
и у. Можно еще записать так:
.
Отсюда видно, если не будет
случайных ошибок, то
. Величину
еще
называют коэффициентом детерминации. По смыслу сказанного ясно, что он
позволяет судить о качестве регрессионной модели.
С учетом степеней свободы
коэффициент детерминации определяется так:
Другой взгляд на то, что показывает коэффициент детерминации. Регрессионная прямая, как уже отмечалось, проходит через средние значения. Она может проходить либо под углом к оси абсцисс, либо горизонтально. В первом случае мы имеем, что между х и у есть некоторая зависимость. Во втором - зависимость отсутствует. Коэффициент детерминации позволяет сделать выбор между этими двумя возможностями.
Какова количественная мера того, что коэффициент детерминации значим? Заметим здесь, что если в задаче один предиктор, то ответ на этот вопрос дается с помощью критерия Стьюдента. Коэффициент детерминации сохраняет свое значение и в случае многофакторного анализа, но в этом случае используется несколько другая статистика - статистика Фишера.
Типичная задача. Пусть мы имеем
какое-то регрессионное уравнение, скажем,
.
Под
понимаю какой-то объясняющий
предиктор. Спрашивается, все ли к предикторов должны участвовать в модели, или
какие-то m штук в модель не входят, т.е. соответствующие коэффициенты равны
нулю? В последнем случае модель имеет вид:
.
Задача решается следующим образом.
Вначале строится первая модель и находится коэффициент детерминации, обозначим
его
. Затем
строится вторая модель без m предикторов и находится коэффициент детерминации
. Затем
вычисляется величина
.
Эта величина подчиняется статистике
Фишера с (m,N-k-1)
степенями свободы. Как и для коэффициента Стьюдента, для нее рассчитаны
таблицы. Работа с ними строится так. Назначается заданный уровень значимости.
По таблицам находится критическое значение F-статистики
Фишера с соответствующим количеством степеней свободы. Если рассчитанное
значение превосходит критическое, то нулевая гипотеза, заключающаяся в том, что
рассматриваемые m переменных не входят в модель, отвергается. Собственно
говоря, из структуры для F видно, что если исключены m
каких-то переменных и при этом коэффициент детерминации мало изменился, то это
и означает, что добавление этих переменных мало меняет остатки. Соответственно,
эти переменные можно и не включать. Но если разность
будет
большой, то это означает, что изменение остатков существенное, существен вклад
этих m предикторов, и исключать их неправомерно.
На практике не исключают сразу несколько предикторов, а анализируют по очереди.
Приведу такой пример. Пусть процесс
описывается функцией
, а мы, не
зная этого, моделируем его функцией
. В силу того, что в
экспериментальных данных будут погрешности, скорее всего, все коэффициенты
будут отличны от нуля. Но после построения регрессии общего вида, следует
проверить достоверность коэффициентов по критерию Стьюдента, формулировав
нулевую гипотезу для каждого коэффициента. Затем, выбрав недостоверный
коэффициент, исключить его. Построить новую регрессию, и с помощью статистики
Фишера убедиться, что исключение соответствующего коэффициента было значимо.