Реферат
Метод наименьших квадратов
Содержание
Вероятностное обоснование МНК как наилучшей оценки
Прямая и обратная регрессии
Общая линейная модель. Многофакторные модели
Доверительные интервалы для оценок МНК
Дисперсионный анализ
Взвешенный МНК
Литература
Вероятностное обоснование МНК как наилучшей
оценки
Рассмотрим следующую задачу. Пусть из
теоретических соображений мы знаем, что
Пусть мы провели
измерений и
получили выборку пар
. Наша
задача - найти коэффициенты
.
Если изобразить результаты измерений на графике, то они не лягут в точности на прямую. Будет некоторый разброс. Поэтому можно сказать, что наша задача состоит и в том, чтобы провести прямую наилучшим образом. Начнем с простейшего подхода.
В дальнейших рассуждениях
пренебрежем ошибкой в
. Будем
считать, что вся ошибка заключена в
. Представим результаты измерений
следующим образом:
, где
есть
случайная величина со средним значением ноль. Будем подбирать искомые
коэффициенты из соображений, чтобы случайная добавка была наименьшей. Введем с
этой целью невязку
и найдем
минимум невязки:
Эти уравнения называются в теории МНК нормальными уравнениями. Они и служат для определения искомых коэффициентов.
Перепишем их следующим образом:
Решение этих уравнений имеет вид:
Полученная линия называется линией аппроксимации по методу наименьших квадратов, еще говорят линией регрессии у по х.
В стандартных учебниках обычно на этом и заканчивается изложение метода НК. Однако до завершения еще далеко. Во-первых, следует оценить ошибки коэффициентов, найти для них доверительные интервалы. Во-вторых, следует оценить качество регрессии. Все это достаточно тонкие и сложные вопросы. Но их надо решать.
Перейдем к оценке ошибок коэффициентов. Для этого сделаем некоторые предварительные замечания и преобразуем найденные выражения.
Введем средние значения для
:
, аналогично
:
.
Вычислим:
аналогично для
Тогда
Перепишем теперь коэффициенты. Для
Последняя сумма равна нулю, и
окончательно имеем:
Это соотношение следует
рассматривать таким образом:
Мы приняли, что основная ошибка
заключена в у, а х не флуктуируют. Последнюю формулу мы можем рассматривать как
линейную комбинацию у, в которой х выступают как фиксированные неслучайные
числа. Если предположить, что yi и yj между собой
независимы и дисперсия
, то мы уже
получали, что дисперсия b
Как оценить
? Очевидно,
На самом деле - это смещенная
оценка, т.к. вместо истинных значений
и
подставляются лишь их оценки. Более
детальные расчеты показывают, что вместо
надо подставить
: 2 здесь
потому, что в задаче 2 искомых параметра
и
. Тогда правильная оценка для
дисперсии будет:
.
Если бы в задаче было бы р искомых
параметров, то надо было бы записать:
.
Этим и заканчивается оценка ошибки
коэффициента
.
По аналогии можно показать, что
дисперсия коэффициента
равна:
Чтобы убедиться в том, что значения
коэффициентов, полученные МНК, являются наилучшими, применим принцип
максимального правдоподобия. Опять же пренебрежем погрешностью в
и будем
считать, что вся погрешность заключена в
. Примем, что i -й результат
измерений - это есть какое-то конкретное случайное число, случайная реализация
из бесконечного набора случайных чисел. Этот набор случайных чисел подчиняется
нормальному закону распределения и характеризуется разбросом, или стандартным
отклонением
. Будем
считать, что стандартное отклонение во всех измерениях одинаковое, т.е.
. И
последнее: считаем, что результаты измерений между собой независимые. Тогда
вероятность получить в результате измерений набор чисел
равна:
Наилучшую оценку для
и
даст
. И мы
приходим к нормальным уравнениям для
и
.
После того, как найдены коэффициенты
и
,
дифференцируя вероятность по
, находим выражение для нее,
совпадающее с тем, что мы использовали выше, где уже учтено количество степеней
свободы.
Прямая и обратная регрессии
Перепишем расчетные формулы в
несколько иной форме. Дополнительно к приведенным формулам введем:
и корреляционный момент:
.
Тогда формулы для коэффициентов
регрессии можно переписать в следующем виде:
,
.
Само уравнение регрессии принимает вид:
Если принять за независимую
переменную у, а за зависимую х, то можно показать, что уравнение регрессии
примет вид:
.
Здесь надо учесть, что
.
Обратите внимание, что последнее
уравнение не получается из предыдущего путем простого выражения х через у. Если
нарисовать графики этих двух регрессий, то мы будем иметь следующее:
Покажем, что в общем случае эти две
регрессии не совпадают. С этой цель рассчитаем
:
Чтобы прямые совпадали,
должен
равняться нулю, или:
. В каком
случае это возможно? Для этого учтем, что
,
.
Учитывая выражение для
корреляционного момента через коэффициент корреляции:
, получаем:
.
Вывод: прямая и обратная регрессии совпадают только в том случае, если коэффициент корреляции равен 1. В противном случае нельзя поступать так: скажем, нашли регрессию у по х, т.е. зависимость у от х. После этого, если нам надо найти какое-то значение х, просто в полученное уравнение подставляем соответствующее значение у и находим обратное решение. В действительности нужно поступить по-другому. Надо вначале построить обратную регрессию х по у. И уже из этой регрессии находить х при нужном значении у.
Пример
Исследования распределения тяжелых элементов в галактическом диске Wielen et al. 1996.
Содержание тяжелых элементов в
звездах часто характеризуется интегральной величиной, которую называют
металличностью:
По данным о рассеянных скоплениях:
соответственно, градиент у них
получился
.
По данным о распределении звезд по возрастам, но теперь в окрестности Солнца, они построили зависимость:
, здесь
- возраст
звезды в млрд лет. После этого они предложили модель химической эволюции
галактического диска:
В качестве примера, иллюстрирующего,
как будет меняться со временем по галактическому диску металличность, они на
основе своей формулы построили такой рисунок:
И далее сделали удивительный вывод.
Они решили, что найденная модель позволяет определять места рождения звезд,
т.е.:
Приняв для Солнца его возраст и
металличность (по определению, для Солнца она равна нулю), авторы получили, что
в момент рождения оно находилось примерно на 1.9 кпк ближе к галактическому
центру, нежели его современное расстояние.
Ошибка при этом у них оценивалась примерно в 1 кпк. Так что на уровне стандартного отклонения и даже почти 2 σ этот радиальный сдвиг Солнца достоверен. Они же развили теорию диффузии звездных орбит по радиусу галактики. Эта работа в свое время вызвала огромный резонанс. Многие авторы считали, что она решает ряд проблем, как Солнца, так и Галактики. Авторы этой работы - известные специалисты. Их авторитет и большое количество ссылок создали видимость, что здесь все правильно. Но оказалось, что это не так.
Во-первых, эту работу покритиковал известнейший специалист в области исследований химического состава звезд - Тварог.
. Он обратил внимание на то, что
выборка Вилена и др. не является представительной. Еще говорят так: не является
репрезентативной.
Посмотрите, где заканчиваются данные
в этой работе: они охватывают область
кпк и не заходят во внутреннюю
область, откуда, по мнению Вилена и др., Солнце продиффундировало к нынешнему
положению.
. Авторы заложили крайне упрощенную
модель распределения тяжелых элементов в виде линейной функции с единым в
значительной части диска галактики градиентом. Такое представление ниоткуда не
следует, и более поздние работы, в частности, наши с И.А. и моим постоянным
соавтором на протяжении уже 10 лет из ин-та Астрономии при университете Сан
Паулу (Бразилия) Ж.Лепиным показывают, что радиальное распределение тяжелых
элементов в галактических дисках вовсе не описывается линейной функцией. Более
того, распределение деформируется со временем.
. И еще одна деталь. Вилен с соавторами
упустили, что из прямой регрессии нельзя делать обратные расчеты. Мои расчеты
показывают, что если по тем же данным построить регрессионную зависимость
от
, то
получается совершенно другой результат:
Если эту формулу привести к виду,
аналогичному Вилену и др., то получим:
Отсюда
. С учетом
стандартной погрешности в определении расстояний ![]()
кпк, приведенное выше смещение
можно считать недостоверным.
В обсуждаемой работе много других
предположений, которые вызывают недоумение, но я не буду на них останавливаться.
Общая линейная модель.
Многофакторные модели
Приведенную схему можно обобщить на
произвольное число независимых переменных. Пусть у нас есть набор переменных
. Их
называют «объясняющие» переменные. И мы имеем линейное соотношение: