Такой признак, как «вид изменения состояния нейрона», делит ИНС на синхронные и асинхронные. В первом случае в каждый момент времени лишь один нейрон меняет свое состояние, во втором - состояние меняется сразу у целой группы нейронов, как правило, у всего слоя. Алгоритмически ход времени в нейронных сетях задается итерационным выполнением однотипных действий над нейронами.
По способу решения задачи ИНС разделяются: на формируемые; с формируемой матрицей связи (сеть Хопфилда); обучаемые; комбинированные (смешанные).
Формируемые сети. Сети этого вида проектируют для формализуемых задач, имеющих четко сформулированный в нейросетевом базисе алгоритм решения конкретной задачи.
Сети с формируемой матрицей связей. Сети этого вида применяют для трудноформализуемых задач. Как правило, эти сети имеют одинаковую структуру и различаются лишь матрицей связи (сеть Хопфилда). Достоинством таких сетей является их наглядность в работе.
Обучаемые сети. Этот вид сетей используют для решения неформа-лизуемых задач. В процессе обучения сети автоматически изменяются такие ее параметры, как коэффициенты синаптической связи, а в некоторых случаях и топология. Серьезным препятствием в широком применении ИНС все еще остается большое время обучения сети. Поэтому выбор или разработка алгоритма обучения является ключевой задачей.
Комбинированные (смешанные) сети. Этот класс сетей сочетает в себе признаки двух, а то и трех основных видов. Как правило, эти сети многослойные, каждый слой которых представляется различной топологией и обучается по определенному алгоритму. В настоящее время этот класс получил наибольшее распространение, так как дает самые широкие возможности разработчику.
Приведенная выше классификация позволила определиться с начальным классом ИНС, наиболее подходящим для использования в рамках нейромодифицированной модели Шарпа. В дальнейшем предложенная классификация позволит выбирать перспективные классы ИНС для других моделей и решаемых задач.
Реализация нейромодифированной одноиндексной модели Шарпа базируется на применении ИНС. При этом важно спроектировать структуру сети, адекватную поставленной задаче. Проектирование структуры ИНС предполагает выбор количества слоев сети и нейронов в каждом слое, а также определение необходимых связей между слоями.
Подбор количества нейронов во входном слое обусловлен размерностью входного вектора х. Подобная ситуация и с выходным слоем, в котором количество нейронов принимается равным размерности ожидаемого вектора d. Серьезной проблемой остается подбор количества скрытых (внутренних) слоев и числа нейронов в каждом из них. Теоретическое решение этой задачи в смысле условия достаточности было предложено математиками, занимающимися аппроксимацией функции нескольких переменных. Следует отметить, что ИНС выступает в роли универсального аппроксиматора обучающих данных (х, d) [26, 157]. В процессе обучения подбираются его функциональные коэффициенты (векторы весов отдельных нейронов). На этапе функционирования при зафиксированных значениях весов производится простой расчет значения аппроксимирующей функции при заданном входном векторе.
О
пределение
минимального количества скрытых слоев
сети основано на использовании свойств
аппроксимирующих функций. Каждая
заданная функция может быть выражена
линейной комбинацией локальных импульсов,
которые имеют ненулевое значение только
в ближайшей окрестности текущего
значения x.
Импульсная функция определенной
структуры может быть сформирована как
суперпозиция двух функций, сдвинутых
относительно друг друга [59]. На рис. 4.13
продемонстрирован способ формирования
импульса для одномерной сети, имеющей
единственный вход.
Две сдвинутые относительно друг друга идентичные сигмоиды у1 и y2 создают в результате вычитания импульс с длительностью, пропорциональной разности смещений этих сигмоидальных функций. Соответствующим подбором функциональных параметров можно добиться формирования такого импульса, который будет возникать в необходимом для нас месте и иметь требуемую ширину и крутизну нарастания.
В случае двухмерной сети можно аналогичным способом сформировать импульс на плоскости [65]. Разность двух определенных на плоскости и сдвинутых относительно друг друга сигмоидальных функций образует гребень бесконечной длины.
Добавляя следующую пару сдвинутых относительно друг друга сигмоидальных функций и вычисляя их разность, можно получить второй гребень бесконечной длины. При подборе параметров обеих сигмоидальных пар таким образом, чтобы их гребни располагались под определенным углом (например, 90°), можно получить в результате суммирования этих гребней структуру двухмерного горба. В месте пересечения гребней образуется импульс двухмерной формы, ограниченный с четырех сторон ответвлениями бесконечной длительности. Эти ответвления можно ликвидировать передачей всего импульса на следующую сигмоидальную функцию (дополнительный слой нейронов) с соответственно подобранным порогом. Как следствие, выполняется фильтрация значения суммы на определенном уровне, подобранном так, что импульс, сформированный сложением двух гребней, пропускается, тогда как ответвления гребней отсекаются.
Созданная этим способом двухвходовая ИНС содержит скрытый слой, состоящий из четырех нейронов, и выходной слой, на котором расположен один нейрон сигмоидального типа. При построении сигмоидальной функции активации с соответствующим порогом он выполняет суммирование сигналов от предыдущих четырех нейронов и отсечение ответвлений.
Возможность обобщения приведенных рассуждений на случай многовходовой сети следует из теории Колмогорова [59, 65]. Если ограничиться непрерывной функцией, трансформирующей N-мерное множество входных данных х в М-мерный выходной вектор d, то можно доказать, что аппроксимация такого типа осуществима при использовании сети с одним скрытым слоем. При N входных нейронах будет достаточно использовать для реализации этой функции скрытый слой с (2N + 1) нейронами. Архитектура ИНС, удовлетворяющая теореме Колмогорова, изображена на рис. 4.14.
В предложенном Колмогоровым доказательстве теоремы принято, что выходные сигналы отдельных слоев описываются зависимостями вида
, (4.4)
для нейронов скрытого слоя при k=1,2,…,2N+1 либо:
, (4.5)
для нейронов выходного слоя, где символами у(*) и g(*) обозначены некоторые точно не определенные непрерывные функции, а все используемые в этих формулах коэффициенты подбираются в процессе обучения.
В случае дискретного преобразования х—>у одного скрытого слоя уже недостаточно и необходимо создание еще одного слоя нейронов. Это означает, что независимо от вида многовходовой аппроксимирующей функции максимальное количество скрытых слоев, достаточных для аппроксимации заданного преобразования, не превышает двух.
Результат, полученный благодаря применению теоремы Колмогорова, носит теоретический характер. Он определяет максимальное количество слоев и число нейронов в отдельных слоях, достаточных для аппроксимации заданного преобразования. Теорема не уточняет ни вид нелинейных функций, ни методы обучения сети, создаваемой для реализации данного преобразования Однако она представляет собой фактор, важный для минимизации структуры ИНС. В практических реализациях сетей как количество слоев, так и число нейронов в каждой из них может отличаться от предлагаемых теоремой Колмогорова. Помимо немногочисленных исключений (например, неокогнитрон [65]), чаще всего используются сети, имеющие один скрытый слой (максимум - два), причем количество нейронов в слое может различаться (как правило, от N до 3N).
Одно
из важнейших свойств нейронной сети -
это способность к обобщению полученных
знаний. Сеть, натренированная на некотором
множестве обучающих выборок, генерирует
ожидаемые результаты при подаче на ее
вход данных, относящихся к тому же
множеству, но не участвовавших
непосредственно в процессе обучения.
Разделение данных на обучающее и тестовое
подмножества представлено на рис. 4.15.
Множество данных, на котором считается истинным некоторое правило R, разбито на подмножества L и G, при этом в составе L, в свою очередь, можно выделить определенное подмножество контрольных данных V, используемых для верификации степени обучения сети. Обучение проводится на данных, составляющих подмножество L. Способность отображения сетью элементов L может считаться показателем степени накопления обучающих данных, тогда как способность распознавания данных, входящих во множество G и не использованных для обучения, характеризует ее возможности обобщения (генерализации) знаний. Данные, входящие и в L, и в G, должны быть типичными элементами множества R. В обучающем подмножестве не должно быть уникальных данных, свойства которых отличаются от ожидаемых типичных значений.
Феномен обобщения возникает вследствие большого количества комбинаций входных данных, которые могут кодироваться в сети с N входами. Если в качестве простого примера рассмотреть однослойную сеть с одним выходным нейроном, то для нее может быть составлено 2N входных выборок. Каждой выборке может соответствовать единичное или нулевое состояние выходного нейрона. Таким образом, общее количество различаемых сигналов составит 2N. Если для обучения сети используются р из общего числа 2N входных выборок, то оставшиеся незадействованными (2N—p) допустимых комбинаций характеризуют потенциально возможный уровень обобщения знаний.
Подбор весов сети в процессе обучения имеет целью найти такую комбинацию их значений, которая наилучшим образом воспроизводила бы последовательность ожидаемых обучающих пар (хi, di). При этом наблюдается тесная связь между количеством весов сети (числом степеней свободы) и количеством обучающих выборок. Если бы целью обучения было только запоминание обучающих выборок, их количество могло быть равным числу весов. В таком случае каждый вес соответствовал бы единственной обучающей паре. К сожалению, такая сеть не будет обладать свойством обобщения и сможет только восстанавливать данные. Для обретения способности обобщать информацию сеть должна тренироваться на избыточном множестве данных, поскольку тогда веса будут адаптироваться не к уникальным выборкам, а к их статистически усредненным совокупностям. Следовательно, для усиления способности к обобщению необходимо не только оптимизировать структуру сети в направлении ее минимизации, но и оперировать достаточно большим объемом обучающих данных.
Обучение
ведется путем минимизации целевой
функции E(w),
определяемой только на обучающем
подмножестве L,
при
этом
,
где
р
обозначено
количество обучающих пар (хk,
dk),
а
yk — вектор реакции сети на возбуждение хk.
Минимизация этой функции обеспечивает достаточное соответствие выходных сигналов сети ожидаемым значениям из обучающих выборок.
Истинная
цель обучения состоит в таком подборе
архитектуры и параметров сети, которые
обеспечат минимальную погрешность
распознавания тестового подмножества
данных, не участвовавших в обучении.
Эту погрешность будем называть
погрешностью обобщения EG(w).
Co
статистической точки зрения погрешность
обобщения зависит от уровня погрешности
обучения EL(w)
и
от доверительного интервала
.
Она
характеризуется отношением [157]
. (4.6)
В
работе [155] показано, что значение
функционально зависит от уровня
погрешности обучения EL(w)
и
от отношения количества обучающих
выборок р
к фактическому
значению
параметра,
называемого мерой Вапника-Червоненкиса
и обозначаемого VCdim.
Мера VCdim
отражает уровень сложности нейронной
сети и тесно связана с количеством
содержащихся в ней весов. Значение
уменьшается
по мере возрастания отношения количества
обучающих выборок к уровню сложности
сети.
По этой причине обязательным условием выработки хороших способностей к обобщению считается грамотное определение меры Вапника-Червоненкиса для сети заданной структуры. Метод точного определения этой меры не известен, о нем можно лишь сказать, что ее значение функционально зависит от количества синаптических весов, связывающих нейроны между собой. Чем больше количество различных весов, тем больше сложность сети и соответственно значение меры VCdim. В [154, 156] предложено определять верхнюю и нижнюю границы этой меры в виде
, (4.7)
где [ ] обозначена целая часть числа, N - размерность входного вектора, К - количество нейронов скрытого слоя, Nw - общее количество весов сети, a Nn - общее количество нейронов сети.
Из выражения (4.7) следует, что нижняя граница диапазона приблизительно равна количеству весов, связывающих входной и скрытый слои, тогда как верхняя граница превышает двукратное суммарное количество всех весов сети. В связи с невозможностью точного определения меры VCdim в качестве ее приближенного значения используется общее количество весов нейронной сети.
Таким образом, на погрешность обобщения оказывает влияние отношение количества обучающих выборок к количеству весов сети. Небольшой объем обучающего подмножества при фиксированном количестве весов вызывает хорошую адаптацию сети к его элементам, однако не усиливает способности к обобщению, так как в процессе обучения наблюдается относительное превышение числа подбираемых параметров (весов) над количеством пар фактических и ожидаемых выходных сигналов сети. Эти параметры адаптируются с чрезмерной (а вследствие превышения числа параметров над объемом обучающего множества - и неконтролируемой) точностью к значениям конкретных выборок, а не к диапазонам, которые эти выборки должны представлять. Фактически задача аппроксимации подменяется в этом случае задачей приближенной интерполяции. В результате всякого рода нерегулярности обучающих данных и измерительные шумы могут восприниматься как существенные свойства процесса. Функция, воспроизводимая в точках обучения, будет хорошо восстанавливаться только при соответствующих этим точкам значениях. Даже минимальное отклонение от этих точек вызовет значительное увеличение погрешности, что будет восприниматься как ошибочное обобщение. По результатам разнообразных численных экспериментов установлено, что высокие показатели обобщения достигаются в случае, когда количество обучающих выборок в несколько раз превышает меру VCdim [15].
На рис. 4.16 представлена графическая иллюстрация эффекта гиперразмерности сети (слишком большого количества нейронов и весов).