Text
                    МАТЕМАТИКО-СТАТИСТИЧЕСКИЕ
МЕТОДЫ ЗА РУБЕЖОМ


OPTIMISATION EN CLASSIFICATION AUTOMATIQUE C. et collaborateurs INSTITUT NATIONAL DE RECHERCHE EN INFORMATIQUE ET EN AUTOMATIQUE DOMAINE DE VOLUCEAU • ROCQUENCOURT • B. P. 105 • 78 150 LE CHESNAY 1979
МЕТОДЫ АНАЛИЗА ДАННЫХ Подход, основанный на методе динамических сгущений Перевод с французского С. А. АЙВАЗЯНА, В. Д. КОНАКОВА, С. Ю, АДАМОВА Под редакцией С. А. АЙВАЗЯНА и В. М. БУХШТАБЕРА Москва «Финансы и статистика» 1985
ББК 22.172 М54 Коллектив авторов под руководством Э. Дидэ МАТЕМАТИКО-СТАТИСТИЧЕСКИЕ МЕТОДЫ ЗА РУБЕЖОМ ВЫШЛИ ИЗ ПЕЧАТИ 1. Ли Ц., Джадж Д., Зель- н е р А. Оценивание параметров марковских моделей по агрегированным временным рядам. 2. Райфа Г., Шлейфер Р. Прикладная теория статистических решений. 3. Клейнен Дж. Статистические методы в имитационном моделировании. Вып. 1 и 2. 4. Б а р д Й. Нелинейное оценивание параметров. 5. Болч Б. У., Хуань К. Д. Многомерные статистические методы для экономики. 6. И б е р л а К. Факторный анализ. 7. Зельнер А. Байесовские методы в эконометрии. 8. X е й с Д. Причинный анализ в статистических исследованиях. 9. П у а р ь е Д. Эконометрия структурных изменений. 10. Драймз Ф. Распределенные лаги. 11. Мостеллер Ф., Тьюки Дж. Анализ данных и регрессия. Вып. 1 и 2. 12. Бикел П., Доксам К. Математическая статистика. Вып. 1 и 2. 13. Лиме р Э. Статистический анализ неэкспериментальных данных. 14. Песаран М., Слейтер Л. Динамическая регрессия: теория и алгоритмы. ГОТОВИТСЯ К ПЕЧАТИ Бартоломью Д. Стохастические модели социальных процессов. Редколлегия: А. Г. Аганбегян, Ю. П. Адлер, Ю. Н. Благовещенский, А. Я. Боярский, Э. Б. Ершов, Т. В. Рябушкин, Е. М. Четыркин М 1702060000—001 010@1)—85 78—84 Institut National de Recherche en Informatique et en Automatique Перевод на русский язык, вступительная статья, «Финансы и статистика», 1985
• АНАЛИЗ ДАННЫХ, ПРИКЛАДНАЯ СТАТИСТИКА И ПОСТРОЕНИЕ ОБЩЕЙ ТЕОРИИ АВТОМАТИЧЕСКОЙ КЛАССИФИКАЦИИ I. ЗАДАЧИ СТАТИСТИЧЕСКОЙ ОБРАБОТКИ ДАННЫХ И МЕТОД ДИНАМИЧЕСКИХ СГУЩЕНИЙ Рекомендуя к изданию на русском языке коллективную монографию французских коллег «Методы анализа данных. Подход, основанный на методе динамических сгущений», мы в какой-то мере отдавали себе отчет в том, какие трудности нас ожидают. Главная из них — значительная отдаленность содержания и формы данной книги от принятых в литературе по методам статистической обработки данных большинством советских, американских и английских авторов. Однако как раз первый компонент «отдаленности» (оригинальность содержания) и явился решающим доводом в пользу целесообразности русского издания этого труда. Что касается второго компонента (особенность стиля подачи материала, заключающаяся в увлечении, до некоторой степени традиционном для французской математической литературы, сухим лаконичным формализмом), то переводчики и редакторы постарались, по возможности, облегчить читателю адаптацию к принятой авторами форме изложения. Предлагаемая читателю книга посвящена изложению и развитию одного общего подхода (названного авторами «методом динамических сгущений»: МДС — Methode des Nuees Dinarniques: MND) к статистической обработке данных (гл. 1—4, 12), способного генерировать методы решения таких задач, как: 1. Разбиение обследованной совокупности объектов или признаков на некоторое число (известное заранее или нет) однородных классов— собственно проблема автоматической классификации в различных постановках (гл. 5, 7, 15, 16). 2. Снижение размерности (числа анализируемых показателей) исследуемого массива исходных данных, отбор наиболее информативных показателей и визуализация (удобное наглядное представление) исходных многомерных данных и полученных статистических выводов (гл. 6). 3. Статистический анализ предпочтений, задача их типологизации и агрегирования (гл. 9). 4. Статистический анализ линейных моделей регрессионного типа (г«*. Ю, И). 5- Оптимальная (в рамках решаемой конкретной задачи) оцифровка анализируемых переменных (гл. 13).
6. Статистический анализ «двухвходовых» таблиц сопряженности (гл. 14). Работоспособность описанных приемов статистической обработки продемонстрирована на иллюстративных и самостоятельных реальных задачах (гл. 8, 17, 18). Используемые методы сопровождаются комментариями, относящимися к их вычислительной реализации. Научный редактор книги профессор Эдвин Дидэ — один из ведущих специалистов в области так называемого «анализа данных». Он руководит подразделением в Национальном институте исследований по информатике и автоматике (INRIA) и одновременно преподает в университете Париж—IX. Характеризуя анализ данных как область исследований, следует сказать, что до последнего времени развитие теории, методологии и практики статистической обработки анализируемых данных шло, по существу, в двух параллельных направлениях. Одно из них представлено методами, предусматривающими возможность вероятностной интерпретации обрабатываемых данных и полученных в результате обработки статистических выводов. Эту систему понятий, определений и методов принято называть математической статистикой. Другое направление представлено методами анализа данных и основано на следующей логической схеме: подлежащие статистической обработке исходные данные не могут интерпретироваться как выборка из генеральной совокупности, и, следовательно, использование вероятностных моделей при построении и выборе наилучших методов статистической обработки и последующая вероятностная интерпретация статистических выводов оказываются неправомерными; из множества возможных методов, реализующих поставленную цель статистической обработки данных, наилучший метод выбирается с помощью оптимизации некоторого экзогенно заданного критерия (функционала) качества метода*. Разработанный Э. Дидэ и его сотрудниками метод динамических сгущений (МДС) хотя и формулируется в терминах общей задачи классификации, но, по существу, при соответствующем подборе управляемых параметров метода индуцирует разнообразные методы решения задач типов 1—6. Основная идея МДС (являющаяся далеким обобщением идеи известного ранее метода «iC-средних», примерно в одно и то же время предложенного Себастианом (США, [17]), Мак Куином (США, [25]) и Шлезингером (СССР, [23])) может быть достаточно отчетливо выражена словами Э. Дидэ: «Среди всех разбиений на К классов еле. *Следует, правда, отметить, что и в математико-статистическом подходе выбор наилучшего из всех возможных методов статистической обработки производится в соответствии с некоторым функционалом качества метода; однако в этом случае исследователь основывает свой выбор функционала качества метода на допущениях о вероятностной природе исходных данных, руководствуясь, например, принципом максимального правдоподобия и т. п., в то время как в анализе данных при задании функционала качества метода руководствуются эвристическими соображениями содержательного (физического, экономического, технического и т. п.) плана (см. [1]). Это обусловливает целесообразность разработки единой методологии построения статистических решающих правил, объединяющей в себе оба упомянутых направления. Соответствующую научную дисциплину мы, следуя [3], будем называть прикладной статистикой.
дует найти разбиение, относительно каждого класса которого заданное «ядро» оказалось бы наиболее представительным. Понятие ядра ... имеет самый широкий смысл (курсив наш.—С. А. и В. Б.): ядро класса (т. е. группы точек) может быть подгруппой точек, центром тяжести, осью, случайной переменной и т: д.» (см. с. 25). Именно степени свободы, предоставляемые исследователю возможностью выбора типа ядра, вида оптимизируемого функционала качества метода и связанных с ними параметров, и позволяют вкладывать в рамки описываемого в книге метода широкий спектр приемов статистической обработки данных. Это и составляет главную ценность МДС, обусловливает теоретический и прикладной интерес данного метода для нашего читателя. Дело в том, что сама по себе идея формулировки и решения основных задач прикладной статистики в качестве специальных оптимизационных задач предлагалась и последовательно реализовывалась и в работах других авторов ([1], [4], [5]). Однако авторам МДС впервые удалось сформулировать различные типы задач статистической обработки данных в рамках единой оптимизационной задачи автоматической классификации (АК). Сами авторы разделяют содержание своего двухтомника на 5 частей. Особое место занимает гл. 1, в которой введены основные понятия, сформулирована математическая идея метода и дана общая схема доказательства сходимости алгоритмов, основанных на МДС. Подчеркнем, что сходимость алгоритма авторы понимают в смысле «анализа данных», а не в смысле классической математической статистики, т. е. утверждается стабилизация алгоритма только на данной выборке. Остальные главы первой (теоретической) части монографии (гл. 2— 4) посвящены детализации и углублению МДС. Эти главы можно считать теоретической базой всех последующих частей. Здесь хотелось бы выделить гл. 3 «Мультикритериальная классификация», которая особенно выпукло демонстрирует возможности МДС. Вторая часть посвящена изложению и дальнейшему развитию на базе метода МДС классических задач анализа данных, математической статистики и численного анализа (гл. 5, 6, 7, 10, 11). Здесь наибольшее впечатление производит гл. 6 «Факторный типологический анализ», в которой показано, что МДС позволяет создать алгоритм, синтезирующий достоинства классического факторного анализа и автоматической классификации, реализуемой с помощью метода /(-средних. Третья часть посвящена разработке адаптивных алгоритмов (гл. 12, 13) и проблемам статистической обработки так называемых таблиц сопряженности признаков (гл. 14). Четвертая часть (глава 15) посвящена задачам получения разбиения выборки на классы с дополнительной структурой либо на классы, Удовлетворяющие некоторым априорным ограничениям. Самостоятельный интерес представляют главы, посвященные изложению результатов решения прикладных задач с использованием раз- личных вариантов МДС (пятая часть). Так, в гл. 8 описывается применение дискриминантного типологического анализа (ДТА) к решению проблемы автоматизации контроля качества функционирования вра- 7
щающихся механизмов. С помощью ДТА удалось формализовать и автоматизировать ранее субъективно оцениваемые понятия «хорошее качество» и разные типы дефектных режимов функционирования. Метод основан на статистической обработке (с использованием ДТА) частотных характеристик режима вращения. В гл. 9 демонстрируются возможности МДС при статистическом анализе множества предпочтений, высказанных относительно одной и той же совокупности объектов, намечены конкретные области применений такого анализа в маркетинге, в управлении (в частности, при решении проблемы мультикри- териального выбора), в статистической обработке экспертиз. Гл. 17 и 18 целиком посвящены описанию решения конкретных задач соответственно при исследовании информационных систем и при типологическом анализе так называемых «нагрузочных кривых» (последовательностей, описывающих суточную динамику потребляемой электроэнергии). Оценивая монографию в целом, следует отметить широту диапазона практической применимости описанного в ней подхода, его работоспособность при решении широкого спектра задач типа 1—6. Обратим внимание читателя на тот факт, что множество алгоритмов, построение которых возможно на базе МДС, не исчерпывается алгоритмами, описанными в предлагаемой работе (как отмечают сами авторы, подбор алгоритмов, представленных в монографии, осуществлялся ими с ориентацией в первую очередь на их прикладную актуальность). Необходимо подчеркнуть также, что предлагаемая вниманию читателя книга — одна из очень немногих (если не единственная), полностью посвященная проблеме автоматической классификации (наша точка зрения относительно подобной ситуации изложена в разделе II данного предисловия). Говоря о недостатках монографии, следует отметить относительно слабо представленный аспект вероятностного моделирования и вероятностной интерпретации при конструировании и использовании методов статистической обработки данных. Список цитируемых работ явно не полон и сильно отражает пристрастия авторов. Например, в монографии нет ссылок на опубликованные на английском языке работы Фуку наги и, в частности, на его книгу [22], хотя алгоритм Фуку наги решения задачи автоматической классификации с максимизацией разделимости классов, по существу, совпадает с алгоритмом дискрими- нантного типологического анализа, описанного в гл. 7. Книга сильно выиграла бы, если бы авторы уделили внимание сравнительному анализу эффективности предлагаемого ими МДС и другим возможным методам решений тех же задач. По согласованию с авторами в русском издании книги произведены некоторые сокращения. В основном они коснулись текстов программного обеспечения ЭВМ. Дело в том, что советский читатель не смог бы им воспользоваться, в частности, из-за невозможности непосредственной адаптации ряда стандартных модулей, наличие которых является необходимым условием применения описываемых программ. Несмотря на отмеченные недостатки, мы не сомневаемся в том, что знакомство советского читателя с книгой Э. Дидэ и соавторов будет способство- 8
ять распространению в статистической практике новых актуальных и эффективных методов анализа многомерных данных, проводимого целью получения научных или практических выводов. В следующей части предисловия мы постарались описать соотношение между изложенными в книге результатами французских коллег достижениями советских специалистов в данной области, связь с задачей построения общей теории автоматической классификации. С этой частью предисловия можно познакомиться и после прочтения книги. II ПОДХОД К ПОСТРОЕНИЮ ОБЩЕЙ ТЕОРИИ АВТОМАТИЧЕСКОЙ КЛАССИФИКАЦИИ Отсутствие достаточно полных и глубоких монографий по автоматической классификации объясняется, на наш взгляд, тем, что теория, на базе которой можно было бы «навести порядок» в огромном множестве алгоритмов АК, возникающих из нужд разнообразных приложений, еще не создана. Отсутствие теории означает, по существу, отсутствие подходов к систематизации и развитию идей АК, а это в свою очередь препятствует разработке новых алгоритмов, их сравнительному анализу. Предлагаемая книга вносит существенный вклад в развитие такой теории. В частности, она дает достаточно общий способ описания разнообразных алгоритмов АК. Однако, позволяя генерировать широкий класс алгоритмов АК, структура МДС не содержит такого набора управляемых параметров метода, который давал бы возможность устанавливать конструктивные связи между различными алгоритмами, производить их сопоставление и сравнительный анализ. К тому же существуют важные классы алгоритмов АК, не укладывающихся в схему МДС (например, «Форель», см. [13]). Ниже, следуя [6], [7], мы излагаем подход к построению общей теории АК. В частности, будет показано, как в рамках этого подхода преодолеваются указанные трудности. Описываемый подход опирается на следующую идею. Все многообразие алгоритмов АК представляется в виде иерархической структуры. На самом верхнем уровне находится универсальная математическая модель, компоненты которой образуют средство для единообразной постановки задач АК и описания алгоритмов их решения. На самом нижнем располагаются «движения» конкретных алгоритмов (определение «движения» алгоритма дано ниже). Переход на более низкие Уровни происходит за счет конкретизации, наполняющих компоненты структуры модели информацией о характере данных, конечной цели классификации, априорных гипотезах, результатах предварительной обработки и т. п. Предлагаемый подход имеет три аспекта: А. Исследование модели АК как математической структуры с целью получения условий сходимости алгоритмов и описания класса Функционалов, оптимизируемых ими. Б. Сопоставление различных известных алгоритмов и разработка етодов целенаправленного конструирования новых алгоритмов, ос-
нованных на переходах снизу вверх и сверху вниз по уровням иерархической структуры в многообразии алгоритмов. В. Получение параметрических семейств алгоритмов с целью реализации их в виде комплексов программ, предназначенных для автоматизации процессов проверки сложных иерархических гипотез. В последующем изложении мы, по возможности, придерживаемся обозначений и понятий книги, ряд результатов иллюстрируется на примерах алгоритмов из нее. В описании нашей математической конструкции мы используем терминологию и результаты книги [2]. Начнем с описания компонент универсальной математической модели АК. Е — классифицируемая совокупность объектов хъ х2, ... Способ задания этих объектов конкретизируется в процессе постановки задачи. В большинстве алгоритмов объект хп описывается /?-мерным вектором замеренных на нем признаков. В частности, в случае числовых признаков Е лежит в евклидовом пространстве R*7. S = S(E) — множество состояний, в которых выборка участвует в алгоритме. Содержательно эта компонента описывает допустимые классификации, возникающие на шагах алгоритма. В терминологии книги S(E) — это пространство покрытий, но мы более конкретизируем эту компоненту, считая каждый элемент s ? S отображением выборки Е в множество Z — множество значений классификаций. Состав и структура Z определяют тип решаемой задачи, т. е., по существу, дают средство ответить на вопрос: Какую задачу классификации предполагается решить? Например, когда Z ^= [1, 2, ..., &, ...,/(] — список номеров классов, то множество S = {s : Е -> Z} совпадает с множеством разбиений выборки Е на К непересекающихся классов: s4=^ (?A), ..., Е(К))у где E(k) — s-1^). Если Z—упорядоченное множество, то это соответствует классификации с предпочтением или иерархической классификации. Задачам нечеткой классификации отвечает Z= {(zb ..., Zk), где zk— вещественные числа, такие, что zfe^0, к %гк ==1}; более формально в этом случае Z — симплекс, вершины ко- торого соответствуют номерам классов, а координаты точек симплекса— вероятностям (или степеням) принадлежности к классам. Очевидно, что наличие априорных сведений о типе задачи АК, о допустимых классификациях приводят к ограничениям, выделяющим множество S(E) в множестве всех отображений. Например, наличие в Е обучающей к (верифицированной) подвыборки Ег — (J Ex(k) приводит к условиям вида s(x) ~k для х G Ex(k). Итак, чтобы задать S, необходимо формализовать задачу, т. е. указать Z и сформулировать условия, выделяющие S в множестве всех отображений Е -> Z. L(E) — множество описаний выборки Е в рамках данного алгоритма. Эта компонента связана с выбором средств для достижения цели классификации, она соответствует подпространству представительств, понимаемому более широко, чем в книге. Множество L мы рассматри- ю
ваем как подмножество в множестве всех отображений Z ->• К, где Y — множество значений, в терминах которых выражается результат классификации. Например, когда Е с: Rp и Z = [1, ..., Ю, а каждый класс предполагается описывать выборочным средним, то Y = Rp и L(?) = _ {^-»- F} = Rp х ... X Rp. Если предполагается описывать классы эталонами, причем известно, что эталон &-го класса должен находиться в rh — окрестности типичного представителя у%, в частности может быть rk = О для некоторых k, то L(?) = {{уг, ..., ук)9 yk ? R", \\Уь —^И ^ гь- Если предполагается описывать классы эталонными множествами, то в качестве Y берется соответствующая часть множества всех подмножеств в Е. Множество Y может иметь совершенно иную природу, чем пространство измеряемых признаков. Например, в факторном типологическом анализе (см. гл. 6) точкой Y является q- мерное аффинное подмногообразие в R". Более того, само Y может быть составлено из пространств различной природы соответственно требованиям к эталонам различных классов. Отметим, что на этом пути удалось включить в нашу модель известные алгоритмы, формально не описываемые методом динамических сгущений (например, «Форель» [13]), а также построить новые алгоритмы (подробнее см. ниже). Я(Е) — множество выделенных конечных подмножеств в Е — «порций», в которых Е поступает на классификацию. Эта компонента вводится для того, чтобы в рамках модели можно было рассматривать алгоритмы как параллельного (Я(Е) состоит из одного элемента, символизирующего все ?), так и последовательного типа (например, если на классификацию последовательно поступает по одному объекту, то М(Е) = Е). Отметим, что, хотя в книге описаны только алгоритмы параллельного типа, в работе Э. Дидэ [24] развит метод динамических сгущений и для процедур последовательного типа. X — оператор из S X L X Я в S, называемый классификатором, поскольку он определяет, что нужно сделать с имеющимися средствами ^для данного типа Z задачи АК, чтобы из предыдущего состояния s* выборки Е с описанием 1п перейти в другое состояние 1п+1 при поступлении очередной порции рп+х с ?, т. е. провести переклассификацию. Частным случаем оператора Ж является функция назначения g : L -*- ¦^ 5 (см. гл. 1). Обычно оператор Ж строится исходя из функционала f * оценивающего качество классификации, согласно априорному представлению исследователя о «хорошей» классификации. Рассмотрим, например, как строится оператор X в исторически одном из пер- вых и наиболее общем алгоритме разбиения на К классов методом локальной оптимизации. Пусть s : Е~+ Z = 11, ..., К) — некоторая классификация и х ? Е. Обозначим через s(k, x) новую классификацию: S\K х)(х') = ф:'), если х фх! и s(&, х)(х) = k. Фиксируем критерий качества классификации f : S -*• R1 и определим оператор X: S X ^ Я ->¦ 5 для алгоритмов последовательного типа (т. е. когда Я as :=== ?) формулой #)*=$, если 9 (s) = min f(s(k,x)) и * A) x) = s(*,*), кф*(х), k^argmmf($(k'fx)) а
Приведенная конструкция не накладывает практически никаких ограничений на вид функционала f, но в общем случае приводит к довольно медленной процедуре классификации, реализующей минимизацию функционала f способом перебора на дискретном множестве S. Если к дополнительно предположить, что f(s) имеет вид ^Рк(Е(к))у где E(k) = k = i = s~x(k) и Fk(-)— критерий качества &-го класса, представляющий собой функцию на множестве всех подмножеств из Е> такую, что Fk{E\) ^ Fk(E2), как только Ег а Е2у то классификатор УС можно задать следующим образом. Положим (й, х) = Fk(E(k) U х) - Fh((E(k)[)x)\x). Тогда s,x) = s, если A(s(x)9x) = minA(kyx) и k = s(k, х), если k B) Отметим, что приведенный классификатор используется в алгоритме равномерного распределения объектов по К классам, где функционал Fh(E(k)) имеет вид (см. [2]) 2 E Рассмотренные выше классификаторы действуют только в процедурах последовательного типа*. Для построения классификатора в процедурах параллельного типа обычно используются функционалы f : S X XL-^R1 вида 2 2 k=\ s(x)=k где Fk(x, l(k)) — описывает, насколько объект х близок ядру l(k). В этом случае классификатор СК можно взять в виде «. / / w ч ( ^ = argmin Ffe, (х, / (*')), х 6 р, «•(s,/,p)(x) = | *' _ C) I s(x)f х?р. Отметим, что когда функционал Fk(x, у) не зависит от &, приведенный классификатор совпадает с функцией назначения g:L-+S. 3) — оператор из S X L в L, называемый дескриптором, поскольку с его помощью на основании предыдущего описания 1п выборки Е и полученной классификации sn+1 вырабатывается новое более оптимальное описание. Частным случаем оператора 3) является функция представительства g : S -+¦ L. В эталонных алгоритмах разбиения на * Точнее, только в процедурах последовательного типа можно гарантировать убывание глобального критерия при переходе к новой классификации (более подробно об этом см. в [2], [22]). 12
К классов оператор 3) строится исходя из функционала f : 5 X L __>. R1 вида f(s,l)= 2 Fk(E(k),l(k)) k=\ по формуле S(s, l)(k) *= argmin Fh(E(k), у). Таким образом, вычисление значений дескриптора 3) является процедурой минимизации функционала Fh(E(k), у) на Y. Здесь основная идея МДС сталкивается с серьезной проблемой. Нетривиальные примеры выбора представительств классов приводят к необходимости брать в качестве Y достаточно сложные многообразия (см., например, Y для факторного типологического анализа). Стандартные функционалы Fh, позволяющие эффективно вычислять значения дескриптора в случае алгоритма /(-средних, когда Y = Rp, при переносе на многообразия аффинных подмногообразий в R*7 теряют свойство единственности решения задачи на минимум. Авторам книги приходится прибегать к искусственным приемам выбора одного из возможных значений дескриптора, что в свою очередь вызывает усложнение условий остановки алгоритма. В связи с этим отметим, что в работах [4], [5] развиты методы оптимизации широкого класса функционалов на многообразиях аффинных подмногообразий евклидова пространства R?. G — оператор из^Х S X L X JV->^ (где N — множество натуральных чисел), который можно рассматривать как генератор порций. Определение 1. Моделью алгоритма АК (ААК) называется набор (?, S, L, Я, ЗС, Ю, G) компонент, наделенных описанной выше структурой. Определение 2. Движением алгоритма, отвечающим начальным данным sx 6 S, 1г ? L и рг ? Л, называется последовательность (sx, /i),..., (sn, ln), (sn+1, /ji+i),... где Sn+l=&{Sn, U, Pn), ln+i—3){ln9 Sn+l)> Pn+i = G (pn, Sn+1, ln+li П+1). Определение З. Функционал f iSXL^R1 называется интерпретирующим для модели, если 9 (sn> ln) > f (sn+l9 ln) > f (sn+lt /Л+1) Для всех пу начиная с некоторого по> причем f (sn, ln) > f (Sn+i, ln+i) при {sn, ln) ф (sn+l9 Zn+1). В приведенных выше примерах построение операторов CW и 3) непосредственно опиралось на функционал f(s, /), который автоматически становился интерпретирующим для модели ААК с этими CfC и 25, а Движение алгоритма превращалось в последовательность «покоорди- 13
натной» минимизации функционала § на S X L. Но даже в этом случае, очевидно, существует много других функционалов, интерпретирующих данное движение алгоритма, т. е. если операторы ^иЖ уже заданы, то функционал f восстанавливается по ним далеко не однозначно. Далее, одни и те же множества S(E) и Ц?) могут быть получены для различных конкретизации множеств Z и Y соответственно. Таким образом, в рамках данной модели ААК элементы Z, Y и f ее структуры являются варьируемыми параметрами. Покажем, как эти параметры позволяют восстанавливать иерархическую структуру многообразия алгоритмов, о которой шла речь выше. 1. Модель алгоритма/С-средних параллельного типа Е = (хг, ..., xm)czRp. Для простоты будем считать, что р-мерное евклидово пространство Rp наделено стандартной метрикой: \\х — — у\\* = 2(х* — г/02» ГДе (*\ •••» хр) и (у1, ..., ур) — координаты векторов х и у соответственно. В качестве первой конкретизации множества Z возьмем список номеров классов 1Х = [1, ..., k, ..., /С]. Положим S(E) ~ {s : Е -> Zx) и будем отождествлять каждое отображение s : Е -> Zx с разбиением множества Е на классы (?A), ..., Е(К)), где E(k) = s-x(&). Имеем U ^(А) ^== Е и E(k) П ?(/г') = 0. Каждый класс будем описывать его средним, т. е. в качестве Y возьмем само пространство Rp и положим L(?) = {I : Zi-> У} — Rp x ... X Rp, таким образом, Z = (ух, ..., ) поэтому в L(E) можно ввести метрику следующим образом: Так как мы строим модель алгоритма параллельного типа, то в качестве ^ должны взять одноэлементное множество (выборка Е вся участвует в классификации на каждом шаге), поэтому в дальнейших формулах компоненты Л и G модели можно не учитывать. Возьмем операторы Ж и 25, отвечающие функционалу ¦ 2 2 Н*-у(№ D) *=1 *€?<*) где fi(ft)=s-4*) и 1= Тогда H(l)) = minp(x, &,(*)},... E) U ?»+1 (*'): р (х, уп Щ) = 14
где Р(*.0)=11*—У\\> *»+! = 2) Aп,*п+1) = (Уп+1A),..;Уп+1 (К)), где 2 \х— у\\\ т. е. у„+1( Здесь и далее |?| обозначает число элементов в множестве Е. Итак модель алгоритма /(-средних параллельного типа построена. Начнем модификацию ее параметров. 2. Модель алгоритма (К-r)-средних Сейчас будет указана конструкция, применимая к модели любого алгоритма эталонного типа, в частности к модели любого алгоритма МДС. Содержательно она заключается во введении дополнительного класса, называемого классом «джокер» (синонимы: класс «отказ», «не знаю» и т. п.). Задается «порог отказа» г, и если значение меры несходства объекта х с каждым из К эталонов (ядер) классов превосходит г, то такой объект относится к символическому классу *. Итак, Zx(*)-[1, ..., /С,* ]. Заметим, что S(E) в этом случае точно такое же, как в алгоритме (/(+ + 1)-средних. Y(*) = Rp U */(*) — объединение пространства Rp и изолированной точки. В качестве L(E) возьмем часть множества отображений Zx(*) в F(*), состоящую из всех отображений, переводящих символ * в у(*), тогда каждая точка / 6 Ц?) будет иметь вид (*/A), ..., у {К), ()) У()) Заметим теперь, что в формуле E) для классификатора вместо евклидова расстояния || || можно использовать любую меру р(лг, у) несходства между объектом х и эталоном у. Положим, по определению, что р(х, #(*)) = г для любого объекта х> и возьмем в качестве оператора •* нашей новой модели классификатор, задаваемый формулой E) для р(х, yn(k)) =||* — yn(k) 11 и р(х, у (*)) = г. Ясно, что тогда ?п+1(*)= — {х 6 Е : r<min||#-— yn+i(k)\\}. Для получения оператора Ж можно k воспользоваться формулой F), так как составляющая yn+i(*) в /п+1 = = 30(/n, sn+1) не меняется. Таким образом, модель алгоритма (/С-г)-средних описана и тем самым определено его движение. Теперь при непосредственной проверке можно убедиться, что функционал И l'2 G) 16
является интерпретирующим для этой модели. Можно подвести первые итоги. Получение модели 2 иллюстрирует подъем снизу вверх в нашей иерархии. Действительно, отправляясь от модели 1, мы получили модель 2 с дополнительным параметром г. Утверждение, что модель 2 лежит выше по иерархии, чем модель 1, обосновывается-тем, что взяв теперь модель 2 за основу и устремляя г к оо, мы из модели 2, очевидно, получаем модель 1. 3. Модель алгоритма «Форель» Для получения модели алгоритма «Форель» достаточно, отправляясь от модели 2, спуститься вниз по иерархии, полагая К = 1. Этот результат иллюстрирует способность нашей иерархической структуры устанавливать связи между известными алгоритмами, используемыми для решения разных задач классификации (мы установили связи между моделями 1 и 3, лежащими на одном уровне в нашей иерархии, через модель 2, лежащую выше). Более того, на этом пути удается получить новый интерпретирующий функционал для «Форели». Напомним, что первоначально алгоритм «Форель» описывался своим движением (см. [2], [13]), а затем для исследования его сходимости в [8] был введен интерпретирующий функционал где 4. Модель алгоритма А (ЯГ)-средних Теперь мы опишем модель нового алгоритма, получение которой дает пример еще одного способа подъема снизу вверх в нашей иерархии. Для этого покажем сначала, как можно изменить параметры модели 1, совершенно не меняя ее основные компоненты, а значит, и движение алгоритма. Обозначим через Д(/С) стандартный (К — 1)-мерный симплекс, т. е. к множество точек {(гъ ..., zK), zk ^ 0, ^zk = 1}. Занумеруем вершины Ах, ..., Ак симплекса Д(/С) так, чтобы вершина Afe имела координаты (О, ..., О, 1, 0, ..., 0), 1 стоит на k-м месте. Теперь в качестве второй конкретизации множества Z в модели 1 возьмем симплекс А(/С). Тогда S(E) из модели 1 можно отождествить с частью множества отображений из Е в А(/С), состоящих из всех отображений, переводящих Е в подмножество (Аь ..., ДЛ-) с: А(/С). Каждую точку z 6 A(/Q можно однозначно записать в виде z = к к = Х^Аk, где zk > 0, 2zft = 1. Поэтому каждое линейное отображение k= 1 к /: Д(/С)-> R*7, т. е. такое отображение, что l(z) = ^к1(Аъ), однознач- 16
но определяется набором образов вершин (/(Ai), ..., /(Д^)). Следовательно, в новой конкретизации множества Z модели 1 множество L(E) можно отождествить с множеством всех линейных отображений из Ю в R*. Заметим теперь, что в новой интерпретации множеств S и L функционал D) можно записать в виде f (s, I) = 2 2 Ф*(* W) \\*-У(Ь)II2' D') k=i xex где фь(з(*)) = 1, если s(x) = ЛЛ, и 0 — в противном случае, а #(&) == = /(Ah). Тогда согласно общей схеме оптимизационного подхода к построению операторов Ж и 33 (см. формулы A)—C)), имеем: отображение из ? в А (К), такое, что 2 <Pk(s(x))\\x-y(k)\\\ E') где минимум берется по всем возможным значениям классификации для данного х. Отметим, что аргумент, в котором функция из E') достигает минимума, может быть не единственным, поэтому необходимо фиксировать еще способ выбора требуемого аргумента. В формулу E) заложен в явном виде способ выбора, наиболее употребительный на практике. линейное отображение из А(/С) в R?, такое, что Н argmin 2 <Pft(sn+i (*))ll *— УII2, т. е. Итак, требуемая модификация параметров модели 1 завершена. а немедленно приводит нас к модели алгоритма нечеткой классификации, который мы назвали алгоритмом А(/С)-средних. Для Z = А(К) возьмем в качестве S(E) множество всех отображений из ? в А(/С). Таким образом, классификация s 6 S(E) сопоставляет теперь объекту х вектор (гъ ..., zK), в котором координата zh имеет смысл степени принадлежности объекта к k-му классу. Множество L(?*) возьмем таким же, как в описанной выше модификации модели 1. Ин- Терпретирующий функционал возьмем вида D'), но теперь будем считать, что функции Фь(-)> k = 1, ..., /С, являются параметрами модели. Операторы ЯГ и 25 зададим согласно формулам E') и F'). 17
5. Модель алгоритма нечеткой классификации Беждека и Данна (см. [12]) Для того чтобы «спуститься» от модели 4 к модели 5, достаточно конкретизировать вид весовых функций ф&(-), рассматриваемых как функции на симплексе Д(/(). В алгоритме Беждека и Данна В этом случае можно дать явное решение оптимизационной задачи E'): найти минимум функционала P 2 = fez«) при условии, что Следуя методу множителей Лагранжа, рассмотрим функционал имеем: dF Следовательно, zk = -=\\х — у(Щ\\~~2, где Таким образом, классификация sn+1 на объекте х принимает значение (гг(х), ..., гк(х))9 где 6. Модель алгоритма (А(/С)-г)-средних Модель 4 описывает алгоритм нечеткой классификации эталонного типа, поэтому точно так же, как был осуществлен подъем алгоритма /(-средних до алгоритма (Л>)-средних, можно от алгоритма А (К)- средних перейти вверх по нашей иерархии до алгоритма (А(/С)-г)- средних. Таким образом, получается модель алгоритма, отстоящая от модели конкретного алгоритма (/(-средних), с которого мы начали, уже на два уровня. В качестве завершающей иллюстрации приведем модель нового алгоритма, который является аналогом алгоритма «Форель» в задачах нечеткой классификации. 18
7. Модель алгоритма (ДA)-г)-средних для весовых функций Беждека и Данна Спускаясь вниз по уровням иерархии от модели 6, получаем: Z - АB) ¦= {z = zA + 22Д2, zk > 0, zx + z2 =• 1}; S(?) = {s : ?-> AB)}; К = {ty + (l - t)y(% 0< /< 1, y(*) 6 Rp, y(*) — изолированная точка}, т. e. Y—-конус над Rp. L(E) — часть множества линейных отображений АB) в К, состоящая из всех отображений, при которых вершина А2 переходит в точку У(*)- с / V1 (с ( y\ С / V*м где ^ДпA)|| ^ n+i li; =тттг 2 (sn+i,i WJ Рассмотрим теперь в рамках нашего подхода вопросы сходимости ААК. Мы выделим два класса моделей ААК и приведем результаты их математического исследования, дающие возможность единообразно доказать сходимость широкого класса ААК. Определение 4. ААК называется сходящимся, если в его движении (slf /х), ..., (sn,/п), ...—последовательность описаний /lf-..., /n — сходится в метрике пространства L(E) к некоторому предельному описанию /*. Подчеркнем, что метрика в Ц?), индуцированная, как правило, метрикой в Rp (например, евклидовой метрикой в R*\ когда Y = Rp), является важным параметром при настройке математической модели ААК на специфику решаемой задачи. Определение 5. Модель ААК называется корректной, если: (а) Для данных s ? S> t ?L к р ?Я оператор ж меняет состояние только подмножества р cz E, причем это изменение полностью определяется описанием /; (б) существует интерпретирующий функционал f, ограниченный снизу на данном движении алгоритма, такой, что для любого е> О и п^ по существует величина б > 0, такая, что как только f (sn, ln) — --^(Sn+i, /n+i)< б, то p(tn, /n+i)< e (см. определение 3). Далее, говоря об интерпретирующем функционале f корректной додели, мы всегда будем подразумевать, что он удовлетворяет условию Щ определения 5. Лемма К Пусть § — интерпретирующий функционал корректной Додели ААК. Тогда из равенства f (snj ln) = F(sn+1, /n+1) следует, To ln = ln+l для всех п^гц. Сказывается, что для большого класса ААК верно и обратное ут- Ржд
Лемма 2. Если множество значений интерпретирующего функционала f конечно, то в модели ААК условие (б) определения 5 выполняется тогда и только тогда, когда из f(sny ln) = f(sn+lJ /n+1) для п > п0 следует, что 1п = 1п+1. Теорема 1. Если множество значений интерпретирующего функционала f корректной модели ААК конечно, то в движении этого алгоритма последовательность описаний ll9 ..., ln стабилизируется, т. е. существует такое пи что 1п = /п+1 для всех п > пх. Доказательство предыдущих результатов использует только свойство (б). Следующий результат показывает роль свойства (а). Теорема 2. Если в движении алгоритма, описываемого корректной моделью, последовательность описаний 11У ..., 1п стабилизируется, начиная с номера пъ то соответствующая последовательность состояний su ..., sn задает стабилизирующуюся классификацию выборки ?, т. е. как только х ? рп cz E для п^ пъ sn+1(x) *= sn+1+k для всех k > 1. Отметим, что небольшое отклонение от стандартного вида формул A) — C) для классификатора Ж, отвечающего функционалу ?, вызвано как раз желанием получить оператор Ж% обладающий свойством (а). Внимательный читатель, несомненно, обратит внимание на то, что в основном тексте авторы книги задают оператор зс в стандартном виде, а в комментариях к ряду конкретных алгоритмов указывают, что для стабилизируемости последовательности классификаций необходима его соответствующая модификация. В случае когда оператор 3) не зависит от первого аргумента, т. е. задается отображением S(E) -^ L(?) (это имеет место во всех алгоритмах МДС), из конечности множества S(E) и теорем 1 и 2 следует стабилизируемость движений алгоритмов, описываемых такими корректными моделями. Следующий результат лежит в основе исследования сходимости алгоритмов последовательного типа, описываемых корректной моделью для бесконечных выборок (ср. [18]). Лемма 3. Пусть (slt /х), ..., (sn, /n), ...—движение алгоритма, описываемого некоторой корректной моделью. Тогда для любого е>0и натурального N существует номер пъ такой, что р(/д, /п+ь)< е для всех k<^ N и п^ п1. Определение 6. Модель ААК называется усиленно корректной, если: (а') оператор Ж удовлетворяет условию (а) определения 5; (б') существует интерпретирующий на данном движении алгоритма ограниченный снизу функционал f и строго монотонно возрастающая функция ф, причем ф@) = 0, такие, что как только п ^ п0, то f (Sn, In) > $ {Sn+1, ln+l) + Ф (P {In, ln+l))- Нетрудно проверить, что усиленно корректная модель является корректной. Обратим внимание, что из тождества Гюйгенса*, которое име- *Речь идет об известном тождестве вида 2Ч*) • I\х-у\|2 = 2х(*) • И*-*срП2 ?Е ?Е где *ср = 2^ (х) - */2А, (х). х?Е х?Е 20
ет место для большинства критериев качества классификации, используемых в книге, вытекает, что соответствующие алгоритмы МДС описываются усиленно корректными моделями. В ряде случаев оказывается, что и не нужно прибегать к общей математической теории сходимости, а достаточно воспользоваться просто иерархической структурой многообразия всех ААК. Например, взяв за основу очень элементарное доказательство стабилизируемости движения алгоритма /(-средних (см. гл. 1 книги), мы, используя описанный выше «подъем» модели этого алгоритма до алгоритма (К-г)- средних, непосредственно получаем стабилизируемость движения алгоритма (/(-г)-средних, а спускаясь вниз к модели A-г)-средиих, получаем элементарное доказательство стабилизируемости движения алгоритма «Форель». Отметим, что впервые этот результат был получен более сложным способом в [8]. С. А. АЙВАЗЯН, В. М. БУХШТАБЕР ЛИТЕРАТУРА 1. Айвазян С. А. Экстремальная формулировка основных проблем прикладной статистики. — В кн.: Всесоюзная школа «Программно-алгоритмическое обеспечение прикладного многомерного статистического анализа». Ереван: ВЦ Госплана АрмССР, 1979, с. 24—49. 2. А й в а з я н С. А., Б е ж а е в а 3. И., Староверов О. В. Классификация многомерных наблюдений. —М.: Статистика, 1974. —240 с. 3. Айвазян С. А., Енюков И. С, Мешалкин Л. Д. Прикладная статистика: основы моделирования и первичная обработка данных. — М.: Финансы и статистика, 1983. — 472 с. 4. Бухштабер В. М., М а с л о в В. К. Факторный анализ и экстремальные задачи на многообразиях Грассмана. — В кн.: Математические методы решения экономических задач, 1977, № 7, с. 87—102. 5. Бухштабер В. М., М а с л о в В. К. Задачи прикладной статистики как экстремальные задачи на нестандартных областях. — В кн.: Алгоритмическое и программное обеспечение прикладного статистического анализа. Ученые записки по статистике, т. 36. М.: Наука, 1980, с. 381—395. 6. Бухштабер В. М., Маслов В. К., Зеленюк Е. А. Методы построения алгоритмов эталонного типа в задачах автоматической классификации. — В кн.: Машинные методы обнаружения закономерностей (Вычислительные системы, вып. 88). Новосибирск, 1981, с. 65—79. 7. Бухштабер В. М.,Маслов В. К.,Зеленюк Е. А. Методы анализа и построения алгоритмов автоматической классификации на основе математических моделей. — В кн.: Прикладная статистика. Ученые записки по статистике, т. 45. М.: Наука, 1983, с. 126—144. 8. Блехер П. М., Кельберт М. Я. Доказательство сходимости алгоритма «Форель». — В кн.: Прикладной многомерный статистический анализ. М.: Наука, 1978, с. 358—361. 9. В а п н и к В. Н. Восстановление зависимостей по эмпирическим данным. — М.: Наука, 1979. —447 с. Ю- Д о р о ф е ю к А. А. Алгоритмы автоматической классификации. — Автоматика и телемеханика, т. 12, 1971, с. 78—112. И- Дюран Б., Одел л П. Кластерный анализ. Пер. с англ. — М.: Статистика, 1977. — 128 с. 12. Заде Л. А. Размытые множества и их применение в распознавании образов и кластер-анализе. — В кн.: Классификация и кластер. М.: Мир, 1980, с 208—247. 21
13. 3 а г о р у й к о Н. Г. Методы распознавания и их применение. — М.: Сов. радио, 1972. — 206 с. 14. Классификация и кластер/Под, ред. Дж. Вэн Райзина. Пер. с англ. —М.: Мир, 1980. — 390 с. 15. Орлов А. И. Сходимость эталонных алгоритмов. — В кн.: Прикладной многомерный статистический анализ. М.: Наука, 1978, с. 361—364. 16. П а т р и к Э. Основы теории распознавания образов. —М.: Сов. радио, 1980. — 408 с. 17. С е б а с т и а н Г. С. Принятие решений при распознавании образов. Пер. с англ. — Киев: Техника, 1965. — 258 с. 18. С е в р ю к М. Б. Сходимость алгоритма «Форель» для бесконечного числа объектов. — В кн.: Алгоритмическое и программное обеспечение прикладного статистического анализа. М.: Наука, 1980, с. 377—381. 19. Типология потребления/Под ред. С. А. Айвазяна и Н. М. Римашевской. — М.: Наука, 1978. — 168 с. 20. Т у Д ж., Г о н с а л е с Р. Принципы распознавания образов. Пер. с англ. — М.: Мир, 1978. — 411 с. 21. Т у р б о в и ч И. Т., Г и т и с В. Г., М а с л о в В. К. Опознание образов. — М.: Наука, 1971.— 246 с. 22. Ф у к у н а г а К. Введение в статистическую теорию распознавания образов. Пер. с англ. — М.: Наука, 1979. —368 с. 23. Ш л е з и н г е р М. И. О самопроизвольном различении образов. — В кн.: Читающие автоматы. Киев: Наукова думка, 1965, с. 88—106. 24. D i d а у Е. Classification automatique sequentielle pour grands tableaux (Rev. fr. inf. rech. oper. 9° annee (mars 1975), p. 1—29). 25. Mac Queen J. Some methods for classification and analysis of mulyivariate observation. Proc. Fifth Berkeley Symp. Math. Stat. and Probab., 1967, vol. 1, p. 281—297.
ПРЕДИСЛОВИЕ Цель анализа данных, реализация которой возможна лишь благодаря применению ЭВМ, состоит в создании средств, позволяющих охватывать содержание таблиц данных значительного объема через представления (предпочтительно визуальные), которые легко доступны для понимания пользователя. Перспективы использования анализа данных весьма широкие, поскольку редко встречаются области, в которых не было бы таблиц, охватывающих огромное число объектов, характеризуемых одновременно многими переменными. Безусловно, анализ данных составляет важную часть человеческого мышления и опыта, накопленного в контакте с «многомерной реальностью»: от Аристотеля с его деревом «вещей жизни», через Адансона [1] с его первой иерархией, основанной на понятии сходства (XVIII в.), до основ факторного анализа Пирсона (начало XX в.) и метода главных компонент Хотеллинга C0-е годы нашего столетия). Огромный объем вычислений, которые необходимо производить при обработке данных, обусловил тот факт, что именно ЭВМ была главным инструментом, которого недоставало в этой области. Благодаря работам таких ученых, как Л. Гуттман [7], С. Хаяши [15], Р. Ше- пард [18], Дж. Крускал [10], в начале 60-х годов появились первые визуальные представления многомерных данных, полученные посредством метода многомерного шкалирования, реализованного с помощью ЭВМ. Во Франции к середине 60-х годов в этой области стали известны работы Ж. Бэнзекри и его коллег (см. [4], [9]), которые получили первые визуальные представления на машине с помощью факторного анализа соответствий. В этой же связи следует упомянуть работы Л. Лебара и его коллег (см. [Ill, [12]). Читателю, интересующемуся историческими сведениями, можно рекомендовать книгу Ж. Бэнзекри [3]. В этом развитии методов и идей автоматическая классификация (АК), конечно же, должна была заявить о себе. Какое же место занимает автоматическая классификация в рамках анализа данных? Автоматическая классификация объединяет весь набор методов и алгоритмов, предназначенных для разбиения совокупности объектов, каждый из которых описан набором переменных, на какое-то число однородных (в определенном смысле) классов. Эти классы могут быть в той или иной степени связаны между собой, например в форме графа, или дерева, каждая вершина которого представляет один класс. 23
Следует отличать методы автоматической классификации от методов дискриминантного анализа и методов упорядочения, потому что последние предполагают обязательное знание априорно заданных классов объектов (обучающих выборок). Именно в связи с необходимостью классифицировать растения и и виды встал вопрос об автоматической классификации. Это проявилось, в частности, в работах Адансона [1], выполненных под руководством Бюффона A747 г.).. И первой книгой, полностью посвященной автоматической классификации (после появления ЭВМ), мы обязаны натуралистам Со калу и Сниту A963 г.). Сдерживаемая в своем развитии громоздкостью вычислений автоматическая классификация должна была занять свое место в общем развитии методов анализа данных в связи с появлением ЭВМ. Сфера ее применения должна быть очень широкой, поскольку она охватывает все области, в которых аккумулируются большие объемы данных. В настоящее время имеется обширная литература по методам автоматической классификации. Приведем некоторые работы, полностью посвященные автоматической классификации: Бэнзекри [4], Лер- ман [13], Андерберг [21, Хартиган [8], а также недавние исследования, такие, как Жамбю [9], Шандон и Пэнсон [6]. Существенная часть книги Пажеса и Кайеза [5] также связана с данной тематикой. Как и в любой начинающей научной дисциплине, в автоматической классификации были созданы и использованы разнообразные, в той или иной степени экспериментальные и эвристические, методы. Этим объясняется тот факт, что зачастую пользователь оказывается перед лицом огромного количества алгоритмов, часто описывающих плохо сформулированные или вообще не поставленные задачи! В результате для некоторых пользователей автоматическая классификация является амальгамой алгоритмов, основная цель которых — получить классы. Нас же в первую очередь интересуют постановки задач, решение которых дается этими алгоритмами. Другими словами, до того как начать сравнивать алгоритмы, необходимо сравнить задачи (выраженные математическим языком), которые эти алгоритмы стремятся решить. На типичный вопрос неофита, спрашивающего: «Какой алгоритм наилучший?», — мы отвечаем: «Какова конкретная математическая постановка задачи, решаемой при обработке ваших данных?»* Действительно, если быть более наблюдательным, то мы можем констатировать, что еще редко встречаются различные алгоритмы, которые решали бы одну и ту же задачу и оптимизировали один и тот же критерий. В данной работе мы покажем, что очень большая группа задач АК может быть выражена в форме оптимизации критерия, хорошо определенного с математической точки зрения. Излагаемый в книге метод динамических сгущений (МДС) позволяет построить необходимый базис для формулировки этих задач и получения алгоритмов, дающих их * Средства, облегчающие ответ на поставленный вопрос, заложены в математическую модель алгоритмов А К, обсуждаемую в предисловии к русскому изданию. — Примеч. пер. 24
приближенные решения. Основное свойство МДС состоит в том, что он вводит новую проблематику. Речь идет об оптимизации критерия, который оценивает согласованность между покрытием множества объектов, подлежащих классификации, и способом представительства классов этого покрытия. В таком случае задача оптимизации может быть сформулирована как задача одновременного отыскания покрытия и представительства его классов среди множества возможных покрытий и представительств, которые оптимизируют заданный критерий. Множество разбиений и множество иерархий дают два классических примера множеств покрытий. Каждый класс разбиения или каждую ступень иерархии можно «представить» с помощью «центра тяжести»; множество таких центров является классическим примером множества представительств. Термин «представительства» будет уточнен в гл. 1. С учетом конкретных задач, которые ставятся пользователями, можно вообразить большое число других множеств покрытий и представительств; некоторые из них будут рассмотрены далее. Другое важное свойство МДС состоит в том, что он позволяет построить семейство алгоритмов, при некоторых условиях гарантирующих убывание минимизируемого критерия. Не следует придавать чрезмерного значения самим алгоритмам. Наиболее важными, с нашей точки зрения, являются четкая формулировка задачи оптимизации (а хорошо поставить задачу — это дать, по существу, половину ее решения) и способность метода ввести концепцию и аппарат автоматической классификации во многие области. Более того, в будущем может оказаться, что алгоритмы, не обладающие общностью метода динамических сгущений, но лучше приспособленные к какой-то специальной области, могут лучше решать задачи, о которых мы говорим в этой работе. В основных своих чертах метод динамических сгущений был разработан в конце 60-х годов сотрудниками IRIA—LABORIA*. На с. 2 диссертации Э. Дидэ A972 г.) можно прочесть: «Среди всех разбиений на К классов следует найти разбиение, относительно каждого класса которого заданное «ядро» оказалось бы наиболее представительным. Понятие ядра (оно будет уточнено математически) имеет самый широкий смысл: ядро класса (т. е. группы точек) может быть подгруппой точек, центром тяжести, осью, случайной переменной и т. д.» Впоследствии мы привыкли вместо «ядра» употреблять слово «представитель». Некоторые задачи классификации, формулируемые в рамках схемы МДС, являются совершенно новыми, для других — в соответствующей главе приведена библиография. В гл. 1 мы старались представить «формализм» МДС таким образом, чтобы выразить в первую очередь основную идеологию, на которой базируются все главы; для этого мы сознательно устранили некоторые интересные аспекты МДС, например связь с задачами распознавания *Речь идет об Институте исследований по информатике и автоматике (IRIA), Расположенном в пригороде Парижа ("ныне Национальный институт исследовании по информатике и автоматике — INRIA). LABORIA — одно из подразделении института. — Примеч. пер.
образов; некоторые аспекты этой проблематики имеются у Ж. Симона [19]. Другие главы связаны с первой, но их можно читать и независимо друг от друга; их можно сгруппировать в пять частей. Первая часть включает гл. 2—5, она посвящена развитию МДС. Вторая часть содержит описание преобразования с помощью МДС классических задач анализа данных (гл. 6, 7, 8) и математической статистики (гл. 9, 10, 11) в задачи автоматической классификации. Во всех случаях МДС позволяет по-новому взглянуть на анализируемые задачи, трансформируя проблему «глобальной оптимизации» на всей анализируемой совокупности объектов в аналогичную задачу «локальной оптимизации» на множестве возможных покрытий. Интерес «локальной» точки зрения объясняется по крайней мере двумя следующими причинами: а) может оказаться, что представительство, рассматриваемое среди множества всех возможных представительств, окажется посредственным, но будет вполне удовлетворительным на надлежащих частях анализируемой совокупности; б) отнесение («назначение» в один из классов) нового объекта исходя из локального представительства классов может оказаться более точным. Например, две хорошо выбранные локальные факторные плоскости будут иметь «инерцию» лучше, чем единая глобальная факторная плоскость (гл. 6). Отнесение нового объекта к объектам одной из двух плоскостей (к той, к которой они ближе) дает возможность приписать ему соответствующие новые координаты (их число равно числу выбранных факторных осей), более точные, чем те, что он имел бы в глобальной факторной плоскости. Третья часть (гл. 12, 13, 14) касается проблем «редактирования» и предварительного анализа исходной таблицы данных. Известно, насколько это важная задача, задача, которую исследователь, анализирующий данные, стремится решить до того, как применить основной метод. Эта задача прежде всего касается пересмотра состава анализи руемой выборки, состава набора переменных, привилегированности некоторых из них или модификации меры подобия (или сходства) объектов, априорно заданных пользователем. Здесь показано, каким образом эта задача может быть реализована «адаптивно» с учетом возможностей автоматической классификации и МДС. Четвертая часть (гл. 15 и 16) связана с изучением иных (чем разбиения) покрытий. Речь идет о получении удовлетворительной адекватности между покрытием и представителями, которые выбираются для каждой его части. Тогда можно использовать МДС, либо чтобы улучшить результаты, полученные другими методами (например, результаты иерархической классификации могут быть улучшены путем минимизации критерия, охватывающего глобально все иерархии, см. гл. 16), либо чтобы изучать новые типы покрытий (например, мульти- разбиения Г. Броссье, см, гл. 15 и 16). В каждой из четырех частей перспективы расширения сферы применения МДС весьма многообразны, что достигается, например, с по-
мощью варьирования пространства покрытий или представительств. Но всегда ли они полезны? Априорно трудно ответить на этот вопрос. Так, например, мы намеревались сначала использовать факторный типологический анализ (гл. 6) в распознавании рукописных букв; в действительности же он нашел себе применение при распознавании слов и в геологии. Пятая часть книги (гл. 17, 18) посвящена разнообразным приложениям МДС. Наиболее интересными из них являются, с нашей точки зрения: 1) совершенствование информационной системы путем адаптации программ в пронумерованной среде; 2) изучение и типологизация кривых спроса электромощностей. Другие работы, касающиеся вопросов оптимизации в автоматической классификации, публиковались в виде диссертаций, статей или рабочих отчетов LABORIA, а также в трудах Международных конференций A977 и 1979 гг.) по анализу данных и информатике. Данная монография — результат коллективной работы, в которой авторы старались использовать один и тот же язык. Это дает по крайней мере два преимущества. Во-первых, возможность «погрузить» свою задачу в общие рамки МДС позволяет часто получить более глубокое понимание содержательной сущности решаемой задачи. Для пояснения этой мысли приведем пример с анализом смеси распределений вероятностей: возможность поставить задачу в рамках МДС позволяет (путем простого изменения пространства представительств) обрабатывать смесь вероятностных распределений иначе, чем это делается в случае нормальных компонент смеси*; в частности, при нашем подходе рассматриваемое семейство законов входит только как параметр программы. Во-вторых, исследователь зачастую теряется перед растущей массой алгоритмов автоматической классификации. Предлагаемый в книге МДС является как бы путеводной нитью, позволяющей осмыслить семейство алгоритмов автоматической классификации в рамках единой точно сформулированной оптимизационной задачи и общего языка. В заключение мы выражаем свою признательность директору Национального института исследований по информатике и автоматике профессору Лионсу, благодаря которому мы обрели научную среду, благоприятную для формирования основных идей, представленных в Данном труде, а также профессору Ж. К. Симону за его советы и поддержку. Мы благодарны профессорам Ж. П. Обэну, Ж. Леви и А. Сит- бону за их дружескую поддержку в Парижском университете — IX («Дофин»), господину Борну, мадемуазель де ля Фабрэг, которые способствовали практической реализации данного издания; мадам Беллиа и мадам Корнелис за их постоянную помощь в техническом оформлении рукописи. •ЛИТЕРАТУРА 1- A dansonM. A757) Histoire naturelle du Senegal. Coquillages. Aves la relation abregee d'un voyage fait dans ce pays de 1749 a 1753. Bauche, Paris. *Cm. Diday E.,Schroeder A. A new approach in mixed distributions detection. — RAIRO — Recherche Operationnelle, 1976, vol. 10, №6. 27
2. AnderbergM. R. A973) Cluster Analysis for Applications. Academic Press, 3. В e n z e с г i J. P. A977) La place de Га priori, Organum pages 11 a 24. 4. BenzecriJ.P. A973) L'analyse des donnees. Tome 1. La taxinomie. Tome 2. L'analyse des correspondances. Dunod. 5. CaillezF., Pages J. P. A976) Introduction a l'analyse des donnees. Smash Editeur. 6. ChandonJ. L., PinsonS A980) L'analyse typoloque: theorie et applications. Masson. 7. G u t t m a n L. A968) A General Nonmetric Technique for founding the smallest coordinate space for a configuration of points. Psychometrika, 33, 469—506. Gut t man L. et al A941) The prediction of personal adjustmant Social Science Research Council, G u t t m a n L. A954) A new approach to factor analysis, p. 258—348. In: F. P. Lazarsfeld (ed). Mathematical Thinking in the Social Sciences. New York, Free Press. 8. H art igan J. A. A977) Clusters as Modes. In: 1-st int. symp. on Data Analysis and Informatics, IRIA Rocquencourt, 78150, France. 9. J a m b u M. A978) Aspect Statistique et Informatique de la classification au- tomatique hierarchique, These d'Etat L. S. M. 10. Kruskal J. B. A964) Multidimensional scaling by optimizing goodness of fit to nonmetric hypothesis. Psychometrica, 29, 115—129. К r u s к a 1 J. В., W i s h M. A978) Multidimensional scaling. Editor: Eric M. Uslaner, University of Mariland. 11. LebartL., FenelonJ. P. A973) Statistique et Informatique appliquees, Dunod. Introduction et programmes de diverses methodes d'analyse des donnees. 12. LebartL, Morineau A., T a b a r d N. A977) Techniques de la description statistique. Dunod. Methodologie de traitement par 1 Analyse des donnees des questionnaires. 13. L e г m a n J. C. A970) Les bases de la classification automatique. Gauthiers- Villars. Approche combinatoire de la classification automatique. 14. H о t e 1 1 i n g H. A933) Analysis of a complex of statistical variables into principal components, J. EDUC, Psychol., 24, 499—520. 15. H а у a s h i C. A954) Multidimensional quantification, with the applications to analysis of social phenomena. Annales of the Institute of Statistical Mathematics 5 B), 121 — 143. 16. Lingoes J. A973) The Guttman-Lingoes nonmetric program series, Ann. Arbor, Michigan, Mathesis Press. 17. Pearson K. A906) On the coefficient of racial likeliness. Biometrika, T. 18, 105—117. 18. S h e p а г d R. N. A962) The analysis of proximities: multidimensional scaling with an unknow distance function. Psychometrica, 39, 123—157. S'hepard R. N. A972) A taxonomy of some principal types of multidimensional methods for their analysis, p. 21—47 in Multidimensional scaling: Theory and Applications in the Behavioral Sciences, vol. 1, New York, Seminar Press. 19. SimonJ. C, BackerE., SallentinJ. A980) A structural approach of pattern recognition. Signal Processing, vol. 2, № 1. S i m о n J. C. A979) Clustering and digital image analysis. Inst. Phys. Conf. Ser., № 44, chapter 1. 20. SneathP. H.,Sokal R. R. A973) Numerical Taxonomy. W. H. Freeman. S о к a 1 R. R., S n e a t h P. H. A963) Principles of numerical taxonomy. W. H. Freeman and Co, XVI. 359 p. 28
Глава 1 • ОСНОВНЫЕ ПОНЯТИЯ И ФОРМАЛЬНЫЕ ПОСТРОЕНИЯ 1.1. ОБЪЕКТЫ, ПЕРЕМЕННЫЕ И МЕРА СХОДСТВА При решении большинства задач автоматической классификации необходимо заранее задать некоторые величины; наиболее существенным в этом отношении является выбор самих объектов, переменных и меры сходства между объектами. Обозначим: Е — анализируемое конечное множество объектов. Мы предполагаем, что card Е = п* и что эти объекты обозначаются соответственно Х\ » ^2 > • • •» ^п > F — конечное множество переменных, характеризующих эти объекты. Мы предполагаем, что card/7 ;= р и что эти переменные обозначаются л;1, л:2, ..., хр. Обозначим: х{ 6 R — значение, принимаемое переменной / на объекте i\ d — мера сходства ** между объектами, которая есть отображение Е х Е ¦-> R, такое, что d(x, у) = d(y> x) и d(x, x) = d(y, у) для любых х и у, принадлежащих Е. Для улучшения анализа данных полезно исследовать вопрос о пересмотре нашего выбора величин. Так, например, можно из множеств Е и F выделить подмножества, затем произвести замену переменных, изменить меру сходства так, чтобы наилучшим образом-«приспособиться» к структуре искомых классов. С этой целью следует определить пространство допустимых изменений и найти в этом пространстве такое изменение, которое было бы наилучшим в смысле определенного критерия, зависящего от типа искомой классификации (см. гл. 4, 8). 1.2. МЕТОД ДИНАМИЧЕСКИХ СГУЩЕНИЙ (МДС) Перед тем как определить основные этапы этого метода, необходимо ввести некоторые понятия и прежде всего понятия пространства покрытий и пространства представительств. *С помощью card А или |Л| автор обозначает мощность множества А. В дан- "°м случае мощность определяется числом элементов, входящих в Л. — Примеч. **См. приложение 1, где дан ряд разъяснений и показана связь с показате- 1ем различия. 29
1.2.1. Пространство покрытий 5 Пространство покрытий S является множеством, каждый элемент которого представляет собой систему подмножеств элементов Е, удовлетворяющую заданной «структуре классов»*. На практике мы встречаемся обычно с тремя основными типами структур классов: разбиениями, иерархиями и покрытиями, определенными на множестве Е. В данной статье мы в первую очередь остановимся на разбиениях ** 1.2.2. Структура и пространство представительств Определение. Говорят, что Е обладает структурой представительства, если ему сопоставлены множество L и отображение D множества Е X L в R+. Тогда L называется пространством представительств, а каждый из его элементов / есть одно «представительство» (или один «представитель»); если (х, I) ? Е X L, то D(x, l) называется мерой сходства между объектом х и представителем /. Примеры. а) L = Rp, D(x, I) есть евклидово расстояние в пространстве Rp от х до /; / есть, например, центр тяжести в RP подмножества из Е (см. гл. 2). б) L = Rp х 30, где 30 есть семейство евклидовых расстояний. Пусть / = (a, d) 6 L, тогда D может быть определено как D(x, /) = = d(a, x) (см. гл. 5). Замечание. Мы будем иногда называть (в этом есть, видимо, некоторая языковая неточность, но это часто позволяет избежать двусмысленности) «представительством покрытия» s = (sx, ..., sh) ? S всякое /е-кратное представительство L = {Ьг ,..., Lft), позволяющее каждому классу si покрытия 5 поставить в соответствие представителя Lt 6 L. 1.2.3. Функция представительства Представительство подмножества элементов множества Е осуществляется обычно в два этапа: а) выбор пространства L представительств; б) выбор функции g, которая позволяет всякому подмножеству множества Е поставить в соответствие единственное представительство, принадлежащее L, а именно если g(Q) = /, то говорят, что / есть представительство подмножества Q (Q ? Е). В дальнейшем g будет называться «функцией представительства» и аналогично будет называться всякое преобразование, ставящее в соответствие подмножеству из Е определенное представительство, или, в более общем виде, одному или нескольким подмножествам Е одно или несколько представительств. Классическая задача нахождения представительства формулируется следующим образом: дано множество Е, обладающее структурой *В приложении 2 мы даем определение, позволяющее уточнить это понятие. **Под разбиением, определенным на Е, авторы понимают разделение исследуемого множества объектов Е на некоторое число (заранее заданное или нет) непересекающихся подмножеств. — Примеч. пер. 30
представительства, определяемой L и D. Найти / ? L, которое миними- зирУет S^(xi.) в пространстве R+, где Q есть заданное подмноже- ство Е. 1.2.4. Функция назначения (отнесения объекта к классу) Если задано пространство представительств L, то построение покрытия на Е также может осуществляться в два этапа: а) выбор пространства покрытий S; б) выбор преобразования /, которое позволяет каждой части L поставить в соответствие элемент из S. В дальнейшем мы будем называть / «функцией назначения»* и аналогично будут называться всякие преобразования, ставящие в соответствие одному или нескольким представительствам одну или несколько частей Е. Пример. Предположим, что Е обладает структурой представительства, определенной пространством представительств L и отображением D : Е X L->- R+. Пусть S = Pk есть множество разбиений Е на k классов. Тогда можно определить преобразование /, которое ставит в соответствие каждой части L = {Lb ..., Lk) из L с к элементами разбиение/5 = (/I, ..., Pk) на k классов множества ?, следующим образом: Pt = {х,?Е : D(x, Lt) < D(x, L,)}, причем в неопределенных случаях, когда D(xy Lt) = D(x, Lj), будем полагать х 6 Л, если i< /. 1.2.5. Основные составные части и структура метода Метод динамических сгущений в том виде, в котором он излагается в данной работе, включает следующие составные части и этапы: 1) выбор пространства покрытий S; 2) задание на Е структуры представительства, которое осуществляется с помощью выбора пространства представительств L и отображения D : Е X L -> R+; 3) определение оптимизируемого критерия; этот критерий представляет собой отображение, обозначенное W, принимающее лишь положительные значения; это отображение позволяет, используя отображение D, измерить «степень адекватности» между всяким покрытием и всяким представительством этого покрытия; 4) формулировку задачи оптимизации, целью которой является минимизация критерия W\ эта задача формулируется следующим образом: требуется построить одновременно покрытие s ? S' a S и представительство L этого покрытия таким образом, чтобы s и L имели наибольшую возможную «степень адекватности» в смысле критерия W {S есть, например, множество разбиений, a S' есть множество разбиений на k классов); 5) построение алгоритма (называемого «алгоритмом динамических сгущений»), этот алгоритм состоит в последовательном итеративном *С помощью отображения / непосредственно фсрл.иру;отсг :сл^с:г. т. е. при заданной системе представительства / ? L каждый объект с помощью функции / получает «назначение» в тот или иной класс. — Примеч. пер. 31
использовании функции представительства g и функции назначения /; осуществление этого алгоритма начинается с покрытия 5@) ? S, которое либо оценивается, либо извлекается наугад, или же с части пространства представительств L<°>c: en L, которая также оценивается или извлекается наугад; 6) изучение свойств сходимости данного алгоритма; мы можем определить последовательность ип = W(vn) с Vn = (s<n\ L<">), где s<"> 6 S и L<«> есть представительство s<">, построенное с помощью преобразования g\ если функция назначения (позволяющая нам перейти от L<n> к s<rt+1>) и функция представительства (позволяющая перейти от s<"+1> к L(/l+1>) выбраны хорошо, то в общем случае можно показать, что последовательности vn и ип являются сходящимися и что последовательность ип убывает; иными словами, это означает, что в ходе осуществления этого алгоритма критерий убывает с каждой итерацией вплоть до его стабилизации. Пространства покрытий и предстаЗительстб S и L Функции назначения и предстабительстба f и а Рис. l.li 1.3. ИССЛЕДОВАНИЕ ОДНОГО ВАЖНОГО ЧАСТНОГО СЛУЧАЯ 1.3.1. Пространства покрытий и представительств Пространство покрытий есть S *= Р&, т. е. множество разбиений на k классов. Зададим на Е структуру представительств, поставив ему в соответствие пространство представительств L и отображение D'\ E X L ->R+. Пусть Р есть множество подмножеств Е\ рассмотрим отображение D: Р X L-+ R+, такое, что ?>({*}, /) = D'(x, /), V х ?Е (чтобы упростить обозначения, в дальнейшем мы будем одинаково обозначать элемент х и подмножество {х}). Допущение 1. Предположим, что минимум D(A, .) существует и он является единственным, каково бы ни было А из Р. Допущение 2. D(Ay I) = 2 D(at /), VA 6 Р и I 6 L. Замечание 1. В записи допущения 2 мы применили для упрощения обозначений знак суммы. Однако на самом деле закон с «+» можно было бы заменить любым другим законом с «©» при условии, что он будет ассоциативным, коммутативным и удовлетворяющим следующему условию монотонности*: афК?Ф8, если а < у и 0 < б, где а, 0, у, б 6 R+. ¦Различные варианты операции 0 сводятся к выбору шкалы на R+, т. е. к выбору монотонно возрастающей функции <р (t) (t 6 R+) и заданию операции Ф в виде а 0 Р = ф (а) + ф (Р)- При дополнительном условии а 0 0 = а полагают а 0 р = ф-i (ф (а) + ф (р)), где ф-1 (ф (/)) = t — Примеч. пер. 32
1.3.2. Критерий и задача оптимизации Пусть Lfe = LX...XL F-кратное прямое произведение), возьмем в качестве критерия отображение W : Pft X Lfe-> R+, такое, что W(P, L) - SD(Pif L,), или, иначе, W(P, L) = 22D.(*, L). i— l /= l x e P| Отображение № измеряет таким образом «степень адекватности» между разбиением Р и представительством его классов L. Задача оптимизации формируется при этом следующим образом: найти среди всех элементов (Р, L) ? Р& X Lk такой, который минимизирует W. Замечание 2. В отношении определения критерия можно сделать то же замечание 1 для суммы ^Р(Ри Lt). 1.3.3. Функция представительства Это есть преобразование g: Pfe-^Lft, такое, что g(P) = L при Р = = (Рг, ..., Ph) и L = (L1? ..., Lk)y где Lz- —элемент пространства L, который минимизирует D(Piy .). 1.3.4. Функция назначения Это есть преобразование /: Lk -> Pfe, такое, что /(L) = Р, где L = - A1Э ..., Lk), Р = (Plf .... Pk). аЛ-{^6?: D(x9 Lt) < D(xf L7) и К/в случае равенства}. Отметим, что преобразования g и /, которые мы здесь определили, требуют знания D и L. 1.3.5. Построение алгоритма Построение этого алгоритма (обеспечивающее его быстрое и эффективное осуществление) состоит в том, чтобы, взяв за начальную точку решение v0 = (Р@\ L<°>) (в действительности достаточно одного из значений: либо L<°>, либо Р@)), которое либо оценивается, либо извлекается наугад, оптимизировать критерий W путем последовательных итераций по отношению к L (при фиксированном Р), используя функцию представительства g, а затем по отношению к Р (при фиксированном L), используя функцию назначения /, вплоть до получения устойчивого решения. Этот алгоритм сходится к решению, которое не обязательно является оптимальным и которое зависит от решения (Р<°>, L<°>), принятого в качестве исходного. Этот алгоритм может быть формализован с помощью двух последовательностей vn и ип: Pk xLft, где Зак. 303 33
1.3.6. Изучение свойств алгоритма Алгоритм состоит в том, чтобы на основании решения v0 вычислять значения i>lf v2i ... вплоть до того момента, когда эта последовательность сойдется, что будет доказано ниже. Последовательность vn составлена из элементов конечного множества, поэтому она сходится только в том случае, если она является стационарной (т. е. существует N, такое, что для всякого п> N vn ^= vn+1). Предложение 1. Последовательность ип сходится убывая. Доказательство. Мы покажем, что ип-х ^ W{P{n~X), L<">) ^ ип. Первое неравенство справедливо, поскольку для любого i D(P{ln-l\LJn--l))^D(P(in-l\L\n)) по определению g, откуда при суммировании по i 1К Ип~1))^ W (Я<«-1>, L<">). Второе неравенство записывается следующим образом: 2 ? D(x,L\n))> S 2 D(x,Lia)y Это неравенство также справедливо, так как любой элемент х 6 Е ближе в смысле D к представителю его класса в разбиении Р<п> чем в разбиении Р^-1), уже по определению преобразования /. Последовательность ипу будучи убывающей и ограниченной снизу (так как ее члены положительны), сходится. Предложение 2. Последовательность vn сходится. Доказательство. Известно, что всякая последовательность, сходящаяся на конечном множестве, достигает своего предела. Это относится как раз к последовательности ип, поскольку рассматриваемое нами пространство конечно. Предположим, что последовательность сходится на итерации N> или, иными словами, ^+i = им, откуда W(vn+i) = W(vn)\ это равенство не всегда приводит к тому, что Улг+i = vn, так как преобразование W не обязательно является инъективным*. Покажем, что тем не менее vn = v^/ для всякого п ^ N. В самом деле, a^+i = ^n означает, что W(vn+i)~W(vn), а выполнение равенств 1F(L^+1>, P(iV+1))= = W(UN\ РЩ и g(PW) = L<^+1> ведет к L<^> = L(iV+1>; действительно, L<"> =^L^+1> предполагает D(PWK Uf) > D(P^K L^+O), если UNJ = L<^+!) (что обязательно имеет место для некоторых индексов); это неравенство обращается в равенство, если LGY> = HN+l\ и, суммируя по / = 1, ..., k эти равенства и строгие неравенства, мы получаем W(UN\ /><*>) > Щ1<^+1>, Р<^>). С другой стороны, мы имеем W(UN+1\ P<N>) > W(UN+1K Р(»+г)) (это неравенство было доказано при доказательстве предложения 1), откуда имеем * Преобразование / называется инъективным, если из а Ф Ь следует, что / (а) Ф f (b) — Примеч. пер. 34
W(L(NK P(N)) > W(HN+l\ P<iV+1>), что противоречит предположению un+i = «w- Таким образом, имеем L<N> = HN+1\ откуда Д/,<^>)=/(И*+1>), а следовательно, Я<^> = /W+1) и, наконец, ^ = = 0лг+1. Такое же рассуждение можно провести для любого п^ N, откуда уп = t^ Для всякого п^ N. 1.3.7. Свойства полученного решения а) Полученное решение является «устойчивым» и «несмещенным», поскольку представительство L* = (L*, ..., Lfe), полученное в результате сходимости нашей процедуры для k классов, требует (посредством f) разбиения Р*, k классов которого также в качестве представительства допускают L*. б) Полученное представительство L* позволяет построить функцию назначения. Эта функция каждому элементу из Е ставит в соответствие такой класс с индексом t, что D(xy Lf) —minD(x, Ц). (В случае неединственности минимума следует брать наименьший индекс.) в) Можно получить несколько решений, меняя выбор исходного разбиения Р<°>. Если же-следует выбрать всего одно решение, то в качестве такового должно быть принято решение, дающее наилучшее значение критерия. Интересно исследовать множество решений с тем, чтобы извлечь из него информацию, которая может быть использована на практике; таковы, например, группы объектов (мы называем их «устойчивые (или сильные) формы»), которые находятся всегда в одном и том же классе независимо от того, какое решение рассматривается. Более подробно этот вопрос освещен в [1]. 1.4. РАССМОТРЕНИЕ ДРУГИХ СЛУЧАЕВ 1.4.1. Несколько представителей одного класса До настоящего момента мы рассматривали лишь тот случай, когда каждому классу множества Е ставится в соответствие единственный представитель (другими словами, единственный элемент пространства L). Однако интересно рассмотреть случай, когда подмножеству из Е соответствует несколько элементов из L. Мы рассмотрим несколько таких случаев, и, в частности, тот, при котором L = 3d (E) и представители различных классов (как подмножества Е) имеют одну и ту же мощность (см. гл. 2). 1.4.2. Случай существования непустой общей части у представителей всех k классов Речь идет о таком типе задач, в которых k представителей (L1? ..., Lk) ;= L для классов разбиения (Р1у ..., Ph) = Р содержат общую часть С, которая не меняется, каков бы ни был показатель / (i = 1, 2, 2* 35
..., k). В этом случае в общем виде задача может быть сформулирована следующим образом: если критерий задан формулой W(Py L) = k = 2 ?)(/>*, Lt)y где Lt = (ai9 С), то необходимо найти такую тройку * — 1 (Р, а, С), где а ;= (ах, ..., аЛ), которая минимизирует f в Р;- X Lfe X X С. В гл. 12 и 15 мы продемонстрируем два примера применения этой формализации. 1.4.3. Возможности выбора функций назначения и представительства Эти функции могут иметь различный вид и использоваться для решения проблем представительства, отличающихся от тех, которые были описаны в 1.3.1. Так, например, в некоторых случаях оказывается необходимым учитывать ограничение на уровень связности искомых классов, и тогда следует соответствующим образом видоизменить функцию назначения. Подобные проблемы рассматриваются, в частности, в задачах распознавания образов при разложении и запоминании контуров. В некоторых случаях функция представительства не может поставить в соответствие одному (или нескольким) классу из Е одно (или несколько) наилучшее представительство (иными словами, D(A, .) не имеет минимума). С этой проблемой мы сталкиваемся, в частности, при решении задач расщепления смеси вероятностных законов распределения. Для того чтобы оптимизировать критерий, мы вынуждены обходить это затруднение, принимая в качестве g функцию, которая просто улучшает, а не оптимизирует критерий. В том случае, когда D(A, .) имеет несколько минимумов, применение предложения 2 невозможно, поскольку из равенства ип+1 = ип не следует L(n+1> ;= L(n>. Эта трудность может быть преодолена, если наложить дополнительное условие на преобразование /, а именно: объект не может перейти из одного класса в другой, если это ведет к ухудшению критерия; в результате / становится отображением Pft X L^ -> Pft (см. гл. 7). 1.5. НЕКОТОРЫЕ МЕТОДЫ, НЕ УКЛАДЫВАЮЩИЕСЯ В ОБЩУЮ СХЕМУ МДС а) Выбор пространства покрытий 5, как правило, необходим при любом методе классификации; однако в противоположность нашему методу многие алгоритмы, широко используемые на практике, не требуют при своем осуществлении нахождения наилучшего покрытия s 6 ? S в смысле явно выраженного критерия. Так обстоит дело, например, в классических алгоритмах иерархической классификации, где S есть множество занумерованных иерархий. Эти алгоритмы состоят в последовательном поэтапном построении различных уровней иерархии. 36
При этом оказывается, что в случае «минимального расстояния» можно затем показать, что полученная ультраметрика является наилучшей (в смысле известного критерия) среди всех подчиненных ультраметрик (в смысле выбранной меры сходства). Напротив, для алгоритма среднего расстояния или для алгоритма центрированного момента второго порядка [2] мы не имеем аналогичного результата. В связи с тем, что для этих алгоритмов, как правило, не существует общего критерия, относящегося к любой иерархии из множества S занумерованных иерархий, а также в связи с тем, что осуществление этих алгоритмов происходит путем последовательного агрегирования пар объектов или пар групп объектов, эти алгоритмы не входят в рамки метода динамических сгущений. б) Выбор структуры представительства может быть в некоторых случаях совершенно бесполезен. Так, например, в случае «обменного алгоритма» Ренье [3] достаточно просто определить критерий W : S-> R+, а затем, взяв за начальное значение s@> 6 S, переносить объекты из одного класса в другой, руководствуясь показателем улучшения критерия. в) В целом можно сказать, что в проблематику, связанную с методом динамических сгущений, не входят задачи, которые не могут быть сформулированы в терминах оптимизации критерия, измеряющего «степень адекватности» между покрытием и его представительством; не входят также алгоритмы, которые не требуют определения пространства покрытий S и пространства представительств L, функции представительства g и функции назначения /, позволяющих переходить от одного пространства к другому. 1.6. СРАВНЕНИЕ АЛГОРИТМОВ МЕТОДА ДИНАМИЧЕСКИХ СГУЩЕНИЙ Алгоритмы, относящиеся к типу «динамических сгущений», различаются между собой в зависимости от того, как конкретно выбираются значения S, L, / и g. Если пространство покрытия S выбрано, то можно сказать: «Любой алгоритм метода динамических сгущений является «наилучшим» по сравнению со всеми другими алгоритмами динамических сгущений в смысле критерия, который ему соответствует». Предположим, что алгоритм At (соответственно Aj) при каждой итерации уменьшает значение критерия Wt (соответственно Wj). Тогда всякое решение, полученное с помощью алгоритма Аи в общем случае может быть улучшено при осуществлении алгоритма Aj в смысле критерия Wj и наоборот. За исключением одного особого случая (см. I П) мы не можем улучшить решение, полученное с помощью алгоритма Аи используя алгоритм Aj9 так как если критерий Wj улучшается, то одновременно критерий Wt ухудшается. Это требует от пользователя хорошего понимания задачи оптимизации, которую он решает. ПРИЛОЖЕНИЕ 1 Понятие «мера сходства» включает два классических понятия, применяемых при автоматической классификации: «показатель различия» и «показатель сходства». 37
Показатель различия представляет собой отображение d : Е ж X ?-> R+, которое удовлетворяет следующим соотношениям: d(x, у) = d(yy х) (симметрия), d(xyx) = 0,V х?Е. Показатель сходства есть отображение d : Е X ?WR+, удовлетворяющее соотношениям d(xy у) = d(yy х)у d(xy х) = d(#, */) = dmax > d(*, y)y Vx, у еЕ при л: фу. Очевидно, можно легко перейти к индексу различия dl от индекса сходства d2, положив dx(xy у) = dmax — d?{x, у). Учитывая то, как эти понятия употребляются нами в данной работе, любители точных формулировок, видимо, предпочли бы говорить скорее о «мере различия», чем о «мере сходства». Однако мы предпочли сохранить этот последний термин, поскольку он обозначает то же понятие и более употребителен. ПРИЛОЖЕНИЕ 2 Определение. Говорят, что Е обладает межклассовой структурой, если ему ставится в соответствие множество S (называемое пространством покрытий), включенное в множество всех подмножеств Р, удовлетворяющее трем следующим условиям: 1) VseS, s- {Ръ ..., Pk}=>VPi*sE] 2) Hs 6 S, такое, что Е 6 S; 3) Hs 6 S, такое, что Ye ? Е {е} 6 5. Легко заметить, что Е будет обладать межклассовой структурой, ^если мы ставим ему в соответствие одно из следующих множеств: Sx — множество пересекающихся покрытий; 52 — множество разбиений; 53 — множество мультиразбиений (гл. 15); 54 — множество иерархий. Множества S, которые обеспечивают множеству Е наличие межклассовой структуры, как правило, слишком разнообразны, и для решения конкретных задач мы вынуждены ограничиваться лишь частью S. Так, например, множество разбиений Pk с фиксированным числом классов к представляет собой широко используемую на практике часть множества разбиений. ЛИТЕРАТУРА 1. D i d а у Е. A972) Optimisation en classification automatique et reconnaissance de formes. R. A. I. R. О (Novembre). 2. JambuM. A978) Classification automatique pour Tanalyse des donnees. Dunod. 3. R e g n i e г S. A965) Sur quelques aspects mathematiques des problemes de classification. I. С. С Bui., vol. 4, 175—191. 38
Глава 2 • ИССЛЕДОВАНИЕ НЕКОТОРЫХ ВАРИАНТОВ В СЛУЧАЕ ЕДИНСТВЕННОГО ПРЕДСТАВИТЕЛЯ КАЖДОГО КЛАССА 2.1. ВВЕДЕНИЕ Важным этапом в понимании и интерпретации больших массивов данных зачастую является отыскание наиболее «репрезентативных» элементов среди объектов, подлежащих классификации. Хорошим подходом к решению этой задачи является метод автоматической классификации [4], при котором отыскивается разбиение исследуемого множества объектов на классы, такие, что каждый объект больше похож на лучших «представителей» своего класса, чем на представителей других классов. На практике часто бывает так, что об объектах приходится судить единственно по их сходству между собой. Это понятие легко конкретизируется с помощью меры различия объектов; напротив, многомерный подход к этому понятию более труден, так как требует изучения множества дескриптивных свойств (переменных) и определения расстояния между объектами и между переменными по таблице «объект—свойство». В этой главе представительство класса объектов производится путем выбора подмножества объектов, обладающего некоторыми свойствами [8], [10]. Тем самым классификация объектов будет зависеть только от степени различия между объектами. При этом (как ив 1.3) рассматривается случай, когда имеется по единственному представительству от каждого класса изучаемого разбиения. Таким образом, структура, выбранная для пространства покрытий 5, есть множество Рк разбиений на k классов. Пространство представительств L будет, в зависимости от различных вариантов, подмножеством множества SP(E) всех подмножеств Е или подмножеством евклидова пространства R*\ E — множество объектов, подлежащих классификации. В первой части этой главы рассматривается оптимизационная задача, соответствующая каждому из описываемых вариантов. Во второй части изложен метод «центра тяжести», который особенно часто используется в автоматической классификации. Этот метод применяется к множеству индивидов в евклидовом многомерном пространстве. Если индивиды могут быть «помещены» в такое пространство, то соответствующая оптимизационная задача первых вариантов является проблемой минимизации критериев квадратичного типа. В конце главы сравниваются различные задачи оптимизации. 39
Обозначим: Е — множество объектов, подлежащих классификации; Pk — множество разбиений на k классов множества Е; d — мера «несходства» объектов, определенная на множестве Е\ D — мера адекватности покрытий $> (Е) и представительств L; t — функция на ?, такая, что t(x) есть порядковый номер элемента х\ Определим также функции: / — функция назначения, задающая отображение Lk ->• Phy где Lft = L X L X ..., X L (k раз); g — функция представительства, задающая отображение Р&->- .->• Lfe. И наконец, критерий W задает отображение Lk X Pk-+ ->R+. Все различные представленные здесь варианты используют одно и то же пространство покрытий, которым является множество разбиений на k классов (& фиксировано). Варьируются только пространство представительств L и мера адекватности D между №(Е) и L. 2.2. МЕТОД, ИСПОЛЬЗУЮЩИЙ ЯДРА ПОСТОЯННОЙ (ФИКСИРОВАННОЙ) МОЩНОСТИ 2.2.1. Пространство представительств Определим пространство представительств как множество подмножеств мощности т совокупности Е. Таким образом, обозначив это пространство через Lm, имеем где 3s (E) есть множество всех подмножеств совокупности Е. Мера адекватности между ?Р (Е) и Lw. Предположим, что на совокупности Е определены мера несходства d(x, у) между любыми двумя объектами х и у этой совокупности и одновременно мера («функция массы») [I со значениями в R+: > VЛ cr E. Тогда мера адекватности между ёР(Е) и Lm определяется как отображение D : ЗР(Е) X Lm->- R+ следующим образом: a, Ь). 2.2.2. Оптимизационная задача Пусть имеется разбиение Е на k классов Р = (Рг, ..., Pk) и /г-ядер- ное множество L = (Lly ..., Lk). Оптимизационная задача заключается в отыскании пары (Р*, L*), которая минимизирует следующий критерий W: 40
где D(Pi9L,)= 2 2> x€Pt yeL- 2.2.3. Замечания Замечание 1. Можно сделать так, чтобы число элементов, составляющих ядро, зависело от номера класса. В этом случае мера адекватности между &>{Е) и Lm есть где А ^^(Е) и N 6 Lm, а критерий принимает вид W(P9L) = JbDni(Pi9Lt), где nt = \Lt\. Замечание 2. В случае когда все элементы ? имеют одну и ту же массу, равную ji, критерий запишется с мерой адекватности между ^(Е) и Lm вида Dm(A,N)=-2 2d(a,b). Если в качестве меры адекватности между SP(E) и Lm выбрать функцию то получим следующий критерий: 1=1 где nt = \Lt\ = card/,*. 2.3. МЕТОД ЯДЕРНОГО РАЗБИЕНИЯ 2.3.1. Пространство представительств В данном случае пространство дредставительств определяется как множество классов ?, т.е. как №(?). Мера адекватности между пространством представительств и Ф (Е) есть функция D «несходства» между SP (Е) и им самим, т.е. отображение 41
удовлетворяющее свойству симметричности: УЛ, В 6^(?) D(A, B)= = D(By А). При этом не обязательно, чтобы D(A, А) = 0; более того, при любом А 6 №(Е) может существовать элемент В множества 3* (?), такой, что DE, Л)<?>(Л, Л). Выражая обычным способом функцию адекватности D через показатель «несходства» объектов dy получаем: () 2 2 аел ьев 2.3.2. Оптимизационная задача Пусть имеется L ? Pft иР f Pfe. Задача оптимизации в данном случае состоит в отыскании такой пары (Р*, L*) из Pk X Pfe, которая минимизирует следующий критерий: или 2 /•= 1 Если L = Я, то U7(P, P) - 2.4. МЕТОД, ИСПОЛЬЗУЮЩИЙ ЯДРА ПЕРЕМЕННОЙ МОЩНОСТИ 2.4.1. Пространство представительств Вместо того чтобы брать щ элементов из ? в качестве ядра /-го класса ?", в предлагаемом здесь новом методе ядро составляется из множества элементов ?, обладающего массой, меньшей некоторого апри Орного фиксированного уровня \i. Таким образом, пространство представительств есть множество частей Е, масса которых меньше или равна ^1 (обозначим его L*1): где ц(Л) = 2 1^(а)- Мера адекватности между ЗР(Е) и L^ определится, а е А таким образом, как отображениеD : ^(?) х L11-^ R+, такое, что при А е &{Е) и N 6 ^ 42
2.4.2. Оптимизационная задача Пусть Р 6 Рь и L 6U = D* x ... х L» (k раз). Оптимизационная задача состоит в отыскании такой пары (Р*, L*), которая минимизирует критерий 2.5. АЛГОРИТМ Можно добиться убывания критериев, соответствующих описанным выше оптимизационным задачам, используя естественный алгоритм, приведенный в 1.3.6, при условии, что будут выполнены две следующие гипотезы. Гипотеза 1. Минимум D(Ay .) существует в пространстве представительств и является единственным, каково бы ни было А из 5й (?). Очевидно, что в нашем случае минимум существует, так как пространство представительств состоит из конечного множества элементов. В случае «неединственности минимума», т.е. наличия нескольких локальных минимумов, выбирается тот элемент N пространства представительств, на котором значение 2 ИМ является минимальным. Гипотеза 2. D(A, N) = 2 D(a, N). Очевидно, что это условие оказывается выполненным в трех предыдущих определениях функции D. Замечание. В рамках описанной схемы решение, основанное на алгоритме поиска минимума критерия W вида W(P, L) = 2 ) / = 1 требует определения D и знания L (пространства представительств). Более того, функция D должна удовлетворять допущениям 1 и 2 из 1.3.1. 2.6. МЕТОД ЦЕНТРА ТЯЖЕСТИ Представление классов центрами тяжести очень распространено. По словам Уишарта [13], очевидно, Торндайк [121 является первым, кто предложил процедуру итеративного уточнения местоположения центров тяжести, в чем можно убедиться, в частности, прочитав следующую его фразу A954 г.): «Вообще говоря, элемент является неправильно расклассифицированным, если он к членам другого кластера ближе, чем к членам своего ... В подобных случаях производится «переназначение» элементов, начиная с наиболее очевидных промахов, и при этом пересчитываются средние значения внутриклассовых расстояний. Эти изменения производятся до тех пор, пока никакое еле-
дующее изменение не сможет уменьшить величину среднего внутриклассового разброса». Затем Себастьян [11], Дженси [7] и Форжи [6] усовершенствовали процедуру итеративного повторного перераспределения элементов по классам, близкую по своей сути к той, что была предложена Торн- дайком. Наконец, Мак-Куин [9] предложил следующую процедуру. Из подлежащей классификации совокупности объектов извлекаем случайным образом k элементов, которые используем в качестве начальных приближений для центров k искомых классов. Каждый следующий элемент из классифицируемой совокупности Е последовательно относится к тому классу, к которому он ближе всего; но это назначение производится только в том случае, если это расстояние ниже заданного порога а. Если же это расстояние больше а, то этот элемент объявляется центром нового класса. После каждого назначения координаты центров классов пересчитываются. Если два центра оказываются слишком близкими друг к другу, то оба класса перегруппировываются (объединяются в один класс). Описанный процесс продолжается до стабилизации местоположения центров классов. Болл и Холл [1] и [2] создали очень популярный в США метод, названный ISODATA. Он состоит в случайном отборе k элементов в качестве центров k классов и в назначении (без изменения центров классов) п — k оставшихся объектов по k классам по принципу ближайшего соседства к центру. После такого распределения объектов по классам центры классов пересчитываются. Если два центра классов слишком близки друг к другу, тогда эти два класса объединяются; одновременно если дисперсия одного класса слишком велика, тогда он разделяется на два класса. Этот процесс продолжается до стабилизации центров классов и требует априорного выбора некоторого числа «порогов», в сравнении со значениями которых принимается решение о слиянии или разделении классов. В статье Фридмана и Рубина [5] подвергается сомнению критерий внутриклассовой дисперсии и предлагается критерий, инвариантный относительно линейного преобразования переменных. Все описанные алгоритмы требуют от пользователя «размещения» своих объектов в евклидовом пространстве, в то время как в предлагаемом нами подходе этого не требуется. 2.6.1. Пространство представительств Каждый элемент множества Е изображается точкой в пространстве Rp, а мера несходства d между элементами Е есть евклидово расстояние. Отправляясь от этого метрического пространства (Е, d)y определяем в качестве пространства представительств L множество R^. Мера адекватности между SP(E) и Rp определяется таким образом: ) % а€А 44
2.6.2. Оптимизационная задача В данном случае оптимизационная задача состоит в отыскании такой пары (Р*, L*)y которая минимизирует критерий W (P, L) = 2 D (/>,, Lt) =2 S И (х) & (х, Lt), где Lz- — центр тяжести класса Рг и, следовательно, L представляет k центров тяжести классов разбиения Р. Очевидно, что критерий выражает среднюю внутриклассовую дисперсию разбиения Р. 2.6.3. Алгоритм Алгоритм, описанный в 1.3.5, дает возможность найти локальный оптимум для этой задачи. Для того чтобы он был применим к этой задаче оптимизации, необходимо соблюдение условий, сформулированных в следующих двух гипотезах. Гипотеза 1. Минимум D(A, •) существует и единствен, каково бы ни было А в 9*(E). Проверим соблюдение этого условия в нашем случае: minD(A, y)= min2 \x(a)-d2{a, у). Одно из хорошо известных свойств евклидова расстояния определяет справедливость следующего положения: минимум D(A, •) существует и единствен, это — центр тяжести класса А, т.е. где ха — представление элемента а в Rp (т.е. вектор координат элемента а в пространстве Rp). Гипотеза 2. D(A, у) - 2Р(а, у) а е А (с очевидностью следует из определения D). Таким образом, алгоритм, приведенный в 1.3.5, учитывая предложение из 1.3.6, дает возможность сделать этот критерий убывающим. Замечание. Метод центра тяжести требует дополнительно (по сравнению с предыдущим методом) определения на элементах множества Е евклидова расстояния. Более того, основанный на минимизации критерия квадратичного типа метод «чувствителен» к элементам, слишком Удаленным от центра тяжести классов. 45
2.6.4. Распространение на непрерывный случай Распространим метод центра тяжести на случай, когда Е—не обязательно конечное множество. Будем предполагать Е = Q — множество анализируемых объектов конечной меры. Рассмотрим вероятностное пространство (Q, 33, fx): Q — множество наблюдений (пространство элементарных событий); 53 — борелевское поле (т. е. минимальная а-алгебра множеств) на Q; \i — определенная на $} положительная мера, такая, что |jt(Q) < < -f оо, ао функции Т на 53 говорят, что она измерима в (Rm, 53?) E3™ — борелевское поле щ Rm), если для любого В ? 53 и соответствующего X = Т(В) имеем; J Td\i = $ dlT(\L)]; В X где Т(\х) есть «образ меры» [а, порожденный Т. Следовательно, для любой функции Л, являющейся 53^ -измеримой, имеем: j h&T(\k) - J ATdji. 2.6.4.1. Определения Пусть Е — множество наблюдений, 33 — борелевское поле на Е, а |х — положительная мера на {В. Тогда: 1) мера, определенная на множествах В 6 53 соотношением j /d(i, называется мерой плотности f по отношению к pi и обозначается / • [л; 2) положительная мера v называется абсолютно непрерывной по отношению к \х, если из \i(B) = 0 следует v(B) ^=0, В 6 ^; 3) положительная мера v называется сингулярной по отношению к мере |i, если существует N ^ 3d, такое, что |i(A0 =0, a v(?—Л^) = 0; 4) две числовые и 53-измеримые функции /{ и /2 называются эквивалентными по положительной мере [х, если для всякого В ? 53 5) будем называть центром тяжести подмножества Qx множества Q вектор G(QX), такой, что где Xi = {x ? Rm : gco б Qlf такое, что jc = Г(со)} ^= T(QX) и ^(Qx) = = 1 rfix(co) - J d(T(|i)). Теорема Лебега — Никодима*. Пусть T(\i) — некоторая положительная мера на (Rm, 53™), существует единственный класс Л* числовых *В советской литературе эту теорему чаще называют теоремой Радона— Никодима. — Примеч. пер. 46
^-измеримых положительных функций, эквивалентных по мере Лебега v, а мера v' — единственная сингулярная по отношению к мере v мера, такая, что =A.v + v', Vheh*, причем h есть функция плотности на образе множества Я в R/n. Тогда мера Лебега v абсолютно непрерывна по отношению к T(\i). 2.6.4.2. Построение алгоритма динамических сгущений Напомним используемые обозначения. Расстояние d задано в Rm и определяет отображение пространства Rm x Rm в R+. Билинейная симметричная форма б задана в Q, определяет отображение Q x Q в R+ и позволяет для любых пар соь (о2 6 Q и хъ х2 ? Rw, связанных между собой соотношениями Xi=T((o$, устанавливать соответствие d(xu х2) - 6@)^ оJ) = d(T((ox)9 Г(со2)). Будут использованы также два разбиения Q и Р множества Х= T(Q) на k классов, связанные между собой некоторым соотношением Р = ¦¦=/№)¦ Построение функции назначения. Определим класс Pt соотношением Р{ - {х 6 X с R- : d(x, G(Qt)) < d(x, G(Qj)), j = \Tk\ j ФI). Его построение сводится, таким образом, к построению следующей разделяющей гиперплоскости Нц классов с номерами / и /: Ни -{x6R- d(x, G(Qt)) = d(x, G(Qj))}. Если Аи = {x 6 X : d(x, G(Qt)) < d(x, G(Q;-))}, то имеем соотношение Pi = П Л„. Построение функции представительства. Вычисляем G(Pt)9 который является центром тяжести класса Я,-: [xh{x)dx+ [xdv (x) при Г(|х)[Р«] - f h(x)dx + f dv'(x). Критерий B7(L, P) = W(v) записывается в виде (x, G (P,)) A (jf) dx 4- J d (*, G (P,)) dV p. как d и б — билинейные формы, то, если Rt = Г-1 (Р,-), имеем ^(«)- ? f в (cofG (/?,)) ф (со). 47
Замечание. Если Q есть конечное множество, то h(x) = 0 для всякого х 6 Rw. В этой ситуации v'(x) = |i(co), если существует со ? &, такое, что л; = Т(со), и v'(^c) = 0 — в противном случае. Алгоритм метода центра тяжести является, следовательно, частным случаем только что определенного алгоритма. 2.6.4.3. Теорема Алгоритм, определенный таким образом, приводит к убыванию критерия W, а последовательность ип = W(vn) сходится. Доказательство. Пусть Сц = Рг П Qj. Таким образом, мы имеем следующие соотношения: р. = UCU и Q; = Udj, a Q = иСи. / / *./ По определению центра тяжести для всякого у 6 Rm d(x, G(P|))dT(|i)(jc) < J ф, у i так что , G(Pi))dT(V)(x) <J d(x9 G(Qj))dT(\i)(x). Функция назначения / по определению «устроена» так, что для всякого d(xy G(Pt))^d(xy G(Pj)) при } Ф1. Следовательно, при любом / Ф1 J d(x, G(Pt)}dT(v)(x) < J d(x, G(Qj))dT(ii)(x)y Cij Cij откуда, суммируя* на Q, получаем k k k k из этого вытекает, что Пусть о = (P, L) и о' = (Q, L). Тогда ^(o) < W(v'). Последовательность ип = Щ1^) ограничена снизу и, как только что показано, убывающая. Следовательно, она сходится. 2.6.4.4. Пример Рассмотрим вероятностное пространство (Q, Ж, |li), в котором Q =* = R — множество действительных чисел, $$ — борелевское поле на R и fi — положительная мера, такая, что ji(Q) = 10, а по теореме Ле- 48
бега — Никодима существует плотность h = dT(\i) по мере Лебега Возьмем в данном примере следующую функцию плотности: причем оо J h(x)dx = 7(R) = Ю. Требуется произвести разбиение множества X = R) на два класса (т.е. k = 2). (и, следовательно, Рис. 2.1 Разделяющая гиперплоскость Вариант 1. Положим ax=Y, a2 = 5, ^i=-2" » ^2 = у- Разделяющая гиперплоскость (которая в данном случае является точкой на R) определяется уравнением * Соответственно з ' И-00'3!")' *И3Т' +оо): Зт ' —00 +00 j 3-L з-L 3 *Авторы приводят результат явного аналитического решения оптимизационной задачи вида X* чоА W (х*) = J (x — Oi (x*))*h (x)dx + J (x - a2 (x*))*h (x)dx -+ mm, — 00 X * где at (a:*) = д:, д2 (х*) = G (Q2) = J^ 49
Вариант 2. Положим аг = 1, а2 = 15, Хг = -д-, Я2 = -^ . Решение соответствующей оптимизационной задачи (см. примеч. пер. на с. 49) дает нам в качестве разделяющей гиперплоскости уравнение х* = 8,59. Соответственно Qx = (—оо; 8,59), Q2=(8,59; +oo), jx(Q2) = 5,69 (рис. 2.2). = 4,31 и Раздели- ju(&2) = 5,69 ющая гиперплоскость Рис. 2.2 2.7. ВЫРАЖЕНИЕ И СРАВНЕНИЕ РАЗЛИЧНЫХ КРИТЕРИЕВ В РАМКАХ НЕКОТОРОГО ЕВКЛИДОВА ПРЕДСТАВЛЕНИЯ ОБЪЕКТОВ Три из четырех описанных здесь методов используют в качестве пространства представительств подмножество множества & (Е) всех возможных подмножеств исследуемой совокупности объектов Е. Табл. 2.1 позволяет сравнить эти три метода. Таблица 2.1 странство ставительств D Метод 1 Lm = {AtE&> (?):| A\ = m} D(A, N) = = 2 2 \i(a)ii(b)x а&А fceN X d (a, b) Метод 2 L=«0* (E) D(A, N) = = 2 2и«)х X \i(b)d(a, b) Метод 3 D(A, N)= 2 |i(«)X flEi4 50
Если измеритель различия d между элементами множества Е есть евклидово расстояние, то мера взаимной адекватности D двух элементов множества ^(Е) может быть записана в виде В табл. 2.2 приведены различные варианты общего вида оптимизируемого критерия W, соответствующие четырем рассмотренным в данной главе задачам автоматической классификации (дисперсия элементов множества А обозначается с помощью var(>4)). Та блица 2.2 Номер задачи 1 (ядра постоянной мощности) 2 (ядерное разбиение) 3 (ядра переменной мощности) 4 (метод центра тяжести) Общий вид оптимизируемого критерия k W(P,L)=^ M^)[var(Pi) + var(L*) + d2(G(P*), G (Lt))) /=i k W(P,L)= 2M^M^)[var(P*) + var(L,) + + d*(G(Pi),G(Li))] k W(P,L)= 2 Р(рг)№г(Рг) + чаг(и) + ^(О(Рг),ОAг))) k W(P, L)= 2 Iх (?i) var (Pi)~средняя внутриклассовая /= l дисперсия ЛИТЕРАТУРА В а 1 1 G. H., H a 1 1 D. J. A965) ISODATA, a Novel Method of Data Analysis and Pattern Classification. Technical Report, Standford Inst. 72 p. В a 1 1 G. H. H a 1 1 D. J. A967) A clustering technique for summarizing mul- tivariate data. Behavioral Sciences, vol. 12, №2, p. 153—155. Bonner R. E. A964) On some clustering techniques. IBM Journal 22, p. 22—32. D i d а у Е. A972) Nouvelles methodes et nouveaux concepts en classification automatique et reconnaissances des formes. These d'Etat, Paris VI. FriedraanH. P., RubinJ. A967) On some invariant critera for grouping data. J. Amer. Statist. Assoc, vol. 62, p. 1159—1178. F о r g у Е. W. A965) Cluster Analysis of Multivariate Data: Efficiency versus Interpretability of Riverside (Resume dans Biometrics, vol. 21, № 3, p. 768). 51
7. J a n с е у R. С. A966) Multidimensional qroups analysis. Australian J. Botany, vol. 14, № 1, p. 127—130. 8. LechevallierY. A974) Optimisation de quelques criteres en classification automatique. These 3eme cycle, Paris VI. 9. MacQueen J. B. A967) Some Methods for Classification and analysis of multivariate obervations. Proc. of the 5-th Berkeley Symposium on Mathematical Statistical and Probability, vol. 1, p. 281—297. 10. Sandor G., DidayE., LechevallierY. A973) Resultats recents concernant la methode des Nuees Dynamiques et applications a la recherche des profils biologiques. А. С. М., Davos. 11. Sebestyen G. S. A962) Pattern recognition by an adaptative process of sample set construction. I. R. E. Trans on Inf. Theory, vol. 8. 12. T h о r n d i к e R. L. A953) Who belongs in the family. Psychometrika, vol. 18, p. 267—276. 13. W i s h a r t D. A971) Some problems in the theory and applications of the methodsof numerical Taxonomy. Ph. D. Thesis 1971, University of St. Andrew.
Глава 3 • МУЛЬТИКРИТЕРИАЛЬНАЯ КЛАССИФИКАЦИЯ 3.1. ВВЕДЕНИЕ 3.1.1. Постановка задачи Рассмотрим случай, когда пользователь желает получить классификацию, которая оптимизирует одновременно много критериев. В [1] приведена библиография по многокритериальным задачам, связанным с этой проблемой. Предлагаемый здесь подход состоит в применении метода динамических сгущений (МДС), в котором каждому из заданного набора критериев Wt ставится в соответствие пространство представительств V и мера сходства Dt : Е X V:-> R+. Основная трудность при этом состоит в определении порядка (всегда связанного с ролью, отводимой различным критериям) на используемых «мерах сходства», называемых «мультисходствами». В самом деле, когда речь заходит об определении принадлежности индивида к классу, то приходится сравнивать два вектора, причем сравнение можно производить в соответствии с каждой из s мер сходства (s — число оптимизируемых критериев). Между векторами берется лексикографический порядок (см. приложение); чтобы определить его, необходимо определить порядок предпочтения на критериях. С этой целью Ханани в [7] предлагает схему, изображенную на рис. 3.1. В этой схеме следует четко разграничивать две различные части: первая (В) определяет порядок предпочтения, заданный на критериях; вторая (С) решает проблему в соответствии с этим предпочтением с помощью предлагаемого здесь алгоритма. Затем пользователь может на этапе D принять или не принять решение, изменяя (в последнем случае) выбор, сделанный на этапе В. 3.1.2. Связь с задачей классификации при наличии ограничений Понятия «критерий» и «ограничения» связаны, как это следует из классических схем математического программирования. Действительнее, рассмотрим следующую оптимизационную задачу с ограничениями: ¦р = bi9 /=1,2,..., п. 53
Эта задача может быть преобразована в мультикритериальную оптимизационную задачу: \8i(P)—bi\^min9 « = 1,2,..., п\ р W(P) ->extr. р Исходная задача В Упорядочение нри*\ териев по предпочтению с Алгоритм решения полученной модели D Результат удоблвтборителен Рис. 3.1 3.2. ПРОСТРАНСТВО ПОКРЫТИЙ И ПРОСТРАНСТВО ПРЕДСТАВИТЕЛЬСТВ В качестве пространства покрытий в этой главе рассматривается пространство Pk всех возможных разбиений исходного множества объектов Е на k классов. Пусть Р = (Ръ ..., Рк) — элемент пространства покрытий Pk (т. е. Р 6 Pft)- Введем s пространств представительств L1, L2, ..., Ls (s — число оптимизируемых критериев), обозначим общее пространство представительств (и L(s)= : \L Пусть Ц — множество всех возможных /г-кратных пространств Vf т. е. элементом Uk множества Ц является последовательность вида L| = = (Ц, Ц, ..., Я/), где Ц 6 U, / - 1, 2, ..., k. 54
Соответственно u u./ общее пространство /^-кратных представительств. Пусть Lh(s) — элемент пространства Lfe(s); тогда Lh(s) = (Ш, Ш, .... Ш)> где Таким образом, если Lft(s) 6 Lft(s), то Наконец, для того чтобы снабдить множество Е структурой представительства, мы должны, кроме пространства представительств, ввести также меру сходства, называемую в данном случае мерой мультисходства D(s). Пусть Dj{x, Щ — числовая функция на Е X U, определяющая сходство элемента х 6 Е и ядра Ц 6 V. Мера мультисходства есть отображение Е X L(s) на (R+)s, такое, что ?><¦>(*, Ms)) = При этом сумма 2D<s)(x, Xz(s)) выражает «сходство» между представи- х&рг тельством Xi(s) и классом Pt /г-разбиения Р 6 Р&. Чтобы сравнивать различные значения, принимаемые Z)^>, необходимо задаться порядком в Rs, который обозначается (<). Примером такого порядка может служить лексикографический порядок на Rs (см. приложение, замечание 2). Используется операция сложения, но можно использовать любую операцию ф при условии, что она будет монотонной. Иначе говоря, из А (<) В nC(<)D должно следовать, что А е С (<) В 0 D. w w 3,3. КРИТЕРИЙ И ОПТИМИЗАЦИОННАЯ ЗАДАЧА Критерий есть отображение №<s> = (flTj, W2, ..., Ws) пространства Pft X Lfe(s) на (R+)s, где Wj (/ = 1,2,..., s) есть отображение пространства Pfe x Lj(->- R+. 55
Аналитическое выражение этого критерия таково: r<s>(P,Lft(S))=2 2 D<°Hx,%i(s)). Таким образом, соответствующая оптимизационная задача состоит в минимизации W(s> (v) по v ? Pk X L& E). 3.4. ФУНКЦИЯ НАЗНАЧЕНИЯ И ФУНКЦИЯ ПРЕДСТАВИТЕЛЬСТВА Сопоставление ^-разбиению ^-кратного представительства задается с помощью функции назначения f, которая является отображением пространства L&(s) на пространство Pft, таким, что если Lh(s) - Ms), .... K(s)), то f (Lk(s)) = P = (Plf ..., Ph), где Xt(s) есть вектор-столбец с s координатами X) (j = 1, s), a P определяется с помощью соотношений В случае равенства элемент х назначается в класс с самым маленьким порядковым номером. Иначе говоря, мы комплектуем класс Ри относя к нему элементы множества Еу «наиболее близкие» (в терминах «мульти- сходства» D<s>) к представителю К($)- Наконец, для сопоставления кратному представительству некоторого разбиения введем функцию представительства g, которая есть отображение пространства Lk(s) на пространство Pft, т.е. если Р = (Р1У ..., Р^), то g(P) = Lk(s) = K(s)> •••» hk(s))y или (gi(Py \gs(P)j где gj(P) = Ljk = (M, ...Да), аХ|(/= 1,2, ..., k) задается тем элементом V9 который минимизирует величину 2D;(*, •)• Предполагается, что этот элемент единственный. 3.5. АЛГОРИТМ Алгоритм определяется с помощью двух последовательностей: vn = (/><">, LW(s)) 56
Уточним это. Пусть Р<°> — некоторое начальное разбиение (как-то подобранное или выбранное случайно.) Тогда L(k0)(s) вычисляется по формуле ) Выбор начального разбиения р (случайный или с помощью специального подбора) Вычисление L(knj(s) = g(Pfn)), речь идет, об отыскании таних Лу"'которые минимизируют величину ZJj(Pr' % i Вычисление Т.в. QTOT04HO , • заданное" Рис. 3.2 Нет Вычисление те P.ft*O = fx€E 'VM(x = ...к и Е- We))» Таким образом, имеем первую пару v1 = ность {vn} определяется рекурсивно (s)). ПоследовательПри этом у„+1 получается из vn с помощью соотношений 57
Общее схематическое описание алгоритма мультикритериального метода динамических сгущений представлено на рис. 3.2. 3.6. СООТНОШЕНИЕ АЛГОРИТМОВ ОБЫЧНОГО И МУЛЬТИКРИТЕРИАЛЬНОГО МЕТОДОВ ДИНАМИЧЕСКИХ СГУЩЕНИЙ Алгоритм мультикритериального метода динамических сгущений (ММДС) — это обобщение алгоритма МДС с единственным критерием. Очевидно, что, уменьшая число критериев от s до 1, мы получим обычный алгоритм МДС. Имеются следующие соответствия между исследуемыми в ММДС и МДС понятиями: функции g соответствует классическая функция представительства g; функции f — классическая функция назначения /; мультикритерию W(s> — критерий W\ мере мультисходства D(s> — расстояние (мера адекватности) D; пространству представительств L(s) — пространство L; кратному представителю Xt (s) 6 L (s) — представитель L, 6 L; отношению порядка (<) — обычное отношение порядка <. Сходимость алгоритма ММДС. Теорема 1. 1) Последовательность ип = W^ (vn) сходится, монотонно убывая, и достигает своего предела. 2) Последовательность vn =(P^n\ Uf (s)) стационарна (т. е. найдется такое N, что для всех п > N vn = vn+1). Доказательство теоремы проводится аналогично тому способу, который приведен в гл. 1 (с более подробными деталями доказательства можно познакомиться в [7]). 3.7. КЛАССИФИКАЦИЯ ПРИ ТРЕБОВАНИИ РАВЕНСТВА ОБЪЕМОВ КЛАССОВ 3.7.1. Задача Рассмотрим подробный пример практического использования ММДС. Речь идет об определении разбиения на k классов одинакового объема высокой плотности. В целях упрощения рассмотрим евклидово пространство Е cz R2, где любое Xj 6 Е определяется парой чисел: Xj = (x), х)) 6 R2. В терминах математического программирования наша задача состоит в следующем: N при ограничении ^ &ц = М, /=1,2, ..., k, 58
где я _ М' если xj?Pi> где Pi есть *"й класс разбиения Р; (О-—в противном случае, и #* — центр тяжести /-го класса, т.е. N , } /=1,2 (см. замечание 1 в приложении). Другими словами, мы ищем разбиение Р на классы одного и того же объема УИ, такое, чтобы сумма внутриклассовых дисперсий была минимальна. Эту задачу можно представить разными способами; в частности, в [8] она была исследована с помощью динамического программирования. Можно сформулировать задачу, выражая ограничение на объемы классов в форме второго критерия W2\ тогда приходим к следующему: k М- mm. Рассматриваемая под таким углом зрения задача тогда состоит в том, чтобы найти такой минимум W2, для которого классы разбиения будут плотными насколько возможно. 3.7.2. Выбранный порядок Прежде всего необходимо установить порядок предпочтения. Он определяется в соответствии с обратным лексикографическим упорядочением, т. е. пусть Определено, что А (<) В тогда и только тогда, когда а2< Ь2 или а2 — ~ Ь2 и аг < Ьг (см. замечание 2 приложения). 3.7.3. Представительство Для первого критерия Wx (минимизация дисперсии) определим представительство следующим образом: где L1 ¦— множество центров тяжести всевозможных подмножеств Е. Пространство представительств для второго критерия (выражающего ограничение на объем классов) опишем в виде 59
где пространство L2 есть совокупность всех троек Xf = (г*, С\ МО б R+ х R2 х N, г< 6 R+, О = (С[, С<2) б R2 и А,? определяет круг в R2 радиуса г1 с центром в точке С, содержащий ровно М1 точек множества Е. При этом М' и г1 выбираются таким образом, чтобы г1 был наименьшим радиусом круга с центром О, такого, чтобы М( было как можно ближе к заданному М. 3.7.4. Мультисходство В данном случае D<2> = (Dly D2) есть функция со значениями в положительной четверти плоскости (R+J. При этом Dx осуществляет отображение пространства Е X L1 на R+, а именно Dx(x, Xj)^d(x, X}) = (x1^xir + (x'~lc!J=(xl-Xn2 + (x2-U2J. Вторая координата D2 определяет отображение пространства Е X L2 на R+: 2 @, 2 и2 (X, А/ ) = U — в противном случае. Иными словами, элементы, находящиеся вне круга, определяемого тройкой X*, «штрафуются». 3.7.5. Мультикритерий WW и оптимизационная задача В данном случае мультикритерий №<2> задает отображение пространства Pk X Ц на положительную четверть плоскости (R+J, a именно 2 2 Dx(x9 XI) - 2 i=\ x^Pt i=\ Другими словами, штрафу подвергаются точки каждого класса Ри внешние по отношению к кругу Х\. Для сравнения величин WW используем обратный лексикографический порядок (<) на (R+J, который был определен в 3.7.2. Оптимизационная задача состоит в отыскании такой пары (Я*, L*N б Рй X Ц, которая минимизирует №<2). Другими словами, отыскиваем разбиение Р*^(Я*, Р%) и представительство L* = \ ), где L1* представляет центры тяжести классов P*r a L2* представляет k кругов, каждый из которых содержит М (или число, близкое М) элементов соответствующего ему класса. 60
3.7.6. Функции представительства и назначения Функция представительства g = Iе 2 ], где gx—отображение про- странства Pk в пространство Ц, такое, что L1 = gi(P) = (М, • ••, Н), где V есть—центр тяжести класса Pt\ g2— отображение пространства Рк в пространство Ц, а именно g2(P) = L2 *= (Xf, ..., Я|), где №2(/\ 2(P, Г). Заметим, что отыскание «наилучшего» круга А,? является очень трудоемким процессом. По этой причине мы можем, например, ограничить свой выбор центров С1 = (С[, С'2) кругов только точками класса Рг или сделать его еще уже, условившись выбирать в качестве О только центр тяжести класса Pt. Для того чтобы g2 было функцией, необходимо принять здесь гипотезу о том, что Е таково, что L2, которое минимизирует W2(P, L) среди L 6 L2, является единственным. В противном случае придется прибегнуть к более сложному формализму, соответствующему ситуации, когда ^D2(x, •) имеет несколько минимумов (см. 1.4.3); в том слу- *е А чае когда центр круга становится центром тяжести класса Л, имеется только один минимум. Функция назначения есть отображение пространства L1 в пространство Pfe, т.е. f(Lfe<2>) = Я, где Рг строятся в соответствии со следующей процедурой: Pt = {x?E: D<2> (x, V2>) (§ D(*)(x, W>), I = 1, ..., k\ l ф1) (в случае равенства х попадает в класс с меньшим порядковым номером). 3.7.7. Описание алгоритма Алгоритм реализуется следующим образом. Отправляются как от исходной точки от некоторого начального разбиения Я<°>, как-то подобранного или выбранного случайно. Каждому классу Р(?} соответствует круг Я?(°), который содержит число точек множества Е, равное заданному М или наиболее близкое к нему, и имеет минимально возможный радиус. Затем каждая точка относится к ближайшему «представителю», для определения которого используется расстояние до центров ?йжести классов Рг и Pj, если точка находится внутри пересечения или вне двух некоторых кругов, например, определенных тройками А,г-2@) и Х/2(°>. В противном случае точка назначается в класс, соответствующий кругу, в котором она находится. С новым разбиением, полученным таким образом, повторяется тот же процесс, и так до достижения сходимости, которая имеет место в соответствии с теоремой 1. Заметим, что если существует покрытие множества Е непересекающимися кругами, каждый из которых содержит М точек Е, то глобальный минимум критерия W2 является нулевым (нулевое значение получается по крайней мере с помощью этого покрытия). 61
3.7.8. Искусственный пример Пусть множество Е состоит из 8 точек (рис. 3.3 (а)). Требуется найти разбиение на 2 класса с минимальной внутриклассовой дисперсией и одинаковым объемом классов (М — 4). На рис. 3.3 (б) схематически дается произвольное начальное разбиение Р1°К Элементы класса 1 обозначены точками, а класса 2 — крестиками. Каждая итерация состоит в вычислении нового разбиения и его представительства. Во время 1-й итерации определяются центры тяжести, для обозначения которых используются те же символы, но (by Исходные данные F) 1-я итерация F) 2-я итерация (г) 3-я итерация Рис. 3.3 очерченные кругом. После вычисления ядер X? на следующей итерации получаем разбиение с 2 неравными группами (рис. 3.3 (в)). Однако в ходе 2-й итерации вычисляются наилучшие ядра, а решение, полученное в результате 3-й итерации, является оптимальным (рис.3.3 (г)). 3.7.9. Выбор других геометрических конструкций Факт выбора кругов в качестве представителей связан с определенным (а именно евклидовым) выбором метрики Dx. Другой выбор Dx будет приводить к использованию других геометрических форм (прямоугольников, эллипсов и т.п.). 3.7.10. Область применения Задача поиска классов, обладающих слабой инерцией и равными объемами, часто встречается на практике: в информатике для реструктуризации программ [5], при перенумерации в системах виртуальной памяти [2], при реорганизации баз данных [6], так же как при локализации процессоров центрального устройства в сетях ЭВМ [3]. Во всех этих примерах всегда имеется набор данных, на которых определяются критерий (иногда несколько) и ограничения, имеющие вид, описанный 62
в 3.1.2. Несмотря на разнообразие свойств различных приложений, все эти задачи можно сформулировать в терминах многокритериальной классификации и использовать для решения алгоритма ММДС. 3.7.11. Программная реализация алгоритма Программа решения задачи разбиения заданного множества элементов Е на классы равного объема была записана на языке Фортран CDC Ханани A979 г.), который в [7] описал пример ее использования. Имеющийся экспериментальный опыт свидетельствует, что объем необходимой памяти для реализации такой программы приблизительно является линейной функцией числа классифицируемых точек N. 3.8. ЗАКЛЮЧЕНИЕ Мы дали формулировку алгоритма динамических сгущений с несколькими критериями и показали, что его свойства сходимости те же самые, что свойства классического алгоритма динамических сгущений. Более того, мы продемонстрировали с помощью детального примера, что ММДС дает общий подход к решению большого семейства задач по классификации при наличии ограничений. Таким образом, ММДС открывает возможности широкого спектра исследований: изучение различных проблем с ограничениями, обеспечивающими соответствие критерия и используемого представительства классов; изучение различных отношений порядка (<); исследование других структур помимо разбиений, например многокритериальных иерархий, и т.д. Наконец, было бы интересно установить связь с бикритериальным подходом, предложенным Делаттром в [4]. 3.9. ПРИЛОЖЕНИЕ Замечание 1. Другой способ определения понятия «центра тяжести» группы элементов Рг- заключается в поиске такой точки #*, что D(x*9Pt)= inf D(x,Pt). Замечание 2. Лексикографический порядок для векторов с s координатами определяется следующим образом. Считается, что векторы а = (аъ а2, ..., ат, ..., as) и b = (bly Ь2, ..., Ьт, ..., Ь8) связаны отношением а (<) Ь тогда и только тогда, когда существует такое т ^m^s), что для всех i ^ m at — Ьг, но ат ^ Ът. ЛИТЕРАТУРА 1. AnderbergM. R. A973) Cluster Analysis for Applications. Academic Press. 63
2. В а Ь о п n e a u J. Y. et al. A977) Automatic and General Solution to the Adaptation of Programs in a Paging Environment. 6-th ACM Symposium on Operating Systems Principles, 109—116. 3. С h a n g S. K., T a n g D. T. A975) Processor Allocation in a Distributed Computer System. Proceeding of Computer Network Symposium, Maryland, 47—54. 4. Delattre M. A979) Classification optimale bi-critere These d'Etat, Faculte Universitaire Catholique de Mons (Belgique). 5. Ferrari D., A974) Improving Program Locality by Strategy-Oriented Restructuring. IFIP, 266—270. 6. F lor у A., etal. A978) Data Base Reorganization by Glustering Methods. Information Systems, 3, 59—62. 7. H a n a n i U. A979) Multicriteria dynamic clustering. Rapport de Recherche Laboria, № 358, IRIA, Rocquencourt, France. 8. Lechevallier Y. A976) Classification automatique optimale sous contrainte d'ordre total. Rapport de recherche Laboria, n° 200, IRIA, Rocquencourt, France.
Глава 4 • ИССЛЕДОВАНИЕ РЕШЕНИЙ, ПОЛУЧЕННЫХ С ПОМОЩЬЮ АЛГОРИТМОВ МДС, НА ПРОСТОМ ПРИМЕРЕ 4.1. РАССМАТРИВАЕМЫЙ ПРИМЕР 4.1.1. Исходные данные Нами было искусственно построено в качестве множества Е классифицируемых объектов в плоскости хОу облако из 48 точек. Оно характеризуется наличием двух классов-сгущений: множества Сх, содержащего точки 1~17, и множества С2, содержащего точки 18~48 (см. рис. 4.6 и табл. 4.1). 4.1.2. Введение модельных конструкций МДС Мы хотели, отправляясь от некоторого определенного представительства, исчерпывающим образом изучить все возможные разбиения на два класса, которые могут быть получены с помощью МДС. При этом мы выбрали на первом этапе в качестве пространства представительств L1 — {L : L = (Еъ ?2)}> гДе ^i — элемент множества ?, а Е2 — пара элементов того же множества. Нетрудно подсчитать, что общее число элементов пространства представительств L1 (cardL1) равно: 48(^ • 48 • 47 + 48) - 56 448. Отображение /х (функцию назначения), определенное на элементах L ? L1 со значениями в пространстве Р2 разбиений множества Е на два класса, мы строим, опираясь на меру сходства (адекватности) вида * = 1, 2, т. е. класс Рг = {х : D(xy Et) < D(x, Ej)}, i = 1, 2; i ф] (здесь d — обычное евклидово расстояние). Можно подсчитать, что при таком задании L1 и fx общее число различных возможных разбиений множества Е на два класса составит card^L1)) — 614; именно на этом подмножестве разбиений мы и реа- лизовывали различные алгоритмы МДС. 4.2. ИСПОЛЬЗУЕМЫЕ АЛГОРИТМЫ Снова обратимся к структурам представительства, рассмотренным в гл. 2, постоянно оставаясь в рамках схемы, предусматривающей наличие единственного представителя от класса, а именно: 3 Зак. 303 ^5
Номер точки 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 Абсцисса 1 2 2 3 3 4 4 4 5 5 5 6 6 6 7 7 7 1 1 2 2 2 3 3 Ордината 6 5 6 4 5 2 3 4 2 3 3 1 2 3 1 2 3 8 9 8 9 10 8 9 Номер точки 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 Та Абсцисса 3 4 4 4 5 5 5 6 6 7 7 8 8 9 9 9 10 10 10 10 11 11 11 11 блица 4.1 Ордината 10 7 8 9 7 8 9 6 7 6 7 5 6 4 5 6 2 3 4 5 1 2 3 4 а) в качестве представителя подмножества Q ? Е используется центр тяжести G(Q) этого подмножества, а мера сходства между элементом а множества Е и представителем / = G определяется соотношением Dx{a, G) = (a — G)f - М • (a — G), где а 6 Е — /?-мерный вектор-столбец (в нашем примере р = 2)* и М — некоторая симметричная, положительно определенная матрица порядка рх р\ очевидно, что каждому разбиению множества Е на два класса ставится в соответствие пара центров тяжести этих двух классов и, наоборот, каждой паре (при заданной выше мере сходства Dx) ставится в соответствие разбиение; б) будут рассмотрены также случаи, когда представительство задается парой точек множества Е, т.е. L = {(а1у а2) : аг 6 Еъ а2 6 ?}» а в качестве мер сходства между элементом х 6 Е и подмножеством Q исследуемого множества Е используются: АЛ*; Q) = S d(x,a), *В случаях когда это необходимо, авторы разделяют обозначения рассматриваемого элемента а 6 Е и его векторного задания х (а) в соответствующем р-мерном пространстве. — Примеч. пер. 66
D,(x; Q)= где G(Q), как и ранее, — центр тяжести подмножества Q. Заметим, что последняя мера сходства (ZL) не удовлетворяет допущениям 1 и 2 из 1.3.1 и соответственно не позволяет определить монотонно убывающую последовательность ип ~ W(P^n\ L<">) в алгоритме МДС. Тем не менее во всех рассмотренных нами практических ситуациях эта последовательность сходилась. При реализации любого из алгоритмов МДС рассмотрим отображение h множества Р2 разбиений (исследуемой совокупности Е) на два класса на себя, где h является суперпозицией (сверткой) двух отображений / и g, т. е. h = f*g ~ f (g (Я)). Очевидно (см. о построении и свойствах алгоритмов МДС в 1.3.5 и 1.3.6), сходимость алгоритмов МДС достигается на «неподвижных» точках (по отношению к К) множества Р2, т. е. на таких Р 6 Р2> на которых Р = h (P). Рассмотрим граф * Л = (Р, Г), где Г—множество пар (h(P), P): каждая дуга графа начинается из h (P) и заканчивается в Р. Гипотеза о сходимости алгоритма МДС, построенного по схеме, основанной на суперпозиции /г, позволяет утверждать, что граф не содержит циклов **. Разобьем граф Л на связные компоненты ***, каждый из которых является, таким образом, «прадеревом с петлей в корне»****, так как он не содержит циклов за исключением «петли» в исходной вершине, т. е. в корне. Таким образом, множество решений алгоритма МДС (подмножество разбиений из Р2) будет, в терминологии теории графов, множеством корней всех связных компонент графа Л. 4.3. ПОЛУЧЕННЫЕ РЕЗУЛЬТАТЫ 4.3.1. Сравнение алгоритмов В табл. 4.2 представлены результаты подробного исследования всех решений, полученных с помощью алгоритмов МДС, использую- *Граф — фигура, состоящая из точек (называемых вершинами) и отрезков, соединяющих некоторые из этих вершин. Соединяющие отрезки (ребра или дуги графа) могут быть прямолинейными или криволинейными. — Примеч. пер. **Цикл — линия на графе, не проходящая ни по какому ребру более одного раза и являющаяся замкнутой. — Примеч. пер. ***Связный граф (подграф) — граф, каждая вершина которого может быть соединена некоторой цепью с любой другой его вершиной. — Примеч. пер. **** Петля — ребро графа, оба конца которого совпадают. В нашем случае такая ситуация соответствует неподвижной точке, так как в ней h (P) —Р. Корень дерева — любая вершина, которую мы выбираем за начальную точку дерева. Прадерево — дерево с ориентацией связей, измененной на противоположную (т. е. с направлением от верхних ветвей к корню). Такое направление соответствует хронологии итераций алгоритмов МДС, когда мы постепенно приближаемся к стационарной точке последовательности unt т. е. к корню дерева. — Примеч. пер. 3* 67
щих в качестве мер сходства элемента из ? и представителя класса величины Dx ~ D4. Та бл ица 4.2 Характеристики алгоритмов Число решений Максимальное число итераций Среднее число итераций Использованные меры сходства Dt 6 11 5,1 Dt 3 9 4,4 Dz 7 8 4,4 8 8 4,4 В результате проведенного исследования можно констатировать: а) алгоритм, основанный на мере сходства D4, сходится при использовании в качестве начального любого из 56 448 представительств; б) алгоритм, основанный на мере сходства Dlf сходится медленнее, чем другие; в) алгоритм, основанный на мере сходства D2, приводит к единственному истинному решению * наиболее часто по сравнению с другими алгоритмами. Мы изучили более подробно результаты, полученные с помощью алгоритма, основанного на мере сходства D:i. В табл. 4.3 представлено распределение общего числа возможных начальных представительств по числу итераций я, необходимому для сходимости этого алгоритма B <; п ^ 8)**. В ней принято обозначение: a hn означает /г-кратное применение отображения А. Таблица 4.3 п card (Nn) card (Nn)-100% 8 2 card (Nn) 2 3051 5,41 % 3 13488 23,91 % 4 12208 21,64% 5 13407 23,77% 6 13210 23,26% 7 822 1,46% 8 304 0,05% *При варьировании начальных представительств, выбираемых из L1. — Примеч. пер. **Вне диапазона [2; 8] оказалось всего 48 (из 56 448) представительств, т. е. при использовании этих 48 представительств в качестве начальных представительств алгоритма число итераций, необходимых для сходимости, было либо равно единице, либо больше 8. — Примеч. пер. 68
4.3.2. Прадеревья с петлей в корне На рис. 4.1 представлены see 7 решений, полученных с помощью алгоритма, основанного на D^ (они обозначены Л, В, С, D, E, F, G), а на рис. 4.2 —4.4 изображены прадеревья решений Л, В и F. В каж- Рис. 4.1. Облако исходных точек и разбиение, полученное с помощью алгоритма, основанного на D3 U3 Ш Ш О ПодпрадереЗо й1 Рис. 4.2. Прадеревья, соответствующие решению А 69
Рис. 4.3. Прадеревья, соответствующие решению В Рис. 4.4. Прадеревья, соответствующие решению F дом прямоугольнике указано число таких разбиений Р, после отображения которых с помощью суперпозиции h = f (g (P)) мы получаем одно и то же новое разбиение (этому разбиению соответствует на рисунке соединенная с прямоугольником ребром ближайшая нижняя вершина дерева). 4.3.3. Гистограмма решений На рис. 4.5 представлены значения оптимизируемого критерия W для семи полученных решений, так же как относительные частоты появления каждого решения. Мы наблюдаем общую тенденцию, в соответствии с которой чем меньше достигнутое значение критерия, тем чаще мы «выходим» на решения *. *К сожалению, выбор авторами алгоритма для проведения более подробного анализа нельзя признать удачным. Мера сходства D3i а следовательно, и отвечающий ей оптимизируемый критерий W основаны на евклидовой метрике, которая в данном случае не отражает специфики геометрической конфигурации множества классифицируемых точек. Соответственно решение Л, наиболее удачное в смысле оптимизируемого критерия W (см. рис. 4.5), является в действительности, пожалуй, самым неудачным с точки зрения правильного разделения двух четко обозначившихся вытянутых скоплений точек Сг и С2 (см. 4.1.1). Напротив, самое правильное, по существу, решение F оказывается среди худших в смысле оптимизируемого критерия W. Гораздо интереснее было бы рассмотреть решения, полученные с помощью алгоритма, основанного на Dx: при подходящем выборе матрицы М (см. 4.2) решения, оптимизирующие критерий W, будут, по существу, наилучшими. — Примеч. пер. 70
50% Ш 30% 20% 10% Относительная частота появления решений с заданным значением . критерия W Е F 6 О W0 200 400 600 800 1000 1200 W(L, P) Рис. 4.5. Гистограмма распределения решений по величине оптимизируемого критерия 19 18 I 22 21 2G 3 2 25 2k 23 5 Ц 28 27 28 8 7 s 31 30 29 V 10 3 33 32 14 13 12 35 34 11 1S 15 37 36 40 3d 38 43 Ц7 41 47 4B 45 Рис. 4.6. Изображение облака исходных (классифицируемых) точек 4.4. ЗАКЛЮЧЕНИЕ Изучение этого искусственного примера позволило убедиться в том, что выбор меры сходства D и пространства представительств L играет в автоматической классификации ведущую роль. Это дало нам также общее представление о структуре множества получаемых решений. ЛИТЕРАТУРА 1. D а г с о s Р. A975) Contribution a la classification automatique. Application a des donnees medicales. These de Docteur-Ingenieur. Toulouse. 2. D i d а у Е. A972) Optimisation en classification automatique et reconnaissance des formes. Note scientifique IRIA. 3. D i day E. A972) Nouvelles methodes et nouveaux concepts en classification automatique et reconnaissance de formes. These de Doctorat es-Sciences. 71
Глава 5 • АВТОМАТИЧЕСКАЯ КЛАССИФИКАЦИЯ НЕПОЛНЫХ ДАННЫХ 5.1. ВВЕДЕНИЕ 5.1.1. Задача Метод анализа данных предполагает выполнение гипотезы о том, что каждый из изучаемых объектов описывается по всей совокупности анализируемых свойств переменных. На практике часто случается, что некоторые из переменных на тех или иных объектах не были (или не могут быть) зарегистрированы: индивид может отказаться отвечать на некоторые вопросы, может не оказаться необходимой для измерений экспериментальной базы, отдельные данные могут быть «стерты» или потеряны и т. д. В таких ситуациях при обработке данных используются различные паллиативы, не имеющие под собой теоретической базы. Чаще всего объекты, на которых отдельные переменные не наблюдаются, не принимаются в расчет вовсе. Эта процедура имеет два главных недостатка: сокращение (порой существенное) объема рассматриваемой выборки и возможность появления определенного смещения в наших статистических выводах (когда оставшаяся часть выборки уже не является случайной). Другой часто применяемый метод состоит в замене любого недостающего значения переменной средней величиной имеющихся наблюдений по рассматриваемой переменной. Это также приводит к смещению выводов. Конечно, подобные данные по своей природе являются неполными и нельзя надеяться на появление возможности анализировать их так же точно и строго, как полные данные. Тем не менее следует стремиться сделать как можно меньше ошибок при обработке неполных данных, на что и направлены усилия различных авторов, о которых мы здесь будем говорить. 5.1.2. Предшествующие работы В многочисленных статьях, посвященных этой теме, представлены в основном два подхода. Первый из них характеризуется тем, что авторы стремятся восстановить недостающие данные, не заботясь о том, какого рода обработке эти данные подвергнутся в дальнейшем. Методы, используемые для этой цели, различны. Для восстановления недостающего на объекте наблюдения некоторые из авторов [3], [8], [10] 72
используют регрессию переменной, по которой недостает наблюдения по одной или нескольким переменным полностью «обеспеченным» наблюдениями. Другие [5], [10] применяют для восстановления данных прогностическую модель, построенную на базе анализа главных компонент. Наконец, третьи [13] используют формулу восстановления данных, основанную на факторном анализе соответствий. При втором подходе авторы ставят задачу по-иному: зная, какую именно задачу нужно решить в результате анализа данных (например, провести анализ главных компонент или построить регрессию), они стараются произвести наилучшую оценку параметров анализируемых моделей по тем неполным данным, которыми располагают [1], [2], [4], [5], [9], [Ш, [121. Метод, представленный в этой главе, следует логике второго порядка. 5.1.3. Предлагаемый подход Как и в других методах анализа данных, в методе динамических сгущений предполагается наличие полных исходных данных. В этой главе будет показано, как МДС может «работать» при неполных количественных данных. Итак, пусть Е = {х1у х2, ..., хп) — множество классифицируемых объектов и F = {х1, х2, ..., х?) — совокупность переменных, описывающих «состояние» каждого из объектов xt. Наша цель — разделить множество Е на k непересекающихся классов (наилучшим, в смысле критерия W, образом), зная при этом, что по некоторым переменным отдельные объекты не были статистически обследованы. Можно предложить несколько подходов к решению сформулированной задачи. Прежде всего такой, который состоит в восстановлении тем или иным способом недостающих данных и в применении к укомплектованным таким образом данным метода динамических сгущений. Можно использовать также подход, при котором в ходе реализации МДС происходит включение фазы восстановления недостающих данных между фазой «переназначения» объектов по классам и фазой изменения представительства классов. Значение по недостающей переменной может быть восстановлено на объекте, например, с помощью ее аппроксимации соответствующей координатой центра тяжести класса, к которому относится этот объект. Наконец, можно применить подход, который не предусматривает восстановления недостающих данных, а автоматическая классификация производится непосредственно на базе имеющихся в наличии наблюдений. Именно такой подход описывается в настоящей главе. Чтобы точнее определить основные характеристики этого подхода, введем некоторые понятия и обозначения. 73
5.2. МЕТОДОЛОГИЯ ОБРАБОТКИ НЕДОСТАЮЩИХ ДАННЫХ 5.2.1. Оператор проектирования и подпространство, соответствующие неполно описанному объекту Будем предполагать, что каждый объект xt ? Е «снабжен» некоторым весом |ьц. Если не пропущено ни одного наблюдения, то каждый объект xt можно представить в форме вектора из Rp: х i • где X/ — значение /-й переменной на объекте i. Само собой разумеется, что переменные, не наблюдаемые ни на каком объекте, так же как объекты, на которых ни одна из переменных не была зарегистрирована, предварительно устраняются. Пусть на объекте xt ? Е зафиксированы значения только qt переменных; соответственно (р — qt) других переменных не были статистически обследованы на этом объекте. _ Если мы перенумеруем переменные, то вектор xt можно разложить на две части — Рис 5 j известную и неизвестную: к [известные, неизвестные. Неизвестная часть соответствует значениям, которые приняли бы р — — qi необследованных переменных, если бы они наблюдались. Будем действовать так, как будто мы знаем в отношении xt (элемента пространства R^O только его проекцию на векторное подпространство пространства Rp, изоморфное к пространству R^* (см. рис. 5.1). Каждому объекту xt ставим в соответствие оператор проектирования (или просто проектор) Аг: 74
Если перенумеровать исследуемые переменные указанным выше способом, то будем иметь О О векторное подпространство, изоморфное к пространству R?*; при несколько вольном словоупотреблении мы не будем в дальнейшем различать Im (At) и Rqi. Пусть далее Кег(Лг.) *= {w "О О u' up векторное подпространство, изоморфное к пространству RP ?*; в дальнейшем мы также не будем различать в обозначениях пространства Кег (Л г) и R^~^. Если переменные множества F переиндексированы таким образом, что переменные, по которым нет наблюдений на объекте Хи оказываются последними в ряду всех р рассматриваемых переменных, матрица проектора Аи которую мы идентифицируем с Аи будет иметь вид (РХР) где Ik — единичная матрица размерности k X k. Покажем на примере, какой вид принимает эта матрица, когда переменные не переиндексированы. Пример. Предположим р = 5, т. е. xt 6 R5 (i =1,2, ..., п), и в качестве наблюдения х% имеем 1 0 • 0 0 1 0 0 Я и т. е. л 'и 0 0 0 75
где * означает недостающие наблюдения. Тогда qt=3, а матрица соответствующего проектора будет иметь вид  О" О 1 1 ^о о_ Пусть и ? R5. Тогда А, «1=1 О / Замечание. Если наблюдение xt является полным, т. е. если на i-ы объекте зарегистрированы значения всех переменных, то Аг = /р, т. е. At задается матрицей, соответствующей эндоморфизму идентичности Rp. 5.2.2. Аппроксимация расстояний Полагаем, что расстояние на Rp задается квадратичной формой, определяемой некоторой симметричной положительно определенной матрицей М: d2 (иу v) = (и — vY М (и^- v), где (ut v) 6 Rp X Rp. 5.2.2.1. Псевдорасстояние от полного вектора до неполного вектора Пусть и 6 Rp и об xt? Rp известно, что Агхг ? R*7*. Мы хотели бы уметь вычислять d2 (и, хг). По определению имеем: d2 {и, xt) = {и — ХгУ М (и — xt). Эта величина невычисляема. Найдем ее аппроксимацию. Мы можем вычислить расстояние от и до d2 (щ AtXi) = (и — At Xi)' M (и — AtXi). Однако из рис. 5.2 видно, что более естественно было бы спроектировать вектор и в то же пространство, в котором находится Atxif т. е. в R^*, и затем вычислить расстояние между двумя проекциями векторов 76
и п xt в пространство R?*. Следовательно, мы аппроксимируем расстояние d2(u, xt) величиной d2 (Atuy At xt) = (и — xty At МАг(и — xt)y которую назовем псевдорасстоянием от полного вектора и до неполного вектора xt и обозначим через d2 (и, хг). Итак, d2 (и, xt) = {и — XiYAiMAt (и — Xi) = d2 (Atu, Агхг) р по определению. При использовании такой аппроксимации необходимо соблюдать некоторую осторожность. Прежде всего это — не расстояние в общепринятом смысле этого понятия. В самом деле, нетрудно убедиться, что, во-первых, из d (и, xt) = 0 не следует с необходимостью и = xt\ во-вторых, для Сможет не соблюдаться неравенство треугольника. Кроме того, в 5.2.2.3 мы увидим, что сравнение псевдорасстояний редко оказывается возможным. Пример. Пусть имеются (xiy и) 6 R5 X R5, такие, что -неизвестно, и = \ 3 I, Агхг = ш ¦ неизвестно, Предположим, что М = /5. Тогда d2 (хи и) = A-2J + B-2J + (З-ЗJ + D-3J + + E—ЗJ = 6. Мы же можем вычислить только d2 (хи и) = A-2J + B-2J + D - ЗJ = 2, т. е. всего лишь некоторую часть от^2 (xifu). Координаты и, соответствующие ненаблюденным на объекте переменным, не учитываются при вычислении^2 (и> хг). Замечание. В некоторых случаях выражение AiMAt можно упростить. В самом деле, каждый раз, когда М есть диагональная матрица, имеем потому что диагональные матрицы коммутативны. С другой стороны, At есть проектор и, следовательно, АгАг = Aiy откуда в конечном счете получаем для всякого / = 1, 2, ..., п - MAt - AtM 77
при условии, что М — диагональная матрица. Впрочем, можно показать, что это свойство справедливо и для некоторых недиагональных матриц специального типа. 5.2.2.2. Псевдорасстояние между неполными векторами Пусть мы имеем два не полностью обследованных объекта xt и xh, таких, что AtXi ? Rqi и Ahxh = R^. Мы не можем знать точно расстояние d2 (xt, xh) = (xt — xh)''M (xt — xh)j однако можно, зная AtXi и Ahxh, вычислить его аппроксимацию d (xit xh). Итак, AtXi — элемент пространства R?*, a Ahxh — элемент пространства R^. Следовательно, они являются несравнимыми. В то же время части векторов xt и xhi расположенные в общем векторном подпространстве R?* f| R^, являются сравнимыми. Эти части Агхг и Ahxh Рис-5*3 записываются: (AhAiXi — компонента вектора Агхг в пространстве R^* f| 1^^/^^ — компонента вектора A hxh в пространстве R?* П Две матрицы At и Ah, будучи обе диагональными, коммутируют. Следовательно, будем использовать следующую аппроксимацию: и (Xi, Xh) = уАгЛьХ^ AhAiXi) • JVi • (AiAfrXfr / 4; (xh — Xi). Однако далее мы увидим, что псевдорасстояние между неполными векторами уже не обладает никаким интересным свойством и, следовательно, непригодно к использованию. Пример. Пусть имеются два вектора из R5: '1\ ч- неизвестно, ч- неизвестно; ч- неизвестно, - неизвестно. Если М = /в, то d2 (xlf x2) = A-6J + B-7J + C-8J + D-9J + + E—10J, в то время как d (хг^х2) = C — 8J + E — 10) 2. При подсчете аппроксимации d во внимание принимаются только компоненты, статистически обследованные одновременно на обоих сравниваемых векторах. 78
5.2.2.3. Сравнимость псевдорасстояний Даже по данному нами определению псевдорасстояния не могут претендовать на то, чтобы задать реальное приближенное значение истинных расстояний, поскольку часть расстояния при этом не учитывается. Однако не стоит забывать о том, что знать точные значения расстояний часто бывает менее полезным, чем знать их относительные величины. Другими словами, нам чаще важно знать, что ближе к а — b или с, чем определить точные расстояния между а, Ъ и с. Это как раз тот тип сравнений, на котором построен метод динамических сгущений. Поэтому следует изучить сравнимость псевдорасстояний, которые мы только что ввели. Рассмотрим 5 видов сравнения псевдорасстояний. 1) В первую очередь мы интересуемся псевдорасстояниями между векторами пространства Rp и неполными объектами х%. Итак, пусть и 6R*\ a xt и xh— не полностью обследованные объекты, т. е. мы знаем только AiXi ? R^* и Ahxh ? R^. Можно ли сравнивать псевдорасстояние от и до xt с псевдорасстоянием от и до xh? d2 (и, xt) = d2 (Aiii, AtXi) = (и — XtYAiMAi (u—**)• d2 (a, xh) = d2 (Ahuy Ahxh) = (u — xh)'AhMAh (u — xh). Матрицы AtMAi и AhMAh, используемые для вычисления двух псевдорасстояний, различны. Следовательно, два псевдорасстояния несравнимы: чаще всего эти два выражения оперируют с различными подмножествами статистически обследованных переменных. В действительности подобного вида сравнения не имеют места при реализации метода динамических сгущений. 2) Напротив, для реализации МДС актуальна следующая задача. Пусть заданы (и, v) 6 RP X Rp и не полностью статистически обследованный объект, о котором известно только Агхг 6 R^- Ставится вопрос: к какому из векторов и или v более близок объект xt? В этом случае мы будем сравнивать d2 (а, хг) и d2 (vy xt): d2 (и, Xi) = (u- xt)'AtMAi (u Вычисление этих двух псевдорасстояний производится одним и тем же способом, следовательно, они сравнимы. Именно это свойство позволит нам реализовать метод динамических сгущений в условиях неполных данных. 3) Теперь перейдем к псевдорасстояниям между неполными векторами. Пусть имеются (хи xh, Xj) 6 Rp X Rp X Rp — три неполных вектора. Пусть Аь Ah и Лz — соответствующие им проекторы. Тогда d2 (xi9 xh) = (xt — xh)'AiAhMAhAi (xt — xh), d2 (xu xt) = (xt — XiYAtAiMAiAt (xt — хг). 79
Сразу же становится очевидным, что эти псевдорасстояния в общем случае несравнимы. 4) Затем рассмотрим следующий случай. Пусть (хи xh) ? Rp X X Rp — два неполных вектора с проекторами At и A h соответственно, .Пусть и 6 Rp- Ставится вопрос: вектор хг ближе к xh или к и? d2 (xt, xh) = (xt — xh)'AiAhMAhAi (xt — xh), d2 {xu u) = (u- XtYAt MAt (u - Xi). Эти две величины также оказываются несравнимыми. 5) Наконец, пусть {и, v) ? Rp x Rp и неполные вектор-наблюдения Xt и xh имеют проекторы соответственно At и Ah. Требуется сравнить расстояние между и и xt с расстоянием между v и xh: d2 (и, xt) = (и — хг)'АгМАг (и — Xi), d2 (v, xh) = (v — xh)rAhMAh (v — xh). Эти две величины сравнимы только в случае At = АЛ, т. е. только тогда, когда совпадают переменные, по которым не были статистически обследованы объекты Xi и xh. Общий вывод: рассматривая векторы и 6 Rp, v 6 RP и неполный вектор Xi, которому соответствует оператор Лг-, можно утверждать, что псевдорасстояния <12 (и, xt) nd2 (у, xt) являются сравнимыми. Все другие сравнения псевдорасстояний в общем случае не имеют смысла. 5.2.2.4. Надежность псевдорасстояний Сравнимость псевдорасстояний вида d2(u, xt) и d2 (v, xt), где и и v— полные, a xt — неполный векторы из Rp, не означает, однако, что эти сравнения являются точным отражением реальности. В самом деле, вполне возможно, что одновременно выполняются неравенства (d2 (xi9 и) > d2 (хи v), Ы2(хг1 u)<d2(Xi,v). Продемонстрируем такую возможность на следующем примере: ¦<- неизвестно 80
Предположим, что М = /5. Тогда имеем: d2 (xi9 v) = 20 Г ( " } С другой стороны, d2(xn v) - 16 j Следовательно, в действительности л:, ближе к v, чем к и, однако наши аппроксимации приводят к противоположному выводу. Тем не менее вполне допустимо принять такую аппроксимацию, поскольку реальные величины этих расстояний не могут быть вычислены, а если исходить лишь из того, что мы знаем о векторе xiy то он действительно оказывается более близким к иу чем к v. 5.2.3. Аппроксимация инерции 5.2.3.1. Напоминание понятия инерции Рассмотрим облако из п точек (х15 х2, ...., хп) пространства Rp, причем каждой точке хг приписан некоторый вес \it (i = 1, 2, ..., п). Инерцией множества (хи х2,..., хп) вокруг точки а 6 RP называется величина / (а) - ? М2 (хи а) = j^\n (xi —аУ-М- (xt—a). i=\ /==1 Вклад каждой точки в эту инерцию есть \ird2 (xi, a) = \it (xt — а)'-М- {хь — а). 5.2.3.2. Псевдоинерция Определение инерции / (а) предполагает введение расстояния d2 (xt, a) (xt — a)r • М -{хь — а), которое мы аппроксимируем с помощью & (х[, а) = (хг — a)' AtMAi (xt — a), где At — проектор объекта (вектора) xt. Следовательно, логично (если принять эту аппроксимацию расстояний) использовать как аппроксимацию инерции относительно точки а величину 7 (а) = 2 Vid*(Xb a)= 2 \*ч(х1-а)'Аг МАг{хг- а). Это, в частности, означает, что в аппроксимации / (а) учитывается только часть истинного значения инерции / (а). Аппроксимацию / (а) будем называть псевдоинерцией заданного множества точек {х1,..., хп) относительно точки а. Вклад каждого объекта в эту псевдоинерцию есть [Ltd2 (xt, a) = (ьц (xt — a)'AiMAi (х, — а). 81
Замечание. Расстояние d2 (x,-, а) можно выразить в зависимости от d2 (х,, а): d*(x,,a) (х, - а)' М (х, - а) =¦¦ -- (х, - aI \А, + AР - А,)] М \At + (/,, - А,)] (х,-а) - + 2 (xt - a)'At М (Ip - Af)(Xl -a, + (x, - a)' (lp - -A,) M (Ip-A,) (x, ~a)=d (xif a) + A (d). Невозможно вычислить остаток A (d) ¦-- d* (xt, a) — dl (xt, а), состоящий из двух членов, так как он зависит от вектора (I},—At) {х( — а), а нам доступно только Л, (хг — а). Точно так же имеем / (а) =,: Г (а) + А (/). Эта псевдоинерция не претендует на то, чтобы быть приближенной величиной / (а). Она составляет только исчисляемую ее часть. Однако она сохраняет некоторые свойства инерции, как это будет показано далее. 5.3. СВОЙСТВА ПСЕВДОИНЕРЦИИ 5.3.1. Напоминание некоторых понятий Напомним некоторые известные результаты и понятия перед тем, как обобщать их на случай неполных данных. 1) Пусть имеется облако из п точек (х1у х2,..., хп) пространства Rp, снабженных весами соответственно \ilt fx2, ..., \in, и пусть требуется найти такую точку из Rp, инерция относительно которой заданного облака точек была бы минимальной. Доказано, что эта задача имеет единственное решение G, которое принято называть центром тяжести облака. Его аналитическое выражение Q .5" и, следовательно, всегда справедливо неравенство / (О< / (а), Уа 6 RP- 2) Предполагаем, что мы имеем разбиение п объектов облака на k классов Съ С2, ..., Ch. Пусть (Gv G2,.... Gh) — центры тяжести этих k классов. По определению имеем 2 Pi xi 2j Pi 82
Эти центры образуют облако из k новых объектов, которым соответствуют веса Тогда центр тяжести облака {х,-}.^^—- с весами {fij/^p^ является также центром тяжести облака {Gy}/= х—, имеющего веса {т7}^г-, т. е. 1^ ^1 «*. у 1 3) Отправляясь от того же разбиения множества {**}/ву-^ на классы С1у С2,..., Cfc, можно разложить инерцию / (G) следующим образом: ПО) = + 2 / > 0). Инерция облака / (G) вокруг центра тяжести также называется полной инерцией облака и обозначается Т. k k Величина ^rrijd2 (Gjy G) есть инерция облака центров тяжести {G7}. Ее называют межклассовой инерцией и обозначают В. Каждое выражение ^{itd2 (xi9 Gj) представляет инерцию точек, со- е с е соо ставляющих класс Су, вокруг центра тяжести этого класса. Сумма этих k инерции называется внутриклассовой инерцией и обозначается W. Уравнение разложения инерции записывается: T=W + В, где i--=\ 1 = 2 ntj(P(GhG). В этом выражении Г— характеристическая константа облака {^}г:==1—, независящая от разбиения^, С2, ..., Cft). Напротив, величины В и W связаны с этим разбиением: В есть показатель взаимного удаления k классов друг от друга; W— показатель концентрации (разброса) элементов этих классов вокруг их центров тяжести. 83
5.3.2. Минимизация псевдоинерции Пусть имеется облако из п объектов (хъ..., хп)\ полных или неполных, с весами (f^,..., \лп). Каждому объекту^ соответствует проектор At (см. 5.2.1). Отыщем точку G, вокруг которой псевдоинерция минимальна. Пусть а 6 Rp. По определению псевдоинерция облака вокруг а запишется: . • . 7 (а) = 2 |х» 2Цхи а) = 2 1*« (**-fl)' Ai MA> (xi~a)- 5.3.2.1. Необходимое условие Искомая точка G есть точка минимума функции 7 (а) и, следовательно, она должна удовлетворять уравнению да где 0 обозначает нулевой вектор Rp. Но Т(а)^^ \it x[ At MAt ** - 2 2 Hi e' ^ MAt xt откуда i^L =-2 2|1,^Ш,х, + 2 5! |i{ At MA,a = П '=2 ? li^^ Таким образом, искомая точка должна удовлетворять уравнению Во всех случаях, когда матрица ^piAiMAi обратима, точка, которая минимизирует псевдоинерцию, обязательно должна иметь вид о = B Hi л, мл,)"* f 2 f 2 Следовательно, нам нужно исследовать обратимость матрицы м y^iAiMAt и одновременно проверить, является ли определенная таким образом точка минимумом, а не максимумом псевдоинерции. 84
5.3.2.2. Природа экстремума Для того чтобы точка G, определяемая уравнением A), давала минимум функции / (а), нужно, чтобы гессиан выражения / (а), т. е. матрица д21 (а)/да2, была положительно-определенной. Но /=1 Важно, следовательно, определить, при каком условии матрица п 2 \iiAiMAi будет положительно-определенной. Теорема. Если каждая из переменных х1, х2,..., xp наблюдается, по крайней мере, на одном объекте облака {**},• _пг» то матРиДа 2 \iiAiMAf является положительно-определенной. Для доказательства этой теоремы представим проектор Af в развернутом виде: fa} О \° где [а\ = 1, если х\ наблюдается; \al = 0, если х\ не наблюдается («утеряно»). Тогда гипотезу «каждая переменная наблюдается, по крайней мере, на одном объекте облака» можно записать в виде «для всякого / 6 {1, 2, ..., р} найдется / ? {1, 2, ..., л}, такое, что а[ фО». Следовательно, нам необходимо установить, что при условии справедливости этой гипотезы мы имеем для любого и ? Rp: 1) и' 2) из и ' Bi\*>iAiMAi) и — 0 следует, что и = 0. /= 1 Проверим последовательно эти два момента. 1) Для любого и 6 RP '?. Pi At MAt ) и= V \itu AiMAtU^ у и^ЦЛ^Н^. Но из того, что для любого i = 1,2, ..., м |х,- > 0 и ||Лг-м||& ^ 0, сле- п дует, что S^ilHi^H м ^ 0. 85
2) Легко показать, что равенство и BИчЛгМЛг) и = 0 имеет место 1=1 тогда и только тогда, когда |И^||л* — 0 при всех i = 1, 2, ..., п. Итак, нам остается доказать: из того, что для любого / = 1, р найдется / ? {1, 2, ..., /г}, такое, что а\ фО, с необходимостью следует, что если при любом t: —- 1,2, ..., /г величины Л,*г = 0, то и = 0. Далее, в ходе всего доказательства мы полагаем, что i ? {1, 2, ..., п} и / = A, 2, ..., /?}. Предположим противоположное нашему утверждению, т. е. что существует и Ф0 (и 6 Rp), такое, что Аги = 0 при всех *" = 1, 2, ..., п, и покажем, что в этом случае найдется такое /, что а\ =0 при всех i —¦ 1, ..., п. Чтобы это сделать, запишем и в развернутом виде: тогда откуда следует, что если для всех (' — 1, 2, ..., п Atu = 0, то а{ uf= 0 при всех i и /. С другой стороны, из того, что и ф0у вытекает, что найдется /, такое, что и1' фб. Можно, следовательно, утверждать, что найдется /, такое, что W ФОУ но при этом alw ¦=--- Опри всех/ =- 1,2,..., п. И значит, найдется /, такое, что а*. =¦--= 0 при всех i =1, 2,..., п. Это завершает доказательство теоремы. Следствие. Мы установили, что если каждая переменная наблюдается, по крайней мере, на одном из объектов облака, то матрица ^P является положительно-определенной, следовательно, она i = 1 обратима, а точка G из Rp, удовлетворяющая уравнению A) из 5.3.2.1, дает минимум псевдоинерции облака. Замечание. Если рассматриваем полное облако объектов, то гипотеза, по которой каждая переменная должна наблюдаться, по крайней мере, один раз, будет всегда справедлива, поскольку в 5.2.1 оговаривалось, что мы устранили те переменные, которые не наблюдались ни на одном из объектов анализируемого облака. Если же мы анализируем некоторое подмножество полного облака и стараемся вычислить точку из R^, которая минимизирует псевдоинерцию этого подмножества, то условие, обеспечивающее положительную определенность матрицы i, не обязательно будет иметь место. 86
5.3.2.3. Псевдоцентр тяжести Если каждая переменная наблюдается, по крайней мере, один раз, то точка G из Rp, которая минимизирует псевдоинерцию, будет определяться выражением G= VLtMAlxl). = 1 Мы назовем ее псевдоцентром тяжести облака. По построению 7(G)<7 (a), Vfl € Rp. Замечание. Если М — диагональная матрица, то в соответствии с замечанием из 5.2.2.1 t — MAt - AtM для любого i --= 1, 2, ..., п. В этом случае выражение для G упрощается: 3= f 2 Hi МЛ,)"' ( ? Hi M^i дсЛ = (м- I 2 I*i 2 (*«лi X x (м B |it a , x, j ] = С 2 Перепишем это соотноп1ение покоординатно. Пусть Gj есть /-я координата G. Легко подсчитать, что О 2 »*« flf 2 Vt at x'i 2 Vi aPt x? С другой стороны, имеем i= 1 Откуда в конечном счете 2 ^ai 87
Числитель этой дроби есть взвешенная сумма всех имеющихся наблюдений по переменной х*\ а знаменатель — сумма всех весов \iiy соответствующих наблюденным (по переменной xi) объектам. Пример. Предположим, что облако образовано тремя объектами хх, х2, х-, с весами \xt = 1, ji2 --- 2 и jli3 ^ 3, где Пусть М = /.,. В качестве координат центра тяжести этого облака имеем: Q _._ Ml *1+^2*2 + ^3*3 = _Ц_ __ 2 33 Н'Н-^З + И'З 6 Q „ . ^I^I+^^I+MS^S „ _^fL = . 3 33 ^1 + ^2 + ^8 6 26 4 33 q 4 33 M-i "I" М-я -Ь М-з 6 Теперь предположим, что нам неизвестны величины а:?, Х2 и xj. Таким образом, будем иметь /1 0 0\ /10 0\ Лх I 0 1 0 J, Л2 = ( 0 0 0 | и Л3 - \0 0 0/ \0 0 1/ В этом случае мы можем вычислить только псевдоцентр тяжести облака с координатами Gx =-= ^ xi + ^ -^2 ^ 1 66, Н + М г_. 350, ^ 4,60. 5.3.3. Отношение между псевдоцентрами тяжести ' Предположим, что исследуемое облако объектов разделено на k классов. Обозначим через С/ (/ = 1,2,..., k) множество индексов тех объектов, которые отнесены к /-му классу. Будем предполагать, что в каждом из этих классов каждая переменная измерена, по крайней мере, один раз. Тогда из 5.3.2.3 следует, что мы можем вычислить псевдоцентр тяжести каждого из этих классов. Пусть G], ..., Gk—это псевдоцентры тяжести. Тогда по определению i Ц liiiY!^ Vit Z=l, ..., k, 88
что можно записать в виде Псевдоцентр тяжести полного облака точек представляется в виде /=1 =i ) 8,1 / J Таким образом, G выражается как центр тяжести групповых центров тяжести Gi (I — 1, 2, ..., k) со специально предписанным матричным взвешиванием. 5.3.4. Разложение псевдоинерции Как и ранее, предполагаем, что данные так разбиты на k классов С1э С2,..., Cfe, что удовлетворяется достаточное условие вычислимости псевдоцентров тяжести (см. 5.3.2.3). Пусть Gly G2,..., Gk — псевдоцентры тяжести классов. Тогда полная псевдоинерция запишется в виде i=\ i=\ -2 2 &((*-$)+(G(-Gj)' 1= 1 *<=CZ = У, S M'i^i —Gi)' Л —GJ' Л^ МЛ^ (Gi—G) + 2 Величина Г разложена на три члена, которые мы последовательно рассмотрим. 1) Прежде всего, в выражении мы узнаём псевдоинерцию класса Сг относительно его псевдоцентра тяжести. Следовательно, величина 8 89
играет ту же роль, что и внутриклассовая инерция в случае, когда векторы являются полными. Мы назовем эту величину внутриклассовой псевдоинерцией и обозначим ее через W. Следовательно, по определению 2 1=1 2) С другой стороны, имеем 2 Shi /=1 f Г 2 L 'ее, Однако выражение в квадратных скобках равно нулю по определению псевдоцентра тяжести класса Сг (см. 5.3.2.3). 3) Наконец, последний член запишется так: 2 ? MG-G;)'Лг МЛ (G-G,) = 1 = 1 = 21 F-$)' 17 |^m^ Но в случае полных данных межклассовая инерция выражалась в виде (см. 5.3.1) = v mrd*(GhG)= У (G—Gi)'l 2>* ^\ (G /1 ;i i«€C / поскольку т, = 2^г- Сравнив правые части последних двух выраже- ний, мы видим, что величина 2 (^—Gt)f B l^iAiMAt) (G — Gj) играет ту же роль, что и межклассовая инерция. Назовем это выражение межклассовой псевдоинерцией и обозначим через В. Итак, В = 2 (G -§,)'/]>>,./ 1=1 [ i?Cl Теперь мы в состоянии записать полную псевдоинерцию в виде T=W+ В. Как и в случае полных данных, Т есть постоянная (т. е. не зависящая от способа разбиения) характеристика облака неполных объектов. 90
g то же время W и В зависят от способа разбиения множества {*Ьв1 на k классов. В частности, W есть показатель концентрации объектов классов вокруг их псевдоцентров тяжести, а В— показатель взаимной удаленности k классов друг от друга. Замечание. Величина показателя W, которую мы только что определили, должна интерпретироваться с осторожностью, так как она является только аппроксимацией истинного значения W. В частности, легко показать, что W = 0 не означает, что все данные сливаются с центром тяжести класса, к которому они принадлежат. 5.3.5. Сравнимость внутриклассовых псевдоинерций Величина W выражается как сумма взвешенных псевдорасстояний. Однако псевдорасстояния не обязательно сравнимы между собой (см. 5.2.2.3). Вполне уместно задать вопрос, будут ли сравнимы между собой две внутриклассовые псевдоинерции, соответствующие двум различным разбиениям анализируемого облака неполных объектов. Пусть Cj, C2,..., Ck — классы первого разбиения, a Gx, G2, ..., Gh — соответствующие псевдоцентры тяжести, которые предполагаются вычислимыми. Пусть Cf, C5, ..., С% — классы второго разбиения, a Gf, 82, ..., G% — соответствующие псевдоцентры тяжести, которые также предполагаются вычислимыми. Тогда имеем В каждом из этих выражений каждый индивид xt появляется один-единственный раз. Ему соответствуют следующие члены: \iid2 (xiy Gt) и \itd2 (xt, G*). Однако мы видим (см. 5.2.2.3), что имеем право сравнивать расстояния от одного неполного вектора до двух полных векторов из Rp. Следовательно, сравнение Wx и W2 имеет смысл. 5.4. АЛГОРИТМ 5.4.1. Напоминание сущности метода центра тяжести Так называемый вариант «центра тяжести» метода динамических сгущений можно кратко объяснить следующим образом. Его цель— добиться такого разбиения облака на k классов, при котором внутриклассовая инерция была бы минимальной. Чтобы это сделать, на базе некоторого начального разбиения Р<°> строится последовательность (Я<';>) разбиений, где каждое новое разбиение получают путем отнесе- 91
ния каждой точки к классу с наименее удаленным от нее центром тяжести. Эта процедура итерируется до. сходимости критерия, т. е. последовательности ип = W (P{n\ L<">). Реализация МДС на неполных количественных данных происходит по той же схеме. 5.4.2. Пространство представительств Как и в случае варианта центра тяжести МДС на полных данных, пространством представительств здесь является пространство Rp. В самом деле, именно псевдоцентр тяжести каждого класса будет наилучшим образом «представлять» свой класс во всех случаях, когда этот центр будет вычислимым. Однако было уже показано, что по своей конструкции это есть элемент из Rp, откуда получаем L = Rp. Чтобы окончательно снабдить Е структурой представительств, нам остается задать отображение D пространства Е X L на неотрицательную числовую полуось R+ (см. 1.2.2), которое будет служить мерой сходства между элементами пространств ?и L. В интересующем нас случае это отображение определяется так: D (xiy a) = d2 (xi9 a) = (xt — а)' АгМАг(хг — a), i = 1,2,... п. Мы знаем, что d2 (хи а) ^ 0. Следовательно, D (хи а) есть элемент пространства R+. С другой стороны, оправдывается название «мера сходства», поскольку мы видели, что речь идет об аппроксимации квадрата евклидова расстояния между xt и а. 5.4.3. Критерий . Цель метода — найти разбиение Е на k классов, которое наилучшим (в определенном смысле) образом разделяет классы. Мы видели (см. 5.3.4), что данному разбиению можно поставить в соответствие величину В—межклассовую псевдоинерцию разбиения, которая является показателем взаимной удаленности классов друг от друга, а также величину W — внутриклассовую псевдоинерцию разбиения, которая есть показатель концентрации элементов одного класса вокруг своего псевдоцентра тяжести. Вполне естественно задаться целью отыскать такое разбиение на k классов, которое минимизирует внутриклассовую псевдоинерцию W и максимизирует межклассовую псевдоинерцию Б. Это возможно, так как в 5.3.4 было показано, что T=W + В, где Т — полная псевдоинерция анализируемого облака, т. е. независимая от разбиения константа. Следовательно, минимизация W эквивалентна максимизации В. В дальнейшем условимся искать разбиение яг k классов, минимизирующее внутриклассовую псевдоинерцию W. Договорившись об этом, 92
определим критерий W более точно. Чтобы вычислить W, необходимо иметь в наличии разбиение множества Е на k классов, т. е. иметь один элемент пространства Pk (которое определяет нам множество псевдоцентров тяжести Lft) и один элемент пространства Lft = LX LX... XL (k раз). Итак, можно рассматривать W как вполне определенное отображение: W: PfeXLfc-+ R+, т. е. (Р, L)-+W(P, L) = | ^D{xu G,), 1 И? где (Сх, С2,..., Ch) — k классов, определенных разбиением Р, (Gb G2* • •> Gfe) — псевдоцентры тяжести этих классов, a D—мера сходства, определенная в 5.4.2. Наконец, напомним, что в соответствии с 5>3.5 различные значения W сопоставимы между собой и могут служить оценкой качества разбиения. 5.4.4. Функция представительства Функция представительства g определяется как отображение пространства разбиений Pk в пространство представительств Lfe. Другими словами, функция представительства g — это функция, которая каждому классу разбиения ставит в соответствие свой псевдоцентр тяжести. Однако возникают сложности в связи с тем, что эти псевдоцентры тяжести не всегда вычислимы, т. е. некоторым разбиениям мы не сможем поставить в соответствие псевдоцентры тяжести, и метод нельзя реализовать; в этом случае алгоритм МДС останавливается. В 5.5 мы увидим, что это происходит очень редко. Во всех остальных случаях мы сможем, и притом единственным образом, с любыми k частями множества Е ассоциировать представителей этих частей. 5.4.5. Функция назначения Функция назначения / выражается так же, как при большинстве методов типа МДС, т.е. «назначает» элемент xt в класс Сг тогда и только тогда, когда D (xu Gt) < D (xi9 Grn) при т= 1,..., k\ D(xuQt) = D(xu Gm)npn m= Z+lf...,fc. Подобное задание отображения / определяет классы Сг единственным образом. Напомним, что в силу 5.2.2.3 все псевдорасстояния, которые здесь сравниваются, сравнимы. 93
5.4.6. Сходимость Сходимость проявляется обычным для алгоритмов МДС образом и следует из того, что каждое новое назначение и каждое новое представительство (получаемые в процессе итераций) уменьшают величину критерия W. Очевидно, однако, что в случае, когда в ходе работы алгоритма псевдоцентры тяжести оказываются невычислимыми, сходимости нет, поскольку происходит вынужденная остановка. Так же как при обычном МДС, достигнутый оптимум есть локальный оптимум, и он зависит от начального разбиения. 5.5. РЕЗУЛЬТАТЫ Мы подвергли анализу данные Р. Фишера, которые приведены в [15] 5.5.1. Описание исходных данных Исходные данные образованы в результате измерения параметров на трех разновидностях цветов. Первой разновидности (ирис selosa) соответствуют объекты с номерами 1 ~ 50. Второй (ирис versicolor) соответствуют объекты с номерами 51 ~ 100. Третьей (ирис virginica) соответствуют объекты с номерами 101 ~ 150. Измеренные на цветах параметры: длина и ширина чашелистиков, длина и ширина лепестков. Эти данные интересно подвергнуть обработке с помощью МДС, поскольку априорно известна идеальная классификация на три класса, что позволяет оценить качество классификации, которую мы получим с помощью этого метода, путем ее сравнения с идеальной. Для этого достаточно вычислить процент неправильно расклассифицированных объектов. 5.5.2. Реализованное моделирование Вначале мы применили к этим данным вариант центра тяжести МДС. Оказалось, что класс 1 прекрасно отделяется от классов 2 и 3, разделение которых между собой не столь отчетливо в силу того, что ирис virginica имеет некоторую тенденцию «назначаться» в один класс с ирисом versicolor. Затем мы изъяли из полной выборки исходных данных некоторое число наблюдений, случайно извлекая их из шестисот A50x4) имеющихся чисел. К оставшимся неполным данным был применен алгоритм, который мы только что описали. Все представленные здесь результаты имеют своей отправной точкой одно и то же начальное (случайное) разбиение Р<°>. Что касается случайной выборки изъятых («утерянных») наблюдений, то она реализована в двух вариантах. В первом варианте случайным образом было изъято 120 наблюдений B0% общего числа). Во втором варианте к этим 120 «утерянным» наблюдениям было добавлено еще 120 так же слу- 94
чайно извлеченных чисел, так что общее число недостающих данных составило 240 чисел D0% общего числа). Подчеркнем, что среди этих 240 «стертых» наблюдений первые 120 наблюдений как раз те самые, которых недоставало в первом варианте расчетов. При такой схеме возникает возможность сравнить полученные результаты, а именно результаты, достигнутые с помощью МДС в первом варианте (при 120 «стертых» наблюдениях), с результатами, достигнутыми во втором варианте B40 «стертых» наблюдений). 5.5.3. Процент «утерянных» данных Речь идет об «утере» данных. В действительности мы не можем знать заранее процента «утерянных» данных. Но мы можем «проигрывать» различные варианты с помощью моделирования. Предположим, например, что программа изымает 72% имеющихся наблюдений. В таком случае будет недоставать 72x600/100 = 432 наблюдений, и тогда возможна ситуация, при которой все 4 координаты, соответствующие одному и тому же объекту, окажутся среди этих «стертых» наблюдений. Так что нам следует изъять подобные объекты перед «запуском» алгоритма. В результате такой операции был полностью изъят, например, 41 объект, так что классификации подверглись бы только 150—41 = 109 оставшихся объектов. Таким образом, среди 432 стертых наблюдений 4X41 = 164 относятся к объектам, которые мы не классифицируем. В действительности количество «стертых» данных (на оставшихся 109 объектах) равно 432—164 = 268. Если эти объекты были бы полностью статистически обследованными, то мы имели бы 4 X109 = 436 наблюдений. Так что доля «утерянных» данных (по объектам, сохраненным для дальнейшего анализа) равна 268/436=0,63. Эта величина определяет скорректированный процент потерь, в то время как тот же показатель, подсчитанный до изъятия необследованных объектов G2% в нашем примере), назовем затребованным процентом потерь. Заметим, что уменьшение количества объектов, подвергаемых дальнейшему анализу, побуждает нас использовать в качестве характеристики метода процент неправильно расклассифицированных объектов, а не их количество, что обеспечивает возможность сопоставимости результатов. В частности, этот процент определяется отношением количества неправильно расклассифицированных объектов к количеству анализируемых объектов. В табл. 5.1 представлены взаимосвязанные изменения затребованного и скорректированного процента потерь в наблюдениях, процента неправильно расклассифицированных объектов и числа объектов, оставленных для дальнейшего анализа после изъятия необследованных. 5.5.4. Взвешивание классифицируемых данных и процент неправильно расклассифицированных объектов Сравним результаты, используя две системы взвешивания исходных данных: в первой — все объекты имеют один и тот же вес, во второй — принята следующая система приписывания весов. Пусть xt 6 Е. Если 95
Процент неправильно расклассифицированных данных . 30 20 из р координат вектора xt мы знаем только qf координат, то ему придается вес nt = qtlp. Эта система взвешивания имеет следующее преимущество: объекту приписывается вес, пропорциональный тому объему информации, который имеется в наличии по анализируемым свойствам. Таким образом, все наши расчеты были проведены первый раз с равными весами, а второй раз — с весами nt. На рис. 5.4 показана зависимость процента неправильно расклассифицированных объектов от скорректированного процента потерь в наблюдениях для обоих случаев. В табл. 5.1 представлены значения, на основании которых составлен график на рис. 5.4. Из графика видно, что при скорректированном проценте потерь, меньшем 55, результаты, полученные для двух систем взвешивания, мало отличаются друг от друга, хотя сходимость алгоритма гораздо быстрее, если использовать веса nt. За пределами 55% «утерянных» данных веса nt позволяют получить результаты, которые существенно лучше. В частности, когда алгоритм используется при равных весах, классы 2 и 3 стремятся слиться, откуда происходит резкое возрастание процента неправильно расклассифицированных объектов. Напротив, эти классы остаются относительно- хорошо разделенными, когда используются веса я,. И здесь опять мы были свидетелями сходимости, намного более быстрой в случае использования весов пг. Наконец, не следует забывать, что когда мы рассматриваем эти результаты на полных данных, МДС приводит к 9,33% плохо расклассифицированных объектов. 10 10 20 30 АО 50 ВО С нор рек тиробанный про цен / утерянных Рис. 5.4 70 '/ft С/' \Л ' ' Г-* ' данных 5.5.5. Возможный дефект алгоритма В 5.4.4 было показано, что в случае, когда не хватает одной и той же переменной на всех объектах одного класса, мы не можем вычислить представителя этого класса, и алгоритм останавливается. На практике 96
Таблица 5.1 Процент затребованный 0 9 18 25 32 38 43 49 54 59 63 66 69 72 75 76 78 * потерь скорректированный 0 9 18 25 31 36 41 44 49 53 55 57 59 62 64 65 67 Процент неправильно расклассифицированных объектов 9,33 10,67 10,67 12,67 12,16 12,33 12,81 12,32 11,03 15,3 16,34 15,13 41,59 24,77 47,12 45,1 38,78 9,33 11,33 10 12,67 13,51 12,33 12,5 11,6 11,0 13,64 15,92 15,97 17,7 17,51 18,27 39,22 31,63 Число объектов, оставленных для анализа 150 150 150 150 148 146 144 138 136 132 124 119 113 109 104 102 98 Зак 303 97
Таблица 5.2 Полные данные: 14/150 -9,33% неправильно расклассифицированных объектов Класс 1: 1, 2, 3, 4,..., 50 Класс 2: 51, 52, 54,..., 100, 102, 107, 114, 115, 120, 124, 127, 128, 134, 135, 143, 147, 150 Класс 3: 101, 103,..., 106, 108,..., 113, 116,..., 119, 121, 122, 123, 125, 126, 129,..., 133, 136,..., 142, 144, 145, 146, 148, 149 Неполные данные: 19/109=17,5% неправильно расклассифицированных объектов Класс 1: 1, 2, 3, 5, 6, 7, 10, 11, 12, 13, 15, 16, 17, 19, 20, 24, 25, 27, 28, 29, 30, 32, 34, 35, 36, 39, 40, 42, 44, 45, 47, 48 Класс 2: 37, 55, 56, 58, 61, 63, 65. 68, 69, 70, 74, 77, 80, 81, 82, 85, 87, 88, 89, 90, 91, 94, 95, 97, 99, 100 107, 114, 122, 150 Класс 3: 50, 51, 52, 59, 62, 64, 71, 72, 73, 76, 86, 92, 96, 98, 101, 102, 103, 104, 106, 108, 110, 111, 112, 113, 117, 118, 119, 120, 121, 123, 124, 125, 126, 128, 130, 131, 133, 137, 138, 139, 140, 141, 142, 144, 145, 148, 149 «Утерянные» объекты: 4, 8, 9, 14, 18, 21, 22, 23, 26, 31, 33, 38, 41, 43, 46, 49, 53, 54, 57, 60, 66, 67, 75, 78, 79, 83, 84, 93, 105, 109, 115, 116, 127, 129, 132, 134, 135, 136, 143, 146, 147 Скорректированный процент потерь =^62. для тех вариантов счета, которые здесь были представлены, это происходит только тогда, когда затребованный процент потерь в исходных данных достигает 80. При этом скорректированный процент потерь составляет 67, а количество анализируемых объектов уменьшается до 88. 5.6. ЗАКЛЮЧЕНИЕ Построенный нами вариант алгоритма МДС в большинстве случаев используется при классификации неполных количественных данных без их восстановления, а лишь на базе имеющейся информации. Конечно, алгоритм не претендует на то, чтобы быть универсальным средством в случае неполных данных, с одной стороны, потому, что он может оказаться с дефектом (неожиданная остановка алгоритма), а с другой — потому, что качество классификации падает по мере возрастания количества недостающих данных. Классификационный анализ оставшихся данных показывает тем не менее, что объект оказывается среди плохо расклассифицированных объектов чаще всего потому, что его координаты, обладающие наиболь- 98
шей дискриминирующей способностью, являются утерянными («стертыми»); если же судить по оставшимся в целости координатам, то такие объекты кажутся более близкими к классу, к которому они были приписаны в ходе алгоритма, чем к классу, в котором они должны были бы находиться в действительности. ЛИТЕРАТУРА 1. A f i f i A., E 1 ashof f R. M. A966) Missing observations in Multivariate Statistics I — Review of the Litterature. Journal of the American Statistical Association, 61, p. 595—604. A f i f i A., E 1 a s h о f f R. M. A967) Missing observation in Multivariate Statistics II — Point Estimation in Simple Linear Regression. Journal of the American Statistical Association, 62, p. 10—29. Afi fi A., Elashoff R. M. A969) Missing observations in Multivariate Statistics III — Large Sample Analysis of Simple Linear Regression. Journal of the American Statistical Association, 64, p. 337—350. A f i f i A., Elashoff R. M. A969) Missing observation in Multivariate Statistics IV — A Note on Simple Linear Regression Journal of the American Statistical Association, 64, p. 359—365. 2. Anderson P. O. A975) Stepwise Regression with Missing Values. Proceedings of the Statistical Computing Section of the American Statistical Asso- siation, p. 78—80. 3. BuckS. F. A960) A Method of Estimation of Missing Values in Multivariate Data Suitable for Use with an Electronic Computer. Journal of the Royal Statistical Society, Series B, 22, p. 302—307. 4. С h r i s t о f f e г s s о n A. The One-Component Model with Incomplete Data. Dissertation for the Degree of Doctor of Philosophy, Faculty of Social Sciences of the University of Uppsala. 5. D e а г R. I". A959) A Principal-Component Missing Data Method for Multiple Regression Models. SP-86 System Development Corporation. Santa Monica, California. 6. D i d а у E., Ok Y., J а с о t t e t M., T о m a s s о n e R. A976) Lissage typologique. Rapport de recherche, № 164, IRIA. 7. F e v г e P. Ph. A976) Traitement des donnees incompletes. Etude bibliogra- phique. Journees de l'AFCET sur les donnees manquantes. 8. FraneJ.W. A975) A New BMDP Program for the Description and Estimation of Missing data. Proceedings of the Statistical Computing Section of the American Statistical Association, p. 110—113. 9. F r a n e J. W. A976) Some Simple Procedures of Handling Missing Data in Multivariate Analysis. Psychometrika, 41, p. 409—415. 10. Gleason Т. С, StaelinR. A975) A Proposal for Handling Missing Data. Psychometrika, 40, p. 229—252. 11. H a i t о v s k у Y. A968) Missing Data in Regression Analysis. Journal of the Royal Statistical Society, Series B, 30, p. 67—82. 12. L а с о u r 1 у N. A974) Problemes Statistiques poses par le depouillement d'enquetes alimentaires. These de Docteur de 3eme cycle. Faculte des Sciences de Paris, p. 223—231. 13. Nor a—С hoyteauC. Une methode de reconstitution et d'analyse de donnees incompletes. These pesentee a l'Universite Paris VI pour obtenir le grade de Docteur es Sciences. 14. F e v r e P. Ph. A980) Nouvelles methodes de traitement des donnees quanti- tatives incompletes. These de doctorat de 3eme cycle. Universite Paris IX Dau- phine. 15. С h e n С. Н. A973) Statistical Pattern Recognition. Hayden Book Company, Incl. New Jersey. 4* 99
Глава 6 • ФАКТОРНЫЙ ТИПОЛОГИЧЕСКИЙ АНАЛИЗ 6.1. ВВЕДЕНИЕ Статистик, располагающий набором данных, из которых он желает извлечь максимально возможное количество информации, часто отдает предпочтение методам факторного анализа. Результаты, полученные этими методами, в самом деле обладают тем преимуществом, что они дают синтетическое описание данных, упрощая исходное описание и одновременно минимизируя потерянную информацию. Более того, они могут быть использованы (см. 11, т. И В, с. 262]) на конечных этапах классификации: исследование аппроксимирующих плоских образов, полученных проецированием анализируемого сгущения на одну или несколько плоскостей главных осей, позволяет перегруппировать в классы близкие элементы с учетом качества их представлений. Нам кажется, что, действуя подобным образом, сталкиваются со следующими неудобствами: 1) при составлении классов частью информации пренебрегают. Используемые плоскости являются наиболее значимыми, однако они значимы с глобальной точки зрения и это не обязательно для каждого отдельного класса; 2) то, что главные факторы ортогональны, не позволяет обнаружить локальные тенденции, например обнаружить направления вытянутое - ти в неортогональных направлениях. Факторный типологический анализ помогает исключить эти неудобства. Его цель — ¦ выявить локальные тенденции и охарактеризовать их. В области анализа многомерных данных он лежит в пересечении линейного анализа и автоматической классификации. Его можно рассматривать с двух точек зрения: с одной стороны, это метод автоматической классификации, который посредством итерационного сходящегося процесса на каждом шаге улучшает, в смысле заданного критерия, разбиение анализируемого множества и позволяет в результате получить локальные оптимумы, т. е. наилучшие разбиения, достижимые при выбранных начальных разбиениях. Его оригинальность по сравнению с другими алгоритмами типа «динамических сгущений» состоит в использовании метода факторного анализа (анализа главных компонент (см. [5]) или анализа соответствий [1, т. II] для нахождения по разбиению множества на классы новых «представительств», являющихся в данном случае аффинными многообразиями, вокруг которых затем агрегируются новые классы; алгоритм состоит из последовательных итераций вплоть до нахождения подмножеств, сконцентрированных вокруг аффинного многообразия; 100
он может, следовательно, приводить к распознаванию некоторых сложных форм, составленных из таких многообразий и сгущений около них. Как метод классификации этот метод обогащается вкладом факторного анализа: распознавание формы сгущений, глобальные и локальные визуализации конфигурации, описываемой таблицей данных, интерпретация с помощью небольшого числа информативных признаков, восстановление данных с помощью небольшого числа факторов и т. д., что позволяет более полно описать полученную классификацию; с другой стороны, можно считать, что это метод факторного анализа, получивший благодаря алгоритму динамических сгущений возможность учитывать специфику данных. В самом деле, он подходит к основной задаче факторного анализа в некотором смысле наиболее общим образом. Вместо того чтобы искать аффинную прямую, плоскость или q- мерное аффинное многообразие, наиболее «близкие» к анализируемому сгущению, и считать удовлетворительным упрощенное описание его в подпространстве пространства Rp, объясняющем достаточный процент дисперсии, ищут аффинные многообразия размерности ^-О, 1, 2, 3,..., наиболее близкие к отдельным локальным агломератам данного сгущения, и спрашивают себя, можно ли считать это сгущение состоящим из классов, сконцентрированных вокруг этих многообразий. (Для этого используют показатель, оценивающий близость «класс-многообразие» и близость между исходным сгущением и совокупностью из К аффинных многообразий (критерий W).) Если ответ отрицательный, то метод, который предполагает априори существование К классов, ищет новые многообразия и с их помощью разбивает данное сгущение на новые локальные агломераты до тех нор, пока не осуществляется «хорошая» аппроксимация данного сгущения К аффинными многообразиями небольшой размерности. В результате действия алгоритма получается совокупность аффинных многообразий, составляющих «скелет», аппроксимирующий сгущения точек лучше, чем одно аффинное многообразие, определяемое обычным факторным анализом, который, впрочем, можно рассматривать как частный случай факторного типологического анализа при К 1. Такое применение алгоритма динамических сгущений позволяет еще обнаружить и проанализировать локальные подпопуляции, которые выявляются таким образом не произвольно, а в результате более точной аппроксимации данных. Это интересно, в частности, в случае больших таблиц, когда метод напоминает применение увеличительного стекла вдоль отдельных направлений или на отдельных плоскостях, замечательных тем, что они дают хорошее локальное представление для исследуемого сгущения. 6.2. МЕТОД 6.2.1. Основные пространства и функции Пусть Е — конечное множество классифицируемых объектов, характеризуемых р параметрами, т. е. Е рассматривается как часть аффинного пространства Rp. 101
Пусть \i — распределение массы на Rp. Пусть М — метрика* на Rp и dM — индуцированное расстояние.. Пусть Lq (или проще L)—пространство представительств: множество аффинных подмногообразий** размерности ц в Rp. Основу метода составляют следующие четыре отображения. 1) Определим меру близости D между элементами Е и аффинными многообразиями как отображение: D:?XL^R+, (*, k)-+D (х, к) - ц (х) d% (х, к), где Пусть V — направляющее подпространство Я, и а — некоторая точка Х;если обозначить через ф? оператор М-ортогонального проектирования на У1, то Замечание 1. Когда к имеет размерность 0 (т. е. сводится к одной точке а), то D (х, к) j,i (x) d2M (x, а). Замечание 2. Так как для любой точки у ? к существует вектор у' ? ? V, такой, что у а + у , то inf dh \Х> у) ¦"= inf M.((x~d)—у', (х~а)—у'), у€к ' yev f но вектором из V> ближайшим к (х — а), является фу (х — а), откуда inf dh ix, у) = ||(х—a) —<Pv \х—а) \\2М - || Ф^ (х—а) II2 - \\x~a\\h~Hv (х-а^\\% =- П) -\\x-a\\h- 2 (Фа(х-а)J, B) а --1 где фа есть оператор проектирования на ось, порожденную а-м вектором базиса подпространства V. Соотношение B) используется для практических расчетов. Замечание 3. Можно интерпретировать D (х, к) как момент инерции точки х относительно аффинного многообразия к (т. е. инерции распределения массы, сосредоточенной в х). В дальнейшем пусть Pt 6 3d (E) и распределение \лР. определено как в 6.2.1. Если обозначить через lp.] инерцию распределения \1Р. относительно к, то /Jflpl --¦¦¦¦ 2О(*> *)¦ C) 1 *Имеется в виду евклидова метрика, задаваемая некоторым скалярным умножением М (х, у) векторов х и у из Rp. — Примеч. ред. **Чтобы определить аффинное многообразие, достаточно задать пару, состоящую из точки и векторного ^-мерного подпространства пространства RP. 102
Эта величина, которую мы собираемся использовать в дальнейшем, будет также называться моментом инерции класса Pi относительно X. Замечание 4. Исходя из данных, которые нужно обрабатывать, и из желаемых результатов можно предложить другое определение D, более общее, чем предыдущее: D9 (х, К) = IX (х)((а + 1)\\х-а\\*м - ||Фу (х - а)\\%) = = [х (х) (а|| (х - a)Hi, + Щ (х - а)\\2м) при 0 < а ^ 1 (если a =¦-= 0, то D' = D). Сходимость алгоритма можно доказать и в этом случае. 2) / — «функция» агрегирования, связанная с D и определяемая следующим образом: / : LK-+ Ря (обозначается также /#), /(L) = (Plf ..., Рь ..., Як), где Л = {х 6 ? I у/ *&* D (*. Li) < D (^ ^)>- Это определение необходимо уточнить; при переходе от л-й итерации к (п + 1)-й сталкиваются с одной из трех возможностей: B) V/i e 1 К], Vx 6 ? (x 6 Я<п> и з i D (x, I<n>) < D (x, LJ»)) и V/< < t D (x, L{n>) < D(x, Lj")) =^ x f Я{« + 1)) (через ]К] обозначено множество {1, 2,..., K})\ C) V/ e ] /С], Vx б Е (х б ^n) и V/ б 1 К] D (х, L<»>) < < D (x, L<n>) =^ x eP<»+1>). В C) ситуация такова, что точка х остается в классе, которому она принадлежала на я-м шаге, так как переход ее в другой класс не приводит к улучшению критерия *; A) и B) — это случаи, когда х переходит в другой класс в соответствии со строгим убыванием критерия. В случае B) при наличии многих классов, расположенных на равном расстоянии от х, точку х относят к классу с наименьшим индексом**. Итак, имеем следующее определение: pin+i) = {* € pin) | Yk б ] К] D (х, L<">) < D(х, L<»>)} U U \х?Е и xQ *В МДС определение / таково, что если / < i и D (х, Цп)) = D (a:, J то х ? PJ."~^ \ даже когда на предыдущей итерации х ? Р{.п\ **Прием весьма несовершенный, поскольку он не принимает во внимание ни веса, ни форму, ни дисперсию классов (см. [1]). 103
\J \xeP(hn)\D(x, L<">) < D (x, fie] к) Очевидно, что такое определение имеет чисто теоретический интерес, практически же случаи равенства расстояний от точки х до представительств разных классов маловероятны. Но при таком определении каждой модификации разбиения соответствует улучшение критерия W, определенного ниже. Это позволяет доказать и использовать в 6.3.4.2 свойство ограниченной инъективности функции W. Замечание 1. / действительно является функцией, так как / (L) Р есть разбиение, однозначно определенное таблицами близости между индивидуумами и центрами агрегирования. Замечание 2. Интуитивно ясно, что новый класс Pt состоит из точек Е (число точек класса априори не фиксировано), более «близких» (в смысле расстояния, определенного в 6.2.1) к многообразию Ltj чем к любому другому многообразию. 3) Определим меру близости R:L X I/O X PA+R+ между классами и аффинными многообразиями следующим образом '• Определим также R:LK x]/CI x € Pic,V*6l/a R {L, k, P) =--¦ S D (x, Lh) R (Lft, k, P). xe.pk Нетрудно заметить, что R (X, /, P) - 1% [jiip.l (см. замечание З на с. /-~ 102) и что у R (L, k, Р) — аналог меры среднего рассеяния класса Рк вокруг аффинного многообразия Lk. R будет предполагаться инъек- тивным относительно первого аргумента, т. е. R(K f, P) -¦= R(X, /, Р)<*Ь - ^'. Предполагается, что распределение масс имеет равную инерцию относительно двух многообразий только в том случае, когда эти многообразия совпадают, что неверно, например, в случае равномерного распределения в области с симметриями. Однако на практике такие распределения маловероятны. 104
4) g — «функция», связанная с R, которая позволяет определять К центров агрегирования L исходя из /(-разбиения Р. Она задается следующим образом: g: P*->LK, g(P) = (Ll9...9 Li9...9 LK)9 где Lt — аффинное многообразие* размерности q в R*\ такое, что уА? L R (Lt, i, P) ^ R (A,, i, Р), т. е. это (/-мерное аффинное многообразие в Rp, относительно которого распределение \iP. имеет минимальную инерцию. Воспользуемся следующими известными фактами: 1. We ?Гя (Rp), Va e W А, = (а, V) и X, = (giy У), где gi = g (|Xp.) —два «параллельных» аффинных многообразия и по теореме Гюйгенса h l\iPi] = VupjI + 7ргЫ (a-gi)\\h**. Следовательно, L,- есть аффинное многообразие, проходящее через центр тяжести gt класса Pt. 2. Если положить Lt = (g"b V*), то решение У* получим при одновременном исследовании двух квадратичных форм: ot — квадратичная форма инерции распределения |ыР., М — положительно определенная квадратичная форма, определяющая на Rp евклидову структуру. Из известных результатов факторного анализа (см. [1]) следует, что ЛИЛ), (gu Vt)]^ I Ifi (Pt)9 (gif V)). Vt — векторное подпространство, порожденное q первыми главными осями инерции сгущения {(г, \х (х))\х 6 Л-}- Поскольку / [(I (Рг)у (а, V)] = R (X, /, Р), 11И (Pi), (gh V)] = R (kg, I, P\ где kg = (gh V), /1И(Л), (gu Vt)) = R(Li9 i9P)9 имеем VA, W УгвК), R (X, i, P)^R (kg , i9 P)^R (L, i, P). B частном случае, если H/, Pt = 0, то L; не существует, тогда я (Plf .. Pi, .... Рк) = (Llf .-, L^-i L L) * Здесь fxp = 2 f1 (*)• — Примеч. пер. i 105
Существование К -центра L, дающего решение задачи на минимум, таким образом, доказано, но, конечно, условие Vi g (Pt) = Lt для единственного Ьг* не обязательно должно выполняться. Известно, что в случае кратных собственных значений подпространство Vi определяется не единственным образом. Следовательно, в общем случае g не является функцией. Однако в многочисленных приложениях кратные собственные значения встречаются только как исключение; они (см. [1, т. II, с. 79]) «появляются естественным образом только при наличии симметрии геометрической конфигурации». Поэтому мы не обращаем внимания на этот случай. Замечание. Формализм при использовании локальных метрик. Квадратичная положительно определенная форма М, определяющая на Rp евклидову структуру, может быть: выбрана раз и навсегда (алгоритм ANATYP-A, описанный в 6.2.3); связана с анализируемым сгущением (алгоритм ANATYP-B см. 6.3.3.). В этом случае формализм, принятый здесь, следует модифицировать. Новые определения будут даны в 6.3.2. 6.2.2. Оптимизируемый критерий W 6.2.2.1. Определение Определим меру близости между /(-центрами и /(-разбиениями: W:LK X PK^R+, (L, P)^W(L, P) = 2 R(L, k, P). 6.2.2.2. Интерпретация критерия Локальный анализ — это анализ сгущения Ph = {(x, \ih (х))\х?Е}> где \ik — распределение масс, общей массы jj,fe<l, индуцированное \i и определяемое следующим образом: или же анализ сгущения {(ху \х% (х))\х 6 Ри}=Р1 с ц| (х) = \i (x)l\ih, х?Рки\1%=\. Ясно, что R (L, &, Р) есть инерция распределения \хк относительно аффинного многообразия Lk. Если рассматривают инерцию распределения \х% относительно Lfe, обозначаемую Ir(P%\Lk) (остаточная инерция относительно Lk распределения с полной массой 1), то R (L, k, Р) = ?ft/r (P% I Lk). * Через g обозначают также преобразование* g : № (Е) -+¦ L, такое, что g (Pt) = Li = gi+ Vt. 106
В дальнейшем выбранный критерий w(I, p) = интерпретируется как средневзвешенное полных масс К классов с весами, являющимися остаточными инерциями каждого класса относительно связанного с этим классом аффинного многообразия. Для L = g (Р) (т. е. у& ?] /(], Lk есть аффинное многообразие размерности q, относительно которого класс Pk доставляет минимум остаточной инерции) определяют W(P) = W (g (Р), Р), что позволяет приписать «числовое значение» распределению Р и сравнивать между собой два разбиения (W (Р) — мера «рассеяния» разбиения Р). Доказано [15], что преобразование W : Р&—>¦ R+ инъективно для всякой последовательности {(/о g)eo(P0)}nGEN, где Ро есть некоторый элемент Pk. Замечание 1. R (L, i, Р) = 2ji (х)\\х — Фг (х)\\%.= \хг [след ог о у оь= 1 где Фг — оператор проектирования на Lu аг —матрица инерции сгущения Р*, Мг — метрика, ассоциированная с этим сгущением, №а — — а-е собственное значение матрицы ог о Mt. Замечание 2. Показатель ||*— Ф^ (х)||д#./к R (L, i, P) сравнивает расстояние от х до Lt со средним рассеиванием класса Pt вокруг Lt. Показатель \i (х)\\х — Ф; (x)\\m./R(L, iy P) нормирован и измеряет вклад х в инерцию класса Piy ул; ? Pt. Он дает возможность оценить вклад отдельного индивидуума в класс. 6.2.2.3. Связь между критерием, полной инерцией и межклассовой дисперсией Рассмотрим три множества. 1. Е — множество индивидуумов, снабженных массой |ы, полной массы 1, с центром тяжести g. 2. i(gk> S V (*I*б К]} = {(fffc, |Tft)|* 6 W), где gk— центр тя- ?P x?Pk жести класса Pk разбиения Р = (Я1э..., Р^,..., Р^)- 3. Ж^ = {(х, fxft (х))| х 6 Рь}, V^^ 1^- Полная инерция Е относительно его центра тяжести g равна 107
Полная инерция множества Жк относительно его центра тяжести gk равна: По теореме Гюйгенса = 2 откуда Второе слагаемое правой части представляет собой момент инерции множества центров тяжести (межклассовая дисперсия). Если искомые центры являются 0-мерными аффинными многообразиями, т. е. точками, то для каждого класса Рк g (Pk) — gk — центр тяжести класса k и, следовательно, w (Р) = 2 igh Ы=ig (v) - 2 Я \\g-gk №• Чтобы минимизировать критерий в этом частном случае, достаточно максимизировать межклассовую дисперсию. Мы отсылаем читателя к методу, который описал (следуя Э. Дидэ) Ж. Бэнзекри в [1] (быстрые алгоритмы агрегирования с переменными центрами). 6.2.3. Алгоритм ANATYP-A 6.2.3.1. Описание Итерационный процесс вызывает поочередно функции gи/, определенные в 6.2.1. Схематическое представление его в виде упрощенной блок-схемы приведено на рис. 6.1. Последовательные этапы состоят в следующем: 1. Случайный розыгрыш или оценивание (исходя из возможной априорной информации о данных) разбиения Я<°> множества Е на /Стах классов. 2. Поиск /(-центров агрегирования L разбиения Р (на n-й итерации, L(n) = g (/>(«))). Этап 2 состоит в вычислении для каждого класса центра тяжести и q первых главных осей инерции (q^ 0), т. е. в применении «функции» g. 3. Вычисление критерия W (L, Р) для каждой пары (L = g (Р), Р). Последовательность положительных вещественных чисел ип = = W (g (Р{п)), Р{п)) = W (PW), определенных для каждой итерации /г, позволяет следить за ходом алгоритма. В 6.2.3 доказано, что при некоторых условиях этот алгоритм сходится. 108
4. Проверяется, сошелся ли алгоритм (или, что то же, стабилизировалась ли последовательность ип). 5. Вычисление «близостей» между классифицируемыми индивидуумами и К аффинными многообразиями, полученными на этапе 2. В результате получают таблицу «расстояний» размерности (card E) X X К: {D(x, k) \x?Ey ?6Ш} Розыгрыш или оценивание начального разбиения Р(о) г~2 Поиск К-центров, связанных с исследуемым разбиением (т. е. на П'Ой итера- ции: L<n>' = 9(Р(п))) 3 Вычисление соответ стбующего критерия: W ((№) Р*>) ип= Конец Рис. 6.1 Г6- Построение нового разбиения Стабилизирова лась ли последова Вычисление табли- I цырасстояний между] элементами ? и аффинными мно2оо6разинии\ 6. Построение нового разбиения исходя из таблицы близостей, вычисленной на этапе 5, т. е. применение функции / на /г-й итерации: Ж»+1)= / (L<n>). Замечание. Этапы 6, 2, 3, 4, 5 в указанном порядке составляют одну итерацию. 7. Останов происходит при достижении устойчивого элемента Pft, т. е. разбиения P<rt>, такого, что fog (PW) = PW, тогда имеем: Vp e N, W [g (Р<»>), РЩ = W[g (Pi"+P))t P(n+P)]t т. е. tin^ 109
На практике после быстрого убывания на первых итерациях часто наблюдают очень медленное и малозначимое убывание последовательности ип. Эта ситуация оправдывает процедуры, останавливающие алгоритм прежде, чем достигается устойчивый элемент. 6.2.3.2. Сходимость алгоритма Сходимость алгоритма равносильна сходимости последовательности положительных вещественных чисел: {W (Рп)}п<=н, где Рп = = (f °g)" (Po)^ разбиение, полученное на п-й итерации, исходя из начального разбиения Ро- В факторном типологическом анализе последовательность {wn= = W (Рп)}п<=н сходится убывая. Доказательство аналогично доказательству из 1. 3. 6. Более детальное изучение сходимости алгоритма и свойств преобразований / и g в частном случае типологического факторного анализа можно найти в [15]. 6.2.3.3. Процедуры остановки алгоритма Пусть получаемые на последних итерациях разбиения становятся очень мало отличными друг от друга, тогда вопрос об остановке алгоритма решается следующим образом. 1. Проверяя относительное убывание критерия, останавливают итерационный процесс, если «П — «71+1 < е, где е — заданное малое число. Приходится предполагать выпуклость кривой убывания ип. Выпуклость наблюдается на практике для последних итераций. 2. Проверяя устойчивость классов, используют понятие количества информации (доставляемого разбиением />(л+1), когда имеют разбиение Я<">), которое будет уточнено в 6.4.5.1; останов происходит, когда это количество становится меньше заданного малого числа. В этом случае считают, что переход от Р^ к Р(п+1) слишком мало модифицирует матрицы, по которым рассчитываются представительства классов. 3. Проверяя устойчивость полученных ^-мерных аффинных многообразий (критерий, используемый только в случае осей, т. е. q = 1), вычисляют угол между осями, полученными для одного и того же класса на двух последовательных итерациях, и останавливаются, когда оси более не «поворачиваются» *. Результаты критериев 2 и 3 являются, вообще говоря, согласованными, однако они не всегда проявляются одновременно, ибо удаление небольшого числа точек может изменить количество информации, а оси при этом не повернутся, что происходит в случае, когда точки близки к пересечению аффинных многообразий или имеют очень малую массу, и, обратно, устранение влияния удаленной точки или точки с большой *В случае q > 1 можно использовать для аналогичных целей раствор между двумя ^-мерными подпространствами. — Примеч. ред. ПО
массой может изменить ось, но заметно не изменит количество информации. Способ использования этих критериев уточняется в блок-схеме, риведенной на рис. 6.2. Замечание 1. Уже упоминавшаяся проблема локальных метрик будет обсуждаться далее, в частности для факторного типологического анализа соответствий, поскольку в этом методе метрика определяется анализируемым сгущением. Ядляются ли к opt лученных на п-ой иге рации, „значимо'' отлич 77 к предыдущих „Значимо" ли ноли- честбо информации, доставляемое ^О при известном С)? конец Рис. 6.2 Замечание 2. Модификация алгоритма на первых итерациях позволяет избежать некоторых эффектов, связанных со случайными колебаниями вначале, и, в частности, избежать «пустых» классов. 6.2.4. Метрики и функция представительства В процессе работы алгоритма метрика М играет существенную роль. Ее влияние сказывается как при переходе от /С-центров сгущений L к /С-разбиению / (L), так и при поиске К аффинных многообразий, связанных с разбиением. Применить g — это значит вычислить для каждого класса Pk квадратичную форму инерции V сгущения и диагонализовать V о М, поскольку V/, Lt есть аффинное многообразие размерности q, порожденное q первыми собственными векторами формы V ° М. Очевидно, что ill
различные варианты выбора Mug связаны между собой; рассмотрим 3 возможности. 1. м = 1Р. В этом случае М не зависит от анализируемого сгущения и не возникает задача о локальных метриках, т. е. метриках, ассоциированных с каждым классом. (i) () Чтобы осуществить глобальный анализ сгущения Ж, диагонализу- ют матрицу корреляций: V/, I'&ph A(,\ /')=*(/. j')/s(j)s(j'), где s (/, Л = 2 ^ (х{ —gf) (*{' -gJ") Другими словами, выполняют анализ главных компонент (АГК) сгущения Т (J\T) стандартизованных данных. На уровне классов это означает провести АГК подмножества Т (Жк) множества стандартизованных данных Т(Ж). Когда выполняют локальный анализ для класса Ph ? 9Р (Е), диа- гонализуют матрицу где qijo (/) — /- я компонента центра тяжести преобразованного сгущения J\Tk. Матрица Ak не является матрицей коэффициентов корреляции переменных х\ для класса Рк, для любого k проводят анализ главных компонент сгущения {(Т (л;/), \ii)\i б Рк} данных, стандартизованных глобально, а не локально. При глобальном анализе роль этой метрики заключается в том, чтобы результаты не зависели от единиц измерения- и она априори придает одинаковую важность различным признакам. Эти преимущества сохраняются в локальном анализе, если использовать локальные метрики, а именно V/?, .\1„ =-diag Матрица, которую следует диагонализовать, вместо D) примет вид Аи (/, /') ^ 2 & xixf/°k (I) <>h U") — Pk g{ g{'/oh ID oh (Г)- E) 112
Поскольку " r/V2- )* TO Если используют D) вместо E) для признака, который мало меняется на классе k, но сильно меняется на всем множестве, т. е. ok (j) мало по сравнению с о (/), то важность этого признака в анализе рассматриваемого класса уменьшают. Обратно, если oh (/) ^> а (/) (т. е. у-й признак сильно изменяется на классе, но не на всем ?), то подчеркивают большую значимость этого признака при анализе класса. 3. М — метрика х2*- Очевидно, желательно использовать метрику х2 и» следовательно, анализ соответствий. Преимущества многочисленны: распределительная эквивалентность (РЭ)**, одновременное барицентрическое представление... Метрика в этом случае определяется данными, что ставит проблему локальных метрик, которая будет уточнена в 6.3.2. 6.3. ФАКТОРНЫЙ ТИПОЛОГИЧЕСКИЙ АНАЛИЗ СООТВЕТСТВИЙ*** 6.3.1. Обозначения / — множество индексов индивидуумов, мощность / равна п\ J — множество индексов параметров, мощность J равна р\ Р — (п х /?)-таблица данных {р (/, /)}, / 6 /, / 6 <Л Р (*\ /) > 0; Pi- =-~^Р (<> /). Р-/ •¦¦-- 2 Р & 1\ Pi- > 0, Vi\ p., > 0, V/; S^- ^Sp-^2 p ii>i)==s> *Пусть / (со), /х ((о) и /2 (о) — три вероятностные меры на конечном множестве Q, причем / (со) > 0 Vco. Тогда х2-рзсстоянием между fx и /2 с центром / называется число х2 (/., L; /) =¦ 2j - • — Примеч. ред. оби / (со) **Определение РЭ см. в примечании редактора на с. 116. —Примеч. пер. ***Предметом факторного анализа соответствий (см. [1]) является анализ множества условных вероятностных законов, связанных с таблицами сопряженности. Геометрическое представление множеств этих законов в виде сгущений точек в соответствующих пространствах позволяет применять для их изучения методы факторного анализа. Далее авторы развивают эти методы в рамках общей схемы МДС. — Примеч. пер. ИЗ
/ (А /) — вероятностная мера на /хУ; /г. ^ /7,-./s и f.j =----- /?./s— вероятностные меры на / и J соответственно; К — максимально возможное число классов разбиений; (Рь..., Рк) — разбиение / на К классов; Обозначим через Rj множество всех конечных мер на J. Основная задача факторного анализа соответствий состоит в следующем: найти аффинное многообразие заданной размерности q в Rp, относительно которого инерция распределения массы в множестве •.V (/)* минимальна, соответствующая задача ставится и для Л" (J). В факторном анализе такая задача (см. 6.2.1) решалась путем отыскания q первых собственных векторов симметричной матрицы V°M с общим членом вида** /=i Pi.Vp.fVр.г 6.3.2. Проблемы, возникающие при выборе метрики %2 в факторном типологическом анализе и предлагаемое решение В процессе работы алгоритма приходится пересчитывать главные оси инерции классов, полученных разбиением множества / индивидуумов, т. е. анализировать подмножества условных вероятностных законов. Пусть (Л,..., //<) — разбиение / на К классов. Сгущение Ж (Ik) - {(//Jf ft) \ i^Ih) g Ry, Yk 6 1 /Cl*** имеет центр тяжести fkj = fj ° fj? , где //. = {fk (i-) = fi. x -^— / f /ь \ (см. обозначения в 6. 3. 1). k \ Sh i Сгущению J\T (Ih) соответствует часть таблицы данных f^k размерности р X nh. Имеем f*j = [ f7fi9 ..., /ji]. * <#*(/) С R'7 — множество с вероятностной мерой (см. определение множества Ж (/fe) далее). — Примеч. ред. **3десь V — матрица инерции (ковариации) множества .4^(/), М — метрика X2 в RP. — Примеч. ред. ***3десь и далее использование множества в качестве нижнего индекса означает развертывание в вектор-столбец по элементам этого множества, а в качестве верхнего индекса — в вектор-строку по элементам этого множества. Под /J. следует понимать р (/, j)lpt. — Примеч. пер. 114
Пусть Vk — матрица инерции; связанная со сгущением JT (Ik), с общим членом у к (/> Л = 2 fi.(fy-h(-i)(flf--fk(-n)- Для решения задачи необходимо вычислить и диагонализовать для каждого класса Ik матрицу Vh о М, где М — метрика f в Rp с центром, который выбирается исходя из следующих двух возможностей (см. 6.3.2.1 и 6.3.2.2). 6.3.2.1. Метрика х2 с центром, связанным со всем сгущением кой В этом случае следует рассматривать Rj (изоморфное Rp) с метри- 1/Л/ где f.j = 2/ (*\ /)» связанной с JT (/). Тогда алгоритм будет совпадать с i e / описанным в 6.2.3 и, следовательно, сходиться, но для каждого отдельного класса проведенный анализ не будет совпадать с факторным анализом соответствий, так как выбранный центр метрики %2> являясь центром всего сгущения, вообще говоря, не будет центром этого класса. Ясно, что глобальное сгущение допускает два эквивалентных евклидова представления {Л\ R*\ diag [ — ,...,—) } и {Г (Ж), diag (I, ..., 1)}, где Поэтому локальный анализ может рассматриваться как анализ главных компонент преобразованных сгущений: матрица инерции которых имеет вид где = S Замечание 1. S 115
поскольку — равно (^-полной массе класса k. S Видно, что диагонализуемая матрица F) из 6.3.1 не учитывает ко- эффициент 1/fXfc. В самом деле, матрица, которую следует диагонали- зовать, имеет общий член После несложных вычислений легко убедиться, например, что собственный вектор, отвечающий собственному значению X матрицы УиЦу /')> является собственным вектором, отвечающим собственному значению А, {^-матрицы F), рассчитанной по сгущению */F (Ih). Замечание 2. Распределительная эквивалентность* при таком выборе центра не имеет места. Пусть Jrh (У) {//fe, /ft (•/)!/ 6 У}-—сгущение индексов параметров класса /Л, где /Л (•/)-¦ V/ (/, /)/щ. Предположим теперь, что существуют /, и /2, такие, что /"/'¦ -- /'/2, т. е. h Gi) /л ('/г) /ft(-/i) /л (-/а) тогда а из равенств, приведенных выше, следует _, (fk(-h)L.h (Л (•/.))'/./, *Приведем определение РЭ (ср. [1J). Пусть дана таблица данных Р - i/7 (*» /)}> * 6 ^» / 6 ^, такая, что для некоторой пары индексов j\ и /2 выполняется равенство f'.il f-f2 для всех i ^ /. Введем новый индекс /s. Положим Js "- (J\(h, /2)) U /в и Ps - {р (/, /)}, i 6 /, / 6 У8, где р (i, /8) р (/, /i) f f P (f» /2)- Тогда таблица Р определяет вложение Ж (/) в Rj (см. 6.3.2), а таблица P,s — вложение ,Л' (/) в R, . Рассмотрим отображение я, сопоставляющее S мере fi 6 Ry меру лр, 6 Ry , такую, что лр, (/) fx (/), / ^= j8 и л|л (ys) ^ (Д) f + fi (/2). Тогда говорят, что для меры И- 6 Ry выполняется свойство распределительной эквивалентности метрики х2, если метрики х2 с центром ц в Rj и с цент- ром яA в Ry индуцируют одну и ту же метрику на .Л"A). — Примеч. ред. 116
Распределительная эквивалентность будет иметь место, если ' • /i • /g _„ * As / и \ fk(-h) ~ fh(-k) ~~ fk{.is) гак как тогда Условие (Яо), вообще говоря, не выполняется. В дальнейшем мы увидим, что при справедливости гипотезы (Яо) матрицы, которые следует диагонализовать, будут одни и те же, если выбирать в качестве центра fj (центр глобального сгущения) или fkj (центр сгущения -Г (/*)). Замечание 3. Если выбранным центром является /у, то расстояния между индивидуумами из класса k не зависят от принадлежности их к этому классу и равны расстояниям в глобальном сгущении: . eh(n .lay//)/; В ':>том случае локальный анализ проводится на подсгущениях глобального сгущения, форма которых (по существу, определяемая метрикой) не меняется в процессе анализа. Это будет не так, если для каждого k выбирать соответствующий центр fkJ (см. 6.3.2.2). Замечание 4. Сгущение параметров не может рассматриваться независимо от целей анализа. Существует столько подсгущений, сколько имеется классов: Vk Jrk{J) ..._щг fk{./))!;;<zj} с % pa,f),vi e 1 и M-fl 2 P(»,/)/sk= ^ f{i,j)slsk ielk te/ft в Rn с метрикой, задаваемой вектором весов //, и в Rrtft (nh -card Рк), снабженной аналогичной метрикой Расстояния между параметрами равны соответственно: (/. /) ¦ Г. 117
Если гипотеза (Яо) справедлива, то всегда получают одно и то же представительство для облака параметров, каков бы ни был класс k. В противном случае параметры играют в анализе k-то класса роль, тем более отличную от их роли в глобальном анализе, чем менее верна эта гипотеза. 6.3.2.2. Метрика х2 с центром, связанным с классом k Обозначим для каждого k: через Mk метрику на Rp, такую, что через fh (*•) распределение вероятностей на /, такое, что Класс Pk представляет собой сгущение {(/у, fk (i-))/i? Ik), и симметричная матрица, которую следует диагонализовать, чтобы выполнить анализ соответствий этого сгущения, имеет общий член вида (для центральной матрицы инерции) и (для начальной матрицы инерции) 2) а;(/, л = 2 fk(/¦) frГ//УКТ1)УКШ ----- причем У fu (J) является собственным вектором матрицы Ak (/, /'), соответствующим собственному значению А, = 0, и собственным вектором матрицы А% (/, у"), соответствующим собственному значению X ™1,- Если 0* — такой вектор, что г Vfh(-i') Vfh(-i) то е* называется а-м собственным нормализованным вектором, где ка = = а -е собственное значение. Таким образом, локальный анализ является факторным анализом соответствий для каждого класса kr причем, с одной стороны, мы имеем V», Г € Р„, d\ (i, i') = 2 (fl/-f;-J.'fk (•/)- 118
где fk (•/) удовлетворяет соотношению У \ikfk (•/) = /../, 2j М^л = 1, т. е. локальные анализы проводятся для частных сгущений модифицированной (в зависимости от k) формы (см. 6.3.2.1, замечание 3). С другой стороны, появляются нежелательные эффекты на этапах 3 и 2 итерационного процесса, описанного в 6.2.3.1. К этапу 3 таблица D (близостей «индивидуумы — классы») построена следующим образом: расстояния индивидуумов, составляющих множество* ?, до каждого центра агрегирования вычисляются с помощью метрики и системы масс**, связанных с этим центром: всякий индивидуум из ?, не принадлежащий к PkJ проектируется на центр агрегирования Lh как дополнительный индивидуум к анализу 6-го класса. При построении нового разбиения / (L) каждый индивидуум из Е относят к тому классу, относительно центра которого он имел бы наименьший момент инерции, если бы принадлежал к этому классу. Уменьшение критерия гарантировано на этом этапе, чего нельзя сказать, вообще говоря, относительно этапа 2. Более подробно об этом см. в 6.3.3. Резюме. В первом случае таблица D получается более «однородным» образом, т. е. Vx, Vfe, близость D (x, Lk) вычисляется bRpc помощью одной и той же метрики без учета принадлежности индивидуума х к классу, что, вообще говоря, не всегда желательно, так как локальные анализы при этом не являются анализами соответствий классов. Во втором случае локальные анализы являются, конечно, анализами соответствий классов, что для некоторых исследований (см. 6.3.3) кажется необходимым, но тогда возникает проблема сходимости алгоритма (см. 6.3.3.2). Замечание. Сравнение матриц, которые надо диагонализовать, в указанных случаях показывает, что V/ ^ Р(*\ />//>./= -**- => А (/, /') = -*- Ak (и Л =|ifc Ah (и Л /e/ft s s и что два описанных подхода полностью эквивалентны в частном случае, когда справедлива гипотеза (Яо): 2 ' = Н'Ь V/, k. Так как ieik p-J (#о) эквивалентна тому, что V&, V/, fk (•/) — /.,/» то эти два метода эквивалентны лишь тогда, когда центры тяжести классов совпадают с глобальным центром тяжести. * Таким образом, / рассматривается далее как множество индексов объектов из Е. — Примеч. ред. **Если адаптировать систему масс к классу так, чтобы она не влияла на итерационный процесс на уровне функции g, то влияние скажется на уровне функции /. Использование D с системой нормированных масс приводит к объединению классов и малоэффективно. Поэтому обычно избегают нормировки локальных распределений масс. 119
6.3.3. Использование «локальных» метрик: исследование сходимости алгоритма ANATYP-B Алгоритм ANATYP-B отличается от алгоритма ANATYP-A, описанного в 6.2.3, тем, что метрика, которой снабжено Rp, не является фиксированной, а на каждом шаге адаптируется к результатам проводимого анализа. 6.3.3.1. Обозначения и определения М — множество метрик на R^; L, P/t — определяются так же, как в 6.2.1; Л -¦-¦: М X L — пространство центров агрегирования, элементами его являются пары, состоящие из некоторой метрики и ^/-мерного аффинного многообразия; Ак ^ (М х L)JKJ, или, иначе, (М)^ X (LIKJ —пространство К- центров; Л : $Р- (Е) —>¦ М — отображение, позволяющее связать с каждым подмножеством А из Е метрику Л> (А) на R*7, обозначаемую также тА (алгоритм ANATYP-A можно рассматривать как частный случай, когда отображение Л постоянно); D : Е X Л ->- R+ — отображение, определенное для Vx 6 Е, V (/я, X) =-¦¦ (т, (а, V)) 6 Л формулой D (х, (/я, Я)) - A (х) (inf || дс—у ||^) fi (х) \\ ф^ (х—а) \Ц. Если обозначить через / 1х, X, mj момент инерции точки х относительно аффинного многообразия (а, V) в метрическом пространстве (R*\ m), то D (х, (ту X)) I |х, X, /я]; /? : А х J /C1 X P/i -> R+ — отображение, определенное для VA =¦-¦ (mf (а, 1/)) 6 Л, V/ ?] /Cl, VP 6 Рь формулой /? (Л, /, Р) --- У D (х, Л) - ^ Iх (х1 II Фя ^х) |lm • Если обозначить через 1Т (Ри X, пг) остаточную инерцию относительно аффинного многообразия с распределением |х* (полной массы 1 и связанным с Pf) в метрическом пространстве (R*7, m), то R (A, i, Р) =^1й1г (Ph X, /я); /?:ЛКХ]/С1 х Рк-> R+ —отображение, такое, что VA - (Лх, .... А,, ..., Лк) R (А, /, />) -¦ R (Л,-, I, P). 1^*:ЛКХРК-^ R+ —отображение, такое, что W (Л,Р)- 2.^(Л, tfJ 120
где ViAt •-¦- (ki} rrti) и функция / : Лк ->РК определяется как в 6.2.1, однако следует иметь в виду, что D (X, А,) < D (х, Л,) #> || Ф1 (л || р Это означает, что x?Piy если «расстояние» от него до А,* в (R*7, меньше, чем до Xj в (RP, тР.). Пусть g: 3* (Е) -*¦ Л означает композицию двух отображений , А)\-+(тА, LA), где тА — метрика, соответствующая А в силу отображения М> и h — функция g из алгоритма ANATYP-A, т. е. при заданной метрике т* отображение h сопоставляет сгущению А аффинное ^-мерное многообразие LA, натянутое на главные оси инерции этого сгущения в метрическом пространстве (ИР, тА). Будем обозначать также через g : Pfe-^ -^Ак отображение, которое каждому разбиению Р = (Ръ..., Pi,..., ..., Рк) ставит в соответствие набор Л = (g (Рг)у ..., g(Pt),..., )) Замечание. Если в R (Л, i, Р) ¦= V ^ (х)Цф^ (х — а)\\2т предпо- x^pt лагается, что /п, а, Уне зависят от Pt, то ти gt, Vt в R (g (Рг)у /, Р)= -- %\i (л:)||ф! (х — gi)\\m. связаны с Рг(тг - \i (Рг)\ gt — центр тя- жести сгущения Piy a V,- — его «главное» подпространство инерции.) 6.3.3.2. Исследование алгоритма Алгоритм ANATYP-B описывается с помощью функций / и g по схеме из 6.2.3. Чтобы проследить за его ходом, изучим свойства последовательности {zp}> определенной ниже. Для каждой итерации п положим где Р(°> — некоторое начальное разбиение. Пусть z2n, z2/l+i, z2n+2 — ТРИ последовательных элемента последовательности {zp}: z 2n 2n = W (Л<я>, /><">) =2 Si) (jc, *Эта эквивалентность имеет место в том случае, когда зависимость функции D от класса касается только метрики, а масса индивидуума х остается неизменной. Можно было бы ввести также зависимость массы точки х от принадлежности ее к тому или иному классу, т. е. приписать х массу f.i (x)/\ii и, таким образом, рассмотреть для каждого класса Pt распределение с полной массой 1. 121
где Свойства последовательности {zp}. 1. Преобразование /? является 2 —/-свертываемым (см. [15]) и, следовательно, таким, что Даже если z2n = z2n+1 <Н> Р<я> == реи-1) и, следовательно, если сходимость не достигнута, то мы имеем строгое неравенство z2n > z2n+1. 2. Преобразование R относительно отображения h обладает следующим свойством: YI 6 L, Vm 6 М, Vf 6 1/С], и, следовательно, 7? обладает свойством которое слабее, чем ^-свертываемость (см. [15]), поскольку X) не является, вообще говоря, центром агрегирования (т, А,). Тем не менее для X = L{n) из этого свойства вытекает где последнее равенство является определением для zln+i- Имеем (Z2Tl+l Z2n+\) В силу свойств 1 и 2 Z2n Z2n+1 > 0, ^ zl/i+i — 22n+2 > 0 (свойство инъективности R (см. [15, 3.1.2])). Напротив, ничего нельзя сказать о разности z2n+i — Z2n+i между моментами инерции сгущения РЛП+1) относительно L^>, вычисленных в (R", m<?>), а затем в (R?, m<^+1>). Эта разность может быть отрицательной, как показывают примеры, в которых не наблюдается убывание последовательности {zp} (в случае метрик х2 с центрами, связанными с локальными сгущениями), однако в большинстве случаев последовательность {zp} убывающая. 122
На интуитивном уровне это можно объяснить следующим образом: в начале работы алгоритма первое улучшение критерия (z2n — z2n+i) весьма велико и полностью компенсирует величину z2n+1 — Z2n+1, возможно, отрицательную. На итерациях же, близких к конечной стадии работы алгоритма, классы Я(?> и Р<^+1) отличаются очень мало, поэтому метрики т^> и т(?+1) так же мало отличаются, и, следовательно, величина z2n+i — г2П-ы очень близка к нулю. Кроме того, в редких случаях, когда последовательность {zp} не убывала, срабатывали критерии остановки алгоритма (см. 6.2.3.3), так как либо относительная разность (г" ~~ **+*) была меньше фиксированного zn порога, хотя (zn — zn+1) отрицательна, либо после значения большего, чем предыдущее, значения критерия снова убывали. Интерес к этому алгоритму объясняется в основном тем, что он позволяет проводить факторный анализ локальных соответствий для случаев, интересных с точки зрения приложений. Замечание. Можно, однако, построить сходящийся алгоритм, вводя следующую модификацию функции /. Действуем последовательно: каждый индивидуум изменяет принадлежность к классу только в том случае, когда с учетом изменения, которое он вносит в метрику нового класса, критерий улучшается. 6.3.4. Восстановление данных по ограниченному числу локальных факторов 6.3.4.1. Восстановление данных по ограниченному числу факторов [1, т. II А, с. 33—35] Для восстановления таблицы данных по результатам локального анализа* здесь применяется факторный типологический анализ. Использованы те же обозначения, что и в 6.3.1. Таблице данных Р (IJ) соответствуют: таблица / (IJ) (распределение вероятностей на / X У); маргинальные законы Pj и Pj\ сгущения профилей** dr(I) = {(fij> ft.) I i 6 /} (с центром тяжести f.j), расположенных в гиперплоскости пространства Rp, ортогональной вектору /./***. * Восстановление данных с помощью факторного типологического анализа изучено только в частном случае факторного анализа соответствий, но аналогичное изучение может быть проведено и для АГК. **3десь авторы используют терминологию анализа соответствий (см. [1])? где введенные выше (см. 6.3.2) законы fl/ (соответственно /}'), i 6 / (соответственно / ? J) принято называть профилями. — Примеч. пер. ***В Rp рассматривается скалярное умножение, задаваемое матрицей М = = diag (/71). Требуемый факт следует из того, что вектор ~[/f.j является собственным вектором с нулевым собственным значением матрицы ковариации А (/, /'). -— Примеч. ред. 123
Если с помощью факторного анализа соответствий определить (р — 1) главных направлений «вытянутости» сгущения, задаваемых направляющими векторами {Uaj, а = 1, ... (р — 1)}, то % G) сс=1 где Fa @ — а-я координата вектора fj в базисе {/.у, (Uaj, а = 1,..., /? — 1)}. Исходя из G) получим две эквивалентные формулы для восстановления данных по факторам: (*\ D -//./-Л 1 +Р2 *«Г 1 /2 ^а @ Ga (/) ) , (8) V / + PS ^/2 Фа Фа7 ) • (9)* Если вместо (р — 1)-го фактора используется только q @ ~-1) факторов, то (8) и (9) сводятся к приближенным формулам порядка 0: / (i,/) wfi.f.j, q порядка q: f (/, /) = ft.f.j A+2 ^i/2 Фа' Фа')- a=l Восстанавливая данные по этим формулам, получают аппроксимации таблицы fij: порядка 0, скажем Тц, где Т° (i, j) = Д./.у, или, что является более общим, порядка q, 0 < q< p — 1, скажем Т<?1Г где Tjy ~ таблица, наиболее близкая к fjj в смысле, который мы сейчас уточним, fu и T]j рассматривают как распределения вероятностей на / х J\ чтобы оценить точность аппроксимации, множество всех распределений вероятностей на / v /снабжаютметрикойх2с центром //././. Тогда имеем II fu - ть \\)t f r - II fu -ft h \\f) f = "v1 *«• 0 °) a--l т. е. полную инерцию сгущения Л"' (/), и Vq \\fiJ-Th\\flfi Via, A1) * Таким образом, Ga(j)^kl/' -3L - ^/->^/, F<h ^T^2 Ф. /./ v<v a Заметим, что системы вокторо» \Ц^Г- к .-..¦- J« 2, /i — I} н {Ч*а > & -'-'¦' 1, 2. .. •,,. я -1} <»ргогональя1»1 птносцт^пьно скалярного умножения, задаваемого матрицей V? ' <На^' (/ |, .... /\р) Примеч. /V'i. 124
т. е. инерцию, не объясненную первыми q главными осями инерции Рассмотрим аппроксимацию порядка q и обозначим через 8,-7- ошибку для (/, /)-го элемента таблицы: a>q В качестве глобальной ошибки возьмем норму матрицы 8//: «./ а>д где {&ijflfifj — абсолютный вклад (/, /)-го элемента в общую инерцию, и соответствующий нормированный показатель a>q та — доля инерции, объясняемая осью а). 6.3.4.2. Восстановление данных по локальным факторам Данные составляют таблицу Р(М) чисел с общей суммой s, ее хотят восстановить по результатам локальных анализов соответствий. Для каждого к рассматривают частную таблицу //ft j = (—¦—L i g Рис. 6.3 с общей суммой Определим таблицу //у:
Она имеет общую сумму 1 и маргинальные законы fj и //, определенные следующим образом: /*(•/)= S/('./)/?= S/*(',Л, A2) /e/h teih 22 С этой таблицей связано множество профилей: Сгущение, которое надо анализировать, имеет, следовательно, вид: Определяя с помощью факторного анализа соответствий для каждого k ? ]К] главные факторы, получим 2 a=l Таким образом, учитывая A2), A3), для восстановления fjj получим /(*. /)=//¦/k(-l') ( 1 +'S ^Ф^Фа!Л A5) \ а=1 / Пусть е*у — ошибка, сделанная в результате замены элемента /* (i,/) таблицы fk(IhJ) его аппроксимацией порядка q, полученной исходя из A4). Пусть r\ij — ошибка, сделанная при замене / (/, /) его аппроксимацией порядка q, полученной исходя из A5). Тогда: откуда N. В. Ограничение//.ft вектора //. на Ik отлично от//.^, это находит отражение в формуле II Л?/II?» > ^j /•A #JA 126
Для метрики X2 с центром //ft • fkmJ расстояние между исходной таблицей // j и таблицей-приближением с помощью A5) нулевого порядка равно: f/./.J a>0 Итак, если через L% обозначить 0-мерное аффинное многообразие — центр агрегирования класса k (т. е. его центр тяжести), то а>0 аналогично и, следовательно, для каждого класса knVq^ О R представляет собой расстояние в метрике %2 с центром //fe. /.у между исходной восстанавливаемой частной таблицей и таблицей-приближением порядка q. Восстановление полной таблицы по частям. Рассмотрим множество распределений вероятностей на / X / с метрикой %2 с центром *///у//= = {///*, ife = 1, ..., /С}, соответствующей матрице 44i.fi) 0 0 т.® Рис. 6.4 где Di \—диагональная матрица, соответствующая вектору Отметим, что / (///) = 2 1 // )» тогда ^ ////= ^- ^ <'у')' если f' 127
Пусть ?/у — таблица приближений порядка q, восстановленная по частям, пусть fu — исходная таблица, причем обе таблицы упорядочены согласно последовательности (Ilf ..., 1К). Имеем Sfe2 ОДК] где L*=(Lb...,Llt...9L!d. Мы видим, что критерий точности аппроксимации представляет собой сумму расстояний между К частными исходными таблицами {// j, k 6 ]Ю) и К таблицами их локальных приближений порядка q : {Tqikj, k 6Ш}- To же верно для расстояния D A / fjfj/i) между полной исходной таблицей fu и ее аппроксимацией порядка q, описанной выше. Теперь можно сравнить расстояние между fu и таблицей, восстановленной по факторам глобального анализа, (а) ||/,,-ЗД2|Л/ с расстоянием между fu и таблицей, восстановленной по локальным факторам, уйг\ \\ $ f"Q ||2 ^уЧ V^ л \у/ ij a П\ ' а>G Мы сейчас увидим, что если классы выбраны хорошо, то расстояние (б) может быть значительно меньше (а). Предложение. Пусть Е — глобальное сгущение; Le — аффинное ^-мерное многообразие, натянутое на его главные оси инерции; W^Lej Е)—его инерция относительно L^. Пусть Р* — разбиение, полученное в результате работы алгоритма исходя из некоторого разбие- н ия Р из Рк (Е). Тогда если Р* Ф Р, то имеют место неравенства V&6N, Замечание 1. Поскольку при использовании локальных метрик встает проблема сходимости алгоритма (см. 6.3.3), следует выбирать Р в подмножестве Ск разбиений, для которых алгоритм сходится. Напомним, что если метрика не зависит от анализируемого класса, то Ск = Рк> в противном случае Ск s Рк- Замечание 2. В частном случае, когда проводят анализ соответствий, из (а) и (б) имеем: )^\\fIj-TqIj\\fi f jy WK (P) - 2 2 2 II/ (i, Л -Й V, i) if//;, h (•/)• 128
Доказательство. Пусть имеются разбиения Р = {Рь..., Рь • •., Ph ..., Рк) и Q - (/>!,..., Р* U ^ .... Рк}*- Обозначим через Ри класс Рг U Р7- из Q. Положим Lij = g (Ptj) **. Тогда = 2 Поскольку и то Я( RU Ни, I, Uj, j, w P)l P)* (Q); >R *R( Z W (Li, i, Lj, j, (P). P) P), Повторяя этот прием столько раз, сколько необходимо, докажем неравенство V./C, VP, W, (LEy ?)> WK(P). В самом деле, считая выполненной принятую в 6.2.1 весьма разумную гипотезу инъективности R относительно первого аргумента, т. е. R(K i\ Р) = /?(*', /, Р)&Ь = V, имеем Л (Lb i, P) = /? (L|;> i, P) & Lt - Lj;. Итак, Lt = Lu**g(Pt)=g(Pt U Pj). Если Р7- Ф 0, то последнее равенство может достигаться лишь в том случае, когда класс Pj расположен симметрично относительно Lu что маловероятно. Следовательно, резонно полагать, что W(Q)>~W(P), поэтому w1 (LE, Е) > wK (Р). Второе неравенство из формулировки предложения является следствием свойств итеративной процедуры. Более того, оно строгое в том случае, когда начальное разбиение Р не является несмещенным. В са- *3десь считается, что в разбиении Q классы i и / равны Pt (J Pj. — Примеч. ред. **3десь в зависимости от контекста g (PJ) = Lt, а также g (Р) = (Lx, ... ..., Lu -.. LK). 5 зик. зоз 129
мом деле, в силу свойства функции W, о котором мы напоминали в 6.2.2.2, W (P)= W (Р*) <=2 Р = Р*. Следовательно, если Р ф />*, то Wx (LEj E) >~Wk (P) > WK (P*)- Это предложение показывает, что средняя ошибка при восстановлении таблицы данных методом глобального анализа больше средней ошибки при восстановлении ме- Е) тодом локальных анализов по классам. Ь-случайное разбиение ПерВОе неРавенство может на д классов !W7 сигналов 14~каиального преобразователя ВОКОДЕР Р *- лона льный опта мум, соответствующий Ра Wd(P*) наводить на мысль, что уменьшение ошибки в большей степени происходит благодаря разбиению на классы, а не благодаря действию алгоритма. На самом же деле все рассмотренные авторами примеры показывают, что, хотя критерий убывает при переходе от глобального анализа к анализу К классов некоторого разбиения Р, его значение остается по величине того же порядка *. Напротив, применение нашего алгоритма гарантирует быстрое убывание значения критерия до величин, существенно меньших по порядку (см. кривую убывания на рис. 6.5). Номер итерации Рис, 6,5. Кривая убывания критерия (ошибки для восстановленных таблиц с помощью аппроксимаций порядка 3) 6.4. ПРИМЕНЕНИЕ МЕТОДА 6.4.1. Выбор входных параметров 6.4.1.1. Максимальное число классов, При отсутствии указаний на оптимальное требуемое число классов желательно выбирать верхнюю границу для него так, чтобы получить «разумное» число классов, т. е. такое число классов, для которого результат анализа допускал бы наиболее прозрачную интерпретацию и визуализацию. При гипотезе, что множество Е состоит из К классов (К неизвестно), важно уметь распознавать, какой из следующих двух случаев имеет место: (а) *Стах > К истинного; (б) /Стах< К ИСТИННОГО. Случай (а). Заметим сначала, что согласно определению отображения / фактическое число классов меняется в процессе итераций и в ре- *При условии, что число классов существенно меньше числа индивидуумов. — Примеч. ред. 130
зультате может получиться разбиение множества Е на k классов, где k меньше априори заданного /Сшах- Для определения истинного числа классов полезным является понятие устойчивых многообразий, введенное в 6.4.3, а именно ставится под сомнение истинность класса, который появляется только при одном выборе начальных данных или истинность различия классов, имеющих очень близкие представительства. Случай (б). В решении вопроса может помочь рассмотрение остаточных инерции классов и сравнение их с глобальной остаточной инерцией. В самом деле, число классов и размерность многообразий—представительств классов являются двумя связанными параметрами, а именно для достижения при ограниченной размерности значимой доли объясненной инерции необходимо сократить число элементов в классах и, следовательно, увеличить число классов. Другими словами, если аффинные многообразия, полученные в результате сходимости алгоритма, таковы, что их размерность не позволяет объяснить «разумную» долю инерции класса (под Рис. 6.6 «разумной» понимаем существенно большую долю, чем при глобальном анализе), то это означает, что размеры классов слишком велики. Сокращение этих размеров приводит к увеличению числа классов. Пример. В рассматривается как распределение в R2. При одном или двух классах необходимы две оси для объяснения достаточной доли инерции (т. е. это не отражает тот факт, что внутренняя размерность В равна 1), и представление этого распределения с помощью проекций на ось плохо аппроксимирует данные. Ясно, что для хорошего одномерного представления данных необходимо разбить В по крайней мере на пять классов. Аналогичные рассуждения применимы к распределению в R2 в виде буквы А (рис. 6.6). 6.4.1.2. Размерность локальных многообразий Считая сгущение погруженным в Rp (или в R'' в случае профилей и метрики х2) можно в принципе отыскивать многообразия размерности q <; р — 1 (соответственно q ^ р — 2). Однако цель метода состоит в том, чтобы найти представительства небольшой размерности, которые давали бы хорошее описание «кусочков» сгущения. Итак, будем последовательно отыскивать оси (q = 1), плоскости (q = 2), трехмерные аффинные многообразия, останавливаясь, когда доля объясненной 5* 131
инерции является достаточной, не забывая об указанной выше связи размерности многообразий и размеров классов. Желательно выбирать параметры q и /Стах одновременно или одновременно модифицировать их в процессе работы алгоритма. Отметим, что^ может быть также определено в результате глобального анализа. 6.4.1.3. Метрика Выбор метрики осуществляется согласно информации об исследуемых данных в соответствии с обычными критериями (см. [2] и [5]), Для локального анализа, в частности, когда используют метрику %2 нужно еще решить, что использовать — «глобальную» или «локальную» метрику. При этом руководствуются целью анализа или тем* какими свойствами данных хотят воспользоваться. 6.4.2. Выбор меры близости D 6.4.2.1. Определение D и «стратегия объединения» В факторном типологическом анализе стратегия объединения, т. е. правило, по которому индивидуумы множества Е относятся к одному rf3 центров, зависит существенно от выбранной меры близости D; в самом деле, с представительством L связано разбиение Цр на полиэдральные выпуклые* области (Cly... Ciy ..., Ск), определяемые следующим образом: d = {х е Rp\D (*, Lt) < D (*, Lj), V/ Ф i). Границы этих областей состоят из частей гиперплоскостей {Fi\i 6)/(], /61/С1}, где V/, V/ F{ - {х 6 Ro |D (х, Lt) = D (x, Lj)}. Разбиение сгущения Е индуцируется разбиением пространства Rp. Различный выбор D приводит к различным разбиениям и как следствие к различным стратегиям объединения точек. В основном алгоритме «расстояние» между индивидуумами и центрами равно: VX = (g, У), D (х, X) = h (х) =-- 1у (х -g) - моменту инерции индивидуума х относительно аффинного многообразия к. Исходную стратегию модифицируют: либо используя другое определение D (см. замечание 4 из 6.2.1), для которого доказывают следующее предложение: ¦Предполагается, что D (х, X) = \i (x)d2 (x, А,), где d2 (x, X) — квадратичная форма от х 6 Rp. — Примеч. ред. 132
пусть D задано следующим образом, где L = (а, V) 6 L: D(xy I)~-- v (х)а\\х - a\\h + Ц (х)Щ (х — a)\\h, 0< и R задано, как в 6.2.1. Тогда, если отображение g сопоставляет сгущению подпространство, натянутое на q первых факторов этого сгущения, то алгоритм сходится*; либо дополняя стратегию так называемым методом эллипсоидов- ядер для исключения влияния резко выделяющихся точек (см. 6.4.4) и влияния случайного выбора начального разбиения множества Е. 6.4.2.2. Эффект выбора параметра а Правильный выбор этого параметра может способствовать более эффективному распознаванию структуры данных. Этот выбор может быть обусловлен либо априорной информацией о данных, либо предпочтениями пользователя. В наиболее часто встречающейся ситуации, когда структура данных априори неизвестна, мера близости D может быть модифицирована после получения предварительных результатов, оцениваемых как малоудовлетворительные. Две крайние возможности а — 0 и а = 1 были проверены на различных данных. Полученные результаты проиллюстрированы на рис. 6.7. Вывод таков, что при а = 0 алгоритм обнаруживает направления вытянутости, тогда как при а = 1 он обнаруживает, в большей степени, концентрацию массы. Если ищут направления вытянутости (т. е. а = 0), то во всех вариантах появляются 2 одинаковые оси, т. е. в этом искусственном примере К = 2 является оптимальным числом направлений. Напротив, с а = 1 появляются естественные разбиения, соответствующие требуемому числу классов. 6.4.3. Понятие устойчивых осей 6.4.3.1. Влияние случайного выбора начального разбиения множества Е. Локальные оптимумы. Приближение к глобальному оптимуму Влияние случайного выбора начального разбиения на (конечные) результаты алгоритма является общей проблемой для всех методов семейства «динамических сгущений». Чаще всего для различных начальных разбиений полученные результаты различны. Итак, приходят к тому, что задают себе следующие вопросы. Существует ли глобальный оптимум? Достижим ли он? Когда можно обоснованно утверждать, что полученный результат близок к глобальному оптимуму? Какие про- * Предложение, очевидно, имеет место только для сгущений общего положения, т. е. для почти всех сгущений. — Примеч. ред. 133
цедуры можно предложить, чтобы приблизиться к глобальному оптимуму? Говорят, что разбиение является локальным оптимумом, если и только если любая прогонка алгоритма, начинающаяся с этого разби- Рис. 6.7. Данные Руспини G5 точек в R2). ения, не меняет это разбиение. Существование локальных оптимумов гарантируется теоремами сходимости. Гипотеза инъективности критерия UP (которую естественно принять) гарантирует существование и единственность глобального оптимума. Но существование (даже достоверно установленное) глобального оптимума не решает проблему, пока этот оптимум не найден. 134
Число вариантов счета ограничено; в большинстве случаев оно очень мало по сравнению с числом локальных оптимумов, поэтому глобальный оптимум не обязательно достигается. Что касается выбора среди уже полученных результатов, то можно показать, что глобальный оптимум для Рк обязательно принадлежит Рк — Рк-i» т. е. является разбиением точно на К классов, и, следовательно, лучший из полученных локальных оптимумов для К классов* (в смысле критерия W) будет разбиением, наиболее близким к глобальному оптимуму. Его выбор разумен и тем более обоснован, поскольку частота появления этого результата велика. Синтез результатов, состоящий в поиске устойчивых форм и построении иерархии (см. 16, с. 50—80]), был бы неудобен (он ограничивал бы полученные результаты знанием разбиения), тогда как в духе нашего метода скорее следует интересоваться локальной структурой данных. Это привело нас к рассмотрению решения, использующего специфическую информацию, предоставляемую методом (знание локальных многообразий максимальной инерции) во всех проводимых вариантах счета, и к введению понятия устойчивых многообразий. 6.4.3.2. Понятие устойчивых осей и устойчивых ^-многообразий После того как выполнено t вариантов счета, замечают, что некоторые оси появляются во всех вариантах, тогда как другие только в 1,2, ..., (/ — 1) вариантах. Определение. Пусть Р* (г) — локальный оптимум, полученный в r-м варианте. Ось L* (г) класса Р* (г) называется устойчивой осью в том и только в том случае, если, каков бы ни был вариант s, существует класс Р* (s), такой, что L* (s) == L* (г), где Vj (s) = Vt (r) (равенства в Rp). Устойчивость оси может быть распознана автоматически. Для этого нужно выполнить проверки, число которых быстро растет с числом вариантов счета и числом классов. Но устойчивые оси можно распознать эмпирически, визуально; численные расчеты (например, единичных векторов осей) позволят подтвердить или отбросить нашу гипотезу. *3амечания. Это свойство показывает важность правильного выбора начального К (Р^ — ^к—1 состоит из разбиений точно на К классов). Если число классов в процессе алгоритма уменьшалось и есть основания считать, что это уменьшение уместно, например, после изучения доли остаточной локальной инерции, то в качестве К можно взять минимальное число классов, при котором результат, полученный с фиксированным априори начальным числом классов, в большей степени соответствует реальной конфигурации. Величина критерия W для различных разбиений помогает сделать правильный выбор К только в том случае, когда эти разбиения состоят из одинакового числа классов. 135
Замечание. Связь с понятием «устойчивых форм». Если существует устойчивая ось, то существует «устойчивая форма», имеющая эту ось в качестве главной оси инерции. В самом деле, существование устойчивой оси есть следствие существования класса, появляющегося во всех вариантах счета, т. е. «устойчивой формы». Напротив, если в действительности не существует устойчивой оси, то «устойчивые формы» выявляют множество аффинных многообразий без большой значимости. w = 0,1231 5 полученных илассоб 0,1278 0,1022 В принципе предыдущие определения легко обобщаются на случай устойчивых многообразий размерности q, большей единицы. Пример. В искусственном примере с буквой Л, просчитанном с К = = 6 и, следовательно, с 6 осями (хотя для описания конфигурации достаточно 3 осей) и-без применения метода поиска эллипсоидов-ядер*, 6 вариантов счета позволили обнаружить две устойчивые оси (появившиеся во всех вариантах) и ось, появившуюся в 3 вариантах из 6 (рис. 6.8). Для тех же данных, обработанных с помощью модифицированного алгоритма с применением метода поиска эллипсоидов-ядер, обнаружены три устойчивые оси для всех вариантов счета (рис. 6.9). *Метод (см. 6.4.4), направленный на подавление влияния случайного выбора начального разбиения с целью достичь глобальный оптимум. 136
6.4.3.3. Заключение Существование устойчивых многообразий, выявленное автоматически или эмпирически, может служить как вспомогательная информация, например, для определения оптимального числа классов или для обоснования полученных результатов. Понятие устойчивых многообразий применимо также при исследовании локальных линейных моделей. 5 полученных классов w-0,0755 Рис. 6.9 6.4.4. Исключение влияния резко выделяющихся точек 6.4.4.1. Эллипсоиды, связанные с />мерным распределением С таблицей данных XJj (card / — /i, card / -^ /?), рассматриваемой как выборка, состоящая из п реализаций /7-мерного случайного вектора, можно связать семейство гомотетичных /7-мерных эллипсоидов, уравнение которых имеет вид (х— g)' V (х — g) =¦¦¦-- С2 (С—некоторая положительная постоянная), A7) где g и V — соответственно среднее и выборочная матрица ковариа- ций для X. Предполагая, что V имеет ранг /?, получим соответственно при С2—1 и С2 = р + 2 индикаторный эллипсоид (см. [16, гл. 2.4]) и эллипсоид концентрации рассматриваемого случайного вектора. 137
Замечание 1. Если V имеет ранг /?, то существует ортогональное преобразование Uy такое, что Uf VU -D, где X,, ..., Хр — собственные значения матрицы V, a U — матрица, столбцы которой являются соответствующими собственными векторами. Пусть z ¦¦- {]' (х — g) — запись центрированного вектора (х — g) в базисе собственных векторов -¦<ЛШ?, XJ~-gJ) ¦<?a(XJ—gJ). Уравнение A7) в этом базисе имеет вид 7' П~] 7 - Г2 Т Р V 72 /У Г2 Замечание 2. Этим поверхностям можно придать следующий вероятностный смысл. Если С2 ¦¦¦-- 1, то уравнение A7) — это уравнение поверхности индикатрисы, т. е. поверхности, которая получается, если для каждого единичного направляющего вектора А в направлении А отложить дисперсию A'VA рассматриваемого случайного вектора. В случае р 1 — это индикаторный отрезок \х — g\•¦¦-¦ а; для р -2— это индикаторный эллипс, заданный уравнением От ai or 2 (У л г? (л') , z"i (х) , - ч (или —~~— -j- -~r—^ 1 в соответствующем базисе) и гомотетичный эл- Af А., липсу инерции этого распределения (что неверно для р>2). Если С2 - /?-?-2, то A7) определяет эллипсоид равной дисперсии. Он получен растяжением в \ р ~\~ 2 раз эллипсоида с С 1. Вероятностный смысл эллипсоида концентрации следующий. Единичная масса, равномерно распределенная в области, ограниченной /?-мерным эллипсоидом, задаваемым уравнением (x-gYV-Ux-g) =¦"=/> + 2, имеет те же моменты порядка 1 и 2, что и рассматриваемое распределение. Отрезок концентрации случайной величины со средним g и дисперсией а имеет вид \х—g\ ----- а|/3. Эллипс концентрации двумерного случайного вектора в два раза больше индикаторного эллипса: г\ (х) . г\ (х) __ ][ 138
Частные таблицы X1/, связанные с классами, позволяют определить эллипсоиды, уравнения которых в системах локальных координат имеют вид а=1 где q < р и (фа^ (х — gJk), а ^ 1, ...,/?) — вектор координат некоторой точки х из Rp в системе (с началом gJk) главных осей инерции класса k. Этим поверхностям можно приписать следующий вероятностный смысл. Если С2 — q -f- 2, например при q = р, то поверхность геометрически представляет собой концентрацию «локальных» распределений, связанных со случайным /?-мерным вектором Xjh . Если q<p, то поверхность представляет собой концентрацию маргинального q- мерного распределения, полученного проектированием исходного распределения на подпространство, порожденное ср1)?г, ..., фд,&. Эти поверхности используются в алгоритме факторного типологического анализа для исправления некоторых нежелательных эффектов. 6.4.4.2. Эффект цилиндра Эффект цилиндра показан на рис. 6.10. В случае q — 1 начальные оси, выбранные случайным образом, не соответствуют конфигурации данных. Индивидуум i, далекий от элементов из класса 1, находится очень близко от Ль его вклад в эту ось весьма весомый, что мешает этой оси повернуться в процессе алгоритма. Показанная тенденция к получению цилиндрических классов в случае ц '-~- 1 нашла отражение в названии этого эффекта. Для модификации алгоритма введем понятие ядра класса. 6.4.4.3. Ядра класса Определение 1. Рис. 6.10 vx одру (k) [Фа, k W]2 Таким образом, ядро — это множество элементов класса, лежащих внутри индикаторного эллипсоида, если С = 1, и эллипсоида с полуосями CYK^k в общем случае фиксированного С > 0. 139
Определение 2. Ядро порядка q имеет вид Таким образом, ядро порядка q — это множество элементов класса, которые проектируются на ^мерное многообразие главных осей инерции внутрь проекции индикаторного эллипсоида. Замечание 1. Принадлежность к ядру влечет принадлежность к ядру порядка qy т. е. внешние точки ядра порядка q являются внешними точками индикаторного эллипсоида, обратное неверно. Замечание 2. Размер эллипсоидов зависит от параметра С. При вероятностной гипотезе, что каждый фактор za является случайной величиной N @, ]/~А,а), можно дать некоторые указания по выбору С. 9 В самом деле, при справедливости этой гипотезы величина 2 ?а (*)/ Аа распределена как %2 с q степенями свободы. Тогда можно вычислить (см. таблицы Фишера в [3, с. 5591), в зависимости от q и желаемой вероятности A—р) попадания в эллипс, величину %р> такую, что Р(Х2>Хр)^Р. Пример. Для q=^ 2 в соответствии с таблицей Фишера индикаторный эллипс случайного нормального двумерного вектора содержит долю совокупности между 30% (С2 = 0,713) и 50% (С2 = 1,386); эллипс концентрации — между 80% (С2 = 3,219) и 90% (С2 = 4,605). При С2 = 9,210 эллипс содержал бы 99% совокупности, Р (х2 ^ 9,21) = - 0,01. 6.4.4.4. Модифицированный алгоритм Новыми основными функциями являются / и g (рис. 6.11), так что Разбиение 9 многообразия представительстба нлассоЬ 9 ^ яора нлассоЬ * > представительства ядер ^Разбиение Рис. 6.11 Ъ - hog; / = fog', где / и g—функции, определенные в 6.2.1. Отображение h : LK^>- [$> (Е)]к определено следующим образом: q где а=1 (N.B. card N'L априори неизвестно.) gf —^это отображение gy распространенное на множество [,3d (E)]k. 140
В процесс одной итерации исходного алгоритма включается, таким образом, поиск ядер классов и многообразий главных факторов этих классов, т. е. на каждой итерации и для каждого класса исключают точки, проекции которых на ^-мерное многообразие лежат вне проекции индикаторного эллипсоида, и, следовательно, эти точки лежат вне этого эллипсоида. Исключение таких точек влечет, вообще говоря, изменение положения осей, особенно в случаях, аналогичных приведенному в 6.4.4.2. В самом деле, для q -= 1, например, если х не принадлежит ядру, то zl (x) > У\ и, следовательно, вклад точки х в ось 1 важен (по крайней мере он больше среднего вклада других индивидуумов). Исключенные индивидуумы — это те, которые в наибольшей степени «объясняют» ось. Удаление их позволяет видеть, только ли благодаря им ось занимает свое положение. 6.4.4.5. Эффект применения метода в примере, описанном в 6.4.4.2 Ось ядра класса Pi индидидуум, исключенный из А точки, исключенные из Рг 1. Поиск ядер и их осей (здесь ядра ограничены отрезками) 2. Раз5иение, полученное исходя из осей ядер и осей нобых Kimccob /* / * .{;¦ \ \ I 3. Разбиение, полученное б результате сходимости алгоритма Рис. 6.12 141
Замечание 1.Модифицированный алгоритм не сходится. Замечание 2. Использование метода, описанного выше, должно быть ограничено и рассматриваться лишь как способ коррекции, возможно, плохого случайного начального выбора разбиения. Замечание 3. Этот метод применяется только с 3-й итерации и в процессе ограниченного числа итераций, что, как правило, достаточно для исключения эффекта цилиндра. Можно либо фиксировать априори число итераций, либо прекратить использование этой модификации алгоритма, как только критерий перестанет убывать. Замечание 4. Метод оказывается очень эффективным при обработке данных, представляющих собой узлы* на плоскости. 6.4.4.6. Приложение: классификация анонимных индивидуумов В факторном типологическом анализе поиск классов сопровождается их характеризацией; полученная типология описывается множеством К аффинных многообразий, она может быть также охарактеризована К функциями близости 6t, ..., 6,-,..., бх, где V/ 6* --= D ( • , L<)— мера близости индивидуума и 1-го аффинного многообразия типологии. Будем определять принадлежность нового индивидуума s к классу, вычисляя и сравнивая значения в точке s К функций близости: Например, согласно исходному определению!) (см. 6.2.1) где набор \giy (фа, ь а = 1,..., q)] характеризует Lt и где фа, г — оператор проектирования на ось efjy определенный формулой фа,,- (s — ~~ Si) = <6!v» sJ —Si > м {s рассматривается как дополнительный индивидуум при анализе /-го класса). Заметим, что в этохм частном случае типология индуцирует разбиение Rp на К областей С1$ ..., Си ..., Ск, разделенных гиперплоскостями так, что С, = {хе Rp \ V/ 6 ]К] U ?=i -Ф dh (х, Lt) < d% (x9 Lj))}. Можно считать, что принадлежность точки х к области Ci влечет, естественно, принадлежность ее к классу /. Однако необходимо отметить, что, отождествляя принадлежность к классу i и принадлежность к области С,:, мы не принимаем во внимание различия в численности, форме и дисперсии классов. Можно считать более обоснованным отнесение индивидуума s к классу /, если он принадлежит этому классу по предыдущему критерию *3десь авторы используют известный топологический термин. — Примеч. ред. 142
и, кроме того, если он при проекции в Lt попадет внутрь эллипсоида концентрации, т. е. dh(s, L?)--~ min d&(s, Lj) /W1 A;(s)---- V \tpaJ(s- a 1 В других случаях при рассмотрении меры близости A/ is) между 6 и L,- можно определить такое наименьшее число nt (s), что Аг (s)-<^ n, (s), и, следовательно, знать положение s относительно эллипсоидов, гомотетичных индикаторному эллипсоиду. Это позволяет, в частности, решить проблему граничных точек: если им (s, Lt) - d%i (s, /-у) и ;z/ (s) < я7- (s), то индивидуум s может быть отнесен к Pt, даже когда cf^ (s, Li) -- dh (s, Ly) < в и л* (s)< </ + 2 < /г7- (s). . Тем не менее в принятии решения, куда отнести индивидуум, мера близости б,- предпочтительнее, так как она согласована с алгоритмом, чего нельзя сказать о А/. Замечание. В случае когда разбиение получено с помощью алгоритма ANATYP-B (локальные метрики), 6; (S) \i (S)dhi (S, I;), если, кроме того, система масс для каждого класса нормирована, то б,- (s) fx/ (s)dh. (s, Lt) и точка, имеющая близкие «расстояния» до двух классов, относится к тому классу, масса которого больше, поскольку \ij(s) - \х (s)/f^. A4.5. Сходимость и критерии остановки алгоритма Мы видели (см. 6.2.3), что алгоритм сходится, достигая несмещенный элемент, т. е. разбиение /\ такое, что f r g (P) Р. Для контроля за сходимостью алгоритма удобно использовать критерий, оценивающий «количество информации» (см. 19, с. 56]), измеряющее объем изменений индексов классов индивидуумов при переходе от одного разбиения к другому на шаге алгоритма. 6.4.5.1. Остановка алгоритма, когда достигается несмещенный элемент Информацию о принадлежности индивидуума к классу рассматривают как наименьшее возможное количество информации. Если К — число требуемых классов, то определение единицы выбранной информации является определением свойства с К модальностями (появления события среди К равновероятных). Таким образом, можно ввести следующее понятие. Пусть Р<п~1) и Р(п> — два разбиения (содержащие, возможно, пустые классы) множества Е. Средняя условная информация, содержащаяся в разбиении Р(">, когда известно Р(п-г\ определяется так: 143
2 card ь <е]К] /e]K] X Можно доказать следующие предложения: 1. Im (PM/pin-*)) = 0 тогда и только тогда, когда Р*"-1) является измельчением или совпадает с Р(п). 2. /m (/>(л)/Я(л-1)) г 1 тогда и только тогда, когда точки каждого класса р\п~1) распределены равномерно во всех классах Р/л). 3. Во всех остальных случаях 0< Im (Jp<n>/Jp(n-1>) <; 1. Отсюда видно, что если Im (/><")//><"-D) =-.-.. О для некоторого /г, то каждый класс из Р^--1) при переходе к Р^п) целиком входит в некоторый класс разбиения Я*"-1). Тогда в случае равенства числа классов в Р(п~1) и рео получаем, что ре»-1) ^ Р("), разбиение Р<п-{) несмещенное; противоположный случай встречается на практике редко. Проверка значения критерия /т проводится в алгоритме сразу после получения разбиения Р<"> для того, чтобы выявить, возможно, несмещенный элемент (в этом случае «экономят» итерацию, т. е. К локальных факторных анализов). Тем не менее на практике возможно и даже желательно, во избежание слишком большого числа итераций, останавливать алгоритм, как только получают разбиение, достаточно устойчивое в смысле, который мы сейчас уточним. 6.4.5.2. Устойчивость разбиения Считают, что разбиение Р устойчиво, если: 1) условная информация, содержащаяся в p("-iл) при известном Р^п\ меньше некоторого порога, который задается на основе сведений о данных; 2) переход от P<n> к Р^-И) значимо не меняет величину критерия W и q полученных аффинных многообразий. Это понятие устойчивости обосновывает процедуры остановки, описанные в 6.2.3.3. -6.5. ПРИМЕНЕНИЕ К СЖАТИЮ И ВОССТАНОВЛЕНИЮ СПЕКТРАЛЬНЫХ ХАРАКТЕРИСТИК РЕЧЕВОГО СИГНАЛА 3.5.1. Данные Данные, представленные П. Грэйо, получены с помощью преобразователя (ВОКОДЕР)*, разработанного и реализованного отделением *«ВОКОДЕР имеет то преимущество, что он может быть использован как в анализе, так и в синтезе». В анализе речевой сигнал преобразуется в выборку от 25 до 100 отсчетов в секунду в соответствии с рассматриваемым случаем и анализируется с помощью 10—15 фильтров, перекрывающих телефонную полосу частот. Таким образом, собранные данные служат для того, чтобы синтезировать слово с помощью аналоговых фильтров (см. [11]). 144
Е. Т. A. CNET в Ланионе. Они были объектом различных исследований (см. [10], [11], [12]), уже опубликованных или подготавливаемых к печати. Рассматриваются выборки, полученные из речевого сигнала с помощью 12- или 14-канального преобразователя. Каждая выборка / описывается 12 или 14 уровнями Сц, j = 1,12 или 1,14, закодированными в логарифмической шкале с помощью 4 бинарных символов, следовательно 0 ^ Сц ^ 15. С помощью факторного типологического анализа мы последовательно обработали: 55 выборок (полученных с помощью 12-канального преобразователя) семи изолированных устных гласных звуков А, О, 1, U, OU, Е, EU(cm. 6.5.4). Массив из 387 выборок, представляющих собой кодирование следующих фраз: «Слепая страсть неистовых», «Бульон подан на стол»; 1187 выборок (полученных с помощью 14-канального преобразователя) LOGATOMES, т. е. изолированных слов, не имеющих смыслового значения со структурой C.V.C.*. 6.5.2. Исследования, выполненные в Ланионе Данные «сжимаются» с помощью факторного анализа соответствий, затем восстанавливаются с помощью синтеза согласно процедуре, схема которой представлена на рис. 6ЛЗ. Преобразованные Сжа тые Босс та но бленные исходные »- данные »- данные данные. (q qj а кто роб) (порядка q,] Проекция на q Формула главных срантор- восстановления Лнализ нш осей порядка 9 Синтез (преобразователь) (преобразователь) Исходное Восс тановленное слово слово Рис. 6.13 Изучение матрицы ошибок, полученной исходя из критериев восприятия, позволяет сравнивать исходное и восстановленные слова и оценить потерю внятности. Проделанные исследования показывают, что «в целом факторный анализ очень хорошо объясняет результаты теста». В частности, «доля объясненной инерции очень сильно коррелирует с качеством восстанов- *Т. е. со структурой «согласная—гласная—согласная». — Примеч. пер. 145
ления» (см. [10]). Последнее наряду с некоторыми неудобствами, описанными в ill], побудило исследователей CNET модифицировать систему на основе факторного типологического анализа *. 6.5.3. Вклад факторного типологического анализа Вносимые изменения состоят, с одной стороны, в «сжатии» данных при помощи факторного типологического анализа, что позволяет определить самые подходящие (т. е. объясняющие самую большую долю инерции) системы осей G или 8 в зависимости от данных), а с другой стороны, в использовании формулы восстановления данных в терминах локальных факторов. Исходные данные, полученные во~* кодером Предварительная нлассифи- кация Ответвление на одну из систем подходящих осей Матрицы *ак^ роб Восстановление с помощью параметров оставленной системы осей Воспроизведе ние данных Вокодером /4 Период И Период к!лас с 1U Период \Ч Рис. 6.14 Вся обучающая выборка предварительно «ответвляется» на одну из систем осей (наиболее подходящую в смысле меры близости D), сжимается, затем восстанавливается исходя из локальных факторов системы оставшихся осей. Систему сжатия-восстановления можно представить в виде схемы, как показано на рис. 6.14. При восстановлении речи также отмечается отчетливое улучшение результатов (лучшая внятность и большее сжатие обучающих выборок). Для примера приведем (см. [11]) результаты сравнения рассмотренных систем сжатия-восстановления на обучающих выборках логатом, структура которых наиболее показательна: * «Мы пришли к этой более предпочтительной системе по следующим причинам: 1) тесты восприятия убедили нас в том, что лучше иметь различные оси для звуков гласных и переходных; 2) старый алгоритм чувствителен к особенностям источников речи (такие алгоритмы называются дикторозависимыми. — Примеч. ред.); 3) факторный анализ отдает предпочтение точкам, наиболее удаленным в ущерб близким от среднего, что явилось причиной некоторых плохих восстановлений» (см. [12]). 146
Исходные данные логатомы звуки 79 % 92 % Исходные данные логатомы звуки 65 % 87 % 5 факторов логатомы звуки 63 % 85 % 2 фактора (8 классов) логатомы звуки 62% 85,5% Выход схемы 1 (см. рис. 6.13) Выход схемы 2 (см. рис. 6.14) Таблица показывает преимущество системы по второй схеме. Для выборки, кодировка которой первоначально требовала 64 бит, теперь можно обойтись только 23 или 24 битами. Таким образом, расход составляет 3/8 первоначального, т. е. на 2400 e.b/s расход всего лишь 900 e.b/s. 6.5.4. Примеры анализа гласных Анализ соответствий, выполненный на сгущении из 55 гласных звуков, выявил первую факторную плоскость, объясняющую 75,22% инерции, из которых 51,30% приходится на 1-ю ось. Данные, обработанные с помощью факторного типологического анализа и разделенные на 2 класса, затем на 7 классов, распределились так, как показано на рис. 6.15. * / 8 * А • 4 * А • А • А • А • А * А 2 8 * 0 * 0 " 0 > 0 > 0 0 * 0 > 0 - 3 7 \ > / / t ! [ 8 и - и •• и и и 1- U и и 5 8 • QU ои ои ои • ои • ои • > ои ои 6 в * Е Е Е Е Е Е с 7 • в • > EU * • EU ' EU EU EU > EU • > EU EU Разбиение на 7 классов • А « а • А * А • А * А « й • и • и - и * и - и • и * и • и . Е • • ? • * ? • • Е ' - Е ¦ ? ¦ • Е * * ^ • EU * EU • ?0 • EU * • ?i/ * 0 • ¦ * 0 • » 0 ¦ • 0 * » / • • / « » / ¦ , / *¦ / » * / » / • OU - ои ои » 00 * 00 * >¦ 00 *¦ ои ои Доля объяснением инерции 7/ U2 % .9/, 61 % 2-я ось Разбиение на 2 класса Рис. 6.15 147
Класс 1 А 81,95 91,6 82,76 92,49 Класс 2 0 55,48 74,6 62,42 78,21 Класс 3 / 57,33 81,81 54,79 88,60 Класс 4 и 75,40 88,52 68,86 86,50 Класс 5 OU 87,10 94,69 76,95 94,87 Класс 6 Е 52,03 69,23 42,55 66,0 Класс 7 EU 57,47 88,66 66,47 85,85 ANATYP-A ANATYP-B Таблица позволяет сравнить долю объясненной инерции для каждого класса с долей объясненной инерции при глобальном анализе. Одно и то же разбиение получено с помощью алгоритмов ANATYP-A и ANATYP-B (т. е. с метрикой %2 глобальной и локальной). 6.6. ЗАКЛЮЧЕНИЕ В практическом отношении полученные результаты обнадеживающие. Как средство классификации факторный типологический анализ обогатился возможностями факторного анализа: знание формы сгущения, глобальные и локальные визуализации ситуации, описываемой таблицей данных, интерпретация с помощью сокращенного числа признаков, восстановление данных по ограниченному чцслу факторов и т. д. способствуют более полному описанию получаемого разбиения на классы. * Совокупность аффинных многообразий, полученная в итоге действия алгоритма, составляет «скелет», более близкий к сгущению, чем одно аффинное многообразие, определяемое с помощью глобального факторного анализа, который, с этой точки зрения, соответствует случаю, когда априори предполагают существование единственного класса. Привнесение алгоритма динамических сгущений делает возможным обнаружение и анализ локальных подсовокупностей, которые выделяются не случайным образом, а в результате более точной аппроксимации данных. Это особенно интересно в случае больших таблиц, когда факторный типологический анализ позволяет как бы применить увеличительное стекло в направлениях или на плоскостях, дающих наилучшее локальное представительство этих таблиц. Факторный типологический анализ можно считать, следовательно, эффективным при выделении однородных групп внутри совокупностей и получении типологии поведений их подсовокупностей, но он относительно дорогостоящий, поскольку на каждом шаге алгоритма вплоть до его сходимости нужно выполнить столько факторных анализов, сколько выделено классов на этом шаге, и лишь многочисленные применения в совершенно разных областях позволят нам говорить, что сила рассматриваемого метода исследования компенсирует это не- 148
удобство; эти применения позволят, кроме того, накопить опыт в выборе метода, наиболее отвечающего природе решаемых задач. Различные направления приложений или обобщений появляются естественным образом: моделирование, обработка таблиц с восстановлением пропущенных данных по локальным факторам (см. 6.3.4.2), расширение множества начальных факторных гипотез и поиск нелинейных факторов. Некоторые направления кажутся особенно интересными, например относящиеся к задачам восстановления таблиц данных по ограниченному числу локальных факторов. ЛИТЕРАТУРА 1. BenzecriJ. P. A973) L'analyse des donnees. Tomes I et II. Dunod. 2. С a z e s P. A975) These de Doctorat de 3eme cycle. (L. S. M.). З.'СгагаегН. A966) Mathematical methods of statistics. Princeton University. 4. Cailliez, Maille, Nakache, Pages A971) Analyse des donnees multidimensionnelles. С. ЗЕ. 5. D i d а у Е. A972) These de Doctorat d'Etat. 6. D i d а у Е., SchroederA. A974) A new approach in mixed distribution detection. Rapport de Recherche, № 52, IRIA-Laboria. 7. DidayE., GovaertG. A974) Rapport de Recherche, № 89, IRIA-Laboria. 8. Lebart, Fenelon A971) Statistique et informatique appliquees. Dunod. 9. С 1 о u t i e r E., L e s t r a d e D. A974) Classification et interpolation. Rapport de stage D. E. A. Laboratoire de statistique mathematique de Paris VI (J. P. Benzecri). 10. Cart ierM., GraillotP. A974) Compression et reconstitution de donnees spectrales. C. R.5 eme journees d'etude sur la parole. Orsay. 11. Graillot P. A975) Projection, compression et reconstitution de donnees spectrales de la parole. Bulletin de Tlnstitut de phonetique de Grenoble. 12. GraillotP. A975) Systeme pour la transmission a tres faible debit. Rapport des activites 1975 en acoustique au CNET Lannion. 13. DidayE. A973) Introduction a Г analyse factorielle typologique. Rapport de recherche, №27, IRIA-Laboria. 14. DidayE., Schroeder, Ok Y. A974) The Dynamic Clusters method in pattern recognition. Information Processing. 15. О k Y. A975) Analyse factorielle typologique et Hssage typologique. These de 3eme cycle Universite de Paris VI. 16. L i n n i с k A963) Methode des moindres carres. Dunod.
Глава 7 • ДИСКРИМИНАНТНЫЙ ТИПОЛОГИЧЕСКИЙ АНАЛИЗ 7.1. ВВЕДЕНИЕ 7.1.1. Задача дискриминации В дискриминантном анализе речь идет о выделении переменных (называемых объясняющими), которые наилучшим образом подтверждают заданное априори разбиение множества объектов на классы (дескриптивный дискриминантный анализ), затем, возможно, о построении правила отнесения объекта к классу (дискриминантный анализ принятия решений). В факторном дискриминантном анализе речь идет о нахождении линейных комбинаций объясняющих переменных, называемых дискриминантными факторными осями, проекции на которые классов априори заданного разбиения будут наиболее однородными и наиболее разнесенными друг от друга (см. [2]). Дискриминантный типологический анализ применим в случае, когда априори заданные классы малоизвестны и разбиение на них может быть поставлено под сомнение по разным причинам: необходимо более точное разбиение, границы классов размыты, некоторые классы следует объединить, так как они не различаются с помощью объясняющих переменных и т. д. Его цель — поиск разбиения на К классов и одновременно наилучшей дискриминантной плоскости (или гиперплоскости). 7.1.2. Отсрочка в обосновании априорного разбиения на семейства Задание априорного разбиения выборочной совокупности Е основано на гипотезе о структуре данных. Желательно уметь выделять это разбиение локально, чтобы учитывать бесспорно однородные группы объектов. В многочисленных случаях возможность такого априорного разбиения допускают по разным причинам. а) Поставленная задача может изучаться в соответствии с разными подходами. Например: в контроле качества продукции типы продукции могут быть выделены априори из-за дефектов функционирования или дефектов производства (см. обработку банка промышленных данных в гл. 8); в естественных науках к исследованию подходят с различных позиций — физики, химии, биологии ...; в медицине различают симптомы, причины, лечение и т. д. 150
Априорное выделение типов приводит к разбиению совокупности Е (на непересекающиеся классы), которое и определяет, вообще говоря, выбор подхода к задаче дискриминантного анализа. Если это не так, го приходится увеличивать число классов. Полученное при этом разбиение иногда субъективно, и, естественно, возникает желание иметь метод, допускающий отсрочку в окончательном выборе этого разбиения. В самом деле, возможно, что группа индивидуумов Z, однородная и (или) изолированная в выборочной совокупности Е и отличная от каждого априорного класса, сможет получить интерпретацию при другом подходе. б) Границы классов, определенных априори, могут быть произвольными (определяемыми порогами) или неточными. Например, при двух классах типа «присутствие — отсутствие» может не существовать объективной и точной границы. Определение априорных классов зависит, например, от выбора числового порога, если изучаемые данные получены в результате измерения, либо классификация индивидуумов Ы частности, выборочной совокупности) является результатом экспертной оценки. В последнем случае классификация может зависеть от эксперта и даже от порядка появления индивидуумов. По этим причинам метод должен допускать отсрочку в окончательном задании границ классов. А именно может оказаться, что априорное разбиение слишком детальное, или, наоборот, слишком грубое в том смысле, что в граничных зонах между классами желательно ввести новые классы (которые, возможно, следует назвать «неопределенными»). Когда априорное разбиение также спорно, предпочитают, вообще говоря, заменять дискриминантный анализ анализом главных компонент [2] или соответствий [11, а также классификацией. Но при таком подходе дискриминантные (или частично дискриминантные) параметры априорных классов и шумовые переменные имеют одинаковые веса. Априорные семейства при этом могут стать плохо распознаваемыми, и приходится сделать вывод, что признаки, характеризующие объекты , не позволяют их классифицировать. Например, известно, что факторный дискриминантный анализ (ФДА) [8.1 дает лучшее, чем анализ главных компонент (АГК), разделение априорных классов. В самом деле, ФДА сгущения объектов, разделяемых на К классов, эквивалентен АГК сгущения G — центров тяжести классов (с метрикой V*1, определяемой матрицей, обратной к матрице ковариаций параметров) 1111. Оси минимальной инерции сгущения G, которые несут мало информации с точки зрения дискриминации, могут быть осями с большой дисперсией сгущения Е. В этом случае они будут мешать распознаванию априорных классов. 7.1.3. Классификация и дискриминация: дискриминантный типологический анализ Дискриминантный типологический анализ (ДТА) объединяет методы дискриминации и классификации [7]. На основании априорного выделения типов ищут разбиение на классы, наиболее однородные и наилучшим образом разделяющиеся при 151
проектировании на дискриминантное подпространство (заданной размерности /*); метод учитывает одновременно наличие априорных классов и имеющуюся структуру сгущения объектов. Такой подход отличен от подхода, состоящего в проведении классификации с последующим дискриминантным анализом полученной типологии. Дискрими- нантный типологический анализ позволяет, в частности, устранить субъективное, произвольное или неточное задание априорного разбиения на семейства. С другой стороны, в общем случае некоторые априорные классы являются однородными и (или) изолированными и их легко распознать, а некоторые имеют большую дисперсию или трудно разделимы, они мешают надежному распознаванию первых, и желательно в ходе анализа иметь возможность их модифицировать. В частности, можно перегруппировать априорные классы или разбить некоторые из них на более однородные группы. Пространство Rp объектов снабжено для каждого анализа метрикой, определяемой матрицей J/-\ обратной к выборочной матрице ковариаций параметров. Таким образом, в ДТА различаются методы, которые используют: фиксированную метрику, зависящую, впрочем, от разбиения множества Е\ адаптивную метрику (см. гл. 12.2); адаптивные локальные метрики (см. гл. 12.5). ДТА производит линейное адаптивное преобразование переменных с целью отделить для дискриминации полезную информацию от мешающей [7]. В ДТА различают также: методы, использующие выбор параметров [8], методы, использующие нелинейное преобразование переменных [51 7.2. ПРОСТРАНСТВО ПРЕДСТАВИТЕЛЬСТВ Представительство каждого разбиения на k классов содержит часть, общую для всех классов [4, гл. 1, § 4.2] с Lt = (аг1 С), где С — общая часть для всех Lb..., Lki поэтому L можно записать проще: L = @1,..., ah, С). Предположим, что задано целое г (I ^ r ^ k — 1) и С — семейство из г 1/~1-ортонормированных векторов пространства Кр: С= (иг, ..., иг). Итак, представительство задается в виде набора L = (аъ ..., ал, «!,..., иГ), где #!,..., ak — k точек (центров) bRp, &x,..., ur — г векторов из Rp, удовлетворяющих условиям: 152
u'sV-lut^O9 1< Множество всех таких представительств обозначается через Lkyr. 7.3. КРИТЕРИЙ 7.3.1. Определение На множестве Pk X Lkyr определим критерий IF следующим образом. Пусть L ¦¦-= (aly...y ah, uly ...y ur) ? L/j>r, f/ — векторное подпространство в R*7, порожденное %, ..., иГУ I (aiy Piy U) — инерция класса Pt относительно точки aiy объясняемая U'. По определению W (P,L)— V / (ah P-, /7). Положим Li = {аи (%,..., «г)) и D (Pf, LO - / (af, P,-, (/). Тогда критерий IF (P, L) запишется ^ (P, L) == 2 О (Piy Li). Замечание. Гипотеза 1 из 1.3.1 относительно единственности представительства L, доставляющего минимум W (Р, •) при фиксированном Р, в данном случае неверна. 7.3.2. Частный случай Если L ^ (gly ..., gft, ult ..., мг), где ^ — центр тяжести класса Pi A < i < й) разбиения Р -.- (Ръ ..., рЛ), то IF (P, L) — внутриклассовая инерция (Г inertie intra-classe) разбиения Р, объясняемая (У: lF(P,L)-/lntra(/\ f/). 7.3.3. Математическое выражение критерия в терминах меры близости 1. Если через du обозначить меру близости точек в R*7, определяемую формулой du (*, У) =¦¦ (хи — У и)' V-1 (хц — Уи), 153
где хи и уи — ^-^-ортогональные проекции точек х и у на подпространство U, то В рамках общей схемы алгоритмов МДС следует положить: D (x, Lf) =--¦-- db (xy щ). 2. Для каждой точки х в Rp имеем: г г Из К~ ^ортогональности векторов и1у..., иг и из того, что u's V (x — у) — скаляр, имеем: г s -- 1 Так как (us V и*) -- 1, 1 ^ s ^ г, то г du{xyy)'~- V, (х-—у)' V~lusiis V~x(x — у), S -¦-•: 1 dd(xyy)^-(x—y)'V-1l v /,sW;) i/-i(x—у), (I) или иначе г db (х, у) --¦ ^ ^ 1/^1 (^"^ (я—У)' v~l us- № 7.4. ФУНКЦИЯ ПРЕДСТАВИТЕЛЬСТВА Найдем функцию g, определенную на Ptl со значениями в L/, г, такую, что для всякого разбиения Р ? Pk - min W (P, L). Для каждого подпространства U и каждого подмножества Л из ? известно, что (теорема Гюйгенса для объясненных инерции 181) min/(а, Л, U)^I(gA,A,U), где ?л — центр тяжести множества А. Отсюда выводим, что для каждого подпространства U min y\ I (ah Ph U) ^ j? / (git Piy U)y где gi — центр тяжести класса Pt A ^ i ^ й). 154
Как уже отмечалось, величина в правой части равенства есть /mtra (Л U) — внутриклассовая инерция разбиения Р, объясняемая U. Таким образом, min W (Р, L) = min /lntra (Р, [/). C) L^Lk,r U Предложение 1. Сгущение G^(gly ...,gft) центров тяжести классов Pj,..., Р/о снабженных весами ^, ..., ^~ (где пг — число элементов в классе Р,), и сгущение Е объектов, снабженных равными весами —, имеют один и тот же центр тяжести. Доказательство. Пусть g0 — центр тяжести сгущения Е: go = y, х/п. х&Е Имеем откуда 1 — st-у 2 Предложение 2. Для каждого подпространства U сумма внутриклассовой и межклассовой инерции (l'inertie inter-classe) разбиения Р, объясняемых U, равна инерции сгущения Е, объясняемой U : Доказательство. По определению: 2 d Согласно A) dy (x, у) имеет вид db (х, y) = (x — у)' М (х — у), где 2 s= 1 155
Следовательно, / (Е, U) ,- ^ — (x-go)' M п k k 2У —(х—gty м(х—giH-'V -^—{gi- i = l д:бР. k 1 / (?, I/) - /lnter (Я, ?/) + /lntra (/>, U) + Поскольку 2 ~х— ~ gt == 0, последнее слагаемое равно нулю. Пред- яп п х я.п п ложение доказано. Предложение 3. Для каждого подпространства U размерности г инерция / (?, U) постоянна и равна г. Доказательство. Пусть (и1У ..., иТ) — У^-ортонормированный базис в U. Имеем с учетом B): /(?,{/) =22 -j^V-Hx-goJix-goW-1^ = ^ s = 1 2 "; V-I B—^-««) <*-«•)') V'1 "в = 2 us v-lvv-lus-= 2 s=l s=l Из соотношения (З) и предложений 2 и 3 получим: min W (Л I) = min (r — IinieT (Р, Щ) = г — max /inter (Л (/). LeLfcfr С/ </ 7.4.1. Поиск max /1п1ег (Л ?/) [7] Речь идет о задаче анализа главных компонент [2]. Разыскивается подпространство размерности г, которое доставляет максимум инерции сгущения G, объясняемой этим подпространством. Подпространство, порожденное векторами uly...t ur, определенными ниже, 156
является решением этой задачи оптимизации. Пусть ul9...> ur — собственные векторы, соответствующие г наибольшим собственным значениям матрицы В (Р) У, где В (Р) — матрица межклассовой инерции разбиения Р, т. е. матрица инерции сгущения G, определенная следующим образом: h О Точнее, пусть кг ^ к2 ^ ... ^ кг ^ 0 — г наибольших собственных значений матрицы В (P)V-1. Собственное значение к кратности т > 1 рассматривается как набор собственных чисел ks = ks+1 = ... = ^ / ^ (+ К ) 7 / Если Xs — простое собственное значение, то us определяется как где et обозначает /-й вектор канонического базиса в R? и где is — наименьший индекс i, такой, что е% не У~1-ортогонален к собственному подпространству Е8, соответствующему к8. Если к — кратное собственное значение кратности т > 1, к= = к8 = ...= X,;, где / = min (s-fm — 1, г), то и8, ..., И; определяются следующим образом. Пусть is — наименьший индекс i, такой, что et не УР-1-ортогонален к собственному подпространству ?\, соответствующему к. Обозначим через vs У~1-ортогональную проекцию вектора eis на подпространство ?\ и возьмем в качестве us вектор vJVvs'V"^. Далее, для t, s+1 ^t^j, определим векторы щ по индукции. Пусть et—подпространство, порожденное векторами и8, ..., щ~и и Е^ Q et — У~1-ортогональное дополнение подпространства zt в^ Е%. Пусть it — наименьший индекс ?, такой, что et не У""х-ортогона- лен к Ex Q e-t. Тогда обозначим через vt У~1-ортогональную проекцию вектора ei% на подпространство E%Qzt и возьмем в качестве щ вектор — Vf . Vvi V-*vt 7.4.2. Вывод: функция представительства Пусть Р = (Pi,..., Рл). Положим g- (P) = (gj,..., g-fe, wlf ..., wr), где gt — центр тяжести класса Pt (i = 1,..., k) и и1у..., ^определены в 7.4.6. Имеем /inter (P, U) - S ^, откуда W (P, g (P)) - г — 2^s. s=l s=l 157
Замечание I. В программе информатики приходится диагонализо- вать симметричную матрицу порядка k (&, вообще говоря, всегда меньше /?, порядка матрицы В (Р) V~x) 16]. Замечание 2. Ьх = У-1^,..., bT = V~xur — г первых дискрими- нантных факторов разбиения Р. Они реализуют: последовательные минимумы (при условии ^-^ортогональности) отношений внутриклассовой дисперсии к полной дисперсии фактора Ь\ последовательные максимумы (при условии V~l -ортогональности) отношений межклассовой дисперсии к полной дисперсии фактора Ь. 7.5. ФУНКЦИЯ НАЗНАЧЕНИЯ В этой главе общее определение функции назначения дополняется следующим условием: при работе алгоритма в случае, когда нельзя определенно отнести х к элементам разбиения Рп (п~^ 1), т. е. когда принимают во внимание разбиение РпЛ\ если х принадлежит к одному из классов р\п'~Х) или Р\п~~{\ он остается в классе с тем же номером; в противном случае х относят к классу с меньшим номером. 7.6. СХОДИМОСТЬ АЛГОРИТМА В общее доказательство сходимости алгоритма (см. 1.3.6) следует внести некоторые изменения, учитывающие: выбор единого представительства; неединственность представительства, на котором достигается минимум критерия W (P, L) при фиксированном Р. В предложении 1 из 1.3.6 неравенство следует непосредственно из приведенной выше конструкции представительства L(A2) = g (P^-1)). В предложении 2 из 1.3.6 равенство W (P<^\ LW) = W и неравенства W (PiN\ t(jV))>W ) влекут W (P(N) L(yv+1)) —- W 2 2 D( /-1 X(=P(N) i i Так как всякое изменение классов разбиения P^N) при переходе к разбиению P(N+{) обязано сопровождаться строгим улучшением критерия, 158
из последнего равенства вытекает, что P^N) и p(w-H) совпадают. С другой стороны, поскольку отображение g однозначное, имеем Таким образом, получаем: иЛ =-¦ (P(n), /») = uyv+i для всех п > N + 1. 7.7. ПРОГРАММА ИНФОРМАТИКИ DISCRI 7.7.1. Входные данные Помимо таблицы данных, на вход программы DISCRI подаются: начальное разбиение, Р@); при первоначальном анализе в качестве Р<°> выбирают разбиение, определенное априори. При дополнительном анализе Р<°>- выбирается в зависимости от полученных ранее результатов, см. 7.8.1 (максимальное число требуемых классов k задается равным числу классов разбиения Р<0>); размерность дискриминантного подпространства, г; г должно быть выбрано меньшим или равным k—1. При первоначальном анализе г выбирается равным k — 1 (если нет дополнительной информации, то полагают k <; 5). Для дополнительного анализа г выбирается в зависимости от результатов, полученных на предшествующих этапах (см. 7.8.1). 7.7.2. Выходные данные на каждой итерации Значения критерия: собственные значения к\п\ ..., Х(гп)] центры тяжести классов Р[п), ..., Р[п)', класс принадлежности каждого объекта в разбиении Р(пК 7.7.3. Выходные данные к моменту сходимости алгоритма Итоговое разбиение Р* (Р*,..., Я|); центры тяжести gf, ..., g% классов Р*,...Р%\ векторы и*, ..., и* общей части С* итогового представительства; дискриминантные факторы b* V~lu*, ..., Ь* ^ V~x и* классов Ри ..., Р\\ значение критерия W (P*, L*); собственные значения А,*, ..., 'к*; графические представления К^-ортогональных проекций центров тяжести^*, ..., g% и множества Е на плоскости, порожденные парами векторов и* и и%, и% и и* " ... (если г нечетно, то последнее представление дается на диагонали плоскости (и*, и*)). 159
7.8. ИНТЕРПРЕТАЦИЯ РЕЗУЛЬТАТОВ 7.8.1. Определение новых семейств Дискриминантный типологический анализ, начинающийся с априорного разбиения Р@>, приводит к разбиению Р*, А-классов которого определяются с помощью г дискриминантных факторов (согласно функции /, т. е. / (L*) == Р*). Затем производят интерпретацию каждого класса Р* (по отношению к типам, имеющимся априори), отсюда получают разбиение Е на kx классов (kx может быть отлично от k) Z = —- (Zb..., Zkl). Каждый класс этого разбиения: совпадает с некоторым классом Pj0) разбиения Pi0\ или содержится в некотором классе Р/о) разбиения Р<°\ или, наконец, является объединением нескольких классов или подклассов разбиения Р<°>. Дискриминантный типологический анализ, начинающийся с разбиения Z = (Zjl, ..., Zkl), приводит к разбиению Z* на kx классов. Классы разбиения Z, которые остаются устойчивыми в процессе работы алгоритма, сохраняются. Другие классы преобразуются в более однородные. Возможно, что число дискриминантных осей г при этом меняется. Наконец, исходя из априорного разбиения Т множества Е на k классов получают разбиение F множества Е на k* классов F ~ -- (Fly ..., Fk*) и размерность г*, такие, что: классы Fi A ^ / ^ k*) допускают содержательную интерпретацию специалистом (возможно, что некоторые классы для этого подвергаются дискриминации второго уровня, см. 7.8.3); устойчивость разбиения F при дискриминантном типологическом анализе удовлетворительна. В частности, представительство g (F) индуцирует разбиение fog (F), мало отличное от F; иначе говоря, представительство g (F) позволяет определить разбиение F с помощью функции назначения /. Разбиению F =-- (Fl9 ..., Fk*) множества Е соответствует его разбиение .С,, ..., fk* на k* категорий или форм, полученных из априорных семейств и выборки из которых Fly ..., Fk* разделены с помощью решающего правила Я, определенного ниже. 7.8.2. Решающее правило Jf Пусть L -- g (F) - (g-j, ..., gk; щ, ..., ur*) и i == l Объект x относя?'к семейству W/, если (х - gt)'Dv (x - gf) < (x - gi)'De (x - gt), i - 1, 2, ..., k*. Имеем 160
Отсюда выводим согласно 7.3.3, что по правилу Л объект должен быть отнесен к семейству, центр которого является самым близким к нему (в смысле метрики V~x) в проекции (V~^ортогональной) на векторное подпространство U, порожденное иг, ..., иг* (Л отлично, следовательно, от классического линейного решающего правила). Правило Л может быть дополнено визуализацией проекции классифицируемого объекта х на подпространство (/, порожденное Uu ..., иг*. В самом деле, проекция объектов из Е на U позволяет определить граничные зоны между классами Fly F2, ..., Fh и, следовательно, между семействами ?г, ..., ? k. Для объекта х, проекция которого на U принадлежит граничной зоне, решающее правило Л ненадежно. В этом случае специалист может решить, куда отнести х, принимая во внимание апостериорный риск плохой классификации. Можно также определить зону отказа от принятия решения, если специалист считает, что на стадии анализа предпочтительнее создать семейство ^расклассифицированных объектов, чем провести ненадежную классификацию и тем самым сильно увеличить риск. Этот прием особенно уместен в медицинских приложениях, где ошибка классификации может иметь весьма серьезные последствия, а плата за нее не может быть выражена в цифрах. ч Решающее правило Л должно хорошо работать на экзаменационной выборке, т. е. на множестве объектов, не участвовавших в построении Л, относительно которых точно известно, к какому семейству они принадлежат. Использование правила Л оправдано для разбиения на категории, полученные в итоге дискриминантного типологического анализа, поскольку оно строится на основании результатов этого метода. Более того, это правило простое, непараметрическое и имеет то преимущество, что не подвержено влиянию шумовых параметров. В то же время дис- криминантный типологический анализ можно рассматривать как метод дескриптивного и конструктивного (построение нового разбиения) дискриминантного анализа, а на стадии принятия решения применять правило Байеса. 7.8.3. Второй уровень дискриминации Если специалист считает, что разбиение ? = (?г, ..., ? *•) множества Е слишком агрегировано, то он может реализовать второй уровень дискриминации. Для каждой категории ?i A ^ / ^ &*), являющейся объединением семейств fz>1, ..., ?hh, которые необходимо выделить, реализуют локальный дискриминантный анализ, в котором fi — изучаемая популяция, а ?иъ ..., ?ик — априори заданные семейства. Решающее правило представляется глобально в форме Дерева. 7.9. ЗАКЛЮЧЕНИЕ С помощью дискриминантного типологического анализа решают задачу разделения нечетко заданных форм, проводя дескриптивное 6 Зак. 303 161
и индуктивное изучение в рамках линейного преобразования переменных. Этот метод позволяет либо подтвердить задаваемую априори структуру, либо получить из нее структуру, более соответствующую целям классификации и дискриминации. Дискриминантный типологический анализ проводит разделение на классы и дает решающее правило отнесения к этим классам. С его помощью получают, в частности, более надежное распознавание существующих априори семейств. Кроме того, при необходимости реализуют второй локальный уровень дискриминации. Он позволяет получить новые классы (формы), более приспособленные для локального дискри- минантного анализа [3]. Кроме того, визуализация в некоторых факторных осях при классификации нового объекта позволяет учесть издержки плохой классификации, а также вероятности принадлежности к классам, когда геометрическое отнесение к ближайшему центру тяжести представляется малонадежным. В соответствии с потребностями, связанными с реальной задачей, и в соответствии с данными можно реализовать для разбиения, полученного с помощью дискриминантного типологического анализа, пошаговый или байесовский дискриминантный анализ. ЛИТЕРАТУРА 1. BenzecriJ. Р. A973) L'analyse des donnees. Tome 2. L'analyse des cor- respondances. Dunod, Paris. 2. С a i 1 1 i e z P., P a g e s J. P. A976) Introduction a l'analyse des donnees. SMASH, Paris. 3. D i d а у Е. A978) Analyse canonique du point de vue de la classification au- tomatique. Rapport de recherche, № 293, IRIA-Laboria. 4. DidayE., GovaertG.,LemoineY. A978) A new kind of representation in clustering. Proc. of the fourth international joint conference on pattern recognition, Kyoto. 5. Lafaye de MicheauxD. A978) Approximations d'analyses canoni- ques non lineaires de variables aleatoires et analyses factorielles privilegiantes. These de Docteur Ingenieur, Universite de Nice. 6. L e b a r t L, Fenelon J. P. A975) Statistiques et Inrormatique Appli- quees. Dunod ed., Paris. 7. Lemoine Y. A979) Classification et discrimination — Analyse discrimi- nante typologique et applications. These de 3eme cycle. Universite de Metz. 8. Romeder J. M. A973) Methodes et programmes d'analyse discriminante. Dunod, Paris. 9. Saporta G. A975) Liaisons entre plusieurs ensembles de variables et co- dage de donnees qualitatives. These de 3eme cycle. Universite Paris VI. 10. S e b e s t у e n G. S. A962) Decision making process in pattern recognition. The MacMillan Company. • 11. UlmoJ. A973) Differents aspects de l'analyse discriminante. Revue de Statistiques Appliquees, vol. XXI, № 2. 162
Глава 8 • ПРИМЕР ПРИМЕНЕНИЯ ДИСКРИМИНАНТНОГО ТИПОЛОГИЧЕСКОГО АНАЛИЗА ПРИ ПРИНЯТИИ РЕШЕНИЯ В КОНТРОЛЕ КАЧЕСТВА 8.1. ВВЕДЕНИЕ В этой главе приведен пример применения дискриминантного типологического анализа к задаче распознавания образов в контроле качества. Подход с помощью дискриминантного типологического анализа позволил нам построить решающие функции на классах, более подходящих для нашей задачи, чем исходные. Изложение данного подхода интересно по следующим причинам: можно проиллюстрировать применимость дискриминантного типологического анализа к реальной задаче, когда классы, заданные пользователем априори, являются размытыми и должны быть частично уточнены; дискриминантныи типологический анализ является новым методом. Для потенциальных пользователей это приложение дискриминантного типологического анализа является хорошим примером, которому надо следовать, чтобы получить результаты, наиболее соответствующие цели исследования с точки зрения выбора начальных разбиений, числа г требуемых дискриминантных осей, числа k требуемых классов; дискриминантныи типологический анализ занимает промежуточное место среди чисто дескриптивных методов и методов принятия решений. Нам представляется полезным проанализировать это промежуточное положение на примере обработки наших данных. Результаты мы сравним с результатами, полученными с помощью факторного анализа соответствий и пошагового дискриминантного анализа. Сначала описываются исходные данные задачи. Затем показаны последовательные этапы анализа этих данных, позволяющие уточнить априорное разбиение выборки на классы. В последней части приведены решающие правила, построенные на классах, выделенных с помощью Дискриминантного типологического анализа; эти правила оказываются хорошо отвечающими специфике задачи. 8.2. ОПИСАНИЕ ДАННЫХ Цель исследования — разработать методы, позволяющие проводить автоматический контроль качества механизмов вращательного Действия по их спектрам частот. Читателя, который особенно интересуется этой проблемой, можно отослать к работе [2]. До сих пор по- 163
добный контроль осуществлялся путем прослушивания оператором работающего механизма. Субъективный контроль происходит в звуконепроницаемой кабине, где оператор прослушивает механизм, работающий в режиме разгона, а затем торможения. Если оператор не обнаруживает дефектов, то машина признается работоспособной, в противном случае оператор описывает тип шума, и эксплуатация машины прекращается. Экспериментально выделяют следующие типы шумов: гул; гул — это шум от скольжения одних зубцов по другим (шум, как правило, сплошной); удар; речь идет о последовательном ряде маленьких соударений, возникающих в результате дефекта (теоретически — это паразитный удар, откуда и происходит название шума), локализованного на одном или нескольких зубцах. Эти два типа шумов могут быть как при разгоне, так и при торможении. Для обнаружения дефектов удобно различать режим разгона и режим торможения, поскольку в некоторых случаях дефект может проявляться только в одном из режимов вращения. Учитывая разницу между разгоном и торможением, различают 7 субъективных акустических семейств. Выборка. Для нашего исследования мы располагали выборкой из ИЗ машин, разбитой на семь субъективно выделенных семейств. Табл. 8.1 описывает разбиение нашей выборки. Для 113 машин были получены спектры с помощью анализатора Фурье-спектров в реальном времени, который выдает вещественную часть преобразования Фурье сигнала s (t). Этот анализатор преобразует сигнал «амплитуда—время» в сигнал «амплитуда-частота». Мы располагаем, следовательно, 113 спектрами в режиме разгона и ИЗ спектрами в режиме торможения (по одному спектру — разгона и одному спектру — торможения для каждой машины), полученными на установившейся частоте вращения ведущего вала в 75 Гц. Таблица 8.1 Разбиение выборки Априорные семейства Исправные Гул при разгоне Гул при торможении Гул при разгоне и торможении Удар при разгоне Удар при торможении Удар при разгоне и торможении Всего Обозначение И ГР гт ГРТ УР УТ УРТ Число индивидуумов семейства 32 12 12 21 12 12 12 ИЗ 164
Путем субъективного прослушивания разобьем выборку из 113 машин на 7 априори выделенных семейств, предполагается, что это разбиение соответствует реальному состоянию машин (см. табл. 8.1). Сжатие данных. Прежде всего мы построили упрощенное описание спектров с тем, чтобы иметь возможность статистически осмыслить данные. На этом этапе, в основе которого лежала физическая интерпретация спектров, мы представили каждый спектр в виде ряда параметров, выраженных в децибелах и гарантирующих исчерпывающее его описание. На втором этапе, применяя методы дескриптивной статистики, мы смогли проверить и уточнить априорные гипотезы и выбрать параметры, наиболее важные для нашей задачи. Основную роль в этой дескриптивной обработке играл факторный анализ соответствий. Наконец, после того как были исключены мешающие переменные, мы подошли к описанию спектров 12 параметрами, выраженными в децибелах. Проблема принятия решения. Цель нашего исследования — построение методов, позволяющих автоматизировать контроль качества механизмов вращательного действия исходя из их спектров частот. Оригинальность задачи по сравнению с классической проблемой диагностики состоит в том, что даже по мнению специалистов субъективная классификация индивидуумов в данном случае нуждается в проверке: с одной стороны, ухо человека не может обнаружить небольшие отклонения от нормы, с другой стороны, при диагностике возможны просто ошибки. С этой точки зрения метод автоматизированного контроля должен давать возможность в процессе анализа ставить под сомнение априорные разбиения на семейства и допускать их преобразование в объективные семейства, выделяемые на основе данных спектрального анализа. В нашем исследовании исходные гипотезы проверялись, и уточнялись с помощью факторного анализа соответствий. При этом необходимо было учитывать априорное разбиение на классы, так как эти классы позволяют выделить глобальные спектральные характеристики, отражающие их специфику. С другой стороны, в результате анализа обнаружилось, что априорные классы не слишком однородны, некоторые из них расщеплялись и перегруппировывались в такие классы, которые нельзя было предусмотреть исходя только из субъективной классификации. В связи с этим представлялось рискованным строить решающую функцию с помощью методов, цель которых различить семь заданных априорных семейств. Можно было бы попытаться как в факторном анализе или при автоматической классификации использовать итеративные методы, которые выявляют перегруппированные классы, не опираясь на априорные гипотезы. Но и этот путь не кажется нам самым плодотворным. Действительно, априорные классы не лишены смысла и остаются ориентиром для построения решающего правила, а в итерационных методах в равной степени учитываются как дискриминантные, так и мешающие переменные. Эти методы делают слишком большой акцент 165
на том, что к априорному разбиению на классы следует относиться с осторожностью. Здесь интересно было применить дискриминантный типологический анализ. В самом деле, этот метод, использующий как методы распознавания образов, так и методы классификации типа динамических сгущений, позволяет в процессе анализа ставить под сомнение априорные классы и дает возможность построить решающие функции на классах, более обоснованных, чем априорные. 8.3. ПРИМЕНЕНИЕ ДИСКРИМИНАНТНОГО ТИПОЛОГИЧЕСКОГО АНАЛИЗА 8.3.1. Методология Цель дискриминантного анализа состоит в том, чтобы для исследуемой совокупности найти решающее правило, которое дало бы возможность различать априори заданные группы. Это правило должно позволять относить каждого нового индивидуума к одной из групп. Задание априорного разбиения на классы, необходимое для применения методов классического дискриминантного анализа, фактически предопределяет результаты. С другой стороны, очень часто оказывается, что разбиение совокупности на классы имеет элементы субъективизма или даже случайно. Дискриминантный типологический анализ сходен с дискриминант- ным анализом с точки зрения построения решающего правила, однако в процессе работы итеративного алгоритма он позволяет ставить под сомнение априорные группы. Алгоритм, начинаясь с некоторого априорного разбиения, определяет дискриминантное подпространство, затем относит каждого индивидуума к тому классу, чей центр тяжести в проекции на дискриминантное подпространство является самым близким. Полученное к моменту сходимости алгоритма разбиение будет устойчивым в смысле применяемого правила отнесения индивидуумов к классам. Если выбор начального разбиения удачный, то для новых индивидуумов этот алгоритм даст правило отнесения, незначительно отличающееся от правил факторного дискриминантного анализа. Если, напротив, классы начального разбиения размыты и недостаточно однородны, то алгоритм даст правило отнесения, которое приведет к еще менее надежным классам, чем заданные априори. Прежде чем описать результаты, полученные с помощью дискриминантного типологического анализа, приведем несколько основных предположений, при которых он использовался. Пусть Е a Rp — множество из п индивидуумов, характеризуемых р числовыми параметрами. С помощью дискриминантного типологического анализа отыскивается разбиение Р =^ (Ри ..., Pk) множества Е на k классов (k фиксировано) и подпространство F размерности г (г фиксировано), которое минимизирует внутриклассовую инерцию, объясняемую F. 166
Пространство Rp снабжено метрикой Т~х (задаваемой матрицей, обратной к матрице ковариаций множества Е). Этот поиск осуществляется с помощью алгоритма типа динамических сгущений. В программе DISCRI (дискриминантного типологического анализа) пользователем определяются три входных параметра: разбиение Р(о\ с которого начинает работу алгоритм; требуемое число классов k\ требуемое число дискриминантных осей г (г<&). Далее мы приводим некоторые соображения, позволяющие наилучшим образом выбирать эти три параметра. Обычно разбиение Р<°> либо оценивается, либо выбирается случайным образом. Во всех алгоритмах классификации, когда начальное разбиение выбирается случайным образом, есть опасность, что алгоритм сойдется к неинтересным решениям. Вот почему в алгоритмах этого типа рекомендуется делать множество прогонок, меняя начальное разбиение. С другой стороны, существуют методы, позволяющие частично преодолеть это неудобство (например, использование сильных форм, см. 1.3.7, а также [3]). Подобной опасности, Кто существу, нет в дискриминантном типологическом анализе, где в качестве начального выбирается разбиение, составленное из априорных классов. Действительно, даже если это разбиение вызывает сомнение, классы не лишены смысла. Более того, пользователь все равно должен проверить, не являются ли априорные классы (или хотя бы некоторые из них) хорошо распознаваемыми — случай, когда применимы методы классического дискриминантного анализа. По этому поводу заметим, что если в качестве начального выбирается разбиение на априорные классы, то первая итерация типологического дискриминантного анализа приводит к тем же результатам, что и факторный дискриминантный анализ. Во всяком случае, какими бы ни были результаты первого анализа, именно они подсказывают, как естественным образом проводить последующую обработку. В частности, если классы начального разбиения плохо распознаваемы (это тот случай, когда дискриминантный типологический анализ применяется в полной мере), то результаты такого анализа подсказывают, как надо перегруппировать, расщепить, смешать классы и получить начальное разбиение для второго этапа алгоритма. Результаты этого этапа позволят аналогичным образом начать возможный третий этап и т. д. Указанный процесс останавливается, когда выбранное разбиение оказывается устойчивым. Выбор числа k требуемых классов диктуется числом классов начального разбиения. Необходимое число г дискриминантных осей, по-видимому, разумно выбирать близким к &, например г = k — 1 или г = k — 2. 8.3.2. Результаты Первый этап анализа. Анализ с начальным разбиением, заданным априори. Анализ начинается с разбиения на 7 классов Т = = G1!, ..., Т7), заданного априори. Выбрано г = 5. 167
Согласно табл. 8.1 установим соответствие: Ш^ 1 ЧГ Т? Гк Л f* TrfT • Т1 — класс И; 72 —класс ГР; ТЗ — класс ГТ; Т4 — класс ГРТ; Т5 — класс УР; Т6 — класс УТ; 77 — класс УРТ. Алгоритм останавливается на 5-й итерации и дает разбиение Т* = = (Т*и ..., Ту). В табл. 8.2 приведено разложение классов разбиения Г* по классам исходного разбиения Т. Таблица 8.2 Начальное разбиение Т и разбиение к моменту сходимости алгоритма Т* Т N. Тх т2 т3 Ti 7*6 т. Т-, 25 2 2 11 1 1 1 т* 10 3 А 14 п 1 9 п 3 1 1 1 8 2 Т*7 2 1 4 10 Представление центров тяжести (ЦТ) классов. Горизонтальная ось /, вертикальная ось 2 цтз цтА ЦП Рис. 8.1 168
Горизонтальная ось 3} вертикальная ось 4 Рис. 8.2 Комментарии. Как и можно было предвидеть, априорное разбиение на 7 классов оказалось неустойчивым. Точнее: класс «исправных» распался на два; класс ГРТ также распался на два, часть его сгруппировалась с классом ГТ, образуя новый класс; классы УТ и УРТ относительно устойчивы; классы ГР и УР оказались более размытыми и наблюдается тенденция смешивания их. Изучение представления центров тяжести привело к интересным результатам (аналогично представлению на плоскости в факторном анализе совокупность элементов тем лучше представлена, чем больше разброс ее по осям). Ось 1 отделяет класс 71 от других; несомненно, здесь мы имеем дело с устойчивым классом. Аналогично классы Т%> Т% и Ту, хорошо представленные по осям 2 и 3, должны быть устойчивыми. Отметим, наконец, что в случае использования 4 осей классы Т% и Г? ведут себя сходным образом. Согласно табл. 8.2 объединение классов Т% и Т* интерпретируется как объединение априорных классов 76 и Г7. Эти два последних класса определяются наличием дефекта соударения соответственно при торможении и в обоих режимах одновременно. Объединение классов Т6 и Т7 интерпретируется просто как множество объектов из ?, имеющих дефект соударения по крайней мере в режиме торможения. Специалисты указали, что класс Т% (входящий в Т4) представляет собой множество машин из Е, имеющих характерный дефект производства (напомним, что априорное разбиение на типы определялось только по особенностям функционирования). Малая стабильность класса ТЛ (машины без дефекта) отражает то, что понятие исправной машины является «размытым». Перечисленные результаты и их интерпретация подсказывают следующее новое разбиение множества ? на 5 классов: С = (Ci, С2, С3, С4, С5), С1 = Т1(] Т\, с2 = (тг - с,) и т2 и т., С3 = Т, U (Tk - П), С± = 7*1, сь = т. и г7. 169
Введение класса С3 оправдано определениями априорных классов Т8 и Т4: Т3 — гул только при торможении; Г4 — гул при разгоне и торможении. В классе С2 объединены машины, имеющие небольшой (с точки зрения специалиста) дефект — гул или удар — только в режиме разгона, что соответствует классам Т2 и Тъ. Машины, рассматриваемые априори как бездефектные, но не попавшие в Т|, естественно объединять с этими машинами, имеющими небольшой дефект. Второй этап анализа. Дискриминантный типологический анализ начинается с разбиения С = (Съ ..., С5), определенного выше. Выбрано г = 4. Алгоритм сходится за 2 итерации к разбиению С* = (С*, ..., С!), аналогичному разбиению С с точки зрения интерпретации классов. Представление центров тяжести классов. Горизонтальная ось t, бертинальная ось 2 Горизонтальная ось 3i вертикальная ось ЩтТ  | U] ' Рис. 8.3 Рис. 8.4 Комментарии. Как уже отмечалось, алгоритм сходится за 2 итерации к разбиению (С*, С?, ..., С%). Табл. 8.3 подтверждает устойчивость разбиения, выбранного в качестве начального для нашего алгоритма. с, са Сз с« С* 21 29 4 Табл 16 13 ица 8.3 г* 6 1 1 23 170
Графическое представление показывает, что: первая дискриминантная ось позволяет выделить CJ = Т4Д; вторая ось разделяет классы Сз и С1\ четвертая ось позволяет разделить классы С* и СЪ- Пять полученных классов, помимо устойчивости, допускают содержательную интерпретацию. Табл. 8.4 помогает сравнить классификацию нашей совокупности, полученную в результате дискриминантного типологического анализа с априорной классификацией. Т а б л и ц а 8.4 Дефект Исправные Гул Удар Разгон J { Ч т. | Торможение ! т. 1 т» Разгон и торможение 1 Т*,2 | | Т4,1 | Т-, \ Объединения (Т3, T4i2) и (Т6, Т7) не удивительны, они соответствуют дефекту одного типа и, по-видимому, отражают следующий факт. Когда оператор слышит аномалию, более ярко выраженную при торможении, чем при разгоне, он имеет тенденцию забывать аномалию при разгоне (в самом деле, прослушивание при торможении осуществляется после прослушивания при разгоне). Класс 74Д, выделившийся из класса ГРТ, соответствует, как мы видели, дефекту, достаточно хорошо объясняемому метрологически. Метрологический анализ показал, что 11 машин обладают резко выраженным доминирующим дефектом. Эти машины вошли в класс 74Д, насчитывающий 13 элементов. Диагноз относительно семейства исправных машин может показаться слишком строгим, но, как оказалось, он не удивляет специалистов и определенным образом подтверждается метрологической экспертизой. Напротив, объединение семейств Т2 и Тъ в класс С% не столь удовлетворительно, хотя довольно естественно назвать класс С% классом «небольшого дефекта в режиме разгона». Интересно было посмотреть, проведя новый анализ, можно ли различить семейства Т2 и Тъ в задаче разбиения на 6 вместо пяти классов. Начальное разбиение для этого анализа соответствовало разбиению ^ъ T2t Т3, Т4, Ть в том случае, когда группа УР не отделяется от класса Т2, образуя 6-й класс. 171
Полученный результат при этом не заслуживает большого доверия. В самом деле, 3 из 12 элементов класса УР начального разбиения присоединились к классу Т2. Нам показалось разумным ограничиться результатами, полученными на 4-м этапе анализа, давшем разбиение на пять «естественных» классов. Отметим, кстати, что, по нашему мнению, неуместно требование любой ценой разделить группы методом дискриминантного типологического анализа. Поступая так, теряют большую часть преимуществ этого метода, а устойчивость полученных результатов в итоге оказывается сомнительной. В наших исследованиях мы рассматривали вместе режимы разгона и торможения. Однако переменные, соответствующие режиму торможения, являются мешающими для распознавания семейств, которые различаются по переменным, соответствующим режиму разгона. Кроме того, чтобы разделить семейства ГР и УР, нам кажется разумным ввести второй уровень дискриминации, проводя исследования только по переменным в режиме разгона. Дополнительные исследования. Эти исследования учитывали работу машины только в режиме разгона, цель их —выяснить, можно ли разделить: группы ГР и УР, входящие в С2; группы УТ и УРТ, входящие в С5; группу ГТ и подгруппу ГРТ, входящие в С3. Наиболее убедительными оказались результаты следующего анализа. Выбрано было k = 5 и г = 4. Начальное разбиение следующее: Рх — класс И; Р2 — класс ГР; Р3 — класс ГРТ; Р4 — класс УР; Ръ — класс УРТ. Индивидуумы групп ГТ и УТ рассматриваются при этом как анонимные: они не участвуют в анализе, но распределяются затем по классам, полученным к моменту сходимости алгоритма. Результаты этого анализа можно резюмировать так: он недвусмысленно показал, что нельзя разделить классы УРТ и УТ; напротив, оказалось возможным построить исходя из этого анализа второй уровень дискриминации, позволяющий расщепить класс С3. Те элементы из ГТ и ГРТ, которые расположены в одном и том же классе, неправильно классифицируются; разделение групп ГР и УР исходя из результатов этого анализа также возможно. Лишь элементы ГР 02 в классе 1 и УР 09 в классе 2 неправильно классифицируются; напротив, границы семейства исправных машин очень нечеткие. В частности, тщетно пытаться отделить подгруппу исправных Clt2 от группы ГР; анализ показывает, что можно ввести второй уровень дискриминации и добиться разделения классов «гул» и «удар» при разгоне. 172
8.3.3. Сравнение дискриминантного типологического анализа с другими методами 3.3-3.1. Сравнение с факторным анализом соответствий На практике случается, что анализ соответствий дает хорошие решения задач дискриминации (см. [7]). В рассматриваемом здесь примере анализ соответствий для таблицы данных, используемых для дискриминантного типологического анализа, позволил обнаружить, с одной стороны, устойчивые и легко интерпретируемые группы и, с другой стороны, построить решающие правила, связанные с этими группами. Таким образом, мы провели анализ соответствий ИЗ индивидуумов, описываемых 24 выбранными ранее переменными. Индивидуумы проектировались только на факторные плоскости A,2) и B,3). Ось 1 объясняет 26,7% инерции сгущения, ось 2 — 16,2%, ось 3 — 12,8%. Ось 1 позволяет противопоставить переменные разгона и торможения и тем самым различать машины с дефектами только в одном из двух режимов. Напротив, машины других семейств плохо классифицируются осью 1. Ось 2 позволяет противопоставить пики средней частоты другим параметрам спектра, в частности пикам высокой частоты. Следовательно, эта ось является хорошим дискриминатором. Машины, имеющие дефект, располагаются в области /\2>0 в сторону параметра, соответствующего пику средней частоты. Ось 3 позволяет различать пики средней частоты между собой. Эта ось хорошо отделяет группу «удар» от группы ГРТ. Изучение факторных плоскостей позволяет, следовательно, выявить различия между априорными семействами, а также неоднородность некоторых групп. Однако границы между семействами и подсемействами не настолько четко выражены, чтобы можно было построить простые решающие правила, основанные на факторах анализа соответствий. Это видно, например, на подгруппе исправных машин Т|, полученной с помощью дискриминантного типологического анализа. На факторных плоскостях A, 2) и B,3) были выделены области, в которых расположено семейство Т*. Совместное рассмотрение этих двух областей позволяет достаточно хорошо распознать класс Т*. Но все-таки индивидуумы И 1 и И 25 не попадают ни в одну из областей, а УРТ 7, напротив, попадает в каждую из них. Ясно, что для выделенных областей нельзя построить простые решающие функции и перейти к автоматическому распознаванию класса Т*. Напомним при этом, что речь идет о классе, распознанном лучше всего с помощью дискриминантного типологического анализа. Подводя итоги, можно сделать вывод, что факторный анализ соответствий не вытесняет методы, связанные с построением решающих правил. 173
8.3.3.2. Сравнение с пошаговым дискриминантным анализом Здесь мы попытаемся ответить на вопрос: может ли факторный пошаговый дискриминантный анализ хорошо различить 7 рассматриваемых априорных групп? Была использована программа MAHAL3 Ж. М. Ромде [9]. На рис. 8.5 приведен полученный с помощью этой программы график зависимости процента правильно расклассифицированных индивидуумов от числа шагов. Результаты этого анализа согласуются с результатами ди- скриминантного типологического анализа. Здесь также наблюдается расщепление классов И и ГРТ на подклассы. Это свидетельствует о том, что дискрими- нантные оси, полученные в программе MAHAL3, плохие. В частности, неправильно расклассифицированные индивидуумы класса ГРТ располагаются плохо интерпретируемым образом. Помимо того, в класс исправных включается слишком большое число индивидуумов, не принадлежащих ему. Процент неправильно расклассифицированных индивидуумов, который не опускается ниже 20, указывает также на недостаточную ус- Та блица 8.5 Классификация индивидуумов к 20-му шагу 100 90 80 70 60 50 АО 30 20 Ю I I I I I I / 2 3 U 5 6 7 8 9 10 12 14 16 16 20 Число шагов Рис. 8.5 S4 Группы \ назначения Исходные >v группы ^v И ГР гт ГРТ УР УТ УРТ и 27 0 1 4 1 0 1 ГР 2 11 1 1 1 0 0 гт 0 0 10 2 0 0 0 ГРТ 0 0 0 13 0 0 0 УР 0 0 0 0 9 0 0 УТ 0 1 0 1 1 10 0 УРТ 2 0 0 0 0 0 11 174
тойчивость априорных классов. Таким образом, и в этом случае можно сделать вывод, что дискриминантный типологический анализ, позволяющий ставить под сомнение априорные гипотезы, оказывается более надежным средством классификации. 8.3.4. Проблема экзаменационной выборки Как и в дискриминантном анализе, желательно разбить имеющуюся выборку на основную, по которой строится решающее правило, и экзаменационную, по которой оценивается пригодность этого правила. Первый экзамен проводится для априорного разбиения, результаты его позволяют провести первый контроль. Является ли разбиение, полученное к моменту сходимости алгоритма, аналогом такого же разбиения, полученного исходя из основной выборки? Если да, то продолжаем процедуру и на каждом этапе контролируем значимость результатов. Для этой процедуры, следовательно, необходимо располагать экзаменационной выборкой объема, сравнимого с объемом основной выборки. Самое простое для этого иметь новую выборку, которая позволила бы нам проверить наши методы. К сожалению, мы не располагаем такой выборкой. Единственное/ что нам остается сделать, это разделить нашу выборку из 113 машин на основную, чтобы строить разбиение на классы и связанные с ним дискриминантные оси, и на экзаменационную выборку, чтобы исследовать устойчивость наших результатов. Мы оставили 85 индивидуумов для основной выборки и 28 — для экзаменационной. Эта операция была повторена еще 2 раза. Каждый раз экзаменационная выборка извлекалась так: 8 машин были отобраны случайным образом в группе И; 3 машины были отобраны случайным образом в каждой из групп ГР, ГТ, УР, УТ, УРТ; 5 машин были отобраны случайным образом в группе ГРТ. Располагая экзаменационными выборками, можно было проводить анализ по оставшимся выборкам. Мы положили число классов равным 5, число дискриминантных осей — 4, а начальное разбиение Fo было следующим: класс 1 — семейство И; класс 2 — семейства ГР и УР; класс 3 — семейство ГТ; класс 4 — семейство ГРТ; класс 5 — семейства УТ и УРТ. Замечание. Малочисленность классов разбиения Fo не позволяет рассматривать более мелкие подклассы. Дискриминантный типологический анализ, начинающийся с разбиения Fo множества Ео (г = 4), после первой итерации привел к разбиению Ft (см. табл. 8.6), которое подтверждает результаты предыдущего анализа. Полученное разбиение имеет структуру, аналогичную 175
^02 Л* ^04 FU 18 1 19 2 16 1 1 20 ^3 8 1 9 Табл p* Г04 13 14 ица 8.6 4 2 23 24 18 9 16 18 Распределение экзаменационной выборки по классам: класс 1: И 7, И 14, И 15, И 17, ГР 11, УР 8; класс 2: И 2, И 28, И 33, ГР 2, ГР 4, ГТ И, ГРТ 7, УР 1, УР 5; класс 3: ГТ 5, ГТ 6, УТ 9; класс 4: ГРТ 3, ГРТ 9, ГРТ Д; класс 5: И 8, УТ 6, УТ 7, УРТ 6, УРТ 9, УРТ А. Мы подчеркнули те индивидуумы, которые считались неправильно расклассифицированными по результатам четвертого анализа (оптимального) и экзаменационного анализа. Таким образом, мы имеем из 28 индивидуумов 5- неправильно расклассифицированных. Принимая во внимание объем основной выборки, этот результат кажется удовлетворительным. Другой экзаменационный анализ. Для этого анализа в качестве начального было взято разбиение, полученное из оптимального разбиения Г* = G1*, 71, ..., Т1) 113 индивидуумов. В этом случае разбиение, полученное к моменту сходимости, оказалось более устойчивым, что подтвердил и экзамен. Использовалась экзаменационная выборка из 28 индивидуумов. Один из 28 индивидуумов оказался неправильно расклассифицированным. Разбиение Т* является, таким образом, удовлетворительным . 8.4. КОНСТРУКЦИЯ РЕШАЮЩЕГО ПРАВИЛА 8.4.1. Решающие правила, выводимые из дискриминантного типологического анализа Процедура отнесения индивидуума к одному из классов, определенных с помощью дискриминантного типологического анализа, состоит в следующем. С помощью калькулятора, связанного с анализатором спектра, определяют параметры, необходимые для принятия решения, к какому классу отнести машину. 176
Машина с номером i0 описывается вектором fo/>/= 1, 2, ..., 24}. С ДРУг°й стороны, в памяти калькулятора располагают центры тяжести классов, для класса I : {аи, j = 1, ..., 24}, и дискриминантные факторы, для s-ro дискриминантного фактора bs = {bsjy /=1,2,... ...,24}, s= 1,2, ..., г. Машину i0 относят к классу /*, если г Г 24 12 Ц 2 bsj(XiJ—aij) • -iL/=i J Здесь г — число дискриминантных осей, г = 4. Если машина i0 отнесена в класс Т\ или 71, то снова начинают вычисления с центрами тяжести и факторами, соответствующими второму уровню дискриминации, который был введен, чтобы разделить классы ГР и УТ. 8.4.2. Другие решающие правила Решающие правила, получаемые при дискриминантном типологическом анализе, такие же, что и при линейном дискриминантном анализе при дискриминантном подпространстве размерности г. Введение других решающих правил означало бы, что с помощью дискриминантного типологического анализа можно описать и построить новое, более надежное разбиение, чем заданное априори. Представляется интересным, например, сравнить решающие правила ДТА с более богатым семейством решающих правил при байесовском подходе (см. [8]). В нашей задаче важно построить решающие правила, допускающие диалог «человек—ЭВМ». В самом деле, такой диалог обеспечил бы возможность регулярно контролировать, насколько содержателен диагноз, позволил бы приобрести полезный опыт для улучшения решающих правил и, несомненно, привел бы к лучшему пониманию связи акустических последствий дефектов с метрологическими характеристиками машин. Поэтому мы старались построить исходя из классов, полученных в результате дискриминантного типологического анализа, простые и допускающие такой диалог решающие функции. Не вдаваясь в детали, отметим, что решающая процедура, на которой мы остановились, использует рекуррентный алгоритм классификации Дж. X. Фридмана [5]. Этот алгоритм используется для того, чтобы разделить две совокупности точкой деления с, которая максимизирует функцию D(z)= \F, (z) - F2 (z)\, D (с) = sup D (z) = sup |F, (г) - F2 (z)\. Z 2 177
Ft и F2 — функции распределения двух совокупностей. Величина D (с) — не что иное, как расстояние Колмогорова—Смирнова между двумя распределениями, она хорошо известна как мера различия 2 функций распределения. На практике Fx и F2 — неизвестны и их оценивают по эмпирическим функциям распределения, определенным следующим образом: 0, если х<х\, к i - —, если Xk т 1, если Хпх- О, если х ад- если П—/72 1, если xL где xlk — k-я точка в упорядоченном но возрастанию семействе Wt (i = —: 1, 2) точек на числовой прямой. В качестве оценки D(c) берется D (с) — sup I/7! (z) — F2 (z)\. Точнее, алгоритм строится следующим г образом. Для всех переменных вычисляют величины (F[ (соответственно F{) — функция распределения семейства W1 (соответственно W2) для переменной /) и производят разрез для переменной /*, такой, что D (Cj*) = max D (Cj). j Разрез делается в точке cjie. Если одна из двух подвыборок удовлетворяла критерию остановки, она относилась к одному из двух классов (элементов которого в под- выборке больше), и, таким образом, получали окончательную ячейку. Если нет, то процедуру повторяли исходя из этой подвыборки. В частности, снова вычисляли D (с^ даже для переменной /, выбранной на предыдущем шаге; в самом деле, в случае, когда /х (х) и (или) /2 (л:) многомодальны, может оказаться, что один разрез не дает хорошего разделения. Отнесение новых индивидуумов к классам. Разбиение по описанной процедуре приводит к дереву бинарных решений. Подвыборка на каждом этапе представляется узлом дерева. Вершина дерева соответствует всей выборке. Две ветки от каждого нефинального узла соответствуют двум подмножествам, определяемым разбиением. Финальные узлы соответствуют финальньш ячейкам. Правило классификации нового индивидуума простое. Индивидуума относят к классу, соответствующему ячейке, в которую он попал. Начиная с вершины, ин- 178
шшидуум «спускается с дерева» до тех пор, пока он не оказывается в финальном узле. Если этот узел представляет один класс, индивидуум относится к этому классу. Если узел представляет собой смесь классов, индивидуум относится к тому классу, который представлен большим количеством элементов. «Спускаясь с дерева», двигаемся налево или направо в соответствии с правилом, если Xj* ^ су-*, то идем по левой ветке, если нет, то по правой. Здесь j\ и с/л представляют собой переменную и точку разреза, соответствующие этому узлу. Можно показать, что эта процедура асимптотически эффективна в байесовском смысле при условии пх1х = я2/2 (см. [2]). nt (соответственно я2) — априорная вероятность первой (соответственно второй) совокупности, /х (соответственно /2)—стоимость неправильной классификации индивидуума первой (соответственно второй) совокупности. Процедура обобщается на случай многих классов путем рассмотрения задачи как последовательности задач для двух классов. Эта процедура интересна главным образом скоростью выполнения и простотой интерпретации диагноза. ЛИТЕРАТУРА 1. Benzecr i J. P. A972) L'analyse des donnees. Tome II. L'analyse des cor- respondances. Dunod. 2. С e 1 e u x G. A978) Contribution statistique a la reconnaissance automatique de spectres de machines tournantes. These 3eme cycle. Universite Paris VI. 3. D i d а у Е. A972) Optimisation en classification automatique et reconnaissance des formes. Cahiers de L'IRIA, № 6. 4. D i d а у Е. A972) Selection typologique de parametres. Rapport de recherche, № 188, IRIA-Laboria. 5. FriedmanJ. H. A977) A recursive partitioning decision rule for non parametric classification. IEEE, Transactions on Computers. 6. L e m о i n e Y. A979) Classification et discrimination, analyse discriminante typologique et applications. These 3erne cycle. Universite de Metz. 7. Nakache J. P.,LorenteP., Benzecri J. P.,Chast angJ.F. A977) AORTE. Cahiers de l'analyse des donnees, vol. II, №4. 8. NakacheJ. P. A976) Comparaison des regies d'affectation associees a dif- ferentes methodes de discrimination. Seminaire IRIA. 9. Romeder J. M. A973) Methodes et programmes d'analyse discriminante. Dunod. 179
Глава 9 • ТИПОЛОГИЧЕСКОЕ АГРЕГИРОВАНИЕ ДАННЫХ О ПРЕДПОЧТЕНИЯХ 9.1. ВВЕДЕНИЕ 9.1.1. Данные и отношения предпочтения Часто приходится иметь дело с данными о предпочтениях: в торговле — в процедурах проверки качества товаров; в управлении — в мультикритериальных задачах; в психологии — в анализе анкет; в политике — в задачах, связанных с голосованием, и т. д. В общем случае можно представить эти данные в виде взвешенного семейства отношений предпочтения: (Ре» Pe)et=E, где Е — конечное множество судей, критериев, индивидуумов, производящих опрос, избирателей, ... Элементы множества Е в дальнейшем будут называться судьями; ре — положительный вес, связанный с судьей е\ X — конечное множество продуктов, которые нужно сравнить между собой, решений, которые требуется принять, событий, среди которых нужно выбрать одно, кандидатов на выборах; элементы множества X будем называть объектами; ре — антисимметричное отображение X X X в [—1, + И- Оно выражает предпочтения судьи е относительно объектов из X. Таким образом, ре (ху у) обозначает степень предпочтения объекта х объекту у; эта степень тем больше, чем ре (х, у) ближе к 1. Отображение ре будем называть отношением предпочтения. Эта модель предусматривает сравнение каждым судьей объектов по парам в протоколе сравнения пар. Например, можно положить: р (х, у) = 1, если объект х намного предпочтительнее объекта у; Р (*» У) == 1/2, если объект х немного предпочтительнее объекта у; Р¦(*» У) = 0, если нельзя отдать предпочтения ни х, ни у*. Р (*> у) ™ —1^2, если объект у немного предпочтительнее объекта х\ Р '(*» У) ^ —1» если объект у намного предпочтительнее объекта х. Часто предпочтения являются строгими без нюансов, и индивидуальные предпочтения судей выражаются двумя непересекающимися отношениями на X: *В этом случае будем говорить, что х и у неразличимы. 180
отношением Р9 асимметричным, обозначающим строгие предпочтения; отношением /, симметричным, указывающим на неразличимость, так что для каждой пары объектов (х, у) имеем: (х, у) 6 Р (х строго предпочтительнее у), или (у, х) ? Р (у строго предпочтительнее х), или (х, у) € I (хну неразличимы). Иначе, отношения Р9 / и R = Р (J / могут быть выражены отношением предпочтения р#, называемым сигнатурой отношения R и определяемым так: 1, если (х9у)?Р9 — 1, если (у9 х) ? Р9 О, если (х, у) ? /. Изучение всех пар объектов становится утомительной задачей, когда число сравниваемых объектов возрастает. Но часто оказывается возможным выразить индивидуальные предпочтения в терминах классификации, допускающей неразличимость объектов. Классификация определяется заданием упорядоченного разбиения X : (Хъ ..., Xl)> которое для наглядности записывается в виде Оно выражает следующие отношения строгого предпочтения Р и неразличимости /: х строго предпочтительнее у9 если х ? Xh9 у ? Xt и k<. I; х и у неразличимы, если существует k, такое, что х, у 6 Xk, и характеризует такое отношение R = Р [j /, которое является отношением предпорядка на X (см. [2])*. В тех случаях, когда нет неразличимых объектов, т. е. когда каждый класс сводится к одному элементу, что наглядно выражается в виде (q = card (X)): это отношение является отношением порядка на X (см. [2]). На практике классификацию часто определяют, приписывая значимость v (x) каждому х и полагая Хк = {х 6 X; v (х) - vfe}, где vx > v2 > ... > vL — различные значения значимости. Классификацию объектов можно, впрочем, получить каноническим способом, исходя из любого отношения предпочтения р и вычисляя функцию значимости для р по формуле vp (х) = 2Р (х, у). У *Все рассмотренные отношения являются полными, что не будет специально оговариваться в дальнейшем. 18)
В случае когда р является сигнатурой предпорядка R, верно и обратное утверждение, что классификация, связанная с vp, позволяет восстановить отношение R (см. [18]). Более богатый запас моделей, чем предпорядки, можно также получить, исходя из v и вводя порог а > 0. Положим: х строго предпочтительнее у, если v (x) > v (у) + а; х и у неразличимы, если |v (х) — v (y)\ ^ с, тогда получим отношение R = Р U /, которое является квазипорядком на X [20], [21], [28]. Другие типы условия также могут быть введены в терминах отношений предпочтения. Например, свойство транзитивности выражает согласованность в предпочтениях. Стохастическая транзитивность: Yx, у, г : р (л:, у) > 0 и р (у, г) > 0 =>- р (*, z) > max (p (ху у)у р (уу z)). Соответствует определению семейства вложенных квазипорядков [15], [26]. Размытая транзитивность: Yxy у, z : р (*, z) > min (р (х, у), р (у, z)). Слабая транзитивность: Yky Yxlf ..., xk : р (х1у х2) > 0, ..., р (хк-ъ хк) > 0 => р (хъ хк)^0. Соответствует понятию совместимости с отношением порядка на X [6], [18], [8]. 9.1.2. Агрегирование данных о предпочтениях Агрегировать данные о предпочтениях — значит дать сжатое их описание, притом сделать это наилучшим образом с помощью одного или многих отношений предпочтения заданного типа. Очень часто стремятся после этого объединить (синтезировать) предпочтения судей в единую классификацию сравниваемых объектов для того, например, чтобы выбрать наиболее ценные объекты. Всюду в дальнейшем Я будет обозначать множество отношений предпочтения исследуемого типа. Часто эти отношения будут снабжаться оцифровкой у, выбранной из множества Г (р) допустимых оцифровок, определенного для каждого р f J?. Одновременно для индивидуального отношения предпочтения судей вводятся множества Д (ре) допустимых оцифровок и функция несходства ф для измерения расхождения между любой оцифровкой из |J Г (р) и любой оцифров- Рб«^ кой из U А (ре). е&Е Пригодность пары (р, у), где р — отношение предпочтения из J?» а у — оцифровка Г (р), к объединению индивидуальных предпочтений судей будет измеряться величиной <Ыр> У) = ^Реппп ф (у, б). е<=Е 6( Таким образом, пригодность тем выше, чем ближе эта величина к 0. 182
Наконец, наилучший синтез индивидуальных предпочтений по определению будет осуществляться парой (р, у), доставляющей решение задачи: (A) min min Фя(р, у). ^ r() В дальнейшем предполагается, что множество Л конечно и для каждого р 6 Л задача min ФЕ (р, у) имеет единственное решение ур, которое будем называть оптимальной оцифровкой предпочтения р. Исчерпывающее перечисление известных вариантов приведенной выше модели вывело бы нас очень скоро за рамки этой главы, поскольку задача (А) часто сопряжена с комбинаторными трудностями [24], [15], [18], [4], [30], [22], [5], [11]. Поэтому мы ограничимся здесь несколькими наиболее известными вариантами. Медианные отношения. Г(р) = {р} Ф (Р. Ре> = 2 I P (X, У) —Ре (X, У) I х,у (мера несходства, обобщающая расстояние Хемминга). Для Л = {р#, R— отношение турнира}* задача (А) решена с применением мажорантного правила Кондорсе [23]. Подробно изученный случай, когда Л = {р#, R — отношение порядка} приводит к задачам, решаемым методами ветвей и границ [9], [24], [18] или методами целочисленного программирования [22]. Последние применяются также для других случаев: Л = {ря, R— отношение предпорядка}, Л = {pRy R — отношение квазипорядка}, но с гораздо большими трудностями. Все же в связи с этим можно рекомендовать читателк> работы [13], [15], [25] , [3]. Отношения, максимизирующие количество информации. В этом случае оцифровки у и б являются вероятностными отношениями, т. е отображениями из X X X в [0, 1], такими, что Ух у : у (х, у) + у (у, х) = б (х, у) + б (у, х) = 1. Полагают Ф G. б) - —26 (х, у) log у (х, у). х, у Этот критерий, идущий от теории информации, особенно интересен статистическими свойствами, которыми обладают решения задачи (А)Ш. В модели 1 Брэдли—Терри [6], [81, [9], [18]. Л = {р#, R — отношение порядка}, *Для турнира / = { (х, х); х 6 X}. J83
Г (ря) =^~{у — вероятностное отношение, х строго предпочтительнее у => у (х, у) > 1/2}, Задача (А) может быть решена методами, применимыми для исследования медианных порядков. В модели 2 Брэдли-Терри [6], [1] Я = {ря, R — отношение предпорядка}, Г (р^) = {у — вероятностное отношение, х строго предпочтительнее у 4Ф л (х) > я (y)Vx : ji (x) > 0, ^ п (х) =- I и у (х, у) = •= я {хI (я (х) + я (у))}, Алгоритм Л. Р. Форда [12J позволяет, при некоторых ограничениях, решить задачу (А). Средние отношения. Теперь оцифровки у и б являются нотациями*, т. е. отображениями X в R, в качестве ф выбирают Ф (Y, б) - 2 h (х) - б (х)]\ х В методе Борда [24], [И] М = {р#, R — отношение предпорядка}, Г (ря) = {у—нотация, х строго предпочтительнее у ^ у (х) > у (у)}, А (Р.) = КЛ- Задача (А) решается путем вычисления средней функции значимости индивидуумов. В методе пермутоэдра [18] Л = {р#, R — отношение предпорядка}, г (р) == К}, Задача (А) решается методом вычисления путей наименьшей длины в графе, снабженном оценкой [18], [19]. В методе оптимальной оцифровки с порогами [7]. Л = {ря, R — отношение предпорядка}, Г(р^) = {у — нотация, х строго предпочтительнее у <=* у (х)>у (у)}, и если ре = ряв, где Re — отношение квазипорядка, то A (pRe) = = {б — нотация, х строго предпочтительнее у => б (х) > б (у) + 1, х и у неразличимы => |б (х) — б (у)\ ^ 1, 2^ W = 0}- * Нотация (notation) — система знаков или символов, представляющих числа, величины. — Примеч. пер. 184
Этот метод, содержательный, только когда индивидуальные данные являются квазипорядками, был придуман для устранения неустойчивости аналогичного метода, основанного на алгоритме Дж. Крускала |17] и содержательного только тогда, когда индивидуальные данные являются предпорядками [19]. Оцифровка основана на свойстве квазипорядков, установленном в [27]. Задача (А) выражается в терминах выпуклого анализа: в двух выпуклых множествах найти две точки, находящиеся на минимальном расстоянии. 9.1.3. Типологическое агрегирование данных о предпочтениях Несколько описанных выше моделей показывают разнообразие алгоритмических проблем, с которыми приходится сталкиваться, когда нужно агрегировать индивидуальные данные о предпочтениях. Для получения все более и более сложных синтезов индивидуальных предпочтений, позволяющих, с одной стороны, лучше передать все нюансы мнений, для выражения которых применяются турниры, порядки, предпорядки, квазипорядки, вложенные квазипорядки и т. п., а с другой стороны, использовать эвристические методы решения задачи (А), мы предлагаем заменить глобальное описание предпочтений более простым локальным. Это оправдано тем, что аналогичным образом определяют основные тенденции судейства, и тем, что при таком описании можно ограничиться наиболее однородными группами индивидуальных предпочтений, добиваясь большей простоты структуры локальных синтезов и упрощения этапов алгоритма по агрегированию. Как и в 9.1.2, агрегировать предпочтение судей, принадлежащих к подмножеству С cz ?, значит решить задачу (Ас) min min Фс (р, у), ?^ ?Г) где на этот раз Фс(р, т)= Ц Л min Как и выше, мы предполагаем, что Л конечно. Для каждого непустого подмножества С из ? задача (Н) \ min Фс (р, у) имеет единственное решение, обозначаемое v e г(р) Yp, с Обозначая теперь через Ф? минимальное значение Фс (р, у), полученное при решении задачи (Ас), запишем задачу типологического агрегирования в виде (Ат) min 2 ф^> где (Съ ..., С/с) — разбиение Е 185
Очевидно, что выигрыш в простоте при ограничении наиболее простыми синтезами (порядки, предпорядки и т. п.) не бесплатен, так как теперь возникает проблема поиска разбиения множества Е> а комбинаторные трудности задач классификации хорошо известны. Два подхода к задаче (Ат) были предложены Е. Жакет-Лаг резом. В [14] был рассмотрен случай двух классов с использованием алгоритма типа динамических сгущений и медианных порядков. В [16] развивается иерархический подход, который обосновывается устойчивостью множества предпочтений по отношению к операциям усреднения. Систематическое исследование метода динамических сгущений содержится в работах [18], [19] и [7]. Развитие этого метода рассматривается в 9.2. 9.2. ФОРМАЛИЗАЦИЯ ЗАДАЧИ В РАМКАХ МЕТОДА ДИНАМИЧЕСКИХ СГУЩЕНИЙ Принимая обозначения гл. 1, уточним пространство представительств L и оптимизируемый критерий W. 9.2.1. Пространство представительств Задача (Лс) может иметь несколько решений, но всегда в соответствии с гипотезой (Н) их число конечно. Возьмем в качестве L множество конечных подмножеств множества (J {р} X Г (р). Каждый класс Р? С будет, таким образом, иметь представителем множество вида { (Pi, Yl). •••> (Pm, Ym)}, где pi синтезирует предпочтения судей класса С и yt — оцифровка р*. 9.2.2. Оптимизируемый критерий В обозначениях 9.1.2 адекватность элемента L из L в качестве представительства предпочтений судьи е будет измеряться величиной min d(e,L) 2 min card (L) {P^L бед(ре) а адекватность того же элемента L в качестве представительства синтезированного предпочтения множества судей С из ? будет измеряться величиной Локально агрегировать данные (ре, ре)е е Е — это значит определить одновременно: разбиение множества Е на К классов: Р = (Clf ..., Ск)> 186
последовательность 5 = (Lly...y LK) представительств из L, синтезирующих предпочтения судей в каждом классе из Р. В соответствии с гл. 1 качество пары (Р, S) будет измеряться величиной k=\ и наилучшие пары будут решениями задачи (Ат) min min W (Р, S)*. Эта задача снова названа (Ат), так как она эквивалентна поставленной выше задаче с тем же названием (см. замечание в 9.3.1). Решения этой задачи при помощи алгоритма динамических сгущений приведены в 9.3. 9.3. АЛГОРИТМ Согласно изложенному в гл. 1 решения задачи (Ат) могут быть получены с помощью построения последовательности (PW, S(">), такой, что: РA>— начальное разбиение, произвольно выбранное из Рк, для каждого п ^ 1: 5(п> — решение задачи min W (Р(л), 5), p(n+i) _ решение задачи min W (Р, 5(/г>). />GP/( 9.3.1. Этап представления Для фиксированного разбиения Р = (С1э ..., Ск) 6 Рк задача min W (P, S) эквивалентна, благодаря свойству аддитивности критерия W, К задачам min D(Chy L), L€EL где *Рд- — множество разбиений множества ? на К классов, LK — L X L X ... X L (/С раз). 187
Решение исходной задачи получим, если выберем в качестве решения L% множество, состоящее из решений задачи (АСк)'. min min Фсь (р, т). r) Мы выбираем решение LJ, образованное всеми решениями задачи Ack. Множество L% конечно благодаря гипотезе (Н). Замечание. В этих обозначениях и обозначениях, принятых в 9.1.3, = У\ Фсь ^ k Две формулировки задачи (Ат) являются, таким образом, эквивалентными. 9.3.2. Этап назначения На этот раз речь идет о решении задачи min W (Я, S). Представительство S = (Lly ..., LK) теперь фиксировано. Как и в гл. 1, благодаря аддитивности критерия W мы можем выбрать в качестве решения Р* = (If-1 (l)l...AM (К))), где / — функция назначения, определенная формулой / (ё) = min {k\ d (e, Lk) = min d (e, Li)}. i 9.3.3. Сходимость и разные задачи После того как мы показали, что описанный выше способ выбора pw и $(п) действительно приводит к решению задач, возникающих на двух этапах алгоритма, убывание числовой последовательности W (P(n\ SW) становится очевидным. В самом деле, имеем ул: W (/>(»), S<"))> W(P<n+l\ S<»)) > W Напротив, сходимость самой последовательности (Р^п\ S^) требует детального исследования, поскольку задачи min D (С, L) не обязательно имеют единственное решение. Предложение. Последовательность (Я<л\ 5(Аг>) стабилизируется. 188
Доказательство. Как и в гл. 1, покажем сначала, что стабилизируется последовательность W (Р(Л), S<n>), заметив, что она убывает и может принимать только конечное множество значений, так как = min Рк конечно. Если W (P<n>, S<">) — W (Р(/г+1>, S<"+1>) для достаточно больших я, то согласно двум неравенствам, приведенным выше, для достаточно больших п. Полагая P(rt+1> = (С<*+1), ..., С(?+1>), получим, используя результаты из 9.3.1, что Yk представительства L(/*> и L(?+1) являются решениями задачи min D (C^+1), L), т. е. Yk LW и L^+1> являются реше- ниями задачи (Лс<«+1)). Так как L<?+1> содержит все такие решения, для всех k и для достаточно больших п имеем г (Я) г (/1+1) Lk CZ Lk Отсюда получаем, что последовательность также возрастает для достаточно больших п. Так как множество Л конечно, эта последовательность обязана стабилизироваться. То же верно для последовательности И*\ поскольку согласно гипотезе (Н) Отсюда легко следует стабилизируемость последовательности LW) Очевидно, что предел (Я*, L*) последней последовательности зависит от выбора начального разбиения Р&К Кроме того, основным параметром является число классов К. По этому поводу рекомендуем читателю обратиться к главам книги, посвященным методам, разработанным для ослабления влияния выбора начальных параметров. 9.4. ЗАКЛЮЧЕНИЕ Ясно, что МДС можно применить к многочисленным методам агрегирования, сделав их «типологическими». Среди различных вариантов общей модели, описанной в 9.1.2, медианные отношения и отношения, максимизирующие количество информации, имеют то преимущество,
что они оперируют непосредственно с отношениями предпочтения, но, если не довольствоваться эвристическими соображениями, для их реализации иногда приходится использовать довольно громоздкие алгоритмы. Методы средних отношений основаны исключительно на работе с функциями значимости. Нам кажется, что эти методы не следует подвергать критике из-за того, что они непосредственно неприменимы, когда предпочтения судей выражаются в классификационных терминах. Их преимуществом является то, что они реализуются более простыми алгоритмами. Если же априори не удается составить функции значимости, то можно прибегнуть к методам оптимальной оцифровки, которые описаны для квазипорядков. ЛИТЕРАТУРА 1. A s t i е А. A970) Comparaisons par paires et problemes de classment. Estimation et tests statistiques. Math. Sci. Hum., №32, p. 17—44. 2. В a r b u t M., MonjardetB. A970) Ordre et classification. Algebre com- binatoire. Hachette Universite. 3. Barthelemy J. P. A976) Sur les eloignements symetriques et le principe de Pareto. Math. Sci. Hum., 61, p. 39—60. 4. Barthelemy J. P., MonjardetB. A979) Ajustement et resume de donnees relationnelles: les relations centrales. 2nb IRIA Cong, on data analysis. Versailles. 5. В 1 i n J. M. A976) A linear assignment formulation of the multiattribute decision problem. R. A. I. R. O., Rech. Open, vol. 10, № 6, p. 21—32. 6. В r a d 1 e у R. A., T e г г у М. E. A952) The rank analysis of incomplete block designs. I the method of paired comparisons. Biometrika, 41, p. 502—537. 7. С h a n d о n J. L., Lemaire J. A977) Agregation typologique de quasi- ordres, un nouvel algorithme. Journ. Intern. Analyse des donnees et informa- tique. Versailles. 8. David H. A. A969) The method of paired comparisons. Griffin's statistical monographs & courses. 9. D e С a n i J. S. A972) A branch and bounded algorithm for maximum likelihood paired comparison ranking. Biometrika, 59, № 1, p. 131 —135. 10. D e f а у s D. A978) Analyse hierarchique des preferences et generalisations de la transitivite. Math. Sci. Hum., 61, p. 5—27. 11. DegenneA A972) Techniques ordinales en analyse des donnees statistique. Hachette Universite. 12. Ford L. R., Jr. A957) Solution of a ranking problem from binary comparisons. Amer. Math Monthly, 64, p. 28—33. 13. H e u с h e n n e C. A970) Un algorithme general pour trouver un sous-ensemble d'un certain type a distance minimum d'une partie donnee. Math. Sci. Hum., №30, p. 23—33. 14. J а с q u e t-L a g r e z e E. A971) Analyse d'opinions valuees et graphes de preferences. Math. Sci. Hum., № 33, p. 33—35. 15. Jacquet-LagrezeE. A975) La modelisation des preferences, preordres, quasi-ordres et relations floues. SEMA, Direction Scientifique. Rapport de recherche, № 80. 16. Jacquet-LagrezeE., В e r g e s J. C. A977) Une methode et un programme de classification hierarchique de preordres. Note de travail, COREF, № 19. 17. Kruskal J. B. A964) Multidimensional scaling by optimizing goodness of fit to a non metric hypothesis. Psychometrica, vol. 29, p. 1—27. 18. L e m a i r e J. A976) Agregation typologique des preferences. These de 3 cycle. Universite de Nice. 190
in Lemaire J. A977) Agregation typologique des donnees de preferences. Math Sci. Hum., 58, p. 31—50. 90 Luce R. D. A956) Semi orders and a theory of utility discrimination. Eco- nometrica, vol. 24, p. 178—191. 21. M e n u e t J. A974) Quasi-ordres et modelisation des preferences. SEMA, Direction scientifique. Note de travail, № 197. 22 Michaud P., MarcotorchinoJ. F. A978) Optimization in ordinal data analysis. Techn. Rep. 001, Oct., IBM, Paris. 23 MonjardetB. A973) Tournois et ordres medians pour une opinion. Math. ' Sci. Hum., №43, p. 55—70. 24. PeyrouxC. A975) Agregation d'opinions individuelles. These de 3eme cvc. le. Universite de Paris VI. 25. R i b e i 1 1 G. A973) Equilibre, equivalence, ordre et preordre a distance minimum d'un graphe complet. Math. Sci. Hum., №43, p. 71—106. 26. R о b e r t s F. S. A971) Homogeneous families of semi orders and the theory of probabilistic consistency. J. of Math. Psychology, Tome 8, p. 248—263. 07 S с о t t D. A964) Measurment structures and linear inequalities. Journ. of math. Psychology, 1, p. 233—247. 28. Scott D., S u p p e s P. A958) Foundational aspects of theories of measurement. The Journ. of symbolic Logic, 23, 2, p. 113—128. 29. Tabourier Y., Rochfeld A., FrankC. A975) La programmation structures Les Editions d'Organisation. 30. Tomassonne R., FlanzyC. A977) Presentation synthetique de di- verses methodes d'analyse de donnees fournies par un jury de degustateurs. Ann. Technol. Agric, 26, 4, p. 373—418.
Глава 10 • ЛОКАЛЬНО-ЛИНЕЙНЫЕ МОДЕЛИ 10.1. ВВЕДЕНИЕ 10.1.1. Постановка задачи При использовании временнйх рядов часто задают вопрос об устойчивости по времени (стационарности), т. е. желают знать, исходя из наблюдений, хорошо ли приспособлен один и тот же закон для описания одного и того же явления в разные периоды времени. Например, остается ли функция макроэкономического потребления той же до и после войны? Подчинялись ли промышленные инвестиции во Франции одному и тому же закону распределения до и после введения общего рынка? Изменилась ли функция импорта стран, в прошлом колониальных, после обретения ими независимости? В этих примерах группы наблюдений определены априори: потребление до войны, потребление после войны, инвестиции до вступления в общий рынок, инвестиции после вступления в общий рынок и т. д. В случае линейной модели стабильность во времени, следовательно, может быть измерена •с помощью критерия Шоу [7]. Во всех рассмотренных выше случаях проверка устойчивости относилась к двум последовательным периодам. Но она могла бы относиться и к «перемешанным» периодам времени. Например, остаются ли взаимоотношения в фирме «Филлипс» (по показателям: текущая заработная плата, цены, безработица) теми же при различных фазах конъюнктуры — подъема и спада? Тогда возникает более трудная задача: предположив, что временной ряд был порожден несколькими режимами регрессии, нужно определить моменты изменения этих режимов. Речь идет тогда об определении различных групп наблюдений и связанных с ними режимов регрессии. Возвращаясь к примеру с промышленными инвестициями, заметим, что теперь задача состоит не в том, чтобы проверить, изменил ли общий рынок поведение предприятий, а в том, что, зная, что это поведение менялось во времени, обнаружить один или несколько моментов, разделяющих разные режимы (и, если этого желают, связать их с изменением, происходящим в экономике страны), равно как и сами эти режимы. 10.1.2. Различные подходы Для решения рассматриваемой задачи были предложены различные методы, которые можно разделить на две категории. 192
1. Случай двух режимов: поиск точки переключения. Квандт [15] выражает функцию правдоподобия как функцию от моментов времени и максимизирует ее относительно средних рх, р2 и дисперсий а|, а\ двух режимов, а также относительно моментов времени. фэйрлей и Хиниш [9] предполагают, что точка переключения равномерно распределена на множестве выборок, и устанавливают критерий правдоподобия. Браун и Дарбин [1] предлагают определять рекуррентные невязки Ui (t .= е + 1, Т, где е — число объясняющих переменных и Т — число наблюдений), полученные при использовании t-x по порядку у и х (в модели у = х$ + и), и оценивать Р, основываясь на первых ц — 1) значениях у и х. Эти невязки преобразуются в переменные, распределенные согласно нормальному закону N @, а2/) и их кумулятивные суммы проверяются на значимость отличия от нуля. 2. Более сложная задача, предполагающая, что режимы могут прерываться и устанавливаться вновь в различные моменты времени, становится практически неразрешимой, ибо для ее решения требуется 2Т раз оценить функцию правдоподобия вместо Т раз. Использовались два новых подхода. Фэйр и Джаффе [8], Гольд- фельд и Квандт [10] предполагали существование дополнительной переменной z, которая позволяет классифицировать индивидуума (Уи xt) согласно, критерию: (уи хг) порожден режимом 1, если гх <: z0; (уи Xt) порожден режимом 2, если zt > z0, где z0 известно. Мак-Ги и Карлетон [12] используют алгоритм иерархической классификации и предлагают искать f<*>, k = 1, К (К известно), такие, что в случае обычного метода наименьших квадратов для р объясняющих переменных модель записывается следующим образом: где гг имеют распределение N @, а2) и независимы. Агрегирование производится в смысле остаточной дисперсии. Для этого алгоритма, дорогостоящего из-за большого числа наблюдений, необходима начальная стадия, состоящая в оценивании остаточной дисперсии для всех групп из (р + 1) наблюдений среди Т наблюдений. Если наблюдения перегруппированы таким образом, что их показатели упорядочены, на первой стадии остается тем не менее (Т — р) оцениваний остаточной дисперсии (следовательно, (Т — р) обращений (р X /?)-матрицы). Более того, р первых этапов иерархии невозможны, и окончательное решение зависит от этих первых этапов. 10.1.3. Предлагаемый подход Метод, который мы предлагаем, реализует синтез методов регрессии и автоматической неиерархической классификации. Неиерархическая классификация наблюдений, осуществляемая согласно мето- 7 Зак. 303 193
ду динамических сгущений, реализуется одновременно с вычислением гиперплоскостей регрессии. Мы получаем также типологию множества индивидуумов и множество гиперплоскостей локальных регрессий, связанных с выделенными типами, откуда и происходит название типологической или локальной регрессии. При применении предлагаемого метода строят, исходя из разбиения Р<°> (оцениваемого или выбираемого случайным образом) множества наблюдений на К классов (К фиксировано априори), последовательность L<n> из К гиперплоскостей регрессии и последовательность PW разбиений на К классов таким образом, чтобы минимизировать критерий, измеряющий неадекватность гиперплоскостей образованным группам (связь между этим критерием и критерием Шоу рассмотрена в 10.3.7.1). Используя функцию назначения, по которой строится новое разбиение Р, и функцию представительств, по которой строится новое представительство, мы решаем также задачу 2 с помощью алгоритма, менее сомнительного, чем те, в которых предполагается существование дополнительной переменной г и фиксированного порога г0, и менее дорогостоящего, чем алгоритм Мак-Ги. В ходе изложения мы приводим необходимые понятия и результаты о псевдообращении и гребневой регрессии. 10.2. ФОРМАЛИЗАЦИЯ ЗАДАЧИ Здесь мы предлагаем метод, позволяющий обнаруживать К локальных режимов регрессии и К связанных с ними гиперплоскостей, построенных из условия минимума критерия, измеряющего неадекватность подвыборок их линейным представлениям. Напомним сначала классические результаты регрессии и введем понятие псевдообращения. 10.2.1. Необходимые теоретические факты и псевдообращение Обычно модель линейной множественной регрессии с р переменными и п индивидуумами записывается в виде V, = 1,4 где Eet = 0, ?еге;. = 8ио2у 0< а2 < оо, V;, или в матричной форме: Y = ХЪ + е, ?е-0, Е (8'е) = а2/, где Y — (л, 1)-вектор, X — (п, /?)-матрица, b — (/?, 1)-вектор, г -— (п, 1)-вектор, 0 — (я, 1)-нулевой вектор. 194
Обыкновенный метод наименьших квадратов состоит в том, что качестве оценки Ь вектора Ь выбирают вектор, доставляющий минимум сумме квадратов невязок S (Ь) между наблюдаемыми значениями yt и подогнанными значениями yt зависимой переменной, что записывается так: п / р л 2 или в матричной форме: min (Y — Xb)' (Y — ХЬ) = min S (Ь). ь ь Условия первого порядка выражаются в виде mm ь •2L(b)= — 2Х' Y + 2Х' ХЬ - 0. дЬ Эти условия определяют нормальные уравнения: Х'ХЬ = X'Y. Условия второго порядка приводят к неотрицательно определенной квадратичной форме: dbdb' и гарантируют нам единственный минимум, если матрица X1 X положительно определена. В противном случае система нормальных уравнений допускает по крайней мере одно решение (и, следовательно, бесконечно много), причем каждое решение дает одно и то же минимальное значение S (Ь). Итак, возможны два случая: Х'Х обратима и хорошо обусловлена, Х'Х плохо обусловлена или необратима. В первом случае получаем классический результат: Т= (Х'Х)-гХ'У. Во втором случае (случай мультиколлинеарности, неортогональные переменные и т. п.) мы должны ввести понятие обобщенного обращения. Определение 1. Пусть А — (т, /?)-матрица ранга R. Матрицу А~ размера (ру т) называют псевдообратной к матрице Л, если АА-А -Л. Мы сейчас покажем, что такая матрица всегда существует. Рассмотрим матрицу АА'. Она является квадратной, размера (т, т)у симметричной, имеющей ранг R ^ т и неотрицательно определенной. Следовательно, ее можно диагонализовать, и так как у нее R положительных собственных значений и (т — R) нулевых, то существует ортогональная матрица Р, такая, что РАА' Р' = "О О 195
К о где Р' = Р-1 — матрица (т, т) и AR = • О ^ >Ая,—матрица (Я, Я). Представим Р в блочном виде: Р\ Р Г ГДО ^1"ма1Рица размера (/?, /я), а Р2—матрица размера (m—R, /rc). Из ортогональности матрицы Я получим откуда РХР\ — I. Кроме того, PAA'P'-\PlAA'P{ ^i^'^l^FAi, 0] \P2AA'P[ РгАА'Р'2\ [0 OJ' откуда PXAA'P[ = AR и Р2АА'Р'2 - 0. Так как Р2АА'Р'2 = (^2^) (^2^)'» из последнего равенства получаем Р2А = 0. Следовательно, а так как Я/Рх + Р'2Р2 - /, то Р[РгА = А и ЛЛ'Я; - />{A*. Лемма. Матрица G = ArP\K~RP1 является псевдообратной к матрице А. Доказательство. AGA - АА'Р'хАГьРгА = PIArA'^A - Р[РгА = Л. Таким образом, для каждой матрицы А существует псевдообратная матрица. Покажем теперь, что псевдообратная матрица к Л, вообще говоря, не единственна. Предложение 1. Пусть G — некоторая псевдообратная матрица к матрице А. Тогда для любой матрицы В размера (/?, т) матрица G + B — GABAG снова является псевдообратной к А. Доказательство. Зная, что AGA = Л, достаточно проверить, что A (G + В — GABAG)A = Л. В самом деле, раскрывая скобки, получим AGA + ABA — AGABAGA = А + ABA — ABA = Л. Предложение 2. Пусть G и Я — две псевдообратные матрицы к матрице Л, тогда существует матрица В размера (/?, т), такая, что Н = G + В — GABAG. 196
Таким образом, не только доказано существование псевдообратной матрицы, но и описана вся совокупность (вообще говоря, бесконечная) псевдообратных матриц. Очевидно, что если матрица А обратима, то Д-1 является единственной псевдообратной к А. Применение к линейным системам. Пусть имеется система ранга r<min(m, /?), где Л — (т,р)-матрица, Ъ~(р, 1)-вектор, g — (т,1)-вектор. Определение 2. Говорят, что система совместна, если для заданных Ли§" она допускает по крайней мере одно решение Ь. Предложение 3. Для совместности системы АЬ = g необходимо и достаточно AA~~g ------ g VA~". —ч Доказательство. Необходимость. Если существует решение 60, т. е. Ab0 — g, то для каждой псевдообратной матрицы А~~ имеем AA~g - АА~АЬ0 - АЬ0 - g. Достаточность. Пусть G — некоторая псевдообратная матрица к матрице Л, такая, что AGg — g. Тогда выявляется решением системы, и, следовательно, система совместна. Предложение 4. Если система Ab — g совместна, то ее общее решение имеет вид 1) = A~g + (/ — А~А% УЛ", V/i 6 RP. Доказательство. Нужно показать, что если AA~g = g*, то 1) \ГЛ" и/if Rp вектор b = Л~^ + (I — A~~A)h, таков, что Ab = = g", это получается сразу, поскольку АЬ = AA~g - g\ 2) Vb0, такого, что АЬ0 = g", существуют Л~ и А, такие, что Ьо = ^ ^~~^ + (/ — A~~A)h. Достаточно положить h = Ьо и взять любую псевдообратную матрицу Л~. Для регрессионной модели получим Л =Х% g-Х'Г, (р. р) (р. О 1Г= (Х'Х)~Х'К — (/ — (Х'Х~) (X'X))h. Определение 3. Напомним несколько результатов и статистичес^ ких критериев, позволяющих судить о значимости регрессии. 197 Доказательство. Помня, что AHA = А, выбираем В — Н — G проверяем, что Я = G + В — GABAG:
В случае когда модель содержит постоянный член (одна из объясняющих переменных постоянна м равна 1 на всей выборке), адекватность модели выборке измеряют с помощью коэффициента детерминации R2: остаточная дисперсия 1 г' г = I m t остаточная дисперсия 1 К = 1 = I полная дисперсия П : —(п, " I U П - 1 х, гдее =у—у, е= : —(п, 1)-векюр, у = — > yt и у= ХЪ. В случае когда модель не содержит константы (это ограничение, требующее, чтобы гиперплоскость регрессии проходила через начало координат), адекватность измеряют величиной У У У У ^ г' г Оценка а2 имеет вид а2 = ^зг^ (несмещенная оценка). Матрица ковариаций вектора Ъ равна: V (Ь) = о2 {Х'Х)-1 и, следовательно, 1/F) = а2 (Х'Х)-1, если (Х'Х)-1 существует. В 10.3 мы приведем выражение для матрицы ковариаций в случае, когда {Х'Х)-1 не существует или когда матрица Х'Х плохо обусловлена. Приведенные выше результаты будут применяться для каждого подмножества наблюдений, полученного после разбиения всего множества наблюдений на К классов. 10.2.2. Пространство представительств Пусть Е — множество наблюдений. Данные представляются в виде массива из п строк и (р+l) столбцов, где столбец — это один из п- мерных векторов (X1, ..., Хр, у), а /-м элементом zt множества наблюдений ? считается f-я строка-(/?+ 1)-мерный вектор zt = (X/, ..., XI yt)y Vi = TT^. Здесь (X1, ..., Х^) — р объясняющих переменных; у — переменная, которую надо объяснить. Определение 4. Назовем пространством представительств LK — = { (Ll9 ..., LK)} множество векторов (Lb ..., LK)> где —Bj—вектор коэффициентов регрессии. Пространство LK можно отождествить с RpK. Назовем пространством разбиений Рк = { (Ръ ..., Рк)} совокупность разбиений множества всех наблюдений Е самое большее на К классов. 198
Положим tij = card (Р}), V/ = 1, К, и обозначим через 4 i-ю строку массива Р), являющуюся (р+1)-мерным вектором. Тогда имеем z> Z'n. , x/ = Г*'/ L nj У1^ Здесь Z'— (rij, p+ 1)-матрица, представляющая собой ограничение на класс Pj таблицы всех данных. 10.2.3. Оптимизируемый критерий Алгоритм состоит в одновременном поиске разбиения на К классов множества наблюдений и К гиперплоскостей регрессии, связанных с этим разбиением таким образом, что минимизируется критерий: = 2 Минимизируют сумму квадратов остатков, связанных с разбиением множества из п наблюдений на К классов. Нужно найти пару (L*, Р*)г такую, что W(L*9 Я*)= min W(L9 P). 10.3. АЛГОРИТМ И ЕГО СВОЙСТВА 10.3.1. Функции / и g Функция назначения / является преобразованием LK в Рк: Определение 5. Пусть d : Е X Rp-> R+ —функция близости между индивидуумом и ядром Bjy определенная формулой d (Z, Bj) = (y- XBj)\ где X - (х\ ..., *р), Z == (X, у). Тогда для V/ 6 I7T полагают Z, В;) < d (Z, B,)Vt =^/}. 199
В случае если Hi : d (Z, Bj) = d (Z, Bt), то Z относят к классу с наименьшим индексом. Функция представительства g— это преобразование из Рк в LK: g: Pk-^Lk, где Bj — вектор, минимизирующий критерий R (В, /, Р) — ^d (Z, В), j т. e. R (Bj, /, P) = min {7? (В, /, Я)|В 6 Rp}, откуда, используя нормальные уравнения и вводя псевдообратную матрицу, получим Bj = Bj (h) = {{ЮУ {Xi)T(Х'У yl +AР-((ЯУ (Щ~ W (ЩК где /i — некоторый вектор из Rp. Когда объясняющие переменные коррелированы или когда матрица (XJ'Y (Xi) плохо обусловлена, мы выбираем в качестве Bj вектор Bj (h) с минимальной нормой (см. 10.3.4), чтобы избежать при восстановлении переменной у* сильного влияния объясняющих переменных с завышенными значениями (что приводит к иллюзорному восстановлению у). 10.3.2. Последовательности ип и vn Последовательность vn определяется следующим образом: где Р<°> (или Н°>) выбираются произвольно или оцениваются. v(n+i) строится по v(n): Последовательность ип определяется как ип — W (vn) (см. 1.3.5). 10.3.3. Сходимость алгоритма Предложение 5. Последовательность ип сходится убывая. Доказательство. Покажем, что 2) 1) и 2) =^ мЛ не возрастает. Докажем 1): V J 200
но B/n+l) V/= 1,/С —вектор, минимизирующий R (В, /, Р(»>) *= 2 d (z> В)> г*е z = (*» У)> Z еР*/1) откуда следует 1). Докажем 2): имеем win**», рси-п)^ ^ 2 {yi—xiBjn+l))\ где card (P<»+i)) = /!/. В критериях W(Un+l\ Р<я>) и И7(?(л+1). Р<«+П) каждый элемент из ? участвует один и только один раз. Пусть i (X, у) и V (X, у) — индексы классов, к которым принадлежит элемент (X, у) ? Е в разбиениях Р<п) и P(rt+J) соответственно. Тогда имеем W(U«+*K P<">) = 2 d(z, Bftg^), где г=*(Х, у), Е По построению разбиения Р(«+1) d (г, Bln{t!l)) > d (г, BlUl)) V г 6 ?, откуда, суммируя эти неравенства по z, получим 2). Из 1) и 2) следует, что последовательность ип не возрастает. Так как ип ограничена снизу нулем, она сходится. Сходимость достигается за конечное число этапов, так как множество Рк конечно и элементы последовательности Z>> принадлежат к конечному множеству g(PK) <= Lk- Предложение 6. Последовательность (Z», Р<п>) сходится к несмещенному элементу, т. е. (/>>, Р<»>) -> (L, Р) = (gof (L), / (L)). Доказательство. Как показано выше, последовательность иЛ сходится и достигает своего предела за конечное число шагов, следовательно, 3N, такое, что Vn > N РЩ. Но откуда W (Z>+1>, P<«+1>) = W (Z>+1>, P<">) = № (Z», P(«>). Последнее равенство можно переписать в виде к nj к nj 2 2 (у{—х1Щп+1)Т^ 2 S (М—хлв<«>J. 201
По построению вектора Bjn+l) имеем Равенство возможно, только если но тогда Б}Л+1) = B{jn)Vj = TTtf и, следовательно, Z>+1> - L<">. Поскольку Я<"+1> = / (L<"+1>) = / (Z») => /><"> = Я*"*1), то ЗЛГ, такое, что Vn>N, (Z», /><«)) = (LW, Р(^)). Таким образом, последовательность (L(n), P(n>) стабилизируется. Пусть (L, Р) — ее предел. Имеем (L, Р) == (L("+1), />(«+1>) Vn> N. Более того, =*(L%P) = {g.f (I), / (L)>, т. e. (L, />) - несмещенный элемент. 10.3.4. Гребневая регрессия и регрессия по Марквардту В процессе работы итеративного алгоритма возможны три ситуа ции на уровне каждого класса: матрица Х'Х некоторого класса необратима, поскольку число индивидуумов меньше числа объясняющих переменных; матрица Х'Х плохо обусловлена, что может быть, когда число индивидуумов незначительно больше числа объясняющих переменных. Оценки в этих случаях плохи тем, что их дисперсии велики; матрица Х'Х хорошо обусловлена (обратима) и параметры можно оценивать по классическому методу наименьших квадратов. Чтобы получить решение в первых двух случаях, мы пользуемся методом гребневой регрессии и псевдообращением. В дальнейшем мы предполагаем, что объясняющие переменные центрированы и нормированы, равно как и переменная, которую надо объяснить. Гребневая регрессия [11], [3], [4]. В случае неортогональных объясняющих переменных матрица корреляций «далека» от единичной матрицы. Вектор оценок, получаемый по методу наименьших квадратов, имеет, как правило, завышенную норму, а компоненты его могут иметь даже неправильный знак. В самом деле, пусть модель имеет вид Y = ХЬ + гу Ег = 0, var e = а2/. Метод наименьших квадратов дает оценку Ъ = (Х'Х)-1*'К
Вычислим расстояние между Ъ и 6: Е F — b)f F — 6) = ? tr F — Ь)' (Ь — 6), поскольку F — b)f (b — Ь) 6 R. Итак, Т=(Х' Х)~*Х' Y \ «* 6^(Х' Х)~1Х' (Хб + е), 7 = Хб + е ) ->?=6 + (Х/Х)-1Х/б, откуда (Ь-ЬУ (?-6) = ((Х' Х)-1^ 8)' ((X' X)-1*' е) ^tr((X' X)-XX' е)', ((X' X)-1 X' е) = tr ((X' X)-1 X1 е) (е' X (X' X)-1). Следовательно, Е F-6)' F—6) ^((Х'Хг1 X') а2 (X (Х'Х)-1) = a2tr (Х'Х). Пусть (^0/=Г7 ~^ Р с°бственных значений матрицы Х'Х, тогда 0/^/)^Т""р ~~ собственные значения обратной матрицы (Х'Х). Следовательно, Еф-ьу (b-b) = o* St. и если ^max = ^! > Я2 > ... > Хр = A,min > 0, то Еф — Ь)' {b — b)>aVKp. Если hp близко к нулю, то расстояние между 6 и 6 велико, качество оценивания плохое. Тем не менее можно улучшить качество оценки, если отказаться от поиска решения по методу наименьших квадратов в пользу решения, гарантирующего меньшие значения ||6||2. Чтобы решить эту задачу, мы сейчас введем понятие гребневой регрессии. Для избежания искаженного восстановления объясняемой переменной в гребневой регрессии ставится дополнительное условие, чтобы вектор b имел не слишком большую норму. Вектор 6 ищут из условия ||У—Х6||2= min || У—Х6||2, {Ь : || Ь ||« = а} где а фиксировано априори. Согласно методу Лагранжа эта задача эквивалентна поиску вектора, минимизирующего функционал L(b,x)= ||Г_ где х — множитель Лагранжа. Дифференцируя по 6 и х, получаем Для экстремального вектора 6 уравнения — 2X'Y + 2X'Xb + 2nb = О, ||6||= а. 203
Таким образом, I)b = X'Y Ъ = I (Х'Х) + х1]-г X'Y = b (х), где х находится из условия \]b\\2 = а. Предложение 7. Для каждого х>0 матрица (Х'Х + к1) обратима, и поэтому вектор Ь (х) определяется однозначно. Матрица (Х'Х + х/) лучше обусловлена, чем (Х'Х), каждое ее собственное значение на х больше соответствующего собственного значения матрицы (Х'Х). Доказательство. Положим А = Х'Х. Имеем А = SDS'y где S — матрица, составленная из ортонормированных собственных векторов, a D —диагональная матрица собственных чисел матрицы А. С учетом того, что S'S — /, получаем А + х/ = SDS' + х/ - SDS' + kSS' = S (D + x/)S'. Следовательно, собственные вектора матрицы Х'Х являются собственными векторами матрицы (Х'Х + х/) и D + х/ — диагональная матрица собственных чисел матрицы Х'Х + х/. Так как Х'Х — неотрицательно определенная матрица, ее собственные числа Xt неотрицательны, и поэтому собственные числа %г + к матрицы Х'Х + и/ положительны для любого х > 0, т. е. для любого х > 0 матрица Х'Х + х/ регулярна. Предложение 8. Ковариационная матрица оценок параметров имеет вид Vb (k) = g2(X' X + xiy^X' Х)(Х' Доказательство. Пусть Ъ — оценка по методу гребневой регрессии и Р — оценка по методу наименьших квадратов. Имеем X'Y = (Х'Х)М ?= (Х'Х + х1)-гХ'Г, откуда ^ (X' X + х/)-1(*' Х)Ъ Vb = ^ Х(Х'Х)(Х' Но V?= о2 (Х'Х)"\ следовательно, Определение величины и. Для определения величины х можно использовать итерационный процесс, в котором вектор Ъ оценивается последовательно для различных значений х (х = 0; 0,1; 0,2, ...). Останавливаются, как только значения оцениваемых коэффициентов стабилизируются, т. е. когда для каждой компоненты вектора Ъ относительное приращение, соответствующее изменению х, становится мень- 204
те фиксированного порога. Эта процедура полезна, когда заранее не знают, какое значение придать а. Она оправдана тем, что норма у ^ (х) 112 является убывающей функцией в положительной части окрестности нуля и тем, что минимум ее достигается для положительного значения х (см. [3], [4]). Псевдообращение.Согласно Марквардту оценка регрессии методом псевдообращения особенно интересна в случае, когда одно или несколько собственных значений корреляционной матрицы равны нулю; гребневая регрессия более приспособлена к случаю, когда собственные значения этой матрицы близки к нулю. Напомним метод вычисления псевдообратной матрицы, при котором используется вычисление собственных значений. Положим, как и вы- ше) а = Х'Х. Пусть D — диагональная матрица упорядоченных собственных значений А,х ^ %2 ^ ... ^ %р и S — матрица соответствующих ортонормированных собственных векторов матрицы А. Имеем S'AS = D, где S'S = /. Предположим, что А имеет ранг г, так что последние (р — г) диагональных элементов D равны нулю. Положим S = (Sr, 5Р_Г), где Sr — (/?, г)-матрица, a Sp-r — (р, р — г)-матри- ца, где Dr и Dp-r — (г, г)- и (р — г, р — г)-диагональные матрицы. Если Dp-r = 0, то по определению D^lr = 0, откуда или где Sj — собственный вектор матрицы Л, соответствующий собственному значению %t. Для выбора г можно использовать следующий критерий. Проверяют величину -~. Если -~ > со, где, например, со = = 10~5 , то полагают г = /?, если нет, то сравнивают р 7" р~г с со. Если р j Р > со, то полагают г = р — 1. В противном случае p-k продолжают итерации. На k-м шаге, если ^Kt/ tr D > со, то г = р — ky i=p если нет, то переходят к шагу k + 1. Геометрическая интерпретация определения псевдообратной матрицы по Марквардту. Пусть А — квадратная (/?, /?)-матрица ранга г<.ру для которой хотят найти псевдообратную. Пусть / — эндоморфизм пространства Rp, задаваемый матрицей А. Рассмотрим ImA = / (Rp). Ограничение / на ImA в ортонормированном базисе, порожденном первыми г собственными векторами Л, записывается с помощью матрицы Dr, a D; в этом базисе является на ImA обратным 205
преобразованием /-1, ограничение которого на ImA есть эпиморфизм. Таким образом, Ay = SrDy^r совпадает с преобразованием /-1 из ImA в ImA у записанным в исходном базисе пространства Rp. Для задания оператора Ау на всем Rp следует иметь в виду, что поскольку S'r г = 0 Vz 6 (ImAI-, то Ay можно продолжить на все Rp как композицию /""^(ортогональная проекция на ImA) и тогда ImAy = ImA. Итак, оператор А у является псевдообратным к Л, т. е. ААуА = Л, откуда получаем следующий результат. Предложение 9. Когда матрица X имеет неполный ранг, метод Марквардта дает решение по методу наименьших квадратов, ортогональное к Vb (аффинному многообразию решений Ь), если вектор Y фиксирован, иначе говоря, единственное решение с минимальной нормой, отыскиваемое методом гребневой регрессии при варьировании х. Доказательство. В самом деле, Vb есть прообраз при отображении X : Rp -*• Rn ортогональной проекции вектора Y на ImX — векторное подпространство в R" размерности г. ^^ Аффинное многообразие Vb параллельно подпространству ker X = ker X'X, поскольку ker X'X id ker X и имеет ту же размерность р — г, так как rang X'X = rang X = г. Итак, Т - (Х'Х)ГХ'Г 6 V? и ?6 /тХ'Х = кеП (Х'Х) - (K6)i, следовательно, b ? Vb f| (V&I. Практический способ выбора г. Выбор параметра г сводится к анализу главных компонент на строках массива X, т. е. на сгущении из п векторов объясняющих переменных Xt 6 Rp> i 6 1, п. В качестве объясняющих переменных оставляют лишь г первых факторов (или главных компонент), критерий, по которому отбрасывают (р — г) последних факторов, основан на доле инерции, объясняемой множеством отброшенных факторов. Этот метод, следовательно, родственный методам ортогональной регрессии. Предложение 10. Матрица ковариаций решения по методу Марквардта равна: Vb = a2 (Sr Dy1 S'r) (X' X) {Sr Dyx S'r). Доказательство. Имеем и если Р — решение по методу наименьших квадратов X'Y= (X'X)?, то 1) = (SrDrlSr) (X'X)? и Vb~ (Sr Dy1 S'r) (X' X)(V p) (X'X) (SrDy1 S'f). Поскольку У? - a2 (X'X)-1, 206
то Замечание о сходимости алгоритма. Сходимость алгоритма, как правило, имеет место. Она может нарушаться, по-видимому, только в том случае, когда применяют операции псевдообращения по Марк- вардту к матрице (X'X)j класса /, ранг которой больше /*, и если уменьшение остаточных дисперсий в других классах не компенсирует возрастание остаточной дисперсии в этом классе /. Выбор конкретного псевдообращения или оценки гребневой регрессии для одного или нескольких классов во время одной итерации влияет посредством функции назначения на строение следующего разбиения. Возможно, что выбор другого псевдообращения позволит получить лучший локальный минимум. 10.3.5. Исключение эффекта «цилиндра» Эффект цилиндра, отмеченный в факторном типологическом анализе (см. гл. 6), может равным образом возникать в типологической регрессии, когда случайный выбор начального разбиения (или начальных разбиений) является «неудачным» (рис. 10.1). Рис. 10.1 В этом случае (/? = 2, К = 2) случайный выбор Р = (Ръ Р2) не позволит распознать структуру в двух однородных классах совокупности. Речь, следовательно, идет о том, чтобы модифицировать алгоритм на уровне его первых итераций с тем, чтобы исключить эффект цилиндра. Рис. 10.2 207
10.3.5.1. Эллипсоид случайного вектора Пусть у' = 1, % — векторы размерности (/? + 1), элементы множества Е. Класс /^ представлен /i/ реализациями вектора Z/ размерности (/? + 1). Обозначим через Z' средний вектор и через Vj — ковариационную матрицу этого класса. Vj — матрица размера (р + U Р + 1) и ранга г. Определение 6, Если г = /? + 1» то эллипсоидом (/? + 1)-мерного случайного вектора Z' называют множество (/7 + 1)-мерных векторов W, таких, что W'Vj^-W^c), Cj — положительная постоянная. Если cj = 1, то получают эллипсоид-индикатор. Если г< р + 1, то существует ненулевой вектор и, такой, что Vju = 0, откуда a'l//U = 0 и, следовательно, по определению матрицы Vj Е [и' (Z> -Z7)]2 = 0 =Ф и' (Z7-Z7) = 0. Таким образом, вектор (Z/ — Z^ принадлежит к векторному подпространству, ортогональному всем векторам и, таким, что V}-u = 0. Это подпространство размерности г называют носителем Zi — ZL Пусть R — матрица размера (р + Up — т + 1) ранга р + 1 — г с нормированными вектор-столбцами, такая, что уравнение VjRj = 0 определяет этот носитель. Тогда R/ (Zi — Z') = 0. Определение 7. Если г <С р + 1, то эллипсоидом вектора Zi называют множество векторов W> таких, что и удовлетворяющих условию R/W = 0. 10.3.5.2. Модификации, вносимые в алгоритм Определение 8, Множество элементов класса Ру, лежащих внутри индикаторного эллипсоида, назовем индикаторной частью этого класса. Оно задается следующим образом: Z?Pj (ZeQj & {Z-ZJY Vrl (Z-lf) < l), если г = />+ I, Z e Pj (Z 6 Qj&iZ-ZiyiVj + R, R^~l (Z-Z0< l), если r<p+ I. Заметим, что Qj cz PjVj = l, К и (Qx, ..., Qk) не является разбиением множества наблюдений Е. На первых итерациях алгоритма рекомендуется следующая его модификация: h g' разбиение Р -> индикаторные части Q ->• представительства индикаторных частей -> разбиение Р, 208
где ft: PK-+( p._>. Qj = {Z — элемент класса Pj, лежащий внутри индикаторного эллипсоида этого класса}, g' : ($> {Е))к ->- L к, расширение отображения g на C* (Е))ку f : LK-+ PK определяется, как раньше (см. 10.3.1). При применении указанной процедуры на всех шагах сходимость алгоритма не гарантируется (это происходит из-за введения отображения ft). Поэтому такая модификация используется только на первых итерациях, а последующие шаги проводятся в рамках прежнего сходящегося алгоритма. 10.3.5.3. «Хвост» эллипсоидов Если предположить, что (р + 1)-мерный вектор Z* имеет нормальное распределение со средним Z' и невырожденной матрицей ковариа- ций Vjy то В самом деле, так как Vj — положительно определенная матрица, то существует обратимая матрица Wy такая, что Vj=WW. Тогда случайный вектор а = W~~x (Zi — Z') имеет нормальное распределение с матрицей ковариаций Сумма квадратов его компонент имеет распределение %р+1 и может быть записана в виде а' а = (Z'* — Z')' (W -')' (W -l) [Zl- ZJ) = (Zl —D) Vfl (Z* —If). Можно также вычислить величину Xp+i,t, как функцию от (/7+1) и той доли совокупности т, которую мы желаем иметь внутри эллипсоида из условия Р {хр+1 > хр+\, т} = 1 — т> и» таким образом, фиксировать параметр Cj. 10.3.6. Оптимальный выбор числа классов Каким бы ни был применяемый метод классификации, встает задача выбора числа классов. На практике вычисляют один (или несколько) показатель, позволяющий оценить это число классов. Мы опишем здесь два таких показателя. Первый р ,дгч внутриклассовая остаточная дисперсия ^ ' полная остаточная дисперсия ' где /С — число классов* Полная остаточная дисперсия записывается в виде P 205
где У/ — вычисленное с помощью глобальной регрессии значение У/. Пусть YfL — значение У/, вычисленное по методу типологической регрессии с К классами. Докажем, что к ->f J ?-?} У, т. е. что полная остаточная дисперсия = внутриклассовая остаточная дисперсия + межклассовая остаточная дисперсия. Имеем V/, Yt, откуда в векторной форме Нужно показать, что последнее слагаемое равно нулю. Итак, для всех / имеем так как каждый Yj в проекции на линейное многообразие, порожденное объясняющими переменными класса Р}, дает Y\. Суммируя это равенство по /, получаем, что <У — YL, YL>=0. Остается показать, что <iY— YL, Y~> = 0. Пусть Х = — векторы наблюденных значений классов Р1У...,РК. Имеем j- = Х} (X/ Xj)-1 XJ Yj V/ = ТГК, откуда 210 Yj - Y\ = (/ - Xj(X',X;)-lX',)Yj V/ = 1, К.
разложим вектор У в композицию: f+t к где мы использовали то, что Х'Х = ^X!Xi9 и приведенное далее предложение 11. Имеем где Al^ Заметим, что хгм12 мхи-1)! ^xi 2 2 (Я Хй)-1(Х} Х,))~1. к <y-yL, y>= 2 <*0-уг/'> Предложение 11. ) (к 2 /=1 Рис. 10.3 к к -\ / к ( (если обратные матрицы существуют). 211
Доказательство, В самом деле, пусть М — обратимая матрица, такая, что ) Имеем /к \ /к \ / /=м i 2 Ai * I [ 2 ^ч ~ ^ ( откуда к к /К \ -1 /К Предложение 12. Вектор локальных невязок ортогонален вектору вычисленных глобальных значений: _ у ьу у> = 0. Доказательство. -YK Y> = |j <(/ -Xj (X/ X^)-1 X;-) У;-, XjMx x 2 wx,)-1) x l / x Положим c(K)= тогда 212
Имеем с (К) = 0, если К = 1, с (/С) = 1, если внутриклассовая дисперсия равна нулю, т. е. когда критерий алгоритма типологической регрессии равен нулю. Чтобы оценить значение параметра /С, строят график кривой с (К) (рис. 10.4). Анализируя эту кривую, можно заключить, что приемлемая для нашего С1 примера величина К равна, 4. Второй показатель определяется по аналогии с /^-критерием Фишера: х ж цу__уч|2 К—1 ' 0 12 3 4-56 И где п — число наблюдений. Рис. 10.4 10.3.7. Связь с критерием Шоу Критерий Шоу — это критерий однородности и устойчивости. По существу, речь идет о частном случае критерия общей линейной гипотезы. Принимается, следовательно, гипотеза о нормальности возмущений. Критерий оказывается очень интересным в случае локальных линейных моделей, так как он позволяет проверить, являются ли локальные представительства, которые мы получаем, существенно различными. Например, в экономических приложениях нужно проверить, исходя из наблюдений, хорошо ли приспособлен один и тот же экономический закон к описанию одного и того же явления в разные периоды времени. 10.3.7.1. Критерий Шоу Пусть модель состоит из К регрессий, соответствующих разбиению множества наблюдений Е на К классов: где Ее1^=0у Vex = (о Предположим также, что ранг Xk*=p Vfe, где р — число объясняющих переменных. Допустим также, что возмущения имеют нормальное распределение. Задача состоит в следующем: проверить Но : Ъг = Ьг = ... = Ьк 213
против На : Ьг фЬ2 ф... ФЪК (bj попарно различны). Собирая К регрессий A), запишем модель в виде или где " Ух' У* -Ук. в сжатой форме: У = Xj X • ~Хг у *•*¦ 2 0 - ХЬ + е, Уз: ("л 1 l{nhp), 1 (п о * 1 / Ег ^:( ъ% -ьк^. = 0, 1/е = ; = card (/>; Р, 1), У: (л КРг 1) _. = аЧ Л). AZ, 1 е2 > В соответствии с критерием Шоу при принятых выше предположениях и при справедливости гипотезы Но F_ n-pK CKOo-CKOfl ~р(/С—1) ' СКОа имеет распределение Фишера FP(K^\)t п~кр- Здесь СКО0 — сумма квадратов остатков при оценивании в условиях гипотезы #о (значение СКО0 получим, если проведем глобальную регрессию, т. е. с К — 1); СКОд — сумма квадратов остатков при оценивании в условиях гипотезы На (значение СКОа получим, если выберем локальную регрессию на К классов, для которой критерий W минимален); Fp (к-1). п-кр — распределение Фишера с р (К — 1) и п — Кр степенями свободы. Замечание 1. Для вычисления СКОа используют тот факт, что в модели, составленной из К регрессий, в случае, когда возмущения для разных регрессий некоррелированы, мы придем к одинаковому результату независимо от того, будем ли производить подгонку по методу наименьших квадратов для составной модели или для каждой из К регрессий отдельно. Отсюда ско« = ско1+ско2 + ... + ско*. В случае справедливости гипотезы Яо модель A) можно записать в виде (взяв в качестве Ьо общее значение (&,-)/= i. кУ- "уГ _УК_ = Хк или в сжатой форме: 214 у = Zb0 + e,
откуда СКОо - (V еH, где г— у —у. Замечание 2. В случае когда мы имеем дело с временными рядами, зиожет оказаться, что многие из К выборок будут иметь малый объем nG сравнению с числом объясняющих переменных (что оправдывает применение псевдообратных матриц). Тогда вычисление СКО0 остается тем же, поскольку ранг = /?, если gi?]/e], такое, что Хг имеет ранг р. При альтернативной гипотезе, имея по-прежнему равенства СКОа =CKOi-f... + СКОК> мы не можем вычислить СКО* обычными методами, если ранг Xt <С р. В этом случае, как легко понять, CKOj = 0. В самом деле, через щ линейно-независимых точек можно- провести гиперплоскость размерности р> niy следовательно, СКО^ = 0 Vt G Ш, такого, что ранг Хг < р. В случае когда Н* такое, что ранг Xt < p, критерий Шоу записывается в виде F \Ф1 П} Р СКОо-СКОа F р(/С —2) СКОа где F имеет распределение Фишера F (K_2) S (я—рУ Наконец, для того чтобы проверить гипотезу о том, являются ли К регрессий значимо различными с порогом е, достаточно проверить выполнение неравенства и отвергнуть гипотезу Яо : Ьх = Ь2 = ... = Ьк при выполнении этого неравенства. 10.3.7.2. Связь между критерием Шоу и критерием W Задача: найти min W (L, Р), где эквивалентна задаче: найти max F, где р _ п—Кр СКОо-~СК00 ~ 1) СКОа 215
В самом деле, F можно переписать: r_ п-Кр ГСКОр Л р(К-\) Поскольку п, К и р постоянны и значение СКОа постоянно, то max F Ф» max —1-— 44 min СКОа <н> min W (L, Р). СКОа Тем не менее критерий F Шоу — это критерий, предполагающий нормальность, тогда как наш критерий W чисто метрический. 10.3.8. Метод прогноза, связанный с локальными линейными моделями 10.3.8.1. Задача Мы хотим решить следующую задачу: пусть X — новый индивидуум, X = (X1, ..., Хр). Предположим, что X принадлежит к одной из групп, но неизвестно, к какой. Требуется определить решающее правило, позволяющее относить этого дополнительного индивидуума к одному из классов Р*, ..., Р?, и значение объясняемой переменной Y для этого индивидуума. 10.3.8.2. Регрессия с помощью шаров Метод регрессии с помощью шаров [2], [3], [4] позволяет решать задачу отыскания функциональной регрессионной зависимости исходя из эмпирических данных. С п реализациями (X}, ..., X?, y^)/=i,n, связывают сгущение из п точек в R*7 (точка задается своими р координатами, соответствующими объясняющим переменным). Каждой точке приписывается значение Yt. (Мы предполагаем, что две точки никогда не совпадают.) Чтобы предсказать значение переменной Y для нового индивидуума с координатами (X1, X2, ..., Хр), мы ищем S точек (S фиксировано) множества индивидуумов, ближайших к (X1, ..., Хр), и берем в качестве Y среднее значение объясняемых переменных этих 5 точек. 10.3.8.3. Правило отнесения нового индивидуума Пусть Р*, ..., Р1с —К классов, полученных в результате работы алгоритма. Пусть Х = (Х\ ..., X") — р координат нового индивидуума. Пусть S = {s 6N|smax>s>smlrJ, где smax и sraln фиксированы. Для каждого s 6 S и каждого / = {1, ..., К} обозначим через pj (s) число точек, принадлежащих Р/, среди s точек, ближайших 216
к X. Пусть Vs 6 5 Js - { / 6 {'1, ..., /С}, р7 (s) - max р, (s)} и у/ = 1=ТГк ^ {1, ...» К}, положим smin где Пусть l, если/6У8, 0 в противном случае. У* - {/*|т|/. = Если |«/*| = 1, то мы относим X к Р/, если нет, то мы меняем границы изменения s. Получаем прогнозируемое значение Y: f 0.3.8.4. Пример Положим К = 2, /7 = 2, 5ш1п = 1, 5гаах = 5, X = E, 2, 1). Было получено: Jx = A), У2 = A, 2), У3 = B), J4 - B), У5 - B), откуда X б Р*2. /23456789/0 Рис. 10.5 '04. ВХОДНЫЕ И ВЫХОДНЫЕ ДАННЫЕ ПРОГРАММЫ Необходимо вводить: п — число наблюдений, К — число классов, 217
р — число объясняющих переменных, ITER — максимальное число итераций алгоритма, (L<i>, ..., L<&>) —начальные представительства (или РФ, ..., Y, X — экзогенные и эндогенные переменные. На выходе получим: Р = (Ръ..,Рк), L = (Llf ...,LK), W, оценки а/, / = 1, 2, ..., К дисперсий, ковариационные матрицы параметров V (bj) - of (Srj D7S S'ri) (Xj Xj) (Srj D7r S;,)f если bj вычисляются по алгоритму Марквардта, и fa = of (X; Xj + kj I)-1 (Xj Xj) (Xj Xj + kj 7)-1, если bj — оценка по методу гребневой регрессии, jR/, / = 1, 2, ..., К— квадраты коэффициентов корреляции и графики переменных Y и Y. 10.4.1. Общая схема алгоритма 1 • Выбор L(n) Вычисление i(n) с помощью функции предстабительства X Вычисление. р(п) с помощью срункции назначения Оценибание критерия [ 77= П W w устойчиб Рис. 10.6 218
Вычисление 1<Л> (гребневая регрессия). Вычисление матрицы X'X корреляции нормированных объясняющих переменных Применение гребневой регрессии Обращение [(х'х) Вычисление Ь=((Х'х) не устойчивы Проверка коэффициентов b \ Коэффициенты устойчивы | конец | Рис. 10.7 10.5. ЗАКЛЮЧЕНИЕ В [6] применяется алгоритм типологической регрессии к моделям обобщенных наименьших квадратов, наименьших абсолютных отклонений, ортогональной регрессии с ошибками в переменных, авторегрессионным моделям. С другой стороны, в рамках метода типологической регрессии мы подошли к задачам распознавания образов. Используя регрессионные методы в условиях локальных линейных ограничений и неиерархическую классификацию, мы получаем алгоритмы сжатого кодирования кривых (например, кривых уровней высот в автоматической картографии). Эти алгоритмы позволяют восстанавливать непрерывные кривые, с непрерывными производными или сплайны. Наконец, мы распространяем модели типологической регрессии (применяемые в случае количественных переменных) на ситуации, в которых требуется объяснить ординальную, качественную и количественную переменную с помощью группы разнородных переменных (смесь ординальных, качественных и количественных переменных). Мы получаем алгоритм итеративного типа, который дает одновременно 219
разбиение наблюдений, гиперплоскости локальных регрессий и связанные с ними оцифровки переменных. В [6] рассматриваются различные применения этих алгоритмов, в частности, в геологии и автоматической картографии. ЛИТЕРАТУРА 1. Brown , Durbin A968) Methods for investigating wether a regression relationship is constant over time. Congres Europeen de statistique, Amsterdam. 2. Benzecri, Cazes A974) Methodes statistiques de la taxonomie. LSM Paris VI. 3. Cazes A975) Protection de la regression par utilisation de contraintes lineages et non lineaires RSA, № 3, vol. 23. 4. Cazes A975) Techniques de la prevision lineaire. Ecole d'ete d'Analyse Numerique, IRIA. 5. Charles C. A977) Regression typologique. Rapport de recherche IRIA, № 257. 6. С h а г 1 e s C. A977) Regression typologique et reconnaissance des formes. These de 3eme cycle, Paris IX. 7. Chow A960) Test of equality between two sets of coefficients in two linear regressions. Econometrica, 28, p. 561—605. 8. Fair, Jaffee A972) Methods of estimation for markets in desequilibrium. Econometrica. 9. Fairley, Hinich A970) A test for a shifting slope coefficient in a linear model. JASA 65, p. 1320—1329. 10. Goldfeld, Quandt A972) Non linear methods in econometrics. Amsterdam, North Holland Publishing Co. 11. Hoerl, Kennard A970) Ridge regression, biaised estimation for non orthogonal problems. Technometrics, vol. 12, № 1. 12. McGee, Carleton A970) Piecewise regression. JASA 65, p. 1109— —1124. 13. Marquardt A970) Generalized inverses, ridge regression. Biaised linear estimation and non linear estimation. Technometrics, vol. 12, № 3, p. 591 — -611. 14. M a z о d i e r. Polycopies sur la regression — ENSAE. 15. Quandt A958) The estimation of the parameters of a linear regression system obeying two separate regimes. JASA 53, p. 873—880. 16. Saguez, Santini A979) Formalisation du probleme de la regression par morceaux en termes de contr61e des systemes. IRIA. 220
Глава 11 • ТИПОЛОГИЧЕСКОЕ СГЛАЖИВАНИЕ П.1. ВВЕДЕНИЕ Метод, которому посвящена эта глава, появился в связи с некоторыми проблемами, часто возникающими при анализе данных. Во-первых, это обработка данных, описывающих эволюцию явления в виде графика, иначе говоря, данных, к которым удобно применить полиномиальную модель. И во-вторых, это проблема обработки таблиц данных с пропусками. Дело в том, что часто не все наблюдения могут быть проведены в одинаковых условиях. Речь идет о таких измерениях, как, например, содержание минерала на различной глубине (в геологии), увеличение веса животного (в животноводстве), изменение в численности популяций (в агробиологии). Наша задача состоит в определении групп, каждая из которых состоит из объектов, или наблюдений, изменяющихся по одному и тому же закону и принадлежащих некоторой исходной, возможно неполной, совокупности. Иначе говоря, в многомерной выборке требуется выделить подмножества, каждое из которых может быть описано полиномиальной функцией. Метод типологических сглаживаний состоит в автоматической классификации данных, содержащих пропущенные значения. Обычно при неполных данных классификации предшествует оценка пропущенных значений. Особенностью описываемого метода является то, что в нем одновременно выполняются классификация и аппроксимация. На наш взгляд, это позволяет избежать многих неудобств. Прежде всего процедура, в процессе которой выполняется столько аппроксимаций, сколько существует объектов, может оказаться черес- ЧУР дорогостоящей. С другой стороны, при оценке пропущенного значения было бы желательно принимать во внимание все похожие объекты, и, таким образом, заменять классическую интерполяцию статистической интерполяцией (группы объектов), поскольку характерные и отличительные черты групп нас интересуют больше, чем особенности отдельных объектов. Из практических соображений будем считать, что строки таблицы Данных являются известными определяемыми экспериментально значениями на некотором носителе функций одной переменной. Ограничимся случаем, когда носитель J дискретный, естественно упорядоченный и его элементы разбивают числовую прямую на интервалы равной длины. Поскольку, как правило, вид наиболее подходящих Функций неизвестен, нам кажется уместным для характеризации классов искать многочлены небольшой степени. Будет показано, что такие 221
условия можно наложить и на неполные данные, допуская при этом некоторую ошибку. Алгоритм, который приводится далее, определяет разбиение совокупности на классы, каждый из которых характеризуется многочленом. Степень многочлена определяется в процессе подгонки. Вклад класса в значение критерия говорит о его дисперсии относительно характеризующей кривой и позволяет оценить качество характеризации. 11.2. ОБОЗНАЧЕНИЯ Наличие пропущенных данных, или «дыр», в обрабатываемой таблице с трудом позволяет согласовать требования, которым должны удовлетворять хорошие обозначения, а именно сжатость и ясность. Пытаясь ввести достаточно четкие обозначения, мы сделали их относительно громоздкими. Пусть /, J — конечные множества индексов, где t 6 / нумерует объекты, a / 6 «/ — переменные и xit — значение /-й переменной для 1-го объекта. Для каждого i ? / обозначим через Jt множество переменных, действительно измеренных для объекта i, т. е. Jt = {] ^J:xK— не дыра}; |/*| = card (Jt). Аналогично для каждого j ? J обозначим через /7- множество объектов, для которых имеется информация о значениях /-й переменной, Ij = {i ? I : х\ — не дыра}; |//| = card (//). Следовательно, каждый объект i может быть представлен вектором из R'JH, обозначенным xJ = {xL\j ? Ji), а каждая переменная / — вектором из R1 *j I, а именно х{ = {х{: i 6 Ij). Множество объектов может быть представлено в виде Е = {xj : i e /}• Множеству Е соответствует таблица xJp содержащая пропущенные данные и 2|/*| измеренных значений переменных. Пусть Р = (Plf ..., Phf ..., Рк) — некоторое разбиение множества / на k классов. Для каждого класса Pk определим следующие множества: 1) Jк- — множество переменных, принимающих хотя бы одно значение на объектах класса Pk, т. е. Ju-= {/ 6 J ' 3t 6 Pk* такое, что х{ — не дыра} = tVp Jt\ ft 2) Ij,k — множество объектов, принадлежащих Pk, для которых измерены значения /-й переменной: Ij,k = {i 6 Pk ' х{ — не дыра}. 222
11.3. ОПИСАНИЕ МЕТОДА 11.3.1. Частный случай 11.3.1-1- Структура классов и пространства представительств Рассмотрим случай, когда для каждого класса существует единственный представитель и структура классов является некоторым разбиением (см. 1.3.1). В качестве пространства представительств L возьмем множество многочленов степени не выше п. уХ 6 L обозначим XJ множество {X (/) : / ? J} значений, принимаемых многочленом X на конечном носителе из J. Значение X (/) V/ будет обозначаться также как Хк Поскольку L является векторным пространством размерности п+ 1, всякий многочлен X может быть разложен по некоторому базису Л = {Ло, Alt ..., Ап}: X = ? СаАа и характеризован вектором коэффициентов, соответствующих этому базису. Таким образом, многочлен X может быть отождествлен с вектором (Со, С1у ..., Сп). Определим следующие понятия: а) мера близости между объектами и многочленом: D : Е X L -> R+, ^ -ЖО1), A) где fA;-—весовые коэффициенты переменных [например, б) мера адекватности классам их представлений: R : L X ДО X Рк^ R+, где ]К) = {1,2, ...,/С}, Л(«,й,/>)= 2 D(jrf,«j. B) И.3.1.2. Функция представительства и функция назначения Функция назначения задается точно так же, как и в гл. 1: / : LK-> PKVL = («lf ..., «K)f / (L) = Я,, где Pk={i:iei\D D 55fc) - inf {D (x/, ЖЛ. ):*' б ]*]}}. 223
Функция представительства g: Px~^LK задается формулой g(P)^L = (Xlf...9Xh9...9XK)9 C) где %k, k= 1, ..., КУ —многочлен степени не выше /г, минимизирующий R (•, ky P). Можно показать, что для всякого фиксированного базиса многочлен Xh определяется однозначно и является многочленом регрессии. 11.3.1.3. Оптимизируемый критерий Критерий W:LK X PK-+R+, представляющий собой меру близости между разбиениями на К классов и соответствующими представительствами, задается формулой ,P).= 2 2 D(rf,Zk) = &]К] iP = 2 2 Hi 2 U-xLYl Sii, D) 11.3.2. Ограничения 11.3.2.1. Ограничения на дисперсию и меры близости Пусть объект i представлен вектором xf, компонентами которого являются \Jt\ соответствующих наблюдений. Рассмотрим многочлен X = ЛС и вектор 55Jf, составленный из его значений на носителе У*. Введение метрики V71 в пространстве R17*1, для которой расстояние между элементами из R; J/ ! равно: ]' КГ1 [xi-(AQJ*\ = и определение коэффициентов С, минимизирующих это расстояние эквивалентны требованию, чтобы объект i удовлетворял условиям: Заметим, что меры близости A), B) и D) могут быть интерпретированы следующим образом: \\xJ(-X'i\&T>, F) R(X,k,P)= S 1К-2Щ-', G) ГA,я)= s s IK-Jrill^«, (8) 224
где 2 i Замечание 1. Ограничения на дисперсию были наложены для того, чтобы выполнялись соотношения F)—(8). Замечание 2. Многочлен, минимизирующий G), является регрессией. Замечание 3. Если V/ \ij = 1, то в (8) 2 \ij= \Jt\. 11.3.2.2. Центр тяжести класса Определение. Центр тяжести класса k, обозначаемый ется как |/^|-мерный вектор с компонентами определяОбозначим через \jt k суммарную массу элементов класса РкУ у которых измерен /-й параметр, т. е. 1 Тогда Положим Замечание. G^ является центром тяжести в обычном смысле, если рассматривать &-й класс как сгущение { {xjh, rr\) l rr\ точек *?k с весами Mil Поскольку /г- с: Jh, если ^ — пропущенное наблюдение, то определение согласуется с предположением -^ 0. 11.3,2*3. Базис интерполяционных многочленов Выбор базиса. Конечно, в качестве базиса в пространстве многочленов степени не выше п можно взять одночлены 1, х% х%, ..., хп, но мы будем руководствоваться желанием упростить вычисления, осо- 8 Зак. 303 225
бенно операцию обращения матрицы, и поэтому изберем базис, состоящий из ортогональных многочленов. Заметим, что для каждого класса возникает своя проблема обращения V**1, и, следовательно, необходимо строить свой базис интерполяционных многочленов ортогональных в метрике У*:1, что делается относительно несложно одновременно с вычислением вектора оценок Ck. Каждому базису из многочленов Ло, ..., Ап можно поставить в соответствие матрицу Ah размером \Jk\ X (п + 1), содержащую значения этих многочленов на носителе Jh. Пусть матрица VT1 размером \Jk\ X \Ju\ вводит метрику на/?17*1: и Ck = (A'kVk 1Ak)~1Ak. Для простоты будем далее опускать индекс ky не забывая о том, что речь идет о некотором фиксированном классе. Элементы матрицы (Л'У"Л) = S имеют вид iAJ|VM|*j=: 2 A4AfcvAft|iy; a,p= 1,..., n+ 1 поскольку V/ (? Jk v/, k = 0). Это можно записать в виде Sap = = <Ла, Ap>v-i, откуда, в силу ортогональности базисных многочленов в метрике К-1, видно, что матрица 5 диагональная. Кроме того, cov (с) = Е I (с — с) (с — с)'], и поскольку 5 диагональна, то var (са) = а2/<Ла, Aa, > Va и cov (ca, cp) = 0 при р фа, т. е. коэффициенты некоррелированы. Построение базиса из ортогональных многочленов на носителе Jh (см. [3]). Напоминание. На множестве многочленов, которые можно рассматривать как элементы пространства Ry, вводится скалярное умножение индуцированное евклидовой метрикой, ассоциированной с классом k*. Или если многочлены Р и Q представить в виде векторов соответствующих значений на носителе Jki то эти векторы будут элементами R'y&' и можно записать: <Р, Q> P'V lQ. В векторном пространстве многочленов степени не выше п будем искать базис Ао> ..., Ant такой, что при 0< a< n А« —многочлен ¦Поскольку Ijth Ф 0 и Vjik — 0 для всех / $ Jhf то <Р/, QJ 226
степени а и V ф, а), 0<а< р<л,<Ла, Лр> = 0. Очевидно, что д0 = const. Положим Ло = 1. Мы можем доказать следующее предложение. Предложение 1. 1) Vcc^O многочлен Aa+i, который может быть выражен через Ла и Ла~ 1 соотношением Ла+1 (л:) = (х — аа)Ла (х) — ba_iAa__i (х), ортогонален всем многочленам Ар, где |5 ^ а, если (*Ла, Ла> аа= — ГТ"-' 0а-1 = а> Ла> <Ла-1' Ла-1> 2) {Ло} U {Лд+ь а = 0, ..., л — 1} — базис пространства многочленов степени не выше п. 3) В этом базисе оценки коэффициентов регрессионного многочлена имеют вид: <Ла- Ла> Многочленом степени п, минимизирующим дисперсию, будет 7 {А«> G) л Замечание. Если требуется построить многочлен степени п+1, то не надо заново строить базис и коэффициенты Са, достаточно положить 7 —Т i <лЛ+1» о) л , Лп+1) Это равенство используется, когда проверка показывает, что степень регрессионного многочлена неудовлетворительна. Оно позволяет повысить степень, не повторяя всех вычислений. П.3.3. Алгоритм 11.3.3.1. Описание Первый шаг алгоритма случаен, производится какое-то разбиение на К классов. Число К либо задается, либо определяется по свойствам данных. Шаги 2, 3, 4, 5 составляют одну итерацию. Отличие этого алгоритма от других методов динамических сгущений заключается в шаге 2 (особенно 2.1 и 2.2). В 11.3.2 описывается содержание этого шага. Сходимость и остановка алгоритма гарантируются его свойствами, которые сформулированы в 11.3.3.2. В результате работы алгоритма на шаге 6 выдается 8* 227
разбиение множества I на К классов (возможно существование пустых классов), каждый из которых характеризуется многочленом степени не выше я, где число п определяется a priori и уточняется в процессе подгонки (см. 11.3.4.2). Анализ классоб некоторого разбиения 2.1 2.2 2.3 Случайное разбиение собокупности объентоВ на Нтах классов Поиск непропущенных измерений и определение] центра тяжести Ь-го класса Определение регрессионного многочлена i^ для ff-го класса Вычисление меры близости между объекта ми класса Р и мно гочленом Разбиение с исполь- зобанием таблицы „расстояний? вычисленной на шаге 2.3 Все ли классы просмотрены ? нет Вычисление значения оптимизируемого критерия Результаты- разбиение на классы, каждый из которых характеризуется многочле - ном Рис. 11.1 11.3.3.2. Сходимость Конец На третьем шаге каждой итерации вычисляется элемент последовательности iii = W (L(/\ P(/>). Можно показать, что при условиях существования и единственности регрессионного многочлена степени п для каждого класса Pk (что доказывается в 11.3.4.1) убывание после- 228
довательности щ и, следовательно, сходимость алгоритма вытекают из определения отображений /, g и R. Доказательство аналогично приведенному в гл. 1. 11.3.4. Решение и его свойства 11.3.4.1. Статистическая и алгебраическая интерпретация функции представительства Оценки коэффициентов регрессионного многочлена, минимизирующие квадрат V-1 — нормы его отклонения от центра тяжести Gi, где k — номер класса. Пусть С — множество МНК-оценок вектора коэффициентов С, иначе говоря, множество функций от G{, минимизирующих ||Gi — ACHv'1 (см. [2]). Оценка С является решением системы нормальных уравнений, имеющих в матричной записи вид A'V-iq— А'у-гАС = 0. Эта система получается, если приравнять к нулю производную по С выражения ||GAC|hi = ^(G, С). Если ранг матрицы Л равен /г+ 1, то матрица S ~ Л/У~1Л обратима и система имеет единственное решение Алгебраическая интерпретация многочлена, приближающего центр тяжести класса. Пусть п — максимальная степень искомого многочлена, т = card (Уь) (т > п). Рассмотрим пространства Rm = F, R"+1 = Е и сопряженные к ним пространства F* и Е*. Предположим, что в Rw введена метрика М. Пусть Л — (Ло, ..., Ла, ,.., Лп) —базис пространства многочленов (Ла — многочлен степени а); A<fe> = = (A^fe, ..., AJnb) — матрица, столбцами которой являются п + 1 векторов, принадлежащих Rm, с координатами L«, равными значениям базисных многочленов в точках носителя Jk. Обозначим через Н (Л) векторное подпространство в F = Rm, порожденное векторами AJh AJk Наша задача состоит в определении коэффициентов (Со, ..., Сп), таких, чтобы точка была наиболее близкой к G в метрике М. Это эквивалентно нахождению вектора С 6 Н (Л), такого, что G)= inf db(G,v). оёЯ (Л) 229
Известно, что такая точка G единственная и является М-ортогональной проекцией вектора G на Н (Л). Итак, можно сформулировать следующий результат: VG 6 Rm, H!G 6 Н (Л), ||G - G\\h = inf |G - о ИЛ. veeH(A) Замечание. Несмотря на то что точка G единственна, разложение (9) единственно только в том случае, когда столбцы матрицы Л (k) составляют базис в Н (Л), в противном случае существует сколько угодно разложений такого вида. Сформулируем лемму и предложения, которые при определенных условиях доказывают существование и единственность регрессионного многочлена в некотором классе. Лемма. Если Л — базис М-ортогональных многочленов на носителе Jki то столбцы матрицы Л (k) составляют М-ортогональный базис в подпространстве Н (А). Предложение 2. Пусть G 6 R^hl и Л — базис из М-ортогональ- ных многочленов с носителем Jk> тогда существует единственная точка С = (Со, ..., Сп) и, следовательно, многочлен X = ЛС, такой, что \\G~^\\h= inf HG-^llfc {Vx 6 R1 значение полинома X 6 L определяется формулой X (x) = = 2СаЛа (*), оп+/ (К MA) Положим (см. обозначения в 11.2)). Алгебраическая интерпретация оценки величины G. Матрицу Л (k) можно рассматривать как линейный оператор ранга (я+1), действующий из ?* в F. Матрица Л'МЛ задает изоморфизм пространств (рис. 11.2). Поскольку ^ [Я (Л)]1, то Л/ М (G- K'MG = А'МЛС, откуда ¦G)=0 С = {A'MA)-1AtMG G= А(А'МА)-гА'МО. Ап = A0) A1) Несложно показать, что Ап является идемпотентным и Af-симметрич- ным оператором, переводящим Rn в Н (Л). Значит, его можно считать М-ортогональным проектором. Таким образом, оценка G многочленом степени не выше п сводится к построению оператора Ап по формуле A1) для каждого класса Pk. 230
Замечание. Далее будет доказано предложение, которое позволит нам для каждого фиксированного п записать отображение g (см. 11.3.1) следующим образом: g(P) = №(GJ, ..., i4'«(G,), ..., Akn(Gk)l где An (Gt) — проектор, определяемый согласно (И), при М = V7 и Gt, УГ1» Л$ соответственно центр тяжести, метрика и матрица Л, ассоциированные с классом Р/. Предложение 3. Регрессионный многочлен/г-й степени класса Рк (т. е. многочлен, минимизирующий B)) является МНК-оценкой центра тяжести класса Pk. Доказательство. Вектор коэффициентов С оценивается по формуле A0). Пусть X = АС — многочлен с этими коэффициентами и Xk =« Л (k) С (k) = Э1, ..., &т) — вектор, координатами которого являются \Jk\ оценок значений многочлена, аппроксимирующего центр тяжести (?&, на носителе Jkr а Х% = Л* (k)Ck — на носителе J. По построению^? такой, что* X Выражение A2) является функцией от X вида = inf || G—ХЦ-х. A2) где а' — постоянная, равная первому слагаемому выражения в квадратных скобках, а функция / определяется двумя последними слагаемыми. Это можно записать в виде И предложение 2 может быть сформулировано следующим образом: V X^\X:F (?)= inf F(X). SS&L *Д.'1я того чтобы обозначения не были слишком громоздкими, будем в дальнейшем опускать индекс k, помня, что имеем дело с фиксированным классом. 231
Поскольку а — постоянная, /€=7к Следовательно, V.2, Итак, многочлен Ж, минимизируя Л (.2), приводит к минимуму и R (X, k, P), что и требовалось доказать. 11.3.4.2. Качество регрессии. Подгонка степени многочлена Постановка задачи. Мы уже рассматривали задачу нахождения многочлена, определяемого коэффициентами (Со, ...,СП)> такого, чтобы невязка \\G — AC\\v-i достигала минимального значения. При фиксированном значении п решение С существует и единственно. Интересно было бы узнать, какие коэффициенты вносят существенный вклад в аппроксимацию и какими d можно пренебречь (ниже будет уточнен смысл сказанного). Иначе говоря, можно задаться вопросом, насколько оценка а==0 обозначаемая Gn, лучше оценки ае.4 где /4 с {0, 1, .., /г}, или оценки обозначаемой Gr, где г<п. Заметим, что во всех трех формулах используются одни и те же коэффициенты Са. Это является следствием статистической независимости коэффициентов регрессионного многочлена, что уже было отмечено в 11.3.2.3. Для определения качества оценки рассмотрим величину 232
Очевидно, что Vr, Vn и r< n имеет место разложение ^ ^ п ^ а=г+1 и, следовательно, Иг ^ JI Итак, чем выше степень многочлена, тем лучше (в смысле A6)) аппроксимация*. Заметим, что критерий A6) не может нас удовлетворить, так как он определяет точность оценки, не принимая во внимание ее сложность. Мы же предпочли бы более простую модель (т. е. оценку многочленом более низкой степени) при условии, что качество оценки меняется незначительно. Если желательно знать, насколько использование п — г многочленов улучшит качество аппроксимации, можно воспользоваться величиной п 11 Gn — Gr\\ m—n—\ t = —: :— X . |1 G — ип И При заданном доверительном интервале сравнение ее значения с соответствующим значением в таблице позволяет оценить, насколько оценка G многочленом степени п лучше оценки, когда степень многочлена г. Замечание. В случае более общей оценки A4) следует сравнивать все 2л+1 — 1 возможные аппроксимации. Применяемый метод. Мы используем процедуру «восходящего» включения базисных многочленов в аппроксимацию. Эта процедура осуществляется одновременно с выбором коэффициентов. Положим г = п — 1. При оценке G не используется базисный многочлен степени п, тогда величина измеряет качество аппроксимации Gn относительно аппроксимации многочленом Gn-j. Процесс останавливается, если последний многочлен, включаемый в аппроксимацию, не является значимым согласно статистике F. Поскольку при подгонке степени многочлена алгоритм меняется, появляется опасность неубывания последовательности иг (см. 11.3.3.2). В самом деле, если при переходе от одного шага итерации к другому * Это утверждение может быть неверным, если базисные многочлены, комбинацией которых является 6Г, не содержатся в числе многочленов, комбинацией которых является &п, но такой случай мы не рассматриваем. 233
степени многочленов для некоторых классов уменьшаются, то расстояния B) могут только возрастать, даже если мы пользуемся наилучшей аппроксимацией в определенном смысле. Более точно: пусть / и i + 1 — два последовательных шага итерации; G(/+1> — центр тяжести класса Р</+1). Обозначим через ошибки, соответствующие оценкам многочленом степени п. Имеем 8 @ > е (i + 1). A7) Если же на шаге i + 1 то всегда \\G — Gr||2> ||G — GJ|2, если r</i и неравенство A7) может не выполняться. С другой стороны, согласно правилу выбора г, интуитивно ясно, что исключенные многочлены не вносят существенного (в смысле R) вклада в объяснение G. На ЭВМ была проведена проверка этого явления. Случаи неубывания ui наблюдались крайне редко и то на начальных шагах итерации. Алгоритм всегда сходился. На самом деле, если при уменьшении степени многочлена имеет место возрастание критерия, то, когда классы и степени стабилизируются Никель (данные без пропусков) многочлены 5-и степени (без использования процедуры подгонки степени) Класс / I I ! I Класс 5 (т. е. на конечных шагах итерации), критерий снова начинает убывать и алгоритм сходится. Во всяком случае всегда есть возможность вернуться к оценкам многочленами заданной степени. класс 2 / хо° / °" !• х° / 9 • / *,° / • * Класс 3 ! / i i i i i i i i i Уровень глубины Рис. 11.3 25 f 1.3.4.3. Применение в геологии Исследовались данные о содержании руды (железа, никеля, кобальта) на 120 участках. Рассматривалось 25 уровней глубины залегания. Носитель J = A, ..., 25) описывает 25 уровней глубины, причем любые два соседних уровня отличаются на один метр. Исходные данные не содержали пропущенных значений. Мы попытались определить «порог значимости» описанного в этой главе метода. Иначе говоря, пы- 234
тались найти долю пропущенных данных, при которой результаты очень сильно отличались бы от результатов, полученных по данным без пропусков. Для этого метод типологического сглаживания был применен сначала к исходным данным, а затем к данным с 10 и 20% случайных пропусков. Было проведено 5 прогонов алгоритма, число классов взято равным 5, степень многочленов — тоже 5*. Результаты для никеля приведены в виде графиков на рис. 11.3—11.5. Никель 20 У» данных пропущено, степень ? 5 подгонялась I / + ¦ /V- f Уровень глубины Рис. 11.4 Было замечено, что при различных прогонах алгоритма объекты очень часто попадали в одни и те же классы. Если сравнить результаты, полученные по полным данным и по данным с 10 и 20% пропусков, можно заметить, что полученные классы мало менялись. Это говорит об определенной эффективности метода. *Нам кажется, что a priori лучше завышать степень многочлена, В самом деле, оценки коэффициентов при высоких степенях малы, что мало меняет оценки пропущенных значений. С другой стороны, если взять степень низкой, можно слишком многим пренебречь при определении многочленов. 235
! Никель 10% данных пропущено, степень ^ 5 под2онялась / У У /1 ж/о х / о • 25 Уровень глубины Рис. 11,5 11.4. ЗАКЛЮЧЕНИЕ Особенности подхода к обработке пропущенных данных, описанного в этой главе, заключаются в следующем. Предполагается, что строки таблицы данных состоят из значений полиномиальных функций одной переменной на некотором носителе. Рассматривается только случай, когда носитель /, на котором экспериментально определяются значения этих функций, дискретный, естественно упорядоченный и его элементы разбивают числовую прямую на интервалы равной длины. Аппроксимация проводилась методом наименьших квадратов, поскольку он «...мало чувствителен к выбору носителя, если имеется достаточное число точек и они удобно распределены...», и ему «...отдается предпочтение всякий раз, когда требуется приблизить некоторую функцию, определяемую экспериментально» [9]. При таком подходе много вопросов еще требуют изучения, например, влияние пропущенных данных и определение «порога» значимости метода; случай «нерегулярного» носителя; взвешивание параметров, использование других базисов многочленов (например, многочленов Лежандра) или других аппроксимирующих функций (функции Гаусса, синусов и т. п.); при- 236
менение других процедур (аппроксимация в смысле Чебышева, среднеквадратичная при помощи некоторых частичных степенных рядов и т. п.)- И наконец, остается проблема выбора входных параметров, главным образом, числа классов (степень многочленов можно подогнать). Это, несомненно, оказывает сильное влияние на результаты. ЛИТЕРАТУРА 1. G г а у b i 1 1 A961) An introduction to linear statistical models. McGraw Hill. 2. S с h e f f e H. A959) The analysis of variance. Wiley. Русский перевод: Г. Шеффе. Дисперсионный анализ. М., Наука, 1980. 3. Bibliotheque mathematique de programmes FORTRAN СП. 4. Л и н н и к Ю. В. Метод наименьших квадратов и основы математико-стати- стической теории обработки наблюдений. М., Физматгиз, 1962. 5. Caillez, Maille, Nakache, Pages A971) Analyse de donnees multidimensionelles. С. Зе. 6. D i d а у Е. A972) These de Doctorat d'Etat. 7. D i d а у E. Introduction a l'analyse factorielle typologique. Rapport de recherche, № 27, IRIA-Laboria. 8. Ok-Sakun A975) These de 3eme cycle. 9. Legras A971) Methodes et technique de l'analyse numerique. Dunod. 10. Cloutier, Lestrade. Rapport de stage DEA. Laboratoire de statisti- que mathematique. 11. M i 1 1 er R. G. Jr A966) Simultaneous statistical inference. McGraw Hill, New York. 12. F о r s у t h e G. E. A957) Generation and use of orthogonal polynomial for data fitting with a digital computer. J. SIAM 5, 74—88. 13. P e с k J. E. L. A962) Polynomial curvefitting with constraint. SIAM review 4, 2 135—141. 14. DidayE., Ok., Jacottet, Tomassone A976) Lissage typologique. Rapport IRIA, № 164. 15. J а с о t e t A975) Application de la methode des nuees dynamique au clas- sement d'objets connus par une suite de mesures comportant des valeurs man- quantes. Rapport interne INRIA/IRIA.
Глава 12 • АДАПТИВНЫЕ РАССТОЯНИЯ 12.1. ВВЕДЕНИЕ В большинстве существующих алгоритмов используется единая мера сходства для всего множества Е, и она не меняется во время работы алгоритма. В этой главе будет описан метод, в котором мера сходства локально приспосабливается к структуре пространства Е, оптимизируя некоторый критерий, выражающий степень этой приспособленности. При этом мера остается квадратичной функцией*. Далее, в рамках более общего алгоритма в качестве расстояний рассматриваются и другие семейства функций. 12.2. МЕТОД АДАПТИВНЫХ РАССТОЯНИЙ 12.2.1. Пространство представительств Определим пространство представительств L как прямое произведение: L = Кр X 2) у где 3) — множество квадратичных функций d, определяющих расстояния в R*\ таких, что определители соответствующих матриц равны единице. Мера сходства D между элементами х и X (х 6 Еу X = (a, d) ? L) определяется соотношением D (х, X)=d (x9 a). Мера сходства между подмножеством В cz R*7, состоящим из конечного числа элементов, и X = (a, d) задается соотношением D (Я, X) = Если d (•, а) — квадрат расстояния от точки а и элементы множества В имеют массу 1, то D (В, X) — инерция множества В относительно точки а. 12.2.2. Алгоритм Используется общий алгоритм, описанный в гл. 1, применительно к введенному выше пространству представительств L. *Под мерой сходства имеется в виду некоторое расстояние между х ? Е и К 6 L. Квадратичной называется такая мера сходства D, для которой соответствующее расстояние является квадратичной формой, т. е. D (дс, Я) = = (х — X)'Q (л: — X), где Q — некоторая симметричная положительно определенная матрица. — Примеч. ред. 238
12.2.2.1- Функция назначения Следуя 1.2.4, определим функцию назначения / как отображение Если L 6 Ьь, L = (Къ ..., Xh) и Kt = (аь <2г), то / (L) является разбиением Я = (Ръ ..., Pfe), где Р« - {х 6 ? : D (х, Ь,) < D (х, ^) V/ ^ 0- A) Поскольку D (a:, Xf) = dt (x, аг), A) можно записать так: Pt = {xeE:di (x, a%) < dj (x, a,) V/ Ф i}. Таким образом, каждый класс Р* состоит из элементов Е, расстояние от которых до cti, измеренное функцией diy меньше, чем до любой другой точки ctj, измеренное с помощью dj. 12.2.2.2. Функция представительства Следуя 1.2.3, определим функцию представительства g как отображение Pft-^ L*. Если Р = (Рх, ..., Ph) — некоторое разбиение Е на k классов, то g (Р) = L = (Къ ..., ЛЛ), где X,- = (аи dt), такое, что {a, d) Ниже будет раскрыт смысл пары (а^ dt). Предложение. Если В — конечное подмножество R*\ то пара (a*, d*)y определяемая из условия D (В, (a*, d*)) = min D (В, (а, d)), (а, d)?RPX& единственная, причем а* = центр тяжести Б, ad* — расстояние Ма- халанобиса, определяемое матрицей \Q\~p Q~\ где Q — ковариационная матрица элементов В (в дальнейшем будем называть d* расстоянием Махаланобиса, ассоциированным с В)*. Это утверждение является следствием двух классических результатов. * Индийский математик П. Махал анобис предложил использовать в качестве меры различия двух многомерных нормальных совокупностей с векторами средних значений ах = (а^1), ..., а[р))' и а2 = (а[х\ ..., а[р))' и одной и той же ковариационной матрицей 2 величину' (% —- а2)' 2-1 (аг — а2) (см.: М a h a 1 а- п о Ь i s P. C. On tests and measures of group divergence. Journ. Asiat. Soc. Beng., vol. 26, 1930, p. 541—588). Говоря о ковариационной матрице Q элементов В, авторы подразумевают матрицу Q = 2 (Ь — а*) (Ь — а*) , где Ь — элементы ьев множества В, а а* — центр тяжести множества В. Соответственно в их терминологии расстояние Махаланобиса между элементами х и а равно: d* (x, а) = = (* — a)'(\Q\P~Q-i) (x — а). — Примеч. ред. 239
1. Квадратичная метрика d, определяемая матрицей с единичным определителем и минимизирующая инерцию множества В, состоящего из элементов Rp, является расстоянием Махаланобиса, ассоциированным с В, и задается матрицей \Q\p Q-1 (доказательство приводится в приложении 1. 2. Точка, относительно которой инерция множества В минимальна, совпадает с центром тяжести В. Это утверждение является следствием теоремы Гюйгенса. Отсюда, в частности, следует, что функция представительства будет ставить в соответствие разбиению Р1э ..., Р* последовательность (klf ..., Xk), в которой Хг = (a*, dt)y где at — центр тяжести класса Р*, a dt — расстояние Махаланобиса, ассоциированное с Р%. 12.2.2.3. Свойства алгоритма Сходимость доказана для общего случая (см. 1.3.6). Критерий имеет вид W(v)=W (L, Р) = 2 D (Pu Kt) = 2 2 dt (а*> У)> B) где v = (L, P), L =(ЯХ, ..., Xft), ^ =(аь d,), Р = (Ри ..., /Ч)- Минимизация B) сводится к поиску пары (L, Р), минимизирующей сумму инерции классов Pt относительно точек аи измеренных в метриках dt. Очевидно, что метрика не выбрана раз и навсегда^ а определяется для каждого классу заново. Приведем другие выражения критерия. Используя свойства расстояния Махаланобиса, можно доказать следующие предложения. Предложение 1. Критерий B) может быть записан в виде W(L,P) = p .2 card (Р,) | Qt\ —, C) где q. — ковариационная матрица класса Pt. Доказательство. Критерий B) является суммой инерции, а каждая инерция в метрике Махаланобиса равна р • card (Pi)\Q\p (см. [6]). Предложение 2. С помощью описанной процедуры определяются такие классы, для каждого из которых произведение дисперсий по главным осям инерции минимально. Доказательство. Можно заменить матрицы Qt в выражении C) на Qu полученные диагонализацией Qiy так как \Qt\ = \Qt\. Каждый элемент Iju матрицы Qt равен дисперсии класса Pt относительно /-й главной оси инерции, т. е. vj (Рг) (см. приложение 2). Следовательно, 240
Свойство инвариантности Предложение 3. Последовательность разбиений (Р(/г>), полученная в результате применения описываемого алгоритма к некоторому начальному разбиению Р<°>, инвариантна относительно выбора базиса в пространстве Rp, содержащем множество классифицируемых объектов Е. Доказательство. Известно, что при преобразовании базиса, задаваемом невырожденной матрицей Л, значение расстояния Махалано- биса, ассоциированного с некоторым подмножеством из Rpy умножа- — 1 ется на |Л | р. Доказательство этого факта приводится в приложении 3. Таким образом, в процессе работы описываемого алгоритма значения _ 1 всех расстояний умножаются на \А | р, но это не меняет получаемых разбиений. 12.2.3. Случай необратимой ковариационной матрицы 12.2.3.1. Постановка задачи Описываемый алгоритм на всех шагах итерации для каждого класса требует обращения соответствующей ковариационной матрицы. Это возможно тогда и только тогда, когда подпространство, порожденное каждым классом, имеет размерность р, иначе говоря, линейная оболочка векторов, принадлежащих любому из классов, должна совпадать с Rp. Если, например, какой-нибудь класс состоит меньше чем из (р + 1) элементов, то это условие не выполняется. Мы покажем, что в таком случае не существует расстояния, минимизирующего критерий, и что при некоторых дополнительных ограничениях задача может быть решена с сохранением сходимости алгоритма. Пусть на некотором шаге п имеется разбиение Pw и требуется вычислить LW = g(PW). Если Я<п> = (Я?\ ..., /><?>), то L<"> = = ((a(f>, d^)9 ..., (а<?\ dty)), где а^ — центр тяжести класса 1 Р{?\ а расстояние dt определяется матрицей М = \Q(^\P (Q^)"- Критерий может быть записан в виде Р<я>)= 2 О[Р^\ {а?\ d\n))}. Вклад i-ro класса в значение критерия на предыдущем шаге равен D[pip, (a^~l\ d<^-x>)]. Если матрица Q(f?> обратима, то функция g классу PW ставит в соответствие пару (а<?+1>, d(^+1>), минимизирующую D (Pif .). В этом случае можно быть уверенным в уменьшении вклада /-го класса в значение минимизируемого критерия. Предложение 4. Если Q<?> нельзя обратить, то Yd* 6 25, Н d 6 ®, такое, что D [P\n\ (<4n\ d)]=±D [P\n\ (a\n\ d*)]. D) 241
Доказательство. Обозначим через X и Л(?> вектор-столбцы пространства Rp, соответствующие х и aW. Пусть d* ? 2), тогда имеем D = 2 — X) M* x E) где М* —матрица, определяющая d*. По определению Согласно предположению матрица Q<*> необратима, значит, векторы (^(п) — х) принадлежат некоторому векторному подпространству F размерности г < р. Введем с помощью матрицы Р такое преобразование базиса, чтобы первые г векторов составляли базис в F, а оставшиеся р — г были М*-ортогональны первым. Пусть AW и X в новом базисе соответствуют а<?> и лс, т. е. X — РХ и Л(^ = PAW. Метрика d* в новом базисе будет задаваться матрицей М* = (Р-1)'М*Р~1. В силу того, что векторы нового базиса образуют два ортогональных подпространства, матрица М* состоит из двух блоков: р—г Б 0 0 С р—г С другой стороны, последние р — г координат у всех векторов (Д(п) — х) равны нулю, поскольку такие векторы принадлежат F. Следовательно, при использовании формулы E) для нового базиса действие Л1* сводится к блоку В. Расстояние можно задать матрицей N = P'NP, где Г р—г 2 С р—г р—г Из равенства |JV| = \М*\ следует \N\ = |М*| = 1, а значит, d 6 Ж. Отсюда вытекает D). Следствие. Если матрица Q<J*> не является обратимой, то не существует расстояния, минимизирующего D [Р(?\ (а<^>, .)]. 242
12.2.3-2. Решение Поскольку не существует расстояния, минимизирующего величину D \РТ\ (в/п\-I» возьмем в качестве дЦ расстояние из 25, улучшающее вклад 1-го класса в критерий. Таким образом, мы ограничиваемся подпространством F, порожденным классом Р\п\ и выбираем в F наилучшее расстояние с определителем, равным определителю матрицы, индуцирующей расстояние й\п~~1) в F. Затем мы продолжаем такое расстояние на все пространство Rp так, чтобы определитель полученной матрицы был равен единице. На предыдущем шаге вклад t-ro класса в критерий был равен D [Р\п\ (я!"", 4П"}I. Везде будем полагать а\п) равным центру тяжести класса Р\п). Таким образом, Достаточно выбрать такое d, чтобы D И"\ \4*\ dj\ <Z> [РГ, (a!n\ df'% и вклад t-ro класса в критерий будет улучшен. Имеем Будем действовать как при доказательстве предложения 4: заменяя d* Hadi", воспользуемся таким преобразованием Р базиса, при кото" ром d\n~l) будет определяться матрицей М\п~1) =(Я-1)'Л1{/|) Я-1, представимой в виде Bn-i 0 0 с р — г р-г Обозначим через Л(п> — X r-мерный вектор, состоящий только из г первых координат А \п) — X (оставшиеся р — г координат равны нулю): D 1Р\п\ (а\п\ й(Г{))) - 2 [А\п) - XYBn-г [А\п) - XI F) Будем искать матрицу Вп, минимизирующую выражение F). Согласно приложению 1 имеем где 243
Матрица Qin) обратима, поскольку линейная оболочка векторов Л1П) — X совпадает с Rr. Определим расстояние й\п) такой матрицей М\п\ что М\п) — Р'МР, где М = Тогда 0 0 с d [p\n\ (<4n\ <*<•">)] = S [а\я) ~х]' м [А\я) -х] = —х]< Таким образом, расстояние ^л) улучшает вклад i-ro класса в критерий. 12.2.4. Пример применения метода адаптивных расстояний 12.2.4.1. Исходные данные будем использовать данные из [4] и [8] для решения задачи оценивания смеси распределений. Имеется 150 точек, взятых из 3 двумерных нормальных распределений, определяемых средними и ковариационными матрицами 1 4 -i- О 4 4 1,7] 4 Г 4 -и] .7 1 ]' 0 JL " L-1.7 1 J- 4 „ На рис. 12.2 представлено геометрическое изображение данных, на рис. 12.1 приводятся координаты элементов выборки. Первые 50 точек принадлежат первому распределению, точки с номерами 51—100 имеют распределение со средним G2 и второй ковариационной матрицей, а последние 50 точек принадлежат третьему классу. 244
4 * / 2 3 и 5 6 7 8 9 10 11 12 13 /4 15 16 17 )Q 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 4/ 42 A3 44 45 46 47 48 49 50 0,88 -0,26 -1,00 -0, 13 -0, 18 -0,35 -0,39 -0,25 -0 47 0,46 0,02 -0,07 -0,62 0 97 -1, 13 -0, Of -0,38 -0/9 0.36 0,30 0, 09 0,34 0,25 -0,61 -0,38 -0,25 0, 39 0,07 -0,08 -0,10 0,12 -0,42 -0,55 -0,04 0, 19 -0,04 0,56 -0,82 0,08 -0,64 -1,05 -0,53 -0, 18 0,1 U 0,00 0, 20 -0, 29 -0.53 0.41 олг 2, 85 2 62 3,05 "' 2, 72 3,34 2,56 3, 84 2 94 2 62 2, 71 3,21 2,39 2.42 3,02 3,31 3, 70 2.44 3, 29 3,29 3,63 3.15 3, 22 2.96 3 31 2 24 3. 12 3.05 2, 23 2,33 2, 74 2.51 3,44 3,02 2, 18 2,43 3,49 2.56 3, 92 2,00 3, 18 2.61 3,01 3, 08 2,37 2, 01 3,24 3,81 3,22 3.51 9,5* 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 7/ 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 1 61 1, 02 0,55 /,2Ь -3, 18 0,44 0,04 2,71 -1,20 -0,86 -1,83 3,69 1,50 0,24 0,82 0,32 1,19 0, 77 -0.66 -2 22 1. 80 -0, 15 -0.39 -2, 12 -2. 59 1,02 -?, 68 -2, 76 2. 82 -1.04 3,53 -1, 84 -2, 48 0, 92 2, 08 4. 71 -0,41 -2 22 /,46 1, 74 3, 25 0,88 -0, 43 -1.67 1, 79 0. 29 -1, 50 -1.48 -0, 06 0,50 0. 46 0,68 .0,47 0,25 -0, 80 -0,27 -0, 35 1, 17 -0, 26 -1, 25 -0,23 1, 75 0,93 -0, 61 1. 72 0,01 1,10 0,47 -0. 44 -1,85 0,99 0, /4 0,07 -1.16 -/, 70 0, 58 -1,55 -1,50 1, 05 -2,03 1,60 -0,09 -0,88 0,87 1. 77 1, 93 0,87 - 1,94 1, 33 0,03 2,05 1,08 -0, 71 -1,30 0.85 0,90 -0,55 '0,93 -0, 44 -0,88 101 102 ЮЗ 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 /40 141 /42 /43 /44 /45 /45 /47 148 /49 150 4,74 5.69 3, 26 2,90 4, 07 0,68 3,97 4,34 3,38 3,81 2 04 1. 61 3,35 7,23 5,02 5,46 4, 35 4, 38 5,07 4, 55 0, 82 5,30 6, 15 2. 51 5, 90 2, 82 2,33 3, 14 3, 98 3,40 2.32 1, /4 2, 16 5,31 2.73 5,35 5, 93 1, 51 6, 86 4, 16 6,02 8,22 4,01 7,33 2,41 -0.33 2.22 3.83 /,42 4,45 2,15 2, 22 2,55 3. 68 3, 09 5,86 2 91 1 77 3,31 3.45 3, 72 4, 58 3, 14 0, 78 2,40 /, 79 2. 42 2, 11 2, 30 2,42 3,44 2.61 1 44 4,43 2.09 3, 28 3, 93 3,43 4,12 3,63 3, 78 5,02 4,50 2,71 3, 19 2,77 1.47 4, 4 7 2.44 2.22 1, 77 -0, 59 4, 18 1,84 4, /4 5,23 3, 28 3,35 4,04 3,00 Рис. 12.1. Координаты 150 точек, принадлежащих одному из трех нормальных распределений Рис. 12.2. Три исходных класса
12.2.4.2. Результаты Использовался алгоритм адаптивных расстояний, причем число классов задавалось равным 2, 3, 4, 5, 7, 9. Для каждого случая производилось 20 классификаций и выбиралась та, которой соответствовало наименьшее значение критерия. На рис. 12.3 (а)—(е) представлены соответствующие результаты классификации и значения критерия W. Рис. 12.3(а). Два класса (№=472) Рис. 12.3F). Три класса (№=212) Рис. 12.3(в). Четыре класса (№= = 166) Рис. 12.3(г). Пять классов (№=129) Рис. 12.3(д). Семь классов (№=95) 246 Рис. 12.3(е). Девять классов (№= = 67)
12.2.4.3. Результаты, полученные методом динамических сгущений с использованием единого расстояния Число классов было взято равным трем. Каждое представительства состояло из трех точек исходного множества. Использовалось евклидово расстояние. На рис. 12.4 приводится наилучшая из 20 классификаций. Рис. 12.4. Метод динамических сгущений (расстояние фиксировано) 12.2.4.4. Заключение Сравним результаты двух методов. В случае адаптивного расстояния 3 элемента были ошибочно классифицированы, тогда как при применении обычного метода динамических сгущений число таких элементов равнялось 23 (точка считается ошибочно классифицированной, если после работы алгоритма она относится не к тому классу, из которого она выбрана). Здесь виден недостаток методов, в которых дисперсия вычисляется в единой метрике. Такие методы имеют склонность к выделению классов сферической формы. В описываемом примере данные сформированы из классов другого вида. Результаты показывают, что использование адаптивных расстояний помогает преодолеть этот недостаток. Заметим, что метод разделения смеси распределений [8] дает примерно те же результаты, что и метод адаптивных расстояний. В самом Деле, разница между двумя алгоритмами невелика и заключается только в вычислении расстояний: водном случае в качестве расстояния между точкой и парой [a, d] берется d (xy а), а в другом — , а)], где М — матрица, определяющая расстояние d. Однако применение этих двух методов, во-первых, к неквадратичным расстояниям (например, (8)) и, во-вторых, к распределениям, не являющимся нормальными (к гамма-распределению), приводит к совершенно различным результатам. 247
12.3. ОБОБЩЕНИЕ МЕТОДА АДАПТИВНЫХ РАССТОЯНИЙ В описанном алгоритме мы одновременно искали элемент а ? Rp и расстояние d, оптимизирующие некоторую функцию. Теперь мы будем это делать в два этапа. 12.3.1. Обозначения Пусть Е — множество элементов, подлежащих классификации; Ph — множество разбиений Е на k классов; Lfe — множество, элементами которого являются наборы вида (к1У ..., Kk), %t ? Ау где А определяется в каждом конкретном случае; 3) — множество показателей сходства между элементами Е и элементами А\ Ak —множество, элементы которого имеют вид (dlf ...,dk)f dt ?S; D — функция, определенная в Е X А X 3) со значениями в R+; / — функция, определенная в .9* (Е) X А X 3) со значением в R+ 12.3.2. Оптимизируемый критерий Критерием является функция W, определенная в пространстве PfcXLfeXAfcCO значениями в R+, W(PyL,A)=% /(Р,Д|,^,), G) где Р = (Pv ..., Ph) 6 Pft, L - (lu ..., h) € U, Л = (dly ..., dk) 6 A*. Мы ищем тройку (Я, L, А), минимизирующую этот критерий. 12.3.3. Алгоритм Алгоритм может быть сведен к схеме, приведенной на рис. 12.5. Он сконструирован на основе трех функций. Рис. 12.5 1) Функция назначения /, определенная на L& X Ak со значениями в Pft, позволяет по L = (Хъ ..., Kh) и A (dly ..., dk) формировать классы Р = (Р19 ..., Pft) = / (L, А) по правилу: Pt = {xeE:D(x, Xiy dt) < D (*, ^, d;) V / ф1). 248
2) Функция представительства g, определенная на AfexPfe со значениями в Ьь позволяет по А и Р находить представительство L =(к1у Xk) = g (A, P), в котором ^ удовлетворяют условию: / {Рг> К dt) - min / (Piy К dt). 3) Функция е, определенная на Pk X Lk со значениями в ДЛ> определяет метрики в (Р, L) = А — (db ..., dk) ? Aft, где df удовлетворяют условию: / (Pif liy dt) = min / (Piy Xiy d). d?3 Отправляясь от некоторого начального элемента V@> = (/)@), Д(°)), можно построить последовательность V{n) = (P(fI), L(rt), с помощью функций f, g и е следующим образом: где 12.3.4. Сходимость алгоритма 12.3.4.1. Сходимость В работе [5] доказывается следующий результат. Предложение. Если / выражается через D, так что выполнены условия из 12.3.5, хотя бы одно из множеств А или 3) конечно, отображение W инъективно, то последовательность (РПу Ln, An) сходится, а соответствующая последовательность значений критерия Ww убывает. 12.3.5. Ограничения на конструкцию алгоритма Для нахождения функций / и g не требуется никаких ограничений Единственное условие функционирования алгоритма заключается в том, чтобы можно было найти элемент множества 2), минимизирующий Функцию /. Для этого множество 3) должно быть конечным или обладать некоторыми свойствами (например, быть семейством квадратичных Расстояний). Если это не выполняется, то можно не требовать оптимизации критерия на каждом шаге итерации, а ограничиться только его Уменьшением. При этом сохраняется сходимость алгоритма. 249
12.4. СЛУЧАЙ, КОГДА РАССТОЯНИЯ НЕ ЯВЛЯЮТСЯ КВАДРАТИЧНЫМИ 12.4.1. Введение Использование квадратичных расстояний приводит к обращению матриц размера (р X р), что значительно увеличивает время вычислений. Для упрощения вычислений и сокращения времени работы программы можно определить расстояние следующим образом: d (х, у) = ? Xj \yj - xjl где I = (Къ ..., Яр) ? R". (8) Семейство таких расстояний в англосаксонской литературе носит название «City Block» («Городской квартал»). Обозначения из 12.3 хорошо «приспособлены» для рассмотрения расстояний вида (8). 12.4.2. Алгоритм Для того чтобы свести алгоритм к описанному в 12.3.2, надо уточнить определения множеств Е, Л, 3) и некоторых функций. 12.4.2.1. Множества Как и ранее, Е — множество /?-мерных наблюдений, т. е. ЕаК?. Возьмем А = Rp и обозначим через 25а.в. семейство расстояний вида (8) (т. е. расстояния, использующие абсолютные величины), где р h 6 R, ^7 > 0, / = 1, ..., р и П Xj = 1. Элементы Pk, Lk и Afe опре- /=1 деляются обычным способом по множествам ?, А и й)а.в.. 12.4.2.2. Функции D, I и W D —функция, определенная на Е X А X 25 со значениями в R+: если *??> а ?А и d ? 25а.в, то ?> (*, a, d) = d (x, a). I — функция, определенная на ^ (Е) X А X 25а.в., значениями которой являются числа из R+: если В 6 ?Р (?), а € Л, d 6 25а в , то / (fi, a, d) = ) 2 (у ) J(?B Д = (dly ..., dfe) 6 Дь критерий определяется следующим образом W (Р, L, А) = 2 7 (Р- а- *>= 2 Цель метода состоит в определении k элементов R*7, которые могли бы служить представителями k классов и k расстояний, таких, чтобы в каждом классе сумма соответствующих расстояний от каждого элемента до представителя была минимальной. 250
12.4.2.3. Функции f, g и е функция / определяется так же, как и раньше: элемент из Е относится к тому классу, представитель которого наиболее близок к данному элементу в смысле соответствующего расстояния. Функция g каждому разбиению ставит в соответствие набор точек (аи ..., ak), причем /-й координатной at является atj—медиана значений /-го параметра по всем элементам класса i. И наконец, функция е каждому разбиению и набору (аъ ..., ak) ставит в соответствие k расстояний dl9. >dfc. Для i= I, ..., k di определяется по формуле (8), где соответствующие коэффициенты Х\, ..., А/ задаются соотношениями П( /l 2 iw-<! Р ,7 = 1 Р- 12.4.3. Критерий Последовательность (P(n>, Un\ А(л>) сходится, и значения крите2 П /=1 / рия убывают. 12.5. МЕТОД, В КОТОРОМ РАССТОЯНИЕ ОПРЕДЕЛЯЕТСЯ ОДИНАКОВО ДЛЯ ВСЕХ КЛАССОВ Описанные выше методы требуют довольно много времени, поскольку на каждом шаге итерационного процесса определяются расстояния du ..., dh. В методе, который будет описан ниже, расстояние определяется на каждой итерации заново, но является одинаковым для всех классов. 12.5.1. Описание метода Элемент пространства представительств состоит из k точек Rp и расстояния d, принадлежащего семейству функций Ж, которое будет описано ниже: Lft - {К .», в*. d)\ ateRPydeSD). Критерий W определяется соотношением 251
где Р = (Р1у ..., Pk), L = (аи ..., ahj d). Он имеет смысл суммы инерции по всем классам в метрике d относительно точек ati i = -1, ..., k. Функция / каждому представительству L ставит в соответствие разбиение Р, минимизирующее критерий (9). Очевидно, что t-й класс разбиения оказывается сформированным из элементов, наиболее близких к а% в смысле d, i = 1, ..., k. Замечание. Элемент, для которого расстояния до нескольких центров равны, относится к классу с наименьшим номером. Функция g каждому разбиению Р ставит в соответствие набор точек аъ ..., ak и расстояние d, минимизирующее (9). Задача заключается в определении таких точек и соответствующего расстояния. Могут встретиться различные ситуации. Например, если 25— множество квадратичных расстояний, определяемых матрицами с единичными определителями, то метрика d определяется матрицей где X и А — вектор-столбцы, соответствующие х и аь\ аь — центр тяжести класса Pt. С помощью функций f и g можно, как и в общем случае, построить- алгоритм, который будет обладать теми же свойствами сходимости. 12.5.2. Пример с искусственными данными Описанный метод применялся к задаче классификации сорока то. чек, выбранных из двух классов в двумерном пространстве (рис. 12.6) # л 40,89 39,04 38 49 36,08 37,40 35,39 36,71 4 3U II 35,27 33 42 33,49 31, 92 ,5 32,33 3.0,41 29,86 31,78 28t Qt Y 35,00 36,51 3k 79 33,49 31,85 31\ S5 33,49 30,55 30,55 29,11 29,11 27 74 27, 74 27,74 25,62 25,62 25,62 23, 97 23, 97 22405 л ?/ 29, 93 22 25,62 23 25.68 24 25.00 25 20,2! 26 23,01. 27 21,03 28 25, 14 29 23,29 00 23,68 31 24.04 32 2?,92 33 27.33 34 29.38 35 28.42 36 30,2! 37 28.36 33 25,96 29 21,71 АО 23.42 Y 22 05 22, OS 21,53 25,00 21.58 24 45 24t45 26,99 26,99 30,96 29,73 29 73 33,70 33.70 ЭК 99 36.44 36,44 33,08 27.47 28,90 252 Рис. 12.6
Наилучшее (в смысле критерия) разбиение было найдено после пяти прогонов алгоритма (при случайном «извлечении» представителей в качестве исходной точки последовательности, см. рис. 12.7), Рис. 12.7 Г1 01 Начальное расстояние определялось матрицей L . Матрица расстояния, полученного в результате работы алгоритма, имеет вид 2,63 —1,591 — 1,50 1,20 J Применение метода динамических сгущений с евклидовой метрикой дает совершенно другие результаты. 12.6. ЗАКЛЮЧЕНИЕ Гибкость, которой обладают описанные в этой главе методы, может оказаться причиной весьма необычной «формы» полученных разбиений. Поэтому необходимо управлять работой программы. Например, на трех первых шагах итерационного процесса использовать фиксированное расстояние или, если имеется соответствующая информация о данных, определить начальные значения сгущений, расстояний, а может быть, и разбиений. И наконец, определение набора расстояний на каждом шаге игера- ционного процесса значительно замедляет работу программы. Этого можно избежать, взяв простые расстояния. Существует, например, программа, работающая с расстояниями в абсолютных значениях (City Block). ПРИЛОЖЕНИЕ 1 Теорема. Симметричная матрица М размера рУр с единичным определителем, минимизирующая выражение 2 У'MY, где В — конечное у е в множество вектор-столбцов р X 1, таких, что det | 2 YY'\ УЯ имеет вид M=\Q\P (Г\где Q = %YY'. A0) Y(=B Y(=B 253
Доказательство. Известно, что если А и В—матрицы размеров п X т и т X п соответственно, то tr (AB) — tr (BA). В силу того, что Y'MY является скаляром, Y'MY = tr {Y'MY) = tr (Y {Y'M)) = tr (YY'M). Следовательно, 2 Y'MY = tr[BKK')Af]. уев Заметим, что 2 УУ — Q- Так как Q симметричная положи- тельно определенная матрица (| Q | Ф 0), то Q =СЛС =-= QiQi, где С — ортогональная, Л—диагональная матрицы, составленные из собственных векторов и собственных чисел матрицы Q, a Q^CA^ Af = -Л. Имеем: tr (QAf) =tr (QiQiM) =tr (QiMQJ. Положим R = Q{MQV Задача сводится к тому, чтобы найти матрицу R с минимальным следом при условии \R\ = |Q| = a =^0. Очевидно, что матрица R симметрична и, следовательно, диагонализуема над вещественными числами и след R равен сумме ее собственных значений. Поскольку произведение собственных значений равно а, минимум суммы достигается, когда все I собственные значения равны a p . При этом матрица R должна иметь вид tf^QiMQi-a" /p *. Тогда Af=ap Q-1=|Q|P Q-1, где Q= 2 ет смысл центра тяжести В). Имеем У d (X, G) = У. (X-G)' M (X-G). Решением является A0), где Q= S (X-G)(X- ad — расстояние Махаланобиса, ассоциированное с множеством В ПРИЛОЖЕНИЕ 2 Теорема. Если В — конечное подмножество из Rp и М — диагональная матрица, которую будем рассматривать как ковариационную в некотором ортонормированном базисе, то каждый диагональный элемент представляет собой инерцию по соответствующей главной оси. Доказательство. Пусть имеется базис с началом в центре тяжести В, состоящий из векторов, коллинеарных собственным векторам кова- */р — единичная матрица размера р X р. — Примеч. ред. 254 Следствие. Эта теорема может быть применена к задаче определения квадратичного расстояния d, задаваемого матрицей М, такого, что \М\ -¦¦• 1 и У d (X. G) ппинимает минимальное значение (G име-
оиационной матрицы, построенной по элементам множества В. В этом базисе ковариационной матрицей является М. Если вектор у 6 В «мрет координаты (уи ..., уп)у то базисе ковариационной матрицей я имеет координаты (уи ..., уп)у то 2 С ДРУг°й стороны, базисные векторы являются главными осями инерции, а инерция по направлению, определяемому базисными векторами (?)) е% (/, (?)), имеет вид Из последних двух соотношений вытекает утверждение теоремы. ПРИЛОЖЕНИЕ 3 Если В — конечное подмножество Rp, dx — расстояние Махала- нобиса в каноническом базисе Rp, то расстояние Махаланобиса d2, ассоциированное с множеством В, в некотором другом базисе (определяемом невырожденной матрицей перехода А) имеет вид Yx и у, dt(x, у) = \Ар dx (x, у). Доказательство. Согласно приложению 1 расстояние d1 задается матрицей где Q1= 2 (X-G)(X-G)\ X и G — соответственно х и центр тяжести в каноническом базисе. Расстояние d2 задается: где и G — соответственно X и центр тяжести в новом базисе, причем = AG и X = АХ. Следовательно, Q2 = 2 Л (X-G) (X-G)' А' = AQ1 A', х<=В 255
= (Х—Y)' A' M2A{X—Y) = 2. J_ = \A\'\Q\P (X-Y)' Q, (X-Y) ¦- (к(х,у). ЛИТЕРАТУРА 1. ChernoffH. A970) Metric considerations in cluster analysis. Proc. of the sixth Berkely symposium on Math. Stat. and Prob. 2. D i d а у E., G о v a e г t G. A974) Classification avec distances adaptives. С R. Acad. Sc. Paris, t. 278, serie A, p. 993. 3. D i d а у Е., С о v a e г t G. A977) Classification aves distances adaptives. RAIRO. V—11, №4, p. 329—349. 4. Diday E., S с h г о e d e г A. A976) A new approach in mixed distributions detection. RAIRO, vol. 10, № 6, p. 75—106. 5. Govaert G. A975) Classification automatique et distances adaptatives. These de 3eme cycle. Mathematiques appliquees. Universite Paris VI. 6. R о m e d e г J. M. A973) Methodes et programmes d'analyse discriminan- te. Dunod, Paris. 7. Sebestyen G. S. A962) Decision making process in pattern recognition. McMac Millan Company. -8. SchroederA. A976) Analyse d'un melange de distribution de meme type. Revue de Statistique Appliquee, vol. XXIV, № 1.
Глава 13 • ОПТИМАЛЬНАЯ АДАПТИВНАЯ ОЦИФРОВКА 13.1. ВВЕДЕНИЕ Пусть Е — конечное множество из п объектов, характеризуемых ;; переменными различных типов (количественными, номинальными пли ординальными). Такому множеству соответствует таблица разнородных данных. Для статистика таблица данных является «промежуточным продуктом», который следует видоизменить так, чтобы можно было получить некоторые содержательные результаты и выводы. Как правило, в случае таблицы разнородных данных трудно выявить информацию, которую несут некоторые переменные, поскольку они могут быть измерены в довольно специфичных шкалах. Поэтому перед любым статистическим анализом таких данных исследователь вынужден приводить их к однородному виду с тем, чтобы можно было воспользоваться нужным методом (в нашем случае —методом автоматической классификации). Следует заметить, что информация, содержащаяся в любой переменной из рассматриваемой таблицы данных, сохраняется при различных преобразованиях, удовлетворяющих некоторым ограничениям, которые накладываются согласно природе самой переменной [14]. Если в результате получается переменная, принимающая вещественные значения, то соответствующее преобразование называется оцифровкой. Эта задача рассматривалась такими авторами, как Кайе и Пажес [1], Де Леев, Янг, Такане [91, Сапорта [16], Массой [11], Тененос [18]. Цель настоящей главы состоит в том, чтобы поставить задачи оптимизации и описать алгоритмы, позволяющие преобразовывать метки, приписанные категориям переменных так, чтобы получить наилучшие, в смысле некоторых математически определенных критериев, разбиения. Одновременно получаются новые метки, которые должны быть «эквивалентными» исходными или «совместимыми» с ними. Говоря о преобразовании значений некоторой переменной, принадлежащей неоднородной таблице данных, которое осуществляется с помощью вещественного отображения, мы будем пользоваться следующими понятиями: 1) если мы имеем дело с инъективным отображением, будем говорить, что набор полученных значений эквивалентен рассматриваемой переменной; любые два различные значения переменной оцифровываются разными числами; 2) если при используемом отображении различные значения переменной могут быть оцифрованы одинаково, то полученные метки лишь совместимы с исходными. В этой главе мы рассмотрим основные этапы метода динамических сгущений применительно к разнородной таблице данных (см. также * Зак. 303 257
131, 1171). Вначале определяется пространство покрытий для разбиения на фиксированное число классов, затем пространство представительств, в общем случае зависящее от прямого произведения пространства мер сходства на пространство допустимых оцифровок и, наконец, вводится критерий, выражающий меру адекватности между оцифровкой, совместимой с начальными значениями, и разбиением имеющихся объектов на k однородных классов. Смысл меры адекватности в том, что сумма инерции внутри классов должна быть минимальна. Таким образом, осуществляется адаптивная оцифровка данных» имеющих различную природу. В большинстве алгоритмов автоматической классификации используется одна и та же мера сходства во всем пространстве рассматриваемых объектов и найденные метки не меняются в процессе работы алгоритма. В этой главе будет описан алгоритм нового типа. В нем мера сходства и метки меняются> локально приспосабливаясь к структуре пространства объектов, по мере того как алгоритм сходится. Степень адаптации выражается определенным критерием, который уменьшается при каждом изменении меры сходства или меток. Описываемые алгоритмы адаптивной оцифровки относятся к группе методов динамических сгущений и обладают двумя преимуществами: 1) они позволяют разбить объекты, характеризуемые разнородными переменными, на однородные классы; 2) полученные метки, совместимые с начальными, позволяют дать следующую интерпретацию: для каждой переменной две метки тем ближе, чем более похожи ответы, соответствующие этим меткам для других переменных. Одна из оригинальных черт настоящей работы заключается в доказательстве того, что адаптивную оцифровку можно рассматривать как частный случай метода адаптивных расстояний (см. 13.4.7, а также 1171). Однако для облегчения чтения этой главы мы будем идти от частного к общему. Вначале будет рассмотрена адаптивная оцифровка при фиксированном расстоянии, а потом задача будет распространена на случай адаптивного расстояния. 13.2. ПЕРЕМЕННЫЕ И ИХ ОЦИФРОВКА Обозначим через Е конечное множество имеющихся в нашем распоряжении объектов хг, ..., хп. 13.2.1. Общие определения Будем придерживаться определений и обозначений работы [21. Определение 1. Пусть заданы так называемое пространство наблюдений V и алгебраическая структура $¦ на нем. Определить переменную на множестве Е — это значит задать отображения из Е в °1У\ 258
Обозначим через F конечное множество, состоящее из р переменных xi характеризующих объекты из ?; х[ — значение, принимаемое /-и переменной на /-м объекте (неколичественные переменные задаются в бинарном виде). Определение 2. Векторной переменной называется всякое отображение Е в пространство, являющееся /7-кратным прямым произведением Wj- Структура ty такого пространства определяется через tyf. = (Wt х ^2 х ... 13.2.2. Связь между заменой переменных и оцифровкой Мы хотели бы указать на связь, которая существует между оцифровкой и заменой переменных. Определение 3. Пусть х — векторная переменная, определяемая элементами множества F. Оцифровка х задается отображением q пространства V со структурой $• в R*\ на котором вводится алгебраическая структура %'. Структура $-' должна сохранять характеристические свойства, зафиксированные структурой ^, объектов, описанных с помощью переменных из F. Для иллюстрации приведем схему, представленную на рис. 13.1. Здесь q - (qu ,.., qp); (Tjfj) X R со структурой ^/, которая индуцируется #'; S = (Su ...f Sp) —отображение, определяющее оцифровку; Sj=qj ° jc</>— количественная действительная пере- (, менная, представляющая перекодированную переменную &н (она получает- Рис. 13.1 ся заменой переменной хЩ. Пусть С - (сг, ..., ср) — матрица размера п X р, столбцами которой являются оцифровки, задаваемые векторами перекодированных значений переменных xS^: 13.2.3. Ограничения на оцифровку и множества оцифровок, допустимых согласно природе переменных Пусть xW — переменная, определенная на множестве ?, которой соответствует «схема оцифровки», приведенная на рис. 13.2. Ограничения на оцифровку и множество допустимых оцифровок зависят от природы я:</>. Рассмотрим три случая. 9* 259
Рис. 13.2 13.2.3.1. Номинальная переменная Пусть х</> — номинальная переменная. Каждой градации переменной xW должна соответствовать одна-единственная числовая метка. Иначе говоря, всякое отображение qj из Wj в R определяет оцифровку переменной х^'К Множество допустимых оцифровок состоит из элементов, удовлетворяющих следующим ограничениям: С/ j — \^7 С ^ • j — ^ j j» 7 С ^ f» где Cj — вектор, координатами которого являются числовые метки /-й переменной на п объектах; bj — вектор меток, поставленных в соответствие nij градациям переменной х</>; Xj—матрица, представляющая п анализируемых объектов по переменной х№ в бинарном виде* (см. Ш). 13.2.3.2. Ординальная переменная В этом случае структура #v ($-)) должна задавать порядок на Wj (на R). Таким образом, всякое монотонно возрастающее отображение, действующее из cl?J j в R, задает оцифровку х^К Множество допустимых оцифровок в этом случае представляет собой выпуклый многогранный конус (см. [18]): где Cj — вектор перекодированных значений переменной xU\ соответствующих п анализируемым объектам; bj — вектор меток, соответствующих rtij градациям переменной л:<'*>; Xj — логическая таблица индикаторных переменных градаций признака х^'К *Объект с номером / представлен в этой матрице строкой длины rrij (число градаций переменной х(/)), в которой на kfU месте стоит единица, а на остальных — нули, где ki — номер градации переменной *</), к которой отнесен объект i. Таким образом, матрица Xj, названная авторами логической таблицей индикаторных переменных градаций признака хУ\ имеет размер п X т7- — Примеч. ред. 260
* 3.2.3.3. Количественная переменная Множество всевозможных значений количественной переменной является подмножеством R. При оцифровке каждому значению должна ставиться в соответствие одна-единственная числовая метка. Таким образом, отображение qs пространства R в себя задает оцифровку *</>. Множество допустимых оцифровок определяется соотношением Обозначим ?Р= V\ X ^2 х ... х WP прямое произведение множеств допустимых оцифровок рассматриваемых переменных. 13.3. АДАПТИВНАЯ ОЦИФРОВКА В СЛУЧАЕ ИЗВЕСТНОЙ ФИКСИРОВАННОЙ МЕРЫ СХОДСТВА Адаптивную оцифровку определяют аналогично адаптивному расстоянию (см. гл. 12), следуя основным этапам метода динамических сгущений, определенным в гл. 1. Мы будем пользоваться подходом, описанным в [4], вытекающим из общего случая, представленного [17]. 13.3Л. Выбор пространства покрытий Пространством покрытий назовем множество, состоящее из подмножеств Е и удовлетворяющее заданной структуре классов. Практически используются три основных типа структуры классов: разбиения, иерархии и покрытия, заданные на множестве/?. В этой главе мы будем иметь дело только с разбиениями множества Е на k классов. Пусть <$ = Р^ — множество таких разбиений. 13.3.2. Структура представительства, пространство представительств 13.3.2.1. Пространство представительств Пространство представительств определяется равенством L = Rp X V, где Ф вводится в 13.2.3.1. Представительство некоторого В а Е имеет вид: L = (g, с) 6 L; g — вектор, р координат которого являются центрами тяжести В по соответствующим переменным, с ?W. Наконец, Lfc = L X ... X L (k раз). 13.3.2.2. Мера сходства между объектом н представительством Вспомним, что множество Е можно рассматривать как подмножество векторного пространства R*, где q — размерность, необходимая Для представления р переменных. Степень годности представительства 261
для определения характеристик объекта xt ? Е может быть измерена с помощью расстояния d (xu L) — \\g — Ci\\2, A) где ct — вектор перекодированных значений р переменных на i-u объекте*. Представительство L нам подходит тем больше, чем меньше величина A). Определим меру сходства между объектом хг и представительством L следующим образом: D (xi4 L) - Pid (xu L), B) где pi — весовой коэффициент, приписанный /-му объекту. 13.3.3. Оптимизируемый критерий Критерий представляет собой отображение W: Ph X Lh-*- R+, определяемой формулой W (Л L) = | D (Рь Lt), C где Р - (Ри ..., Ph) e Pfe; L - (Llf ..., Lk) 6 Lk; Lf - <?, с); ft — центр тяжести Pt\ D {Pi, Lt) = 2 D (x, Lz). Таким образом, (З можно представить в виде W(P,L)^? ^ Д (*,?,) =2 2 Px\\?i-?x\\\ D) где /?х — весовой коэффициент, приписанный объекту х, а сх — вектор перекодированных значений переменных на объекте х. Выражение D) эквивалентно W(P, L) = % \\cj-Ygj\\bn, E) /= 1 где Cj — вектор перекодированных значений переменной х^ на п объектах О F) О gj — вектор k X 1, координатами которого являются значения центров тяжести классов Pl9 ..., Pk по переменной xW\ Y — матрица размера п X ?, состоящая из нулей и единиц, причем ?-й элемент /-го столбца равен 1, если t-й объект принадлежит классу Рг. Этот критерий позволяет определить меру адекватности представительства L разбиению Р. "Л • • \ 0 -oj *с\ — строка матрицы С, определенной в 13.2 2 (cj — ее столбец). — Примеч. ред. 262
13.3.4. Задача оптимизации Общая задача заключается в определении одновременно разбиения р g Pk и его представительства L, таких, чтобы они были наиболее адекватны в смысле минимизации критерия. W. Иначе говоря, мы ищш разбиение множества объектов Е на k однородных классов (с минимальной суммой внутриклассовых инерции) и одновременно оцифровку, совместимую с начальными неоднородными данными, которая была бы адекватной центрам тяжести классов. Замечание. Для того чтобы избежать нулевых оцифровок (практически малоинтересный случай), мы будем требовать, чтобы векторы перекодированных значений переменных были центрированы и нормированы согласно метрике, определяемой матрицей F),, где pt > О Итак, ищется решение следующей задачи: с \ / 1, ... , /7. Здесь 1П = | : j— вектор-столбец из п единиц; MI (Ph) — множество матриц Y для всевозможных разбиений из Pk. 13.3.5. Описание алгоритма Речь пойдет об одном из алгоритмов, реализующих метод динамических сгущений. Исходя из некоторого оцененного или взятого наугад начального разбиения Я<°> ? Рь мы будем строить последовательность (Р(»), Lw)r такую, чтобы последовательность соответствующих значений критерия W (P(n>, L<">) убывала. Для этого требуются две функции, которые будут определены ниже. Это /: Lk ->• Pfe — функция, ставящая в соответствие некоторому представительству L6Lft разбиение Р 6 Рь> и функция g: Ph-+ Lkr которая по разбиению Р определяет представительство L. Таким образом, нужная нам последовательность строится следующим образом: 263^
13.3.5.1. Функция назначения /: Lft-^ Pfe. Для каждого L ?Lkf L (L2, ..., Lk) и Lt == = (gif c) 6 L / (L) является разбиением P •-=¦ (Ръ ..., Pfe), таким, что P, - {jc 6 ? : D (x, Lt) < D (x, L7) V/ # i равенство возможно лишь при i<Zj}. Поскольку D (Xy Lt) ¦— px\\gi — сх\\гу где рх — вес объекта, а сх — вектор перекодированных значений р переменных на объекте х, имеем Pi '- {х 6 Е: ||& -?я||* < |&- с?||2 V/ ^=f и /< /}. Если теперь вспомнить, что Lt (gn с), a Lj = (g"j, с), то станет очевидно, что класс Pt состоит из тех элементов ?, которые по мере сходства B) ближе к представлению Liy чем к любому другому Lj. Замечание. Безразлично, искать ли разбиение Р -- (Рх, ..., Pk) или матрицу У - (^1, ..., уд. При заданном L известны Cj, gj, j — 1, ..., р. В этом случае / (L) является решением задачи оптимизации 13.3.4. 13.3.5.2. Функция представительства g: Pk -> Lft. Для каждого разбиения множества Е на k классов Р = (Рь ..., Pk) значением g (Р) является представительство L = = (Lj, ..., Lk), где Lj = (grf, с). При этом L является решением задачи G), которая распадается на р задач: G) ,... , р. Нам придется рассмотреть задачу минимизации для всех трех типов переменных. Замечание. Метки, полученные в процессе работы алгоритма, не зависят от исходных меток. 13.3.5.2.1. Оцифровка номинальных данных Вектор перекодированных значений переменной лг<'*> можно записать в виде где Xj — логическая таблица индикаторных переменных градаций признака х^'\ a bj — вектор, координатами которого являются метки, приписываемые соответствующим градациям х^'К При этом реша- 264
я задача оптимизации G), где индекс / соответствует номинальной переменной *(/). Решение зависит от того, является ли g} нулевым вектором. Поэтому рассмотрим два случая: а) g. — нулевой вектор из R*. Это вырожденный случай, G) сводится к определению вектора bj ? Rm*\ который бы удовлетворял Ь) (X'pnXj) bj = 1, KDnXjbj = 0. (8) решением являются векторы единичной длины в метрике, задаваемой матрицей X/DnXj\ расположенные на гиперплоскости, которая определяется вторым уравнением (8); б) gj — ненулевой вектор из R*. Вектор о, = Ygj известен, будем считать, что он центрирован в метрике Dn. Покажем, что решение (9) 1)п-центрировано и является решением G). Задача (9) эквивалентна A0): min Для A0) функция Лагранжа имеет вид ? (bj> a) = \\Xjbj — aj\\%Dn - a (b) (X}DnXj) bj - 1), где а — неопределенный множитель. Для того чтобы существовало решение A0), необходимо выполнение следующих двух условий: ^— = оте^От^ 6 Rmj—нулевой вектор); д2 % (bj, а) -——=¦ положительно полуопределенная матрица (см. [10]). Заметим, что =^— - A — a) (X}DnXj). Поскольку а< 0, d(bjf очевидно, что второе условие выполнено. Если выполнено первое условие, то A - а) (Х'рпХ,) Ь± - и> поскольку а ф \у 265
где &>s = Xj (X/DnXj)-x XjDn — Du-ортогональный проектор на векторное подпространство Vj. В силу того, что ||су||дп = 1, и решение (9) имеет вид с* = ' l Для того чтобы показать, что A1) действительно является решением, докажем следующее предложение. Предложение 1. Если вектор а/ центрирован в метрике Dn, то это справедливо и для cj. Доказательство. Имеем ' V [Г (^']'= (ГД^ЛУ ft = ft ; - 0, потому что произведение Dn& является симметричной матрицей, а вектор \п принадлежит линейной оболочке столбцов матрицы Xj. Итак, A1) является центрированным вектором перекодированных значений номинальной переменной *</>. 13.3.5.2.2. Оцифровка ординальных данных В этом случае вектор перекодированных значений переменной име ет вид и Ь\п Напомним, что Xj — матрица бинарного представления переменной </>, а fc; — вектор оцифровок, соответствующих категориям переменной причем координаты ft/ упорядочены согласно установленному порядку среди значений х(Т). Как и для номинальной переменной *</>, рассмотрим два случая: а) ft — нулевой вектор из R*. Обозначим через С<^> = {bj 6 ^ Rwi: Ь(/> ^ ...^6^)} выпуклый конус в пространстве Rm*. Требуется найти вектор Ь7- 6 С(/), удовлетворяющий системе уравнений (8). Решением является любой вектор, имеющий единичную норму в метрике, определяемой матрицей X/DnXj и принадлежащей пересечению гиперплоскости, задаваемой уравнением (8) с конусом С<'>; 266
ф g. — ненулевой вектор. Определим % = {v 6 Rn- II v\\bn = ___ i \ "Тогда задачу минимизации можно записать следующим образом: A2) min Ik,—a,||2 , Будем считать, что заданный вектор ctj = Ygj центрирован в метрике Dn. При решении A2) используются следующие три утверждения: 1. С помощью алгоритма Крускала (см. [5], [6]) можно найти 2. Вектор cj, при котором достигается A3), ?>п-центрирован (проекция на V} не нарушает центрированности). 3. С помощью теоремы 1, имея решение A3), можно получить решение A2) (см. [8]). Теорема 1. Всякое нормированное в метрике Dn решение A3) является решением A2). Доказательство приводится в [8] и [13]. 13.3.5.2.3. Оцифровка количественных данных Множество всевозможных значений количественной переменной принадлежит R. Положим cj = ZjbJf bj 6 R<™+1\ A4) — QniZyK — >Z(/m))~матрица размера n x (m+\), Таким образом, перекодированными значениями количественной переменной х^ будут многочлены степени т от ее исходных значений. Рассмотрим два подхода. 1. Метод полиномиальной регрессии. Задача оптимизации имеет вид -1 и <L»'?>?» 267
или, что эквивалентно, b'(Z',DnZj)b, = Как и для номинальной переменной, возможны два случая: а) gj — нулевой вектор пространства R*. Всякий нормированный в метрике Z}DnZj вектор bj9 принадлежащий гиперплоскости YDn X X Zjbj = О, дает нам вектор меток С/, удовлетворяющий A4) и являющийся решением A5); б) gj — ненулевой вектор. Вектор а/ = Ygj известен, как и прежде будем считать, что он центрирован в метрике Dn. Проекция а7- на Wj также будет Отцентрированной (согласно предложению 1). Таким образом, последнее уравнение A5) всегда будет выполнено. Решая A5) методом неопределенных множителей, получим где З5^. = Zj (Z'/DnZj)-1 Z}Dn —D^-ортогональный проектор на пространство, порожденное столбцами матрицы Zj. 2. Второй подход основан на минимизации невязки. Будем считать, что вектор dj известен и \'nDnaj = 0. Поскольку проекция на ?^-Оп-центрирована (согласно предложению 1), из теоремы 1 вытекает, что для решения A5) достаточно найти вектор bj 6 R(m+1), реализующий и пронормировать его в метрике Dn. С другой стороны, ||Z/&7-—Я/||ЬП является суммой квадратов остатков следующей модели: aj^Zjbj + Uj, Е (tij) — 0n—нулевой вектор, принадлежащий Rrt , E{»J »,) = *>-К Решением задачи A6) является ) Dn Zj)~* Z; Dn (Zjjyj + u 268
где SPZj-=Zj(Z'/DnZj)^Z].Dn. Если это выражение представить в виде c** = ajJ\-Cbz. tij—uX то можно рассмотреть геометрическую интерпретацию при п = 2 (рис. 13.3). Рис. 13.3 Здесь ln eWj и < 1„, щ>оп = 0 (см. [12]). С другой стороны, ^aj-c)" = {I~Zj (Z; D '. Dn\ oj - = [I-Zj (Z'.Dn где /—единичная матрица размера п X п, a Qz. = / — Zj (Z}DnZj)- X Z/Dn — оператор Dn-ортогонального проектирования на^/, т. е. на D^-ортогональное дополнение^;. Квадрат нормы вектора щ имеет вид Е B5) = [n~tr (Z/D» ^)"! Z/ Z^' Доказательство этого соотношения приводится в [12]. Кроме того, Е Й = Е (QZj uj) - QZj E Kuj) - 0„, A8) E{^j2y-=E[QZjuju;/QZj]^Qzj Dn" Q!zf A9) Нормируя с)* в метрике Dnt можно получить решение задачи A5) (см. теорему 1). Заключение. В случае, когда *</> — количественная переменная, метками являются координаты вектора Cj, который получается после нормирования в метрике. Dn вектора где :rz. : j {Z'PvZj)-1 Z}Dn, вектор uj принадлежит гиперплоскости \aDnUj 0 и удовлетворяет A7)—A9). 269
13.3.6. Сходимость алгоритма Здесь п будет обозначать номер итерации. Предложение 2. Последовательность ип = W (vn) (где vn (, L<rt>) определяется в 13.3.5) является монотонно убывающей и имеет предел. Доказательство. Имеем W (P<">, L<">) = min W (P, L<">) (согласно определению /), pepfe IF (Р<«- !>, L<">) = min ЩР<«- *>, L) (согласно определению g). LeLft Таким образом, т. e. wn ^ «n-i- Последовательность w^ монотонно убывает, и поскольку все ее члены положительны, она сходится. 13.3.7. Связь между каноническим анализом и оцифровкой номинальных данных Введем следующие обозначения: Wy — {УЬ: Ъ 6 R*} — линейная оболочка столбцов матрицы К; Wy cz R<">; Vj = {Xfa: a 6 Rm^'} — векторное подпространство, порожденное "" "" столбцами матрицы X/, 2^ c Задача (9) эквивалентна следующей: найти вектор ?/ 6 %и Угол которого с подпространством Vy минимален. В самом деле, минимизировать расстояние между вектором из %} и некоторым вектором из $*V равносильно минимизации угла между этими векторами. Положим 5V = Y (Y'DnY)~x Y'Dn — оператор Оп-ортогонального проектирования на Wy. Пусть 8;. — угол вектора \] = Xja с Wy. <|„ SPY h>Dn Ч\ lj \\ОП №|; \\Dn COS (9,.). Для того чтобы сделать 0,- как можно меньше, надо решить задачу: при В силу того, что 270
(так как &YDn &>y = Dn эта задача сводится к Уравнение Лагранжа для B0) имеет вид X(а, Ц =а' X/ Dn^кХ,-а — ^а' X/ B1) ^ (X/ Dn X,)-1 X/ Dn №y Xj a = Кал B2) Учитывая B1) и условие задачи B0), имеем a' (Xj Dn g*Y Xj) a = W (Xj Dn Xj) a=k, т. е. К равно максимальному значению <?/, ^к ^> оп- Если теперь обе части B2) умножить слева на Х/,^то, положив ^ = X/ (Х/ОлХ/)~1 х X X/Dn, получим отсюда следует В последних двух соотношениях можно узнать основные уравнения канонического анализа двух групп переменных, порожденных Xj и Y. Возьмем в качестве вектора меток xS^ каноническую компоненту а, соответствующую наибольшему собственному значению матрицы так как cj отсюда 9,Y [(Y'DnY)-* (Y'DnXj) a] = kcj. B3) t-й координатой вектора (Y'DnXj) а является сумма перекодированных значений х</> для объектов, принадлежащих классу Pf (значения меток умножаются на веса, соответствующие объектам). Элемент с номерами (t, i) диагональной матрицы Y'DnY равен суммарному весу объектов класса Pt. Очевидно, что (Y'DnY)-l(Y'DnXj)a = gj. Равенство B3) превращается в 3*jYgj = *?h но aj^Ygj и ^jOj^Xcj. 271
Из условия нормировки вектора Cj вытекает: а} Следовательно, а} 3й/ Dn &jaj - tf (cj Dn cj) =ф || oj \\hn *} = Этот же результат был получен прямо (см. (И)). Заключение. Итак, оцифровка номинальной переменной сводится к каноническому анализу двух групп переменных, порожденных матрицами Xj и Y. Вектор меток, соответствующих градациям рассматриваемой переменной, задается первой канонической компонентой, т. е. собственным вектором оператора OPj SV, соответствующим максимальному собственному значению. 13.4. АДАПТИВНАЯ ОЦИФРОВКА ПРИ ИСПОЛЬЗОВАНИИ АДАПТИВНЫХ РАССТОЯНИЙ 13.4.1. Выбор пространства покрытий 5 Как и в 13.3.1, мы ограничимся S = Pk множеством разбиений Е на k классов. 13.4.2. Структура представительств, пространство представительств 13.4.2.1. Пространство представительств Определим пространство представительств как L = Rp х т х 2Р, где 3) — множество расстояний Махаланобиса (см. гл. 12), определенных на Rp, таких, что определители соответствующих матриц равны 1, а множество W вводится в 13.2.3. Согласно приложению 1 из гл. 12 VB cz Rp существует симметричная положительно определенная матрица /И, такая, что соответствующее расстояние йв минимизирует инерцию множества В, причем М == \Q\p Q-\ где Q — ковариационная матрица на В. Следовательно, всякому элементу множества 3j можно поставить в соответствие диагональную положительно определенную матрицу, и всякое В а Е может быть представлено так: L = fe, dBt с) 6 L, где g — центр тяжести В, с ?Wy dB — расстояние Махаланобиса на множестве В. Обозначим пространство представительств: Lfe -- L х ... X L (* раз). 272
13.4.2.2. Мера сходства между объектом и представителем Для того чтобы определить меру сходства между объектом и представителем, рассмотрим образ пространства Rp при ортогональном преобразовании ?/', которое переводит расстояние, задаваемое симметричной, положительно определенной матрицей М, в расстояние, задаваемое диагональной матрицей Мв, составленной из собственных значений матрицы М. Мера сходства между объектом х ? В и представителем L = (g, dB, с) ? L задается равенством DB(x, L)= \\g-cx\\bB. Сх — вектор перекодированных значений переменных на объекте х. 13.4.3. Оптимизируемый критерий В качестве критерия мы будем использовать отображение W: Рк X Lfe-> R+, причем, как и в 13.3.3, справедливы определение C) и выражения для входящих в него параметров, кроме Lu в данном случае Lt = (gt, diy с), где gt — центр тяжести, a dt — расстояние Махаланобиса, ассоциированное с классом Pt. Формула D) принимает вид W(P,L)= S Dt(PitLt)= 2 S Di(x>Lt) = k где ca — вектор значений переменных для объекта х\ Mt — диагональная, положительно определенная матрица, соответствующая dt: Af,= о 0 Таким образом, можно записать: 1 0 в противном случае. 273
Определим матрицу Df. — к Тогда /==1 Матрица Y определяется в 13.3.3. Таким образом, критерий W позволяет оценить, насколько адекватны разбиение Р 6 Р& и представительство L 6 Lfe. 13.4.4. Задача оптимизации Задача состоит в том, чтобы одновременно определить: разбиение Р 6 Р& на однородные классы (с минимальной суммой внутриклассовых инерции); семейство квадратичных расстояний (de), локально адаптируемых к структуре Р, i = 1, ..., k\ числовые метки, которые были бы совместимы с начальными неоднородными данными. По тем же причинам, что и в 13.3.4, векторы перекодированных значений переменных полагаются нормированными и центрированными в метрике Dj. Таким образом, решается следующая задача оптимизации: /24) II ?/№,= !. где \п — вектор-столбец из п единиц. 13.4.5. Описание алгоритма См. 13.3.5. 274
13.4.5.1- Функция назначения функция назначения / является отображением f: L& —>• Рь» причем если L 6 U, L = (L2, ..., Lfe), a L,- = (giy diyd) € L, то / (L) = Py где разбиение Р имеет вид (Р1у ..., Pft), Pt = {x?E:Di (xy L,)< ^Dj (x, Lj)y V/ =#=*, равенство возможно лишь при *</}• Послед- дее определение равносильно Р,- = {x?E:\\g% — сх\\м. ^ ||g> — — ^лПл4» У/ фь* в случае равенства t <С /}. Таким образом, каждый класс состоит из таких элементов множества Еу которые в смысле расстояния Di «ближе» к представлению Liy чем к любому другому Lj в смысле Dj. 13.4.5.2. Функция представительства g: Pk-+ Lft. Если Р = (Р1у ..., Pk) — некоторое разбиение множества Е на к классов, то значением g (Р) является L = (Lly ..., Lk)y где Li = (giy diy с) определяется как решения задачи B4). Замечание. Если разбиение Р ? Ph известно, то мы можем определить К, gi, dt и Dj. При решении задачи B4) следует рассмотреть три случая согласно возможным типам переменной (см. 13.3.5). Воспользуемся обозначениями из 13.3. 13.4.5.2.1. Оцифровка номинальных данных Возможны два случая: a) gj — нулевой вектор пространства R*. Задача оптимизации вырождается в ( ь: /vr n у л />.~ 1 1 ' B5) множество решений состоит из векторов, нормированных согласно первому уравнению и принадлежащих гиперплоскости, определяемой вторым уравнением B5); б) gj — ненулевой вектор. Рассуждая, как в 13.3.5.2.1, приходим к решению » где ** = ?/ — центрированный и нормированный в метрике Dj вектор, координатами которого являются значения перекодированной переменной. 13.4.5.2*2, Оцифровка ординальных данных Остаются в силе соответствующие результаты из 13.3.5,2.2 при условии, что Dn заменяется на Dj. 275
13.4.5.2.3. Оцифровка количественных данных Первый подход. При использовании полиномиальной регрессии решение имеет вид где Pz.^ZjiZ'PjZjyiZ'Pj. B6) Второй подход. Если минимизировать невязку, то, как и в 13.3.5.2.3, получим с}* = aj + (SPz. Uj — uj), &>Zj определяется B6), a Uj — вектор, принадлежащий гиперплоскости \nDjUj — О и удовлетворяющий ^^ DjZj^Z} Zj]9 E (iij) =•¦ Ол, Е (tiju'j) = Qz. D x Qz., — — — j j где Qz. = I — 9*z. является Dy-ортогональным проектором на Wf (Dp — ортогональное дополнение Wj). Третий подход. Здесь описывается оцифровка посредством прямого разложения квадратичного адаптивного расстояния. Для этого каждому классу Рг 6 Р поставим в соответствие матрицу Махаланобиса: Hi = \Qt\P QT\ где Qi = 2 (х — Si) (х — SiY — ковариационная матрица клас- х е р i са Рг (см. 7). Hi является аналогом матрицы Ми задающей в классе Рг расстояние dt. Матрица Ht вещественна, симметрична и положительно определена, значит, можно найти матрицу Вг, такую, что Ht = = BiBi. Минимум инерции класса Рг равен 2 (x-gtYHt(x-gt)= xfp (Btx-Bigt)' (вгх- - Bigt). B7) Таким образом, найдено преобразование Ви позволяющее минимизировать инерцию класса Pt. В качестве вектора меток количественной переменной л;(/> можно взять значение всякого преобразования, способствующего уменьшению этой инерции. Пусть 276
можно положить 'л V ГкV I Г» — Гу • РГЯИ Y С H 13.4.6. Сходимость алгоритма См. 13.3.6. 13.4.7. Связь между оцифровкой переменных и определением некоторых адаптивных расстояний Используя формулу B7), можно критерий представить в следующем виде: Поскольку Bj и gi определены, положим: — квадратичное расстояние между объектом х и центром тяжести класса Рг. Таким образом, min []? ^ e«(^ft) I. где б = F1э ..., 6ft), bi 6 25о — семейство квадратичных расстояний, определенных на R*\ Заключение. Итак, если определена матрица Bif имеет место связь (эквивалентность) между адаптивной оцифровкой и определением семейства адаптивных расстояний бг-, минимизирующих критерий. 277
13.5. ПРИМЕР ПРИМЕНЕНИЯ ОПТИМАЛЬНОЙ АДАПТИВНОЙ ОЦИФРОВКИ 13.5.1. Данные Мы использовали таблицу смоделированных данных (рис. 13.4). Второму столбцу соответствует номинальная переменная, третьему — -Номера объектоЬ - Номинальная переменная -Ординальная переменная - Количес тденная переменная 35 2 36 2 37 1 Рис. 13.4 ординальная, а четвертому — количественная. Эти переменные служат для описания пятидесяти объектов. 278
13.5.2. Результаты Пять начальных разбиений были выбраны наугад. Для каждого из них исследовались результаты различных вариантов оцифровки. На рис. 13.5 приводится случай, когда количественная переменная оцифровывалась с помощью многочленов третьей степени (значение критерия при этом оказалось наименьшим). Начальное разбиение, выбранное случайный образом номер класса Количество элементов вилассе 17 4 5 12 13 IS 16 17 19 22 23 26 28 37 38 41 44 47 о с 21 3 6 9 11 18 21 24 25 29 31 32 33 35 36 39 42 43 45 Ап но 49 50 о о 12 1 2 7 8 10 14 20 27 30 34 40 46 Рис. 13.5 13.5.2.1. Переменные и числовые метки 1) Номинальная переменная: Исходные метки Полученные метки 1 0,411 2 0,132 3 0,411 4 0,260 5 —3,369 279
2) Ординальная переменная: Исходные метки Полученные метки 1 —0,905 2 — 0,393 3 —0,035 4 1,348 5 1,962 3) Количественная переменная: Значения 0,0 0,1 0,2 0,4 0,5 0,6 0,7 0,8 0,9 1,1 1,2 1,4 1,8 1,9 2,0 2,7 3,3 3,8 4,3 4,4 4,9 5,4 Метки — 0,875 —0,878 -0,875 —0,875 —0,875 — 0,875 — 0,875 -0,875 — 0,875 1,244 1,244 1,244 1,244 1,244 2,078 2,078 1,963 1,963 1,230 1,230 1,230 0,214 Значения 5,5 5,6 5,7 5,8 5,9 6,1 6,6 6,9 7,7 7,9 8,2 8,9 9,1 9,2 9,3 9,4 9,5 9,6 9,7 9,8 9,9 Метки 0,214 0,214 0,214 0,214 0,214 — 0,751 —0,751 —0,751 — 1,332 — 1,332 — 1,196 — 1,196 — 0,007 — 0,007 —0,007 —0,007 — 0,007 — 0,007 —0,007 — 0,007 —0,007 11.5.2.2. Наглядное Интерпретация федстеш т меток. 1) Метки, полученные для номинальной переменной. Согласно рис. 13.6 можно утверждать, что градации 1 и 3 в процессе оцифровки были объединены. Градация 2 ближе к градации 4, чем к градации 3. И наконец, градация 5 была оценена меньше, чем другие. 280
Полученные метни Взаимное расположение полученных меток -3,369 Рис. 13.6 Полученные метни Взаимное расположение полученных меток 5 Исходные метни -0,39 -0,9 Рис. 13.7 281
Полученные метки Взаииное расположение полученных меток 2,078 1,96 Рис. 13.8 2) Метки, полученные для ординальной переменной (рис. 13.7). При оцифровке был сохранен порядок градаций. Следует отметить относительную важность градации 5 и низкую оценку градации 1. 3) Метки, полученные для количественной переменной. Небольшие значения переменной получили большие метки (рис. 13.8). Многочлен имеет вид у = С^ОЗбх3 — 0,63х2 + 2,56х — 0,875, где х принимает значения исходных, а у — полученных меток. 13.5.2.3. Значения критерия и количество объектов, поменявших классы при переходе от одного шага к другому Номер итераций 1 2 3 4 5 Циспо объектов, перенесенных 6 другой к'пасс m 3 1 t 0 Значение критерия ' 208,578 201, 975 Щ 837 т> вое /94, 534 282 Рис. 13.9
13.5.2.4. Таблица перекодированных данных и разбиение Габлицо перенодиробанных донных 2 3 it 5 6 7 8 9 10 м 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 ¦36 37 38 39 40 4 7 42 43 44 45 4G 47 48 49 50 0,41 152 0, 1318В 0, 131 89 0, 13189 0,13189 0,41152 0,411 52 О,12189 0,411 52 0,131 8 9 0,411 52 0,411 52 0,411 52 О, 13189 0,4\\52 0,26005 0,26005 0,26005 0, 4 11 52 0,411 52 0,4 1152 ~3, 36921 -3,36921 0,28005 0 ,13189 -3,36921  ,38921 0,26005 0,26005 0,26005 0,26005 0,26005 О,13189 0, 13189 О,13189 0, 13189 0,41152 0, 13189 0,4 1152 ~ ,4 1152 , 1152 ,41152 ,26005 ,4115? .41152 ,26005 , 1152 ,41152 ,26005 ,41152 к 0, 0, о, о, о, о, о, о, о, -0,03482 1 ,34768 -О,03482 -О ,39324 1 ,96212 ,39324 1 ,96212 1,96212 1,96212 1 ,34768 1 ,34768 -0, 03482 1,96 212 1 , 96 212 -0,03482 -0,39324 -О,39324 'О ,90528 "О ,03482 -О , 03482 -О ,03482 1 ,34768 -О,03482 1,34768 U34768 ,2 -01 90528 -0,9 05 28 -0,90528 ,90528 -0, 90528 -О, 90528 -0, 90528 -0,90528 - 0,30528 -0,90525 'О,03482 "О,90528 -О ,30528 '0,90528 -0,90528 '0,90528 - 0,305 28 -О , 90528 -0, 03482 -О у 39324 -О,393 24 -0,39324 "О, 39324 -0,03482 -0,57535 -0,87535 -0,87535 -0,57535 -0,87535 -0,57535 -0,57535 -0,37535  ,87535 ,87535 -0,8 7535 -0\В 7535 '0,87535 -0,75 11 2 '0,00740 1,23004 1 ,23004 1 ,23004 -0 ,00740 -0,00740 0 ,21421 1,96268 1,23004 -1 ,33229 1,24366 1,24366 2,07 844 -1,19 560 -0,87535 -О 00740 1 24366 1.9G268 2,07844 -О,87535 ,33229 ,00740 ,21421 ,19560 ,75112 ,75112 ,21421 \21421 ,21421 ,21421 ,00740 ,00 74 0 ,00740 ,00740 .24366 ,24366 Полученное разбиение Номер класса Количество эле- ментод в классе \ о, -О' -0 О, 0. о, 0 -о, -о, -0, -0, ! / 4- 22 23 26 27 2 3 25 22 37 3 43 1 2 3 4 5 6 7 в 9 10 ft 12 п fU /5 /6 /7 IB 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 АО 4/ 43 44. 45 46 47 40 50 Рис. 13.10 28а
ЛИТЕРАТУРА 1. CallezF., Pages J. P. A976) Introduction a Г analyse des donnees, SMASH. 2. Diday E., Lemaire J., Pouget J., T e s t u F. A980) Elements d'analyse des donnees. Dunod. 3. D u p о n t-G atelmand C. F Avril 1978) Deux methodes d'analyse des donnees qualitatives. Typologie avec codage adaptatif et modele de decompositions additive des preferences. These de 3eme cycle. Universite de Paris IX. 4. G о v a e г t G. G mai 1975) Classification automatique et distances adap- tatives. These de 3eme cycle. Universite de Paris VI. 5. Kruskall J. B. A965) Analysis of factorial experiments by estimating monotone transformation of the data. Journal of the royal statistical society, series B, 27. 6. Kruskall J. B. A971) Monotone regression, continuity and differentiability properties, Psychometrika, tome 36, № 1. 7. Kyoto, Japan (Novembre 7—10, 1978) Proceedings of the fourth international joint conference on pattern recognition. 8. (De) Leeuw'J. A976) A normalized cone regression approach to alternating least squares algorithm. The Netherlands — University of Leiden. 9. (De) LeeuwJ., Y о u n g F. W., T а к a n e Y. A976) Additive structure in qualitative data: An alternating least square methods with optimal scaling features (Addals). Psychometrika, 41. 10. M a 1 i n v a u A I-. A971) Leson de theorie microeconomique. P. 260—261, theoremes II cl IV, Dunod. 11. MassonM. A974) Processus lineaires et analyses de donnees non lineaires. These de doctorat d'etat. Universite de Paris VI. 12. M a z о d i e r P. Methodes statistiques de reconometrie: moindres carres generalises. Polycopie, cours de l'ENSAE. 13. Peyrieux J. A977) Probleme de convergence des algorithmes de codage optimal. Memoire de D. E. A. Universite de Paris IX. 14. R e n у i A. A966) Calcul des probabilites avec un appendice sur la theorie de reformation. P. 509, Dunod. 15. RomederJ. M. A969) Methodes de discrimination. These de 3eme cycle. Universite de Paris VI. 16. S a p о r t a G. A975) Liaisons entre plusieurs ensembles de variables et codage de donnees qualitatives. These de 3eme cycle. Universite de Paris VI. 17. T a 1 e n g F. A980) Selection typologique de parametres de differents types. These de 3eme cycle. Universite. de. Paris IX. 18. T e n e n n a u s M. A977) Analyse en composantes principales d'un ensemble de variables nominales et numeriques. COREF. Note de travail, № 18.
Глава 14 • ПЕРЕКРЕСТНАЯ КЛАССИФИКАЦИЯ С ПОМОЩЬЮ ТАБЛИЦЫ СОПРЯЖЕННОСТИ Пусть имеется таблица сопряженности То двух множеств / и /, требуется найти разбиение Р множества / на р классов и разбиение Q множества J на q классов, такие, чтобы коэффициент Пирсона х2 для вновь полученной таблицы сопряженности был максимальным. Существует много методов решения этой задачи, например алгоритм обмена Ренье. В этой главе рассматривается построение последовательности разбиений (Pn, Qn), которая получается поочередным применением метода динамических сгущений к множествам I и J. 14.1. ПОСТАНОВКА ЗАДАЧИ Пусть То = (Uj) — таблица сопряженности, построенная по двум множествам: / и </. Исходя из То можно определить рц, pt. и p.j, как это обычно делается при анализе таблиц сопряженности: Зависимость между / и J можно измерять с помощью коэффициента Пирсона по таблице {/?*;}: Эта величина показывает, насколько измеренные частоты рц отличаются от соответствующих значений в случае, если бы / и J были независимы, т. е. от pt. p.j. Чем больше величинах2, тем сильнее связаны множества / и «/, в случае их независимости она обращается в нуль. Если дано разбиение Р = (Pl9 ..., Рр) множества / и разбиение Q (Qu ••-. Qq) множества /, то можно определить новую таблицу сопряженности, элементами которой являются Vm=l q. Для каждой такой таблицы можно найти значение коэффициента A). Uiiuia задача состоит в определении разбиений Р и Q, максимизирую- 285
щих величину % для соответствующей таблицы. Таким образом, мы ищем наиболее зависимые разбиения. Для обоснования такого подхода рассмотрим пример Бэнзекри [1]. Пусть ttj — число членов /-й коммуны*, имеющих /-ю профессию. «Разбиение Р множества коммун будет тем лучше, чем больше информации о долях различных профессий членов i-н коммуны несет знание класса коммуны. С другой стороны, разбиение Q множества профессий тем лучше, чем больше будут группироваться профессии, которые имеют члены отдельных коммун, т. е. когда знание класса, в который попала /-я профессия, дает приближенную информацию о том, как люди, имеющие эту профессию, распределяются по коммунам». 14.2. ОПИСАНИЕ МЕТОДА Предлагаемый метод основан на поочередном разбиении множеств / и /. При этом используется модификация алгоритма динамических сгущений [23. Уточним, что имеется в виду, прежде чем описывать метод перекрестной классификации. 14.2Л. Метод динамических сгущений с использованием расстояния 5С2 и центра тяжести Пусть (ptj) — таблица частот на / X /. Ищется разбиение множества / на k классов, г = card (/) и s=card («/). Мы будем иметь дело со сгущением «/Г, образованным гвекторами; {(mily ..., mis), /=1, ...,г}, наделенными массой шц = ?И-, и масса i-ro вектора равна pt.. Pi' Предполагается, что в пространстве, в котором лежит сгущение Ж, введена метрика, задаваемая матрицей 1 о Р.1 Р.ш B) 14.2.1.1, Алгоритм Начиная с некоторого исходного разбиения Р<°> строится последовательность разбиений (Р<">): для каждого класса разбиения Р<0) определяется центр тяжести; новое разбиение строится таким образом, что каждый элемент относится к тому классу, к центру которого он ближе * Коммуна •— низшая административно-территориальная единица во Франции, управляемая муниципальным советом во главе с мэром. — Примеч. пер. 286
всего, затем процедура повторяется, т. е. алгоритм реализует метод динамических сгущений для случая, когда роль ядра класса играет его центр тяжести. Получаются следующие результаты: а) критерий, оптимизируемый этим методом, имеет вид W(P)=% % Я-*&<*№)> C) где Р = (Р1У ..., Pk)'r d— расстояние в метрике B) и G (Рг) — центр тяжести класса Рг\ б) последовательность (Р(п>) стабилизируется (т. е. ЯЛ/\ V/i > N Р(п) = /><*>) и, кроме того, W (PW) > W (PW) > ... > W (/><">) = = W (PW). 14.2.1.2. Связь между критерием W и коэффициентам сопряженности %2 Пусть Р — некоторое разбиение множества /; G — центр тяжести этого множества. Тогда согласно теореме Гюйгенса 2/*. ^2 (i> б>= 2 2 Р-d* & /б/ 1=\вЩ Словами это можно выразить так: общая инерция (Т) равна сумме внутриклассовой инерции (W) и межклассовой инерции (В)у т. е. Т - W + ?. D) Выражение для Т Если G = (g3, ...r ^fs), то но определению центра тяжести Pi. напомним, что У, р{: = 1. Откуда /6=/ s 1 . P.! 287
таким образом получаем, что общая инерция Т равна коэффициенту X2 исходной таблицы (см. A)), который мы будем обозначать как Выражение для В k , 2 Пусть (p^-)— таблица сопряженности, полученная суммированием по объектам, принадлежащим /-му классу: рц = 2 Рч- Таким образом, рг. ^ 2 Pi-> Отсюда получаем, что В = %2 (Р, У), где х2 (^» «О — коэффициент х2 для таблицы (ри). Выражение для W W совпадает с критерием C), оптимизируемым методом динамических сгущений для множества Ж, состоящего из элементов массы pi. и расположенного в пространстве с метрикой %2. Итак, C) можно представить следующим образом: X2 (/, J) = W (Р) + X2 (Я, /), где W (Р) — значение критерия для разбиения Р. Поскольку х2 (Л J) не зависит от разбиений, алгоритм динамических сгущений, минимизируя W (Р), максимизирует коэффициент х2 Для таблицы (Р, /). 14.2.2. Предлагаемый алгоритм Во время работы алгоритма исходя из некоторого начального (Р<°>, Q<°>) строится последовательность разбиений (Р(п\ Q(/z)), такая, что последовательность х2 (Р{п\ Q(n)) возрастает. Будет показано что последовательность (Р^п\ Q(">) стабилизируется. 14.2.2.1. Необходимость задания чисел классов р и q В выражениях X2 (/, J) = х2 (/, Q) + W (Q), Xя (Л Q) = х2 (^, Q) + w (Р). 288
Значения W (Р) и W (Q) всегда положительны, и поэтому X2 (Р* Q) ^ X2 (Л «О- Следовательно, если р к q заранее не фиксированы, то наилучшими разбиениями в смысле критерия %2 окажутся тривиальные разбиения, в которых каждый элемент множеств / и J является отдельным классом. Числа р и q можно определить, изучая изменение критерия как функции от р и q. 14.2.2.2. Построение Р<л+!) исходя из (Р<4 Q^>) Пусть Т (/, Q(/l>) — таблица сопряженности, элементы которой где Го — исходная таблица сопряженности, a Q<rt> — разбиение множества J на классы Q^\ ..., Q(rt). К этой таблице можно применить метод, описанный в A4.2.1). Будем считать, что объектами, подлежащими классификации, являются элементы множества /, a q классов разбиения Q(n) — параметры. Таким образом, можно построить такую последовательность разбиений на р классов я0, ..., яг, ... множества /, что последовательность соответствующих значений %2 будет возрастать до некоторого номера: х2(я0,Q(/°) <х2(%,Q<">) <.<х2(я*, Q(n)) = х2 Здесь N — номер, начиная с которого значения этой последовательности стабилизируются. Если я0 = Р(/г), то для улучшения этого разбиения достаточно положить Р(л+1> = я N. При этом 14.2.2.3. Построение Q<w+4> исходя из [Р(п^\ QW) Принцип тот же, что и в случае построения разбиения Р(гг+1), только теперь следует рассматривать таблицу Т (Р(»+1), J). Получается последовательность разбиений на q классов множества У, на которой значения х2 сначала строго возрастают, а потом стабилизируются. В качестве Q<n+1> берется предел этой последовательности. При этом 14.2.3. Сходимость последовательности (Р(п\ Q(n>) Число всевозможных разбиений множеств I и J на р я q классов конечно. Последовательность значений %2 (P(rt), Q(rt)) возрастает и ограничена сверху. Следовательно, она стабилизируется, т. е. X2 (Р(Л+1), Q^+1)) -х2 (Р{п\ Q{n)) Из свойств метода динамических сгущений (см. 14.2.1.1) вытекает, что последнее равенство может выполняться только при P<n+1) = Р<я). Ю Зак. 303 289
С другой стороны, Q(/x+1) получается из (Р<п+1\ Q<n>), но ЯС+1) = и Q<n> было получено уже к моменту сходимости последовательности X2 (/><">, Q<">) из (/><">, Q^-1)). Отсюда С^1) - Q<">. Таким образом, последовательность (Р<Л>, Qw) стабилизируется. 14.3. ПРИМЕРЫ ПРИМЕНЕНИЯ 14.3.1. Международное сравнение бюджетов времени 14.3.1.1. Данные Мы воспользовались примером, рассмотренным Жамбю [4]. Множество / состоит из 28 типов людей. Эти типы характеризуются признаками: пол, страна проживания, трудовая деятельность и семейное положение. Множество J состоит из 10 видов времяпрепровождения. Состав множества I РМСШ — работающие мужчины в США РЖСШ — работающие женщины в США НЖСШ — неработающие женщины в США ЖМСШ — женатые мужчины в США ЗЖСШ — замужние женщины в США ХМСШ — холостые мужчины в США РМСЗ—работающие мужчины в странах Запада РЖСЗ—работающие женщины в странах Запада НЖСЗ — неработающие женщины в странах Запада ЖМСЗ — женатые мужчины в странах Запада ЗЖСЗ — замужние женщины в странах Запада ХМСЗ — холостые мужчины в странах Запада РМСВ — работающие мужчины в странах Востока РЖСВ — работающие женщины в странах Востока НЖСВ — неработающие женщины в странах Востока ЖМСВ — женатые мужчины в странах Востока ЗЖСВ — замужние женщины в странах Востока ХМСВ — холостые мужчины в странах Востока РМЮГ — работающие мужчины в Югославии РЖЮГ — работающие женщины в Югославии НЖЮГ — неработающие женщины в Югославии ЖМЮГ — женатые мужчины в Югославии ЗЖЮГ — замужние женщины в Югославии ХМЮГ — холостые мужчины в Югославии ХЖСШ — незамужние женщины в США ХЖСЗ — незамужние женщины в странах Запада ХЖСВ — незамужние женщины в странах Востока ХЖЮГ — незамужние женщины в Югославии Состав множества / 1 — профессиональная деятельность 2 — время, сопутствующее профессиональной деятельности (транспорт...) 3 — работа, связанная с домашним хозяйством 4 — время, отданное детям 5 — прогулки, хозяйственные покупки 6 — туалет, забота о себе 7 — отдых 290
8 — сон 9 — просмотр телевизионных передач 10 — другие способы проведения досуга В таблице Т = {tali ?/, / ? J) элементы t^ представляют количество часов, которые тратят люди i-ro типа на /-е занятие. РМСШ РЖСШ нжсш жмсш зжсш хмсш хжсш РМСЗ РЖСЗ нжсз жмсз зжсз хмсз хжсз РМЮГ РЖЮГ нжюг жмюг зжюг хмюг хжюг РМСВ РЖСВ нжсв жмсв зжсв хмсв хжсв 1 610 475 10 615 179 585 482 652 510 20 655 168 642 389 650 560 10 650 260 615 433 650 578 24 652 434 627 433 2 140 90 0 141 29 115 94 100 70 7 97 22 105 34 140 105 10 145 52 125 89 142 106 8 133 77 148 86 3 60 250 495 65 421 56 196 95 307 567 97 529 72 262 120 375 710 112 576 95 318 122 336 594 134 431 68 296 Таблица данных 4 10 30 по 10 87 0 18 7 30 87 10 69 0 14 15 45 55 15 59 0 23 22 42 72 22 60 0 21 5 120 140 170 115 161 150 141 57 80 112 52 102 62 92 85 90 145 85 116 115 112 76 106 158 68 117 88 128 6 95 120 110 90 112 105 130 85 95 90 85 83 77 97 90 90 85 90 85 90 96 94 94 92 94 88 92 102 7 115 100 130 115 119 100 95 150 142 180 152 174 140 147 105 95 130 105 117 85 102 100 92 128 102 105 86 94 8 760 775 785 765 776 760 775 807 815 842 807 825 812 848 760 745 815 760 775 760 774 764 752 840 762 770 770 798 9 175 115 160 180 143 150 132 115 81 125 122 119 100 84 70 60 60 80 65 40 45 96 64 86 122 73 58 58 10 315 305 430 305 373 385 336 330 262 361 320 392 387 392 365 235 380 357 295 475 409 334 228 298 310 229 463 379 14.3.1.2. Результаты Было проведено несколько вариантов классификации. Изменялось требуемое число классов и начальные разбиения. Наилучшими в смысле значения критерия и числа классов оказались следующие две классификации. Разбиение множества / Номер класса 1 Число элементов 7 нжсш зжсш нжсз зжсз нжюг зжюг нжсв 2 3 8 0 РМСШ жмсш хмсш РМСЗ жмсз хмсз хмюг хмсв 4 5 РЖСШ хжсш РЖСЗ РЖЮГ РЖСВ 5 6 4 0 РМЮГ жмюг РМСВ жмсв 7 4 хжсз хжюг зжсв хжсв 10* 291
Разбиение множества / Номер класса Число элементов 1 3 4 2 6 5 б 7 8 9 10 3 2 1 2 Заметим, что при всех проделанных разбиениях для множества / классы 1, 2, 4 и для множества J классы 1 и 3 оказались очень устойчивыми» Таким образом, несложно выделить наиболее важные классы. На рис. 14.1 приводится восходящая иерархическая классификация /•• Щ класс 2 «#» 8 «» 6 N 15 1В N U ¦ нжсш, теш, хмш. хмюг, нжев, хмев , - РЖСЗ, РЖСВ, ЗЖС8, РЖЮГ * нжсш, нжев, хжез - РЖСВ, ЗЖСВ, НЖСЗ, РЖЮГ N 17 + ИЖСШ - РЖСВ, ЗЖСВ, НЖСЗ, РЖЮГ класс 3 класс 1 N 18 - НЖСЗ, ЗЖСВ, НЖЮГ, НЖС8, НЖСШ - НЖЮГ + нжсш, нжев, нжюг, нжев, нжсш - ХЖСВ, РМСШ, ЖИСВ, ХМСШ < Н 19 «J Рис. 14.1 множества У, а на рис. 14.2 — множества I, найденные Жамбю. В первом случае узлы характеризуются основными типами людей, во втором — видами времяпрепровождения (+ означает положительный, а — отрицательный вклад). 292
нпасс 1 класс зжюг—, - I 49 ИЖЮГ-.Т ur.HR—Г .51 ЗЖСЗ класс 2 хжсз 43 РЖЮГ бремя, отданное детям + прогулки, туалет, телевизор - детиу телеВизор, прогулни, забота о себе - дети, телебизор + другие биды пробедения досуга РИС з-1 хм ю г-I хмсв J ХМСШ-1 35 жмсш РМСШ-* 39 29j Зда/гы &/<?ы проЗедения досуга - телебизор - другие биды пробедения досуга, телебиэор 55 53 кие шия биды щ -Другие биды пробедения досуга - другие биды пробе- оения досуга досуга транспорт транспорт - прогулки + другие Виды дения досуга + телебизор + телевизор - транспорт ЮВ Зак. 303 Рис. 14.2
14.4. ЗАКЛЮЧЕНИЕ Полученные результаты позволяют выделить два момента: 1) необходимость построения иерархий для полноты анализа разбиений; 2) важность одновременной структуризации множеств / и J. Последнее позволяет непосредственно интерпретировать разбиение множества / относительно множества У, и наоборот. ЛИТЕРАТУРА 1. Benzecri J. Р. A973) L'analyse des donnees. Tome 1, Dunod. 2. D i day E. A975) Classification automatique sequentuelle pour grands tableaux. RAIRO, 9eme annee. B-l, p. 29—61. 3. Govaert G. A975) Classification automatique et distances adaptives. These de 3eme cycle. Universite Paris VI. 4. J a m b u M. A976) Sur l'interpretation mutuelle d'une classification hierar- chique et d'une analise de correspondances. Revue de Statistique Appliquee, vol. XXIV, №2. 5. M а г г о у J. P., P e n e a u J. P. A971) Analyse des donnees et conception en architecture. Bulletin № 8 de 1'IRIA . 6. P a r e n t C. A975) Methode de caracterisation fonctionnelle des system lo- giciels. Application au cas des systemes de fichiers. These de 3eme cycle. Universite Paris VI. 7. SchroederA. A977) Etude de traces de referances de programmes: analyse de processus «a regimes». Premieres journees internationales Analyse de donnees en informatique. Versailles Sept. 77. 8. RalambondrainyH. A979) Application de Fanalyse multidimention- nell a Fetude de la charge d'un ordihateur. These de3eme cycle. Universite Paris VI.
Глава 15 • КЛАССИФИКАЦИЯ ПРИ НАЛИЧИИ ОГРАНИЧЕНИИ 15.1. ВВЕДЕНИЕ Обычно полное решение задачи классификации требует введения различных условий. Наиболее общим является задание числа классов, которое, как правило, бывает более или менее точно известно. В 15.2 задача определения числа классов сводится к определению цены создания каждого класса. В 15.3 описывается метод классификации при наличии априорных ограничений на разбиение. Этот метод похож на дискриминантный анализ. И наконец, в 15.4 рассматривается метод, который дает возможность в процессе классификации вводить ограничения на пространственное расположение элементов. Методы, позволяющие вводить в автоматическую классификацию ограничения на размеры классов [7], [1], не рассматриваются в этой главе. 15.2. МЕТОД, ИСПОЛЬЗУЮЩИЙ ЦЕНЫ СОЗДАНИЯ КЛАССОВ 15.2.1. Введение Один из возможных подходов к определению числа классов, на которые следует разбить множество Е = {хъ ..., хп}у состоит во включении в критерий цены создания класса. Таким образом, мы приходим к задаче о назначении [2], [8]. В наиболее простой форме ее можно представить как определение оптимального положения К центров L = = {у и •••> У к), обслуживающих п клиентов Е = {хъ ..., хп}, разбросанных по некоторой территории. Каждому центру t/j ставится в соответствие ej — цена его размещения. Каждому клиенту соответствует d (*ь У]) — иена прикрепления t-ro клиента к у-му центру. Если в качестве решения взять некоторое подмножество центров N a L, то цена этого решения будет состоять из — цены размещения центров tjj ? N и W2(N)~ 2 rnin{d(xi9yj)} — цены прикрепления клиентов к центрам у^. 10В* 295
Задача заключается в определении такого A/* s L, что W (N*) = TFx (#*) + W2 (N*) - min {Н^ (АО + №а JVCL Оптимальное решение всегда является компромиссом между двумя крайними решениями: 1) N = L. При этом цена W2 минимальна, но Wx достигает максимума; 2) множество N состоит из единственного центра yh который имеет минимальную цену ej. Однако при этом сильно возрастает цена №2. Поиск оптимального решения посредством полного перебора сложно реализовать, если п ^ 100, поскольку число возможных решений имеет порядок п\. Поэтому следует искать субоптимальные решения. Для этого часто используются гриди-алгоритмы* [5], [12]. Они сводят задачу к поиску пути на графе, соответствующем частям, на которые разбивается множество клиентов. Такие алгоритмы имеют сложность порядка я3. Другой подход состоит в объединении множества клиентов и множества центров. Иначе говоря, точки, в которых располагаются центры, включаются в множество точек, в которых расположены клиенты. При этом общность не ограничивается, так как для каждого возможного расположения центра можно создавать фиктивного клиента. 15.2.2. Описание метода Введем следующие обозначения: Е — множество, состоящее из элементов хи ..., хп\ d — расстояние на Е X Е\ L - {уи ..., ут) — подмножество ?, содержащее т элементов; \л — система весов на Е. В задаче о назначении Е имеет смысл множества клиентов, a L — множества центров. В дальнейшем L будет играть роль пространства представительств. Определим меру адекватности элементов SP (Е) и L следующим образом: D: L X 9>(Е)-+ R+, О(А9у)=%р(а)A(а,у) + е(у), A) где А 6 5^(?), У 6 L, е (у) — цена элемента у. Алгоритм, описанный в гл. 2, позволяет оптимизировать критерий W(P,L)='^D(PhLi), B) /= 1 где Р = (Рь ..., Рк) — разбиение Е на k классов и L = (Lb ..., Lh) — множество элементов пространства представительств L; D (Piy Lt) * Гриди-алгоритмы (greedy — жадный (англ.))— многошаговые процедуры, в которых на каждом шаге принимается решение, являющееся «самым выгодным» в данный момент, без учета того, что может произойти на последующих шагах. Для таких процедур используется также термин «алгоритмы мелкой торговли» (см.: Ковалев М. М. Дискретная оптимизация (целочисленное программирование). Минск, 1977). — Примеч. пер. 296
определяется по формуле A) при Li = {у}. Формулу B) можно представить в виде W(P,L)= или W (P, L) = 2 2 t*(x) d(x, L;)+2«(L4). C) Таким образом, критерий распадается на два слагаемых. При заданном числе классов первое слагаемое может быть минимизировано методом динамических сгущений при фиксированном числе элементов в ядрах [4]. Если цены элементов из L равны, то /= 1 и задача сводится к методу динамических сгущений, где число элементов в каждом ядре следует положить равным 1 [4], [11]. Если же предъявленные требования не удовлетворяются, то можно воспользоваться алгоритмом, который в терминах введенных понятий можно описать следующим образом. 1. Начальный шаг. Выбираются k элементов L: L = {уъ ..., yk). Выбор может быть случайным или заданным пользователем. 2. Функция назначения. Каждый элемент xt ? Е помещается в класс Pj, если d (xtj yj) минимально среди всех d (xt, yt), I = 1, ..., k. Таким образом, получается разбиение Р = (Я1э ..., Pk)y где Pj = {x?E:d (x, yj) < d (x, yi) I = 1, ..., j - 1, /+ 1, ..., ft, в случае равенства /< /}. Заметим, что на этом шаге уменьшается только первая сумма в выражении C), вторая сумма не меняется, так как она зависит только от выбора элементов из L. 3. Функция представительства. Для каждого класса Pj выбирается новый представитель Lj = {у 6 L: 2 И (х) d (ху У) + е (У) минимальна}. 4. Критерий остановки итерационного процесса. Если выполняется одно из следующих трех условий, то надо перейти к шагу 5: а) для всех классов представители не изменились; б) классы, полученные на двух последних итерациях, идентичны; в) -J L^e, где е—заданное число, а №<">—значение критерия на п-и итерации. 5. Изменение числа классов. Цена исключения элемента yj 6 L: 297
где а (х) — минимальное из расстояний между х и элементами L кроме yf. in ld(xy yt)}. Цена создания нового класса уу. где Р (л:) — расстояние между х и наиболее близким к нему элементом L: Если Tj < 0 для некоторого у, 6 L, то исключение центра */;- вызывает уменьшение критерия. Если Vj < 0 для у>? ? L и r/j g L, то уменьшения критерия можно достичь созданием нового центра yj. Итак, на этом шаге вычисляются: min{Tj}, V=-.min{V,}f U*=min(T*9V*). Если U* > 0, то ни создание новых классов, ни ликвидация уже имеющихся не могут вызвать уменьшения критерия, т. е. мы достигли локального минимума и должны прекратить работу алгоритма. Если же U* <С 0, то следует соответствующим образом изменить число классов и продолжить оптимизацию, вернувшись к шагу 2. 15.2.3. Заключение С помощью описанного метода априорное задание числа классов заменяется введением цены создания класса. Если все элементы из Е могут быть представителями классов и все представители имеют одну цену е, то метод упрощается, а критерий принимает вид Таким образом, отмена задания числа классов требует только выбора цены создания класса, и критерий является возрастающей линейной функцией от числа классов для этой цены. В работе [61 рассмотрена задача оценки стоимости создания нового класса, если требуется, чтобы критерий имел одно и то же значение для разбиения F, при котором каждый элемент множества Е образует отдельный класс, и для разбиения G, при котором все элементы попадают в один класс: W (?, F) = пе, W (?, G) = 2_ d (*. У) + е> 298
где у — элемент из ?, минимизирующий критерий 2 ^ (*> у)- При этом требование W (?, F) - W (?, G) влечет 1 Еще одно важное замечание относится к начальному шагу алгоритма. Как и в методе динамических сгущений, можно исходить из k наугад выбранных элементов, но можно задать их, взяв, например, за начальное разбиение F или G. 15.3. МЕТОД С ОГРАНИЧЕНИЯМИ НА РАЗБИЕНИЯ 15.3.1. Введение Задача состоит в определении элементов пространства представительств, позволяющих получить разбиение, близкое к заданному. Она похожа на задачу дискриминантного анализа, однако не требует оценки или определения a priori функции плотности для каждого класса. Более того, можно найти простое решающее правило, зависящее только от множества классифицируемых объектов Е и расстояния на Е X Е. Для этого необходимо определить две операции: агломерацию и раздвигание. 15.3.2. Описание метода и алгоритма Алгоритм может быть разделен на две части: в первой определяется наилучший представитель для каждого класса, а во второй проверяется, не притягивает ли этот представитель элементы, принадлежащие другим классам. Пусть Е = {х19 ..., хп} — множество, подлежащее классификации; С= {С1э ..., Ch} — разбиение ? на i классов, заданное a priori; d — расстояние на Е X Е. Пространством представительств будет само множество ?, а меру адекватности элементов №(Е) и Е определим следующим образом: D: ^(?)XL->R+, D(A,c) = 2 ji (a) d (a, c\ где А а &>(Е) и с 6 L = Е. Используемый алгоритм заключается в следующем. 1. Начальный шаг. Определяются для каждого из заданных классов Сг лучшие представители, т. е. такие элементы Ct 6 Си для которых сумма 2 ^ (ci* У) минимальна. c 2. Назначение. По представителям Ct строится разбиение Рг =-- {х е E:d (x, ct) < d (x, Cj), i = 1, ..., i — 1, i + 1, ..., k, в случае равенства i<C /}. 299
3. Представительство. Пусть Pt == Ct, т. е. класс Ct полностью восстанавливается по представителю ct. В этом случае не требуется менять представителя этого класса. Если же Pt a Ciy т. е. некоторые элементы Ct не вошли в Piy то следует определить нового представителя, при котором на следующей итерации была бы сделана попытка собрать неправильно классифицированные элементы (элементы Сг fl ^ь где Pt = Е — Pi). Ищется элемент х 6 Ри такой, чтобы величина 2 d (xy у) принимала минимальное значение. Этот этап алгорит- у*ес. n pf ма в данном случае представляет собой этап «агломерации». Если Рг ф Сг-, то следует рассмотреть три множества: Pt fl Ct —множество элементов из Сь удачно классифицированных на этом шаге; Pt fl Ct — множество элементов из С*, ошибочно классифицированных; Pi fl Ct — множество элементов других классов, попавших в этот класс. Задача состоит в определении элемента из Pt fl С*, который позволил бы на следующей итерации разбросать по другим классам элементы из Pt fl Ct и собрать в Рг элементы из Рг fl Ct» Таким образом, в данном случае добавляется этап «раздвигания», цель которого найти элемент х 6 Pi fl Ct, такой, что величина S J (х, у) принимает максимальное значение. 4. Критерий остановки. Производится проверка: если множество представителей изменилось, то осуществляется переход к шагу B), иначе работа алгоритма прекращается. Замечание. Существуют и другие способы начала работы алгоритма, кроме описанного на шаге 1. В качестве представителя класса С* можно, например, взять элемент, наиболее удаленный от всех других классов, т. е. ct 6 Cj, такой, что сумма 2 d (cti у) принимает мак- I/GC. симальное значение. Или же можно методом динамического программирования выявить наиболее удаленные друг от друга элементы (clf ..., ci? ..., ck) и взять их в качестве представителей, т. е. такие элементы, что 2 d(shsj)< ^ <UPuci) (si>sj) (ci>cj) для каждого набора (sly ..., siy ..., sfe), где st 6 Q- Этот метод можно применять к различным расстояниям для того, чтобы определить расстояние и набор соответствующих представителей, порождающих разбиение, наиболее близкое к заданному. 15.3.3. Применение классификации с ограничениями на разбиения Пусть дано 26 букв латинского алфавита и 10 цифр. Каждому символу соответствует несколько характеристик (написаний). Цель анализа состоит в том, чтобы для каждого символа определить написа- 300
ние, представляющее его наилучшим образом и достаточно сильно- отличающееся от написаний других букв. Определенный таким образом набор написаний позволяет лучше распознавать новые написания. Множество таких характеристик было найдено (см. [13]), Анализ может быть разделен на две части. В первой части производится описание, цель которого определить существенные черты, позволяющие различать семейства написаний. При этом каждому написанию ставится в соответствие описательный вектор. Поскольку на следующем этапе будут применяться методы многомерного анализа, необходимо, чтобы описывающие переменные (координаты описательного вектора) были однотипными. Для получения количественных описывающих переменных можно воспользоваться методами оцифровки. Затем с помощью факторного анализа соответствий можно будет изучить связи между множеством выбранных количественных переменных и множеством написаний. Такой подход позволяет геометрически визуализировать соотношения между написаниями и переменными б метрике %2. Вопросы метрики %2 и ее адекватности этой задачи рассмотрены в работе [11]. Вторая часть анализа заключается в классификации и дискриминации. Ищется простое правило, решающее вопрос о соответствии написания одному из символов. Здесь можно использовать классические методы, например линейный дискриминантный анализ или метод ближайшего соседа. Ни один из этих методов не позволяет отобрать новый набор характеристик. Однако дискриминантный анализ дает возможность оценить силу дискриминации данного набора характеристик. Например, выбрав дискриминантную функцию d и набор написаний (съ ..., с*, ..., ?3бJ6букв и 10 цифр, можно построить разбиение Р по следующему правилу: Pi - {х 6 Е: d (x, ct) < d (х, cj), f=l,..., 36, D) /= 1, ..., i—1, i + l, ..., 36}, где Е — множество написаний, a Pt — класс, соответствующий i-щ символу. 36 таких классов составляют разбиение Р. Дискриминант- ная способность набора (съ ..., ciy ..., с36) определяется как число (или процент) ошибочно классифицированных элементов разбиения Р. При таком определении решающего правила имеются два пути улучшения дискриминантной способности: модификация дискрими- нантной функции d или изменение набора характеристик [9]. Была проведено изучение различных дискриминантных функций. Если можно менять весовые коэффициенты, то для заданного набора написаний можно оптимизировать d как функцию от обучающей выборки. Определение оптимального набора написаний осуществляется с помощью итерационной процедуры с ограничениями на разбиения. Эта процедура состоит из двух шагов. На первом шаге по имеющемуся набору написаний и выбранному решающему правилу строится разбиение D). Второй шаг заключается в выборе нового набора написаний из полученного разбиения. Для каждого символа i существует 30)
множество ошибочно классифицированных его написаний, а также множество написаний других символов, попавших в класс Рг. Пусть Ct составлено из написаний t-ro символа. Это множество является объединением подмножеств Сг- П ^г и Ct П Л- Для каждого символа i требуется найти представителя, который попытался бы на первом шаге следующей итерации собрать соответствующие ошибочно классифицированные элементы из С, (] Pt и в то же время который был бы достаточно далек от элементов из Ct fl Pi- Пусть, например, для х 6 Ct показателем агрегирования элементов из Ct f| Pi будет а показателем отклонения от элементов из С* П Pi будет g(x)= % d(x,z). Задача сводится к определению х 6 Сь минимизирующего / (х) и максимизирующего g (x). Как правило, оптимальные решения для этих двух функций достигаются на двух различных элементах. Приходится искать компромисс. Этот компромисс выражается в задании весовых коэффициентов для функций / и g и выборе в качестве оптимизируемого критерия взвешенной суммы этих функций. /77 Й2 ИЗ ЙЬ Рис. 15.1 Описанный выше метод был применен для анализа 121 вида написаний, получаемых на устройстве точечной печати, например буква А может быть представлена четырьмя написаниями (рис. 15.1). G/ 62 G3 G5 G6 G7 G8 G9 Рис. 15.2 Для буквы G возможны 9 представлений (рис. 15.2). После того как были выполнены все шаги алгоритма, 105 написаний из 121 были правильно классифицированы. 302
15.4. КЛАССИФИКАЦИЯ С ОГРАНИЧЕНИЯМИ В ВИДЕ ГРАФА СВЯЗЕЙ 15.4.1. Введение Пусть Е — множество, состоящее из п элементов, которые требуется разбить на классы; d — расстояние на Е X Е. Будем считать, что VX у 6 Е O^d (ху у) ^ 1. \i—система весов на Е. Пусть G = (?, U) — граф, задаваемый таблицей инцидентности Q с элементами q (х, у) - 1, если (*, у) 6 U cz E X ?, q (х, у) = 0 в противном случае. Граф G описывает пространственную близость элементов из Е. Близким элементам х и у соответствует q (х, у) = 1, далеким — q(x, у) = 0. Разброс класса С cz E обычно измеряется величиной 2 (xt C Введение пространственных ограничений позволяет переопределить меру разброса класса. Теперь его надо измерять величиной 2 H-q(x,y)]dix,y). (х, t/)?CxC Таким образом, на класс С накладывается штраф 2d (jc, у), если его элементы х и у не являются «соседями». В случае, когда критерий соседства не симметричен, имеются три возможности: если q (х, у) = q (у, х) = 0, то вклад в величину внутриклассового разброса равен 2d (xy у)у когда точки х и у взаимно далекие; если q (ху у) = 0, a q {у, х) = 1 или наоборот, то внутриклассовый разброс изменяется на d (x, у)\ если q (х9 у) = q (у, х) = 1, то такие точки являются взаимно соседними, и их вклад в величину разброса равен нулю. Однако введенная мера разброса класса С не учитывает следующей ситуации: точка х является соседней для у (т. е. q (у, х) = 1), но х и у попали в разные классы. Необходимо накладывать в таком случае дополнительный штраф вида 2 q(x9y)\\—d(x, у)], гдеС = ?-С. {х, у)^СхС Общий разброс k классов (Р1э..., Я&) разбиения Р зависит от расстояния d и матрицы инцидентности Q и может быть измерен следующим критерием: «2 2 2 [1-?<*.*)]<*(*.») + -«) 2 где а 6 [0, 1]. Здесь а — весовой коэффициент. 303 2 2 ^.y)n-d(*.y)]. E)
15.4.2. Изучение влияния весового множителя а Если а = 1, то ИГ (Я) =2 2 2 11-Я(х>У)]<1(х,у). i=l x<=P. ytEPt Одним из оптимальных решений является разбиение F, при котором каждый элемент множества Е образует отдельный класс: W (F) = 0. Если а — 0, то ^(f)=I12 H 9(x,y)[l-d(x,y)], и одним из решений является разбиение G, при котором все элементы из Е попадают в один класс: W (G) = 0. Если а ? ] 0, 1 [, то ни одно из описанных выше двух разбиений не обязано быть оптимальным. Например, при а = - W(P) = -j 2 I Zld(x,y)-q(xfy)], -а для некоторого а 2 2 2 2 2 taB?(*¦ »)d (^ у)-я(x> y)~d (x> у)+ + (\-q(x,y))d(d,y)]. Значение a можно определить, потребовав W (F) = W (G): 2 q(x,y)[l-d(x,y)], (x, W( A A + B , где A = (x. 1 Y ft) X s S [1 — </(*, У)]^ y)[l-d(x, (л, У), У)) откуда a = — цена, соответствующая соседним элементам (q (jc, у) = 1), и 5- 2 ll-q(x9y)]d(x,y) (х, )ЕхЕ — цена, соответствующая далеким элементам (q (jc, у) = 0). 304
15.4.3. Цена перегруппировки двух элементов а) Цена перегруппировки двух соседних элементов х и у при q (х, у) = 1 равна еа (х, у) = а Ы (х, у) — 1] < 0. б) Цена перегруппировки двух далеких элементов х, у, когда Я (ху У) = 0» имеет вид еа (х, у) = A — a) d (х, у) ^ 0. в) Если элементы х и у не перегруппировываются, то ?а (х, у) = 0. Зависимость цены перегруппировки еа (х, у) от элементов матрицы Q можно свести в следующую таблицу: q(x, y)=0 х?С У^С <о 0 0 Цена перегруппировки пары (х9 у) равна: ?а {х, У) = еа (х, у) + еа {у, х), и возможны следующие случаи: а) если х и у не принадлежат одному классу, то еа (х, у) ¦¦= 0; б) если х и у перегруппированы, то 1) 9 (*f У) = 9 (У> х) = Ь Т0ГДа ва (х, у) = 2а [d (х, у) — И < 0; 2) (/ (х, y) = q (у, х) = 0; еа (х, у) = 2 A — a) d (х, у) > 0; 3) ^ (х, у) = 1, a q (у, х) -0 или q (х, у) = .0, а ^ (у, х) = 1, в этом случае еа (х, у) = d (x, у) — а. Знак последнего выражения зависит от а. Например, если 1 card(?x?) то еа (х, у) отрицательна при d (x, S S <*(*, d. 15.4.4. Метод и алгоритм Критерий можно выразить в виде функции от цены перегруппировки еа(х, у): F) где Я = (Ри ..., РЛ) — разбиение на k классов, а К — постоянная величина. Метод ядерных разбиений (см. [10] и гл. 2) позволяет оптимизировать критерий, похожий на F). В данном случае пространством представительств L является множество Зд(Е) всех подмножеств 305
множества Е. Мера адекватности, определенная на элементах из &(Е) X ,Ф(Е), имеет вид D(A, L)= 2 2 М*. у), 4 где А 6 55(?"), a L 6 L = ^(Е). При этом F) принимает вид V(P,Q)«S 2 2 *«(*. у), G) где Q == (Qx, ..., Qfe). Когда в итоге сходимости алгоритма Р = Q, критерий G) с точностью до постоянной эквивалентен критерию E). 15.4.5. Применение классификации с ограничениями в виде графа связей Описанный метод может оказаться полезным при применении метода k ближайших соседей, а также метода автоматической классификации, минимизирующего критерий, зависящий от инерции. Метод k ближайших соседей позволяет построить следующую матрицу инцидентности графа: q (х, у) — 1, если у — один из k ближайших соседей х, иначе q (х> у) =;= 0. При этом 2 Q (х> У) ~ * ^х 6 Е. Два элемен- та х я у взаимно являются соседями, когда q (х, у) — q (у, х) = 1. Если потребовать q (х, у) == 1 в этом случае и ^ (ху у) = 0 в противном случае, то получится симметричная таблица Q, к которой можно применить описанный метод. Таким образом, разбиение, полученное исходя из связных компонент графа, соответствующего таблице Q, является решением, оптимальным в смысле критерия E). Поиск разбиения, число классов которого превышает число связных компонент графа, определенного матрицей Q, может быть только компромиссом между штрафом за исключение ветвей графа и выигрышем от создания новых классов в смысле критерия, зависящего,от критерия инерции, отвечающего расстоянию d. В этом случае можно найти локально-оптимальное решение. ЛИТЕРАТУРА 1. А с h а г d М. $., Ва bonne аи J, Y., LechevallierY., Moris- set G,, М о и n a j e d В, A977) Reconnaissanse de la structure et adaption des programmes аи milieu pagine a l'aide d'algorithmes de classification hie- rarchique, Colloque IRIA, Versailles, p. 109—119. 2. С о о p e r L, A972) The transportation location problem. Operations Research, vol. 20, № 1, p. 94—108, 3. CooperL. A964) Heuristic methods for location Allocation problems. S. I. A. M., Review, vol. 6, p. 37—53. 4. D i d а у Е, A972) Nouvelles methodes et nouveaux concepts en classification automatique et reconnaissances des formes. These d'Etat, Paris VI. 6. DunstanF. D,J.,WelshD.J. A. A973) A greedy algorithm for solving a certain class of linear programmes. Mathematical programming, 5, p. 338— 353. 306
6. DeFalguerolles A. A977) Classification automatique: un critere et des algorithmes d'echange. Seminaires IRIA. 7. KuenneR. E., SolandR. M. A972) Exact and approximate solutions to the multisource Weber problem. Mathematical programming, 3, p. 193— 209. 9. К w a n С. С A977) A study of the selection and recognision of handprinted characters. Thesis in Dept. Computer Sciences. Concordia University. Montreal (Canada). 10. L e с h e v a 1 1 i e г Y. A974) Optimisation de quelque criteres en classification automatique. These 3 cycle, Paris VI. 11. LechevallierY., SuenC. C. A978) Choix d'un jen de caractere mo- deles en vue de la reconnaissance, par des methodes de classification. Congres AFCET, IRIA, Reconnaissance des formes. 12. M i n о u x M. A977) Algorithmes gloutons et algorithmes gloutons acceleres pour la resolution de grand problemes combinatoires. Bulletin de l'EDF, serie C, № 1, p. 41-58. 13. S u e n С C, S h i n g h a i R. A977) Assessment of handprint quality based on dispertion measurements. IFIP Congress. 14. SuenC C.,ShiauR.,Shinghal R., К w a n С. С A976) Reliable recognision of hand printed characters. Proceedings of joints workship on Pattern Recognision and Artificial Intelligence.
Глава 16 • АДАПТИВНЫЕ УЛЬТРАМЕТРИКИ И ПОИСК ОПТИМАЛЬНОЙ ИЕРАРХИИ 16.1. ВВЕДЕНИЕ В настоящей главе преследуются две цели. Первая цель заключается в том, чтобы найти для данного множества объектов Е k локально- оптимальных в смысле некоторого критерия иерархических структур. Минимизация критерия сводится к нахождению минимума суммы расстояний от всех точек, принадлежащих некоторому классу, до представителя этого класса (расстояние берется из семейства допустимых ультраметрик). При этом ищется не одна оптимальная на всем Е иерархия, а разбиение множества Е на k классов, каждому из которых соответствует локально-оптимальная иерархия. Практический интерес этого подхода заключается в том, что он позволяет обрабатывать таблицы, состоящие из нескольких множеств объектов, выдавая в качестве результата заданное число локально-оптимальных в смысле некоторого критерия иерархий. Более того, каждая из иерархий оказывается сгруппированной вокруг некоторого объекта (ядра), определяемого апостериори в ходе работы алгоритма. В качестве примера содержательной задачи подобного типа можно рассмотреть следующую ситуацию. Пусть каждая коммуна Франции характеризуется некоторым набором переменных. Требуется разбить множество коммун на k иерархий, оптимизирующих заданный критерий, которые были бы сконцентрированы вокруг некоторых коммун, подлежащих определению. Вторая цель заключается в том, чтобы найти на множестве Е иерархию, для которой сумма инерции составляющих ее классов была бы минимальной. В настоящий момент имеется несколько различных алгоритмов (например, метод УардаШ), предназначенных для определения иерархий, минимизирующих этот критерий; но иерархии, получающиеся в результате их работы, иногда бывают далекими от оптимальных. Практический интерес предлагаемого подхода в том, что он позволяет улучшить иерархию в смысле глобального критерия, связанного с принципом ее построения. В рассмотренном здесь случае задача сводится к минимизации центрального момента второго порядка. 16.2. АДАПТИВНЫЕ УЛЬТРАМЕТРИКИ 16.2.1. Постановка задачи Попытаемся поставить в соответствие каждой части множества Е адаптирующуюся к ней меру сходства. В отличие от гл. 12 это будет ультраметрика, а не квадратичная функция. Ниже будет определен 308
алгоритм, с помощью которого осуществляется оптимальное разбиение множества Е. Критерий оптимальности зависит от различных ультраметрик, соответствующих классам разбиения. 16.2.2. Формализация задачи 16.2.2.1. Ультраметрика на множестве Е Ультраметрикой, определенной на множестве ?, называется всякое отображение d множества Е X Е в R+, которое удовлетворяет следующим условиям: 1) V (х, у) е Е X Е d (х, у) ¦-= О 44 х ¦¦= у; 2) V (х, у, z) ? Е X Е X Е d (ху у) < max {d (x, z), d (z, у)}; 3) V (x, у) б ? X Е d (х, у) - d (у, х). 16.2.2.2. Представитель подмножества относительно ультраметрики Представителем подмножества В ? Е относительно некоторой ультраметрики d называется такой элемент х^> ? ?, что / (В, d).= Ц d (x, x^)) - min 2 d (x, у). 16.2.2.3. Пространство покрытий и пространство представительств Обозначим через Pk множество разбиений Е на k классов и будем называть его пространством покрытий. Пусть L = (Е X SDE)k —пространство представительств, где 3)Е — множество ультраметрик, определенных на Е. 16.2.2.4. Критерий Введем критерий W, отображающий Pk X L в R+: где Р - (Р1У ..., Pk) б Pfe и L = ((аь rfx), ..., (afc> dft)) 6 L. 16.2.2.5. Задача оптимизации Требуется найти Р* 6 Pfe и L* f L, такие, чтобы выражение A) обратилось в минимум. В 16.2.3.1 будет показано, что вместо L* можно искать набор ультраметрик d* = (d*y ..., d%)> такой, что W (P*, d*) - min W (P, d), B> PePfe где t (P, d) = 2 7 (рь d^)^ d = №' — 4) и d, 6 25 С 2)е. 309
16.2.3. Алгоритм 16.2.3.1. Функция представительства Для того чтобы определить функцию представительства g, введем два отображения: h и g±. Первое действует из Pk в 3)k и каждому элементу Р = (Рг, ..., Pk) б Pft ставит в соответствие h (Р) = (dlt ..., dfc) 6 Ж*, причем Vy 6 Л-, i = 1, 2, ..., /г 2 t(x, у) =тт 2 d В работе [5] доказывается существование такого отображения для частного случая, когда %) содержит ультраметрики, соответствующие множеству деревьев, определенных на Е. Отображение g1 действует из Pk X $jk в (Е X 3j)k, ставя при этом каждой паре (Р, d) в соответствие элемент L* 6 L, такой, что W(P, L*) = minH7(P, I), k где I = Замечание. Получается, что (а*, ..., aj) — не что иное, как D\> ..., xfy, где d = (dlf ..., dh), если (а|, ..., d%) ?PXX ... X />ft. При этом пара (Р*, L*) будет решением задачи оптимизации критерия A) тогда и только тогда, когда критерий B) достигает минимума. Две задачи, сформулированные выше, эквивалентны, так как они дают одно и то же оптимальное разбиение. Функция представительства g является отображением пространства Pk в L и каждому Я?РЛ ставит в соответствие gt (P, h (P)). 16.2.3.2. Функция назначения Функцией назначения / называется всякое отображение L в РЛ, которое каждому L ? L ставит в соответствие такое разбиение Р 6 Рл» при котором величина W (P, L) принимает наименьшее значение. 16.2.3.3. Сходимость алгоритма При условии существования функций / и g можно исходя из некоторого разбиения Р<°> 6 Рь построить последовательность Vn = (P(rt), I»), такую, что V л € N* />> = g (P<«>), ?(«+*) =± / (!<«)). Теперь легко доказать следующую теорему. Теорема 1. Последовательность ип = U^ (t^rt) убывает. 310
Доказательство. В самом деле, по построению vn < W (/><">, lw) < W где, если L<"> = ((a(»>, d<»>), .... (a^>, d?»>)), to~L <«> = ((«<">, d<"+'>), ... 16.2.4. Примеры применения МДС с использованием адаптивных ультраметрик 16.2.4.1. Деревья Пусть на Е определено множество деревьев и введена мера сходства d. Это позволяет каждому дереву А = (?, V) поставить в соответствие ультраметрику йл [5]. При этом Ж является множеством всех таких ультраметрик dU- Функции/ и g определяются в работе [5]. Отображение h в этом случае характерно тем, что при Р ? Р& образ разбиения /i (Р) = (dl9 ..., d^), такой, что для всех i = 1, ..., k dt является максимальной субдоминантной ультраметрикой, определенной на ?*. Замечание. Один из недостатков описанного в 16.1.3 алгоритма заключается в том, что для рассматриваемого случая он требует вычисления максимальной субдоминантной ультраметрики на множестве Е. Поэтому рассматриваемый алгоритм можно применять лишь к небольшим множествам данных. В работе [11] для решения данной задачи используется другой алгоритм. Он не требует вычисления и запоминания максимальной субдоминантной ультраметрики, поэтому освобождается память для обработки больших массивов данных и сокращается время работы алгоритма. 16.2.4.2. Дихотомические иерархии Пусть, как и прежде, на множестве Е введена мера сходства d, а на 9>(Е) — мера dmln, такая, что V (Л, В) ?& (Е) X &(Е), dm\n (Л, В) = min d {x> у) (минимальное расстояние). (х, у) е АхВ Каждой иерархии Н дихотомического разбиения множества Е поставим в соответствие ультраметрику d#> определенную на Е. Тогда множество 3) будет состоять из всех таких ультраметрик. Подробно этот пример рассматривается в работе [5]. Обратим внимание лишь на то, что отображение h имеет тот же вид, что и в предыдущем примере, и замечание о недостатках алгоритма также сохраняет силу. *Пусть на множестве Е выбран некоторый показатель различия б. Субдоминантной ультраметрикой d§ называется верхняя граница множества {d : <*€ 6 ®в и V*, у$Е X Е d(xty)^b (*, у)}. — Примеч. ред. ЗП
16.2.4.3. Пример с искусственными данными Талица данных Номер точки 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 Компоненты 36,510 15,480 35,340 15,960 33,700 21,510 33,150 23,220 32,600 24,660 32,050 26,710 30,960 28,360 30,140 29,380 29,110 30,680 28,010 32,190 26,440 31,990 25,000 31,370 23,770 30,410 23,010 28,630 21,920 27,600 Номер точки 16 17 18 19 20 21 22 23 24 25 26 27 28 29 Компоненты 21,160 26,160 19,660 23,560 19,180 22,050 20,550 21,030 22,260 20,070 21,780 18,770 21,100 19,380 21,920 17,190 20,680 16,160 19,660 14,930 18,490 14,040 17,190 12,810 16,030 11,580 14,930 10,550 Исходные ядра были взяты наугад: точки с номерами 10 и 15. Разбиение, полученное по начальным ядрам, приводится на рис. 16.1. 1 1 г 2 Рис. 16.1 Рис. 16.2 Единицам соответствуют точки, попавшие в первый класс, а двойкам— во второй. Окончательное разбиение изображено на рис. 16.2. Полученные ядра обведены кружками. Если при разбиении на два клас- 312
са пренебречь самой большой ветвью дерева минимальной длины*, то один из классов будет состоять только из двух точек, помеченных стрелками. Окончательный результат Требуемое число классов 2 Класс номер 1 Число элементов 13 Элементы 17 18 14 20 21 22 23 24 25 26 27 28 29 Дерево на множестве точек Начало 17 18 19 22 22 21 23 24 25 26 27 28 Конец 18 19 22 21 20 23 24 25 26 27 28 29 Длина 1,384 1,708 1,739 0,914 1,350 1,586 1,612 1,598 1,470 1,790 1,691 1,507 Ядром является точка с номером 22 Класс номер 2 Число элементов 16 Элементы 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 Дерево на множестве точек Начало 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 Конец 2 3 4 5 6 7 8 9 10 И 12 13 14 15 16 Длина 1,265 5,787 1,796 1,541 2,123 1,978 1,309 1,659 1,868 1,583 1,568 1,560 1,935 1,500 1,628 Ядром является точка с номером 12 Значение критерия 55,313 На рис. 16.3, 16.4 приводится иерархия на множестве ? и ее разбиение. *Длиной дерева (?, А), где А — система подмножеств Е, называется S 6 (#, у); 6—показатель различия, выбранный на множестве Е.—При- (х, у)<=АхА меч. ред. 313
п П 1 2 6 3 4 5 7 8 9 Ю И 12 13 14 15 16 23 20 22 21 24 25 26 17 18 W 27 28 29 Рис. 16.3. Иерархия, соответствующая дереву минимальной длины на Е Пербая иерархия 1 п 1 п 1 Пп 1 г А... 1 6 4 5 3 7 8 9 10 11 12 13 /4 15 16 23 20 22 21 24 25 26 17 18 19 27 28 29 Вторая иерархия 1 2 Рис. 16.4. Иерархии, полученные при разбиении дерева минимальной длины п 1 1 1 г ДА i 1 2 6 3 4 5 7 8 9 10 11 12 13 14 15 16 23 20 22 21 24 25 2617 1819 27 28 29 Рис. 16,5. Иерархия, соответствующая дереву Л, разделенному программой на А% и Лэ 314
о. п П 1 Г 1 I 2 6 3 4 5 7 в 9 10 11 12 13 1U 15 1L- Первая иерархия 23 20 22 21 24- 25 26 17 18 19 27 28 2$ Вторая иерархия Рис. 16.6. Иерархии, соответствующие деревьям Л4 и Л2, полученные в результате работы программы На рис. 16.5, 16.6 приводится иерархия Л, составленная из иерархий полученных классов, и ее разбиение на Ах и Л2. 16.2.5. Заключение Мы показали, как можно применять метод динамических сгущений для нахождения разбиений, каждому классу которых можно поставить в соответствие некоторую оптимальную иерархическую структуру (ультраметрику). Другой подход к этой задаче представлен в [5]. Наш подход обладает теми преимуществами, что позволяет (как мы надеемся) обрабатывать большие массивы данных за время, пропорциональное я3, при используемой памяти, пропорциональной я2, где п — число элементов множества Е. 16.3. АЛГОРИТМ ПОИСКА ОПТИМАЛЬНОЙ ИЕРАРХИИ 16.3.1. Постановка задачи Методы восходящей иерархической автоматической классификации предназначены для определения на всяком конечном множестве объектов Е cz Rm иерархии частей этого множества, иначе говоря, такого разбиения Е, чтобы одни классы включали в себя другие. В этом параграфе мы рассмотрим дихотомические иерархии, определенные на ? и оптимальные в том смысле, что сумма инерции всех составляющих их классов минимальна. Будем предполагать, что на множестве Е введена квадратичная метрика d. Методы иерархической автоматической классификации (как, например, метод Уарда) таковы, что в большинстве случаев полученные с их помощью иерархии не являются оптимальными. Мы предложим алгоритм, позволяющий улучшить эти методы. 315
16.3.2. Формализация задачи 16.3.2.1 Дихотомическая иерархия на Е Дихотомической иерархией, определенной на множестве ?, называется такое множество Я, состоящее из подмножеств Е, что 1) V х б Я, {*} 6 Я, 2) ? € #, 0 3) 4) V5e#card(?)> 1=>-Я(В, §) € # хН : Вф В и (Первые три условия определяют просто иерархию, четвертое является условием ее дихотомичности.) Обозначим Н множество всех дихотомических иерархий на Е. Будем далее предполагать, что на множестве Е введено квадратичное расстояние d. 16.3.2.2. Инерция подмножества Инерцией множества В а Е называется величина / (Я) = S d2 (х, хв), где хв — центр тяжести В. Теперь можно поставить задачу следующим образом: требуется найти такую иерархию Я* 6 Н, чтобы величина КБ) достигала минимального значения. 16.3.2.3. Пространство покрытий и пространство представительств Пространством покрытий является множество дихотомических иерархий на Е. Мощность каждого элемента Н равна: пг = -„ 2 card (Е) — 1. Соответствующим пространством представительств будет L = (Rn)ni. 16.3.2.4. Оптимизируемый критерий Критерием является такое отображение W: Н X L->R+, что где Я- {B,:i --1, ... //,}, / (Л;:/-!,... пх). 3N
16.3.2.5. Задача оптимизации Таким образом, требуется найти Я* ? Н и L* ? L, такие, что № (Я*, ?*) - min W (Я, L). #Н В работе [51 доказывается, что такое определение оптимальной иерархии эквивалентно приведенному выше. 16.3.3. Алгоритм 16.3.3.1. Функция представительства Функцией представительства g называется отображение Н в L, ставящее элементу Я в соответствие g (Я) = L, причем W (Я, g (Я)) = min W (Я, I). LEL Замечание. Если Я = {5г: i = 1, ..., лх}, то g (Я) = {G (Вг), * = 1, ..., пг}, где G (Bt) — центр тяжести множества Bt. 16.3.3.2. Функция назначения Множество Су = {В : В ? Я и у ? В} называется ^е/гью иерархии Я, проходящей через элемент у. Пусть Я { 1" (х, у)еЕхЕи Су\ Расстоянием от элемента х ? Е до цепи Су иерархии Я, относительно L 6 L называется величина Иерархией относительно тройки (х, у, Н) ^ Е X Е X И называется иерархия Я, полученная в результате следующих операций: 1) вычитания х из элементов Сх — Су П Сх, отличных от {х} и Ву где В — элемент Я минимальной мощности, строго содержащий* X] 2) прибавления х ко всем элементам Су — Сх f| С/, 3) замены б на {у}. Пронумеруем все элементы множества Е: хъ ..., хN. Функцией назначения f называется всякое отображение Н X L->H, при котором / (Я, L) ^ Я, если для любой пары (я, у) 6J: X Е dL (я, Су) ^ >: d/, (а:, Сх) и в противном случае / (Я, L) = Я, где Я — иерархия относительно тройки (хи уи Я), в которой х% ? Е — элемент с наименьшим индексом, при котором min dL (хи Су) < dL (xif Cx)> у s к * Говорят, что элемент И строго содержит х, если он содержит не только х. 317
a tji 6 Е — такой элемент, что d {хи у г) = min d (xiy у). 16.3.3.3. Алгоритм Теперь, имея некоторую иерархию #<°> ? Н, можно построить последовательность vn = (#<n>, Ил>), где Этой последовательности будет соответствовать последовательность значений критерия В работе [5] доказывается теорема о том, что последовательность (ип) убывает и сходится. Замечание. В работах, посвященных рассматриваемой теме, найдены функции назначения /, которые лучше, чем только что определенная нами функция, поскольку при их использовании алгоритм сходится в более разнообразных ситуациях. 16.4. ЗАКЛЮЧЕНИЕ В этой главе были определены два типа алгоритмов. Первый предназначен для нахождения локально-оптимальной структуры на Е, второй — для нахождения на множестве Е иерархии, у которой сумма инерции классов минимальна. Мы думаем, что поиск k оптимальных структур с введенными на них ультраметриками может быть полезен при анализе больших таблиц данных. Надеемся, что это сделает интерпретацию иерархических структур менее трудоемкой, чем при применении классических методов. ЛИТЕРАТУРА 1. Ward J. Н. A963) Hierarchial grouping to optimize an objective function. JASA, vol. 58. 2. R о h 1 f A970) Adaptive hierarchial clustering schemes. Systematic Zoology, vol. 19, p. 58—82. 3. Caillez, Pages A976) Introduction а Г analyse des donnees. SMASH Ed. 4. J a m b u M. A979) Classification automatique pour Г analyse des donnees. Dunod. л 5. С h i f f 1 ё t A979) Structures hierarchiques locales optimales. These de 3 cycle. Paris IX Dauphine. 6. В e r g e s A968) Graphes et hypergraphes. Dunod. 7. Cormack A971) A review of classification. J. Royal Statistic Society, se- rie A. 134, p. 321—367. 318
Глава 17 • ПРИМЕНЕНИЕ МЕТОДА ДИНАМИЧЕСКИХ СГУЩЕНИЙ К ИНФОРМАЦИОННЫМ СИСТЕМАМ: РЕСТРУКТУРИЗАЦИЯ ПРОГРАММ И БИБЛИОТЕК 17.1. ВВЕДЕНИЕ В этой главе описывается применение алгоритмов автоматической классификации к информационным системам. Такая работа была осуществлена в рамках проекта «Опал» под руководством М. Бабонно (Национальный институт исследований по информатике и автоматике, отдел «Laboria»). Изучалась проблема редактирования связей в системах. В результате был создан редактор связей [4], [6]. Для облегчения понимания уточним рассматриваемые задачи. Как для реструктуризации программ, так и для реструктуризации библиотек требовалось уменьшить число обменов информацией между оперативной памятью и внешними запоминающими устройствами ЭВМ*. При этом, с одной стороны, сокращается время работы, а с другой — время ожидания пока идет обмен. 17.2. РЕСТРУКТУРИЗАЦИЯ ПРОГРАММ Первая из обсуждаемых задач состоит в реструктуризации программ с тем, чтобы они выполнялись при использовании минимального числа страниц памяти (страница — количество информации, передаваемое из оперативной памяти во внешнюю или, наоборот, при однократном обмене). Дело в том, что в процессе работы программы лишь часть ее находится в оперативной памяти. Рассмотрим, что происходит, когда программа требует некоторую информацию, находящуюся на внешних запоминающих устройствах (на магнитном диске). Во-первых, на магнитный диск помещается некоторая страница из оперативной памяти, при этом сохраняется определенный порядок страниц, на которых хранится программа (задача выбора страницы решается алгоритмом замены страниц). Затем на освободившееся место вызывается искомая страница. Это дорогостоящий процесс, и очевидна необхо- *Имеется в виду ЭВМ с виртуальной организацией памяти. В литературе отражены и другие подходы к анализу подобных задач. В книге У. Гренандера и В. Фрайбергера «Краткий курс вычислительной вероятности и статистики» (М., 1978, § 4.4) используется, например, аппарат цепей Маркова. — Примеч. ред. 319
димость минимизации числа таких операций. Одним из возможных способов уменьшения числа обменов информацией является такая реструктуризация программ, при которой сильно связанные разделы размещаются на одной странице. Это возможно, поскольку, как правило, программа состоит из логически замкнутых секций, их размеры значительно меньше величины страницы. Поэтому при редакции связей должен быть определен порядок размещения таких секций с целью уменьшения числа связей между страницами или группами страниц. В результате будет уменьшено число обменов информацией. 17.3. РЕСТРУКТУРИЗАЦИЯ БИБЛИОТЕК Вторая проблема состоит в реструктуризации блиблиотек редактирующих подпрограмм. Такие подпрограммы (модули) используются при преобразовании программ, которые могут быть написаны на большинстве из существующих языков программирования, в программы на языке машины. Редактирующие модули располагаются в определенном порядке на внешних запоминающих устройствах. Как правило, каждый раз лишь некоторое подмножество редактирующих модулей вызывается в оперативную память. Величина обмениваемой информации постоянна и называется квантом. Задача состоит в реструктуризации библиотеки, расположенной на магнитном диске, с целью минимизации числа обменов информацией. Для этого модули, которые статистически наиболее часто вызываются вместе, должны быть размещены в одном кванте. Это возможно, так как обычно размеры кванта значительно превосходят размеры модуля. Можно сказать, что цель реструктуризации заключается в максимизации отношения суммарный размер используемых подпрограмм (размеры кванта) X (число обмениваемых квантов) 17.4. ПРИМЕНЕНИЕ АЛГОРИТМОВ АВТОМАТИЧЕСКОЙ КЛАССИФИКАЦИИ Алгоритмы автоматической классификации применялись для решения двух проблем: 1) уменьшения числа страниц памяти, требуемого при выполнении программы; 2) минимизации числа обменов информацией при использовании библиотеки подпрограмм. В обоих случаях необходимы характеристики поведения программы или библиотеки. С одной стороны, во время создания программы или библиотеки нельзя предсказать, как они будут себя вести. С другой стороны, их поведение стабильно, т. е. значения характеристик в определенный промежуток времени говорит о поведении вообще. Эти характеристики хранятся в виде матриц обмена М (п, п), где п — количество секций или модулей. В первом случае элемент этой 320
матрицы т (i, f) равен числу вызовов t-й секции /-й за фиксированный промежуток времени. При реструктуризации библиотек т (i, j) равно количеству одновременных вызовов 1-го и /-го модулей. Применялись два алгоритма — динамических сгущений и иерархической классификации. 17.4.1. Применение алгоритма динамических сгущений Алгоритм динамических сгущений использует матрицу расстояний, тогда как в нашем распоряжении есть только матрица обмена М. В качестве расстояния возьмем величину, обратную т (/, /). Главная сложность заключается в необходимости априорного определения числа классов (сегментов). Уже нельзя определять размеры сегментов из условия наиболее полного заполнения страниц, т.е. чтобы минимизировать потери памяти в конце каждой страницы. Тем не менее удавалось получать хорошие результаты как для первой, так и для второй задачи [5]. Мы еще не пробовали применять мультикритериальную классификацию (см. гл. 3), которая кажется более уместной. 17.4.2. Применение алгоритмов иерархической классификации Мы воспользовались алгоритмом иерархической классификации, работающим непосредственно с матрицей обмена. Основное преобразование заключалось во введении ограничений на размеры группируемых элементов. Перегруппировка осуществлялась только в том случае, когда сумма размеров группируемых элементов не превосходила, размеры страницы или кванта памяти. Благодаря этому ограничению процесс перегруппировки в определенный момент прекращался и полученные при этом блоки размещались на границах страниц (квантов). Опыт показывает, что при такой реструктуризации потери памяти малы, а полученные структуры благоприятны. 17.5. РЕЗУЛЬТАТЫ Применение описанных алгоритмов к задачам, имеющим порядка сотни вызовов подпрограмм из библиотеки и порядка десятка обращений к различным секциям (при реструктуризации программ), дало следующие результаты: число обменов уменьшилось на 20—50%; это число зависит от типа программы и от объема памяти, но, как правило, оно ближе к 50%; число обращений к магнитным дискам уменьшилось примерно на 60% по сравнению с тем, что было при исходной структуре библиотеки. Подобные реструктуризации были собраны в системе «Опал». Коммерческая версия под названием RELIEUR будет создана фирмой СП — Хоннавэлл Булл. Она предназначается для операционных систем SIRIS8—IRIS80 и сулит большие выгоды каждому пользователю. 321
ЛИТЕРАТУРА 1. А с h а г d M. S. A975) Segmentation automatique des programmes indepen- damment des langages de programmation. These Universite de Paris VI. 2. AchardM. S., Babonneau J. Y., LeChevallier Y., Moris- setG., Mounajjed B. A978) The clustering algorithms in the Opale Restructuring System. ICPCI. Gardone Riviera, Italy. 3. AchardM. S., Babonneau J.Y.,CarpentierM.,Morisset G., Mounajjed B. A977) Automatic and general solution to the adaptation of programs in a paging environment. Proceedings ACM Operating System Principles. Purdue USA. 4. Achard M. S., Babonneau J. Y., LeChevallier Y., Moris- set G., Mounajjed B. A977) Reconnaissance de la structure et adaption des programmes au milieu pagine a l'aide d'algorithmes de classification hierarchique. Collogue IRIA, Versailles. 5. Carpentier M. A979) Optimisation de la gestion sur disque des biblio- theques de programmes. These Universite de Paris VI. 6. MorissetG. A975) Adaption automatique des programmes au milieu pagine. These Universite de Paris VI.
Глава 18 • КЛАССИФИКАЦИЯ ПОТРЕБИТЕЛЕЙ ЭЛЕКТРОЭНЕРГИИ ПО ГРАФИКАМ НАГРУЗКИ С ПОМОЩЬЮ МЕТОДА ДИНАМИЧЕСКИХ СГУЩЕНИИ 18.1. ВВЕДЕНИЕ Если требуется классифицировать некоторый набор данных, исследователь может обратиться к одному из методов автоматической классификации для того, чтобы выбрать разбиение и, может быть, число классов. Методы иерархической классификации предоставляют возможность выбрать требуемое разбиение из множества всех разбиений, соответствующих различным уровням иерархии. Выбор делается в зависимости от значений некоторого критерия, уровня значимости или свойств полученных классов. Недостаток методов иерархической классификации заключается в том, что они предполагают у классифицируемых данных существование иерархической структуры. Можно задать вопрос, являются ли эти методы наиболее подходящими для классификации больших наборов данных (современные мощные алгоритмы позволяют обрабатывать массивы, содержащие несколько тысяч объектов); не могут ли классы, полученные в результате большого числа иерархических перегруппировок, оказаться далекими от оптимальных из-за того, что предполагаемая структура неестественна для классифицируемой выборки? Если же обратиться к методам неиерархической классификации, то, как известно, они не всегда удобны, поскольку требуют априорного задания числа классов либо более или менее произвольных порогов для этого числа. Метод динамических сгущений не является в этом отношении исключением, но он обладает тем преимуществом, что в результате большого числа прогонов на одном и том же массиве данных дает устойчивые формы. Заметим, что, как правило, по сравнению с числом объектов число прогонов невелико. Полученные устойчивые формы можно подвергнуть иерархической классификации, что позволит определить «удовлетворительное» число классов, в том смысле, как это будет определено ниже. Представленный в этой главе алгоритм, построенный на основе метода динамических сгущений, как нам кажется, вполне подходит для цели, которую преследуют многие исследователи, а именно получить классификацию некоторого массива данных, не зная заранее числа классов. После краткого описания основных этапов этой процедуры приводятся два примера ее применения к задаче классификации кривых мощности (кривых нагрузок), потребляемой пользователями электроэнергией. Речь идет о более точном определении кривой, отражаю- 323
щей мощность электроэнергии, потребляемой клиентами. Для различных целей может потребоваться довольно высокая точность определения этой кривой. Типологический анализ позволяет разбить клиентов на группы, внутри которых разброс кривых нагрузок минимален. 18.2. ОПИСАНИЕ ПОСТРОЕНИЯ ТИПОЛОГИИ С ПОМОЩЬЮ АЛГОРИТМА ДИНАМИЧЕСКИХ СГУЩЕНИЙ 18.2.1. Основы метода Описываемый метод состоит по меньшей мере из двух шагов, третий шаг не обязателен. На первом шаге метода динамических сгущений ищут разбиение исходного набора данных на некоторое количество устойчивых форм. Необходимо провести хотя бы несколько (например, пять) прогонов алгоритма для того, чтобы полученные формы были действительно значимы. Число классов, задаваемое a priori при применении метода динамических сгущений, является в данном случае параметром. Вначале берется завышенное значение (в используемой программе — 20) и ^ | предполагается, что при даль- ч 4 нейшем, более тщательном & 5 анализе имеющихся данных § 67 удастся получить более зна- о 8 чимые устойчивые формы. «g ^ На втором шаге осущест- § вляется восходящая иерар- 12 хическая классификация с межклассовая дисперсия использованием дисперсионного критерия (происходит рис ^ ^ максимизация дисперсии между классами разбиения), затем проводится выбор разбиения. Наиболее значимое число классов можно определить, исследовав зависимость оценки межклассовой дисперсии от числа классов на различных уровнях иерархии (рис. 18.1). Известно, что метод иерархической классификации при переходе на более высокий уровень иерархии, по существу, минимизирует потери межклассовой дисперсии. В качестве наиболее значимых берутся уровни, предшествующие перегруппировке со значительным уменьшением межклассовой дисперсии. Так, например, согласно рис. 18.1 будет сохранен уровень с номером 7. В некоторых случаях анализ изменений межклассовой дисперсии не выявляет, бесспорного числа классов, но во всяком случае такой критерий всегда может служить индикатором. Кроме того, критерием может быть качество интерпретации найденных классов по типологическим переменным. Иерархия дает возможность сравнивать разбиения на соседних уровнях с точки зрения их интерпретации. Окончательное число классов всегда выбирается именно из этих соображений. 324
На третьем шаге осуществляется оптимизация разбиения, найденного на втором шаге. Разбиение, полученное на некотором уровне иерархии устойчивых форм, предполагает иерархическую структуру, которая может и не соответствовать рассматриваемой совокупности. Поэтому, на наш взгляд, основная ценность второго шага состоит в определении наиболее значимого числа классов. Соответствующее разбиение может быть найдено каким-нибудь и неиерархическим методом. Однако весьма вероятно, что разбиение, найденное на некотором уровне иерархии устойчивых форм, окажется достаточно хорошим. Поэтому в большинстве случаев останавливаются на числе классов и разбиении, найденных на втором шаге. На третьем шаге предлагается лишь улучшение этого разбиения в смысле некоторого критерия. Если в качестве критерия использовать межклассовую дисперсию, то можно применить алгоритм обмена, основанный на переносах объектов из класса в класс. Разбиение, полученное на втором шаге, можно улучшить, также взяв его за исходное в методе динамических сгущений. В этом случае критерий выбирается в зависимости от типа применяемого метода. 18.2.2. Оптимизируемые критерии 18.2.2.1. Алгоритм динамических сгущений Известно, что метод динамических сгущений, применяемый на первом шаге анализа, может использоваться в различных вариантах. Мы предпочтем алгоритм, который кроме стандартного варианта, где ядра формируются из точек, принадлежащих выборке, реализует также метод, при котором в качестве ядер берутся центры тяжести классов. В обоих случаях имеется возможность взвешивания объектов. Выбор функции D для обоих случаев описывается в приложении 1. Таким образом, если все веса равны, то в первом случае используется критерий W(L,P)= 2/7 (Pt) [varP, + var At +d(G (At), G (/>,))], A) где P — разбиение на классы Ръ ..., Ph\ L — соответствующее представительство (Аъ ..., Aft), a G (В) — центр тяжести множества В. В случае когда в качестве ядер берутся центры тяжести, критерий принимает вид ^(^)=SP(^l)var(Pl). B) /=i 18.2.2.2. Согласование критериев, оптимизируемых на разных шагах метода На втором шаге используется критерий межклассовой дисперсии, эквивалентный B), при этом критерий A) также убывает. Не следует ли в таком случае на первом шаге применять только метод центра тяжести? Нам кажется, что этот вопрос требует отрицательного ответа. Дело в том, что эффективность метода в целом сильно зависит от того, 325
насколько значимыми являются устойчивые формы, найденные на первом шаге. Они фактически служат основой для иерархической классификации на втором шаге, где определяется окончательное число классов, а зачастую и разбиение. Какая из модификаций метода динамических сгущений при фиксированном числе прогонов даст нам наиболее значимые устойчивые формы? Мы только знаем, что по сравнению с методом, где классы представляются ядрами, формируемыми из точек выборки, метод центра тяжести может привести к созданию «пустых внутри» классов, у которых все элементы расположены на границе (см. приложение 2). Хорошо заполненные классы нам заранее кажутся более желательными, так как устойчивые формы можно определить в виде пересечений таких классов. Конечно, это только гипотеза, требующая проверки. Тем не менее она кажется разумным оправданием для сохранения возможности применять на первом шаге обе модификации метода динамических сгущений. Практический опыт учит применять глав* ным образом первый вариант для получения устойчивых форм. Хотя, вообще говоря, нам не кажется оправданным применение метода динамических сгущений с межклассовой дисперсией в качестве критерия B), на третьем шаге обычно оптимизируется как раз этот критерий при числе классов, определенном на втором шаге. Разбиение, полученное на втором шаге, лишь условно оптимизирует критерий, оставаясь в рамках иерархической структуры (на данном уровне ищется наилучшее, с точки зрения критерия, разбиение из всех, которые можно получить слиянием двух классов разбиения на предыдущем уровне). На третьем шаге можно использовать также и алгоритм переноса. Полученное при этом разбиение доставляет, если не глобальный, то по крайней мере локальный оптимум критерию. Наконец, на третьем шаге можно использовать и другие критерии, например A), соответствующий одновременному выбору разбиения и системы ядер (поэтому осуществлялись прогоны методом динамических сгущений, использующим ядра из точек выборки в качестве представительств классов; начальное разбиение бралось равным разбиению, полученному на втором шаге). Замечание. Что касается метрики и весов, соответствующих объектам, то очевидно, что выбранные на первом шаге они должны сохраняться без изменений на последующих шагах. Таким образом, например, при вычислении весов классов, включенных в иерархическую классификацию согласно их дисперсии, учитываются весовые коэффициенты соответствующих объектов. 18.3. КЛАССИФИКАЦИЯ ПОТРЕБИТЕЛЕЙ ЭЛЕКТРОЭНЕРГИИ ПО ГРАФИКАМ НАГРУЗКИ 18.3.1. Введение Классические методы классификации потребителей электроэнергии по кривым нагрузок на первом шаге заключаются в априорном определении классов исходя из таких внешних характеристик, как ежегодное потребление, а на втором шаге — в статистической обработке 326
значений потребляемой мощности для каждого класса пользователей. При этом в результате последовательности приближений определяется разбиение на однородные классы. Такая процедура предполагает существование более или менее прямой связи между внешними характеристиками и видом кривых потребления электроэнергии. Автоматическая классификация позволяет находить разбиение потребителей, не опираясь на априорную информацию, а исходя лишь из вида кривых нагрузок. Данные являются многомерными, они состоят из результатов разумных измерений на выборках из исходного массива. Они представляют собой совокупность кривых нагрузок в течение одного дня, построенных по десятиминутным интервалам. Для некоторых категорий потребителей имеется довольно большое количество данных. Например, для потребителей электроэнергии низкого напряжения (для населения) были собраны данные о потребляемой мощности за десятиминутные промежутки в течение года C65 X 144 точек для каждого потребителя). Такой большой массив данных не может быть непосредственно обработан даже методами автоматической классификации. Поэтому вначале исследовалось поведение кривых в течение фиксированного дня, затем за несколько наиболее представительных дней недели (например, зимой, когда потребление электроэнергии особенно велико). Далее будут рассматриваться два разных набора данных. С одной стороны, это потребители электроэнергии низкого напряжения (население). Для них потребление носит в значительной мере случайный характер: кривые нагрузок могут изменяться как относительно среднего уровня требуемой мощности, так и по форме (разбиение требуемой мощности по часам дня). С другой стороны, это предприятия, использующие среднее напряжение. В этом случае нас будет интересовать только классификация кривых нагрузок по форме. С этой целью исходные данные преобразуются в «приведенные» (берется отношение потребляемых в различное время мощностей к среднему значению в течение дня). В этих двух случаях производится классификация данных, имеющих различную структуру, что особенно ясно выявится при анализе результатов. 18.3.2. Графики нагрузки для потребителей электроэнергии низкого напряжения, для которых электроэнергия не является основным источником отопления [2] 18.3.2.1. Данные В качестве исходных данных было взято объединение массивов выборочных измерений, проведенных в двух различных сельских областях. Для получения однородного массива не учитывались потребители, для которых электроэнергия является главным источником отопления, в противном случае потребовалось бы учитывать эффект разницы в температуре, которая неодинакова для двух выбранных областей. Таким образом, была получена, по нашим оценкам, достаточно представительная выборка из 1243 потребителей. 327
Было решено изучать данные, собранные для этого множества за неделю, на которую приходится максимальная нагрузка (вторая неделя января), в один из рабочих дней, для определенности во вторник. В целях упрощения данные за десятиминутные интервалы усреднялись на каждые полчаса. Тем самым число значений потребляемой мощности для каждого человека сводилось к 48. Для каждого потребителя эти 48 значений, упорядоченные во времени, представлялись кривой нагрузок. На самом деле отдельно рассматривались данные для интервалов F ч 30 мин — 21 ч 30 мин) — загруженный период и @ ч 30 мин — 6 ч и 22 ч — 24 ч) — незагруженный период, по следующей причине. Выборка разделяется на потребителей с «обычным тарифом» и с «двойным тарифом», причем заранее известно, кто потребляет большое количество энергии ночью (в незагруженные часы), используя при этом в течение дня не меньше электроэнергии, чем потребитель с «обычным тарифом». Классификация всего массива данных привела бы к увеличению числа классов из-за этого различия в поведении потребителей, известного a priori. Поэтому, нам кажется, уместнее проводить две классификации: одну — по 31 переменной, соответствующей загруженному периоду; другую —по 17 переменным, соответствующим незагруженному периоду. Первая классификация потребует большего внимания по причине неравномерного потребления электроэнергии в загруженные часы. 18.3.2.2. Выбор расстояния В связи с тем, что нас интересует не столько форма каждой кривой, сколько соответствующая потребляемая мощность, решено было не использовать расстояние %2, которое может служить только для сравнения профилей кривых. Наиболее простым подходящим расстоянием будет евклидово, составленное из весовых коэффициентов переменных (т. е. метрика в пространстве объектов, задаваемая диагональной матрицей, составленной из весов переменных). Им мы и будем пользоваться. Прежде чем говорить о конкретном определении весов, нам кажется необходимым описать роль, которую играют переменные в образовании типологий. 1. Удобная запись дисперсионного критерия. Основным критерием, которым мы будем пользоваться, является межклассовая дисперсия. Частично этот критерий оптимизируется на втором шаге и может быть еще улучшен на третьем. Межклассовая дисперсия В определяется в /7-мерном пространстве объектов (р — число переменных), где, как предполагается, введена диагональная евклидова метрика. Таким образом, имеем В-2 C/?(/)var(/)/?(/), C) ' var(/) ' 328
где CR (/) — отношение межклассовой дисперсии к общей дисперсии по /-й переменной; р (/) — вес /-й переменной в евклидовой метрике. Если метрика задается единичной матрицей, то S = SC#(/)var(/). D) /=i В этой формуле var (/") (дисперсия /-й переменной, подсчитанная по всей выборке) не зависит от разбиений на классы. Для максимизации упомянутого критерия на различных шагах метода ищутся такие классы, чтобы отношение CR (/) было велико для переменных / с большой дисперсией var (/). Поэтому в результирующем разбиении классы будут различаться, главным образом, по переменным с большой дисперсией. Для строгости здесь надо предположить некоррелированность всех р переменных, иначе нельзя будет независимо изменять величины CR (/).Это приводит к необходимости предварительного анализа связей между переменными, по которым будет проводиться классификация. 2. Анализ главных компонент по загруженному периоду. На рис. 18.2 приводятся результаты применения анализа главных компонент к нормированным переменным для загруженного периода. Их можно сравнить со случаем, когда переменные ненормированы, см. рис. 18.3, Анализ нормированных переменных выявил положительные корреляции между всеми переменными: все они имеют положительные проекции на первую главную ось, которая объясняет 43% инерции всего множества точек, тогда как вторая ось объясняет только 7%. Это явление хорошо известно в анализе главных компонент, оно носит название «эффекта размера», который определяется первым собственным числом, в данном случае этот эффект связан с уровнем потребляемой мощности. Тот факт, что корреляции всех переменных с первым фактором положительны и почти равны, означает, что мощности, потребляемые в каждый отрезок времени, возрастают одновременно с ростом средней потребляемой мощности. Очень большой по сравнению с другими осями процент инерции, объясняемой первой осью, является следствием того, что дисперсия множества кривых, вызванная различиями в потребляемой мощности, значительно превосходит дисперсию в результате их различий по форме. Проекция на плоскость, порожденную второй и третьей главными компонентами, выявляет связи между отрезками времени, когда ликвидирован эффект различия в потребляемой мощности. Это можно сделать, приводя кривые к средней мощности, иначе говоря, если поделить мощность, потребляемую в каждый отрезок времени, на среднюю дневную мощность. Следует заметить, что кривая, соединяющая последовательные моменты времени на этой плоскости, близка к окружности. Она отражает корреляции между мощностями, потребляемыми в последовательные промежутки времени. Впадина в районе точек 13 ч и 13 ч 30 мин, по-видимому, говорит о том, что соответствующие интервалы характеризуются компонентой более высокого порядка (пятой) и что приведенные мощности некоррелированы с мощностями, 11 Зак. 303 329
/5.30 10.00 6,8% ОСЬ 2 Рис. 18.2. Анализ. главных компонент нормированных переменных по данным о 1243 потребителях электроэнергии низкого напряжения в загруженный период
20.30 20.00 ОСЬ 3 6,2% IК 30 11.00 7,8 V. 10сь2 Рис. 18.3. Анализ главных компонент ненормированных переменных по данным о 1243 потребителях электроэнергии низкого напряжения в загруженный период П* 331
потребляемыми в другие моменты времени. Вторая и третья компоненты объясняют почти одинаковые доли инерции. Они выявляют отрицательные связи между приведенными переменными: с одной стороны B0 ч 30 мин, 21 ч) и незагруженный отрезок около 11 ч утра—с другой G ч 30 мин, 8 ч) и A5 ч 30 мин, 16 ч). Это можно объяснить тем, что некоторые загруженные периоды «компенсируются» другими, незагруженными. Более интересна кажущаяся очевидной некоррелированность между вечерними и утренними отрезками времени и уникальность отрезка A3 ч — 13 ч 30 мин), который некоррелирован со всеми предыдущими промежутками времени. Анализ главных компонент нормированных переменных интересен, главным образом, потому, что он позволяет просто измерить корреляционные связи между переменными. Если мы не собираемся нормировать переменные для классификации, то для определения факторов, учитывающих дисперсии переменных, следует рассмотреть результаты анализа главных компонент для ненормированных переменных, изображенных на рис. 18.3. Очевидно, что они несильно отличаются от случая, когда переменные нормированы. Первая компонента объясняет 44% общей инерции. Проекции переменных на нее в этом случае не равны, что говорит о неодинаковых значениях дисперсии этих переменных (точнее, о долях дисперсии, объясняемых различиями в потребляемой мощности). Если осуществить поворот на 90° плоскости второй и третьей компонент так, чтобы третья компонента заняла место второй, то окажется, что кривая, соединяющая различные моменты времени, имеет ту же форму, что и при анализе нормированных переменных. Вторая и третья компоненты попросту поменялись местами. Как и прежде, они объясняют малую долю инерции (вторая — 7,8%, а третья —6,2%). По величине вклада в общую инерцию эти компоненты намного отстают от первой. Эта плоскость позволяет анализировать дисперсию переменных по кривым приведенной мощности. Вторая компонента выявляет немного большую дисперсию переменных, соответствующих вечернему B0 ч 30 мин — 21 ч) и утреннему времени A0 ч 30 мин — 11 ч), чем третья, по которой противостоят промежутки G ч 30 мин — 8 ч) и A5 ч — 15 ч 30 мин). Такое сильное сходство между рис. 18.2 и 18.3 является результатом того, что мощности, потребляемые в различное время, имеют близкие значения дисперсии. В результате проделанного анализа можно сделать вывод: 17 переменных, соответствующих загруженному периоду, в первом приближении можно представить тремя некоррелированными факторами Fl9 ^2» ^з» дисперсии которых сильно различаются. Критерий D) можно представить в виде fel 332
Если в пространстве объектов используется евклидово расстояние, задаваемое единичной матрицей, то дисперсии главных компонент будут пропорциональны их вкладу в общую дисперсию, а именно 44% для первой, 7,8 и 6,2% для второй и третьей компонент. Очевидно, что классификацию следует производить в первую очередь по первой компоненте, а найденные классы будут различаться, главным образом, по уровню потребляемой мощности. Из-за близости дисперсий второй и третьей компонент неясно, по какому направлению классифицировать кривые согласно их форме. Это проявится во втором примере; при классификации кривых с приведенной потребляемой мощностью получаются неустойчивые классы. 3. Выбор взвешенного евклидова расстояния. Алгоритм классификации, в котором критерием является межклассовая дисперсия, одновременно уменьшает внутриклассовую дисперсию, т. е. сумму взвешенных дисперсий внутри каждого класса. Можно сказать, что классификация сводит дисперсию исходного набора данных к дисперсии двух типов: Т = В +2p(/)var(P). общая межклассовая /=1 дисперсия дисперсия внутриклассовая дисперсия Согласно этому выражению дисперсия класса, имеющего маленький вес, может превышать общую дисперсию. Дисперсия вычисляется в выбранной метрике как сумма дисперсий по всем переменным. В нашем случае было бы интересно проследить уменьшение внутриклассовой дисперсии в различные отрезки времени. Для этого можно сравнить кривую зависимости от времени среднеквадратичного отклонения для исходного набора данных и соответствующие кривые для каждого типа потребителей. На самом деле в каждый момент времени / лучше рассматривать коэффициент вариации: <5) где а (/) — стандартное отклонение, a m (/) — среднее значение /-й переменной. Вначале классифицировалось подмножество исходного набора данных D53 потребителя с обычным тарифом). Было показано, что для некоторых типов потребителей в определенные промежутки времени величина E) может быть больше, чем для всего набора данных. Это видно из рис. 18.4 (а), (б), (в). Утверждается, что экстремальные точки графика ог (/) для всего набора данных (наибольшие значения в 11 ч и 15 ч и один локальный максимум в 6 ч) сохраняются, будучи более или менее выраженными и для соответствующих кривых полученных типов. В этих точках графики средней потребляемой мощности как для всего набора данных, так и для типов имеют локальные минимумы. Большие значения коэффициента вариации в периоды времени, когда средняя потребляемая мощность мала, являются следст- 333
вием характера потребления в эти периоды «все или ничего». Особенно характерно это для типов, отличающихся в среднем небольшой потребляемой мощностью в точках, где коэффициент вариации превосходит свое значение для всей совокупности. Для того чтобы смягчить такие, в данном случае неприятные, эффекты, следует ввести дополнительные весовые коэффициенты для всех главных компонент, кроме одной, выражающей различия в потребляемой средней мощности. Эти веса должны придать одинаковую важность всем промежуткам времени (см. пояснения к рис. 18.3 о корреляции исходных переменных с первой главной компонентой). Надо сделать так, чтобы алгоритм сокращал мощность, 1000 12 16 20 24 Время 12 W 20 2* Время Рис. 18.4(а). Кривая средних нагрузок и кривая зависимости коэффициента вариации в процентах от времени по выборке из 453 потребителей электроэнергии низкого напряжения, пользующихся обычным тарифом излишки дисперсии в моменты времени /, которым соответствуют большие значения аг (/). Для этого введем расстояние между объектами следующим образом: F) /=' где xt (/) — мощность, потребляемая i-м объектом в /-й промежуток времени; m (/) — выборочное среднее значение потребляемой мощности в /-й промежуток времени. Если теперь расписать критерий межклассовой дисперсии, задаваемый формулой C), то станет ясно, почему мы выбрали такую систему весов: В = S CR <'"> = S CR У) а? 0). G) 334
Нельзя сказать, что в этой формуле переменные / некоррелированы. Тем не менее можно думать, что после равномерной минимизации G) по всем отрезкам времени (классификация по средней потребляемой мощности, которая соответствует первой главной компоненте) по причине сильной положительной корреляции переменных с первой 800 1000 800 600 400 200 Тип / A56 потребителей) Тип 2 (П6 потребителей) 8 12 16 20 24 О в 12 16 20 24 Тип 3 G5 потребителей) Тип 4 D6 потребителей) 8 12 16 20 24 Время в 12 16 20 24 Время Рис. 18.4F). Разбиение выборки из 453 потребителей электроэнергии низкого напряжения, пользующихся обычным тарифом, на 4 типа главной компонентой алгоритм учтет взвешивание при классификации кривых по их форме и, таким образом, дисперсия в промежутки времени с большими значениями ог (/) будет уменьшена. Такая модификация метрики в пространстве объектов может быть сведена к простому преобразованию исходных данных (мощность, потребляемая в промежуток времени /, делится на среднюю мощность пг (/)). Полученная 335
в результате классификация перестает быть оптимальной в смысле предыдущего критерия, но, естественно, является оптимальной, в смысле критерия G). Как уже говорилось, такая система весов производит Тип 1 Тип 2 О U 8 12 16 20 24 О U В 12 16 20 24 Тип 3 Тип 4 0 4 8 12 16 20 2U Время 0 4 8 12 16 20 24 Время Рис. 18.4(в). Кривая зависимости от времени коэффициента вариации для каждого типа потребителей ожидаемый эффект: кривые аг (/) для отдельных классов сглаживаются и не превышают коэффициент вариации для исходной выборки. Поэтому расстояние F) будет использовано при решении нашей задачи. 18.3.2.3. Предварительные результаты Ниже будут приведены результаты классификации 1243 потребителей, каждый из которых задается значениями 31 переменной, соответствующей загруженному времени суток. Было произведено четыре 336
прогона программы, реализующей метод динамических сгущений, максимальное число классов задавалось равным 20. Выбор большого числа классов объясняется желанием получить побольше устойчивых форм, которые мы ищем на первом шаге. На вход программы при каждом прогоне подавались в качестве начальных ядер классов тройки объектов, выбранных случайным образом. При выбранной метрике были получены 152 устойчивые формы. На втором шаге была проделана восходящая иерархическая классификация полученных устойчивых форм. В качестве критерия бра- 24... 23..- 22.... 21 ... 20... 19.-. 18-... 17.... /?.... 15-.- 0,05 0,Ю 0,15 0,20 0,25 0,30 0,35 0,40 0,45 0,50 0*55 ОМ 0,65 0,70 0,75 ОМ Среднее значение CR Рис. 18.5. Кривая зависимости среднего значения CR от числа классов на различных уровнях иерархии устойчивых форм при классификации 1243 потребителей электроэнергии низкого напряжения в загруженный период лась дисперсия, расстояние не менялось, и учитывались весовые коэффициенты исходных устойчивых форм. Кривая зависимости доли межклассовой дисперсии от числа классов на различных уровнях иерархии выявляет довольно чистую типологию, состоящую из четырех типов. Нижняя часть этой кривой (начиная с 24 классов) приводится на рис. 18.5. Кривая межклассовой дисперсии определялась по переменным, которые вносят наибольший вклад в разделение типов потребителей, т. е. объясняющим до 80% межклассовой дисперсии. Смысл отбора наиболее информативных переменных на каждом уровне перегруппировки (очевидно, что на разных уровнях эти переменные различны) в том, чтобы ограничить долю незначимой дисперсии в разделении типов. Та- 337
кое выделение наиболее значимых типов производится по рис. 18.5 проще, чем по кривой общей дисперсии. Можно считать, что доля дисперсии дается предварительным анализом главных компонент в зависимости от доли дисперсии, объясняемой достаточным для хорошей интерпретации числом главных компонент. В программе классификации доля межклассовой инерции считается параметром, который часто берут равным 80% без точных обоснований. При решении данной задачи мы ограничились первыми двумя шагами, не пытаясь оптимизировать четыре класса, найденные методом восходящей иерархии. Мощность, w 200 18 22 Время Рис. 18.6(а). Кривые средней потребляемой мощности и коэффициента вариации в загруженный период для исходной совокупности из 1243 потребителей электроэнергии На рис. 18,6 (а) представлена кривая средних нагрузок и, что нас особенно интересует, кривая зависимости коэффициента вариации от времени в загруженный период суток для всего набора данных. Обратим внимание на точки локального максимума, соответствующие 11ч и 15 ч..Согласно G) относительное уменьшение дисперсии в эти часы должно быть наиболее сильным. В действительности наиболее сильное уменьшение дисперсии наблюдается после полудня, но ближе к 16 ч и в 9 ч, а не в И ч. Можно сделать вывод, что четыре найденных типа не очень хорошо оптимизирзгют критерий G) (и это не удивительно, потому что на таком высоком уровне иерархии накапливается большое число отклонений от оптимума в результате последовательных перегруппировок}. Поэтому интересно рассмотреть значения CR (/) для типологии устойчивых форм, полученных на первом шаге. Точка, соответствующая 15 ч (CR = 852), видна сразу, точка 11 ч не так очевидна (сосггветствующее значение CR в это время максимально среди утренних часов, но оно меньше, чем для некоторых периодов времени во второй половине дня). Для того чтобы понять это явление, следует вернуться к связям между переменными. Анализ главных компонент показал, что незагруженные послеобеденные часы A5 ч — 15 ч 30 мин — 16 ч) отрицательно связаны с утренними промежутками времени (тре- 338
тья компонента анализа ненормированных данных), тогда как утреннее время A1 ч) отрицательно связано с периодом 19 ч — 19 ч 30 мин (вторая компонента). Очевидно, что эти корреляции не изменились при взвешивании переменных. Напротив, они изменяют главные оси инерции, которые приобретают направление, определяемое наибольшими значениями относительной дисперсии. Вечерние часы имеют аг явно меньше, чем утренние, и потому компонента, связывающая вечернее время с утренним, получает большой вес. Она становится второй 2000 1800 1600 1400 ^ Г 200 g" 1000 §• 600 600 400 200 О ТипЗ / ч Тип2 N 400 потребителей 300 200 461 потребитель потребителей Tuni ТипЗ Тип 2 д; 6 8 10 /2 14 16 18 20 22 Время 6 8 10 12 14 16 18 20 22 время Рис. 18.6F). Кривые средней потребляемой мощности и коэффициента вариации для каждого из трех типов, полученных в результате окончательного разделения исходной совокупности после компоненты, определяющей уровень потребляемой мощности (которая не меняется при взвешивании). Таким образом, при классификации CR уменьшается на интервале A5 ч — 15 ч 30 мин — 16 ч) и утром (особенно в 9 ч), этим объясняются большие значения CR при классификации на 4 типа. 18.3.2.4. Окончательная классификация на 3 типа Рассмотренная классификация выборки из потребителей электроэнергии низкого напряжения составляет только первый этап анализа. Затем была сделана попытка объяснить найденные классы с помощью внешних переменных: технических (плата за электроэнергию, тариф, потребление за год) и социально-экономических (виды электроприбо- 339
ров, тип жилища, возраст и т. п.). По этим переменным имелись анкетные данные тех же потребителей. После преобразования количественных переменных в качественные была построена таблица сопряженности между четырьмя найденными типами и различными градациями переменных. Факторный анализ соответствий позволил различить типы потребителей с помощью имеющихся внешних переменных. Наиболее экспликативными оказались следующие признаки: суммарное потребление за год в загруженный период, наличие электроприборов, тип жилища и социально-профессиональная категория. Однако по этим переменным оказалось невозможным различать два типа, характеризуемых наибольшей потребляемой мощностью, к которым относится 3,2 и 2,1% выборки. Поэтому было решено объединить эти типы. На рис. 18.6 (б) представлены кривые средней потребляемой мощности и коэффициента вариации для полученных таким образом трех типов. Интересно сравнить их с соответствующими кривыми для исходной совокупности на рис. 18.6 (а). Следует отметить различия в объемах найденных классов: 57% выборки принадлежит первому классу, характеризующемуся небольшой потребляемой мощностью A00W—300 W), 37% — второму классу, к которому относятся потребители, использующие примерно вдвое больше электроэнергии B10W— — 640W), тогда как 6% выборки относится к третьему классу с очень большим потреблением (800W—1900W). Заметим, также упомянутое выше уменьшение коэффициента вариации по крайней мере на 30%. Класс с высоким уровнем потребления характеризуется дисперсией, явно меньшей, чем средняя дисперсия. 18.3.2.5. Замечания по проведенной классификации и дополнения Классификация той же выборки по незагруженному периоду A7 переменных) привела также к выделению трех классов. За исключением первого класса, содержащего большую часть совокупности, который характеризуется низким уровнем потребления электроэнергии, не существует заметных пересечений классов соответствующих уровней потребления при классификации по загруженному и незагруженному периодам. Следовательно, при классификации потребителей имеет смысл отдельно рассматривать каждый из двух периодов. После того как проведена классификация потребителей электроэнергии низкого напряжения по данным, измеренным в один день недели, на которую выпадает самая большая нагрузка в году, было бы интересно знать, сохраняется ли характер потребления в другие дни. Решено было считать, что характер потребления сохраняется, если дисперсия потребляемой мощности внутри найденных классов мало меняется в другие дни. На основании анализа был сделан вывод, что классификация по данным, снятым во вторник второй недели января, является разбиением потребителей, поведение которых мало меняется в течение всего года. Это дает возможность косвенным образом сравнить потребителей, используя всю имеющуюся информацию, т. е. потребление ими электроэнергии в течение всего года. 340
Далее была сделана попытка различить выделенные типы по внешним переменным. Оказалось, что значения переменных, обладающих наилучшей дискриминантной способностью, содержатся в платежных карточках потребителей. Таким образом, для обоих периодов суток появилась возможность определить класс, которому принадлежит данный потребитель исходя лишь из его тарифа и мощности электроэнергии, потребляемой им за год. С точки зрения приложений представленные результаты классификации составляют только первый этап. Они могут служить отправной точкой для более тонких статистических исследований каждого класса. 18.3.3. Графики нагрузки для потребителей электроэнергии среднего напряжения 18.3.3.1. Данные Исходными данными является выборка из 190 потребителей электроэнергии среднего напряжения. В нее вошли предприятия промышленности и сферы обслуживания. Каждый потребитель задается тремя графиками нагрузки: в субботу 15 декабря 1973 г., в воскресенье 16 декабря и в среду 19 декабря того же года. Каждая кривая строится по точкам, соответствующим потребляемой мощности за 30-минутные промежутки времени. Таким образом, каждым суткам соответствует 48 значений мощности. Характер потребления не связывался a priori с потребляемой мощностью. Производилась классификация по преобразованным кривым нагрузок. Собранные по трем дням 144 значения потребляемой мощности делились на среднее значение для среды. Таким образом, можно сравнивать потребителей по форме кривых в среду, по уровню потребляемой мощности и форме кривых в субботу и воскресенье. Проводились две классификации. Вначале классифицировались потребители по преобразованным данным, снятым в среду, затем, определяя для каждого потребителя недельную кривую нагрузки присоединением к субботней и воскресной кривым пяти кривых, аналогичных измеренной в среду, производилась классификация по всей неделе. В обоих случаях применялся метод выявления типологии, описанный в гл. 2, причем использовалась евклидова метрика. Выбор других параметров классификации приводится одновременно с результатами. 18.3.3.2. Результаты 1. Типология, построенная по данным за среду. Был проведен ряд экспериментов для того, чтобы оценить влияние основных параметров программы, реализующей метод динамических сгущений (максимальное число классов, число прогонов программы с различными случайными выборами исходных ядер, априорный выбор ядер), на 341
типологию. Оказалось, что во всех случаях анализ графика зависимости межклассовой дисперсии от уровня перегруппировки устойчивых форм привел к разбиению на пять классов (рис. 18.7), которые характеризуются следующими видами потребления электроэнергии: равномерным, слабо модулированным, сильно модулированным, «два пика» I ,0 0.5 О Равномерное потребление 4 8 12 № 20 Время § 2.5 >1! S* 0,5 ^ О Сильно модулированное потребление 4 8 12 16 20 время ос сз I 1-1 3,0 2.5 2,0 1.5 КО 0,5 О Слабо модулиробанное потребление 8 П 16 20 21 Время 30 w It 45 О Потребление кдба пина" U 8 12 W 20 24- Время I » &? ьо 0,5 € Потребление с кратковременными перерывами ¦ в 12 16 20 2* время Средняя кривая при пятом прогоне Средняя кривая при четвертом прогоне Рис. 18.7. Классификация 190 потребителей электроэнергии среднего напряжения на 5 типов. Третья среда декабря 1973 г. и потреблением с кратковременными перерывами. Доля межклассовой дисперсии в общей дисперсии довольно мала: около 35% (в предыдущем примере классификации на четыре типа критерий объяснял 42% общей дисперсии). Усредненные кривые, представляющие полученные классы, мало менялись при различных прогонах, тогда как числа элементов, попавших в каждый из классов, претерпевали значительные колебания. Это видно из табл. 18.1. Можно сказать, что 66% объектов 342
сохраняли свое положение при пяти прогонах. Довольно большая ооля потребителей, отнесенных при первом* втором й йятом прогонах к классу со слабо модулированным потреблением* при Других двух прогонах оказывалась в классе с равномерным истреблением. Это, как видно из рис, 18.7, заметно изменяло соответствующие кривые нагрузок, Таблица 1S.-1 Результаты Максимальное Число классов Число протонов, реализующих алгоритмы динамически* сгущений A) : ядра выбирались случайно B): ядра выбирались a priori Число объектов с равномерным характером потреблений Число объектов со слабо модулированным характером потреблений Число объектов с сильно моду- лйроваййым характером потреб- лейия Число объектов, Для которых графики нагрузки имеют «два пика» Число объектов, потребляющих электроэнергию с кратковременными перерывами пяти прогонов i 10 5 (!) 30 56 62 25 17 2 10 9 0) 32 68 51 25 14 3 15 10 0) 60 25 58 31 16 4 6 10 <и 61 36 52 24 17 5 5 5 B) 35 59 51 30 15 и о ш III 111 21 40 20 и При ля-том прогоне в качестве ядер использовались графики, лучше5 всего пр€Д€?аш!Яю1Цие соответствующие классы в предьщущих lipoto* нах, Преследовалась цель хорошего разделений равно^ерното A-Й тип) и слабо модулированного B-й тип) потребления. TlpejitrmmeJty- ные эле^ейты исходйых классов при пяти прогонах программы в йо- следнем прогоне вубйрались из соображений наилучшего разделения пйтй ттош, а особенно первого й второго. Пшу«&нные пить классов дают наилучшее разделение типов, и поэтому было решено их т&&> в Ka^ettge окончательного результата. Их Шншо сраюйть (ш. рт. 18.7) с результатами четвертого прогона, где первой й второй fnnu разделяются хуже. 343
Неустойчивость полученных классов, на наш взгляд, можно объяс нить следующим образом. Хотя анализ главных компонент и не проводился для этих данных, результаты, полученные для потребителей электроэнергии низкого напряжения, наводят на мысль, что факторы, объясняющие форму кривых, могут обладать близкими инерциями (для потребителей электроэнергии низкого напряжения это второй и третий факторы). Сказанное означает, что множество точек, соответствующих объектам, довольно равномерно распределяется в пространстве, порожденном первыми факторными осями, т. е. не существует направления, вдоль которого эти точки вытянулись бы, что дало бы возможность их легко разделить на типы потребителей. Таким образом, хоть и выделяются довольно явно пять классов, между ними нельзя провести четкие границы. Неустойчивость полученной типологии, а особенно трудность интерпретации результатов классификации по графику суточной нагрузки с помощью месячных или годовых характеристик, которые, как правило, имеются у нас в распоряжении, приводит к необходимости классификации потребителей по графику недельной нагрузки. 2. Типология, построенная по данным за неделю. В этом случае каждому потребителю соответствовали семь графиков суточной нагрузки, пять из которых были аналогичны графику потребления в среду (все данные о потребляемой мощности были поделены на среднее для среды значение). Как и в предыдущем случае, было проделано несколько прогонов. Анализ зависимости межклассовой дисперсии от числа классов привел к выявлению шести классов. При этом доля межклассовой дисперсии составила 45% общей дисперсии. Усредненные кривые, представляющие полученные классы, а также число элементов, попавших в каждый из классов, относительно мало менялись при различных прогонах. Для лучшего разделения соседних классов было проведено пять прогонов программы, при этом каждый раз по-новому выбирались исходные ядра, представляющие шесть классов. В прогоне, результаты которого были признаны окончательными, найдено 33 устойчивые формы. Зависимость отношения межклассовой дисперсии к общей от числа классов иерархии устойчивых форм имеет следующий вид: Число классов 9 CR, % 51 8 47 7 46 6 45 5 39 4 33 3 27 2 21 Это привело к выделению шести классов. Соответствующие усредненные кривые изображены на рис. 18.8. Итак, были выявлены следующие типы: Тип 1 «Равномерное потребление»: 24 объекта, для которых потребляемая мощность практически постоянна для всей недели A базисная устойчивая форма из 24 объектов). Тип 2 «Модулированное потребление во все дни»: 26 объектов с модулированным характером потребления (загруженные—незагру- 344
женные часы) в течение всей недели, модуляция в среду выражена сильнее, чем в воскресенье A базисная форма из 19 объектов). Тип 3 «Потребление с перерывами»: 16 объектов, для которых характерно очень слабое потребление в некоторые периоды A базисная устойчивая форма из 12 объектов). Тип 4 «Слабо модулированное потребление»: 38 объектов, характеризующихся слабо модулированным потреблением в рабочие дни недели и очень слабо модулированным в субботу утром, в воскресенье они потребляют постоянную незначительную мощность C базисные устойчивые формы из 13, 9 и 7 объектов). Тип 5 «Сильно модулированное потребление»: 65 объектов, для которых потребление электроэнергии сильно модулировано в рабочие дни, модулировано в субботу утром, постоянно и незначительно в воскресенье A базисная устойчивая форма из 47 объектов). Тип 6 «Два пика»: 21 объект, характеризующийся большим потреблением с 8 до 12 ч и с 14 до 18 ч в рабочие дни, довольно большим в субботу утром и незначительным в остальное время A устойчивая форма из 14 объектов). Эти результаты позволяют утверждать, что все 6 типов довольно «монолитны», поскольку 76% выборки A45 объектов из 190) оказываются перегруппированными в 8 базисных устойчивых форм. Наряду с этим согласно рис. 18.8 типы довольно хорошо различимы (усредненные кривые нагрузки различимы, стандартные отклонения довольно малы). По численности полученные классы весьма однородны: они содержат соответственно 12,7; 13; 8,4; 20; 34,2; 11% всех рассматриваемых объектов. По всем этим причинам полученную типологию было решено считать удовлетворительной и использовать для дальнейшего анализа данной выборки из потребителей электроэнергии среднего напряжения. С другой стороны, нам казалось интересным сравнить эту типологию с результатами, полученными при классификации тех же потребителей по преобразованным данным, измеренным в среду. Прежде всего заметим, что лишняя группа (модулированное потребление во все дни) возникла из-за различий в потреблении в воскресные дни. Однако главное то, что полученная типология намного устойчивее относительно различных прогонов, чем в предыдущем случае. Эта устойчивость подтверждается монолитностью классов, о которой уже говорилось, и тем, что доля межклассовой дисперсии возросла с 35 до 45 %. Пять классов типологии, выявленной в среду, разделяются намного лучше, если данные о потребителях задаются в виде пяти кривых, аналогичных графику в среду и присоединенных к графикам субботы, воскресенья. Нам кажется, что это можно объяснить тем, что небольшие различия близких кривых в один день во втором случае повторялись пять раз. Отклонения, которые ранее могли сойти за случайные, теперь стали значительными. Иначе говоря, факторы различия кривых в среду имели во втором случае намного больший вес, что и облегчило разделение типов. При данной задаче анализ поведения объектов в один день оказывается недостаточным для однозначного определения, к какому типу 345
относится тот или иной потребитель. Были сделаны попытки разделения найденных типов с помощью внешних характеристик, обладающих наибольшей дискриминантной способностью. Перераспределение исходной выборки привело к уменьшению ошибок при определении первого (равномерное потребление), третьего (потребление с перерывами) 1.0 0,5 Равномерное потребление 2ь объект они ho 40 \sg 60 щ Jo СПабо модулиробанное ШрШёние 38 объектами 10 20 Уо 40 % 60'^ 60* оеда Суббота \ Восмре* \Времй Z3 2,0 Ml Е.З- CfiHh /№ra )fam- ^m Среда J.,-- глш- , Мддулироданное Сильно модулированное потребление Щ0$6мие бо бее дни 26 объём томи //Т /У/? I ^/Т* / /V влЛ л/v *тл' о/т 0,5 О р 65 объектами .^..••-«...^ч У /^7 20 \30 40 Ы 60 70\ 80' Г^да -Суббота \Вв€к0е^ \шш Среда \Суббота \воСкрё- -время Потребление с перерыдвми 16 объектами Потребление ада пике» 21 объектом 10 Щ30 40 У 60 70\дО Среда I рр 60 701 <Й? '- \бремя Рис. !8А Окйтэнеяьная классификация Ш ttwpe&meMft $мк^тэ№ргт низкого тпрямеят т б tmtm по Э-й ттм ят*бр% Шэ г.
и пятого (сильно модулированное потребление) типов, которые составляют три главных типа потребления. Графики, соответствующие различным типам, практически не изменились. Такая дискриминация могла быть проведена только исходя из достаточно четкой типологии, которую сделало возможным наблюдение объектов в течение недели. 18.4. ЗАКЛЮЧЕНИЕ В этой главе описаны два примера применения метода динамических сгущений к задаче классификации графиков нагрузок потребителей электроэнергии. Для этого был реализован алгоритм, позволяющий определить число классов, на которые следует разбить выборку. Он основывается на восходящей иерархической классификации устойчивых форм. В первом примере применялись различные средства для выявления глубинной значимости полученных типов с помощью оптимизации дисперсионного критерия. В самом деле, предварительное изучение вкладов различных переменных во внутриклассовую дисперсию (с помощью факторного анализа) позволило понять их относительную роль при определении типов. Это дает возможность (например, посредством взвешивания переменных) ориентировать метод на получение нужных типов. Это подчеркивает ценность классификации, при которой оптимизируется легко интерпретируемый критерий. Во втором примере мы столкнулись с некоторой неустойчивостью полученных классов, несмотря на то что их средние профили довольно ясно различались. Способ решения этой проблемы нам кажется довольно интересным, так как в нем используется одна из оригинальных черт метода динамических сгущений: пользователь может применять метрику, в которой ядра формируются из элементов выборки так, чтобы полученные классы различались в желаемом смысле. В нашем случае при относительной неопределенности классов выбор ядер является параметром, позволяющим пользователю устранить неопределенность и ориентировать классификацию в нужном направлении. В обоих примерах следует принимать во внимание природу классифицируемых объектов. Для них можно было бы выбрать не евклидово расстояние, а какую-нибудь другую меру близости, принимая во внимание различные аспекты поведения кривых. Ищутся способы характе- ризации кривых, отличные от значений ординаты по времени. Во всяком случае следует подчеркнуть, что самый простой вариант оказался вполне удовлетворительным как в смысле полученных результатов, так и в смысле возможности их интерпретации. 18.5. ПРИЛОЖЕНИЕ 1 При применении метода динамических сгущений необходимо задать D (х, А) расстояние между объектом х и классом Л, принадлежащими совокупности ?. Оно используется, с одной стороны, при нахождении разбиения Р исходя из фиксированных ядер. При этом объекты группируются вокруг наиболее близких к ним (в смысле принятого 347
расстояния) ядер. С другой стороны, для каждого класса Piy принадлежащего найденному разбиению Р, ищутся nt объектов (определяющих ядро At), наиболее близких к Pt. Можно показать, что при определенных ограничениях на функцию D алгоритм сходится, причем полученное разбиение и соответствующая система ядер минимизируют следующий критерий: S 2 *>(x,Pt). i I A Функция D выбирается в зависимости от принятого варианта метода динамических сгущений. 1. Если ядра составляются из элементов совокупности, то D (х, А) = р(х) 2 Р (У) d (х, у), (8) УЕЛ где р (г) — вес, приписанный объекту г. При этом минимизируемый критерий имеет вид: i{P (G (At), G (Pt))], где p (B) — вес; var (B) — дисперсия; G (В) — центр тяжести класса Б; d (х, у) — квадрат расстояния между точками х и у. Обычно выбирается р (х) = 1 V х 6 Е. В этом случае р (Pt) = card (Pt). 2. Если же в качестве ядер берутся центры тяжести, то ?>(*, A)=d(x, G(A))9 В этом случае 18.6. ПРИЛОЖЕНИЕ 2 W = | р (Pt) var (Pt). Преимущество использования элементов выборки в качестве ядер перед центрами тяжести заключается в том, что в этом случае получаются хорошо заполненные классы. В самом деле, при определении расстояния от объекта до ядра с помощью (8) к расстоянию до центра тяжести ядра прибавляется дисперсия этого ядра: D (х, А) = р(х) 2 Р (У) d (xy y) = p (x) p (A) U (х, G (А)) + + var (A)]. При этом «пустой внутри» класс будет содержать ядро с большой дисперсией, и поэтому в процессе работы алгоритма он будет иметь тенденцию к разделению. В этом, несомненно, особый интерес метода динамических сгущений по сравнению с классическими методами, оптимизирующими критерий межклассовой дисперсии. 348
ЛИТЕРАТУРА 1. Bruynooghe M. A978) Classification ascendante hierarchique des grands ensembles de donnees — L'algorithme rapide fonde sur la construction de voisinages reductibles. Les Cahiers de Гanalyse des Donnees JVfb 1. Dunod, Paris. 2. CanalM., Begey S. A978) Classification de la clientele basse tension sans chauffage electrique principal, en fonction de Tappel de puissance. Re- sultats detailles. Note EDF Direction des Etudes et des Recherches, № HR 24—0681/08. 3. P e 1 1 e t e r Y. A977) Application des methodes d'analyse des donnees a l'etude d'un echantillon de courbes de charges de clients Moyenne Tension. Note EDF Direction dec Etudes et Recherches, № HR 24—0490/04. 4. D i d а у Е. Optimisation en classification automatique et reconnaissance des formes. RAIRO. 5. Mol 1 i ereJ. L. A977) Sur une methodologie utilisant la methode des Nuees Dynamique appliquee a la classification de courbes de charge de clients EDF. Bulletin de la Societe franchise de classification. 6. Analyse typologique. Note GSIE—CFRO A969) (GSIE—CFRO Division In- formatique technique et scientifique, 69 rue Legendre 75017—Paris).
ОГЛАВЛЕНИЕ Анализ данных, прикладная статистика и построение общей теории автоматической классификации. Вступительная статья С. А. Айвазяна и В. М. Бухштабера 5 Предисловие 23 Литература 27 Глава 1. Основные понятия и формальные построения 29 1.1. Объекты, переменные и мера сходства 29 1.2. Метод динамических сгущений (МДС) 29 1.2.1. Пространство покрытий S 30 1.2.2. Структура и пространство представительств 30 1.2.3. Функция представительства 30 1.2.4. Функция назначения (отнесения объекта к классу) .... 31 1.2.5. Основные составные части и структура метода 31 1.3. Исследование одного важного частного случая 32 1.3.1. Пространства покрытий и представительств 32 1.3.2. Критерий и задача оптимизации 33 1.3.3. Функция представительства 33 1.3.4. Функция назначения 33 1.3.5. Построение алгоритма 33 1.3.6. Изучение свойств алгоритма 34 1.3.7. Свойства полученного решения 35 1.4. Рассмотрение других случаев 35 1.4.1. Несколько представителей одного класса 35 1.4.2. Случай существования непустой общей части у представителей всех k классов 35 1.4.3. Возможности выбора функций назначения и представительства 36 1.5. Некоторые методы, не укладывающиеся в общую схему МДС . . 36 1.6. Сравнение алгоритмов метода динамических сгущений 37 Литература 38 Глава 2. Исследование некоторых вариантов в случае единственного представителя каждого класса 39 2.1. Введение 39 2.2. Метод, использующий ядра постоянной (фиксированной) мощности 40 2.2.1. Пространство представительств 40 2.2.2. Оптимизационная задача 40 2.2.3. Замечания 41 350
2.3. Метод ядерного разбиения 41 2.3.1. Пространство представительств 41 2.3.2. Оптимизационная задача 42 2.4. Метод, использующий ядра переменной мощности . 42 2.4.1. Пространство представительств 42 2.4.2. Оптимизационная задача 43 2.5. Алгоритм 43 2.6. Метод центра тяжести 43 2.6.1. Пространство представительств 44 2.6.2. Оптимизационная задача 45 2.6.3. Алгоритм 45 2.6.4. Распространение на непрерывный случай . ....... 46 2.7. Выражение и сравнение различных критериев в рамках некоторого евклидова представления объектов , . , 50 Литература 51 Глава 3, Мультикритериальная классификация .......... 53 3.1, Введение 53 ЗЛА, Постановка задачи ....... 53 3.1,2. Связь с задачей классификаций при наличии ©граничений 53 3.2, Пространство покрытий и пространство представительств . ... 54 3.3, Критерий и оптимизационная задача ............ . . 55 3.4, Функция назначения и функция представительства . . . . . , . 56 3.5, Алгоритм , , , 56 3.6, Соотношение алгоритмов обычного и мультйкритериальйото методо в динамических сгущений 58 3.7, Классификация при требовании равенства о&ьемов классов . . . 58 3,7Л. Задача 58 3.7.2. Выбранный порядок .............. . . . . . 59 3.7.3. Представительство ...... 59 3.7.4. Мулы'всходсгш , . , , , 60 3.7.5. Мультикрйтерий W?*> п оптимизационная задача ..... 60 3.7.6. Функции и йред??авйтельегва и йззйзчеййя ........ 61 3.7.7. Описайие алгоритма . , , , 61 3.7.8. Искусственный пример . , , ,,...... . , . . . . . 62 3,7J. Выбор других геометрических койструкцйй 62 3,7Л0, Область применения ... 62 3.7,1Ь Программйая реализация алгоритма 63 3.8, Заклкиейке 63 3.9, Приложейие ,,....., 63 Литература . 63 Глава 4. Исследование решений, полученных е помощью алгоритмов /ИДО, на простом примере . . 66 4Л. Рассматриваемый пример .................... 65 4ЛЛ. Исходные данные. 65 4.L2. Ввелейие модельных конструкций МДС . , . . 65 4.2, Используемые алгоритмы . 66 4.3, Полученные результаты 67 4.3.1. Сравнение алгоритмов 67 351
4.3.2. Прадеревья с петлей в корне 69 4.3.3. Гистограмма решений 70 4.4. Заключение 71 Литература 71 Глава 5. Автоматическая классификация неполных данных .... 72 5.J. Введение 72 5.1.1. Задача 72 5.1.2. Предшествующие работы 72 5.1.3. Предлагаемый подход 73 5.2. Методология обработки недостающих данных 74 5.2.1. Оператор проектирования и подпространство, соответствующие неполно описанному объекту 74 5.2.2. Аппроксимация расстояний 76 5.2.3. Аппроксимация инерции 81 5.3. Свойства псевдоинерции 82 5.3.1. Напоминание некоторых понятий 82 5.3.2. Минимизация псевдоинерции 84 5.3.3. Отношение между псевдоцентрами тяжести 88 5.3.4. Разложение псевдоинерции 89 5.3.5. Сравнимость внутриклассовых псевдоинерций 91 5.4. Алгоритм 91 5.4.1. Напоминание сущности метода центра тяжести 91 5.4.2. Пространство представительств 92 5.4.3. Критерий 92 5.4.4. Функция представительства 93 5.4.5. Функция назначения 93 5.4.6. Сходимость 94 5.5. Результаты 94 5.5.1. Описание исходных данных 94 5.5.2. Реализованное моделирование 94 5.5.3. Процент «утерянных» данных 95 5.5.4. Взвешивание классифицируемых данных и процент неправильно расклассифицированных объектов 95 5.5.5. Возможный дефект алгоритма 96 5.6. Заключен ие 98 Литература 99 Глава 6. Факторный типологический анализ 100 6.1. Введение 100 6.2. Метод 101 6.2.1. Основные пространства и функции 101 6.2.2. Оптимизируемый критерий W 106 6.2.3. Алгоритм ANATYP-A 108 6.2.4. Метрики и функция представительства 111 6.3. Факторный типологический анализ соответствий 113 6.3.1. Обозначения 113 6.3.2. Проблемы, возникающие при выборе метрики %2 в факторном типологическом анализе и предлагаемое решение . . . . 114 352
6.3.3. Использование «локальных» метрик: исследование сходимости алгоритма ANATYP-B 120 6.3.4. Восстановление данных по ограниченному числу локальных факторов 123 6.4. Применение метода 130 6.4.1. Выбор входных параметров 130 6.4.2. Выбор меры близости D 132 6.4.3. Понятие устойчивых осей 133 6.4.4. Исключение влияния резко выделяющихся точек 137 6.4.5. Сходимость и критерии остановки алгоритма 143 6.5. Применение к сжатию и восстановлению спектральных характеристик речевого сигнала 144 6.5.1. Данные 144 6.5.2. Исследования, выполненные в Ланионе 145 6.5.3. Вклад факторного типологического анализа 146 6.5.4. Примеры анализа гласных 147 6.6. Заключение 148 Литература 149 Глава 7. Дискриминантный типологический анализ 150 7.1. Введение 150 7.1.1. Задача дискриминации 150 7.1.2. Отсрочка в обосновании априорного разбиения на семейства 150 7.1.3. Классификация и дискриминация: дискриминантный типологический анализ ! 151 7.2. Пространство представительств 152 7.3. Критерий 153 7.3.1. Определение . . ¦ 153 7.3.2. Частный случай 153 7.3.3. Математическое выражение критерия в терминах меры бли зости 153 7.4. Функция представительства 154 7.4.1. Поиск max /lnter (P, У) 156 7.4.2. Вывод: функция представительства 157 7.5. Функция назначения 158 7.6. Сходимость алгоритма 158 7.7. Программа информатики DISCRI 159 7.7.1. Входные данные 159 7.7.2. Выходные данные на каждой итерации 159 7.7.3. Выходные данные к моменту сходимости алгоритма . 159 7.8. Интерпретация результатов 160 7.8.1. Определение новых семейств 160 7.8.2. Решающее правило М . 160 7.8.3. Второй уровень дискриминации 161 7.9. Заключение 161 Литература 162 353
Глава 8. Пример применения дискриминантного типологического анализа при принятии решения в контроле качества 163 8.1. Введение 163 8.2. Описание данных 163 8.3. Применение дискриминантного типологического анализа . ... 166 8.3.1. Методология 166 8.3.2. Результаты 167 8.3.3. Сравнение дискриминантного типологического анализа с другими методами 173 8.3.4. Проблема экзаменационной выборки 175 8.4. Конструкция решающего правила 176 8.4.1. Решающие правила, выводимые из дискриминантного типологического анализа 176 8.4.2. Другие решающие правила 177 Литература 179 Глава 9. Типологическое агрегирование данных о предпочтениях 180 9.1. Введение 180 9.1.1. Данные и отношения предпочтения 180 9.1.2. Агрегирование данных о предпочтениях 182 9.1.3. Типологическое агрегирование данных о предпочтениях. . 185 9.2. Формализация задачи в рамках метода динамических сгущений 186 9.2.1. Пространство представительств 186 9.2.2. Оптимизируемый критерий 186 9.3. Алгоритм 187 9.3.1. Этап представления 187 9.3.2. Этап назначения 188 9.3.3. Сходимость и разные задачи 188 9.4. Заключение 189 Литература 190 Глава 10. Локально-линейные модели 192 10.1. Введение 192 10.1.1. Постановка задачи 192 10.1.2. Различные подходы 192 10.1.3. Предлагаемый подход 193 10.2. Формализация задачи 194 10.2.1. Необходимые теоретические факты и псевдообращение . . 194 10.2.2. Пространство представительств 198 10.2.3. Оптимизируемый критерий 199 10.3. Алгоритм и его свойства 199 10.3.1. Функции fug 199 10.3.2. Последовательности ип и vn 200 10.3.3. Сходимость алгоритма . , 200 10.3.4. Гребневая регрессия и регрессия по Марквардту . . . 202 10.3.5. Исключение эффекта «цилиндра» 207 10.3.6. Оптимальный выбор числа классов 209 10.3.7. Связь с критерием Шоу . 213 354
10.3.8. Метод прогноза, связанный с локальными линейными моделями 216 10.4. Входные и выходные данные программы 217 10.4.1. Общая схема алгоритма 218 10.5. Заключение 219 Литература 220 Глава 11. Типологическое сглаживание 221 11.1. Введение 221 11.2. Обозначения 222 11.3. Описание метода 223 11.3.1. Частный случай 223 11.3.2. Ограничения 224 11.3.3. Алгоритм 227 11.3.4. Решение и его свойства 229 11.4. Заключение 236 Литература 237 Глава 12. Адаптивные расстояния 238 12.1. Введение 238 12.2. Метод адаптивных расстояний 238 12.2.1. Пространство представительств 238 12.2.2. Алгоритм 238 12.2.3. Случай необратимой ковариационной матрицы 241 12.2.4. Пример применения метода адаптивных расстояний . . . 244 12.3. Обобщение метода адаптивных расстояний 248 12.3.1. Обозначения 248 12.3.2. Оптимизируемый критерий 248 12.3.3. Алгоритм 248 12.3.4. Сходимость алгоритма 249 12.3.5. Ограничения на конструкцию алгоритма 249 12.4. Случай, когда расстояния не являются квадратичными 250 12.4.1. Введение 250 12.4.2. Алгоритм 250 12.4.3. Критерий 251 12.5. Метод, в котором расстояние определяется одинаково для всех классов 251 12.5.1. Описание метода 251 12.5.2. Пример с искусственными данными 252 12.6. Заключение 253 Литература 256 Глава 13. Оптимальная адаптивная оцифровка 257 13.1. Введение 257 13.2. Переменные и их оцифровка 258 13.2.1. Общие определения 258 13.2.2. Связь между заменой переменных и оцифровкой . ... 259 13.2.3. Ограничения на оцифровку и множества оцифровок допустимых согласно природе переменных 259 355
13.3. Адаптивная оцифровка в случае известной фиксированной меры сходства 261 13.3.1. Выбор пространства покрытий 261 13.3.2. Структура представительства, пространство представительств 261 13.3.3. Оптимизируемый критерий 262 13.3.4. Задача оптимизации 263 13.3.5. Описание алгоритма 263 13.3.6. Сходимость алгоритма 270 13.3.7. Связь между каноническим анализом и оцифровкой номинальных данных 270 13.4. Адаптивная оцифровка при использовании адаптивных расстояний 272 13.4.1. Выбор пространства покрытий 5 272 13.4.2. Структура представительств, пространство представительств 272 13.4.3. Оптимизируемый критерий 273 13.4.4. Задача оптимизации 274 13.4.5. Описание алгоритма 274 13.4.6. Сходимость алгоритма 277 13.4.7. Связь между оцифровкой переменных и определением некоторых адаптивных расстояний 277 13.5. Пример применения оптимальной адаптивной оцифровки . . . 278 13.5.1. Данные 278 13.5.2. Результаты 279 Литература 284 Глава 14. Перекрестная классификация с помощью таблицы сопряженности 285 14.1. Постановка задачи 285 14.2. Описание метода 286 14.2.1. Метод динамических сгущений с использованием расстояния %2 и центра тяжести 286 14.2.2. Предлагаемый алгоритм 288 14.2.3. Сходимость последовательности (Р(п), Q(n)) 289 14.3. Примеры применения . . . . 290 14.3.1. Международное сравнение бюджетов времени 290 14.4. Заключение 294 Литература 294 Глава 15. Классификация при наличии ограничений 295 15Л* Введение 295 15.2. Метод, использующий цены создания классов 295 15.2.1. Введение 295 15.2.2. Описание метода 296 15.2.3. Заключение 298 15.3. Метод с ограничениями на разбиения 299 15.3.1. Введение 299 15.3.2. Описание метода и алгоритма 299 15.3.3. Применение классификации с ограничениями на разбиения 300 356
15.4. Классификация с ограничениями в виде графа связей 303 15.4.1. Введение 303 15.4.2. Изучение влияния весового множителя а 304 15.4.3. Цена перегруппировки двух элементов 305 15.4.4. Метод и алгоритм 305 15.4.5. Применение классификации с ограничениями в виде графа связей 306 Литература 306 Глава 16. Адаптивные ультраметрики и поиск оптимальной иерархии 308 16.1. Введение 308 16.2. Адаптивные ультраметрики 308 16.2.1. Постановка задачи 308 16.2.2. Формализация задачи 309 16.2.3. Алгоритм 310 16.2.4. Примеры применения МДС с использованием адаптивных ультраметрик 311 16.2.5. Заключение 315 16.3. Алгоритм поиска оптимальной иерархии 315 16.3.1. Постановка задачи 315 16.3.2. Формализация задачи 316 16.3.3. Алгоритм 317 16.4. Заключение 318 Литература 318 Глава 17. Применение метода динамических сгущений к информационным системам: реструктуризация программ и библиотек 319 17.1. Введение 319 17.2. Реструктуризация программ 319 17.3. Реструктуризация библиотек 320 17.4. Применение алгоритмов автоматической классификации .... 320 17.4.1. Применение алгоритма динамических сгущений 321 17.4.2. Применение алгоритмов иерархической классификации 321 17.5. Результаты 321 Литература 322 Глава 18. Классификация потребителей электроэнергии по графикам нагрузки с помощью метода динамических сгущений 323 18.1. Введение 323 18.2. Описание построения типологии с помощью алгоритма динамических сгущений 324 18.2.1. Основы метода 324 18.2.2. Оптимизируемые критерии . . 325 18.3. Классификация потребителей электроэнергии по графикам нагрузки 326 18.3.1. Введение 326 18.3.2. Графики нагрузки для потребителей электроэнергии низкого напряжения, для которых электроэнергия не является основным источником отопления 327 18.3.3. Графики нагрузки для потребителей электроэнергии среднего напряжения 341 18.4. Заключение 347 18.5. Приложение 1 347 18.6. Приложение 2 348 Литература 349 357
Методы анализа данных: Подход, основанный на методе М54 динамических сгущений: Пер. с фр. / Кол. авт. под рук. Э. Дидэ; Под ред. и с предисл. С. А. Айвазяна и В. М. Бух- штабера. — М.: Финансы и статистика, 1985. — 357 с, ил. — (Математико-статистические методы за рубежом). В пер.: 2 р. 50 к. 9500 экз. В книге французских авторов рассматривается один общий подход к статистической обработке данных, позволяющий наглядно представить анализируемые многомерные данные, строить и отбирать наиболее информативные показатели, решать задачу автоматической классификации объектов и признаков, производить анализ таблиц сопряженности. Для широкого круга статистиков, экономистов, математиков, инженеров, программистов. 1702060000—001 ББК 22.172 М 010@1)—85 ?8~" 517.8
МЕТОДЫ АНАЛИЗА ДАННЫХ. ПОДХОД, ОСНОВАННЫЙ НА МЕТОДЕ ДИНАМИЧЕСКИХ СГУЩЕНИЙ Книга одобрена на заседании редколлегии серии «Математико-статистические методы за рубежом» 31.08.81 Зав. редакцией Л. В. Павлюков Редактор Е. В. Крестьянинова Мл. редакторы И. В. Щербакова, О. Г. Виноградова Техн. редакторы К. К. Букалова, Л. Г. Челышева Корректоры Г. В. Хлощева, Г. А. Башарина, Н. П. Сперанская и И. П. Елкина Худож. редактор О. Н. Поленова ИБ № 1368 Сдано в набор 10.07.84. Подписано в печать 24.10.84. Формат 60X90Vie. Бум. офс. № 2. Гарнитура «Литературная». Печать высокая. Усл. п. л. 22,5. Усл. кр.-отт. 22,5. Уч.-изд, л. 22,02. Тираж 9500 экз. Заказ 303. Цена 2 р. 50 к. Издательство «Финансы и статистика», 101000, Москва, ул. Чернышевского, 7 Московская типография № 4 Союзполиграфпрома при Государственном комитете СССР по делам издательств, полиграфии и книжной торговли. 129041, Москва, Б. Переяславская ул., 46
В 1985 г. издательство «Финансы и статистика» выпустит книгу: Д. С ах ал. Технический прогресс. Концепции, модели, оценки (пер. с англ.). В работе американского ученого Д. Сахала исследуются различные подходы, позволяющие с помощью статистических методов измерить вклад технического прогресса в экономический рост. Автор анализирует социально-экономические последствия технического прогресса, вскрывая его внутренние механизмы. В книге рассматриваются также взаимоотношения науки и технологии. Работа представляет интерес для экономистов, статистиков, преподавателей и аспирантов вузов. Эту и другие книги издательства «Финансы и статистика» можно приобрести в местных книжных магазинах, распространяющих общественно-политическую литературу.