Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие
.pdfусловии,чтоградиент Lp повсемβi, µi равеннулю.Получаемзадачу выпуклогоквадратичногопрограммирования,вместонееможно решить эквивалентную ей двойственную задачу: найти максимум функции Lp по переменным µ и β при условии, что градиент лагранжиана по переменным R2, ξ и a равен нулю, βi ≥ 0, µi ≥ 0.
Вычислив градиент лагранжиана Lp по переменным R2, ξ, a и приравняв его нулю, получим
|
|
|
∂Lp |
n |
n |
|
||
|
|
|
= 0→1–∑µi |
= 0→∑µi =1; |
(31) |
|||
|
|
|
2 |
|||||
|
|
|
∂R |
i=1 |
i=1 |
|
||
|
|
∂Lp |
= 0 → C –µi −βi |
= 0 → C =µi +βi; |
(32) |
|||
|
|
|
||||||
|
|
∂ξi |
|
|
|
|||
∂Lp |
|
|
|
|
n |
n |
|
|
= 0→ − 2∑µiΦ(xi )+2a = 0→ a = ∑µiΦ(xi ). |
(33) |
|||||||
|
||||||||
∂a |
i=1 |
i=1 |
|
|||||
Подcтавив огpаничения типа pавенcтв (31)–(33) в лагpанжиан, исключим переменные R, ξ и a, скалярные произведения (xi, xj) заменим ядерной функцией k(xi, xj) = (Φ(xi), Φ(xj)) и получим двойcтвенную задачу:
|
|
|
n |
n |
n |
|
maxW :W = |
∑µik (xi,xi )−∑∑µiµjk (xi,x j ), |
|
||||
µ |
|
|
i=1 |
i=1 j=1 |
|
|
|
|
|
|
|||
n |
|
|
=1, 0 |
≤µ ≤C,i |
1,= …,n. |
(34) |
∑ |
µ |
i |
||||
|
|
i |
|
|
||
i=1
Таким обpазом, pешение исходной задачи (30) эквивалентно pешению задачи квадpатичного пpогpаммиpования (34), удовлетвоpяющего уcловиям Каpуша–Куна–Таккеpа. Запишем условия комплиментарности
βiξi = 0; |
(35) |
µi(R2 + ξi − ||Φ(xi) − a||2) = 0 |
(36) |
иприведемусловия(31),(32)и(35),(36)дляоптимальныхмножителей Лагранжа в более удобной форме:
– если µi = 0 и ξi = 0, отображение вектора xi, Φ(xi), находится либо внутри гиперсферы, либо на ее поверхности;
51
–если0<µi<C и ξi =0,отображениевектораxi,Φ(xi),находится на ее поверхности (xi – опорный вектор);
–если µi = С и ξi > 0, отображение вектора xi, Φ(xi), находится вне гиперсферы (xi – связанный опорный вектор).
Решение (33) разрежено по µ: вклад вносят только те векторы,
которым соответствуют значения µi > 0.
Итак, задача поиска радиуса R наименьшей гиперсферы, охватывающейвсевекторывпространствепризнаков,сведенакзадаче выпуклогоквадратичногопрограммирования(34).Посколькуядер-
ная матрица с элементами k(xi, xj) неотрицательно-определенная, задача остается выпуклой.
Воспользуемся гауссовым ядром. В этом случае сложность кластерных контуров будет регулироваться единственным параметром q, управляющим «пропускной способностью», или шириной ядра.
Для любого значения x Х определим расстояние от точки Φ(x)доцентрасферыa:r2(x) = ||Φ(x)−a||2.Учитываяразложение a (34), получим
r2(x) = k(x, x) − 2Σiµik(xi, x) + Σi,jµiµjk(xi, xj). |
(37) |
х2
0,5
0 |
|
|
– 0,5 |
|
|
–1,0 |
|
х1 |
– 0,5 |
0 |
Рис. 13. Кластеризация данных, состоящих из 183 точек
52
Все опорные векторы в пространстве признаков находятся на расстоянииR отцентрасферыa.ОтсюдаR=r(xi),гдеxi –(любой) опорный вектор.
В исходном пространстве контуры определяются множеством векторов x, удовлетворяющих условию
{x Х|r(x) = R}. |
(38) |
Этиконтурыинтерпретируютсякакграницы,образующиекластеры (рис. 13). Из (38) следует, что опорные векторы лежат на границахкластеров,связанныеопорные–снаружи(внеконтуров), остальные векторы – либо внутри контуров, либо на их границах. На рис. 13 опорные векторы обведены кружками, кластеры представлены точками различного цвета.
10.3. Маркировка кластеров
После определения границ кластеров требуется провести маркировку кластеров. Для этого используют геометрический подход сучастиемr(x),основанныйнаследующемнаблюдении:еслипара точекпринадлежитразнымкластерам,любойпуть,соединяющий этиточки,долженвыходитьзаграницысферырадиусаR сцентром в точке a в пространстве признаков. Следовательно, любой такой путь содержит точки y, для которых r(y) > R. Исходя из этого, для пар точек xi и xj, чьи образы находятся внутри или на поверхности сферы, определяют элементы Aij матрицы смежности A:
|
|
|
, |
1, если r |
(y)≤R y xi,x j |
||
Aij = |
|
|
|
0 иначе. |
|
|
|
|
|
|
|
Обычно проверяют заранее заданное число точек m, лежащих наотрезке[xi,xj]висходномпространстве,m≈10.Кластерыопределяют как связанные компоненты графа, индуцированного матрицей A.
Связанныеопорныевекторыэтойпроцедуройнеклассифицируются.Такиевекторылибооставляютнемаркированнымиирассматриваюткаквыбросы,либоотносятккластерусближайшимцентром.
53
10.4. Подбор значений гиперпараметров SVC-алгоритма
ПараметрС (0,1]контролируетдолюсвязанныхопорныхвекторов,иливыбросов.Всилуограниченийзадачи(34)верхняяграницадолисвязанныхопорныхвекторовопределяетсявеличиной p = 1/(nC). Подбор параметров рекомендуется начинать со значений p = 1/n и q = 1/maxi,j||xi − xj||2, при которых наблюдается небольшоечислоопорныхвекторов,одинбольшойкластериотсутствие связанных опорных векторов (рис. 14, а). Последующее увеличениеq приводиткростучислаопорныхвекторовикласте-
ров (рис. 14, б–г).
Если хорошего разбиения за счет увеличения q достичь не удается, увеличивают значение параметра p. При этом, так как часть опорныхвекторовтрансформируетсявсвязанные,аграницыкластеров становятся более гладкими, количество опорных векторов уменьшается (рис. 15): при С = 1 (p = 1/n, т. е. связанные опорные
а) х2 |
|
|
|
б) |
х2 |
|
|
|
0,5 |
|
|
|
|
0,5 |
|
|
|
0 |
|
|
|
|
0 |
|
|
|
– 0,5 |
|
|
|
– 0,5 |
|
|
|
|
–1,0 |
– 0,5 |
0 |
х1 |
–1,0 |
– 0,5 |
0 |
х1 |
|
в) х2 |
|
|
|
г) |
х2 |
|
|
|
0,5 |
|
|
|
|
0,5 |
|
|
|
0 |
|
|
|
|
0 |
|
|
|
– 0,5 |
|
|
|
– 0,5 |
|
|
|
|
–1,0 |
– 0,5 |
0 |
х1 |
–1,0 |
– 0,5 |
0 |
х1 |
|
Рис. 14. Изменение числа кластеров в зависимости от значения параметра q: a – q = 1; б – q = 20; в – q = 24; г – q = 48
54
а) |
|
|
|
|
б) |
|
|
|
|
х2 |
|
|
|
|
х2 |
|
|
|
|
3 |
|
|
|
|
3 |
|
|
|
|
2 |
|
|
|
|
2 |
|
|
|
|
1 |
|
|
|
|
1 |
|
|
|
|
0 |
|
|
|
|
0 |
|
|
|
|
–1 |
|
|
|
|
–1 |
|
|
|
|
–2 |
|
|
|
|
–2 |
|
|
|
|
–3 |
|
|
|
|
–3 |
|
|
|
|
–4 |
– 2 |
0 |
2 |
х1 |
–4 |
– 2 |
0 |
2 |
х1 |
|
|
Рис. 15. Кластеризация без связанных опорных векторов (a) и при их допущении (б)
векторы не допускаются) концентрические кольца не могут быть выделены в отдельные кластеры (см. рис. 15, а); при наличии связанныхопорныхвекторов(р=0,3приq=1,0)можновыделитьвсе три кластера (см. рис. 15, б).
При выборе оптимальных значений параметров q и p подходящие критерии – малое число опорных векторов (что гарантирует гладкие границы кластеров) и стабильность кластерного разбиения в некотором диапазоне значений параметров. Для сильно перекрывающихся кластеров следует задавать большие значения p. При этом внутрь сферы в пространстве признаков попадает лишь небольшое множество точек, формирующих основу кластеров. Оставшиесяточки–связанныеопорныевекторы,которыеможно/ нужно отнести к кластеру с ближайшим центром.
ПриSV-кластеризациинаиболеетрудоемкойпроцедуройявля- ется построение матрицы смежности из-за ее большой размерно- сти.В[41–43]предложеныпроцедуры,приводящиекрадикальному сокращениюразмерностиматрицысмежностиA и,какследствие, ксущественномуускорениюSVС-алгоритма.Вэтихпроцедурахвве- дено понятие векторов стабильного равновесия (stable equilibrium vector) (рис. 16). Их определение связано с решающей функцией
55
Рис.16. Топографическаякарта данных:сплошнаялиния – границы кластеров;стрелки–направление откаждой точки
ксоответствующемуейвекторустабильногоравновесия;
○–опорныевекторы;• – исходныевекторы;
+–векторыстабильногоравновесия
r2(x) (37), задающей границы кластеров. Вектором стабильного равновесия называется вектор x, удовлетворяющий условиюr2(x) = 0. В [41] доказано, что векторы исходного пространства, сходящиесявпроцессеградиентногоспускакодномуитомужевектору стабильного равновесия, принадлежат одному кластеру. Для кластеризацииисходныхвекторовдостаточномаркироватьтолько векторы стабильного равновесия. (Число таких векторов намного меньше исходного числа векторов, подлежащих маркировке.) Все исходные векторы маркируются согласно соответствующим им векторам стабильного равновесия.
БИБЛИОГРАФИЧЕСКИЙ СПИСОК
1.Вапник В. Н. Теория распознавания образов (статистические проблемы обучения) / В. Н. Вапник, А. Я. Червоненкис. – М. : Наука, 1974.
2.Vapnik V. N. Statistical Learning Theory / V. N. Vapnik. – N. Y. : John Wiley, 1998.
3.SupportVectorMachinesandKernelsforComputationalBiology/A.Ben- Hur[etal.]//PLoSComputationalBiology.–2008.–Vol.4,№10.–P.1–10.
4.AronszajnN.Theoryofreproducingkernels/N.Aronszajn//Transactions of the American Mathematical Society. – 1950. – Vol. 68, № 3. – P. 337–404.
5.KernelMethodsinComputationalBiology/ed.byB.Scholkopf,K.Tsuda, J.-Ph. Vert. – L. : The MIT Press, 2004.
6.Hoffman Th. Kernel methods in machine learning / Th. Hoffman, B. Scholkopf, A. Smola // The Annals of Statistics. – 2008. – Vol. 36, № 3. – Р. 1171–1220.
7.SmolaA.ATutorialonSupportVectorRegression/A.Smola,B.Scholkopf// NeuroCOLT2 Technical Report Series. – 1998. – Oct. – P. 1–71.
8.SmolaA.Atutorialonsupportvectorregression/A.Smola,B.Scholkopf// Statistics and Computing. – 2004. – Vol. 14. – P. 199–222.
9.Elisseeff A. Leave-one-out Error and Stability of Learning Algorithms with Applications / A. Elisseeff, M. Pontil // Advances in Learning Theory: Methods, Models and Applications / ed. by J. A. K. Suykens. – Amsterdam, 2003. – P. 111–125.
10.Bousquet O. Stability and Generalization / O. Bousquet, A. Elisseeff // Journal of Machine Learning Research. – 2002. – Vol. 2. – P. 499–526.
11.Joachims T. Estimating the Generalization Performance of a SVM Efficiently / T. Joachims // International Conference on Machine Learning – ICML. – Dortmund, 2000. – P. 431–439.
12.Fawcett T.ROCGraphs:NotesandPracticalConsiderationsforResearchers / T. Fawcett. – Palo Alto : Kluwer Academic Publishers, 2004.
13.BischlB.ResamplingMethodsinModelValidation/B.Bischl,O.Mers- mann,H.Trautmann//WEMACS,2010.–Dortmund,2010.–№11.–Р.14–31.
14.BeltramiM. Grid–QuadtreeAlgorithmforSupportVectorClassification ParametersSelection/M.Beltrami,A.C.LindbeckdaSilva//AppliedMathematical Sciences. – 2015. – Vol. 9, № 2. – Р. 75–82.
57
15.Keerthi S. S. Asymptotic behaviors of support vector machines with Gaussian kernel / S. S. Keerthi, C. J. Lin // Neural computation. – 2003. – Vol. 15, № 7. – P. 1667–1689.
16.XuJ.OptimizationofSimulatedAnnealingAlgorithmtotheParametersof SVMPredictionModel/J.Xu//MetallurgicalandMiningIndustry.–2016.–
№1. – P. 97–101.
17.Carrizosa E. A nested heuristic for parameter tuning in support vector machines / E. Carrizosa, B. Martín-Barragán, D. R. Morales // Computers & Operations Research. – 2014. – Vol. 43. – P. 328–334.
18.Tuning and evolution of support vector kernels / P. Koch [et al.] // Evolutionary Intelligence. – 2012. – Vol. 5, № 3. – P. 153–170.
19.MommaM.APatternSearchMethodforModelSelectionofSupportVector Regression/M.Momma,K.P.Bennett//SDM.–2002.–Vol.132.–P.261–274.
20.Fröhlich H. Efficient parameter selection for support vector machines in classificationandregressionviamodel-basedglobaloptimization/H.Fröhlich, A.Zell//NeuralNetworks:ProceedingsIEEEInternationalJointConference, 2005. – Tübingen, 2005. – Vol. 3. – P. 1431–1436.
21.LessmannS.Geneticalgorithmsforsupportvectormachinemodelselection/S.Lessmann,R.Stahlbock,S.F.Crone//NeuralNetworks:Proceedings IEEEInternationalJointConference,2006.–Vancouver,2006.–P.3063–3069.
22.Perolini A. Genetic Algorithms and Kernel Matrix-based Criteria Combined Approach to Perform Feature and Model Selection for Support Vector Machines / A. Perolini // Word Academy of Science, Engineering and Technology. – 2010. – Vol. 64, № 1. – Р. 85–94.
23.KeerthiS.S.Anefficientmethodforgradient-basedadaptationofhyper- parametersinSVMmodels/S.S.Keerthi,V.Sindhwani,O.Chapelle//Advances in neural information processing systems. – Vancouver, 2006. – P. 673–680.
24.Joachims T. Making Large-Scale SVM Learning Practical. Advanced KernelMethods– Support VectorLearning/ T.Joachims. –Cambridge: MIT Press, 1998.
25.Collobert R. SVMTorch: Support Vector Machines for Large-Scale Regression Problems / R. Collobert, S. Bengio // Journal of Machine Learning Research. – 2001. – Vol. 1. – P. 143–160.
26.Platt J. Fast Training of Support Vector Machines using Sequential MinimalOptimization,AdvancesinKernelMethods.SupportVectorLearning/ J. Platt. – Cambridge : MIT Press, 1998.
27.Improvements to the Platt’s SMO algorithm for SVM classifier design. Technical Report CD-99-14 / S. Keerthi [et al.]. – Singapore, 1999.
28.ChenP.-H.TrainingSupportVectorMachinesviaSMO-TypeDecompo- sitionMethods/P.-H.Chen,R.-E.Fan,C.-J.Lin//LectureNotesinArtifical Intelligence. – 2005. – Vol. 3734. – P. 45–62.
58
29.Keerthi S.ConvergenceofaGeneralizedSMOAlgorithmforSVMClassifier Design / S. Keerthi, E. Gilbert // Machine Learning. – 2002. – Vol. 46,
№1–3. – P. 351–363.
30.ImprovementstotheSMOalgorithmforSVMregression/S.Shevade[et al.] // Neural Networks : Proceedings IEEE International Joint Conference. – 2000. – Vol. 11, № 5. – P. 1188–1193.
31.MangasarianO.DataDiscriminationviaNonlinearGeneralizedSupport Vector Machines / O. Mangasarian, D. Musicant // OAI-PMH server at cs1. ist.psu.edu.
32.Successiveoverrelaxationforsupportvectorregression/Y.Quan[etal.]// Journal of Software. – 2004. – Vol. 15, № 2. – P. 200–206.
33.CauwenberghsG.IncrementalandDecrementalSupportVectorMachine Learning / G. Cauwenberghs, T. T. Poggio // Advances in Neural Information Processing Systems. – 2001. – Vol. 13. – P. 409–416.
34.IncrementalSupportVectorLearning:Analysis,ImplementationandAp- plications/P.Laskov[etal.]//OAI-PMHserverateprints.pascal-network.org.
35.MartinM.On-LineSupportVectorMachineRegression/M.Martin.– Berlin : ECML, 2002.
36.CawleyG.AGreedyTrainingAlgorithmforSparseLeast-SquaresSupport Vector Machines / G. Cawley, N. Talbot. – Berlin : ICANN, 2002.
37.EngelY.Sparseonlinegreedysupportvectorregression/Y.Engel,S.Mannor, R. Meir. – Cambridge ; Jerusalem ; Haifa : ECML, 2002.
38.Kivinen J. J. Online Learning with Kernels / J. J. Kivinen, S. Smola, R. Williamson // IEEE Transactions on Signal Processing. – 2004. – Vol. 52,
№8. – P. 2165–2176.
39.Vishwanathan S. Step Size Adaptation in Reproducing Kernel Hilbert Space / S. Vishwanathan, N. Schraudolph, A. Smola // Journal of Machine Learning Research. – 2005. – Vol. 6. – P. 1–48.
40.Support Vector Clustering / A. Ben-Hur [et al.] // Journal of Machine Learning Research. – 2001. – Vol. 2. – P. 125–137.
41.LeeJ.Animprovedclusterlabelingmethodforsupportvectorclustering/ J. Lee, D. Lee // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2005. – Vol. 27, № 3, Mar. – Р. 461–464.
42.Lee J. Dynamic Characterization of Cluster Structures for Robust and InductiveSupportVectorClustering/J.Lee,D.Lee//IEEETransactionsonPat- ternAnalysisandMachineIntelligence.–2006.–Vol.28,Dec.–P.1869—1874.
43.Fastsupport-basedclusteringmethodforlarge-scaleproblems/K.Jung [et al.] // Pattern Recognition. – 2010. – Vol. 43. – P. 1975–1983.
Кадырова Наталья Олеговна Павлова Людмила Владимировна
СТАТИСТИЧЕСКИЙ АНАЛИЗ БОЛЬШИХ ДАННЫХ: ПОДХОД НА ОСНОВЕ МАШИН ОПОРНЫХ ВЕКТОРОВ
Учебное пособие
Редактор О. В. Махрова Корректор Н. Б. Цветкова
Компьютерная верстка О. Б. Романенко Дизайн обложки О. В. Васильевой
Санитарно-эпидемиологическое заключение
№ 78.01.07.953.П.001342.01.07 от 24.01.2007 г.
Налоговая льгота – Общероссийский классификатор продукции ОК 005-93, т. 2; 95 3005 – учебная литература
Подписано в печать 07.07.2022. Формат 60×84/16. Печать цифровая. Усл. печ. л. 3,75. Тираж 50. Заказ 3535.
Отпечатано в Издательско-полиграфическом центре Политехнического университета.
195251, Санкт-Петербург, Политехническая ул., 29.
Тел.: (812) 552-77-17; 550-40-14.
