Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистические системы в управлении качеством промышленных коллекций. Часть 1. Задачи и программные средства управления качеством промышленных коллекц

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
41
правило, подобные программы и документация ориентированы на специалистов, хорошо знакомых с соответствующими метода­ми. Применять их целесообразно в тех случаях, когда требуется систематически решать задачи из той области, для которой пред­назначен специализированный пакет, а возможностей пакетов об­щего назначения недостаточно.
Пакеты общего назначения. Особое место на рынке зани- мают так называемые статистические пакеты общего назначе- ния. Отсутствие прямой ориентации на специфическую предмет­ную область, широкий диапазон статистических методов, друже­любный интерфейс привлекает к ним не только начинающих пользователей, но и специалистов. Универсальность этих пакетов особенно полезна:
• на начальных этапах обработки, когда речь идет о подборе мо­дели или метода анализа данных;
• когда поведение статистических данных выходит за рамки ис­пользовавшейся ранее модели;
• в процессе обучения основам статистики.
Именно пакеты общего назначения составляют большинство представленных на рынке программных продуктов. К таким па­кетам относятся системы Stadia и Statgraphics, а также пакеты SPSS, SYSTAT, S-plus и др.
Неполные пакеты общего назначения. Некоторое распро- странение на рынке статистических программ (особенно в нашей стране) имеют пакеты, которые можно назвать неполными паке­тами общего назначения. Чаще всего они содержат простейшие методы описательной статистики и некоторые методы из двух­трех других разделов статистики. Как правило, это либо недора­ботанные первые версии вновь создаваемых пакетов, либо выне­сенные на рынок программы для внутреннего, узкоспециализи­рованного использования, которые кроме ограниченности стати­стических методов, обычно характеризуются недоработанным интерфейсом и низким уровнем сервисных возможностей. Отли­чительной чертой таких пакетов является отсутствие или слабая методическая проработка документации.
42
Возможности табличных процессоров и баз данных
Вследствие большой популярности на Западе статистических методов обработки данных соответствующие средства стали включаться в табличные процессоры общего назначения (напри­мер, в Excel, Lotus и пр.), а также в некоторые базы данных. Наиболее часто в таких пакетах встречаются средства описатель­ной статистики, методы регрессионного анализа, анализа вре­менных рядов, сглаживания и прогнозирования.
Но в них, как правило, отсутствуют более сложные инстру­менты, например, методы многомерного анализа (кластерный, дискриминантный и пр.), кроме того, многие статистические ме­тоды запрограммированы без учета предназначения формул и границ применимости, что и приводит к грубым ошибкам. Как правило, в табличных процессорах отсутствует система подска­зок и пр.
Таким образом, если требуется получение и обоснование более точных результатов, надежнее экспортировать анализируе­мые данные из табличных процессоров и баз данных и обрабаты­вать их с помощью более мощных статистических пакетов.
2.3. Требования к статистическим программным комплексам общего назначения. Достоинства и недостатки
Статистические программные комплексы общего назначения
должны удовлетворять следующим требованиям [3]:
• наличие достаточно полного набора стандартных статистиче-
ских методов;
• простота для быстрого освоения и использования;
• соответствие высоким требованиям к вводу, преобразованиям и организации хранения данных, а также к обмену с широко рас­пространенными табличными процессорами и базами данных (Excel, dBase и т.п.);
• широкий набор средств графического представления данных и результатов обработки;
43
• удобные возможности для включения в отчеты таблиц исход­ных данных, графиков, промежуточных и окончательных резуль­татов обработки;
• наличие подробной документации, доступной для начинаю­щих и информативной для специалистов.
Среди отечественных разработчиков в первую очередь, следует отметить НПО «Информатика и компьютеры» (пакеты Stadia, CONAN и SIGN), «СТАТ-ДИАЛОГ» (пакеты «Мезозавр», «Класс-Мастер, «САНИ»), Центр статистических исследований МГУ (пакеты «Эвриста», «Сократ» «Росэкспертиза» (пакет «ОЛИМП: СтатЭксперт»). Главной и наиболее отличительной чертой российских пакетов является их ориентация на отече­ственных пользователей. Следствием этого является простота освоения, продуманный интерфейс, более содержательная кон­текстная подсказка по сути статистических методов.
Особенностью рынка статистического программного обеспе­чения в России стало четко обозначенное присутствие на нем представителей крупнейших международных корпораций, разра­батывающих и распространяющих статистические пакеты. В первую очередь это относится к корпорации SPSS, которой при-
надлежит около 4045 % продаж на мировом рынке статистиче­ских программ.
В середине 90-х годов XX в. в России создано представи­тельство фирмы SPSS на базе Института социологии – «Стати­стические системы и сервис», которое проводит активную поли­тику по распространению пакета SPSS, включая проведение ре­гулярных презентаций, подготовку материалов для средств мас­совой информации, создание русифицированной документации, проведение обучения и консультаций по прикладной статистике для пользователей.
Фирма ИнфоСтрой (Санкт-Петербург) является представите­лем Manugistics Inc. и занимается распространением в России па­кета Statgraphics.
Пакет Statistica, созданный в начале 90-х годов XX в. сразу для среды Windows американской фирмой StatSoft Inc., в России распространяет фирма СофтЛайн.
44
Производитель известного статистического пакета SAS глав­ный упор в своей деятельности делает на работы по созданию и внедрению комплексных интегрированных систем доставки ин­формации и поддержки принятия решений на уровне предприя­тия. При этом сами статистические методы являются лишь со­ставной частью современных версий SAS и не распространяются отдельно.
Многие западные программы лишены развитых средств опе­ративной помощи, подсказок и интерпретаций выводов, а их до­кументация нередко отличается запутанностью и большим объе­мом (SAS) или же отсутствием необходимых сведений типа списка формул, по которым можно проверить корректность про­изводимых выводов. Приятным исключением является пакет SPSS, документация которого понятна и систематизирована.
Другой особенностью многих западных пакетов является ориентация на командный язык, как один из главных инструмен­тов пользователя. Наличие подобного языка значительно расши­ряет возможности программ, позволяя пользователю реализовы­вать нестандартные подходы к обработке данных и добавлять но­вые процедуры. Доля и функции командного языка в различных пакетах могут варьироваться. Так в пакете S-plus (версия для Windows) командный язык играет доминирующую роль. Даже для проведения простейших стандартных вычислений пользова­тель должен составить программу на специальном языке. Весьма характерен командный язык и для пакета SPSS, имеется он и в пакетах Statgraphics и Statistica.
Положительным моментом в развитии указанных пакетов яв­ляется появление Windows-версий с современным интерфейсом.
Немаловажное значение имеет цена пакета. Профессио­нальные западные статистические пакеты (SPSS, SAS, BMDP и т. д.) обычно стоят от 2 до 10 тысяч долларов и более. Эти пакеты позволяют обрабатывать гигантские объемы данных, включают средства описания задач на встроенном языке и дают возмож­ность построения на их основе систем обработки информации для целых предприятий.
Пакеты, рассчитанные на массового пользователя, стоят де­шевле – обычно 500–1500 долларов. Эти пакеты отличаются от
45
профессиональных, прежде всего ориентацией на индивидуаль­ного пользователя: преимущественно диалоговый режимом рабо­ты, наличие ограничений по объему обрабатываемых данных и т.д. Имеются и более дешевые пакеты (200–300 долларов и ни­же), но они обычно обладают весьма скромными возможностями.
Таким образом, при использовании западных статистических пакетов пользователь должен обладать высокой квалификацией в статистике, а часто и в программировании. Он должен быть гото­вым к тщательному изучению сопроводительной документации.
В отличие от западных, многие отечественные программы в гораздо большей степени подходят для нужд среднего российско­го пользователя. Здесь основные операции обычно сразу доступ­ны из головных меню, а рутинные процедуры выполняются с ми­нимумом действий и разветвлений. Вся сопутствующая инфор­мация содержится в самой программной системе, включая спра­вочник и интерпретатор выводов. Так устроены наиболее попу­лярные отечественные статистические системы Stadia, Эвриста, Мезозавр, Олимп: СтатЭксперт, Статистик-Консультант и пр. Кроме того, наблюдается прикладная направленность указанных пакетов программ.
Одной из причин различия западных и российских СПК яв­ляется ориентация создателей зарубежных пакетов на западную культурно-информационную среду, которая характеризуется сле­дующими чертами:
• наличие значительно более высокой статистической подготов­ки у пользователей, которая закладывается обязательным изуче­нием прикладной статистики и методов анализа данных практи­чески во всех университетах, школах бизнеса и технических кол­леджах, а в ряде стран и в старших классах школ;
• наличие многочисленной специальной и популярной литера­туры по анализу данных, которую можно без труда найти в лю­бом ближайшем книжном магазине;
• большое количество консультационных фирм, где по те­лефону за несколько минут можно получить исчерпывающую информацию по применению вычислительных методов, а при необходимости – заказать решение и более сложных задач.
46
2.4. Статистические методы и модели, реализованные в статистических программных комплексах
Современная технология обработки данных, как и прежде, начинается с этапа подготовки к анализу, целью которого являет­ся приведение данных к виду, позволяющему провести последу­ющую их обработку, и предварительное формирование представ­лений о типе (структуре) анализируемых данных [4, 6, 11].
Обычно при проведении исследования в области качества промышленных коллекций одежды стремятся учесть максималь­ное количество характеристик, которые существенны при анализе исследуемого вопроса. При этом исследование может состоять из нескольких серий наблюдений, в которых в идентичных условиях регистрируются параметры отдельных объектов (например, де­фекты, выявленные в партии). Имея дело с серией наблюдений, следует стремиться выразить их в простой форме, которая по­зволила бы непосредственно или путем последующих вычисле­ний сделать из них заключения.
Этап подготовки данных к анализу включает:
ввод исходных данных в электронную таблицу системы; предварительное преобразование данных (получение вто-
ричных, расчетных показателей, группировки, ранжирование и т. д.) перед непосредственным применением конкретного статисти­ческого метода;
визуализацию данных при помощи того или иного типа гра-
фиков;
предварительный просчет основных (описательных) стати-
стик.
В практических задачах обычно имеется совокупность наблюдений x1, x2,..., xп, на основе которых требуется сделать те или иные выводы. Часто этих наблюдений много – несколько де­сятков, сотен или тысяч, так что возникает задача компактного описания имеющихся наблюдений. В идеале таким описанием могло бы быть утверждение, что x1, x2,…, хп являются выборкой,
то есть независимыми реализациями случайной величины  с из­вестным законом распределения F(x). Это позволило бы теорети-
47
чески провести расчеты всех необходимых исследователю харак­теристик наблюдаемого явления.
Однако далеко не всегда можно утверждать, что x1, x2,..., хп являются независимыми и одинаково распределенными случай­ными величинами. Во-первых, это не так-то просто проверить (для подтверждения этого требуются значительные объемы наблюдений и специальные, порой многочисленные, тесты). А во-вторых, часто заведомо известно, что это не так. Поэтому для компактного описания совокупности наблюдений x1, x2,..,хп ис­пользуют другие методы – методы описательной статистики.
2.4.1. Методы описательной статистики
Методами описательной статистики принято называть методы описания выборок x1, x2,…,хп с помощью различных пока­зателей и графиков.
Полезность методов описательной статистики состоит в том, что несколько простых и довольно информативных статистиче­ских показателей способны избавить нас от просмотра сотен, а порой и тысяч, значений выборки [11].
Описывающие выборку показатели можно разбить на не­сколько групп.
1. Показатели положения описывают положение данных на числовой оси. Примеры таких показателей – минимальный и мак­симальный элементы выборки (первый и последний член ва­риационного ряда), верхний и нижний квартили (они ограни­чивают зону, в которую попадают 50 % центральных элементов выборки). Наконец, сведения о середине совокупности могут дать выборочное среднее значение, выборочная медиана и другие ана­логичные характеристики.
2. Показатели разброса описывают степень разброса данных относительно своего центра. К ним в первую очередь относятся: дисперсия выборки, стандартное отклонение, размах выборки (разность между максимальным и минимальным элементами), межквартильный размах (разность между верхней и нижней квартилью), коэффициент эксцесса и т. п. По сути дела, эти по-
48
казатели говорят, насколько тесно основная масса данных груп­пируется около центра.
3. Показатели асимметрии. Третья группа показателей отве­чает на вопрос о симметрии распределения данных около своего центра. К ней можно отнести: коэффициент асимметрии, поло­жение выборочной медианы относительно выборочного среднего и относительно выборочных квартилей, гистограмму и т.д.
4. Показатели, описывающие закон распределения. Наконец, четвертая группа показателей описательной статистики дает представление собственно о законе распределения данных. Сюда относятся график и гистограммы и эмпирической функции рас­пределения, таблицы частот.
Применение показателей описательной статистики
Из перечисленных выше характеристик на практике чаще всего используются выборочное среднее, медиана и дисперсия (или стандартное отклонение). Однако для получения более точ­ных и достоверных выводов рекомендуется внимательно изучать и другие характеристики, а также обращать внимание на условия получения выборочных совокупностей.
Особое внимание следует обратить на наличие в выборке вы- бросов – грубых (ошибочных), сильно отличающихся от основ­ной массы, наблюдений. Даже одно или несколько грубых наблюдений способны сильно исказить такие выборочные харак­теристики, как среднее, дисперсия, стандартное отклонение, ко­эффициенты асимметрии и эксцесса. Проще всего обнаружить такие наблюдения с помощью перехода от выборки к ее вариаци­онному ряду или гистограммы с достаточно большим числом ин­тервалов группировки (см. п. 3.6.1).
Подозрение о присутствии таких наблюдений может возник­нуть, если выборочная медиана заметно отличается от выбороч­ного среднего, хотя в целом совокупность симметрична; если по­ложение медианы сильно несимметрично относительно мини­мального и максимального элементов выборки и т. д.
49
njn
.
x
n
njt
1
2.4.2. Наглядные методы описательной статистики
Группировка. Нередко (для облегчения регистрации или при невысокой точности измерений) данные группируют, т. е. число­вую ось разбивают на промежутки и для каждого промежутка указывают число nj элементов выборки xi,..., xn, которые в него попали (здесь j – номер промежутка). Ясно, что:
j
В этом случае в качестве выборочного среднего и дисперсии используют следующие величины. Пусть t1, t2,…, tj – центры (се­редины) выбранных промежутков. Тогда вместо выборочного среднего используют величину t:
j
В качестве выборочной дисперсии используют величину s2:
Точечная диаграмма. Данные, собранные в таблицу, нужда-
tx .
2
s .
n
1
j
n
j
j
t
)(
j
j
t
j
n
2
nt
j
ются в наглядном представлении. Одной из форм такого нагляд­ного представления служит точечная диаграмма: табличные данные отмечаются точками на числовой шкале. Если некоторое число встречается в таблице несколько раз, его представляют со­ответствующим количеством точек. Точечная диаграмма помога­ет построить график выборочной функции распределения.
Гистограмма. Графическое изображение зависимости ча­стоты попадания элементов выборки от соответствующего интервала группировки называется гистограммой выборки.
В качестве ординаты здесь берется не сама частота, а частота, деленная на длину интервала группировки. Согласно определе­нию площадь каждого столбца гистограммы пропорциональна частоте попадания наблюдений в данный интервал группировки (рис. 3).
50
Инструмент анализа Гистограмма строит таблицу распреде­ления частот данных и на ее основе создает диаграмму.
а б
Рисунок 3. Представление результатов анализа в виде
гистограммы в программах: а – Excel; б – Statistica
Перед использованием инструмента следует определить от­резки разбиения (число групп). В противном случае Excel ис­пользует равные интервалы количеством, приближенно равным квадратному корню из числа значений данных, начиная с мини­мального значения и заканчивая максимальным.
Число промежутков обычно выбирают от 5 до 15 или опреде­ляют по формуле Стерджесса, предусматривающую выделение оптимального числа групп при заданной численности совокупно­сти:
K = 1+ 3,322lgN,
где N – число признаков.
Величина интервала рассчитывается по формуле:
xx
h
minmax
.
К
Методы Описательной статистики не требуют трудоемких вычислений – они просты и наглядны, но в то же время позволя­ют выполнить предварительный анализ данных, который значи-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]