Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Статистические системы в управлении качеством промышленных коллекций. Часть 1. Задачи и программные средства управления качеством промышленных коллекц
.pdf
41
правило, подобные программы и документация ориентированы
на специалистов, хорошо знакомых с соответствующими методами. Применять их целесообразно в тех случаях, когда требуется
систематически решать задачи из той области, для которой предназначен специализированный пакет, а возможностей пакетов общего назначения недостаточно.
Пакеты общего назначения. Особое место на рынке зани-
мают так называемые статистические пакеты общего назначе-
ния. Отсутствие прямой ориентации на специфическую предметную область, широкий диапазон статистических методов, дружелюбный интерфейс привлекает к ним не только начинающих
пользователей, но и специалистов. Универсальность этих пакетов
особенно полезна:
• на начальных этапах обработки, когда речь идет о подборе модели или метода анализа данных;
• когда поведение статистических данных выходит за рамки использовавшейся ранее модели;
• в процессе обучения основам статистики.
Именно пакеты общего назначения составляют большинство
представленных на рынке программных продуктов. К таким пакетам относятся системы Stadia и Statgraphics, а также пакеты
SPSS, SYSTAT, S-plus и др.
Неполные пакеты общего назначения. Некоторое распро-
странение на рынке статистических программ (особенно в нашей
стране) имеют пакеты, которые можно назвать неполными пакетами общего назначения. Чаще всего они содержат простейшие
методы описательной статистики и некоторые методы из двухтрех других разделов статистики. Как правило, это либо недоработанные первые версии вновь создаваемых пакетов, либо вынесенные на рынок программы для внутреннего, узкоспециализированного использования, которые кроме ограниченности статистических методов, обычно характеризуются недоработанным
интерфейсом и низким уровнем сервисных возможностей. Отличительной чертой таких пакетов является отсутствие или слабая
методическая проработка документации.

42
Возможности табличных процессоров и баз данных
Вследствие большой популярности на Западе статистических
методов обработки данных соответствующие средства стали
включаться в табличные процессоры общего назначения (например, в Excel, Lotus и пр.), а также в некоторые базы данных.
Наиболее часто в таких пакетах встречаются средства описательной статистики, методы регрессионного анализа, анализа временных рядов, сглаживания и прогнозирования.
Но в них, как правило, отсутствуют более сложные инструменты, например, методы многомерного анализа (кластерный,
дискриминантный и пр.), кроме того, многие статистические методы запрограммированы без учета предназначения формул и
границ применимости, что и приводит к грубым ошибкам. Как
правило, в табличных процессорах отсутствует система подсказок и пр.
Таким образом, если требуется получение и обоснование
более точных результатов, надежнее экспортировать анализируемые данные из табличных процессоров и баз данных и обрабатывать их с помощью более мощных статистических пакетов.
2.3. Требования к статистическим программным комплексам
общего назначения. Достоинства и недостатки
Статистические программные комплексы общего назначения
должны удовлетворять следующим требованиям [3]:
• наличие достаточно полного набора стандартных статистиче-
ских методов;
• простота для быстрого освоения и использования;
• соответствие высоким требованиям к вводу, преобразованиям
и организации хранения данных, а также к обмену с широко распространенными табличными процессорами и базами данных
(Excel, dBase и т.п.);
• широкий набор средств графического представления данных
и результатов обработки;

43
• удобные возможности для включения в отчеты таблиц исходных данных, графиков, промежуточных и окончательных результатов обработки;
• наличие подробной документации, доступной для начинающих и информативной для специалистов.
Среди отечественных разработчиков в первую очередь,
следует отметить НПО «Информатика и компьютеры» (пакеты
Stadia, CONAN и SIGN), «СТАТ-ДИАЛОГ» (пакеты «Мезозавр»,
«Класс-Мастер, «САНИ»), Центр статистических исследований
МГУ (пакеты «Эвриста», «Сократ» «Росэкспертиза» (пакет
«ОЛИМП: СтатЭксперт»). Главной и наиболее отличительной
чертой российских пакетов является их ориентация на отечественных пользователей. Следствием этого является простота
освоения, продуманный интерфейс, более содержательная контекстная подсказка по сути статистических методов.
Особенностью рынка статистического программного обеспечения в России стало четко обозначенное присутствие на нем
представителей крупнейших международных корпораций, разрабатывающих и распространяющих статистические пакеты. В
первую очередь это относится к корпорации SPSS, которой при-
надлежит около 4045 % продаж на мировом рынке статистических программ.
В середине 90-х годов XX в. в России создано представительство фирмы SPSS на базе Института социологии – «Статистические системы и сервис», которое проводит активную политику по распространению пакета SPSS, включая проведение регулярных презентаций, подготовку материалов для средств массовой информации, создание русифицированной документации,
проведение обучения и консультаций по прикладной статистике
для пользователей.
Фирма ИнфоСтрой (Санкт-Петербург) является представителем Manugistics Inc. и занимается распространением в России пакета Statgraphics.
Пакет Statistica, созданный в начале 90-х годов XX в. сразу
для среды Windows американской фирмой StatSoft Inc., в России
распространяет фирма СофтЛайн.

44
Производитель известного статистического пакета SAS главный упор в своей деятельности делает на работы по созданию и
внедрению комплексных интегрированных систем доставки информации и поддержки принятия решений на уровне предприятия. При этом сами статистические методы являются лишь составной частью современных версий SAS и не распространяются
отдельно.
Многие западные программы лишены развитых средств оперативной помощи, подсказок и интерпретаций выводов, а их документация нередко отличается запутанностью и большим объемом (SAS) или же отсутствием необходимых сведений типа
списка формул, по которым можно проверить корректность производимых выводов. Приятным исключением является пакет
SPSS, документация которого понятна и систематизирована.
Другой особенностью многих западных пакетов является
ориентация на командный язык, как один из главных инструментов пользователя. Наличие подобного языка значительно расширяет возможности программ, позволяя пользователю реализовывать нестандартные подходы к обработке данных и добавлять новые процедуры. Доля и функции командного языка в различных
пакетах могут варьироваться. Так в пакете S-plus (версия для
Windows) командный язык играет доминирующую роль. Даже
для проведения простейших стандартных вычислений пользователь должен составить программу на специальном языке. Весьма
характерен командный язык и для пакета SPSS, имеется он и в
пакетах Statgraphics и Statistica.
Положительным моментом в развитии указанных пакетов является появление Windows-версий с современным интерфейсом.
Немаловажное значение имеет цена пакета. Профессиональные западные статистические пакеты (SPSS, SAS, BMDP и
т. д.) обычно стоят от 2 до 10 тысяч долларов и более. Эти пакеты
позволяют обрабатывать гигантские объемы данных, включают
средства описания задач на встроенном языке и дают возможность построения на их основе систем обработки информации
для целых предприятий.
Пакеты, рассчитанные на массового пользователя, стоят дешевле – обычно 500–1500 долларов. Эти пакеты отличаются от

45
профессиональных, прежде всего ориентацией на индивидуального пользователя: преимущественно диалоговый режимом работы, наличие ограничений по объему обрабатываемых данных и
т.д. Имеются и более дешевые пакеты (200–300 долларов и ниже), но они обычно обладают весьма скромными возможностями.
Таким образом, при использовании западных статистических
пакетов пользователь должен обладать высокой квалификацией в
статистике, а часто и в программировании. Он должен быть готовым к тщательному изучению сопроводительной документации.
В отличие от западных, многие отечественные программы в
гораздо большей степени подходят для нужд среднего российского пользователя. Здесь основные операции обычно сразу доступны из головных меню, а рутинные процедуры выполняются с минимумом действий и разветвлений. Вся сопутствующая информация содержится в самой программной системе, включая справочник и интерпретатор выводов. Так устроены наиболее популярные отечественные статистические системы Stadia, Эвриста,
Мезозавр, Олимп: СтатЭксперт, Статистик-Консультант и пр.
Кроме того, наблюдается прикладная направленность указанных
пакетов программ.
Одной из причин различия западных и российских СПК является ориентация создателей зарубежных пакетов на западную
культурно-информационную среду, которая характеризуется следующими чертами:
• наличие значительно более высокой статистической подготовки у пользователей, которая закладывается обязательным изучением прикладной статистики и методов анализа данных практически во всех университетах, школах бизнеса и технических колледжах, а в ряде стран и в старших классах школ;
• наличие многочисленной специальной и популярной литературы по анализу данных, которую можно без труда найти в любом ближайшем книжном магазине;
• большое количество консультационных фирм, где по телефону за несколько минут можно получить исчерпывающую
информацию по применению вычислительных методов, а при
необходимости – заказать решение и более сложных задач.

46
2.4. Статистические методы и модели, реализованные
в статистических программных комплексах
Современная технология обработки данных, как и прежде,
начинается с этапа подготовки к анализу, целью которого является приведение данных к виду, позволяющему провести последующую их обработку, и предварительное формирование представлений о типе (структуре) анализируемых данных [4, 6, 11].
Обычно при проведении исследования в области качества
промышленных коллекций одежды стремятся учесть максимальное количество характеристик, которые существенны при анализе
исследуемого вопроса. При этом исследование может состоять из
нескольких серий наблюдений, в которых в идентичных условиях
регистрируются параметры отдельных объектов (например, дефекты, выявленные в партии). Имея дело с серией наблюдений,
следует стремиться выразить их в простой форме, которая позволила бы непосредственно или путем последующих вычислений сделать из них заключения.
Этап подготовки данных к анализу включает:
ввод исходных данных в электронную таблицу системы;
предварительное преобразование данных (получение вто-
ричных, расчетных показателей, группировки, ранжирование и т.
д.) перед непосредственным применением конкретного статистического метода;
визуализацию данных при помощи того или иного типа гра-
фиков;
предварительный просчет основных (описательных) стати-
стик.
В практических задачах обычно имеется совокупность
наблюдений x1, x2,..., xп, на основе которых требуется сделать те
или иные выводы. Часто этих наблюдений много – несколько десятков, сотен или тысяч, так что возникает задача компактного
описания имеющихся наблюдений. В идеале таким описанием
могло бы быть утверждение, что x1, x2,…, хп являются выборкой,
то есть независимыми реализациями случайной величины с известным законом распределения F(x). Это позволило бы теорети-

47
чески провести расчеты всех необходимых исследователю характеристик наблюдаемого явления.
Однако далеко не всегда можно утверждать, что x1, x2,..., хп
являются независимыми и одинаково распределенными случайными величинами. Во-первых, это не так-то просто проверить
(для подтверждения этого требуются значительные объемы
наблюдений и специальные, порой многочисленные, тесты). А
во-вторых, часто заведомо известно, что это не так. Поэтому для
компактного описания совокупности наблюдений x1, x2,..,хп используют другие методы – методы описательной статистики.
2.4.1. Методы описательной статистики
Методами описательной статистики принято называть
методы описания выборок x1, x2,…,хп с помощью различных показателей и графиков.
Полезность методов описательной статистики состоит в том,
что несколько простых и довольно информативных статистических показателей способны избавить нас от просмотра сотен, а
порой и тысяч, значений выборки [11].
Описывающие выборку показатели можно разбить на несколько групп.
1. Показатели положения описывают положение данных на
числовой оси. Примеры таких показателей – минимальный и максимальный элементы выборки (первый и последний член вариационного ряда), верхний и нижний квартили (они ограничивают зону, в которую попадают 50 % центральных элементов
выборки). Наконец, сведения о середине совокупности могут дать
выборочное среднее значение, выборочная медиана и другие аналогичные характеристики.
2. Показатели разброса описывают степень разброса данных
относительно своего центра. К ним в первую очередь относятся:
дисперсия выборки, стандартное отклонение, размах выборки
(разность между максимальным и минимальным элементами),
межквартильный размах (разность между верхней и нижней
квартилью), коэффициент эксцесса и т. п. По сути дела, эти по-

48
казатели говорят, насколько тесно основная масса данных группируется около центра.
3. Показатели асимметрии. Третья группа показателей отвечает на вопрос о симметрии распределения данных около своего
центра. К ней можно отнести: коэффициент асимметрии, положение выборочной медианы относительно выборочного среднего
и относительно выборочных квартилей, гистограмму и т.д.
4. Показатели, описывающие закон распределения. Наконец,
четвертая группа показателей описательной статистики дает
представление собственно о законе распределения данных. Сюда
относятся график и гистограммы и эмпирической функции распределения, таблицы частот.
Применение показателей описательной статистики
Из перечисленных выше характеристик на практике чаще
всего используются выборочное среднее, медиана и дисперсия
(или стандартное отклонение). Однако для получения более точных и достоверных выводов рекомендуется внимательно изучать
и другие характеристики, а также обращать внимание на условия
получения выборочных совокупностей.
Особое внимание следует обратить на наличие в выборке вы-
бросов – грубых (ошибочных), сильно отличающихся от основной массы, наблюдений. Даже одно или несколько грубых
наблюдений способны сильно исказить такие выборочные характеристики, как среднее, дисперсия, стандартное отклонение, коэффициенты асимметрии и эксцесса. Проще всего обнаружить
такие наблюдения с помощью перехода от выборки к ее вариационному ряду или гистограммы с достаточно большим числом интервалов группировки (см. п. 3.6.1).
Подозрение о присутствии таких наблюдений может возникнуть, если выборочная медиана заметно отличается от выборочного среднего, хотя в целом совокупность симметрична; если положение медианы сильно несимметрично относительно минимального и максимального элементов выборки и т. д.

49
njn
.
x
n
njt
1
2.4.2. Наглядные методы описательной статистики
Группировка. Нередко (для облегчения регистрации или при
невысокой точности измерений) данные группируют, т. е. числовую ось разбивают на промежутки и для каждого промежутка
указывают число nj элементов выборки xi,..., xn, которые в него
попали (здесь j – номер промежутка). Ясно, что:
j
В этом случае в качестве выборочного среднего и дисперсии
используют следующие величины. Пусть t1, t2,…, tj – центры (середины) выбранных промежутков. Тогда вместо выборочного
среднего используют величину t:
j
В качестве выборочной дисперсии используют величину s2:
Точечная диаграмма. Данные, собранные в таблицу, нужда-
tx .
2
s .
n
1
j
n
j
j
t
)(
j
j
t
j
n
2
nt
j
ются в наглядном представлении. Одной из форм такого наглядного представления служит точечная диаграмма: табличные
данные отмечаются точками на числовой шкале. Если некоторое
число встречается в таблице несколько раз, его представляют соответствующим количеством точек. Точечная диаграмма помогает построить график выборочной функции распределения.
Гистограмма. Графическое изображение зависимости частоты попадания элементов выборки от соответствующего
интервала группировки называется гистограммой выборки.
В качестве ординаты здесь берется не сама частота, а частота,
деленная на длину интервала группировки. Согласно определению площадь каждого столбца гистограммы пропорциональна
частоте попадания наблюдений в данный интервал группировки
(рис. 3).

50
Инструмент анализа Гистограмма строит таблицу распределения частот данных и на ее основе создает диаграмму.
а б
Рисунок 3. Представление результатов анализа в виде
гистограммы в программах: а – Excel; б – Statistica
Перед использованием инструмента следует определить отрезки разбиения (число групп). В противном случае Excel использует равные интервалы количеством, приближенно равным
квадратному корню из числа значений данных, начиная с минимального значения и заканчивая максимальным.
Число промежутков обычно выбирают от 5 до 15 или определяют по формуле Стерджесса, предусматривающую выделение
оптимального числа групп при заданной численности совокупности:
K = 1+ 3,322lgN,
где N – число признаков.
Величина интервала рассчитывается по формуле:
xx
h
minmax
.
К
Методы Описательной статистики не требуют трудоемких
вычислений – они просты и наглядны, но в то же время позволяют выполнить предварительный анализ данных, который значи-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
