Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Аудит информационной безопасности. Прикладная статистика. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
организовать специальные частичные или сплошные контрольные про-
Ошибки наблюдения
Ошибка регистрации
Ошибка
репрезентативности
Случайные
Систематические
Случайные
Преднамеренные
Систематические
Непреднамеренные
верки правильности заполнения статистических формуляров;
провести логический и арифметический контроль полученных данных после окончания сбора информации.
Классификация ошибок статистического наблюдения показана на рис. 2.1.
Рис. 2.1. Классификация ошибок статистического наблюдения
Все возможные ошибки в зависимости от причин возникновения можно разделить на ошибки регистрации и ошибки репрезентативности.
Ошибки регистрации — это отличие между значением показателя, полу­ченного в ходе наблюдения, и фактическим его значением.
Систематические ошибки возникают систематически при проведении любых измерений и исследований.
Преднамеренные ошибки — сознательные искажения фактов.
Регулярные намеренные ошибки регистрации обладают направленностью либо к увеличению, либо к уменьшению значений характеристик по каждой единице наблюдения, а значит, величина показателя по совокупности в целом будет содержать в себе накопленную погрешность. Примером систематической преднамеренной ошибки регистрации может служить округление стажа работы сотрудников до целых значений в годах в меньшую сторону.
41
Систематические непреднамеренные ошибки допускаются неумышленно вследствие пропусков в записях, забывания отдельных фактов, погрешности приборов, недостаточной реакции человека и т.д.
Случайные ошибки — это следствие невнимательности при регистрации ответов или подсчете итогов.
Ошибки репрезентативности, в отличие от ошибок регистрации, харак­терны лишь для несплошного наблюдения. Возникают они потому, что ото­бранная и обследованная совокупность недостаточно точно воспроизводит (ре­презентирует) всю генеральную (исходную) совокупность в целом.
Ошибкой репрезентативности называется отклонение значения показате­ля обследованной совокупности от его величины по исходной совокупности.
Ошибки репрезентативности, так же как и ошибки регистрации бывают случайными и систематическими.
Случайные ошибки репрезентативности возникают, когда отобранная со­вокупность неполно воспроизводит всю совокупность в целом. Ее величина может быть оценена.
Систематические ошибки репрезентативности появляются из-за наруше­ния принципов отбора единиц, которые должны быть подвергнуты наблюде­нию, из исходной совокупности.
Ошибка репрезентативности количественного признака показывает, на какую величину средние значения выборочной совокупности могут отличаться от средних значений генеральной совокупности.
Она будет иметь место во всех без исключения выборочных наблюдени­ях. Задача заключается в том, чтобы минимизировать эту ошибку. Ошибка ре­презентативности будет тем меньше, а, соответственно, результаты выборочно­го наблюдения тем точнее, чем больше выборочная совокупность и чем более однородна исследуемая генеральная совокупность.
В соответствии с положениями математической статистики, величина ошибки репрезентативности обратно пропорциональна корню квадратному из числа единиц, попавших в выборку. Это означает, что для уменьшения ошибки репрезентативности в n раз необходимо число единиц выборочной совокупно­сти увеличить в n2 раз. Следовательно, для уменьшения ошибки в 2 раза выбо­рочную совокупность придется увеличить в 4 раза (22), а для уменьшения ошибки в 3, 4 или 5 раз число единиц выборки придется соответственно увели­чить в 9, 16 или 25 раз.
42
Уточним, что понимается под однородной совокупностью. Совокупность
13 3 1 10 5 11 9 1 2 1
5,6
10
   
(1 )PP 
0,25
будет тем однороднее, чем меньшей будет разница между конкретными вели­чинами единиц совокупности и средней величиной данного признака во всей совокупности.
Например, данные выборочного исследования показали, что в одном под­разделении сроки службы 10 персональных компьютеров до первого ремонта составили (в годах) 13, 3, 1, 10, 5, 11, 9, 1, 2, 1. Средний срок службы одного
персонального компьютера равен
года.
В другом подразделении сроки оказались: 7, 5, 6, 4, 6, 6, 7, 5, 4, 6 лет. Средний срок службы — 5,6 года. Как видим, средний срок сроки службы персональных компьютеров в обоих подразделениях одинаков. Но если во втором подразде­лении конкретные сроки службы каждого из 10 компьютеров незначительно отличаются от среднего значения, то в первом подразделении разница между сроками службы отдельных компьютеров и средним сроком службы довольно существенна. Следовательно, совокупность для второго подразделения более однородна, чем для первого.
Для определения меры однородности совокупности теория статистики предлагает специальный показатель разбросанности (колеблемости) численных значений признака, из которых выводится средняя. Этот показатель называется «среднее квадратическое отклонение».
Остановимся на определении среднего квадратического отклонения каче­ственного признака. Задача выборочного наблюдения — определение доли яв­ления, обладающего данным признаком. При этом если известна доля явлений, обладающих исследуемым признаком, то путем ее вычитания из единицы или из 100 % (так обозначается величина всего явления) можно определить долю явлений, не обладающих данным признаком. Например, если мужчины состав­ляют 65 % от общего числа администраторов безопасности (0,65), то доля жен­щин, занимающих эту должность, составит 35 % (0,35). Следовательно, если долю явлений, обладающих исследуемым признаком, обозначить как Р, то доля явлений, не обладающих этим признаком, может быть обозначена как 1-Р.
Среднее квадратическое отклонение качественного признака определяет­ся по формуле:
. В нашем примере Р = 0,65;
= 0,48.
На практике величину среднеквадратического отклонения, нужную для определения объема выборки, можно получить по данным пробного исследова­ния или по предыдущим исследованиям. При исследовании качественного при­знака, чтобы не проводить предварительные исследования, берут максимальное
43
значение 2, которое равняется 0,25 (наихудший вариант, требующий наиболь-
22
2
tn
2
шего размера выборки). Следующей задачей выборочного наблюдения стано­вится определение вероятности того, что выборочная совокупность будет отли­чаться от генеральной в пределах ошибки выборки. Для этого в формулу ошиб­ки выборки включают гарантийный коэффициент t.
Гарантийный коэффициент t означает, что при t = 1 из 1 000 только в 682 случаях средняя величина исследуемого признака выборки будет отли­чаться от средней генеральной совокупности в пределах заданной ошибки. Описанная зависимость получила название интегральной функции Лапласа. Для удобства использования она табулирована (см. прил. 1).
Определение степени точности, с которой нужно гарантировать пределы ошибки репрезентативности, целиком зависит от характера исследуемой про­блемы. Если по практическим соображениям нельзя допустить, чтобы фактиче­ская ошибка репрезентативности превосходила 3 случая из 1 000, то необходи­мо исходить из доверительной вероятности, равной 0,997 (при этом t = 3). Если же можно допустить ошибку в 5 случаях из 100, то следует исходить из довери­тельной вероятности, равной 0,955 (при этом t = 2).
Практический опыт показывает, что доверительная вероятность 0,955 и t = 2 является оптимальным вариантом.
Расчет величины выборочной совокупности, как правило, выполняет спе­циалист-математик, но специалисты в области информационной безопасности, участвующие в выборочном наблюдении, не должны вслепую полагаться на математика. Надо уметь проверить выполненные расчеты.
Определение необходимого объема выборочной совокупности является важнейшим вопросом проведения выборочного наблюдения. Излишняя чис­ленность выборки влечет увеличение стоимости исследования и сроков его проведения. Его недостаточность приведет к увеличению ошибки.
Значит, нужно решить оптимизационную задачу: каков объем выборки, чтобы при ее минимальном объеме получить максимально точные данные?
В необходимых случаях можно воспользоваться для расчета следующей простой формулой:
где — предельная ошибка выборки.
Если t = 2, 2 = 0,25,
,
= 0,052, то:
44
2
2
2 0,25
400
0,05
n
.
Во многих исследованиях, посвященных правовым вопросам, когда гене­ральная совокупность достаточно велика и предельная ошибка выборки дости­гает 5 %, выборка в 400 единиц, как правило, обеспечивает репрезентативность, а следовательно, позволяет правильно судить обо всей генеральной совокупно­сти, разумеется, при соблюдении принципа случайного отбора единиц выбо­рочной совокупности.
Чтобы довести объем выборки до определенного допустимого минимума, не следует гнаться за чрезмерным уменьшением предела возможности ошибки выборки и чрезмерно высокой гарантией ее достоверности. Чрезмерность все­гда приводит к неоправданному увеличению объема выборки и, следовательно, к повышению затрат, не вызываемых зачастую задачами исследования.
Для облегчения применения выборочных исследований существуют таб­лицы, по которым можно получить необходимые сведения, о пределе ошибки выборки при данном числе наблюдений и об объеме выборки, необходимом для того, чтобы ошибка репрезентативности не превысила данного предела.
Для выявления и устранения ошибок, допущенных при регистрации, мо­жет применяться контроль полноты, счетный (математический, арифметиче­ский) и логический контроль собранного материала.
Контроль достоверности осуществляется на всех этапах сбора и обработки статистических данных, однако особое значение имеет контроль на начальных стадиях наблюдения, так как ошибки, допущенные на этом этапе, трудно или не­возможно исправить впоследствии. Влияют же они на все последующие расчеты.
Контроль достоверности статистических данных предполагает, прежде всего, проверку полноты собранных данных. Она состоит в выяснении, от всех ли источников поступили сведения, все ли показатели отражены в документах первичного учета и формах отчетов, например, все ли отделы фирмы предста­вили отчеты.
Важным методом контроля достоверности статистических данных явля­ется арифметический контроль. Эта форма контроля основывается на использо­вании математических взаимосвязей между различными показателями отчета. Примером могут служить балансовые связи, при которых сумма расчлененной по различным признакам совокупности равна итоговым показателям. Пример: сумма выходов из строя оборудования по всем причинам должна быть равна общему количеству выходов оборудования из строя.
45
Если арифметический контроль покажет, что данная зависимость не вы­полняется, это будет свидетельствовать о недостоверности собранных данных. Поэтому в программу статистического наблюдения целесообразно включать показатели, которые дают возможность проведения арифметического контроля.
Счетный контроль заключается в проверке точности арифметических расчетов, применявшихся при составлении отчетности или заполнении форму­ляров обследования.
Для выявления ошибок, наряду с арифметическим контролем, который позволяет устранить лишь ошибки вычислений, применяют также логический контроль. Он тоже основывается на взаимосвязи показателей, но не количе­ственных, а смысловых (логических).
Логический контроль ставит своей целью определить соответствие ответа поставленному вопросу или соответствие между ответами на разные вопросы. Например, если на вопрос «пол» обнаружен ответ «26», то ясно, что ответ в данном случае не соответствует вопросу, что это ошибка, вызванная записью ответа не в той строке или графе (перепутали графы «пол» и «возраст»).
Если же на вопрос «возраст» стоит ответ «10 лет», а на вопрос об образо­вании зафиксирован ответ «высшее», то очевидно, что по отдельности каждый ответ соответствует вопросу, но между собой эти ответы не согласуются. Что­бы установить, в каком из них содержится ошибка, следует рассмотреть ответы на другие вопросы, контролирующие первые. Так, если в рассматриваемом случае в графе «место работы» записано наименование определенного пред­приятия и в графе «семейное положение» указано «замужем», то ясно, что была допущена ошибка в возрасте.
Логический контроль используется, в частности, при заполнении листка учета кадров на сотрудника организации. Если, например, принимаемый со­трудник ранее работал инженером, то, по логике, он не может обладать лишь средним образованием. Здесь связь осуществлена по признакам (графам) «обра­зование» и «занятие».
Обычно для исправления ошибок, выявленных в ходе логического кон­троля, требуется повторно обратиться к источнику сведений.
Вопросы для самоконтроля
1. Что такое статистическое наблюдение, и каким требованиям оно долж-
но удовлетворять?
2. Определите основные задачи и направления применения материалов
статистики в науке и практике обеспечения информационной безопасности.
46
3. Определите объекты наблюдения статистики информационной без-
опасности.
4. Что такое единица наблюдения, единица совокупности и единица из-
мерения в статистике информационной безопасности?
5. Назовите организационные формы и виды наблюдения в статистике
информационной безопасности.
6. Раскройте особенности и научные основы проведения выборочного
наблюдения. Что такое ошибка репрезентативности?
7. Какими методами проверяется достоверность данных статистики ин-
формационной безопасности?
8. Укажите факторы, определяющие границы достоверности статистиче-
ской информации.
9. Как система учета правонарушений в области информационной без-
опасности влияет на степень соответствия статистических данных об инциден­тах действительному положению дел?
10. Чем отличается знание о массе правонарушений в области информа-
ционной безопасности от знания об отдельном правонарушении?
47
ГЛАВА 3. СВОДКА И ГРУППИРОВКА МАТЕРИАЛОВ
СТАТИСТИЧЕСКОГО НАБЛЮДЕНИЯ
В главе аргументирована необходимость проведения статистической сводки и группировки, приведены основные термины, использующиеся на этом этапе статистического исследования.
При рассмотрении группировки приведены и обоснованы основные пра­вила выбора группировочных признаков. Уделено внимание анализу видов группировок.
В качестве способов представления сгруппированных и сведенных дан­ных описаны различные виды статистических таблиц и диаграмм.
3.1. Статистическая сводка
Собираемые в ходе статистического наблюдения сведения характеризуют лишь отдельные элементы — единицы совокупности, но не всю изучаемую со­вокупность. Для того чтобы выявить характерные черты полученной совокуп­ности и обнаружить объективные связи между ее элементами, необходимо си­стематизировать весь собранный материал, подсчитать данные, расчленить по группам, т.е. соединить в целое, свести в единую систему, суммировать и подытожить результаты подсчетов, что достигается на втором этапе всякой ста­тистической работы — статистической сводке.
Этап статистической сводки не менее важен, чем этап наблюдения, так как только при правильной обработке первичных материалов можно выявить подлинный характер (тенденции, закономерности) полученных сведений. Именно в результате этих действий образуются статистические качественно однородные совокупности, появляется возможность оперировать такими коли­чественными показателями, как абсолютные цифры. На этапе же статистиче­ского наблюдения были получены лишь единичные, разрозненные статистиче­ские данные.
Статистическая сводка представляет собой научную обработку материа­лов статистического наблюдения (подсчет первичного статистического матери­ала), подытоживание отдельных единиц и сведения их в массы или совокупно­сти в целях получения обобщенной характеристики изучаемого явления по ря­ду существенных для него признаков.
48
Единица совокупности всегда характеризуется различными качественны­ми (атрибутивными) и количественными признаками. Одни из них непосред­ственно относятся к определению единиц, входящих в совокупность, и могут быть одинаковыми для всех них. Вместе с тем ряд признаков у этих единиц со­вокупности различается, варьирует. Именно такие признаки, варьирующие от единицы к единице, составляют специфическую черту совокупности, делаю­щую ее предметом изучения статистики. Такие признаки называются статисти­ческими.
Статистические признаки единиц совокупности делают ее не просто арифметической суммой величин. Такая совокупность подчинена определен­ным статистическим закономерностям, в основе которых лежит действие зако­на больших чисел.
Различают сводку в узком и широком понимании.
Сводка в широком понимании — научная обработка первичных стати­стических сведений. Она включает в себя группировки исследуемых явлений, получение системы показателей для характеристики типичных групп, подсчет общих и групповых итогов, внесение их в формы статистических таблиц.
Сводка в узком понимании представляет собой действие по подсчету ито­говых данных.
Сводка статистических материалов должна осуществляться на основе раз­работанной программы. Программа статистической сводки должна содержать:
перечень групп изучаемой совокупности по отдельным признакам;
перечень показателей, которые надо подсчитать для характеристики
каждой группы;
территориальные границы, в которых надо произвести разработку ма- териала (область, город и т.п.);
степень детализации ведомственной подчиненности, в пределах которой должны быть сведены материалы (до уровня организации, отдела, сотрудника).
Содержание программы сводки определяется теми задачами, которые стоят перед конкретным исследованием.
Сводка статистических данных может производиться в централизованном (все первичные статистические документы поступают в единый статистический информационный центр и там обрабатываются), децентрализованном (доку­менты первичного учета обобщаются на местах и в статистический информа­ционный центр направляются уже в подытоженном виде) и смешанном (обра­ботка первичного материала происходит частично на местах и завершается полностью в едином статистическом информационном центре) порядке.
49
В зависимости от объема данных обработка первичной статистической информации может производиться вручную (при сравнительно небольшом объ­еме материала) или с помощью компьютеров.
Процедуре сводки, независимо от способа ее проведения, предшествует проверка правильности заполнения статистических карточек. Строгий контроль обеспечивает достоверность статистических данных. Особенно важно прове­рять правильность заполнения документов первичного учета при подготовке их к машинной обработке.
3.2. Группировка как научная основа статистической сводки
Если учесть, что в качестве составных элементов сводка включает:
1) расчленение изучаемого явления на части (группы, подгруппы); 2) подсчет групповых и общих итогов и 3) характеристику этих итогов при помощи опре­деленной системы показателей, то можно заключить, что в основе любой свод­ки статистического материала лежит его группировка.
Статистическая группировка — это распределение единиц изучаемого явления на однородные, качественно различающиеся между собой группы по тем или иным существенным для данного исследования признакам.
Научное исследование массовых процессов и явлений невозможно без их разграничения по группам. Группировка позволяет обработать собранные све­дения и в результате получить сводные, обобщающие показатели, наглядно и правильно отражающие действительность и позволяющие выполнить глубокий анализ, выявить связи, характеризующие изучаемую совокупность явлений. Поэтому статистическая группировка является основой научной сводки.
Адекватная сводка и группировка собранного материала определяют пра­вильность анализа и обоснованность его выводов. Основная задача группиро­вок в статистике информационной безопасности — дать наиболее полную и всестороннюю количественную характеристику правонарушений в этой обла­сти, личности правонарушителей, жертв правонарушений, причин и условий, способствовавших совершению правонарушений, и реакции правоохранитель­ных органов и фирм-разработчиков защитного программного обеспечения на эти правонарушения. С их помощью можно так расчленить собранные первич­ные данные, что все существенные черты и особенности изучаемых явлений (правонарушений, правонарушителей) и процессов выразятся в статистических показателях — абсолютных величинах, которые и являются необходимой осно­вой для завершающего этапа любой статистической работы — анализа. Один из важнейших методологических принципов, лежащих в основе научного выбора
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]