Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Аудит информационной безопасности. Прикладная статистика. Учебное пособие
.pdf
организовать специальные частичные или сплошные контрольные про-
Ошибки наблюдения
Ошибка регистрации
Ошибка
репрезентативности
Случайные
Систематические
Случайные
Преднамеренные
Систематические
Непреднамеренные
верки правильности заполнения статистических формуляров;
провести логический и арифметический контроль полученных данных
после окончания сбора информации.
Классификация ошибок статистического наблюдения показана на рис. 2.1.
Рис. 2.1. Классификация ошибок статистического наблюдения
Все возможные ошибки в зависимости от причин возникновения можно
разделить на ошибки регистрации и ошибки репрезентативности.
Ошибки регистрации — это отличие между значением показателя, полученного в ходе наблюдения, и фактическим его значением.
Систематические ошибки возникают систематически при проведении
любых измерений и исследований.
Преднамеренные ошибки — сознательные искажения фактов.
Регулярные намеренные ошибки регистрации обладают направленностью
либо к увеличению, либо к уменьшению значений характеристик по каждой
единице наблюдения, а значит, величина показателя по совокупности в целом
будет содержать в себе накопленную погрешность. Примером систематической
преднамеренной ошибки регистрации может служить округление стажа работы
сотрудников до целых значений в годах в меньшую сторону.
41

Систематические непреднамеренные ошибки допускаются неумышленно
вследствие пропусков в записях, забывания отдельных фактов, погрешности
приборов, недостаточной реакции человека и т.д.
Случайные ошибки — это следствие невнимательности при регистрации
ответов или подсчете итогов.
Ошибки репрезентативности, в отличие от ошибок регистрации, характерны лишь для несплошного наблюдения. Возникают они потому, что отобранная и обследованная совокупность недостаточно точно воспроизводит (репрезентирует) всю генеральную (исходную) совокупность в целом.
Ошибкой репрезентативности называется отклонение значения показателя обследованной совокупности от его величины по исходной совокупности.
Ошибки репрезентативности, так же как и ошибки регистрации бывают
случайными и систематическими.
Случайные ошибки репрезентативности возникают, когда отобранная совокупность неполно воспроизводит всю совокупность в целом. Ее величина
может быть оценена.
Систематические ошибки репрезентативности появляются из-за нарушения принципов отбора единиц, которые должны быть подвергнуты наблюдению, из исходной совокупности.
Ошибка репрезентативности количественного признака показывает, на
какую величину средние значения выборочной совокупности могут отличаться
от средних значений генеральной совокупности.
Она будет иметь место во всех без исключения выборочных наблюдениях. Задача заключается в том, чтобы минимизировать эту ошибку. Ошибка репрезентативности будет тем меньше, а, соответственно, результаты выборочного наблюдения тем точнее, чем больше выборочная совокупность и чем более
однородна исследуемая генеральная совокупность.
В соответствии с положениями математической статистики, величина
ошибки репрезентативности обратно пропорциональна корню квадратному из
числа единиц, попавших в выборку. Это означает, что для уменьшения ошибки
репрезентативности в n раз необходимо число единиц выборочной совокупности увеличить в n2 раз. Следовательно, для уменьшения ошибки в 2 раза выборочную совокупность придется увеличить в 4 раза (22), а для уменьшения
ошибки в 3, 4 или 5 раз число единиц выборки придется соответственно увеличить в 9, 16 или 25 раз.
42

Уточним, что понимается под однородной совокупностью. Совокупность
13 3 1 10 5 11 9 1 2 1
5,6
10
(1 )PP
0,25
будет тем однороднее, чем меньшей будет разница между конкретными величинами единиц совокупности и средней величиной данного признака во всей
совокупности.
Например, данные выборочного исследования показали, что в одном подразделении сроки службы 10 персональных компьютеров до первого ремонта
составили (в годах) 13, 3, 1, 10, 5, 11, 9, 1, 2, 1. Средний срок службы одного
персонального компьютера равен
года.
В другом подразделении сроки оказались: 7, 5, 6, 4, 6, 6, 7, 5, 4, 6 лет. Средний
срок службы — 5,6 года. Как видим, средний срок сроки службы персональных
компьютеров в обоих подразделениях одинаков. Но если во втором подразделении конкретные сроки службы каждого из 10 компьютеров незначительно
отличаются от среднего значения, то в первом подразделении разница между
сроками службы отдельных компьютеров и средним сроком службы довольно
существенна. Следовательно, совокупность для второго подразделения более
однородна, чем для первого.
Для определения меры однородности совокупности теория статистики
предлагает специальный показатель разбросанности (колеблемости) численных
значений признака, из которых выводится средняя. Этот показатель называется
«среднее квадратическое отклонение».
Остановимся на определении среднего квадратического отклонения качественного признака. Задача выборочного наблюдения — определение доли явления, обладающего данным признаком. При этом если известна доля явлений,
обладающих исследуемым признаком, то путем ее вычитания из единицы или
из 100 % (так обозначается величина всего явления) можно определить долю
явлений, не обладающих данным признаком. Например, если мужчины составляют 65 % от общего числа администраторов безопасности (0,65), то доля женщин, занимающих эту должность, составит 35 % (0,35). Следовательно, если
долю явлений, обладающих исследуемым признаком, обозначить как Р, то доля
явлений, не обладающих этим признаком, может быть обозначена как 1-Р.
Среднее квадратическое отклонение качественного признака определяется по формуле:
. В нашем примере Р = 0,65;
= 0,48.
На практике величину среднеквадратического отклонения, нужную для
определения объема выборки, можно получить по данным пробного исследования или по предыдущим исследованиям. При исследовании качественного признака, чтобы не проводить предварительные исследования, берут максимальное
43

значение 2, которое равняется 0,25 (наихудший вариант, требующий наиболь-
22
2
tn
2
шего размера выборки). Следующей задачей выборочного наблюдения становится определение вероятности того, что выборочная совокупность будет отличаться от генеральной в пределах ошибки выборки. Для этого в формулу ошибки выборки включают гарантийный коэффициент t.
Гарантийный коэффициент t означает, что при t = 1 из 1 000 только
в 682 случаях средняя величина исследуемого признака выборки будет отличаться от средней генеральной совокупности в пределах заданной ошибки.
Описанная зависимость получила название интегральной функции Лапласа.
Для удобства использования она табулирована (см. прил. 1).
Определение степени точности, с которой нужно гарантировать пределы
ошибки репрезентативности, целиком зависит от характера исследуемой проблемы. Если по практическим соображениям нельзя допустить, чтобы фактическая ошибка репрезентативности превосходила 3 случая из 1 000, то необходимо исходить из доверительной вероятности, равной 0,997 (при этом t = 3). Если
же можно допустить ошибку в 5 случаях из 100, то следует исходить из доверительной вероятности, равной 0,955 (при этом t = 2).
Практический опыт показывает, что доверительная вероятность 0,955 и
t = 2 является оптимальным вариантом.
Расчет величины выборочной совокупности, как правило, выполняет специалист-математик, но специалисты в области информационной безопасности,
участвующие в выборочном наблюдении, не должны вслепую полагаться на
математика. Надо уметь проверить выполненные расчеты.
Определение необходимого объема выборочной совокупности является
важнейшим вопросом проведения выборочного наблюдения. Излишняя численность выборки влечет увеличение стоимости исследования и сроков его
проведения. Его недостаточность приведет к увеличению ошибки.
Значит, нужно решить оптимизационную задачу: каков объем выборки,
чтобы при ее минимальном объеме получить максимально точные данные?
В необходимых случаях можно воспользоваться для расчета следующей
простой формулой:
где — предельная ошибка выборки.
Если t = 2, 2 = 0,25,
,
= 0,052, то:
44

2
2
2 0,25
400
0,05
n
.
Во многих исследованиях, посвященных правовым вопросам, когда генеральная совокупность достаточно велика и предельная ошибка выборки достигает 5 %, выборка в 400 единиц, как правило, обеспечивает репрезентативность,
а следовательно, позволяет правильно судить обо всей генеральной совокупности, разумеется, при соблюдении принципа случайного отбора единиц выборочной совокупности.
Чтобы довести объем выборки до определенного допустимого минимума,
не следует гнаться за чрезмерным уменьшением предела возможности ошибки
выборки и чрезмерно высокой гарантией ее достоверности. Чрезмерность всегда приводит к неоправданному увеличению объема выборки и, следовательно,
к повышению затрат, не вызываемых зачастую задачами исследования.
Для облегчения применения выборочных исследований существуют таблицы, по которым можно получить необходимые сведения, о пределе ошибки
выборки при данном числе наблюдений и об объеме выборки, необходимом для
того, чтобы ошибка репрезентативности не превысила данного предела.
Для выявления и устранения ошибок, допущенных при регистрации, может применяться контроль полноты, счетный (математический, арифметический) и логический контроль собранного материала.
Контроль достоверности осуществляется на всех этапах сбора и обработки
статистических данных, однако особое значение имеет контроль на начальных
стадиях наблюдения, так как ошибки, допущенные на этом этапе, трудно или невозможно исправить впоследствии. Влияют же они на все последующие расчеты.
Контроль достоверности статистических данных предполагает, прежде
всего, проверку полноты собранных данных. Она состоит в выяснении, от всех
ли источников поступили сведения, все ли показатели отражены в документах
первичного учета и формах отчетов, например, все ли отделы фирмы представили отчеты.
Важным методом контроля достоверности статистических данных является арифметический контроль. Эта форма контроля основывается на использовании математических взаимосвязей между различными показателями отчета.
Примером могут служить балансовые связи, при которых сумма расчлененной
по различным признакам совокупности равна итоговым показателям. Пример:
сумма выходов из строя оборудования по всем причинам должна быть равна
общему количеству выходов оборудования из строя.
45

Если арифметический контроль покажет, что данная зависимость не выполняется, это будет свидетельствовать о недостоверности собранных данных.
Поэтому в программу статистического наблюдения целесообразно включать
показатели, которые дают возможность проведения арифметического контроля.
Счетный контроль заключается в проверке точности арифметических
расчетов, применявшихся при составлении отчетности или заполнении формуляров обследования.
Для выявления ошибок, наряду с арифметическим контролем, который
позволяет устранить лишь ошибки вычислений, применяют также логический
контроль. Он тоже основывается на взаимосвязи показателей, но не количественных, а смысловых (логических).
Логический контроль ставит своей целью определить соответствие ответа
поставленному вопросу или соответствие между ответами на разные вопросы.
Например, если на вопрос «пол» обнаружен ответ «26», то ясно, что ответ
в данном случае не соответствует вопросу, что это ошибка, вызванная записью
ответа не в той строке или графе (перепутали графы «пол» и «возраст»).
Если же на вопрос «возраст» стоит ответ «10 лет», а на вопрос об образовании зафиксирован ответ «высшее», то очевидно, что по отдельности каждый
ответ соответствует вопросу, но между собой эти ответы не согласуются. Чтобы установить, в каком из них содержится ошибка, следует рассмотреть ответы
на другие вопросы, контролирующие первые. Так, если в рассматриваемом
случае в графе «место работы» записано наименование определенного предприятия и в графе «семейное положение» указано «замужем», то ясно, что была
допущена ошибка в возрасте.
Логический контроль используется, в частности, при заполнении листка
учета кадров на сотрудника организации. Если, например, принимаемый сотрудник ранее работал инженером, то, по логике, он не может обладать лишь
средним образованием. Здесь связь осуществлена по признакам (графам) «образование» и «занятие».
Обычно для исправления ошибок, выявленных в ходе логического контроля, требуется повторно обратиться к источнику сведений.
Вопросы для самоконтроля
1. Что такое статистическое наблюдение, и каким требованиям оно долж-
но удовлетворять?
2. Определите основные задачи и направления применения материалов
статистики в науке и практике обеспечения информационной безопасности.
46

3. Определите объекты наблюдения статистики информационной без-
опасности.
4. Что такое единица наблюдения, единица совокупности и единица из-
мерения в статистике информационной безопасности?
5. Назовите организационные формы и виды наблюдения в статистике
информационной безопасности.
6. Раскройте особенности и научные основы проведения выборочного
наблюдения. Что такое ошибка репрезентативности?
7. Какими методами проверяется достоверность данных статистики ин-
формационной безопасности?
8. Укажите факторы, определяющие границы достоверности статистиче-
ской информации.
9. Как система учета правонарушений в области информационной без-
опасности влияет на степень соответствия статистических данных об инцидентах действительному положению дел?
10. Чем отличается знание о массе правонарушений в области информа-
ционной безопасности от знания об отдельном правонарушении?
47

ГЛАВА 3. СВОДКА И ГРУППИРОВКА МАТЕРИАЛОВ
СТАТИСТИЧЕСКОГО НАБЛЮДЕНИЯ
В главе аргументирована необходимость проведения статистической
сводки и группировки, приведены основные термины, использующиеся на этом
этапе статистического исследования.
При рассмотрении группировки приведены и обоснованы основные правила выбора группировочных признаков. Уделено внимание анализу видов
группировок.
В качестве способов представления сгруппированных и сведенных данных описаны различные виды статистических таблиц и диаграмм.
3.1. Статистическая сводка
Собираемые в ходе статистического наблюдения сведения характеризуют
лишь отдельные элементы — единицы совокупности, но не всю изучаемую совокупность. Для того чтобы выявить характерные черты полученной совокупности и обнаружить объективные связи между ее элементами, необходимо систематизировать весь собранный материал, подсчитать данные, расчленить по
группам, т.е. соединить в целое, свести в единую систему, суммировать и
подытожить результаты подсчетов, что достигается на втором этапе всякой статистической работы — статистической сводке.
Этап статистической сводки не менее важен, чем этап наблюдения, так
как только при правильной обработке первичных материалов можно выявить
подлинный характер (тенденции, закономерности) полученных сведений.
Именно в результате этих действий образуются статистические качественно
однородные совокупности, появляется возможность оперировать такими количественными показателями, как абсолютные цифры. На этапе же статистического наблюдения были получены лишь единичные, разрозненные статистические данные.
Статистическая сводка представляет собой научную обработку материалов статистического наблюдения (подсчет первичного статистического материала), подытоживание отдельных единиц и сведения их в массы или совокупности в целях получения обобщенной характеристики изучаемого явления по ряду существенных для него признаков.
48

Единица совокупности всегда характеризуется различными качественными (атрибутивными) и количественными признаками. Одни из них непосредственно относятся к определению единиц, входящих в совокупность, и могут
быть одинаковыми для всех них. Вместе с тем ряд признаков у этих единиц совокупности различается, варьирует. Именно такие признаки, варьирующие от
единицы к единице, составляют специфическую черту совокупности, делающую ее предметом изучения статистики. Такие признаки называются статистическими.
Статистические признаки единиц совокупности делают ее не просто
арифметической суммой величин. Такая совокупность подчинена определенным статистическим закономерностям, в основе которых лежит действие закона больших чисел.
Различают сводку в узком и широком понимании.
Сводка в широком понимании — научная обработка первичных статистических сведений. Она включает в себя группировки исследуемых явлений,
получение системы показателей для характеристики типичных групп, подсчет
общих и групповых итогов, внесение их в формы статистических таблиц.
Сводка в узком понимании представляет собой действие по подсчету итоговых данных.
Сводка статистических материалов должна осуществляться на основе разработанной программы. Программа статистической сводки должна содержать:
перечень групп изучаемой совокупности по отдельным признакам;
перечень показателей, которые надо подсчитать для характеристики
каждой группы;
территориальные границы, в которых надо произвести разработку ма-
териала (область, город и т.п.);
степень детализации ведомственной подчиненности, в пределах которой
должны быть сведены материалы (до уровня организации, отдела, сотрудника).
Содержание программы сводки определяется теми задачами, которые
стоят перед конкретным исследованием.
Сводка статистических данных может производиться в централизованном
(все первичные статистические документы поступают в единый статистический
информационный центр и там обрабатываются), децентрализованном (документы первичного учета обобщаются на местах и в статистический информационный центр направляются уже в подытоженном виде) и смешанном (обработка первичного материала происходит частично на местах и завершается
полностью в едином статистическом информационном центре) порядке.
49

В зависимости от объема данных обработка первичной статистической
информации может производиться вручную (при сравнительно небольшом объеме материала) или с помощью компьютеров.
Процедуре сводки, независимо от способа ее проведения, предшествует
проверка правильности заполнения статистических карточек. Строгий контроль
обеспечивает достоверность статистических данных. Особенно важно проверять правильность заполнения документов первичного учета при подготовке их
к машинной обработке.
3.2. Группировка как научная основа статистической сводки
Если учесть, что в качестве составных элементов сводка включает:
1) расчленение изучаемого явления на части (группы, подгруппы); 2) подсчет
групповых и общих итогов и 3) характеристику этих итогов при помощи определенной системы показателей, то можно заключить, что в основе любой сводки статистического материала лежит его группировка.
Статистическая группировка — это распределение единиц изучаемого
явления на однородные, качественно различающиеся между собой группы по
тем или иным существенным для данного исследования признакам.
Научное исследование массовых процессов и явлений невозможно без их
разграничения по группам. Группировка позволяет обработать собранные сведения и в результате получить сводные, обобщающие показатели, наглядно и
правильно отражающие действительность и позволяющие выполнить глубокий
анализ, выявить связи, характеризующие изучаемую совокупность явлений.
Поэтому статистическая группировка является основой научной сводки.
Адекватная сводка и группировка собранного материала определяют правильность анализа и обоснованность его выводов. Основная задача группировок в статистике информационной безопасности — дать наиболее полную и
всестороннюю количественную характеристику правонарушений в этой области, личности правонарушителей, жертв правонарушений, причин и условий,
способствовавших совершению правонарушений, и реакции правоохранительных органов и фирм-разработчиков защитного программного обеспечения на
эти правонарушения. С их помощью можно так расчленить собранные первичные данные, что все существенные черты и особенности изучаемых явлений
(правонарушений, правонарушителей) и процессов выразятся в статистических
показателях — абсолютных величинах, которые и являются необходимой основой для завершающего этапа любой статистической работы — анализа. Один из
важнейших методологических принципов, лежащих в основе научного выбора
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
