Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Аудит информационной безопасности. Прикладная статистика. Учебное пособие
.pdf
ограничиться лишь рассмотрением внутренних нарушителей, то аналогичные
1
n
i
i
xx
a
n
2
1
()
n
i
i
xx
D
n
(1 )D P P
2
1
()
n
i
i
xx
D
n
показатели будут 45 и 30 лет, а размах вариации составит 15 лет. Естественно,
что во втором случае изучаемая совокупность более однородна по возрасту, хотя не исключено, что в обоих случаях средний возраст нарушителей будет примерно одинаков. Однако этот показатель — средний возраст — во втором случае характеризует изучаемую совокупность нарушителей более точно.
Из сказанного следует, что размах вариации, являясь наиболее общим показателем совокупности, не указывает, насколько велики отклонения вариантов
признака внутри совокупности.
Более точными характеристиками вариации признака являются отклонения каждого из вариантов от его среднего значения. Поскольку в этом случае
отклонений столько же, сколько и вариантов, следует отыскивать их среднюю
величину. Такими более точными показателями вариации статистической совокупности являются среднее линейное отклонение, дисперсия и среднее квадратичное отклонение.
2. Среднее линейное отклонение по абсолютной величине (модулю) по-
казывает отклонение значений совокупности от средней арифметической величины:
.
3. Дисперсия показывает средний квадрат отклонения всех значений при-
знака от средней арифметической:
или
.
4. Среднее квадратическое отклонение показывает «надежность» средней
арифметической. Чем оно меньше, тем однороднее совокупность.
.
71

Доказано, что при нормальном распределении случайной величины, в
XX
2XX
3XX
100%
x
промежутке
ке
находится 95,4 % всех значений признака. В промежутке
находится 68,3 % всех значений признака. В промежут-
находится 99,7 % всех значений признака (см. рис. 4.1).
То есть вероятность того, что случайная величина отклонится от своего
математического ожидания на величину, большую чем утроенное среднее
квадратическое отклонение, практически равна нулю.
Это правило называется правилом трех сигм.
Рис. 4.1. Правило трех сигм
5. Коэффициент вариации — выраженное в процентах отношение средне-
го квадратического отклонения к средней арифметической:
.
Совокупность считается однородной, если коэффициент вариации не превышает 33 %.
В этом случае говорят, что средняя — типичная (свойственная) для данной совокупности и по ней можно судить обо всей совокупности.
Например, один студент получил в сессию оценки: 5, 2, 5, 2, 5, а другой — 4, 4, 4, 4, 3. Вычислив среднее арифметическое, получим для обоих 3,8
(округляется до 4). Можно ли поставить четвертную « 4 » обоим?
72

1
5 2 5 2 5
3,8
5
X
2
4 4 4 4 3
3,8
5
X
2 2 2 2 2
1
(5 3,8) (2 3,8) (5 3,8) (2 3,8) (5 3,8)
1,47
5
2 2 2 2 2
2
(4 3,8) (4 3,8) (4 3,8) (4 3,8) (3 3,8)
0,4
5
1
1,47
100% 38,7
3,8
2
0,4
100% 10,5
3,8
Значит:
;
;
;
.
;
.
Можно сделать вывод, что вторая совокупность более однородна, чем
первая.
4.3. Абсолютные величины и обобщающие показатели
Анализ статистических данных может осуществляться при помощи
абсолютных величин и обобщающих показателей.
Самым общим показателем статистической совокупности является абсолютная величина, характеризующая ее объем, т.е. количество единиц, составляющих эту статистическую совокупность.
Абсолютная величина — это всегда именованное число, связанное с единицей измерения, — инцидентов информационной безопасности, внутренних
нарушителей, суммы ущерба и т.д. Абсолютная величина может отражать и
объем части совокупности.
В составе абсолютных значений выделяют два показателя: численность
совокупности (инцидентов информационной безопасности, число нарушителей)
и объем признака (время, затрачиваемое на подбор пароля, возраст нарушителя,
сумма штрафа).
Абсолютные величины выражают уровни, характеризующие состояние
явления (число правонарушений), или результаты процессов за определенный
период (изменение числа правонарушений за один год, пять или десять лет).
Без исследования абсолютных данных иногда невозможно судить о
характере произошедших изменений.
73

Пример. Если число инцидентов информационной безопасности увеличи-
Вс
ОВС = 100 %
Вч
лось с 5 до 20 единиц, говорят, что оно выросло на 300 %. Если же оно снижается с 20 до 5, говорят, что оно упало на 75 %. При этом величина повышения в
одном случае и снижения в другом — была одной и той же, а именно 15.
Однако абсолютные числа позволяют увидеть только общие тенденции
анализируемого процесса. Для проведения более глубокого анализа, выяснения
закономерностей и взаимосвязи между отдельными явлениями необходимо
провести сравнения и сопоставления. С этой целью абсолютные показатели
приводят в сравнимый вид и получают обобщающие показатели.
Например, сравнительный анализ состояния информационной безопасности по разным организациям нельзя проводить путем использования
абсолютных показателей, т.к. организации отличаются по численности сотрудников, объему обрабатываемой конфиденциальной информации, количеству
компьютеров и др. параметрам.
Абсолютные величины, приведенные в сравнимый вид, называются в статистике обобщающими показателями, которые подразделяются на относительные и средние величины.
В статистике информационной безопасности нашли применение следующие относительные величины:
1. Относительная величина структуры — отношение части к целому,
называемое удельным весом или долей. Выражается в процентах или дробях,
как простых, так и десятичных. Вся совокупность принимается за 100% (или за
единицу), а ее часть показывает степень распространенности интересующего
исследователя признака:
,
где Вс — величина совокупности; Вч — величина части.
Примером может служить показатель доли внешних угроз информационной безопасности, доли сотрудников организации среди источников угроз, доли
отдельных способов осуществления несанкционированного доступа к информации и т.д.
Частным случаем структуры явления является его география, под которой
понимается распределение изучаемого явления по территории исследуемого
региона.
74

2. Относительная величина интенсивности — отношение величины яв-
П×100000
K=
Н
Т
П
В
ОВД =
В
1556
ОВД = =1,034.
1505
ления, характеризующегося определенным признаком, к размеру среды, которая является его базой. Выражается именованными числами, включающими наименование величин измеряемого признака и среды его распространения. Это отношение называют коэффициентом (уровнем) распространенности явления.
Например, коэффициент компьютеризации на 100 000 населения рассчитывается по следующей формуле:
,
где П — число компьютеров или число лиц, их имеющих; Н — численность
населения.
При расчете коэффициента «компьютерной» преступности на 100 000
населения в той же формуле принимаются обозначения: П — число инцидентов
или число лиц, их совершивших; Н — численность населения в возрасте старше
возраста наступления ответственности.
3. Относительная величина динамики — отношение величины явления к
его предыдущему значению (за предыдущий месяц или за аналогичный период
прошлого года — АППГ):
,
где ВТ — текущая величина; ВП — предыдущая величина.
Например, в 2016 г. зарегистрировано 1 556 утечек конфиденциальной
информации, а в 2015 г. — 1 505. Значит, относительная величина динамики
утечек конфиденциальной информации составила
4. Относительная величина координации характеризует соотношение
между отдельными частями статистической совокупности (например, мужчин и
женщин среди администраторов безопасности):
75

1
2
В
ОВК =
В
,
1
2
В
ОВСр = ×100%
В
Д
П
П
ОПВП =
П
где В1 — величина первой части совокупности; В2 — величина второй части
совокупности.
5. Относительная величина сравнения — отношение одних и тех же вели-
чин, составляющих различные совокупности, выражаемое в долях или процентах. Это может быть как отношение пространственного, так и отношение временного сравнения, например, показатели соотношения количества зарегистрированных утечек информации в разных регионах или в одном из них за разные
временные периоды:
,
где В1 — число утечек безопасности в N-ской области; В2 — число утечек безопасности в M-ской области.
6. Относительный показатель выполнения плана — отношение фактиче-
ского достигнутого за конкретный временной период уровня к запланированному уровню:
,
где ПД — достигнутый уровень; ПП — плановый уровень.
7. Индекс в широком смысле слова означает любой обобщающий показа-
тель, характеризующий состояние или изменение изучаемого явления.
В статистике под индексом понимают относительный показатель сравнения, характеризующий изменение (во времени, пространстве или по сравнению
с эталонным значением) величины какого-либо явления.
Сфера применения индексов в аналитической практике очень широка.
Индексы позволяют охарактеризовать изменение исследуемых явлений во времени (индексы динамики) или в пространстве (территориальные индексы),
определить степень влияния отдельных факторов на изменение динамики
сложного явления (например, влияние изменения числа мобильных устройств
на количество инцидентов информационной безопасности). Индексы позволяют проводить сравнения не только в пространстве и во времени, но и с планами, нормативами, прогнозами.
76

Значения индексов выражают в коэффициентах или процентах. Если из
1
2
q
q
iq
значения индекса, выраженного в процентах, вычесть 100%, то полученная величина покажет, на сколько процентов возросла (или сократилась) индексируемая величина.
Например, количество инцидентов безопасности в организации за 2016 г.
составило 24, а за 2015 г. — 20. Индекс равен 24 : 20 = 1,2 (120 %). Следовательно, за год количество инцидентов безопасности выросло на 20 % (120–100).
Индексы подразделяют в зависимости от степени охвата единиц изучаемой совокупности на индивидуальные и общие (сводные).
К индивидуальным относятся индексы, характеризующие изменения отдельных элементов сложного явления (например, рост или снижение числа утечек конфиденциальной информации). Под сложным явлением в статистике понимают такую совокупность, отдельные элементы которой не могут быть непосредственно просуммированы.
Индивидуальные индексы — относительные показатели динамики, сравнения, выполнения плана, и их определение не требует суммирования данных.
Выбор базы сравнения определяется целью исследования. Индивидуальные индексы рассчитываются как отношение двух индексируемых величин:
,
где q1 — значение индексируемой величины (например, число утечек информации) в текущем (отчетном) периоде, q2 — значение индексируемой величины в
базисном периоде.
Общими (сводными) называются индексы, характеризующие изменение
во времени или в пространстве всех элементов сложного явления, т.е. всего
изучаемого явления.
В зависимости от целей исследования, исходных данных и характера индексируемых показателей построение общих индексов осуществляется одним из
двух способов: агрегатным и средневзвешенным из индивидуальных индексов.
Агрегатные индексы — те, у которых числитель и знаменатель представляют собой сумму произведений двух величин, одна из которых меняется (индексируется), а другая — остается неизменной в числителе и знаменателе (вес
индекса). Вес индекса служит для соизмерения непосредственно несоизмеримых индексируемых величин. Умножение индексируемой величины на вес индекса называют взвешиванием:
77

1
1
1
0
ПБ
И=
ПБ
,
где И — индекс; П1 — индексируемая величина в текущем периоде; П0 — аналогичная величина в базисном периоде; Б1 — вес индекса (должен быть одинаковым и для текущего, и для базисного периода).
Средние величины являются важнейшими обобщающими характеристиками конкретных значений количественного признака статистических совокупностей.
Под средней величиной понимается обобщающая характеристика изучаемого явления по одному количественному признаку (возрасту, стажу работы
и т.д.), получаемая путем его соотнесения с числом единиц совокупности.
В средней величине выражается обобщенное, типичное для данной совокупности значение признака, погашаются случайные отклонения, присущие конкретным единицам совокупности, и таким образом проявляется действие ЗБЧ.
Средние величины с различной степенью точности отражают количественные
признаки изучаемой совокупности. Это зависит от правильной группировки и
степени однородности совокупности, характеризуемой показателями вариации
признаков (размах вариации, среднее линейное отклонение, дисперсия, среднее
квадратичное отклонение).
Существуют различные виды средних величин — арифметические, геометрические, квадратические и т.д., использование которых в каждом конкретном случае обусловливается характером исследуемой совокупности и варьирующего признака, подлежащего осреднению. Каждая из средних может быть
простой и взвешенной.
Основное свойство средней величины заключается в том, что при подсчете общего количества реальные значения могут быть заменены их средними
значениями. Результат при этом не меняется. Таким же образом можно проверить правильность определения средней величины.
При изучении социально-правовых явлений наиболее часто используются
среднеарифметическая и средняя геометрическая:
1. Среднеарифметическое представляет собой среднее арифметическое
значение изучаемого признака, получаемое путем сложения всех значений этого признака и делением полученной суммы на число единиц изучаемой совокупности:
78

1
n
i
i
X
X
n
,
1
1
n
ii
i
вз
n
i
i
Xf
X
f
В
22 23 24
С 23.
3
Xi — i-е значение признака X, n — количество значение признаков X (число
единиц совокупности).
Это простейший способ определения средней величины. Если наименование средней не упоминается, значит, речь идет о средней арифметической.
Такой способ нахождения средней арифметической применяется лишь тогда,
когда каждая единица совокупности имеет различные значения изучаемого
признака, т.е. его значения не повторяются.
В случае повторяемости значений признака в числителе (сложение единиц совокупности) будут встречаться одинаковые слагаемые. Число этих одинаковых вариантов называется весами или частотами. В этих случаях вычисляется не простая, а взвешенная средняя арифметическая (с учетом весов конкретных вариантов признака):
,
где n — число элементов совокупности, Хi — элемент совокупности, fi — частота элемента (число вхождений).
Смысл средней взвешенной легко можно увидеть на таком примере.
Пусть в службе безопасности организации работают несколько человек, возраст
которых на момент проведения исследования составлял 22 (5 чел.), 23 (8 чел.)
и 24 (14 чел.) года. Вычисляя средний возраст сотрудников службы безопасности, его, конечно, нельзя определять исходя только из показателей приведенного вариационного ряда:
Для правильного вычисления необходимо знать веса (частоты) указанных
возрастных признаков, т.е. сколько человек каждой возрастной группы находится в изучаемой совокупности.
79

По условию, сотрудники распределяются по возрастным группам следу-
Возраст (варианты)
Количество сотрудников
(вес каждого варианта)
22 5 23 8 24
14
1
1
22 5 23 8 24 14
23,33
5 8 14
n
ii
i
вз
n
i
i
Xf
X
f
ющим образом:
Для определения действительного среднего возраста сотрудников необходимо учесть количество сотрудников каждого возраста (число вхождений):
.
Из сопоставления полученных данных — 23 и 23,33 года легко понять,
почему между ними возникло расхождение. Дело именно в весе каждого варианта, поскольку больший вес (14 сотрудников) имеет вариант 24 года, он и «перетянул» среднюю в свою сторону.
Средние арифметические находят самое широкое применение при анализе состояния информационной безопасности, результатов деятельности по
борьбе с правонарушениями в этой области, оценке работы соответствующих
подразделений и т.д. При этом средние величины могут вычисляться как на основе абсолютных величин, так и относительных показателей.
Интересно отметить, что порой, не зная приведенной выше особенности
средних взвешенных, отклоняющихся в сторону варианта, обладающего большим весом, ее используют недобросовестные работники торговли, создавая так
называемую «фруктовую смесь».
Предположим, в магазин поступили сухофрукты — 100 кг абрикосов по
300 руб. за 1 кг, 150 кг яблок по 150 руб. за 1 кг, 200 кг груш по 210 руб. за 1 кг.
Если их реализовать по указанной цене, то выручка, как легко подсчитать, составит 94 500 руб. (30 000 руб. за абрикосы, 22 500 руб. за яблоки и 42 000 руб.
за груши). Если же все сухофрукты смешать и полученную смесь в виде компота (450 кг) продавать по средней (простая средняя арифметическая) цене —
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
