Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Аудит информационной безопасности. Прикладная статистика. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
220 руб. за килограмм, то выручка составит 99 000 руб. Откуда же в результате
2
1
n
i
i
кв
X
X
n
2
1
_
1
n
ii
i
кв вз
n
i
i
Xf
X
f
Месяц
янв.
февр.
март
апр.
Число инцидентов
18
21
22
19
18 21 22 19
20
4
X

Месяц
янв.
февр.
март
апр.
Отклонение от средней
2
+1
+2
–1
2 1 2 1
0
4
X
  

осуществления этой торговой «операции» взялись лишние 4 500 руб? Об этом нетрудно догадаться, если знать, что представляет собой средняя арифметиче­ская взвешенная.
2. Средняя квадратическая (простая и взвешенная) применяется, если об-
рабатываемая совокупность содержит разнознаковые (положительные и отри­цательные) единицы — отклонения от определенной величины:
или
.
Пример применения средней квадратической. Пусть известно число инци­дентов информационной безопасности в организации за первые 4 месяца года:
Средняя арифметическая числа инцидентов равна:
.
Ежемесячное отклонение числа инцидентов от среднего значения составляет:
Найдем среднее отклонение от средней арифметической.
Если воспользоваться формулой для нахождения средней арифметиче­ской, получим:
,
81
т.е. отклонения отсутствуют, но на самом деле они есть и средняя арифметиче-
2 2 2 2
( 2) 1 2 ( 1)
2,5 1,58
4
кв
X
 
1
n
n
г
i
i
XX
_
1
i
i
i
n
f
f
г вз
i
i
XX
Год
2012
2013
2014
2015
2016
Инцидентов за год
100
200
600
1 200
3 600
Коэффициент динамики
– 2 3 2 3
2323
2,5
4
X

3600
3906
100 2 3 2 3 100 2,5 2,5 2,5 2,5  
ская отклонений отражает совокупность неверно. Причина — разные знаки членов совокупности. Преодолеем это возведением в квадрат и извлечением квадратного корня:
.
Это и будет среднее отклонение от средней арифметической.
3. Средняя геометрическая (простая и взвешенная) применяется, если об-
рабатываемая совокупность содержит относительные величины:
или
.
Средняя геометрическая используется, как правило, в тех случаях, когда индивидуальные значения признака представлены в виде относительных цеп­ных показателей динамики (темпов роста), построенных на основе отношения каждого уровня в ряду динамики к предыдущему уровню.
Пример. Пусть известно число инцидентов информационной безопасно­сти за несколько лет. По этим данным посчитаны коэффициенты динамики преступности.
Найдем средний коэффициент динамики.
По формуле средней арифметической:
По свойству средней должно выполняться равенство:
.
.
82
Видно, что равенства не выходит.
г
X
36
гггг
XXXX
4
2323 
г г г г г
X X X X X
44
2 3 2 3 36 2,45  
г
X
ii
i
i
Xf
fX
1
1
гар
n
i
i
n
X
X
1
_
1
n
ii
i
гар вз
n
ii
i
i
Xf
X
Xf
X
Если рассуждать логически, то число преступлений возросло в 2×3×2×3 = 36 раз. Значит, средняя величина
полнялось равенство:
т.е.:
Откуда:
4. Средняя гармоническая (простая и взвешенная) применяется, когда из-
вестны Хi, Хi  fi, но не известны fi (
ческой:
должна быть такой, чтобы вы-
,
.
раза.
) — обратная от средней арифмети-
или
.
5. Средняя хронологическая — средняя величина, вычисленная по сово-
купности значений показателя в разные моменты или периоды времени.
6. Мода и медиана могут определяться без вычислений.
Они относятся к структурным средним и являются особым видом средних величин. Их значение имеет какой-либо определенный средний вариант в вари­ационном ряду. Структурные средние применяются для изучения структуры распределения значений признака и являются, в отличие от степенных средних, конкретными характеристиками.
Мода — наиболее часто встречающаяся величина или значение признака (вариант), встречающееся с наибольшей вероятностью в совокупности или в вариационном ряду.
К моде прибегают для выявления величины признака, имеющей наибольшее распространение (стоимость программного продукта в конкуриру­ющих магазинах, ущерб от инцидента информационной безопасности). Мода чаще всего используется в совокупностях большой численности.
83
Медиана — значение, расположенное посередине ранжированного (упо­рядоченного) ряда, значения в котором расположены в определенном поряд­ке — по возрастанию или по убыванию вариантов. Если значений четное число, то в качестве медианы принимают среднюю арифметическую от двух чисел, расположенных посередине ранжированного ряда.
Медиана делит вариационный ряд на две равные части: со значениями признака меньше медианы и со значениями признака больше медианы. По обе стороны от медианы находится одинаковое число единиц совокупности.
4.4. Использование рядов для анализа статистических данных
Все статистические показатели по такому принципиально важному при­знаку, как статичный или динамичный характер показателя, можно разделить на две значительно отличающиеся друг от друга группы.
Если исследуемое общественное явление характеризуется по состоянию на определенный момент времени или за определенный период времени, его показатели имеют статичный характер. Разумеется, такие показатели условны, поскольку все явления развиваются во времени.
Если же изучаемое общественное явление характеризуется во времени, его показатели имеют динамичный характер.
Таким образом, можно выделить два вида статистических рядов в зави­симости от динамичности или статичности отображаемых данных (рис. 4.2).
Ряд распределения — ряд чисел, характеризующих распределение единиц совокупности на группы по одному качественному или количественному при­знаку. В качестве примера приведем данные за первое полугодие 2019 г. по распределению утечек конфиденциальных сведений по типу данных (табл. 4.1).
В зависимости от признака, положенного в основу образования ряда рас­пределения, различают атрибутивные и вариационные ряды распределения:
Атрибутивный ряд распределения — распределение единиц совокупно­сти на группы по атрибутивному (качественному) группировочному признаку (распределение сотрудников организации по полу).
Вариационный ряд распределения — распределение единиц совокупно­сти на группы по количественному признаку — по степени возрастания или убывания числового значения признака (распределение сотрудников организа­ции по возрасту).
Дискретный вариационный ряд — распределение по количественному дискретному (прерывистому) признаку, выраженному точными числами
(ущерб от инцидента информационной безопасности).
84
Статистические ряды
Ряды распределения
Ряды динамики
Атрибутивные
Моментные
Вариационные
Интервальные
Дискретные
Интервальные
Тип данных
Доля утечек, %
Персональные данные
74,3
Платежная информация
10,9
Государственная тайна
3,9
Коммерческая тайна
10,9
Итого
100
Рис. 4.2. Виды статистических рядов
Таблица 4.1
Распределение утечек по типам данных, 2016 г.
Интервальный вариационный ряд — распределение по количественному признаку, выраженному в виде интервалов «от» и «до» (возрастные границы).
При группировке с равными интервалами для определения величины интервала применяется формула:
85
max min
XX
i
n
,
1 3,332 ln  nN
0
10
20
30
40
50
60
70
80
90
Утечка
Мошенничество
НСД
где n — число групп. Эта величина задается или определяется по формуле Стерджесса
, где N — численность совокупности.
Вариационный ряд характеризуется двумя составными элементами: вариантой (Х) и частотой (f).
Варианты — отдельные числовые значения варьирующего признака отдельной единицы или группы совокупности.
Частоты — абсолютные числа, показывающие, сколько раз встречается та или иная варианта в данной совокупности. Частоты, выраженные в долях единицы или в процентах к итогу, называются частостями.
Графически ряд распределения можно изобразить при помощи гистограммы (столбиковая диаграмма), полигона распределения (линейная диаграмма), кумуляты (линейная диаграмма с накоплением) или огивы.
Для построения гистограммы по оси абсцисс указывают значения границ интервалов и на их основании строят прямоугольники, высота которых пропор­циональна частотам или частостям (рис. 4.3).
Полигон используют при изображении дискретных рядов распределения. Полигон представляет собой ломаную кривую, при построении которой на оси абсцисс откладывают значения варьирующего признака, а на оси ординат — частоты или частости.
Рис. 4.3. Распределение инцидентов по характеру, 2019 г.
86
В качестве примера возьмем данные табл. 4.1 и сведения о возрасте сотруд-
0
20
40
60
80
ПДн Платежная инф. Гостайна Коммерч.тайна
П
0
5
10
15
20
23 24 25 26 27 28 29 30
Возраст
Число сотрудников
0
20
40
60
80
23 24 25 26 27 28 29 30
Возраст
ников службы безопасности. Построенные полигоны приведены на рис. 4.4 и 4.5.
Рис. 4.4. Распределение утечек по типам данных, 2019 г.
Рис. 4.5. Распределение сотрудников СБ по возрасту
Кумулята или кумулятивная кривая в отличие от полигона строится по накопленным частотам или частостям. При этом на оси абсцисс помещают зна­чения признака, а на оси ординат — накопленные частоты или частости. Для дискретных рядов на оси откладываются сами значения признака, а для интер­вальных — середины интервалов. В качестве примера построения кумуляты используем данные о возрасте сотрудников службы безопасности (рис. 4.6).
Рис. 4.6. Кумулята распределения сотрудников СБ по возрасту
87
Огива строится аналогично кумуляте с той разницей, что накопленные ча-
0
10
20
30
40
3 8 14 21 29 38 48 63
Число сотрудников (с накоплением)
Возраст
Год
2014
2015
2016
2017
2018
2019
Число утечек
654
723
840
925
1 039
1 276
стоты помещают на оси абсцисс, а значения признака — на оси ординат. Для примера построения огивы используем данные предыдущего примера (рис. 4.7).
Рис. 4.7. Огива распределения сотрудников СБ по возрасту
Вторым видом статистических рядов является ряд динамики.
Рядом динамики (динамическим или временным рядом) называется ряд последовательных значений, характеризующих изменение какого-либо обще­ственного явления или его показателя во времени.
Динамические ряды являются одним из наиболее простых и наглядных приемов отображения изменений какого-либо явления во времени, характери­стики тенденции его развития. В качестве примера можно привести данные, от­ражающие изменение числа утечек информации в первом полугодии:
Анализ динамики инцидентов информационной безопасности в научно­практическом отношении имеет, по меньшей мере, две цели:
дать представление об изменениях показателей за прошедший период, выявить тенденции и закономерности этих изменений;
на их основе осуществить прогноз о возможном состоянии информацион- ной безопасности в ближайшем и отдаленном будущем, что является необходимым условием планирования мероприятий по борьбе с угрозами и инцидентами.
Основными характеристиками временного ряда являются (рис. 4.8):
длина — время, прошедшее от первого до конечного наблюдения (из- мерения), или количество наблюдений;
вую», ведущую закономерность и тенденцию развития явления;
тренд — постоянная составляющая, выражающая длительную, «веко-
88
периодические колебания — более или менее регулярные отклонения
0
20
40
60
80
100
120
140
янв
фев
март
апр
май
авг
сен
окт
нояб
дек
Процесс
Тренд
Период. колеб.
длина
от тренда (сезонные, циклические и т.д.);
остаток или несистематический случайный эффект;
лаг или отставание одного явления от другого, связанного с ним.
Рис. 4.8. Основные характеристики временного ряда
Иногда анализ реального динамического ряда невозможен вследствие чрезмерной сложности изменения данных. В этом случае строят и подвергают анализу тренд динамического ряда, как показано на рис. 4.9.
Рис. 4.9. Построение тренда динамического ряда для его анализа
С точки зрения статистики, длинные динамические ряды предпочтитель­нее коротких, поскольку с увеличением длины ряда результаты, полученные путем его анализа, как правило, приобретают большую надежность. Однако ис­пользование чересчур длинных динамических рядов при анализе данных стати-
89
стики информационной безопасности может оказаться неоправданным из-за резких социально-экономических, политических, правовых изменений. Это может создать такую ситуацию, что начальные и конечные наблюдения будут относиться к совершенно различным по социально-правовой сущности явлени­ям, лишь формально объединяемым общим названием. Следовательно, необхо­димо найти разумный компромисс между статистическими и правовыми, эко­номическими, техническими и пр. требованиями к длине динамического ряда. Мера такого компромисса определяется целями исследования.
Для выявления основных характеристик (тенденций, лагов, колебаний и др.) применяется ряд методов (способов, приемов) обработки динамических рядов. При анализе динамики состояния информационной безопасности нужно уметь пользоваться такими из них, как вычисление уровня ряда, абсолютного прироста (снижения), темпов роста (снижения), темпов прироста и величины одного процента прироста.
Показатели, из которых состоят динамические ряды, называются уровня­ми динамического ряда. Эти показатели могут представлять собой:
абсолютные статистические величины (например, количество преступ- лений компьютерной направленности);
относительные статистические величины (например, число мобильных устройств на 100 тыс. населения);
средние величины (например, средний возраст сотрудников).
Ряды динамики могут характеризовать изучаемые явления на определен­ные моменты времени либо за определенные периоды времени. В зависимости от этого различают моментные и интервальные ряды динамики.
Примером моментного ряда является ряд показателей численности со­трудников организации на определенную дату (начало месяца).
Примером интервального ряда динамики служит изменение числа со­трудников организации за год.
При этом показатели интервальных рядов можно суммировать, а показа­тели моментных — нельзя. Применительно к приведенным примерам, это зна­чит, что количество принятых в организацию за год сотрудников — итог еже­месячно или ежеквартально принимаемых сотрудников; но нет смысла сумми­ровать число сотрудников организации на конкретные даты.
Важнейшим требованием формирования динамических рядов является однокачественность их уровней на протяжении всего временного периода. Ес­ли, например, анализируется уровень утечек информации, то необходимо учесть изменение состава утечек по видам и взять данные о тех видах утечек, которые фиксировались на протяжении всего исследуемого периода.
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]