Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ изображений с точки зрения компьютерной криминалистики (Стегоанализ изображений). Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
11
Методов стегоанализа и атак на стегосистемы существует множество. На
основе специфики конкретных стегосистем могут использоваться различные
вариации существующих методов, уточнённые известными данными.
По выбору средств для проведения анализа данные методы делятся на:
1) Субъективные.
2) Сравнительные.
3) Математические.
Субъективные методы основаны на личной оценке аналитиком файлов
контейнеров с целью обнаружить искажения, вызванные встраиванием
сообщения. В отношении стегоанализа изображений атаки данного класса
часто называют «визуальными атаками». Несмотря на то, что чаще всего под
субъективными атаками подразумевают анализ файлов контейнеров, не
проходивших предварительную обработку, есть и иные виды методов,
сводящиеся к субъективной оценке: к примеру, существует метод визуальной
оценки наименьших значащих битов (НЗБ) изображения (то есть субъективной оценке подвергается не исходное изображение, а матрица НЗБ
пикселей с целью обнаружить нетипичные участки или нетипичное
распределение бит).
Сравнительные методы – это собирательный класс всех методов, которые
опираются на сравнение различных характеристик изображения с
эталонными, а также методы, основанные на анализе передаваемых в
стегосистеме файлов данных и информационных потоков при известном
скрытом сообщении.
К сравнительным методам относятся, к примеру, методы анализа
форматов: попытки обнаружить информацию, скрытую в визуально не
имеющих воплощения частях файлов различных типов. Сравнительными
также являются множества методов, предназначенных для получения данные
о ключах генераторов ГПСЧ при использовании в стегосистеме
псевдослучайных вариаций методов скрытия. Данные атаки предполагают
возможность предоставить стегосистеме собственные произвольные данные и
12
основаны на анализе известного скрытого сообщения. Фактически, такие виды
анализа являются атаками на алгоритмы скрытия [6].
По аналогии с атаками на основании известного сообщения
сравнительными являются методы стегоанализа, основанные на сравнении
предположительно заполненного контейнера с известным оригинальным
файлом контейнера [5].
В виду такого разнообразия, сравнительные методы стегоанализа, в свою
очередь, делятся на:
методы анализа на основе известного пустого контейнера; методы анализа на основе известного скрываемого сообщения; методы, основанные на анализе формата.
Математические методы проведения анализа являются наиболее
актуальным в вопросе непосредственно детектирования встраивания классом
атак на стегосистемы. Данные методы используют математический аппарат
для анализа изображений с целью аналитически обнаружить в их
пространственных и частотных характеристиках формы нетипичного
поведения или подозрительные отклонения и искажения.
К данному виду относится широкий спектр самых различных методов
стегоанализа – и атаки на основе критерия Хи-квадрат, и метод Regular- Singular, и алгоритмы обнаружения скрытия в частотной области (к примеру, по Коха-Жао), и многие другие.
Все методы стегоанализа можно разделить по анализируемой области на
два следующих класса:
1) Анализирующие пространственную область.
2) Анализирующие частотную (спектральную) область.
Первый вид атак на стегосистему осуществляет попытки обнаружить
скрытую информацию в непосредственно битовых представлениях текста,
пикселей изображения, звуковых данных или иных объектах информации. Эти
методы нередко опираются на подсчёт различных количественных
характеристик или методы сравнения анализируемых значений. К этому
13
классу относятся, к примеру, уже упомянутые метод Хи-квадрат, визуальная атака на изображение, а также многие виды сравнительных атак.
Второй вид методов стегоанализа более сложен и основан на различного
рода анализе частотных характеристик: к примеру, анализе коэффициентов
дискретного косинусного преобразования (ДКП) значений пикселей
изображений или анализе частотных характеристик звуковых файлов. Данный
класс атак чаще связан с использованием математических методов, однако
существуют и методики субъективного анализа спектральных представлений
файлов данных.
В целом, исходя из основных выделяемых этапов стегоанализа, атаки на
стегосистемы могут быть разделены на:
1) Методы обнаружения скрытой информации.
2) Методы получения данных для извлечения скрытой информации.
В общем случае, способ обнаружения данных, необходимых для
извлечения, может быть никак не связан с методом, позволившим обнаружить
встраивание сообщения. Кроме того, второй класс методов всегда связан с
конкретными методами стеганографического скрытия, в то время, как первый
класс методов может использовать виды атак, обнаруживающие скрытие
информации без идентификации конкретного алгоритма встраивания.
Сводная схема классификации методов стегоанализа приведена на
рисунке 1.
14
Рисунок 1 – Классификация методов стегоанализа
15
2.2 Метод Хи-квадрат
Критерий χ2 был разработан в 1900-м году Карлом Пирсоном, благодаря
чему получил также название «критерий согласия Пирсона». Этот критерий
предназначался для анализа таблиц сопряжённости (таблиц, содержащих
представление совместного распределения двух переменных). Критерий χ2
применяется для оценки значимости различий между фактическим
распределением некой величины и теоретическим, ожидаемым.
Иными словами, критерий согласия Пирсона позволяет получить вывод о
принадлежности некой полученной при наблюдениях выборки определённому
теоретическому закону распределения. Как правило, анализируемые с
помощью критерия данные категориальны то есть описываются
принадлежностью к определённой категории, что позволяет сопоставить
наблюдаемые и ожидаемые количества появления данных определённой категории.
Нулевой гипотезой в данном контексте является предположение о том,
что наблюдаемые данные не противоречат ожидаемым (данные выборки
соответствуют теоретически предсказанному закону распределения).
Альтернативная гипотеза заключается в утверждении о значимости
расхождения наблюдаемых и ожидаемых величин, то есть об отклонениях,
которые выходят за рамки случайных колебаний и погрешностей.
Для осуществления такой оценки первым делом необходимо выбрать
обобщающую меру расхождения между наблюдаемыми и ожидаемыми
значениями.
В общем случае отдельное наблюдение выборки имеет малую
вероятность попадания в ту или иную категорию (при значительном числе
категорий). В этой связи распределение наблюдаемых значений будет
подчинено закону распределения Пуассона, который и описывает «редко»
происходящие события, описывает количество случайных событий,
появляющихся в фиксированных точках дискретной шкалы (в определённые
16
промежутки времени или в определённых областях пространства). В
описываемом контексте такими точками служат категории [7].
Поскольку при значительно большом количестве наблюдений закон
Пуассона стремится к нормальному распределению, в качестве величины
относительной разности между данными одной категории было предложено
следующее выражение:

,
(1)
где  – значение i-й категории в выборке наблюдаемых величин;
 значение i-й категории в теоретически предсказанном распределении.
Проведение простого суммирования данных значений по всем
категориям привело бы к получению величины, стремящейся к нулю, а потому
Пирсоном было предложено в качестве обобщающей характеристики
расхождения между наблюдаемыми и ожидаемыми значениями использовать
сумму квадратов относительных разностей:

󰇛

󰇜
 
.
(2)
Данное соотношение и называется, собственно, «критерием Хи-квадрат
Пирсона».
Параметр      называется «степенью свободы» и был введён
Рональдом Фишером. Степень свободы описывает количество независимых
слагаемых в сумме. Поскольку сумма всех значений выборки известна
заранее, одно любое из слагаемых (то есть любое одно из значений выборки
для той или иной категории) может быть вычислено вычитанием из известной
суммы всех значений категорий, кроме одного. Таким образом, для k
слагаемых при известной заранее общей сумме количество независимых
слагаемых ровно на 1 меньше.
В этой связи принято говорить о значениях критерия Хи-квадрат для
определённого числа степеней свободы. Распределение χ2 представляется в
17
виде целого семейства распределений, зависящих от r. С увеличением
количества степеней свободы распределение χ2 стремится к нормальному.
Для получения результирующего вывода о верности нулевой гипотезы
необходимо произвести расчёт значения (так называемого «p-value»). При заданном уровне значимости α (заданной вероятности ошибки 1-го рода) значение , будучи меньше него, показывает, что нулевая гипотеза неверна и следует принять альтернативную гипотезу [7].
То есть, если значение меньше заданного уровня значимости,
наблюдаемые значения выборки существенно отклонились от ожидаемого
распределения в силу воздействия каких-либо внешних факторов.
Расчёт производится путём интегрирования функции плотности
распределения Хи-квадрат и имеет следующий вид:
 

󰇛

󰇜
 




,
(3)
где Г󰇛󰇜 – гамма-функция Эйлера, равная  если z – целое неотрицательное
число (является функцией, обобщающей понятие факториала для множеств
действительных и комплексных чисел).
Метод атаки на стегосистему с помощью анализа критерия Хи-квадрат
был предложен и описан Андреасом Вестфелдом и Андреасом Пфитцманом в
1999-м году. Данный способ ориентирован на обнаружение информации, скрытой в НЗБ, наиболее популярным методом реализации стеганографии.
Первым делом вводится понятие пар значений – «PoV» (pair of values).
Каждая пара значений – это пара байт, кодирующих интенсивности цветов и
отличающихся лишь на один НЗБ. Метод НЗБ, фактически, производит
преобразования в рамках данных пар, меняя, если это требуется, значение
байта с оригинального на «смежное» в его PoV, другое значение той же пары.
Идея данного метода анализа основывается на предположении, что в
незаполненном контейнере вероятность одновременного появления обоих
значений каждой пары мала – а, следовательно, значительно разнится
18
количество значений интенсивностей цветов таких, которые отличаются на
НЗБ. Иначе говоря, для незаполненного контейнера разница количества
появлений двух значений одной пары значительна – и так для всех PoV [7]. Количество появлений каждого значения также называется частотой.
Важной задачей анализа с помощью критерия Хи-квадрат является
проблема нахождения теоретически ожидаемого распределения. В его
качестве выбирается последовательность средних арифметических значений
частот всех пар. Поскольку при стеганографическом скрытии в НЗБ
происходит лишь перераспределение частот внутри пары, то сумма частот
пары остаётся неизменной – и, следовательно, постоянным остаётся значение среднего арифметического для PoV.
Таким образом, теоретически ожидаемая последовательность значений,
составленная из средних по паре, является таковой и для незаполненного, и
для заполненного контейнеров. Поскольку критерий Хи-квадрат позволяет
оценить степень статистической значимости отклонений от ожидаемого
распределения и исходя из вышеописанного предположения о значительности
разницы между частотами пары незаполненного контейнера (а, значит, и
значительных отклонений каждой частоты от их среднего арифметического)
можно определить, были ли внесены в анализируемое изображение
изменения.
Степень сходства распределения наблюдаемой выборки с теоретически
ожидаемым распределением, таким образом, становится мерой вероятности
того, что произошло стеганографическое встраивание в контейнер. Если
оценка по критерию Хи-квадрат при заданном уровне значимости позволяет
сделать вывод о том, что отклонения от теоретически ожидаемого
распределения незначительны, это означает, что с высокой вероятностью
имело место встраивание информации.
Общий вид алгоритма методом Хи-квадрат имеет следующий вид:
19
1) Идентификация k категорий, которыми в данном случае являются
значения интенсивности цвета (в одном из или единственном цветовом
канале изображения).
2) Для анализируемого изображения или его части производится подсчёт
частот: подсчёт количеств появления значений каждой категории. Если
значения каких-то категорий встречаются менее, чем 5 раз, они должны
быть объединены с другими категориями так, чтобы данное условие
выполнялось.
3) Производится подсчёт последовательности теоретически ожидаемых значений частот по всем парам значений:



  󰇣 
 
󰇤,
(4)
где  – частота чётного элемента пары с индексом i;


частота нечётного элемента пары с индексом i;
 – количество категорий, подсчитанное в пункте 1.
4) Выделение последовательности частот наблюдаемой выборки:
   󰇣 
 
󰇤.
(5)
5) Расчёт значения критерия Хи-квадрат согласно формуле 2.
6) Расчёт степени сходства наблюдаемого и теоретически
предсказанного распределения (вероятности верности нулевой гипотезы
критерия Хи-квадрат) – «p-value» – согласно формуле 3.
7) Нахождение     – вероятности того, что анализируемый стегоконтейнер заполнен.
8) Сравнение с выбранным критерием значимости :
если  , то контейнер считается заполненным; если  , то контейнер считается незаполненным.
В 4-м пункте алгоритма составляется последовательность, состоящая
только из значений чётных индексов PoV. Именно эта последовательность используется при подсчёте критерия Хи-квадрат в качестве наблюдаемого
20
распределения. При этом теоретическое распределение состоит из
последовательности такой же длины, что связано с подсчётом среднего
арифметического каждой пары (то есть приведения пары значений к
единственному – и, следовательно, уменьшению длины последовательности вдвое).
Выбор именно чётных индексов для составления последовательности не является семантически значимым – вместо  можно составлять последовательность из элементов 

. Это обусловлено тем, что для оценки
критерием Хи-квадрат в данном случае важна лишь сама абсолютная разница
между теоретически ожидаемым значением и наблюдаемым. Поскольку
сумма частот каждой пары неизменна, отклонение чётного элемента от
среднего арифметического пары равно отклонению нечётного элемента [7]. В
связи с этим можно использовать как подмножество значений чётных
индексов, так и подмножество элементов нечётных индексов.
В пункте 7 ищется финальное значение вероятности, согласно которому
и составляется вывод о заполненности стегоконтейнера. Данное значение
связано со значением P критерия Хи-квадрат подобным образом в связи с тем,
что нулевая гипотеза оценки критерием Пирсона заключается в
согласованности значений наблюдаемого и теоретически предсказанного
распределения, т.е. в незначительности отклонений между их значениями.
Однако в контексте оценки стегозаполненности изображения следствием
верности данной гипотезы является вывод о том, что скрытие было
произведено.
В связи с этим нулевая гипотеза предложенного метода анализа
заключается в обратном: в предположении о том, что в изображении нет
скрытой информации. Это связано с сутью самой нулевой гипотезы: она
должна являться базовым предположением, верным до тех пор, пока не будет
доказано обратное. Поскольку задачей метода анализа является обнаружить,
т.е. доказать, что скрытие информации было произведено, нулевая гипотеза утверждает, что контейнер «по умолчанию» считается незаполненным.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]