Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Начальный курс информатики. Часть 1. Учебное пособие
.pdf
41
Как измерить информацию? Это сделать сложнее, так
как нет еѐ универсального определения. Существуют два
подхода к измерению информации. Первый подход отталкивается от практических нужд хранения и передачи информации в технических системах и не связан со смыслом (содержанием) информации. Второй же подход рассматривает восприятие информации человеком и поэтому имеет дело со
смыслом информации.
Алфавитный подход к измерению информации применяется в цифровых (компьютерных) системах хранения и передачи
информации. В этих системах используется двоичный способ кодирования информации. Алфавитный подход еще называют объѐмным подходом. При алфавитном подходе для определения количества информации имеет значение лишь размер (объѐм) хранимого и передаваемого кода.
Под алфавитом некоторого языка будем понимать набор
букв, знаков препинания, цифр, скобок и других символов, используемых в тексте. В алфавит также следует включить и пробел. Полное число символов алфавита принято называть мощностью алфавита. Будем обозначать эту величину буквой N. Например, мощность алфавита из русских букв и отмеченных дополнительных символов равна 54: 33 буквы + 10 цифр + 11 знаков
препинания, скобки, пробел.
При алфавитном подходе считается, что каждый символ
текста имеет определенный информационный вес. Информационный вес символа зависит от мощности алфавита. В компьютере,
для кодирования информации используются алфавит мощностью
– 2. Он содержит всего 2 символа, которые обозначаются цифрами 0 и 1. Его называют двоичным алфавитом.
Информационный вес символа двоичного алфавита принят
за единицу информации и называется 1 бит.
Комбинацию из нескольких знаков двоичного алфавита назовем двоичным кодом.
Используя двоичный алфавит, можно составить уникальный
двоичный код символов алфавита мощностью 4.

42
Порядковый номер символа
1 2 3
4
Двоичный код
00
01
10
11
Порядковый номер символа
1 2 3 4 5 6 7
8
Двоичный код
000
001
010
011
100
101
110
111
N 2 4 8 16
b
1 бит
2 бита
3 бита
4 бита
Информационный вес символов такого 4 символьного алфавита – 2 бита.
С увеличением мощности алфавита увеличивается информационный вес символов этого алфавита. Так, один символ из 8 –
символьного алфавита (N = 8) «весит» 3 бита.
Определим зависимость между мощностью алфавита (N) и
количеством знаков (разрядностью) в двоичном коде (b).
N=2b
Разрядность двоичного кода – это и есть информационный
вес символа.
В компьютере любые виды информации: тексты, числа,
изображения, звук – представляются в форме двоичного кода.
Объем информации любого вида, выраженный в битах, равен длине двоичного кода, в котором эта информация представлена.
Например, объем информации 01100011, представленной
двоичным кодом, – 8 бит.
Содержательный подход к измерению информации основан на определении информации как содержания сообщения,
получаемого человеком. Сущность содержательного подхода заключается в следующем: сообщение, информирующее об исходе
какого-то события, снимает неопределенность знания человека об
этом событии. Чем больше первоначальная неопределенность
знания, тем больше информации несет сообщение, снимающее эту
неопределенность.

43
Клод Шеннон
1916-2001
Пример 3. Вам назначили нового преподавателя; на вопрос
«Это мужчина или женщина?» был дан ответ «Мужчина».
Неопределенность в знании в данном случае, т.е. количество возможных исходов, условно равно 2.
Пример 4. На выборах мэра города было представлено 4
кандидата (неопределенность в знании условно равна 4). После
подведения итогов голосования, узнали, что избран Н.Н. Иванов.
Наибольшее количество информации несет сообщение в
примере 4, поскольку неопределенность знания об исходе события в этом случае была наибольшей.
В 40-х годах XX века проблема измерения информации была решена американским ученым Клодом Шенноном - основателем теории информации. Согласно
Шеннону, информация – это снятая не-
определенность знания человека об исходе какого-то события.
Сообщение, уменьшающее неопределенность знания об исходе некоторого
события в два раза, несет 1 бит информа-
ции.
Согласно определению сообщение в
примере 3 несет 1 бит информации, поскольку из двух возможных
вариантов ответа был выбран один. В примере 4 – 2 бита, так как
снять неопределенность можно только дважды последовательно
уменьшив неопределенность в 2 раза, получая каждый раз информацию в 1 бит.
Во всех рассмотренных примерах предполагается, что воз-
можные исходы события равновероятны.
Введем обозначения: N – количество возможных исходов
события (неопределенность знания), i – количество информации в
сообщении наступлении одного из N результатов. Связь между
этими величинами выражается следующей формулой:
2i =N
Пример 5: В электропоезде 16 вагонов. Какое количество информа-
ции содержится в сообщении о том, что ваш друг едет в вагоне 8?

44
Решение: чтобы ответить на вопрос, нужно решить уравне-
ние: 2i=16, i=4 бита.
Ответ: 4 бита.
Пример 6. В кинозале 16 рядов, в каждом ряду 32 места.
Какое количество информации несет сообщение о том, что вам
купили билет на 12-й ряд, 10-е место?
Решение: в кинозале всего 16·32 = 512 мест. Сообщение о
купленном билете однозначно определяет выбор одного из этих
мест. Из уравнения 2i = 512 = 29 получаем: i = 9 битов.
Ответ: 9 битов.
Решение уравнения 2i =N в общем виде можно записать так:
i=log2N (формула Хартли). Логарифм по основанию 2 от N – это
степень, в которую нужно возвести 2, чтобы получить N. Например, вычисление уже известных значений можно представить так:
log22 = 1, log24 = 2, log28 = 3.
Формула Хартли: i=log2N. Здесь i – количество информации, содержащееся в сообщении об одном из N равновероятных
исходов события.
Для измерения информационных объемов используются
следующие единицы:
1 байт = 8 битов
1 килобайт = 1Кб = 210байтов = 1024 байта
1 мегабайт = 1Мб = 210Кб = 1024 Кб
1 гигабайт = 1Гб = 210Мб = 1024 Мб
1 терабайт = 1Тб = 210Гб = 1024 Гб.
Пример 7: Для регистрации на сайте некоторой страны
пользователю требуется придумать пароль. Длина пароля – ровно
11 символов. В качестве символов используются десятичные цифры и 12 различных букв местного алфавита, причѐм все буквы используются в двух начертаниях: как строчные, так и заглавные
(регистр буквы имеет значение!).

45
Под хранение каждого такого пароля на компьютере отводится минимально возможное и одинаковое целое количество
байтов, при этом используется посимвольное кодирование, и все
символы кодируются одинаковым и минимально возможным количеством битов. Определите объѐм памяти, который занимает
хранение 60 паролей.
Решение: для составления пароля используется алфавит,
мощность которого (количество используемых символов) определяется так: 10 десятичных цифр + 12 букв местного алфавита *2
(используется 2 начертания) = 34 символа.
По условию задачи все символы кодируются одинаковым и
минимально возможным количеством бит, т.е. 2i =34, поэтому
минимально возможное i = 6 битам. Тогда пароль длиной 11 символов будет иметь информационную емкость: 11*6 = 66 бит. Так
как под хранение пароля отводится минимально возможное и
одинаковое количество байтов, то 66 бит можно разместить в 9
байтах. Значит, для хранения одного пароля отводится 9 байт, а
для хранения 60 паролей требуется 60·9 = 540 байт.
Ответ: 540 байт.
Коротко о главном
1. Алфавитный подход – это способ измерения информаци-
онного объема текста, не связанного с его содержанием.
2. Алфавит – это вся совокупность символов, используемых
в некотором языке для представления информации. Мощность
алфавита – это число символов в нем.
3. 1 бит – информационный вес одного символа двухсимвольного алфавита (N=2).
4. Информационный вес символа (разрядность двоичного
кода) (b) и мощность алфавита (N) связаны формулой: N=2b.
5. Содержательный подход - определение количества информации в сообщении об исходе некоторого события.
6. Равновероятные исходы: никакой результат не имеет
преимущества перед другими.

46
7. Неопределенность знания – количество возможных исходов события (вариантов сообщения – N).
8. Количество информации в сообщении об одном исходе
события – i битов.
9. 1 бит – количество информации в сообщении об одном из
двух равновероятных результатов некоторого события.
10. Количество информации, содержащееся в сообщении об
одном из N равновероятных исходов некоторого события, определяется из решения показательного уравнения: 2i =N.
11. Формула Хартли: i=log2N
Вопросы и задания
1. Есть ли связь между алфавитным подходом к измерению
информации и содержанием информации?
2. Что такое бит с позиции алфавитного подхода к измерению информации?
3. Какой информационный вес имеет каждая буква русского
алфавита, если они кодируются одинаковым минимально возможным количеством двоичных разрядов?
4. Что такое неопределенность знания об исходе некоторого
события?
5. Как определяется единица измерения количества информации в рамках содержательного подхода?
6. «Вы выходите на следующей остановке?» - спросили человека в автобусе. «Нет», - ответил он. Сколько информации содержит ответ?
7. Сколько битов информации несет сообщение о том, что
из колоды в 32 карты достали «даму пик»?
8. Какой объем информации содержит сообщение, уменьшающее неопределенность знания в 4 раза?
9. В библиотеке 16 стеллажей с книгами. На каждом стеллаже 8 полок. Библиотекарь сообщил, что нужная книга находится на пятом стеллаже на третьей сверху полке. Какое количество
информации передал библиотекарь?

47
10. Сообщение, записанное буквами из 64-символьного алфавита,
содержит 20 символов. Какой объем информации оно несет?
11. Словарный запас племени пульти составляют 256 слов
одинаковой длины. Каждая буква алфавита несет 2 бита информации. Какова длина слова этого племени?
12. Информационное сообщение объемом 1,5 Кбайт содержит 3072 символа. Сколько символов содержит алфавит, при помощи которого было записано это сообщение?
13. Объем сообщения, содержащего 1024 символа, составил
1/512 часть мегабайта. Каков размер алфавита, с помощью кото-
рого записано сообщение?
14. Для записи текста использовался 256-символьный алфа-
вит. Каждая страница содержит 30 строк по 70 символов в строке.
Какой объем информации содержат 5 страниц текста?
15. Сообщение занимает 3 страницы по 25 строк. В каждой
строке записано по 60 символов. Сколько символов в использованном
алфавите, если все сообщение содержит 1125 байт?
16. В некоторой стране автомобильный номер длиной 7
символов составляется из заглавных букв (всего используется 26
букв) и десятичных цифр в любом порядке. Каждый символ кодируется одинаковым и минимально возможным количеством бит, а
каждый номер – одинаковым и минимально возможным количеством байт. Определите объем памяти, необходимый для хранения 20 автомобильных номеров.
17. В базе данных хранятся записи, содержащие информацию о датах. Каждая запись содержит три поля: год (число от 1 до
2100), номер месяца (число от 1 до 12) и номер дня в месяце (число от 1 до 31). Каждое поле записывается отдельно от других полей с помощью минимально возможного числа бит. Определите
минимальное количество бит, необходимых для кодирования одной записи.
18. В некоторой стране автомобильный номер состоит из 8
символов. Первый символ – одна из 26 латинских букв, остальные
семь – десятичные цифры. Пример номера – A1234567. Каждый
символ кодируется минимально возможным количеством бит, а
каждый номер – одинаковым и минимально возможным количе-

48
ством байт. Определите объем памяти, необходимый для хране-
I V X L C D M
1 5 10
50
100
500
1000
ния 30 автомобильных номеров.
19. При регистрации в компьютерной системе, используе-
мой при проведении командной олимпиады, каждому ученику
выдается уникальный идентификатор – целое число от 1 до 1000.
Для хранения каждого идентификатора используется одинаковое
и минимально возможное количество бит. Идентификатор команды состоит из последовательно записанных идентификаторов
учеников и 8 дополнительных бит. Для записи каждого идентификатора команды система использует одинаковое и минимально
возможное количество байт. Во всех командах равное количество
участников. Сколько участников в каждой команде, если для хранения идентификаторов 20 команд-участниц потребовалось 180
байт?
6. Системы счисления. Перевод чисел из одной
системы счисления в другую
Система счисления – это способ представления чисел и
соответствующие ему правила действия над числами. Разнообразные системы счисления, которые существовали раньше и которые
используются в наше время, можно разделить на непозиционные
и позиционные. Знаки, используемые при записи чисел, называются цифрами. Совокупность всех используемых цифр – алфа-
витом, количество цифр в алфавите - размерностью алфавита.
В непозиционных системах счисления от положения цифры в записи числа не зависит величина, которую она обозначает.
Примером непозиционной системы счисления является римская
система. В римской системе в качестве цифр используются латинские буквы:

49
Пример 8. Число CCXXXII складывается из двух сотен,
n
Название
Алфавит
2
Двоичная
0 1
8
Восьмеричная
0 1 2 3 4 5 6 7
10
Десятичная
0 1 2 3 4 5 6 7 8 9
16
Шестнадцатеричная
0 1 2 3 4 5 6 7 8 9 A B C D E F
Разряды
3 2 1 0
-1
-2
-3
Число 6 2 4 8 , 5 4 7
трех десятков и двух единиц и равно двумстам тридцати двум.
В римских числах цифры записываются слева направо в порядке убывания. В таком случае их значения складываются. Если
же слева записана меньшая цифра, а справа – большая, то их значения вычитаются.
Пример 9. VI = 5 + 1 + 6, а IV = 5 – 1 = 4.
Пример 10.
MCMXCVIII = 1000 + (-100 + 1000) + (-10 + 100) + 5 + 1 + 1 + 1 = 1998.
В позиционных системах счисления величина, обозначаемая цифрой в записи числа, зависит от ее позиции. Количество
используемых цифр называется основанием позиционной системы счисления.
Для записи чисел в позиционной системе с основанием n
нужно иметь алфавит из n цифр. Обычно для этого при n≤10 используют n первых арабских цифр, а при n>10 к десяти арабским
цифрам добавляют буквы.
Если требуется указать основание системы, в которой записано число, то оно указывается как нижний индекс: 1011012,
36718, 3B8F16. Это примеры свернутой, краткой записи чисел в
системах счисления с основанием 2, 8, 16.
Каждая позиция в записи числа называется разрядом чис-
ла. Разряды нумеруются в целой части числа положительными
целыми числами, начиная с нуля, в дробной части – отрицательными числами, начиная с (-1):

50
В записи многозначного числа цифры, стоящие в разных
n
Базис
2
... 28, 27, .26, 25, 24, 23, 22, 21, 20, 2-1, 2-2, 2-3, ...
8
... 88, 87, .86, 85, 84, 83, 82, 81, 80, 8-1, 8-2, 8-3, ...
10
... 108, 107, .106, 105, 104, 103, 102, 101, 100, 10-1, 10-2, 10-3, ...
16
... 168, 167, .166, 165, 164, 163, 162, 161, 160, 16-1, 16-2, 16-3, ...
101,112=1 22 + 0 21 + 120 + 12-1 +12-2;
5670,3028=5 83 + 6 82 + 781 + 080 + 38-1 +08
-2
+ 28-3;
48,54710 = 4101 + 810° + 510-1 + 410-2 + 7 10-3;
15FC,316=1 163 + 5 162 + 15161 + 12160 + 316-1.
позициях, имеют разные веса. Вес определяется базисом системы
счисления.
Бесконечный в обе стороны ряд целых степеней основания
системы счисления называется базисом системы.
В развѐрнутой форме записи число записывается в виде
суммы, в которой каждое слагаемое - это цифра, умноженная на
свой вес. Примеры развернутых форм записи чисел в различных
системах счисления:
Перевод чисел из одной позиционной системы счисления в
другую.
Перевод целых чисел из системы счисления с основанием 10 в
систему счисления с основанием p.
Пример 11. Получить представление десятичного числа 343
в системе счисления с основанием 2.
Решение:
Способ 1
1) Получаем развернутую форму записи числа в двоичной
системе, используем соответствующий базис:
34310=1256 + 0128 +164 + 032 + 116 + 08 + 14 + 12 + 11=
= 128 + 027 +126 + 025 + 124 + 023 + 122 + 121 + 120.
2) Теперь делаем краткую запись представления числа. Для
этого выписываем коэффициенты при степенях двойки:
1010101112.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
