Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Начальный курс информатики. Часть 1. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
41
Как измерить информацию? Это сделать сложнее, так как нет еѐ универсального определения. Существуют два подхода к измерению информации. Первый подход отталки­вается от практических нужд хранения и передачи информа­ции в технических системах и не связан со смыслом (содер­жанием) информации. Второй же подход рассматривает вос­приятие информации человеком и поэтому имеет дело со смыслом информации.
Алфавитный подход к измерению информации применяет­ся в цифровых (компьютерных) системах хранения и передачи информации. В этих системах используется двоичный способ ко­дирования информации. Алфавитный подход еще называют объ­ѐмным подходом. При алфавитном подходе для определения ко­личества информации имеет значение лишь размер (объѐм) хра­нимого и передаваемого кода.
Под алфавитом некоторого языка будем понимать набор букв, знаков препинания, цифр, скобок и других символов, ис­пользуемых в тексте. В алфавит также следует включить и про­бел. Полное число символов алфавита принято называть мощно­стью алфавита. Будем обозначать эту величину буквой N. На­пример, мощность алфавита из русских букв и отмеченных до­полнительных символов равна 54: 33 буквы + 10 цифр + 11 знаков препинания, скобки, пробел.
При алфавитном подходе считается, что каждый символ текста имеет определенный информационный вес. Информацион­ный вес символа зависит от мощности алфавита. В компьютере, для кодирования информации используются алфавит мощностью – 2. Он содержит всего 2 символа, которые обозначаются цифра­ми 0 и 1. Его называют двоичным алфавитом.
Информационный вес символа двоичного алфавита принят за единицу информации и называется 1 бит.
Комбинацию из нескольких знаков двоичного алфавита на­зовем двоичным кодом.
Используя двоичный алфавит, можно составить уникальный двоичный код символов алфавита мощностью 4.
42
Порядковый номер символа
1 2 3
4
Двоичный код
00
01
10
11
Порядковый но­мер символа
1 2 3 4 5 6 7
8
Двоичный код
000
001
010
011
100
101
110
111
N 2 4 8 16
b
1 бит
2 бита
3 бита
4 бита
Информационный вес символов такого 4 символьного алфа­вита – 2 бита.
С увеличением мощности алфавита увеличивается инфор­мационный вес символов этого алфавита. Так, один символ из 8 – символьного алфавита (N = 8) «весит» 3 бита.
Определим зависимость между мощностью алфавита (N) и количеством знаков (разрядностью) в двоичном коде (b).
N=2b
Разрядность двоичного кода – это и есть информационный
вес символа.
В компьютере любые виды информации: тексты, числа, изображения, звук – представляются в форме двоичного кода.
Объем информации любого вида, выраженный в битах, ра­вен длине двоичного кода, в котором эта информация представле­на.
Например, объем информации 01100011, представленной двоичным кодом, – 8 бит.
Содержательный подход к измерению информации ос­нован на определении информации как содержания сообщения, получаемого человеком. Сущность содержательного подхода за­ключается в следующем: сообщение, информирующее об исходе какого-то события, снимает неопределенность знания человека об этом событии. Чем больше первоначальная неопределенность знания, тем больше информации несет сообщение, снимающее эту неопределенность.
43
Клод Шеннон
1916-2001
Пример 3. Вам назначили нового преподавателя; на вопрос «Это мужчина или женщина?» был дан ответ «Мужчина».
Неопределенность в знании в данном случае, т.е. количест­во возможных исходов, условно равно 2.
Пример 4. На выборах мэра города было представлено 4 кандидата (неопределенность в знании условно равна 4). После подведения итогов голосования, узнали, что избран Н.Н. Иванов.
Наибольшее количество информации несет сообщение в примере 4, поскольку неопределенность знания об исходе собы­тия в этом случае была наибольшей.
В 40-х годах XX века проблема из­мерения информации была решена амери­канским ученым Клодом Шенноном - ос­нователем теории информации. Согласно Шеннону, информация – это снятая не-
определенность знания человека об ис­ходе какого-то события.
Сообщение, уменьшающее неопре­деленность знания об исходе некоторого события в два раза, несет 1 бит информа-
ции.
Согласно определению сообщение в примере 3 несет 1 бит информации, поскольку из двух возможных вариантов ответа был выбран один. В примере 4 – 2 бита, так как снять неопределенность можно только дважды последовательно уменьшив неопределенность в 2 раза, получая каждый раз инфор­мацию в 1 бит.
Во всех рассмотренных примерах предполагается, что воз-
можные исходы события равновероятны.
Введем обозначения: N – количество возможных исходов события (неопределенность знания), i – количество информации в сообщении наступлении одного из N результатов. Связь между этими величинами выражается следующей формулой:
2i =N
Пример 5: В электропоезде 16 вагонов. Какое количество информа- ции содержится в сообщении о том, что ваш друг едет в вагоне 8?
44
Решение: чтобы ответить на вопрос, нужно решить уравне- ние: 2i=16, i=4 бита.
Ответ: 4 бита.
Пример 6. В кинозале 16 рядов, в каждом ряду 32 места.
Какое количество информации несет сообщение о том, что вам купили билет на 12-й ряд, 10-е место?
Решение: в кинозале всего 16·32 = 512 мест. Сообщение о купленном билете однозначно определяет выбор одного из этих мест. Из уравнения 2i = 512 = 29 получаем: i = 9 битов.
Ответ: 9 битов.
Решение уравнения 2i =N в общем виде можно записать так: i=log2N (формула Хартли). Логарифм по основанию 2 от N – это степень, в которую нужно возвести 2, чтобы получить N. Напри­мер, вычисление уже известных значений можно представить так:
log22 = 1, log24 = 2, log28 = 3.
Формула Хартли: i=log2N. Здесь i – количество информа­ции, содержащееся в сообщении об одном из N равновероятных исходов события.
Для измерения информационных объемов используются следующие единицы:
1 байт = 8 битов
1 килобайт = 1Кб = 210байтов = 1024 байта
1 мегабайт = 1Мб = 210Кб = 1024 Кб
1 гигабайт = 1Гб = 210Мб = 1024 Мб
1 терабайт = 1Тб = 210Гб = 1024 Гб.
Пример 7: Для регистрации на сайте некоторой страны пользователю требуется придумать пароль. Длина пароля – ровно 11 символов. В качестве символов используются десятичные циф­ры и 12 различных букв местного алфавита, причѐм все буквы ис­пользуются в двух начертаниях: как строчные, так и заглавные (регистр буквы имеет значение!).
45
Под хранение каждого такого пароля на компьютере отво­дится минимально возможное и одинаковое целое количество байтов, при этом используется посимвольное кодирование, и все символы кодируются одинаковым и минимально возможным ко­личеством битов. Определите объѐм памяти, который занимает хранение 60 паролей.
Решение: для составления пароля используется алфавит, мощность которого (количество используемых символов) опреде­ляется так: 10 десятичных цифр + 12 букв местного алфавита *2 (используется 2 начертания) = 34 символа.
По условию задачи все символы кодируются одинаковым и минимально возможным количеством бит, т.е. 2i =34, поэтому минимально возможное i = 6 битам. Тогда пароль длиной 11 сим­волов будет иметь информационную емкость: 11*6 = 66 бит. Так как под хранение пароля отводится минимально возможное и одинаковое количество байтов, то 66 бит можно разместить в 9 байтах. Значит, для хранения одного пароля отводится 9 байт, а для хранения 60 паролей требуется 60·9 = 540 байт.
Ответ: 540 байт.
Коротко о главном
1. Алфавитный подход – это способ измерения информаци-
онного объема текста, не связанного с его содержанием.
2. Алфавит – это вся совокупность символов, используемых в некотором языке для представления информации. Мощность алфавита – это число символов в нем.
3. 1 бит – информационный вес одного символа двухсим­вольного алфавита (N=2).
4. Информационный вес символа (разрядность двоичного кода) (b) и мощность алфавита (N) связаны формулой: N=2b.
5. Содержательный подход - определение количества ин­формации в сообщении об исходе некоторого события.
6. Равновероятные исходы: никакой результат не имеет преимущества перед другими.
46
7. Неопределенность знания – количество возможных исхо­дов события (вариантов сообщения – N).
8. Количество информации в сообщении об одном исходе события – i битов.
9. 1 битколичество информации в сообщении об одном из двух равновероятных результатов некоторого события.
10. Количество информации, содержащееся в сообщении об
одном из N равновероятных исходов некоторого события, опреде­ляется из решения показательного уравнения: 2i =N.
11. Формула Хартли: i=log2N
Вопросы и задания
1. Есть ли связь между алфавитным подходом к измерению информации и содержанием информации?
2. Что такое бит с позиции алфавитного подхода к измере­нию информации?
3. Какой информационный вес имеет каждая буква русского алфавита, если они кодируются одинаковым минимально возмож­ным количеством двоичных разрядов?
4. Что такое неопределенность знания об исходе некоторого события?
5. Как определяется единица измерения количества инфор­мации в рамках содержательного подхода?
6. «Вы выходите на следующей остановке?» - спросили че­ловека в автобусе. «Нет», - ответил он. Сколько информации со­держит ответ?
7. Сколько битов информации несет сообщение о том, что из колоды в 32 карты достали «даму пик»?
8. Какой объем информации содержит сообщение, умень­шающее неопределенность знания в 4 раза?
9. В библиотеке 16 стеллажей с книгами. На каждом стел­лаже 8 полок. Библиотекарь сообщил, что нужная книга находит­ся на пятом стеллаже на третьей сверху полке. Какое количество информации передал библиотекарь?
47
10. Сообщение, записанное буквами из 64-символьного алфавита, содержит 20 символов. Какой объем информации оно несет?
11. Словарный запас племени пульти составляют 256 слов
одинаковой длины. Каждая буква алфавита несет 2 бита инфор­мации. Какова длина слова этого племени?
12. Информационное сообщение объемом 1,5 Кбайт содер­жит 3072 символа. Сколько символов содержит алфавит, при по­мощи которого было записано это сообщение?
13. Объем сообщения, содержащего 1024 символа, составил 1/512 часть мегабайта. Каков размер алфавита, с помощью кото- рого записано сообщение?
14. Для записи текста использовался 256-символьный алфа-
вит. Каждая страница содержит 30 строк по 70 символов в строке. Какой объем информации содержат 5 страниц текста?
15. Сообщение занимает 3 страницы по 25 строк. В каждой строке записано по 60 символов. Сколько символов в использованном алфавите, если все сообщение содержит 1125 байт?
16. В некоторой стране автомобильный номер длиной 7 символов составляется из заглавных букв (всего используется 26 букв) и десятичных цифр в любом порядке. Каждый символ коди­руется одинаковым и минимально возможным количеством бит, а каждый номер – одинаковым и минимально возможным количе­ством байт. Определите объем памяти, необходимый для хране­ния 20 автомобильных номеров.
17. В базе данных хранятся записи, содержащие информа­цию о датах. Каждая запись содержит три поля: год (число от 1 до
2100), номер месяца (число от 1 до 12) и номер дня в месяце (чис­ло от 1 до 31). Каждое поле записывается отдельно от других по­лей с помощью минимально возможного числа бит. Определите минимальное количество бит, необходимых для кодирования од­ной записи.
18. В некоторой стране автомобильный номер состоит из 8 символов. Первый символ – одна из 26 латинских букв, остальные семь – десятичные цифры. Пример номера – A1234567. Каждый символ кодируется минимально возможным количеством бит, а каждый номер – одинаковым и минимально возможным количе-
48
ством байт. Определите объем памяти, необходимый для хране-
I V X L C D M
1 5 10
50
100
500
1000
ния 30 автомобильных номеров.
19. При регистрации в компьютерной системе, используе-
мой при проведении командной олимпиады, каждому ученику выдается уникальный идентификатор – целое число от 1 до 1000. Для хранения каждого идентификатора используется одинаковое и минимально возможное количество бит. Идентификатор коман­ды состоит из последовательно записанных идентификаторов учеников и 8 дополнительных бит. Для записи каждого иденти­фикатора команды система использует одинаковое и минимально возможное количество байт. Во всех командах равное количество участников. Сколько участников в каждой команде, если для хра­нения идентификаторов 20 команд-участниц потребовалось 180 байт?
6. Системы счисления. Перевод чисел из одной системы счисления в другую
Система счисления – это способ представления чисел и соответствующие ему правила действия над числами. Разнообраз­ные системы счисления, которые существовали раньше и которые используются в наше время, можно разделить на непозиционные и позиционные. Знаки, используемые при записи чисел, называ­ются цифрами. Совокупность всех используемых цифр – алфа- витом, количество цифр в алфавите - размерностью алфавита.
В непозиционных системах счисления от положения циф­ры в записи числа не зависит величина, которую она обозначает. Примером непозиционной системы счисления является римская система. В римской системе в качестве цифр используются латин­ские буквы:
49
Пример 8. Число CCXXXII складывается из двух сотен,
n
Название
Алфавит
2
Двоичная
0 1
8
Восьмеричная
0 1 2 3 4 5 6 7
10
Десятичная
0 1 2 3 4 5 6 7 8 9
16
Шестнадцатеричная
0 1 2 3 4 5 6 7 8 9 A B C D E F
Разряды
3 2 1 0
-1
-2
-3
Число 6 2 4 8 , 5 4 7
трех десятков и двух единиц и равно двумстам тридцати двум.
В римских числах цифры записываются слева направо в по­рядке убывания. В таком случае их значения складываются. Если же слева записана меньшая цифра, а справа – большая, то их зна­чения вычитаются.
Пример 9. VI = 5 + 1 + 6, а IV = 5 – 1 = 4. Пример 10.
MCMXCVIII = 1000 + (-100 + 1000) + (-10 + 100) + 5 + 1 + 1 + 1 = 1998.
В позиционных системах счисления величина, обозначае­мая цифрой в записи числа, зависит от ее позиции. Количество используемых цифр называется основанием позиционной систе­мы счисления.
Для записи чисел в позиционной системе с основанием n нужно иметь алфавит из n цифр. Обычно для этого при n≤10 ис­пользуют n первых арабских цифр, а при n>10 к десяти арабским цифрам добавляют буквы.
Если требуется указать основание системы, в которой запи­сано число, то оно указывается как нижний индекс: 1011012, 36718, 3B8F16. Это примеры свернутой, краткой записи чисел в системах счисления с основанием 2, 8, 16.
Каждая позиция в записи числа называется разрядом чис- ла. Разряды нумеруются в целой части числа положительными целыми числами, начиная с нуля, в дробной части – отрицатель­ными числами, начиная с (-1):
50
В записи многозначного числа цифры, стоящие в разных
n
Базис
2
... 28, 27, .26, 25, 24, 23, 22, 21, 20, 2-1, 2-2, 2-3, ...
8
... 88, 87, .86, 85, 84, 83, 82, 81, 80, 8-1, 8-2, 8-3, ...
10
... 108, 107, .106, 105, 104, 103, 102, 101, 100, 10-1, 10-2, 10-3, ...
16
... 168, 167, .166, 165, 164, 163, 162, 161, 160, 16-1, 16-2, 16-3, ...
101,112=1 22 + 0 21 + 120 + 12-1 +12-2;
5670,3028=5 83 + 6 82 + 781 + 080 + 38-1 +08
-2
+ 28-3;
48,54710 = 4101 + 810° + 510-1 + 410-2 + 7 10-3;
15FC,316=1 163 + 5 162 + 15161 + 12160 + 316-1.
позициях, имеют разные веса. Вес определяется базисом системы счисления.
Бесконечный в обе стороны ряд целых степеней основания системы счисления называется базисом системы.
В развѐрнутой форме записи число записывается в виде суммы, в которой каждое слагаемое - это цифра, умноженная на свой вес. Примеры развернутых форм записи чисел в различных системах счисления:
Перевод чисел из одной позиционной системы счисления в
другую.
Перевод целых чисел из системы счисления с основанием 10 в
систему счисления с основанием p.
Пример 11. Получить представление десятичного числа 343
в системе счисления с основанием 2.
Решение:
Способ 1
1) Получаем развернутую форму записи числа в двоичной
системе, используем соответствующий базис:
34310=1256 + 0128 +164 + 032 + 116 + 08 + 14 + 12 + 11=
= 128 + 027 +126 + 025 + 124 + 023 + 122 + 121 + 120.
2) Теперь делаем краткую запись представления числа. Для
этого выписываем коэффициенты при степенях двойки:
1010101112.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]