Лабораторная работа №1
.docxМинистерство цифрового развития связи и массовых коммуникаций
Ордена Трудового Красного Знамени
Федеральное государственное бюджетное образовательное учреждение
высшего образования
«МОСКОВСКИЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ
СВЯЗИ И ИНФОРМАТИКИ»
Кафедра «Математическая кибернетика и информационные технологии»
Отчёт по лабораторной работе №1
по дисциплине «Большие данные»
Выполнил: студент группы БСТ2104
Ягудин Р.Р.
Проверила: Тимофеева А.И.
Москва, 2023 г.
СОДЕРЖАНИЕ
№ стр.
Цель лабораторной работы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
Пункт 0 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
Пункт 1 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
Пункт 2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
Работа с UI . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
Цель лабораторной работы:
Получить навыки работы с файловой системой HDFS
Пункт 0
На рисунке 1 представлен интерфейс Jenkins Job
Рисунок 1 – Интерфейс Jenkins Job
На рисунке 2 представлено открытие Pipeline IPA_VPN и переход к «сборке с параметрами»
Рисунок 2 – Открытие Pipeline IPA_VPN и переход к «сборке с параметрами»
После завершения сборки перехожу в почту и скачиваю ovpn-файл. Затем устанавливаю OpenVPN GUI, загружаю файл с почты и устанавливаю VPN-соединение (рисунок 3 и 4)
Рисунок 3 – Импорт ovpn-файла
Рисунок 4 – Установка VPN-соединения
Пункт 1
На рисунке 5 представлен вход на хост по протоколу ssh
Рисунок 5 – Вход на хост по протоколу ssh
Пункт 2
На рисунке 6 представлена команда для создания локального тестового файла
Рисунок 6 – Команда для создания локального тестового файла
На рисунке 7 представлена команда для увеличения размера файла, который превышает размер одного блока HDFS
Рисунок 7 – Команда для увеличения размера файла
На рисунке 8 представлена команда для создания новой директории в hdfs по пути /data/test_dir
Рисунок 8 – команда для создания новой директории
На рисунке 9 представлена команда, позволяющая положить в HDFS файл test по пути /data/test_dir/test, на рисунке 10 – результат работы команды
Рисунок 9 – Команда, позволяющая положить в HDFS файл test по пути /data/test_dir/test
Рисунок 10 – Результат работы команды
На рисунке 11 представлена команда, позволяющая скопировать директорию /data/test_dir в /data/test_dir_1
Рисунок 11 – команда, позволяющая скопировать директорию /data/test_dir в /data/test_dir_1
На рисунке 12 представлена команда, позволяющая удалить файл test из директории test_dir_1 без сохранения файла в корзине
Рисунок 12 – команда, позволяющая удалить файл test из директории test_dir_1 без сохранения файла в корзине
На рисунке 13 представлены команда для просмотра размера любой директории
Рисунок 13 - команда для просмотра размера любой директории
На рисунке 14 представлена команда для получения информации о том, как файл /data/test_dir/test хранится на файловой системе
Рисунок 14 – Команда для получения информации о том, как файл /data/test_dir/test хранится на файловой системе
Ответы на вопросы:
Какой фактор репликации установлен на кластере? Ответ: 3
Сколько блоков составляют файл? Ответ: 7
На рисунке 15 представлена команда для получения информации о каждом блоке, из которого состоит файл.
Рисунок 15 – Команда для получения информации о каждом блоке файла
0 |
Номер блока по порядку |
BP-2089730104-192.168.0.3-1694299343161 |
Идентификатор block pull |
blk_1073744125 |
Идентификатор блока |
3301 |
Generation stamp. |
len=134217728 |
Объем блока |
Live_repl=3 |
Количество живых реплик блока |
DatanodeInfoWithStorage[192.168.0.7:50010 DatanodeInfoWithStorage[192.168.0.6:50010 DatanodeInfoWithStorage[192.168.0.8:50010 |
IP-адрес и порт, по которому доступен блок |
DS-0fa1051e-e894-40f2-9702-25061bf076da DS-1dc216c9-2a5f-488e-b078-213648c850b1 DS-6efcc178-736f-4d4d-9ae3-ae298b12f96e |
Data Storage ID идентификатор ноды (Если у ноды изменится hostname или IP-адрес, нода всё равно будет идентифицироваться внутри HDFS) |
DISK |
Способ хранения блока (Может также хранится в S3-хранилище) |
Таблица 1 – Данные о первом блока файла
На рисунке 16 представлена команда для получения подробной информацию о состоянии конкретного блока данных
Рисунок 16 – Команда для получения подробной информацию о состоянии конкретного блока данных
На рисунке 17 представлена команда для выполнения вывода информации (время доступа, размер одного блока, размер файла, владелец, фактор репликации) о файле /data/test_dir/test
Рисунок 17 – команда для выполнения вывода информации о файле /data/test_dir/test
На рисунке 18 представлена команда для чтения первых 10 символов тестового файла
Рисунок 18 – команда для чтения первых 10 символов тестового файла
Ответы на вопросы:
Почему мы не получили требуемых данных? Ответ: мы обратились к другой nod-е
На рисунке 19 представлена команда для добавления в curl-запрос флага -L (location). Эта опция заставит Curl повторить запрос для нового адреса, который мы получили ранее в Location.
Рисунок 19 – Команда для добавления в curl-запрос флага -L (location)
На рисунке 20 представлена команда для копирования файла /test из /data/test_dir в test_dir_1 и удаление /data/test_dir_1/test с помощью curl-команды
Рисунок 20 – Команда для копирования файла /test из /data/test_dir в test_dir_1 и удаление /data/test_dir_1/test с помощью curl-команды
Работа с UI
На рисунке 21 представлена команда для авторизации в Hadoop Manager Ambari
Рисунок 21 – Команда для авторизации в Hadoop Manager Ambari
На рисунке 22 представлен поиск созданного файла в директории /data
Рисунок 22 – Команда для поиска созданного файла в директории /data
На рисунке 23 представлена информация об одном из блоков данных
Рисунок 23 – Информация об одном из блоков данных
Ответы на вопросы:
Какой объём стандартного блока HDFS исходя из показателя Size? Ответ: 128 МБ
Есть ли блок, который отличается по размеру от остальных? Ответ: последний Block 6
Сколько пространства занимает последний блок файла в локальной файловой системе? Ответ: 9 МБ
Подумайте, при каких обстоятельствах количество реплик блоков файла может превышать стандартный фактор репликации?
Увеличение фактора репликации для конкретного файла: в некоторых случаях можно увеличить фактор репликации для конкретного файла, чтобы обеспечить дополнительную отказоустойчивость или повысить доступность данных.
Системные ошибки: если произойдет сбой в кластере, который приведет к потере некоторых блоков данных, система может автоматически создать дополнительные реплики для восстановления утраченных данных.
Запросы на увеличение надежности: администраторы кластера могут решить увеличить фактор репликации для определенных файлов в ответ на запросы пользователей или в соответствии с политиками безопасности и управления данными.
Управление данными в реальном времени: в некоторых случаях приложения могут динамически изменять фактор репликации для своих данных в реальном времени в зависимости от текущей нагрузки и требований к доступности данных.
