Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Лабораторная работа №1

.docx
Скачиваний:
0
Добавлен:
29.09.2026
Размер:
1 Мб
Скачать
☆

Министерство цифрового развития связи и массовых коммуникаций

Ордена Трудового Красного Знамени

Федеральное государственное бюджетное образовательное учреждение

высшего образования

«МОСКОВСКИЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ

СВЯЗИ И ИНФОРМАТИКИ»

Кафедра «Математическая кибернетика и информационные технологии»

Отчёт по лабораторной работе №1

по дисциплине «Большие данные»

Выполнил: студент группы БСТ2104

Ягудин Р.Р.

Проверила: Тимофеева А.И.

Москва, 2023 г.

СОДЕРЖАНИЕ

№ стр.

  1. Цель лабораторной работы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3

  2. Пункт 0 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3

  3. Пункт 1 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5

  4. Пункт 2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5

  5. Работа с UI . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11

Цель лабораторной работы:

Получить навыки работы с файловой системой HDFS

Пункт 0

На рисунке 1 представлен интерфейс Jenkins Job

Рисунок 1 – Интерфейс Jenkins Job

На рисунке 2 представлено открытие Pipeline IPA_VPN и переход к «сборке с параметрами»

Рисунок 2 – Открытие Pipeline IPA_VPN и переход к «сборке с параметрами»

После завершения сборки перехожу в почту и скачиваю ovpn-файл. Затем устанавливаю OpenVPN GUI, загружаю файл с почты и устанавливаю VPN-соединение (рисунок 3 и 4)

Рисунок 3 – Импорт ovpn-файла

Рисунок 4 – Установка VPN-соединения

Пункт 1

На рисунке 5 представлен вход на хост по протоколу ssh

Рисунок 5 – Вход на хост по протоколу ssh

Пункт 2

На рисунке 6 представлена команда для создания локального тестового файла

Рисунок 6 – Команда для создания локального тестового файла

На рисунке 7 представлена команда для увеличения размера файла, который превышает размер одного блока HDFS

Рисунок 7 – Команда для увеличения размера файла

На рисунке 8 представлена команда для создания новой директории в hdfs по пути /data/test_dir

Рисунок 8 – команда для создания новой директории

На рисунке 9 представлена команда, позволяющая положить в HDFS файл test по пути /data/test_dir/test, на рисунке 10 – результат работы команды

Рисунок 9 – Команда, позволяющая положить в HDFS файл test по пути /data/test_dir/test

Рисунок 10 – Результат работы команды

На рисунке 11 представлена команда, позволяющая скопировать директорию /data/test_dir в /data/test_dir_1

Рисунок 11 – команда, позволяющая скопировать директорию /data/test_dir в /data/test_dir_1

На рисунке 12 представлена команда, позволяющая удалить файл test из директории test_dir_1 без сохранения файла в корзине

Рисунок 12 – команда, позволяющая удалить файл test из директории test_dir_1 без сохранения файла в корзине

На рисунке 13 представлены команда для просмотра размера любой директории

Рисунок 13 - команда для просмотра размера любой директории

На рисунке 14 представлена команда для получения информации о том, как файл /data/test_dir/test хранится на файловой системе

Рисунок 14 – Команда для получения информации о том, как файл /data/test_dir/test хранится на файловой системе

Ответы на вопросы:

Какой фактор репликации установлен на кластере? Ответ: 3

Сколько блоков составляют файл? Ответ: 7

На рисунке 15 представлена команда для получения информации о каждом блоке, из которого состоит файл.

Рисунок 15 – Команда для получения информации о каждом блоке файла

0

Номер блока по порядку

BP-2089730104-192.168.0.3-1694299343161

Идентификатор block pull

blk_1073744125

Идентификатор блока

3301

Generation stamp. 

len=134217728

Объем блока

Live_repl=3

Количество живых реплик блока

DatanodeInfoWithStorage[192.168.0.7:50010

DatanodeInfoWithStorage[192.168.0.6:50010

DatanodeInfoWithStorage[192.168.0.8:50010

IP-адрес и порт, по которому доступен блок

DS-0fa1051e-e894-40f2-9702-25061bf076da

DS-1dc216c9-2a5f-488e-b078-213648c850b1

DS-6efcc178-736f-4d4d-9ae3-ae298b12f96e

Data Storage ID идентификатор ноды (Если у ноды изменится hostname или IP-адрес, нода всё равно будет идентифицироваться внутри HDFS)

DISK

Способ хранения блока (Может также хранится в S3-хранилище)

Таблица 1 – Данные о первом блока файла

На рисунке 16 представлена команда для получения подробной информацию о состоянии конкретного блока данных

Рисунок 16 – Команда для получения подробной информацию о состоянии конкретного блока данных

На рисунке 17 представлена команда для выполнения вывода информации (время доступа, размер одного блока, размер файла, владелец, фактор репликации) о файле /data/test_dir/test

Рисунок 17 – команда для выполнения вывода информации о файле /data/test_dir/test

На рисунке 18 представлена команда для чтения первых 10 символов тестового файла

Рисунок 18 – команда для чтения первых 10 символов тестового файла

Ответы на вопросы:

Почему мы не получили требуемых данных? Ответ: мы обратились к другой nod-е

На рисунке 19 представлена команда для добавления в curl-запрос флага -L (location). Эта опция заставит Curl повторить запрос для нового адреса, который мы получили ранее в Location.

Рисунок 19 – Команда для добавления в curl-запрос флага -L (location)

На рисунке 20 представлена команда для копирования файла /test из /data/test_dir в test_dir_1 и удаление /data/test_dir_1/test с помощью curl-команды

Рисунок 20 – Команда для копирования файла /test из /data/test_dir в test_dir_1 и удаление /data/test_dir_1/test с помощью curl-команды

Работа с UI

На рисунке 21 представлена команда для авторизации в Hadoop Manager Ambari

Рисунок 21 – Команда для авторизации в Hadoop Manager Ambari

На рисунке 22 представлен поиск созданного файла в директории /data

Рисунок 22 – Команда для поиска созданного файла в директории /data

На рисунке 23 представлена информация об одном из блоков данных

Рисунок 23 – Информация об одном из блоков данных

Ответы на вопросы:

Какой объём стандартного блока HDFS исходя из показателя Size? Ответ: 128 МБ

Есть ли блок, который отличается по размеру от остальных? Ответ: последний Block 6

Сколько пространства занимает последний блок файла в локальной файловой системе? Ответ: 9 МБ

Подумайте, при каких обстоятельствах количество реплик блоков файла может превышать стандартный фактор репликации?

  1. Увеличение фактора репликации для конкретного файла: в некоторых случаях можно увеличить фактор репликации для конкретного файла, чтобы обеспечить дополнительную отказоустойчивость или повысить доступность данных.

  2. Системные ошибки: если произойдет сбой в кластере, который приведет к потере некоторых блоков данных, система может автоматически создать дополнительные реплики для восстановления утраченных данных.

  3. Запросы на увеличение надежности: администраторы кластера могут решить увеличить фактор репликации для определенных файлов в ответ на запросы пользователей или в соответствии с политиками безопасности и управления данными.

  4. Управление данными в реальном времени: в некоторых случаях приложения могут динамически изменять фактор репликации для своих данных в реальном времени в зависимости от текущей нагрузки и требований к доступности данных.

13