Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Компьютерная обработка статистических данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Т.Н. Ледащева, В.И. Чемоданова, Л.В. Брагина
КОМПЬЮТЕРНАЯ ОБРАБОТКА
СТАТИСТИЧЕСКИХ ДАННЫХ
Учебное пособие
Москва
Российский университет дружбы народов
2017
УДК 502/504:004(075.8) ББК 20.1+32.973.26-017.2 Л39
Российского университета
У т в е р ж д е н о
РИС Ученого совета
дружбы народов
Рецензент –
заведующая кафедрой прикладной экологии РУДН
доктор экономических наук, доцент М.М. Редина;
начальник отдела международных проектов и аудитов
в области ОТ, ПБ и ООС ООО «ФРЭКОМ» доктор экономических наук П.В. Касьянов
Ледащева, Т. Н.
Л39 Компьютерная обработка статистических данных :
учебное пособие / Т. Н. Ледащева, В. И. Чемоданова, Л. В. Брагина. – Москва : РУДН, 2017. – 86 с. : ил.
Пособие содержит описание лабораторных работ по обработке статистических данных при помощи пакета Excel, от первичной обработ­ки до анализа временных рядов. Пособие написано на основании много­летнего опыта преподавания дисциплины «Компьютерные технологии и статистические методы в экологии и природопользовании», относящейся к 1 году обучения в магистратуре экологического факультета РУДН.
В каждой теме приведены необходимые теоретические сведения, указана сфера применения разбираемых понятий и методов при решении реальных задач, с которыми могут встретиться в будущей научной и практической деятельности студенты-экологи. Подробно описан процесс выполнения заданий и предложены задания для самостоятельной отра­ботки полученных навыков. Для выполнения заданий на обработку ста­тистических данных предлагается использовать функции пакета стан­дартной установки Excel (процедуры из надстройки «Пакет анализа», требующей специальной установки, не рассматриваются).
ISBN 978-5-209-07999-6 © Ледащева Т.Н., Чемоданова В.И.,
Брагина Л.В., 2017 © Российский университет дружбы народов, 2017
Введение
Сложно представить себе научную работу в таких областях, как биология, медицина, экология, экономика и многих других без использования реальных данных. Но реальные данные, полученные на разных объектах, всегда немного отличаются – так, пробы воздуха, взятые в одной точке города в разное время дня или одновременно, но в разных точках будут различны. Поэтому нельзя делать выводы на основании всего лишь одного эксперимента – и, значит, придется собирать и обрабатывать статистические данные.
В практической работе эколог тоже вполне может столкнуться с необходимостью обработки статистических данных – так, анализ риска возникновения той или иной аварийной ситуации для составления декларации промышленной безопасности промышленного зачастую основан на статистических данных о работе аналогичных объектов.
Пакет Excel предоставляет достаточно широкие возможности для обработки статистических данных, и при этом широко распространен. Предлагаемое пособие призвано продемонстрировать возможности Excel и научить читателя ими пользоваться при решении задач статистического анализа.
Прежде, чем перейти к лабораторным работам, следует дать некоторые общие рекомендации. Внося в лист Excel данные, стоит указать, что это за данные. Вычисляя какой­либо параметр, обязательно укажите, что именно Вы вычисляете. Иными словами, Ваш лист Excel – не черновик для вычислений, он должен выглядеть как полноценное приложение к тексту и быть удобочитаем. Кроме того, результаты вычислений должны быть интерпретированы в терминах реальной задачи.
3
1. Первичная обработка статистических данных.
Построение рядов распределения
Упорядоченное распределение единиц совокупности на группы по некоторому количественному признаку называется вариационным рядом распределения (ВР). Так, население города может быть распределено в вариационный ряд по возрастным группам, по уровню доходов и т.п. - выбор признака определяется задачей статистического исследования. Если разбивают совокупность на группы по качественному признаку (например, по профессиям), то получается атрибутивный ряд распределения.
Любой ряд распределения характеризуется двумя элементами:
- варианта (хi) – это отдельные значения признака, по
которому строится ряд.
- частота (ni) – число, показывающее, сколько раз
встречается то или иное значение признака. Если частота выражена относительным числом n
*
=ni/n (т.е. долей
i
элементов совокупности, соответствующих данному значению варианты, в общем объеме совокупности), то она называется относительной частотой или частостью.
Вариационный ряд может быть:
- дискретным, когда изучаемый признак
характеризуется определенным числом (как правило, целым).
- интервальным, когда определены границы «от» и
«до» для непрерывно варьируемого признака. Интервальный ряд также строят, если множество значений дискретно варьируемого признака велико.
Интервальный ряд может строиться как с интервалами равной длины (равноинтервальный ряд) так и с неодинаковыми интервалами, если это диктуется условиями статистического исследования. Например, может рассматриваться ряд распределения доходов населения со следующими интервалами: <5тыс р., 5-10 тыс р., 10-20
4
тыс.р., 20-50 тыс р., и т.д. Если цель исследования не определяет способ построения интервального ряда, то строится равноинтервальный ряд, число интервалов в котором определяется по формуле Стерджесса:
k ≈1+3,322lg(n),
где k – число интервалов, n – объем выборки. В качестве числа интервалов выбирается ближайшее целое к полученному число. Длина интервала определяется по формуле d=(x
max-xmin
)/k.
Графически вариационные ряды могут быть представлены в виде:
- гистограммы (над каждым интервалом интервального ряда выстраивается «столбик» высоты, соответствующей частоте в этом интервале),
- полигона распределения (ломаная линия, соединяющая точки (хi;ni))
- кумуляты (строится по накопленным частотам, т.е. для каждого значения признака берется частота появления в совокупности объектов со значением признака меньшим данного).
При работе в Excel для построения вариационных рядов могут быть использованы следующие функции:
- СЧЁТ(массив данных) – для определения объема выборки. Аргументом является диапазон ячеек, в котором находятся выборочные данные.
- СЧЁТЕСЛИ(диапазон; критерий) – может быть использована для построения атрибутивного или вариационного ряда. Аргументами являются диапазон массива выборочных значений признака и критерий – числовое или текстовое значение признака или номер ячейки, в которой оно находится. Результатом является частота появления этого значения в выборке.
- ЧАСТОТА(массив данных; массив интервалов) – для построения вариационного ряда. Аргументами являются
5
диапазон массива выборочных данных и столбец интервалов.
2 4 5 6 5 2 3 4 1 4 3 3 4 3 3 4 4 4 4 5 5 3 4 1 3 4 3 5 4 3 5 3 3 2 3 4 6 5 4 4 4 2 3 4 4 6 5 1 5 2 6 2 3 3 4 5 4 4 6
4
Если требуется построить дискретный ряд, то здесь указываются значения варианты, если интервальный – то верхние границы интервалов (их еще называют «карманами»). Поскольку результатом является столбец частот, введение функции следует завершить нажатием сочетания клавиш CTRL+SHIFT+ENTER. Заметим, что задавая массив интервалов при введении функции, последнее значение в нем можно не указывать – в соответствующий «карман» будут помещены все значения, не попавшие в предыдущие «карманы». Иногда это помогает избежать проявления внутренней ошибки Excel, состоящей в том, что наибольшее выборочное значение может не помещаться автоматически в последний «карман»
Пример 1.1. Имеются данные о количественном составе семей, живущих в многоквартирном доме.
Построить вариационный ряд и полигон распределения
Решение.
Откроем таблицы Excel. Введем массив данных в
диапазон А1:L5. Если Вы изучаете документ в электронной форме (в формате Word, например), для этого достаточно выделить таблицу с данными и скопировать ее в буфер, затем выделить ячейку А1 и вставить данные – они автоматически займут подходящий диапазон. Подсчитаем объем выборки n, введя в ячейку В7 формулу =СЧЁТ(А1:L5). Заметим, что для того, чтобы в формулу ввести нужный диапазон, достаточно его выделить. Определим минимальное и максимальное значение в выборке, введя в ячейку В8 формулу =МИН(А1:L5), и в ячейку В9: =МАКС(А1:L5). (рис.1.1)
6
Рис.1.1. Первичная обработка статистических данных, начало
Далее, подготовим таблицу для построения вариационного ряда, введя названия для столбца интервалов (значений варианты) и столбца частот. В столбец интервалов введем значения признака от минимального (1) до максимального (6), заняв диапазон Е8:Е13. Выделим столбец для частот, введем формулу =ЧАСТОТА(А1:L5;Е8:Е13) и нажмем сочетание клавиш CTRL+SHIFT+ENTER. (рис.1.2)
Рис.1.2. Построение вариационного ряда
Для контроля вычислим сумму частот при помощи
7
функции СУММ (значок функции в группе
10,4
18,6
10,3
26,0
45,0
18,2
17,3
19,2
25,8
18,7
28,2
25,2
18,4
17,5
41,8
14,6
10,0
37,8
10,5
16,0
18,1
16,8
38,5
37,7
17,9
29,0
10,1
28,0
12,0
14,0
14,2
20,8
13,5
42,4
15,5
17,9
19,
10,8
12,1
12,4
12,9
12,6
16,8
19,7
18,3
36,8
15,0
37,0
13,0
19,5
«Редактирование» на вкладке «Главная»), вычисленная сумма должна совпасть с ранее вычисленным объемом выборки в ячейке В7.
Построим полигон: выделив полученный диапазон частот, выберем команду «График» на вкладке «Вставка». По умолчанию значения на горизонтальной оси – порядковые числа, что в нашем случаесовпадает со значениями варианты (количестве членов семьи) (рис.1.3.).
Рис.1.3. Построение полигона частот
Название ряда диаграммы «ряд 1» можно либо изменить, воспользовавшись той же опцией «выбрать данные» вкладки «Конструктор», либо просто удалить.
Пример 1.2. Имеются данные о выбросах загрязняющих веществ из 50 источников:
Составить равноинтервальный ряд, построить гистограмму
8
Решение
Внесем массив данных в лист Excel, он займет диапазон А1:J5. Как и в предыдущей задаче, определим минимальное и максимальное значения в выборке. Поскольку теперь требуется не дискретный, а интервальный ряд, и число интервалов в задаче не задано, вычислим в ячейке В10 число интервалов k по формуле Стерджесса (рис.1.4.).
Рис.1.4. Построение равноинтервального ряда, начало.
Полученное значение не является целым, оно равно примерно 6,64. Поскольку при k=7 длина интервалов будет выражаться целым числом (в отличие от случая k=6), выберем k=7, введя это значение в ячейку С10. Длину интервала d вычислим в ячейке В11, введя формулу =(В9-В8)/С10.
Зададим массив интервалов, указывая для каждого из 7 интервалов верхнюю границу. В ячейке Е8 вычислим верхнюю границу первого интервала, введя формулу =B8+B11; в ячейке Е9 верхнюю границу второго интервала, введя формулу =E8+B11. Остальные верхние границы вычисляются аналогично, поэтому зафиксируем номер ячейки В11 в введенной формуле при помощи знака $ и скопируем содержимое ячейки Е9 в ячейки Е10-Е14 (рис.1.5)
9
Рис.1.5. Построение равноинтервального ряда.
Последнее полученное значение равно максимальному значению в выборке. Массив «карманов» заполним при помощи функции ЧАСТОТА (рис. 1.6.)
Рис.1.6. Построение равноинтервального ряда, заполнение «карманов».
Теперь построим гистограмму: выделим столбец частот и выберем на вкладке «Вставка» «Гистограмма». Получив гистограмму, изменим в ней подписи горизонтальной оси на значения в диапазоне интервалов, для этого выберем опцию «Выбрать данные» вкладки «Конструктор». В появившемся окне выберем команду «Изменить» для раздела «Подписи горизонтальной оси» и введем диапазон значений варианты,
10
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]