Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Общая теория статистики. Практикум

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
71
т.е. средний вес спирали для всей партии электроламп лежит в интер­вале от 41,7 до 42,3 мг.
Пример 7.2.4. По городской телефонной сети в порядке случай- ной выборки произвели 100 наблюдений (n) и установили среднюю продолжительность одного телефонного разговора (
x
~
) – 5 мин при
среднем квадратическом отклонении — 2 мин.
Какова вероятность того, что ошибка репрезентативности при определении средней продолжительности телефонного разговора не превысит 18 секунд?
Решение
Для того, чтобы найти вероятность Р, требуется рассчитать t.
Он рассчитывается по формуле 30.
.2,0
100
2
22
мин
n
S
x
===
;
5,1
2,0
6018
=
=t
, откуда Р = 0,866.
Вывод. С вероятностью 86,6 % можно утверждать, что продол­жительность телефонного разговора не превысит 18 секунд.
Пример 7.2.5 Торговая сеть продала 10 000 единиц товара. Из них в 1-ом магазине сети продали 5 000 единиц, во втором мага­зине — 3 000 единиц, в третьем магазине — 2 000 единиц товара. С целью определения качества товара предполагается провести типи­ческую выборку продаж с пропорциональным отбором внутри групп.
Какое количество килограммов следует отобрать, чтобы с веро­ятностью 0,954 ошибка выборки не превышала 5 кг, если на основе предыдущих обследований известно, что дисперсия типической вы­борки равна 1 600.
72
Решение
1. Рассчитаем необходимую численность типичной выборки. По
таблице 1 Приложения 1 для p – 0,94, t = 2,0. Согласно табл. 7.2 по формуле (34) определим объем выборки:
222
22
16002100005
1000016002
+
=xn
= 250 единиц.
2. Необходимо отобрать 250 единиц товара. При этом в первом
магазине надо отобрать:
10000
5000
2501=n
= 125 единиц.
Во втором магазине
10000
3000
2502 =n
= 75 единиц.
В третьем магазине
10000
2000
2503 =n
= 50 единиц.
Пример 7.2.6. В микрорайоне проживает 5 000 семей. Требуется определить минимальный объем случайной бесповторной выборки, который позволит с вероятностью 0,95 оценить средний размер семьи с предельной ошибкой средней, равной 0,4, при среднем квадратиче­ском отклонении S = 2 человека, найденном по данным предвари­тельного обследования.
Решение
По табл. 1 Приложения 1 при p = 0,95 найдем t = 1,96.
Тогда численность выборки по табл. 7.2 равна:
222
22
296,14*5000
5000296,1
+
=xn
= 95 семей.
73
7.3. ЗАДАНИЯ ДЛЯ САМОСТОЯТЕЛЬНОГО РЕШЕНИЯ
Задание 7.3.1. На склад завода поступило 100 ящиков готовых изделии по 80 штук в каждом. Для установления среднего веса дета­лей следует провести серийную выборку методом механического от­бора так, чтобы с вероятностью 0,954 ошибка выборки не превышала 2 грамма. На основе предыдущих обследований известно, что дис­персия выборки равна 4.
Определить необходимый объем выборки.
Задание 7.3.2. В торговой сети, состоящей из 15 магазинов, проводилось выборочное обследование качества продукции на основе отбора серий (магазинов). Выборочные средние по магазинам соста­вили соответственно 14 кг, 15,5 кг, 15 кг, 14,5 кг.
С вероятностью 0,954 определить предельную ошибку выборки.
Задание 7.3.3. С целью определения средних затрат времени при поездках на работу населения города планируется выборочное наблюдение на основе случайного повторного отбора. Сколько людей должно быть обследовано, чтобы с вероятностью 0,954 ошибка вы­борки не превышала 1 минуту, при среднем квадратическом отклоне­нии 15 минут.
74
ГЛАВА 8. СТАТИСТИЧЕСКОЕ ИЗУЧЕНИЕ ВЗАИМОСВЯЗЕЙ
8.1. КРАТКИЕ ТЕОРЕТИКО-МЕТОДИЧЕСКИЕ МАТЕРИАЛЫ
Данный вопрос в конспекте Логиновой С.Л. рассмотрен на стр. 5965.
Одной из задач статистики является обнаружение (выявление) за­висимости как между количественными, так и между качественными показателями, признаками таких зависимостей и дать им количествен­ную характеристику.
Среди взаимосвязанных признаков (показателей) одни могут рассматриваться как определенные факторы, влияющие на изменение других (факторные), а вторые (результативные) — как следствие, результат влияния первых. Вследствие этого существует 2 вида связи между отдельными признаками: функциональная и стохастическая (статистическая), частным случаем которой является корреляционная.
Связь между двумя переменными x и y называется функциональ- ной, если определенному значению переменной x строго соответству- ет одно или несколько значений другой переменной y, и с изменени­ем значения x значение y меняется строго определенно [2].
Там, где взаимодействует множество факторов, в том числе и случайных, выявить зависимости, рассматривая единичный случай, невозможно. Такие связи можно обнаружить только при массовом наблюдении как статистические закономерности. Выявленная таким образом связь именуется стохастической [1].
Корреляционная связь — это связь, проявляющаяся при боль­шом числе наблюдений в виде определенной зависимости между средним значением результативного признака и признаками­факторами. Другими словами, корреляционную связь условно можно рассматривать как своего рода функциональную связь средней вели-
75
чины одного признака (результативного) со значением другого (или других) [3].
По характеру изменений x и y в парной корреляции различают прямую и обратную связь. При прямой связи значения обоих призна­ков изменяются в одном направлении, т.е. с увеличением (уменьше­нием) значений x увеличиваются (уменьшаются) и значения y. При обратной связи значения факторного и результативного признаков изменяются в разных направлениях.
Изучение корреляционных связей сводится в основном к ре­шению следующих задач:
1) выявление наличия (отсутствия) корреляционной связи меж-
ду изучаемыми признаками;
2) измерение тесноты связи между двумя (и более) признаками
с помощью специальных коэффициентов (эта часть исследования именуется корреляционным анализом);
3) определение уравнения регрессии — математической модели,
в которой среднее значение результативного признака у рассматрива­ется как функция одной или нескольких переменных — факторных признаков (эта часть исследования именуется регрессионным анализом).
Для выявления наличия и характера корреляционной связи меж­ду двумя признаками в статистике используется ряд методов.
1. Рассмотрение параллельных данных (значений x и y в каждой из n единиц). Единицы наблюдения необходимо расположить по воз­растанию значений факторного признака х и затем сравнить с ним (визуально) поведение результативного признака у.
2. Графический метод — это графическое изображение корре- ляционной зависимости. Для этого, имея n взаимосвязанных пар зна­чений x и y и пользуясь прямоугольной системой координат, каждую такую пару изображают в виде точки на плоскости с координатами x и y. Совокупность полученных точек представляет собой корреляци- онное поле а соединяя последовательно нанесенные точки отрезками, получают ломаную линию, именуемую эмпирической линией регрес-
76
сии. Визуально анализируя график, можно предположить характер зави- симости между признаками x и y.
3. Метод аналитических группировок для этого производят группировку единиц совокупности по факторному признаку и для каждой группы вычисляют среднее или относительное значении ре­зультативного признака.
4. Подбор уравнения регрессии представляет собой математиче­ское описание изменения взаимно коррелируемых величин по эмпи­рическим (фактическим) данным. Уравнение регрессии должно опре­делить, каким будет среднее значение результативного признака у при том или ином значении факторного признака х, если остальные факторы, влияющие на у и не связанные с х, не учитывать, т.е. аб­страгироваться от них [1].
Уравнение регрессии можно также назвать теоретической ли-
нией регрессии.
Рассчитанные по уравнению регрессии значения результативно-
го признака называются теоретическими. Они обычно обозначаются
x
y
ˆ
или
x
y
и рассматриваются как функция от х, т.е.
x
y
ˆ
= f(x).
Уравнение однофакторной (парной) линейной корреляционной
связи имеет вид:
x
y
ˆ
=
xаа
10
+
, (51)
где
x
y
ˆ
— теоретические значения результативного признака, полу-
ченные по уравнению регрессии; а0, а
1
коэффициенты (параметры)
уравнения регрессии.
Существует несколько методов нахождения параметров (а0, а1)
уравнения регрессии. Наиболее часто используется метод наимень- ших квадратов (МНК). Его суть заключается в следующем требова­нии: искомые теоретические значения результативного признака
x
y
ˆ
должны быть такими, при которых бы обеспечивалась минимальная сумма квадратов их отклонений от эмпирических значений, т.е.
77
( )
== min)
ˆ
(
2
110
2
xaayyyS
ix
.
Для нахождения минимума данной функции приравнивают к
нулю ее частные производные и получают систему двух линейных уравнений, которая называется системой нормальных уравнений:
 
=+
=+
xyxaxa
yxana
2
10
10
. (52)
Определив значения а0, а
1
и подставив их в уравнение связи
x
y
ˆ
=
xаа10
, находят значения
x
y
ˆ
, зависящие только от заданного зна-
чения.
Для решения системы применяется способ определителей, поз-
воляющий сводить к минимуму неточности округлений параметров уравнения регрессии.
a0 = . (53)
a1 = . (54)
5. Линейный коэффициент корреляции — самый популярный измеритель тесноты линейной связи между двумя количественными признаками x и y. Он основан на предположении, что при полной не­зависимости признаков x и у отклонения значений факторного при­знака от средней (
xx
) носят случайный характер и должны случайно
сочетаться с различными отклонениями (
yy
). При наличии значи-
тельного перевеса совпадений или несовпадений таких отклонений делается предположение о наличии связи между x и y.
Линейный коэффициент корреляции r представляет собой сред­нюю величину из произведений нормированных отклонений для x и у и определяется по формулам:
78
 
 
 
 
=
n
y
y
n
x
x
n
y
xxy
r
2
2
2
2
)()(
. (55)
Линейный коэффициент корреляции может принимать значения от –1 до +1.
Существует эмпирическое правило (шкала Чэддока) для оценки тесноты связи, представленное в табл. 8.1.
Таблица 8.1
Шкала Чэддока
| r |
Теснота связи
менее 0,1
отсутствует линейная связь
0,1 ÷ 0,3
слабая
0,3 ÷ 0,5
умеренная
0,5 ÷ 0,7
заметная
более 0,7
сильная (тесная)
Таким образом, коэффициент корреляции при линейной зависи­мости служит как мерой тесноты связи, так и показателем, характери­зующим степень приближения корреляционной зависимости между х и у к линейной. Поэтому близость значения r к 0 в одних случаях мо- жет означать отсутствие связи между х и у, а в других свидетельство­вать о том, что зависимость не линейная.
Мерой точности выбранного уравнения может служить остаточ­ная дисперсия, остаточное среднее квадратичное отклонение или средняя ошибка аппроксимации (приближения). При этом следует
иметь в виду, что сумма линейных отклонений (
z
tt
yy =
)
79
должна стремиться к минимуму (
=
n
i
t
1
min
) или
2
10
)( taay
t
=
t
, для остаточных сумм квадратов (
2
t
):
=
n
t
t
taay
1
2
10
)(
=
2
t
.
Чаще всего для определения точности выбранного уравнения связи выбирается определение средней ошибки аппроксимации.
Средняя ошибка аппроксимации рассчитывается по формуле
=
=
n
t
t
t
t
y
yy
n
E
1
1
100)(
1
. (56)
Нормативное значение средней ошибки аппроксимации равно
%%1512
1
E
.
8.2. ПРИМЕРЫ РЕШЕНИЯ ЗАДАНИЙ
Пример 8.2.1. Имеются по двенадцати предприятиям о сроках оборудования и затратах на его ремонт, представленные в табл. 8.2.1.
Таблица 8.2.1
Данные о сроке службы оборудования и затратах на ремонт
Номер предприятия
1 2 3 4 5 6 7 8 9
10
11
12
Срок службы оборудования
8
11
15 9 20
10
11
18
12
15
11
15
Затраты на ремонт, у.е.
155
230
270
170
337
190
200
300
250
240
192
275
80
Установить наличие связи методами:
1. Параллельных данных.
2. Графическим.
3. Аналитических группировок.
4. Расчетом коэффициента корреляции.
5. Подбором уравнения регрессии.
6. Проверить точность выбранного уравнения расчетом ошибки
аппроксимации.
Решение
1. Метод параллельных прямых.
В данном примере факторным признаком является срок службы оборудования. Значит результативным — затраты на ремонт. Сдела­ем таблицу (см.табл. 8.2.2), в которой проранжируем величину фак­торного признака величины срок службы оборудования (х) и затем сравним с ним (визуально) поведение результативного признака — затраты на ремонт (y).
Таблица 8.2.2
Проранжирование факторного и результативного признаков
Номер предприятия
1 2 3 4 5 6 7 8 9
10
11
12
Срок службы оборудования
8 9 10
11
11
11
12
15
15
15
18
20
Затраты на ремонт, у.е.
155
170
190
192
200
230
250
240
270
275
300
337
Проранжирование факторного признака показало, что с увели­чение срока эксплуатации оборудования затраты на ремонт увеличи­ваются.
2. Графический метод.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]