Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Теория вероятностей и математическая статистика. Ч.2. Учебно-методическое пособие
.pdf
Стандартная ошибка
Стандартная
ошибка
n
S
Выборочная медиана
Медиана
xmed
1
2
1
kk
xxxmed
при
kn 2
1k
xxmed
при
12 kn
Выборочная мода
Мода
xmod
Наиболее часто встречающееся
значение в выборке; если таких
значений несколько – первое из них
Выборочное среднее
квадратическое
отклонение
Стандартное
отклонение
S
2
2
11
1
nn
ii
ii
n x x
S
nn
Несмещенная оценка
дисперсии
Дисперсия
2
S
2
2
2
11
1
nn
ii
ii
n x x
S
nn
Размах варьирования
Интервал
варьирования
I
1
xxI
n
Минимальное
значение варианты
Минимум
1
x
ni,xminx
i
1
1
Максимальное
значение варианты
Максимум
n
x
ni,xmaxx
in
1
Объем выборки
Счет
n
Количество наблюдений в выборке
Здесь и далее мы будем опускать пределы суммирования, предполагая,
ni 1
i
x
x
2
S
Sw
Ku
x
2
S
Sw, Ku
что оно производится по всем
объему обрабатываемой выборки,
элемент выборки после сортировки в порядке возрастания). Следует иметь в
виду, что Excel вычисляет так называемые несмещенные оценки для
математического ожидания (выборочное среднее
(несмещенную дисперсию
асимметрию
среднем каждая из вычисляемых статистик
оцениваемой ею характеристикой – математическим ожиданием, дисперсией,
коэффициентами асимметрии и эксцесса соответственно.
. Статистика «Счет» соответствует
- i-я порядковая статистика (т.е. i-й
), дисперсии
), коэффициента асимметрии (выборочную
), коэффициента эксцесса (выборочный эксцесс
,
,
20
), т.е. в
совпадает с

Приближением неизвестной функции распределения измеряемой
n
x
xF
n
n
x
n
ii
n,x
i
n
i
x
2
12
,N
1
ˆ
x
22
2
ˆ
S
2
12
,N
1 1 1
22
11
SS
X t n X t n
nn
22
2
2
22
11
22
11
11
n S n S
nn
случайной величины является эмпирическая функция распределения
, где
– число наблюдений, оказавшихся меньше x,
а n – объем выборки. Приближением многоугольника дискретного
распределения измеряемой случайной величины является полигон частот,
представляющий собой кусочно-линейный график с вершинами
– число появлений значения
среди результатов наблюдения.
, где
Представление о неизвестной плотности распределения непрерывной
случайной величины дает гистограмма выборки, графически отображающая
количество или долю наблюдений, попавших в заданный интервал
группировки. Можно строить гистограмму и для выборки из дискретного
распределения, но в этом случае полученная столбчатая диаграмма не может
рассматриваться как приближение плотности распределения, поскольку
плотности распределения у дискретной случайной величины просто нет.
Описательные статистики можно использовать также для оценивания
параметров распределения. Например, если наблюдаемая переменная имеет
нормальное распределение
, то наилучшей (состоятельной,
несмещенной и эффективной) оценкой математического ожидания является
выборочное среднее, т.е.
, а наилучшей (состоятельной, несмещенной и
асимптотически эффективной) оценкой дисперсии будет несмещенная
дисперсия
.
Для нахождения интервальных оценок для параметров распределения
можно использовать формулы
,
.
21

Заметим, что такие величины, как выборочное среднее
X
2
S
1
2
1tn
2
1
2
1n
2
1
2
1n
0 99,
10n
1 0 995
2
19
.
t n t
1 0 99,
22
1 0 005
2
19
,
n
22
1 0 995
2
19
,
n
2
12
,N
0 99.
1
2
1
S
tn
n
,
несмещенная оценка дисперсии
и объем выборки n получены ранее при
выполнении описательной статистики. Фактически неизвестными остаются
только квантили распределения Стьюдента
распределения
,
. Их мы находим из таблиц, которые
и хи-квадрат
представлены в большинстве учебных и справочных изданий по теории
вероятностей и математической статистике (см. список литературы в части 1)
и широко распространены в сети Интернет. В процессоре электронных
таблиц MS Excel это можно сделать с помощью функций СТЬЮДРАСПОБР
и ХИ2ОБР. Например, при
и
для нахождения
вводим в свободную ячейку MS Excel
=СТЬЮДРАСПОБР(0,01,9) (значение 0,01 получается как
) и
получаем значение 3,249842848. Для вычисления
вводим в свободную ячейку =ХИ2ОБР(0,005,9) и получаем значение
1,734911384, а для вычисления
вводим в свободную
ячейку =ХИ2ОБР(0,995,9) и получаем 23,58927478.
Для нахождения доверительного интервала неизвестного
математического ожидания по выборке из распределения
в MS
Excel есть встроенные возможности. Достаточно при нахождении
описательной статистики поставить галочку в поле Уровень надежности и
ввести требуемый уровень (в процентах!). То есть, например, при
надо ввести 99. В результате в итоговой таблице последняя строка будет
содержать значение
Нахождение коэффициента выборочной корреляции производится
выбором в окне Анализа данных процедуры Корреляция. Ввод данных
.
22

производится стандартным образом, в результате получаем таблицу
ˆˆ
r X ,Y r Y ,X
1
X
2
X
1
X
2
X
50
1
1
9 26 9 38 12 11 6 54 4 23 388 18
i
i
x , , , ... , , ,
50
2 2 2 2 2 2
1
1
9 26 9 38 12 11 6 54 4 23 3248 074
i
i
x . , , ... , , ,
50
11
1
1
7 7636
50
i
i
X x ,
2
50 50
2
11
11
2
50
4 78843
50 49
ii
ii
xx
S,
2
2 1882S S ,
11
1
22
1 25 1 26
7 24 7 37 7 305med X x x , , ,
1 25
x
1 26
x
корреляций. Следует подчеркнуть, что на диагонали всегда будут стоять
единицы, а вот внедиагональные элементы будут заполнены только
наполовину, поскольку
.
Нахождение уравнения выборочной прямолинейной регрессии в блоке
Анализа данных производится в процедуре Регрессия. Стандартный вывод
позволяет выписать как само уравнение, так и провести его анализ.
Пример 7. Найдем основные описательные статистики массивов
и
, приведенных в Приложении: выборочное среднее, несмещенную оценку
дисперсии, несмещенную оценку среднего квадратического отклонения,
выборочную моду, выборочную медиану и размах варьирования.
Решение. Выполним расчеты вручную непосредственно по формулам
табл. 2. Характеристики для
будут иметь индекс 1, для
-
соответственно, индекс 2.
Найдем вспомогательные характеристики:
,
Тогда выборочное среднее для первой выборки равно
, несмещенная оценка дисперсии, соответственно,
, несмещенная оценка среднего
квадратического отклонения
. Поскольку все значения
выборки уникальны (встречаются только один раз), мода не определена.
Выборочная медиана вычисляется после упорядочивания выборки по
возрастанию как
, где
и
- 25-й и 26-й элементы вариационного ряда, построенного для первой
23

выборки. Наименьшее значение в первой выборке
1
3 78x,
50
13 28x,
50 1
95x x ,
2
X
1
X
2
X
, наибольшее
, размах варьирования, соответственно,
.
Аналогично можно найти все перечисленные характеристики для
переменной
. Ввиду ограниченного объема учебно-методического
пособия мы опускаем соответствующие выкладки.
Проведем тот же анализ с использованием MS Excel. Исходные
переменные у нас расположены с столбцах А (переменная
(переменная
).
) и В
Нам необходимо, чтобы в программе был подключен пакет Анализ
данных, в нем мы выбираем встроенную процедуру Описательная
статистика. В разных версиях MS Excel это делается по-разному. Например,
в MS Excel-2010 для этого в строке управления выбирается «Файл», затем
«параметры», затем «надстройки», затем «пакет анализа»/ «перейти»/ «пакет
анализа»/ «ОК». Затем «данные»/«анализ данных» (в строке управления MS
Excel). В «Анализе данных» выбрать соответствующую опцию, в данном
случае «Описательная статистика»/«ОК». Затем нужно во входных данных
указать значение входного интервала. В нашем случае мы рассматриваем 50
данных в столбцах A и В с A1 по A51;
с B1 по B51 (либо можно выделить
«мышкой», два столбца в таблице). В
итоге появится $A$1:$B$51. Затем
отметить «Группирование: по столб-
цам» и установить флажок «Метки в
первой строке». Выведем результаты
на новый рабочий лист, присвоив ему
имя «ОС». Предусмотрительно
поставим флажок и в позиции
«уровень надежности», доверительный Рисунок 6
уровень 95% указав (рис. 6).
24

Результаты расчета в том виде, как они будут представлены в MS Excel,
2
X
1
X
2
X
2
12
N,
2
12
N,
1
M
1
M
0 95,
приведены на рис. 7. Как видим, данный процессор электронных таблиц
позволяет получить сразу описательную статистику для нескольких
переменных. Сопоставление этих результатов с ранее полученными вручную
демонстрирует их полную идентичность. Заметим, что у переменной
есть
повторяющееся значение 5,65, которое является выборочной модой
распределения.
Рисунок 7
Пример 8. Дополнительный анализ показывает, что изучаемые
переменные
некоторых нормальных случайных величин
с распределением
интервальные оценки неизвестных математических ожиданий
при уровне доверия
и
(см. Приложение) могли быть получены как измерения
с распределением
и
соответственно. Найдем точечные и
и
.
Решение. Как было указано выше, лучшей (состоятельной,
несмещенной и эффективной) оценкой математического ожидания
нормально распределенной случайной величины является ее выборочное
среднее, которое мы вычислили в примере 7, поэтому точечные оценки
25

равны
11
7 7636
ˆ
X,
12
6 0156
ˆ
X,
0 97549,
t
1
1
1 0 975
1
2 1882
49 7 7636 2 01 7 1416
50
,
S,
X t , , ,
n
1
1 0 975
1
2 1882
49 7 7636 2 01 8 3656
50
,
S,
X t , , ,
n
1
7 1416 8 3656 0 95P , , ,
1
3 5812 8 45 0 95P , , ,
0 97549,
S
t
n
7 7636 0 6219,,
6 0156 2 4344,,
1
X
2
X
и
соответственно, дополнительные
расчеты к тем, что были выполнены выше, здесь не требуются.
Для нахождения интервальной оценки необходима квантиль
которая находится по таблицам и равна 2,01 (если использовать процессор
MS Excel, то вводим в ячейке =СТЬЮДРАСПОБР(0,05,49), что дает
результат 2,009574018). Тогда границы доверительного интервала для
равны
,
.
Окончательно получаем, что
Аналогичные расчеты дают
.
.
,
Применение MS Excel делает расчеты гораздо короче. Дело в том, что
величины
уже подсчитаны и приведены в последней строке
таблицы на рис. 6 (это примерно 0,6219 и 0,6918 соответственно). Поэтому
границы первого доверительного интервала – это
, что дает
тот же результат, что и был получен ранее. Аналогично для второго
доверительного интервала имеем
, что также совпадает с
расчетами выше.
Пример 9. Проанализируем тесноту линейной связи между
переменными
и
с помощью выборочного коэффициента корреляции
Пирсона.
Решение. Имеется несколько эквивалентных вычислительных формул
для подсчета выборочного коэффициента корреляции:
26

1 1 2 2 1 2 1 2
11
2 2 2 2
22
1 1 2 2 1 1 2 2
1 1 1 1
nn
i i i i
ii
n n n n
i j i i
i j i i
x X x X x x n X X
ˆ
r
x X x X x n X x n X
.
50
12
1
9 26 6 40 9 38 7 80 12 11 9 76 6 54 11 44 4 23 7 67
2422 4834
ii
i
x x , , , , , , ... , , , ,
,
2422 4834 50 7 7636 6 0156 87 3478, , , ,
22
3248 074 50 7 7632 2099 7524 50 6 0156 260 8928, , , , ,
87 3478
0 3348
260 8928
,
ˆ
r,
,
Вторая формула для нас удобнее, поскольку большую часть входящих
туда величин мы уже нашли в примере 7. Остается найти только одну сумму
смешанных произведений:
Тогда числитель дроби равен
,
а знаменатель
и выборочный коэффициент корреляции равен
.
Проверим наши расчеты с помощью MS Excel. Выбираем «Анализ
данных»/«Корреляция»/«ОК». Заполнение окна показано на рис. 8, результат
расчета – на рис. 9. Он совпадает с ранее вычисленным вручную
непосредственно по формулам. Шкала Чеддока (табл. 1) характеризует в
этом случае линейную зависимость как умеренную. Уравнение этой
зависимости будет получено далее в примере 10.
Рисунок 8 Рисунок 9
27

Пример 10. Найдем и исследуем уравнение прямолинейной регрессии,
2
X
1
X
01
yx
1
YX
2
XX
x
Q
Q
y
X
XY
2
2
0
2
2
1
X
XY
Q
Q
2
6 0156x X ,
1
7 7636y X ,
2
2 2 2
11
11
234 39975
nn
X i i
ii
Q x x x n x ,
2
1 2 1 2
11
87 34779
nn
XY i i i i
ii
Q x x y y x x n X X ,
0
5 9541
ˆ
,
1
0 3008
ˆ
,
5 9541 0 3008
ˆ
y , , x
рассматривая в качестве независимой переменной
– переменную
.
Решение. Мы ищем уравнение вида
аппроксимирующее зависимость
уравнения имеют вид
от
,
,
Заметим, что последние две величины были найдены нами ранее в
примере 9. Подстановка дает
и
, в качестве зависимой
, наилучшим образом
. Оценки коэффициентов
, где
. Окончательное
,
,
уравнение получаем в виде
. В частности, увеличение
фондовооруженности на одну
единицу дает прирост
производительности труда в размере
примерно 0,3 соответствующей
единицы.
Для проверки результата в MS
Excel нам нужно вызвать окно
регрессионного анализа «Анализ
данных»/«Регрессия»/«ОК».
Заполнение полей показано на рис. 10. Рисунок 10
Результатом будут несколько таблиц и графиков.
28

Рисунок 11
Поле
Число
Интерпретация
Выводы
В4
0,334636816
Выборочный
коэффициент
корреляции
ˆ
r
Был ранее получен в примере 9,
означает умеренную прямолинейную
зависимость
1
X
от
2
X
В5
0,111981789
Коэффициент
детерминации
2
R
Характеризует долю разброса данных
около прямой, объясняемую
уравнением регрессии. В данном
случае около 11% разброса описы-
вается построенной прямолинейной
зависимостью, остальные 89%
приходятся на случайные факторы
F12
0,01753375
Уровень
значимости при
проверке
гипотезы о
незначимости
регрессии
Если это число маленькое (обычно
сравнивают с 0,05), то построенная
регрессия статистически значима
(коэффициент перед
x
существенно
отличен от нуля). В противном
случае регрессия статистически
незначима и прямолинейная
зависимость
Y
от X отсутствует. У
нас зависимость присутствует
В17
5,95407814
Значение коэф-
фициента
0
ˆ
Уравнение прямолинейной регрессии
получено в виде
5 95407814 0 30080488y , , x
В18
0,3300804884
Значение коэф-
фициента
1
ˆ
На рис. 11 приведены результаты расчета, в которых надо обратить
внимание на несколько важных полей (табл. 3).
Таблица 3 - Интерпретация результатов регрессионного анализа
29
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
