Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Учпособ ТВ и Матстат.doc
Скачиваний:
91
Добавлен:
27.10.2018
Размер:
3 Мб
Скачать
☆

Математическая статистика

Выборочные и теоретические величины. Несмещенность, эффективность и состоятельность статистической оценки параметров. Элементы теории корреляции.

До сих пор мы предполагали, что имеется точная информация о рассматриваемой случайной переменной (т.е. об ее распределении вероятностей (в случае дискретной переменной) или о функции плотности распределения (в случае непрерывной переменной)). Используя эту информацию можно рассчитать теоретическое математическое ожидание , дисперсиюи любые другие характеристики.

Однако на практике мы не знаем точного вероятностного распределения или плотности распределения вероятностей, а лишь знаем результаты выборочного наблюдения. Понятия «генеральная совокупность», «выборка», «репрезентативность выборки» и способы отбора изложены в первой главе, здесь необходимо отметить, что результаты выборочных значений количественного признака для лучшей обозримости, облегчения обработки этих статистических данных упорядочивают ( по возрастанию, по совпадающим значениям, по интервалам и т.п.).

Обычно упорядочивают по неубыванию: . Разность между максимальным и минимальным значениями СВ называется размахом выборки (размахом варьирования).

Пусть выборка состоит из элементов (наблюдении), причем наблюдалось раз, - раз, … , - раз и - объем выборки. Наблюдаемые значения называют вариантами, а последовательность вариант, записанных в возрастающем порядке, - вариационным рядом. Числа наблюдений называют частотами, а отношения - относительными частотами.

Перечень вариант и соответствующих им частот (или относительных частот) в виде таблицы называют статистическим распределением выборки. Статистическое распределение можно задать также в виде последовательности интервалов и соответствующим их частот ( в качестве частоты, соответствующей определенному интервалу, принимают сумму частот элементов , попавших в этот интервал).

Заметим, что в теории вероятностей под распределением понимают соответствие между возможными значениями СВ и их вероятностями, а в математической статистике – соответствие между наблюдаемыми вариантами и их частотами (или относительными частотами).

Оценкой теоретической функции распределения является эмпирическая функция распределения (функция распределения выборки) – которая определяется как относительная частота события : , где - число значений СВ , меньших, чем , - объем выборки.

Например, чтобы найти , надо число вариант, меньших , разделить на объем выборки: . Из теоремы Бернулли следует, что относительная частота события , т.е. стремится по вероятности к вероятности этого события. Другими словами, при больших числа и мало отличаются одно от другого. Следовательно, целесообразно использовать эмпирическую функцию распределения выборки для приближенного представления теоретической (интегральной) функции распределения генеральной совокупности.

Такое заключение подтверждается и тем, чтообладает всеми свойствами.

Пример 2.8. Анализируется прибыль предприятий отрасли. Обследованы предприятий, данные по которым занесены в статистический ряд:

5

10

15

20

25

5

20

40

25

10

0,05

0,2

0,4

0,25

0,1

Необходимо построить эмпирическую функцию распределения и ее график (рис.2.8)

5 10 15 20 25

Рис. 2.8

Наглядно статистический ряд может быть представлен в виде полигона частот (или относительных частот) – это ломанная, отрезки которой соединяют точки . Для построения полигона частот на оси абсцисс откладывают варианты , а на оси ординат – соответствующие им частоты . Соединив точки получают полигон частот. Аналогично получают полигон относительных частот.

При большом объеме выборки ее элементы удобно сгруппировать в интервальный статистический ряд. Для этого вес интервал со всеми наблюдаемыми значениями выборки разбивают по интервалам равной длины ( - шаг разбиения). Число выбирает исследователь исходя из целесообразного количества групп. Интервальный статистический ряд наглядно представляется в виде гистограммы – гистограммой частот называют ступенчатую фигуру из прямоугольников, основаниями которых служат частичные интервалы длиною , а высоты равны отношению (плотность частоты). Площадь i – го частичного прямоугольника равна - сумме частот вариант i – го интервала. Следовательно, площадь гистограммы частот равна сумме всех частот, т.е. объему выборки .

Аналогично определяется гистограмма относительных частот.

На основании гистограммы обычно выдвигают предположение о виде закона распределения исследуемой величины, что позволяет придать определенную направленность исследованиям.

Пример 2.9 Для анализа доходов населения исследованы 300 семей. По уровню дохода население подразделено на групп. Полученные данные сгруппированы в следующий интервальный статистический ряд:

10

50

80

100

40

20

1/30

5/30

8/30

10/30

4/30

2/30

Необходимо построить гистограмму и выдвинуть предположение о виде закона распределения СВ - дохода населения.

В последнюю группу могут быт включены все субъекты, чей доход превышает 100. Для получения теоретических выводов последний интервал полагается той же длины (), что и остальные.

Построим гистограмму:

0 20 40 60 80 100 120

Рис. 2.9

Форма гистограммы соответствует нормальному закону распределения, т.е. предполагаем, что СВ имеет нормальное распределение: ~ . Далее следует определить параметры (мат. ожидание) и (среднее квадратическое отклонение).

Пусть объем генеральной совокупности равен N. Тогда математическим ожиданием СВ является генеральное среднее, а дисперсией - генеральная дисперсия:

, . (2.71)

Корень квадратный из генеральной дисперсии называется генеральным средним квадратическим отклонением. Таким образом, для нахождения генеральных числовых характеристик необходим анализ всей совокупности. Это требует больших затрат времени и материальных средств, а если объем генеральной совокупности и вовсе неизвестен, то задача не решаема. В реальности же задача решается (хотя и приближенно) выборочным методом – исследователь работает с выборками и находит оценки вышеуказанных генеральных характеристик – выборочные числовые характеристики.

Выборочное среднее – это среднее арифметическое наблюдаемых значений выборки.

, где - объем выборки. (2.72)

Если же значения имеют соответственно частоты (i=1,2,…,k), причем (т.е. выборка задана в виде статистического ряда), то

, (2.73)

т.е. выборочная средняя есть средняя взвешенная значений наблюдаемого признака с весами, равными соответствующим частотам.

Выборочная дисперсия является оценкой генеральной дисперсии

(2.74)

Если значения наблюдаемого признака имеют соответствующие частоты , причем = есть объем выборки, то

, (2.75)

т.е. выборочная дисперсия есть средняя взвешенная квадратов отклонений с весами, равными соответствующим частотам.

Выборочным средним квадратическим отклонением (стандартом) называют квадратный корень из выборочной дисперсии:

. (2.76)

В дальнейшем для упрощения выкладок будем обозначать через .

Групповая средняя – это среднее арифметическое значений наблюдаемого признака, принадлежащих группе.

Общая средняя – это среднее арифметическое значений наблюдаемого признака, принадлежащих совокупности всех групп.

Общая средняя равна средней арифметической групповых средних, взвешенной по объемам групп.

Пример. Пусть первая группа состоит из десяти элементов наблюдаемого признака со значениями равной единице и из пятнадцати элементов со значениями равной шести. Вторая группа – из 20 элементов со значениями 1 и из 30 элементов со значениями 5.

Найдем групповые средние:

, .

Найдем общую среднюю по групповым средним: .

Замечание. Для упрощения расчета общей средней совокупности большого объема целесообразно разбить ее на несколько групп, найти групповые средние и по ним найти общую среднюю.

Теорема. Сумма произведений отклонений на соответствующие частоты равна нулю:

.

Следствие Среднее значение отклонения равно нулю: .

Зачастую для вычисления применяют следующую формулу:

= = ,

Итак, , (2.77)

это формула вычисления дисперсии (безразлично – выборочной или генеральной).

При задании выборки в виде интервального статистического ряда в формулах (2.72) – (2.77) вместо рассматриваем среднее значение -го подыинтервала:

.

Для примера 2.8 имеем:

=15,75.

= 27,7625,

= 5,269.

Для примера 2.9 имеем:

= ,

= 578,22,

= 24,05.

Групповая, внутригрупповая, межгрупповая и общая дисперсии

Пусть совокупность (безразлично – генеральная или выборочная) разбита на групп. Каждую группу рассмотрим как самостоятельную совокупность, которая имеет свою групповую среднюю и дисперсию.

Групповая дисперсия – это дисперсия значений исследуемого (наблюдаемого) количественного признака принадлежащей группе относительно групповой средней:

, (2.78)

где - частота значения ; - номер группы; - объем группы .

Внутригрупповой дисперсией называют среднюю арифметическую дисперсий, взвешенную по объемам групп:

, (2.79)

где - объем группы ; - объем всей совокупности.

Межгрупповой дисперсией называют дисперсию групповых средних относительно общей средней:

(2.80)

где - групповая средняя группы ; - общая средняя; объем всей совокупности.

Общей дисперсией называют дисперсию значений признака всей совокупности относительно общей средней:

. (2.81)

Пример 2.10 Совокупность состоит из двух групп: первая группа содержит один элемент со значением 2, семь элементов со значениями 4 и два элемента со значениями 5, вторая группа содержит два элемента со значениями 3 и три элемента со значениями 8.

Найти а) групповые дисперсии

б) внуртигрупповую дисперсию

в) межгрупповую дисперсию

г) общую дисперсию

Решение.

а) Найдем групповые средние:

= ;

.

Найдем искомые групповые дисперсии: = 0,6;

.

б) Внутригрупповая дисперсия равна:

= 12/5.

в) Сначала найдем общую среднюю:

.

Используя вычисленные групповые средние , , найдем межгрупповую дисперсию:

.

г) Найдем общую дисперсию:

+.

Теорема. Если совокупность состоит из нескольких групп, то общая дисперсия равна сумме внутригрупповой и межгрупповой дисперсий:

(2.82)

Для вышеприведенного примера проверяем: .

Для того чтобы статистические оценки давали «хорошие» приближения оцениваемых параметров, они должны удовлетворять определенным требованиям:

быть несмещенные, эффективные и состоятельные.

  1. Несмещенность – оценки лишь по случайному совпадению могут в точности равняться характеристикам генеральной совокупности. Обычно не совпадают, присутствует определенная ошибка. Мы хотели бы, чтобы мат. ожидание оценки равнялось соответствующей характеристике генеральной совокупности.

Несмещенной называют статистическую оценку , мат. ожидание которой равно оцениваемому параметру при любом объеме выборки, т.е. . В противном случае оценку называют смещенной.

  1. Эффективной называют статистическую оценку, которая при заданном объеме выборки имеет наименьшую возможную дисперсию среди всех несмещенных оценок.

Предположим, что на основе двух выборок одного и того же объема имеем две несмещенные оценки теоретического (генерального) среднего (см. рис. 2.15)

Истинное значение

Рис. 2.15.

Какую оценку предпочесть: А несмещенная, но у В меньше дисперсии?

Поскольку функция плотности вероятностей для оценки более «сжата» чем для оценки , то с помощью первой мы скорее получим более точное значение. Говорят, эта оценка более эффективна.

Итак, для оценки желательно несмещенность и наименьшая возможная дисперсия (эффективность). Эти критерии иногда могут противоречить друг другу. Могут быть две оценки, одна из которых является несмещенной, другая же смещена, но имеет меньшую дисперсию, чем первая. Какую из оценок выбрать? Если вы намерены вести наблюдения за длительный период, когда возможные ошибки (отклонения) «погасят» друг друга, то выберете оценку. Если приемлемы малые ошибки, то выберете оценку .

Оценка называется асимптотически эффективной, если с увеличением объема выборки ее дисперсия стремится к нулю.

  1. Состоятельность. Естественно полагать, что при увеличении объема выборки оценка мат. ожидания - становится более точной. В единичном эксперименте большая выборка необязательно даст более точную оценку, чем меньшая выборка, так как всегда может присутствовать элемент везения (случайно неудачный выбор наблюдаемых значений), но общая тенденция – большая выборка обязательно даст более точные оценки.

Если предел оценки по вероятности (обычно для описания этого факта используют символ , означающий «предел по вероятности») равен истинному значению характеристики ген. совокупности, то эта оценка называется состоятельной. Иначе говоря состоятельной называется такая оценка, которая дает более точные значения с увеличением объема выборки, независимо от входящих в нее конкретных наблюдений.

Оценка параметра называют состоятельной, если она удовлетворяет закону больших чисел, т.е. сходится по вероятности к оцениваемому параметру: , ().

Состоятельная оценка, – у которой смещение и дисперсия стремятся к нулю при увеличении объема выборки. Для малых выборок иногда невозможно найти несмещенную оценку, но если анна хотя бы состоятельна, это лучше, чем не иметь никакой оценки. На малых выборках несостоятельная оценка может иметь меньшую дисперсию, чем состоятельная, поэтому требуется осторожность при выборе данных.

Нетрудно показать, что является несмещенной оценкой генерального среднего, т.е. . Выборочная средняя является и состоятельной оценкой генеральной средней.

Для оценки генеральной дисперсии по выборочной дисперсии умножают на дробь (чтобы компенсировать смещенность точнчной оценки).

«Исправленную» дисперсию обычно обозначают через .

. (2.83)

Для оценки среднего квадратического отклонения генеральной совокупности используют «исправленное» среднее квадратическое отклонение - .

Следует подчеркивать, что не является несмещенной оценкой, поэтому слово «исправленное» взято в кавычки.

Выборочную дисперсию обозначают также через вариацию - :

, (2.84)

Выборочную дисперсию переменной обозначают и через : .

Определенная таким образом выборочная дисперсия является смещенной оценкой теоретической (генеральной) дисперсии : и имеет отрицательное смещение. Причина в том, что она вычисляется как среднеквадратичное отклонение от выборочного среднего, а не от истинного. Так как выборочное среднее автоматически находится в центре выборки, то отклонения от него в среднем будут меньше отклонений от теоретического среднего значения.

При увеличении размера выборки или пишут , т.е. является состоятельной оценкой с отрицательным смещением для небольших выборок.

Выборочный коэффициент вариации определяется отношением выборочного среднего квадратического отклонения к выборочной средней, выраженным в процентах (см. ):

. (2.85)

Коэффициент вариации – безразмерная величина, удобна для сравнения величин рассеивания двух выборок, имеющих различные размерности, например, если варианты одного ряда выражены в сантиметрах, а другого – в граммах.

Кроме выборочной средней и выборочной дисперсии применяются и другие характеристики вариационного ряда. Укажем главные из них.

Модой называют варианту, которая имеет наибольшую частоту.

Например, для ряда:

варианта …………1 4 7 9

частота ………….5 1 20 6 мода равна 7.

Медианой (обозначают также ) называют варианту, которая делит вариационный ряд на две части, равные по числу вариант. Если число вариант нечетно, т.е. , то ; при четном медиана

.

Например, для ряда 2 3 5 6 7 медиана равна 5; для ряда 2 3 5 6 7 9 медиана равна(5+6)/2=5,5.

Средним абсолютным отклонением называют среднее арифметическое абсолютных отклонений:

.

Например, для ряда: варианта …….. 1 3 6 16

частота ……... 4 10 5 1 имеем:

, .

Среднее абсолютное отклонение служит для характеристики рассеяния вариационного ряда.

Выборочная ковариация и выборочный коэффициент корреляции

Наиболее употребляемыми характеристиками связи двух СВ являются меры их линейной связи – ковариация и коэффициент корреляции.

Выборочная ковариация является мерой взаимосвязанности двух переменных и позволяет выразить данную связь одним числом.

При наличии выборки из наблюдений выборочная ковариация между и вычисляют по формуле:

(2.86)

Все свойства и правила ковариации, изложенные выше (см. 2.68 -2.70), имеют место и для выборочной ковариации.

Если теоретическая ковариация не известна, то для ее оценки выборочную ковариацию умножают на (для «исправления» смещенности оценки).

.

Оценка теоретической ковариации имеет отрицательное смещение. Причина в том, что выборочные отклонения измеряются по отношению к выборочным средним значениям величин и и имеют тенденцию к занижению отклонений от истинных средних значений.

Итак, выборочная ковариация является смещенной оценкой теоретической ковариации, т. е. в большинстве случаев дает значения оценок, меньшие теоретических величин.

Выборочный коэффициент корреляции определяется путем замены в формуле (2.69) теоретических дисперсии и ковариации на их несмещенные оценки:

, (2.87)

где , . является показателем тесноты связи и несмещенной оценкой теоретической корреляции . Отметим другие модификации формулы для выборочного коэффициента корреляции:

; . (2.88)

Для практических расчетов наиболее удобна формула (2.87). Выборочный коэффициент корреляции (или просто ), при достаточно большом объеме выборки, обладает те же свойствами что и (см. (2.69)).

Следует отметить, что является непосредственно оценкой генерального (теоретического) коэффициента корреляции между и лишь в случае двумерного нормального закона распределения СВ и . В других случаях (когда распределения и отклоняются от нормального, например, одна из исследуемых величин - не является случайной и т.п.) выборочный коэффициент корреляции не следует рассматривать как строгую меру взаимосвязи переменных.

Вопросы для самопроверки

  1. Что такое генеральная совокупность и выборка?

  2. Назовите основные виды выборок и способы отбора элементов в них.

  3. Что такое статистический ряд и интервальный статистический ряд?

  4. Дайте определение эмпирической функции распределения, приведите ее аналитическое и графическое представление.

  5. Что такое полигон частот (относительных частот) и гистограмма? Для чего они используются?

  6. Как вычисляются основные числовые характеристики по результатам наблюдения (выборки): выборочные среднее, дисперсия, среднее квадратическое отклонение?

  7. Как вычисляется и где применяется выборочный коэффициент вариации?

  8. Как вычисляются выборочная ковариация и выборочный коэффициент корреляции?

  9. Приведите основные свойства выборочного коэффициента корреляции.

Упражнения и задачи

1. Приведены результаты наблюдения за объемами ежедневных продаж некоторого товара за 60 дней:

5, 6, 3, 2, 7, 7, 6, 6, 10, 11, 6, 4, 5, 6, 3, 12, 9, 10, 7, 4, 6, 7, 8, 8, 10, 5, 5, 4, 3, 6, 6, 7, 7, 8, 8, 10, 6, 4, 5, 6, 12, 7, 7, 8, 11, 9, 10, 5, 6, 4, 2, 7, 11, 8, 7, 9, 5, 6, 9, 5.

Необходимо:

а) построить статистический ряд;

б) определить размах выборки;

в) построить эмпирическую функцию распределения и ее график;

г) построить полигон относительных частот;

д) определить выборочные: среднюю, дисперсию, среднее квадратическое отклонение.

е) дать интервальную оценку генеральной средней на уровне значимости 0,05.

2. Для анализа продолжительности телефонных разговоров некоторой справочной телефонной службы с клиентами случайным образом отобраны 60 телефонных разговоров и зафиксированы их длительности (в секундах):

39, 60, 40, 52, 32, 68, 77, 61, 68, 60, 47, 49, 70, 55, 66, 80, 35, 67, 70, 55, 42,

52, 60, 82, 70, 55, 47, 39, 50, 58, 45, 50, 53, 33, 49, 54, 55, 70, 62, 60, 60, 40,

59, 64, 70, 55, 54, 35, 48, 52, 57, 55, 82, 70, 51, 35, 49, 60, 55, 47.

Необходимо:

а) вычислить выборочное среднее, выборочную дисперсию, выборочное среднее квадратическое отклонение рассматриваемого признака;

б) построить интервальный статистический ряд, включающий 5 интервалов (при этом какой шаг вы выбрали и почему?);

в) построить гистограмму и по ее виду выдвинуть предположение о законе распределения рассматриваемой СВ;

г) вычислить выборочные числовые характеристики рассматриваемой величины на основании построенного интервального статистического ряда;

д) построить интервальный статистический ряд, включающий 7 интервалов и вычислить на его основе выборочные числовые характеристики рассматриваемой случайной величины;

е) сравните результаты вычислений в пунктах а), г) и д); каковы ваши выводы?

3. По имеющейся эмпирической функции распределения построить статистический ряд и полигон частот, если объем выборки .

4. Анализируется размер дивидентов по акциям некоторой кампании. Для

анализа отобраны данные за последние 20 лет:

5, 10, 7, -5, 3, 10, 15, 10, 5, -3, -5, 3, 7, 15, 10, 10, 0, -2, 5, 10.

а) Каков ожидаемый размер дивидентов?

б) Как можно оценить риск от вложений в данную компанию?

5. Анализируется прибыль () фирм в некоторой отрасли. Имеющиеся статистические данные по 100 фирмам представлены следующим интервальным статистическим рядом:

, %

8

15

35

30

10

2

Необходимо:

а) оценить величину ожидаемой (средней) прибыли в отрасли;

б) построить гистограмму и выдвинуть предположение о виде закона распределения СВ ;

в) оценить величину относительного разброса прибылей в данной отрасли.

6. Даны результаты наблюдений цены некоторого товара в 20 магазинах: 50, 48, 47, 55, 50, 45, 50, 52, 48, 50, 52, 48, 50, 47, 50, 48, 52, 50, 50, 48.

Необходимо:

а) построить статистический ряд и полигон относительных частот;

б) определить предполагаемый вид закона распределения СВ – цены товара и оценить параметры предполагаемого закона распределения.

7. Данные наблюдений за СВ (количество вновь регистрируемых фирм) и (количество банкротств) за 10 лет представлены в следующей таблице:

Год

Год

1981

72500

1020

1986

82500

3000

1982

72900

1290

1987

87000

4000

1983

74150

1830

1988

86500

4200

1984

73500

2250

1989

90000

4500

1985

78350

2500

1990

89000

4000

а) Каково ожидаемое количество вновь регистрируемых фирм в течение года для данного временного интервала; каковы выборочная дисперсия и среднее квадратическое отклонение для этого показателя?

б) Каково ожидаемое количество банкротств в течение года для данного временного интервала; каковы выборочная дисперсия и среднее квадратическое отклонение для этого показателя?

в) Вычислите ковариацию и коэффициент корреляции между и . Являются ли эти переменные независимыми?

г) Если и коррелированны, то можно ли утверждать, что один из этих показателей является «следствием» другого, т.е. изменение одного влечет изменение другого?