Статистика. Учебное пособие-1
.pdfкластерами не существует, исследователю приходится самому вводить границы между группами объектов. Задачам классификации (как теоретическим их аспектам, так и опыту успешного решения конкретных прикладных задач) посвящена многочисленная литература. Рассматривать их подробно в настоящей работе мы не будем. К задачам прогноза обычно относят и задачи анализа временных рядов.
Анализ временных рядов. Временным рядом называется последовательность чисел – значений некоторого показателя, измеренного в различные моменты времени. Временные ряды используются для описания динамики процессов, например, изменения температуры тела, концентрации определенного вещества в крови и т.д. На основании конечного отрезка временного ряда исследователь должен сделать выводы о свойствах рассматриваемого процесса и тех механизмах (в рамках статистики – вероятностных механизмах), которые порождают этот ряд. При изучении временных рядов ставятся следующие цели: агрегированное описание характерных особенностей ряда; подбор статистических моделей, описывающих временной ряд; предсказание будущих значений на основании прошлых наблюдений (прогноз динамики); выработка рекомендаций по управлению процессом, порождающим временной ряд. На сегодняшний день существует множество моделей и методов, позволяющих достигать перечисленных выше целей с учетом специфики исследуемого процесса. Эти методы подробно описаны в литературе и реализованы в компьютерных статистических пакетах.
Кластерный анализ. Кластерный анализ представляет собой средство исследования топологической структуры совокупности объектов. Он позволяет разбить множество объектов в признаковом пространстве на классы близких между собой объектов. Обнаруженные этим методом «сгустки объектов», называемые кластерами (классами, таксонами), позволяют сформулировать, в конечном счете, гипотезы о логической структуре совокупности. Кластеры, замечательным образом найденные в первый раз и разумно описанные исследователем, после повторного сбора информации и применения кластерного анализа могут «рассыпаться» из-за случайности выявленной кластерной структуры. Это разрушение может произойти тогда, когда реальная кластерная структура может отсутствовать вообще (исследуемая совокупность однородна) или когда задано не соответствующее реальности число классов. Среди множества методов кластерного анализа мы рассматриваем лишь методы, позволяющие
21
изучать большие массивы данных, не ограничивающиеся возможностями оперативной памяти ЭВМ.
Контрольные вопросы
1.Что изучает дисциплина «Статистика»?
2.Каковы ее предмет и метод?
3.Определите место статистики в системе экономических наук.
4.Охарактеризуйте систему статистических показателей.
5.В чем заключается особенность статистической методологии?
6.Что представляет собой статистический признак?
7.Каковы основные этапы статистического исследования?
22
1.2.МЕТОД ГРУППИРОВОК
1.Понятие о сводке и группировке статистических данных
Собранный в процессе статистического наблюдения материал представляет собой разрозненные первичные цифровые сведения об отдельных единицах изучаемого явления. В таком виде материал еще не характеризует явления в целом, так как он слишком разрознен и не классифицирован. Из него не видно ни состава, ни численности, ни существа связей этого явления с другими. Указанные признаки могут быть получены лишь в процессе обработки материалов наблюдения. Это и является задачей второго этапа статистической работы – сводка и группировка результатов статистического исследования.
Статистическая сводка – это систематизация первичных данных и подсчет обобщающих статистических показателей, относящихся ко всей совокупности.
Статистическая сводка классифицируется по ряду признаков: по глубине обработки данных:
–простая;
–сложная;
–комбинированная;
–многомерная;
по форме обработки материала:
–децентрализованная – это способ обобщения материала, который осуществляется снизу доверху по иерархической лестнице управления и на каждом из этапов подвергается обработке;
–централизованная – это способ, при котором все первичные данные, полученные в результате статистического наблюдения, сосредоточиваются в одной центральной организации и подвергаются обработке от начала до конца;
по технике выполнения:
–механизированная;
–ручная.
Статистическая группировка – это разделение множества единиц изучаемой совокупности на однородные типичные группы по определенным существенным количественным или качественным признакам.
23
Различают следующие виды статистических группировок:
–типологические – это разделение исследуемой качественно разнородной совокупности на классы, социально-экономические типы, однородные группы единиц;
–структурные – при группировке этого типа массив данных разбивается на группы, каждая из которых объединяет показатели, характеризующие состояние того или иного структурного элемента изучаемого явления или группы объектов, составляющих это явление;
–аналитические – это группировка, выявляющая взаимосвязи и взаимозависимости между изучаемыми социально-экономическими явлениями и признаками, их характеризующими.
Группированным признаком (основанием группировки) называется признак, по которому проводится разделение единиц совокупности на отдельные группы.
Все признаки в статистической науке можно подразделять на:
–факторные (признаки, которые оказывают большое влияние на изменение результативных признаков);
–результативные (признаки, изменяющиеся под влиянием факторных признаков).
В зависимости от числа положенных в основание группировки признаков различают простые, комбинационные и многомерные группировки.
Простой называется группировка, если группа образована только по одному признаку. Если разбить группу на подгруппу в соответствии с определенными признаками, то такую группировку называют комбинированной.
Комбинационной считается группировка, когда разбивка совокупности на группы производится по двум и более группировочным признакам, взятым в сочетании (комбинации) друг с другом Комбинационные группировки позволяют изучать единицы совокупности одновременно по нескольким признакам.
При изучении сложных социально-экономических явлений и процессов применяются комбинационные группировки. Для того чтобы построить комбинационную группировку, необходимо выявить наличие достаточно большого числа наблюдений.
Для того чтобы найти скопление (в мерном пространстве) объектов (точек), необходимо применить многомерную группировку
Различают группировки по используемой информации:
24
1)первичные – производятся на основе исходных данных, которые были получены в результате статистического наблюдения;
2)вторичные – это образование новых групп на основные ранее проведенной группировки.
Два способа вторичной группировки:
– способ укрупнения интервалов;
– способ деловой перегруппировки.
Метод группировок решает следующие задачи статистического анализа: 1. Выделение социально-экономических типов явлений.
2. Изучение структуры явления и структурных сдвигов, происходящих в
нем.
3. Обнаружение связи и зависимости между явлениями.
2. Интервал группировки
При группировке изучаемых явлений по одному признаку, а тем более при комбинации двух-трех признаков, можно получить значительное число групп (например, при группировке населения по возрасту, при группировке торговых фирм по числу работников или по размеру товарообороту и т.д.).
Для решения вопроса о числе групп необходимо сначала выяснить положение и роль отдельных групп, тенденции их развития и затем выделить характерные, типичные группы, вытекающие из анализа изучаемого явления.
Обычно рекомендуется брать не слишком много групп, так как при этом условии в каждую группу входит достаточно большое число единиц, что позволяет выявлять типичное, характерное, а не случайное.
Для определения числа групп можно воспользоваться формулой Стерджесса:
h +3,322lg N |
(1) |
где h – число групп; N – число единиц совокупности; lg N – десятичный логарифм от N .
25
Данная формула говорит о том, что выбор числа групп объектно зависит от объема совокупности. После установления числа групп решается вопрос об определении интервалов группировки.
Интервал группировки – это интервал значений варьирующего признака, лежащих в пределах определенной группы.
Каждый интервал имеет свою длину (ширину), верхнюю и нижнюю границы.
Нижняя граница интервала – это наименьшее значение признака в интервале, а верхняя граница интервала – его наибольшее значение. Ширина интервала – это разность между верхней и нижней границами.
Величина равного интервала определяется по следующей формуле:
h = |
R |
= |
X max − X min |
|
|
n |
n |
(2) |
|||
|
|
где X max , X min – максимальное и минимальное значение признака в совокупности; n – число групп.
Интервалы группировок могут быть закрытыми и открытыми. Закрытыми интервалами являются интервалы, в которых указаны верхняя и нижняя границы. Открытые интервалы имеют только одну границу (верхнюю – у первого, нижнюю – у последнего).
3. Ряды распределения
Статистический ряд распределения – упорядоченное распределение единиц изучаемой совокупности на группы по варьирующему признаку. Различают атрибутивные и вариационные ряды распределения.
Атрибутивные ряды распределения строятся по качественному признаку, вариационные – в порядке возрастания (или убывания) количественных значений признака.
Вариационные ряды распределения схематично представляют в виде таблицы, состоящей из двух столбцов. В первом столбце приводятся отдельные значения варьирующего признака – варианты, которые обозначают
. Во втором столбце содержатся частоты (
– абсолютные числа) или частости (
– относительные числа).
26
Виды вариационных рядов распределения: дискретные и интервальные. Дискретный вариационный ряд – ряд распределения, в котором индивидуальные значения признака (варианты) представлены в виде целых чисел. Интервальный вариационный ряд – ряд распределения, в котором индивидуальные значения признака (варианты) заданы в виде интервалов.
Варианты – отдельные возможные значения признаков. Частоты – числа, показывающие, как часто встречаются те или иные варианты в ряду распределения. Частостями называют частоты, выраженные в процентах или долях единицы.
Для графического изображения дискретных вариационных рядов применяют полигон распределения и кумуляту. Полигон используется при изображении дискретных вариационных рядов. При этом на оси абсцисс откладываются значения признака, а на оси ординат – частоты. Кумулята (кривая сумм) изображает ряд накопленных частот, которые определяются последовательным суммированием частот по группам и показывают, сколько единиц совокупности имеют значения признака не больше, чем рассматриваемое значение. На ось абсцисс наносятся значения признака, а на оси ординат откладываются накопленные частоты.
Интервальные вариационные ряды изображают графически в виде гистограммы, кумуляты или огивы. Огива получится, если при графическом изображении кумуляты поменять местами оси.
Гистограмма применяется для изображения интервальных рядов. При этом на оси абсцисс откладываются интервалы признака, на оси ординат – частоты. В случае если интервальный ряд построен с неравными интервалами, то вместо частот на ось ординат наносится плотность распределения признака в соответствующих интервалах.
Плотность распределения – это частота, рассчитанная на единицу ширины интервала.
Для изображения вариационных рядов может также использоваться кумулятивная кривая.
27
Контрольные вопросы
1.Сформулируйте сущность метода группировок.
2.Перечислите виды группировок в статистике.
3.Как определяется желаемое число групп при группировке по атрибутивному признаку?
4.Как определяется желаемое число групп при группировке по количественному (вариационному) признаку?
5.Дайте определение ряду распределения.
28
1.3. АБСОЛЮТНЫЕ И ОТНОСИТЕЛЬНЫЕ ВЕЛИЧИНЫ
1. Понятие абсолютных величин
Абсолютные величины – это результаты статистических наблюдений. В статистике в отличие от математики все абсолютные величины имеют размерность (единицу измерения), а также могут быть положительными и отрицательными.
Единицы измерения абсолютных величин отражают свойства единиц статистической совокупности и могут быть простыми, отражая одно свойство (например, масса груза измеряется в тоннах) или сложными, отражая несколько взаимосвязанных свойств (например, тонно-километр или киловатт-час).
Единицы измерения абсолютных величин могут быть трех видов: Натуральные – применяются для исчисления величин с однородными
свойствами (например, штуки, тонны, метры и т.д.). Их недостаток состоит в том, что они не позволяют суммировать разнородные величины.
Условно-натуральные – применяются к абсолютным величинам с однородными свойствами, но проявляющим их по-разному. Например, общая масса энергоносителей (дрова, торф, каменный уголь, нефтепродукты, природный газ) измеряется в т.у.т. – тонны условного топлива, поскольку каждый его вид имеет разную теплотворную способность, а за стандарт принято 29,3 мДж/кг. Аналогично общее количество школьных тетрадей измеряется в у.ш.т. – условные школьные тетради размером 12 листов. Аналогично продукция консервного производства измеряется в у.к.б. – условные консервные банки емкостью 1/3 литра. Аналогично продукция моющих средств приводится к условной жирности 40 %.
Стоимостные единицы измерения выражаются в рублях или в иной валюте, представляя собой меру стоимости абсолютной величины. Они позволяют суммировать даже разнородные величины, но их недостаток состоит в том, что при этом необходимо учитывать фактор инфляции, поэтому статистика стоимостные величины всегда пересчитывает в сопоставимых ценах.
Абсолютные величины могут быть моментными или интервальными. Моментные абсолютные величины показывают уровень изучаемого явления или процесса на определенный момент времени или дату (например, количе-
29
ство денег в кармане или стоимость основных фондов на первое число месяца). Интервальные абсолютные величины – это итоговый накопленный результат за определенный период (интервал) времени (например, зарплата за месяц, квартал или год). Интервальные абсолютные величины, в отличие от моментных, допускают последующее суммирование.
Абсолютная статистическая величина обозначается X, а их общее число в статистической совокупности – N.
Количество величин с одинаковым значением признака обозначается f и называется частота (повторяемость, встречаемость).
Cами по себе абсолютные статистические величины не дают полного представления об изучаемом явлении, так как не показывают его динамику, структуру, соотношение между частями. Для этих целей служат относительные статистические величины.
2. Понятие и виды относительных величин
Относительная статистическая величина – это результат соотношения двух абсолютных статистических величин.
Если соотносятся абсолютные величины с одинаковой размерностью, то получаемая относительная величина будет безразмерной (размерность сократится) и носит название коэффициент.
Часто применяется искусственная размерность коэффициентов. Она получается путем их умножения:
на 100 – получают проценты (%); на 1000 – получают промилле (‰);
на 10000 – получают продецимилле (‰O).
Искусственная размерность коэффициентов применяется, как правило, в разговорной речи и при формулировании результатов, а в самих расчетах она не используется. Чаще всего применяются проценты, в которых принято выражать полученные значения относительных величин. Чаще вместо названия относительная статистическая величина используется более краткий тер- мин-синоним – индекс (от лат. Index – показатель, коэффициент).
Относительные величины выражаются в коэффициентах либо в процентах и получаются путём сопоставления абсолютных величин. Статистикой определяются следующие виды относительных величин:
30
