Статистические методы обработки данных в научно-технических исследованиях в области строительства и недвижимости. Учебно-методическое пособие
.pdfэкспериментальных данных, представленных в табличном виде, возникает потребность получения промежуточных значений. Для этого применяют методы линейной и нелинейной (полиноминальной) интерполяции (определение промежуточных значений) и экстраполяции (определение значений, лежащих вне интервала изменения данных).
3.5.ОРГАНИЗАЦИЯ И ПРОВЕДЕНИЕ НАБЛЮДЕНИЙ
ВЭКОНОМИЧЕСКИХ ИССЛЕДОВАНИЯХ ПРОЦЕССОВ
ВСТРОИТЕЛЬСТВЕ И НЕДВИЖИМОСТИ
Встатистическом анализе экономических явлений, которые сопровождают инвестиционно-строительные проекты в течение всего жизненного цикла (предпроектный этап – проектирование – строительство – эксплуатация), широко используется выборочный метод наблюдения, поскольку в сравнении со сплошным наблюдением он позволяет обеспечить значительную экономию ресурсов, расширить программу обследования и повысить его оперативность.
Как известно, выборочным называется такое несплошное наблюдение, при котором признаки регистрируются у отдельных единиц изучаемой статистической совокупности, отобранных с использованием специальных методов, а полученные в процессе обследования результаты с определенным уровнем вероятности распространяются на всю исходную совокупность.
Проблематика информационного обеспечения исследований рынка строительства и недвижимости предопределяет использование специальных статистических методов, позволяющих анализировать качество выборочных эмпирических данных.
Одной из причин нарушения однородности выборки является наличие в ее составе аномальных значений наблюдаемых признаков, которые могут привести к искажению аналитических результатов статистической обработки.
Задачи получения адекватных оценок для параметров изучаемой совокупности при наличии в ней не согласующихся с остальными элементами выборки наблюдений решаются посредством применения методов робастного (устойчивого) оценивания.
31
Методы робастного оценивания – это статистические методы, которые позволяют получить достаточно надежные оценки статистической совокупности с учетом неявности закона ее распределения и наличия существенных отклонений в значениях данных [0].
|
|
|
Таблица 1 |
|
|
Сравнительный анализ способов достижения |
|||
|
однородности выборочных данных |
|||
№ |
Способ |
Преимущества |
Недостатки |
|
п.п. |
||||
|
|
|
||
|
|
|
|
|
|
Эмпирические методы |
|
||
|
|
|
|
|
|
Усечение выборки – |
|
|
|
1 |
симметричное отбрасы- |
Простота |
Сильное искажение вы- |
|
вание нескольких край- |
борочных характеристик |
|||
|
|
|||
|
них элементов ряда |
|
|
|
|
|
|
|
|
|
Метод Уинзора – сим- |
|
|
|
|
метричная замена |
|
Искажение выборочных |
|
2 |
нескольких крайних |
Простота |
||
характеристик |
||||
|
элементов ряда |
|
||
|
|
|
||
|
ближайшими соседними |
|
|
|
|
|
|
|
|
|
Специальные статистические критерии обнаружения выбросов |
|||
|
|
|
|
|
|
|
Теоретическая |
Снижение мощности в |
|
|
|
сравнении с критериями |
||
|
|
обоснованность |
||
|
|
выбросов, предназна- |
||
|
|
критерия |
||
|
|
ченными для конкрет- |
||
|
|
|
||
|
Критерий Дарлинга – |
|
ных распределений |
|
|
критерий выбросов для |
|
|
|
3 |
Заключение осно- |
|
||
любого непрерывного |
вывается на про- |
|
||
|
|
|||
|
распределения |
верке статистиче- |
Необходима параметри- |
|
|
|
ских гипотез |
зация распределения |
|
|
|
|
совокупности |
|
|
|
Уточнение выбороч- |
||
|
|
ных характеристик |
|
|
|
|
|
|
|
|
Критерий Граббса – кри- |
То же |
Область применения |
|
4 |
терий выбросов в случае |
ограничивается |
||
нормального распреде- |
(см. п. 3) |
установленным законом |
||
|
||||
|
ления |
|
распределения |
|
|
|
|
|
|
32
Существует несколько различных способов устранения (уменьшения) неоднородности выборочных данных. Среди них имеют место как теоретически обоснованные методы выявления выбросов, так и эмпирические способы избавления от нетипичных наблюдений.
Наиболее общие результаты проведенного нами сравнительного анализа возможных способов достижения однородности выборочных данных о цене квартир представлены в табл. 1. Использование любого из описанных в табл. 1 методов обязательно предполагает, что вариационный ряд является упорядоченным, следовательно, аномальными могут быть крайние наблюдения ( x1 и / или xn ).
Наиболее простой из анализируемых способов освобождения от аномальных наблюдений – отбрасывание нескольких крайних элементов слева и справа в вариационном ряду. Расположение выбросов на концах означает то, что они будут автоматически отброшены. При этом выборочные характеристики, естественно, исказятся, но выборка, вероятно, станет более однородной.
Для уменьшения этого искажения Уинзор (Winsor) предложил преобразовать выборку: вместо симметричного отбрасывания крайних элементов заменить их ближайшими соседними. Преобразованная выборка носит название уинсоризованной и имеет вид:
x(k +1),…, x(k +1), x(k +1), …, x(n – k -1), x(n – k), …, x(n – k), |
(4) |
|
(k + 1) |
(k + 1) |
|
где k – число отброшенных элементов; предполагается, что k ≤ n значительно меньше).
Применению специальных статистических критериев обнаружения выбросов предшествует процедура установления закона распределения для выборочных совокупностей. Установление закона распределения является актуальной задачей, поскольку ее решение позволит применить соответствующие критерии проверки совокупностей на наличие выбросов и достичь однородности.
33
Проверяемая гипотеза Н0 заключается в том, что все изучаемые совокупности распределены согласно нормальному закону. Проверка гипотезы о нормальном законе распределения производится по одному из основных критериев согласия – критерию согласия Пирсона c2 (хи-квадрат), для чего следует рассчитать значения критерия согласия Пирсона ( c 2расч ) при числе степеней свободы (n (df ) ) и уровне значи-
мости (a расч ) и определить его критические значения ( cкр2 ) [0].
Вчисле методов робастного оценивания относительно простым
инадежным является метод, основанный на применении критерия, предложенного Ф. Граббсом (F.Grubbs).
Статистики критерия Граббса, используемые при проверке на
выброс наибольшего ( xn ) и наименьшего ( x1 ) значений, соответственно, имеют вид:
|
|
|
Gn |
= |
|
xn - x |
, |
|
(5) |
|||
|
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
S |
|
|
|
|
|
|
|
|
G1 |
= |
x - x1 |
, |
|
(6) |
||||
|
|
|
|
|
||||||||
|
|
|
|
|
|
|
S |
|
|
|
|
|
|
|
n |
|
|
|
|
|
|
|
|
|
|
где |
x = |
å xi |
, |
|
|
|
|
|
|
|
|
(7) |
i=1 |
|
|
|
|
|
|
|
|
||||
n |
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
n |
- x)2 |
|
|
||||
|
|
|
|
|
å(x |
|
|
|||||
|
|
|
S 2 = |
|
|
i |
|
|
|
, |
(8) |
|
|
|
|
i=1 |
|
|
|
||||||
|
|
|
|
|
|
|
||||||
|
|
|
|
|
|
|
n -1 |
|
|
|||
|
|
|
|
S = |
S 2 . |
|
(9) |
|||||
Максимальное или минимальное наблюдение считается выбросом, если значение соответствующей статистики превысит критическое: Gn ³ Gn,1-a или G1 ³ G1,1-a , где α – задаваемый уровень значимости.
Проверка на наличие нетипичных максимальных ценовых показателей в ряде случаев требует, как правило, нескольких итераций. Она имеет последовательный характер, т.е. максимальное значение проверяется до тех пор, пока оно не окажется «не выбросом».
34
4. МЕТОДЫ ИССЛЕДОВАНИЯ СВЯЗЕЙ МЕЖДУ ФАКТОРАМИ
4.1. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ
Корреляционный анализ позволяет выявить наличие статистической связи между случайными величинами. Наличие этой связи характеризуется коэффициентом корреляции или корреляционным отношением. Этот коэффициент позволяет оценить, как изменение одной случайной величины влияет на изменение другой. Он не показывает количественное изменение этих величин в зависимости от изменения одной из них, но показывает направление изменения. Например, уменьшение одной влечет за собой уменьшение или увеличение другой.
Изменение случайной величины y, соответствующее изменению случайной величины х, оценивается двумя составляющими – стохастической и статистической. Стохастическая указывает на неслучайный характер зависимости у от х. А статистическая связана со случайным характером поведения самих у и х.
Корреляционный анализ выполняется в следующей последовательности:
1.Постановка задачи и выбор признаков.
2.Сбор информации и ее первичная обработка:
– группировка,
– исключение выпадающих значений,
– проверка соответствия нормальному закону распределения слу-
чайной величины.
3.Предварительная характеристика взаимосвязей (построение графика).
4.Устранение мультиколлинеарности (взаимозависимости факторов).
5.Уточнение набора показателей путем расчета парных коэффициентов корреляции.
6.Исследование факторной зависимости и проверка ее значимости.
7.Оценка результатов анализа.
8.Подготовка рекомендации для практического использования.
35
Коэффициент корреляции – показатель степени взаимозависимости, статистической связи двух переменных, изменяется в пределах от -1 до +1. Значение коэффициента, равное 0, указывает на возможное отсутствие зависимости, значение +1 свидетельствует о согласованности переменных.
Линейная связь между переменными Xi и X j оценивается коэффи-
циентом корреляции:
p = M × (X i - mX i ) × (X j - mX j ) , |
|
(10) |
|||||||||
|
|
|
|
|
|
s xi ×s xj |
|
|
|
|
|
где Xi и X j – исследуемые переменные; |
mXi и |
mX j |
– математические |
||||||||
ожидания переменных; sxi и s xj |
– дисперсии переменных. |
||||||||||
Выборочный коэффициент корреляции определяют по формуле |
|||||||||||
1 |
|
|
N |
|
|
|
|
|
|
||
× å(xiu - xi ) × (x ju - x j ) |
|
|
|||||||||
rXiXj = |
N |
|
(11) |
||||||||
|
|
u=1 |
|
|
|
|
|
||||
|
|
|
|
|
SXi × SXj |
|
|
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
или по преобразованной формуле |
|
|
|
|
|
||||||
|
|
|
|
1 |
|
N |
|
|
|
|
|
|
|
|
|
× å xiu × x ju - xi × x j |
|
|
|||||
|
|
|
|
|
|
|
|||||
rXiXj = |
N |
u=1 |
|
, |
|
(12) |
|||||
|
SXi × S Xj |
|
|
||||||||
где i = 1, 2, ..., n , j = 1, 2, ..., |
|
|
|
|
|
||||||
m , u = 1, 2, ..., |
N ; |
N – число опытов |
|||||||||
(объем выборки); xi , x j – оценки математических ожиданий; SXi , SXJ – оценки среднеквадратических отклонений.
Только при совместной нормальной распределенности исследуемых случайных величин Xi и X j коэффициент корреляции имеет определенный смысл связи между переменными. В противном случае коэффициент корреляции может только косвенно характеризовать эту связь.
В качестве оценки генерального коэффициента корреляции р используется коэффициент корреляции r Браве – Пирсона. Для его определения принимается предположение о двумерном нормальном распределении генеральной совокупности, из которой получены экспериментальные данные. Это предположение может быть прове-
36
рено с помощью соответствующих критериев значимости. Следует отметить, что если по отдельности одномерные эмпирические распределения значений xi и yi согласуются с нормальным распределением, то из этого еще не следует, что двумерное распределение будет нормальным. Для такого заключения необходимо еще проверить предположение о линейности связи между случайными величинами X и Y. Строго говоря, для вычисления коэффициента корреляции достаточно только принять предположение о линейности связи между случайными величинами, и вычисленный коэффициент корреляции будет мерой этой линейной связи. Коэффициент корреляции Бра-
ве – Пирсона ( rxyP ) относится к параметрическим коэффициентам и для практических расчетов вычисляется по формуле
p |
= |
å |
(xi - x) × ( yi |
- y) |
. |
(13) |
rxy |
å(xi - x)2 × å( yi - y)2 |
|||||
|
|
|
|
|||
Из формулы видно, что для вычисления rxyp необходимо найти |
||||||
средние значения признаков |
X и Y, |
а также отклонения каждого |
||||
статистического данного от его среднего(xi - x), ( yi - y) . Зная эти значения, находим суммы å(xi - x)×(yi - y) , å (xi - x)2 × å ( yi - y)2 . Затем,
вычислив значение rxyp , необходимо определить достоверность найденного коэффициента корреляции, сравнив его фактическое значение с табличным для f = n - 2 . Если rô ³ rst , то можно говорить о том, что между признаками наблюдается достоверная взаимосвязь. Если rô < rst , то между признаками наблюдается недостоверная корреляционная взаимосвязь [2].
Основные свойства коэффициентов корреляции
К основным свойствам коэффициента корреляции необходимо отнести следующие:
37
–коэффициенты корреляции способны характеризовать только линейные связи, т.е. такие, которые выражаются уравнением линейной функции. При наличии нелинейной зависимости между варьирующими признаками следует использовать другие показатели связи;
–значения коэффициентов корреляции – это отвлеченные числа, лежащие в пределах от –1 до +1, т.е. –1 <r < 1;
–при независимом варьировании признаков, когда связь между
ними отсутствует, r = 0;
–при положительной, или прямой, связи, когда с увеличением значений одного признака возрастают значения другого, коэффициент корреляции приобретает положительный знак и находится в пределах от 0 до +1, т.е. 0 < r < 1;
–при отрицательной, или обратной, связи, когда с увеличением значений одного признака соответственно уменьшаются значения другого, коэффициент корреляции сопровождается отрицательным знаком и находится в пределах от 0 до –1, т.е. -1 < r < 0;
–чем сильнее связь между признаками, тем ближе величина коэффициента корреляции к 1. Если r = ±1, то корреляционная связь переходит в функциональную, т.е. каждому значению признака X будет соответствовать одно или несколько строго определенных значений признака Y;
–только по величине коэффициентов корреляции нельзя судить
одостоверности корреляционной связи между признаками. Этот параметр зависит от числа степеней свободы f = n –2, где n – число коррелируемых пар показателей X и Y. Чем больше n, тем выше достоверность связи при одном и том же значении коэффициента корреляции. [2].
Проверка значимости коэффициентов корреляции
Для проверки значимости коэффициентов корреляции чаще всего используют распределение Стьюдента и условие:
38
|
rxixj |
|
N - 2 |
< tt , |
f |
= N - 2, a = 0, 05. |
(14) |
|
|
|
|
|
|||||
1 |
- r2 |
|||||||
|
|
|
||||||
|
|
|
xixj |
|
|
|
|
|
Если условие выполняется, то гипотеза об отсутствии корреляционной связи принимается.
|
|
|
|
|
Таблица 2 |
Критические значения коэффициента парной корреляции при a =0,05 |
|||||
|
|
|
|
|
|
Число |
Критическое |
Число |
Критическое |
Число |
Критическое |
степеней |
значение r |
степеней |
значение r |
степеней |
значение r |
свободы f |
|
свободы f |
|
свободы f |
|
1 |
0,997 |
9 |
0,602 |
17 |
0,456 |
2 |
0,950 |
10 |
0,576 |
18 |
0,444 |
3 |
0,878 |
11 |
0,553 |
19 |
0,433 |
4 |
0,811 |
12 |
0,532 |
20 |
0,423 |
5 |
0,754 |
13 |
0,514 |
30 |
0,349 |
6 |
0,707 |
14 |
0,497 |
50 |
0,273 |
7 |
0,666 |
15 |
0,482 |
80 |
0,217 |
8 |
0,632 |
16 |
0,468 |
100 |
0,195 |
|
|
|
|
|
|
Для проверки значимости коэффициента парной корреляции нужно сравнить его значение с табличным (критическим) значением r , которое приведено в табл. 2. Для пользования этой таблицей нужно знать число степеней свободы f = N - 2 и выбрать определенный уровень значимости, например, равный 0,05. Такое значение уровня значимости называют еще 5 %-ным уровнем риска, что соответствует
вероятности |
верного ответа при проверке нашей гипотезы |
P = 1-a = 0,95 |
, или 95 %. Это значит, что в среднем только в 5 % слу- |
чаев возможна ошибка при проверке гипотезы.
В практических исследованиях 5 %-ный уровень риска применяется наиболее часто. Но экспериментатор всегда свободен в выборе уровня значимости, и возможны ситуации, в которых, например, требуется 1 %-ный уровень риска. При этом возрастает надежность ответа. Проверка гипотезы сводится к сравнению абсолютной величины коэффициента парной корреляции с критическим значением. Если экспериментально найденное значение r меньше критического, то нет
39
оснований считать, что имеется тесная линейная связь между параметрами, а если больше или равно, то гипотеза о корреляционной линейной связи не отвергается [6].
4.2. РЕГРЕССИОННЫЙ АНАЛИЗ
Если корреляционный анализ оценивает силу связи между случайными величинами, то регрессионный анализ позволяет оценить форму этой связи.
Регрессионный анализ выполняется в следующей последовательности.
Составляется полный факторный эксперимент.
1. Определяется центр плана (основной уровень) и уровень варьирования факторов.
Находим центр плана:
Dmko = mk max + mk min .
2
Находим полуразмах:
Dmk = mk max - mko = mko - mk min .
Рассчитываем нижний уровень варьирования факторов:
x = mk min - mko .
i Dmk
Рассчитываем верхний уровень варьирования факторов:
x= mk max - mko .
iDmk
(15)
(16)
(17)
(18)
2. Строится матрица планирования.
Определяем необходимое количество опытов для построения матрицы планирования для двух уровней варьирования факторов 2n, где n – количество факторов.
Матрица планирования типа для трехфакторного эксперимента будет иметь вид:
Таблица 3
Матрица планирования для трехфакторного эксперимента
№ опыта |
X1 |
X 2 |
X3 |
1 |
+ |
+ |
– |
2 |
+ |
+ |
+ |
3 |
+ |
- |
+ |
4 |
+ |
- |
– |
40
