Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Современные информационные технологии. Учебное пособие
.pdf
yx
yx
)]y)(x[(M
y
0 x
Рис. 5.12. Некоррелированные,
независимые переменные
y y
Сезонный тренд
0 x 0 x
Рис. 5.13. Некоррелированные, зависимые
случайные величины
Чем сильнее влияние прочих факторов, тем дальше точки отстоят от ли-
нии регрессии. В случае 2 влияние прочих факторов меньше и зависимость
между y и x является более тесной. Если y(x) = const,
т. е. линия регрессии горизонтальная прямая, проходящая через центр распределения (рис. 5.12), то
переменная Y не коррелирована с X.
Некоррелированность не следует смешивать с
независимостью. Некоррелированность означает, что
среднее значение y не меняется при изменении x.
Случайные величины X и Y независимы, если
P(X < x, Y < y) = P(X < x)P(Y < y) (рис. 5.12).
Независимые случайные величины всегда некоррелированны. Обратное, в общем случае, неверно: переменная Y может зависеть от X, но
так, что центры условных распределений не меняются, а изменяются условные дисперсии (рис. 5.13, диаграмма
слева). Еще один пример зависимости
Y от X, представленный на рис. 5.13,
так называемый "сезонный тренд".
5.9. Практическое задание: построение диаграмм рассеяния
в специализированном пакете
Построить диаграммы рассеяния для пар “выходная–входная переменная”. Сделать вывод о возможных зависимостях между переменными.
В пакете Statgraphics Plus диаграммы рассеяния строятся в разделе De-
scribe/ Numeric Data/ Multiple Variable Analysis с помощью графической процедуры Scatterplot Matrix.
5.10. Коэффициент корреляции
Рассмотрим важный для практики случай, когда ищется линейная связь
между X и Y: y(x) = b0 + b1 x.
Мерой силы линейной связи признаков X и Y является коэффициент кор-
реляции
=
Для независимых случайных величин коэффициент корреляции равен нулю. Однако равенство (X,Y) = 0 не означает в общем случае независимости X
и Y, т. е. является необходимым, но недостаточным условием для независимо-
сти признаков.
.
71

r
n
1i
n
1i
2
i
2
i
n
1i
ii
)yy()xx(
)yy)(xx(
'
0
b
'
1
b
r
y
0 x
Рис. 5.14. Параболическая связь
y
0 x
Рис. 5.15. Связь с периодической
составляющей
Величина не зависит от единиц измерения (одинакова, например, при
переходе от метров к сантиметрам) и является безразмерной величиной.
При вычислении выборочного (эмпирического) коэффициента корреля-
ции r теоретические величины заменяются их оценками:
=
.
Свойства коэффициента корреляции
1. Модуль r не меняется от прибавления к X и Y постоянных слагаемых
и от умножения X и Y на положительные числа, т.е. при линейных преобразованиях случайных переменных: r(b0+b1 x;
+
y)=rxy. Таким образом, коэффи-
циент корреляции не зависит от выбора начала отсчета и единиц измерения.
2. Если одну из случайных величин умножить на 1, то коэффициент
корреляции поменяет знак.
3. Коэффициент корреляции принимает значения в интервале 1
1.
Коэффициент корреляции может быть равен 1 или 1 только если X и Y
линейно зависят друг от друга, т. е. если существует функциональная связь y =
= b0 + b1 x. Величина r, близкая к 1, указывает, что зависимость случайных
величин почти линейная. Значения r, близкие к 0, означают, что связь между
случайными величинами либо слаба, либо не носит линейного характера,
например, является параболической (рис. 5.14).
Таким образом, коэффициент корреляции характеризует степень приближения зависимости
между случайными величинами к линейной
функциональной зависимости.
Если распределение величин X и Y близко
к нормальному, то корреляция между ними является линейной и выборочный коэффициент
корреляции r является надежной оценкой теоретического коэффициента .
Если r > 0, то связь между переменными положительная (прямая), величины X и Y с точностью до случайных погрешностей одновременно возрастают
или убывают. При r < 0 связь отрицательная
(обратная, с возрастанием одной величины
другая имеет тенденцию к убыванию.
Коэффициент корреляции часто используется при связях, отличающихся от линейных.
Если r = 0.80.9, то независимо от вида связи
можно утверждать, что она достаточно тесна для
того, чтобы исследовать ее форму (рис. 5.15).
72

5.11. Практическое задание: вычисление матрицы парных коэффициентов
корреляции
Выполнить анализ полных парных связей – проанализировать коэффициенты корреляции для всех возможных пар переменных, содержащих y, на статистически значимое отличие от нуля.
В пакете Statgraphics Plus для расчета парных корреляций целесообразно
дополнительно создать новые переменные типа x1x1, x1x2, x2x2 и пр.
Для задания имени новой переменной нужно последовательно выделить
заголовок пустого столбца и в контекстном меню (после щелчка правой клавишей мыши) выбрать Modify Column, после чего в поле Name ввести одно из указанных имен. Создание столбца со значениями новой переменной, которые вычисляются через выражение для ранее созданных переменных, выполняются с
помощью команды Generate Data из контекстного меню. Задать выражения вида x1^2, x1*x2, x2^2. Файл с обновленными исходными данными следует сохранить.
Матрица парных коэффициентов корреляции вычисляется после открытия файла с результатами замеров в разделе Describe/ Numeric Data/ Multiple
Variable Analysis с помощью табличной процедуры Correlations. Вводятся ана-
лизируемые векторы данных y, x1, x2, x1x1, x1x2, x2x2, соответствующие исследуемым переменным.
Значения выборочных коэффициентов приведены для различных пар переменных в первых строках таблицы Sample Correlations; далее в скобках –
число наблюдений n, в третьей строке – вычисленный уровень значимости парного коэффициента корреляции. Для сочетаний y и xj, y и xj1xj2, j = 1, 2, 3, вы-
численные уровни, меньшие 0.05, означают возможную значимость соответствующих связей – парные коэффициенты значимо отличаются от нуля с 95%-м
уровнем доверия.
По результатам таблицы Sample Correlations установить, с какими входными переменными параметр y имеет наиболее тесные связи, сделать выводы о
характере каждой связи (прямая, обратная или ложная).
Например: наибольшую зависимость на параметр y оказывает входная
переменная x1, так как вычисленный уровень значимости соответствующего
парного коэффициента корреляции
= 0.0048 < 0.05, а его значение r
выч
y-x1
=
= -0.6 имеет наибольшую абсолютную величину. Связь отрицательная. Также
существенное влияние оказывает сочетание входных переменных x1x2 – коэффициент корреляции r
y-x1x2
= 0.45,
= 0.038 < 0.05, связь положительная.
выч
73

6. ЗАДАЧИ КЛАССИФИКАЦИИ И РЕГРЕССИИ
Классификационная и регрессионная модели устанавливают закономерности между входными и выходными переменными. Если входные и выходные
переменные модели непрерывные – перед нами задача регрессии. Если выходная переменная одна и является дискретной (метка класса), то речь идет о задаче классификации.
Примеры задач классификации и регрессии
В банковском деле классификация применяется для решения задач ско-
ринга, определения кредитного рейтинга клиентов с целью минимизировать
риски при выдаче кредитов, выявить мошенничество с кредитными картами.
В розничной торговле классификация может использоваться для выделения покупателей с определенными предпочтениями, что позволит более полно
удовлетворять спрос и гибко реагировать на его изменения, прогнозировать состояние рынков.
В военной технике с помощью классификации можно распознавать цель
по параметрам отраженного.
В биомедицине с помощью классификации и регрессии можно диагностировать заболевания на основе наблюдаемых симптомов (температура, давление,
состав крови и т. д.), оценивать ожидаемые результаты лечения.
В системах безопасности классификация используется для распознавания людей на основе биометрических показателей: отпечатков пальцев, формы
лица, распределения цвета на радужной оболочке глаза и т. д. – в целях организации их доступа в закрытые зоны.
Регрессия может использоваться при решении тех же задач, но в несколько другой трактовке. Например, при определении кредитного рейтинга все клиенты банка могут быть распределены по трем классам: высокому, среднему и
низкому. В качестве выходной переменной можно выбрать оценку вероятности
возврата кредита. Высокая вероятность возврата (0,8 – 1) соответствует высокому кредитному рейтингу, низкая вероятность (0,1 – 0,3) – низкому кредитному рейтингу, промежуточные значения (0,3 – 0,7) – среднему кредитному рейтингу. При обеих постановках задачи сохраняется главная цель – минимизация
рисков при кредитовании.
В ряде зарубежных источников подобные задачи называют предсказани-
ем (prediction): при классификации для новых объектов предсказываются их
классы, а при регрессии – значения отдельных параметров.
6.1. Простая линейная регрессия
На рис. 6.1 представлена диаграмма рассеяния исходных данных, показывающая наличие обратной зависимости между ценой и объемами продаж: с
увеличением цены продажи падают. С практической точки зрения интерес
представляет количественное описание этой зависимости, какого падения спроса следует ожидать при увеличении цены за единицу.
74

y
Если предположить, что зависимость между переменными линейная, то
для построения модели достаточно провести прямую линию, проходящую через «облако» точек.
Линия регрессии выбирается таким образом, чтобы сумма квадратов расстояний от точек (хi, yi) до этой прямой, измеренных вертикально (то есть
вдоль оси у), была минимальна.
Рис. 6.1. Зависимость объема продаж от установленной цены
Используя метод наименьших квадратов (МНК), можно вычислить оценки коэффициентов регрессии. Соответствующее уравнение будет иметь вид
= 3213,6 – 145,4 x.
Одно из ограничений регрессии: линию регрессии следует считать подходящей аппроксимацией некоторой реальной функции только в том диапазоне
изменений входной переменной х, в котором распределены исходные наблюдения. В противном случае результаты могут оказаться непредсказуемыми. Так,
при цене картофеля, равной нулю, оценка объемов продаж составит 3213,6 кг,
данная формальная интерпретация противоречит здравому смыслу.
Значение коэффициента наклона линии регрессии b1 можно интерпретировать как среднюю величину изменения значения выходной переменной при
изменении значения входной переменной на единицу. При увеличении цены за
один килограмм картофеля на одну денежную единицу можно ожидать уменьшения спроса в среднем на 145,4 кг.
Оценка соответствия линейной регрессии реальным данным выполняется с помощью традиционных показателей: стандартной ошибки оценивания
(равна корню квадратному среднеквадратической суммы квадратов остатков),
коэффициента детерминации, коэффициента корреляции, а также t-критерия и
F-критерия.
75

n
1i
2
i
)yy(
м од
Q
)x(f
ост
Q
n
1i
2
i
)yy(
n
1i
2
i
)y)x(f(
n
1i
2
ii
))x(fy(
м од
Q
ост
Q
)x(f
...xbxbb
2
210
F
n
1i
2
ii
n
1i
2
i
))x(fy(
ln
1
)y)x(f(
1l
1
ост
м од
Q
Q
1l
ln
2
ост
2
м од
S
S
)ln,1l(
:H
0
0...bb
21
F
F
)ln,1l(
...,b,b
21
)x(fy
1
x
Источник
Сумм. кв.
Ст. св.
Средний кв.
F-отн.
выч
Модель
51675.236
1
51675.236
3307.10
.00000
Ошибка
906.28053
58
15.62553
Общее
52581.516
59
Для проверки адекватности модели и расчета коэффициента детерминации
используется основное положение дисперсионного анализа о разбиении суммы квад-
ратов на слагаемые. Общая сумма квадратов отклонений отклика Q =
относительно его среднего значения y разлагается на сумму
щую влияние факторов X, т. е. обусловленную регрессионной моделью
остаточную сумму квадратов
, характеризующую влияние неучтенных факто-
, характеризую-
и
ров, т.е. обусловленную случайными ошибками относительно модели регрессии.
Формальный вид разложения для однофакторной модели:
=
+
=
+
.
Очевидно, чем меньше влияние неучтенных факторов, тем лучше модель
соответствует экспериментальным данным, так как вариация отклика Y в основном объясняется влиянием фактора X.
Для проверки гипотезы об адекватности предлагаемой модели
=
используется F-отношение.
=
с числом степеней свободы
=
=
, где l число коэффициентов модели
(число связей).
Таким образом, критерий Фишера вычисляется как частное от деления
дисперсии, обусловленной моделью регрессии, на остаточную дисперсию. По
величине F-отношения проверяется гипотеза
. Когда коэф-
фициенты отличны от нуля, Fотношение имеет тенденцию к возрастанию.
При F>
онная зависимость
, где критическое значение
, значения коэффициентов
значима.
имеет число степеней свободы
отличаются от нуля и регресси-
Пример. В табл. 6.1 приведены результаты анализа в пакете Statgraphics
линейной модели зависимости поверхностной плотности трикотажа y от суммарной длины нитей в петлях
.
Т а б л и ц а 6.1. Дисперсионный анализ однофакторной линейной модели
Коэффициент корреляции = -0.991345 R-квадрат = 98.28 %
Станд. откл. = 3.95291
76

м од
Q
ост
Q
2
м од
S
2
ост
S
:H
0
0b1
1
b
)x(f
1
1
x
2n
Q
S
ост
ост
2
R
2
R
Q
Q
м од
n
1i
2
i
n
1i
2
i
)yy(
)y)x(f(
2
R
2
R
2
R
2
R
2
r
n
1i
2
i
n
1i
2
10
)yy(
)yxbb(
В табл. 6.1 показано разбиение общей суммы квадратов Q на сумму
квадратов
раты приведены оценки дисперсий
и остаточную сумму квадратов
и
. В столбце средние квад-
, равные отношениям соответ-
ствующей суммы квадратов и числа степеней свободы. Нулевое значение вычисленного уровня значимости F-отношения говорит о том, что гипотеза
должна быть отвергнута, т. е.
= 672.34 39.75
является значимой.
олично от нуля и линейная модель
Под таблицей дисперсионного анализа приведены значения коэффициента корреляции r, коэффициента детерминации и стандартного отклонения
.
Коэффициент детерминации
является еще одним показателем каче-
ства подобранной модели, характеризующим ее информативность,
=
=
,
который обычно выражается в процентах (см. R-квадрат в табл. 6.1). Коэффициент
обусловленную регрессией, в общей сумме квадратов откликов. Чем ближе
показывает долю разброса отклика относительно средней точки y,
к 100 %, тем лучше подобранная модель описывает зависимость отклика от
фактора, тем выше ее информативность.
Для одномерной линейной модели
есть квадрат выборочного коэффи-
циента корреляции Пирсона r:
=
=
.
6.2. Множественная линейная регрессия
Множественная линейная регрессия для моделирования линейных связей
между выходной переменной и набором входных использует плоскость (если
входных переменных две) или гиперплоскость (если входных переменных более чем две). Обычно входные переменные являются непрерывными, но в некоторых задачах могут содержаться и номинальные входные переменные. В этом
случае вводят так называемые фиктивные переменные.
Диаграммы рассеяния для входных и выходной переменных показывают,
какие признаки способствуют повышению значений Y, а какие – уменьшению.
Интерпретация коэффициентов b1 и b2, определяющих положение плос-
кости множественной регрессии, выполняется следующим образом. Например,
если b1 = –2,2, то оцененное уменьшение значений Y на единицу увеличения X1
77

0b
0
S
b
1b
1
S
b
*
0
b
*
1
b
*
0
b
*
1
b
составляет 2,2 при фиксированном значении второй входной переменной, то есть
X2. Аналогично коэффициент b2 = 3,8 говорит о том, что прирост Y на единицу
увеличения X2 составляет 3,8 при фиксированном значении X1.
Для множественной линейной регрессии с m входными переменными коэффициенты регрессии следует интерпретировать по следующему правилу:
оценка изменения выходной переменной Y на единицу изменения входной переменной Xi составляет bi, при фиксированном значении остальных переменных.
Остаток для множественной регрессии представляются в виде расстояния
между наблюдаемым значением Y и гиперплоскостью регрессии.
Множественный коэффициент детерминации R2 определяет относительную долю изменчивости, объясненную регрессией, в полной изменчивости выходной переменной. Всякий раз, когда в модель добавляется новая входная переменная, коэффициент детерминации увеличивается. При этом если новая переменная является полезной, то есть существенно увеличивает долю изменчивости, объясненную регрессией, то коэффициент детерминации увеличивается
значительно, в противном случае увеличение может быть едва заметным.
Среднеквадратическая же ошибка уменьшается, если переменная полезна, то есть способствует повышению точности оценки, в противном случае
ошибка может увеличиться. Это делает ошибку более привлекательным показателем целесообразности добавления в модель новой переменной, чем коэффициент детерминации.
6.3. Поиск модели регрессии в специализированном пакете
Процедуры построения модели простой регрессии находятся в разделе
Relate/ Simple Regression. В полях ввода данных задаются имена зависимой и
независимой переменных y и входной переменной, например, x.
В таблице Regression Analysis - Linear model: Y = a + b*X приводятся
оценки свободного члена (Intercept) b0 и коэффициента наклона (Slope) b1, а
также их стандартные ошибки (Standard Error) Sb0 и Sb1, отношения Стьюдента
(T Statistic)
и
для проверки гипотезы H0 :
=
= 0 (где
,
– ко-
эффициенты истинной регрессии) и их вычисленные уровни значимости (PValue). Малые значения P-Value (менее 0,01) говорят о том, что коэффициенты
линейной регрессии являются значимыми (значимо отличаются от нуля с 99%-
м уровнем доверия).
6.3.1. Доверительные области линии истинной регрессии и прогнозов
наблюдений отклика
Оценка точности регрессионной модели с помощью построения доверительной области линии истинной регрессии (рис. 6.2) осуществляется графической процедурой Plot of fitted Model (построение графика подобранной модели).
Красными (сплошными) линиями показаны 95%-е доверительные границы для
78

)xbby(
i10i
)x(y
средних значений y при наблюдаемых значениях входной переменной x. Более
удаленные пунктирные линии – 95%-е границы прогнозов для новых значений x.
Рис. 6.2. Доверительные области для линейной регрессии
переменной y по фактору x
6.3.2. Глазомерная оценка адекватности регрессионной модели
Глазомерный анализ осуществляется в целях обнаружения в поведении
остатков
какой-либо зависимости от x. Для построения графика
остатков (рис. 6.3) используется процедура Residuals versus X.
Рис. 6.3. График остатков для линейной регрессии
переменной y по фактору x
Если остатки разбросаны в горизонтальной полосе, симметричной относительно оси абсцисс, то одномерную линейную модель можно рассматривать
как адекватную. Если зависимость имеется, то приближенная регрессия
не полностью представляет закономерную часть отклика. Видимый линейный
тренд означает необходимость введения в модель дополнительного фактора,
параболическая зависимость – необходимость добавления квадратичного члена
для погашения соответствующей закономерности в поведении остатков.
Для линейной зависимости переменной y от признака x1 график остатков
(рис. 6.3) показывает наличие лишь случайной составляющей, что позволяет
выдвинуть предположение об адекватности простой линейной модели регрес-
79

0
b
xb
1
0
b
11
xb
22
xb
n
1i
2
i
)y)(f( x
)X,...,X(
p1
сии. Поскольку нормализованные значения остатков лежат в диапазоне (–3, 3),
можно сделать вывод об отсутствии выбросов. Незначительный случайный
разброс наблюдений отклика (observed) относительно регрессионной модели
можно также наблюдать на графике, построенном в зависимости от предсказанных значений (процедура Observed versus X, рис. 6.4).
Рис. 6.4. Разброс наблюдений отклика относительно
регрессионной модели y по x
6.3.3. Множественная регрессия
Адекватность простой линейной регрессии означает, что никакая другая
модель не даст значимого улучшения в предсказании Y.
В противном случае осуществляется уточнение модели регрессии y =
+
вводом нелинейного члена или учетом дополнительных факторов, например, в
уравнении двухфакторной линейной регрессии y =
+
+
.
Коэффициенты множественной модели регрессии вычисляются по методу наименьших квадратов в разделе Relate/ Multiple Regression.
Окно ввода данных содержит поле Dependent variable для ввода зависимой переменной y и поле Independent variables. для ввода нескольких независимых переменных, например, x, x^2, ..., или x1, x1*x2, x1^2 и т. п.
Проверка адекватности и информативности множественной модели осуществляется по результатам второй таблицы Analysis of Variance (дисперсионный анализа), подобной таблице для однофакторного анализа. В ней показано
разбиение общей суммы квадратов Q = Q
, характеризующая влияние группы факторов X=
мод
+ Q
, где Q
ост
– сумма квадратов
мод
.
Значение вычисленного уровня значимости (P-Value) F-отношения,
меньшее 0.5, говорит о том, что подобранная модель является адекватной.
Под таблицей приводятся значение R², свидетельствующее о степени информативности многофакторной модели регрессии, и статистика ДарбинаУотсона d.
Значение d 2 указывает на отсутствие автокорреляции остатков и полноту учета факторов. Если в поведении остатков есть значительная положительная автокорреляция, то d 0, при значительной отрицательной автокорре-
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
