Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Современные информационные технологии. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
yx
yx
)]y)(x[(M
y
0 x
Рис. 5.12. Некоррелированные,
независимые переменные
y y
Сезонный тренд
0 x 0 x
Рис. 5.13. Некоррелированные, зависимые
случайные величины
Чем сильнее влияние прочих факторов, тем дальше точки отстоят от ли-
нии регрессии. В случае 2 влияние прочих факторов меньше и зависимость между y и x является более тесной. Если y(x) = const,
т. е. линия регрессии горизонтальная прямая, про­ходящая через центр распределения (рис. 5.12), то переменная Y не коррелирована с X.
Некоррелированность не следует смешивать с
независимостью. Некоррелированность означает, что среднее значение y не меняется при изменении x. Случайные величины X и Y независимы, если
P(X < x, Y < y) = P(X < x)P(Y < y) (рис. 5.12).
Независимые случайные вели­чины всегда некоррелированны. Об­ратное, в общем случае, неверно: пе­ременная Y может зависеть от X, но так, что центры условных распределе­ний не меняются, а изменяются услов­ные дисперсии (рис. 5.13, диаграмма слева). Еще один пример зависимости Y от X, представленный на рис. 5.13, так называемый "сезонный тренд".
5.9. Практическое задание: построение диаграмм рассеяния
в специализированном пакете
Построить диаграммы рассеяния для пар “выходная–входная перемен­ная”. Сделать вывод о возможных зависимостях между переменными.
В пакете Statgraphics Plus диаграммы рассеяния строятся в разделе De- scribe/ Numeric Data/ Multiple Variable Analysis с помощью графической проце­дуры Scatterplot Matrix.
5.10. Коэффициент корреляции
Рассмотрим важный для практики случай, когда ищется линейная связь между X и Y: y(x) = b0 + b1 x.
Мерой силы линейной связи признаков X и Y является коэффициент кор-
реляции
=
Для независимых случайных величин коэффициент корреляции равен ну­лю. Однако равенство (X,Y) = 0 не означает в общем случае независимости X
и Y, т. е. является необходимым, но недостаточным условием для независимо- сти признаков.
.
71
r
n
1i
n
1i
2
i
2
i
n
1i
ii
)yy()xx(
)yy)(xx(
'
0
b
'
1
b
r
y
0 x
Рис. 5.14. Параболическая связь
y
0 x
Рис. 5.15. Связь с периодической
составляющей
Величина  не зависит от единиц измерения (одинакова, например, при переходе от метров к сантиметрам) и является безразмерной величиной.
При вычислении выборочного (эмпирического) коэффициента корреля-
ции r теоретические величины заменяются их оценками:
=
.
Свойства коэффициента корреляции
1. Модуль r не меняется от прибавления к X и Y постоянных слагаемых
и от умножения X и Y на положительные числа, т.е. при линейных преобразова­ниях случайных переменных: r(b0+b1 x;
+
y)=rxy. Таким образом, коэффи-
циент корреляции не зависит от выбора начала отсчета и единиц измерения.
2. Если одну из случайных величин умножить на 1, то коэффициент
корреляции поменяет знак.
3. Коэффициент корреляции принимает значения в интервале 1
1.
Коэффициент корреляции может быть равен 1 или 1 только если X и Y линейно зависят друг от друга, т. е. если существует функциональная связь y =
= b0 + b1 x. Величина r, близкая к 1, указывает, что зависимость случайных величин почти линейная. Значения r, близкие к 0, означают, что связь между
случайными величинами либо слаба, либо не носит линейного характера, например, является параболической (рис. 5.14). Таким образом, коэффициент корреляции ха­рактеризует степень приближения зависимости между случайными величинами к линейной функциональной зависимости.
Если распределение величин X и Y близко к нормальному, то корреляция между ними яв­ляется линейной и выборочный коэффициент корреляции r является надежной оценкой тео­ретического коэффициента .
Если r > 0, то связь между переменными положительная (прямая), вели­чины X и Y с точностью до случайных погрешностей одновременно возрастают или убывают. При r < 0 связь отрицательная (обратная, с возрастанием одной величины другая имеет тенденцию к убыванию.
Коэффициент корреляции часто использу­ется при связях, отличающихся от линейных.
Если r = 0.80.9, то независимо от вида связи можно утверждать, что она достаточно тесна для
того, чтобы исследовать ее форму (рис. 5.15).
72
5.11. Практическое задание: вычисление матрицы парных коэффициентов
корреляции
Выполнить анализ полных парных связей – проанализировать коэффици­енты корреляции для всех возможных пар переменных, содержащих y, на ста­тистически значимое отличие от нуля.
В пакете Statgraphics Plus для расчета парных корреляций целесообразно дополнительно создать новые переменные типа x1x1, x1x2, x2x2 и пр.
Для задания имени новой переменной нужно последовательно выделить заголовок пустого столбца и в контекстном меню (после щелчка правой клави­шей мыши) выбрать Modify Column, после чего в поле Name ввести одно из ука­занных имен. Создание столбца со значениями новой переменной, которые вы­числяются через выражение для ранее созданных переменных, выполняются с помощью команды Generate Data из контекстного меню. Задать выражения ви­да x1^2, x1*x2, x2^2. Файл с обновленными исходными данными следует сохра­нить.
Матрица парных коэффициентов корреляции вычисляется после откры­тия файла с результатами замеров в разделе Describe/ Numeric Data/ Multiple Variable Analysis с помощью табличной процедуры Correlations. Вводятся ана- лизируемые векторы данных y, x1, x2, x1x1, x1x2, x2x2, соответствующие иссле­дуемым переменным.
Значения выборочных коэффициентов приведены для различных пар пе­ременных в первых строках таблицы Sample Correlations; далее в скобках – число наблюдений n, в третьей строке – вычисленный уровень значимости пар­ного коэффициента корреляции. Для сочетаний y и xj, y и xj1xj2, j = 1, 2, 3, вы- численные уровни, меньшие 0.05, означают возможную значимость соответ­ствующих связей – парные коэффициенты значимо отличаются от нуля с 95%-м уровнем доверия.
По результатам таблицы Sample Correlations установить, с какими вход­ными переменными параметр y имеет наиболее тесные связи, сделать выводы о характере каждой связи (прямая, обратная или ложная).
Например: наибольшую зависимость на параметр y оказывает входная переменная x1, так как вычисленный уровень значимости соответствующего парного коэффициента корреляции
= 0.0048 < 0.05, а его значение r
выч
y-x1
=
= -0.6 имеет наибольшую абсолютную величину. Связь отрицательная. Также существенное влияние оказывает сочетание входных переменных x1x2 – коэф­фициент корреляции r
y-x1x2
= 0.45,
= 0.038 < 0.05, связь положительная.
выч
73
6. ЗАДАЧИ КЛАССИФИКАЦИИ И РЕГРЕССИИ
Классификационная и регрессионная модели устанавливают закономер­ности между входными и выходными переменными. Если входные и выходные переменные модели непрерывные – перед нами задача регрессии. Если выход­ная переменная одна и является дискретной (метка класса), то речь идет о зада­че классификации.
Примеры задач классификации и регрессии
В банковском деле классификация применяется для решения задач ско-
ринга, определения кредитного рейтинга клиентов с целью минимизировать риски при выдаче кредитов, выявить мошенничество с кредитными картами.
В розничной торговле классификация может использоваться для выделе­ния покупателей с определенными предпочтениями, что позволит более полно удовлетворять спрос и гибко реагировать на его изменения, прогнозировать со­стояние рынков.
В военной технике с помощью классификации можно распознавать цель по параметрам отраженного.
В биомедицине с помощью классификации и регрессии можно диагности­ровать заболевания на основе наблюдаемых симптомов (температура, давление, состав крови и т. д.), оценивать ожидаемые результаты лечения.
В системах безопасности классификация используется для распознава­ния людей на основе биометрических показателей: отпечатков пальцев, формы лица, распределения цвета на радужной оболочке глаза и т. д. – в целях органи­зации их доступа в закрытые зоны.
Регрессия может использоваться при решении тех же задач, но в несколь­ко другой трактовке. Например, при определении кредитного рейтинга все кли­енты банка могут быть распределены по трем классам: высокому, среднему и низкому. В качестве выходной переменной можно выбрать оценку вероятности возврата кредита. Высокая вероятность возврата (0,8 – 1) соответствует высо­кому кредитному рейтингу, низкая вероятность (0,1 – 0,3) – низкому кредитно­му рейтингу, промежуточные значения (0,3 – 0,7) – среднему кредитному рей­тингу. При обеих постановках задачи сохраняется главная цель – минимизация рисков при кредитовании.
В ряде зарубежных источников подобные задачи называют предсказани- ем (prediction): при классификации для новых объектов предсказываются их классы, а при регрессии – значения отдельных параметров.
6.1. Простая линейная регрессия
На рис. 6.1 представлена диаграмма рассеяния исходных данных, показы­вающая наличие обратной зависимости между ценой и объемами продаж: с увеличением цены продажи падают. С практической точки зрения интерес представляет количественное описание этой зависимости, какого падения спро­са следует ожидать при увеличении цены за единицу.
74
y
Если предположить, что зависимость между переменными линейная, то для построения модели достаточно провести прямую линию, проходящую че­рез «облако» точек.
Линия регрессии выбирается таким образом, чтобы сумма квадратов рас­стояний от точек (хi, yi) до этой прямой, измеренных вертикально (то есть вдоль оси у), была минимальна.
Рис. 6.1. Зависимость объема продаж от установленной цены
Используя метод наименьших квадратов (МНК), можно вычислить оцен­ки коэффициентов регрессии. Соответствующее уравнение будет иметь вид
= 3213,6 – 145,4 x.
Одно из ограничений регрессии: линию регрессии следует считать подхо­дящей аппроксимацией некоторой реальной функции только в том диапазоне изменений входной переменной х, в котором распределены исходные наблюде­ния. В противном случае результаты могут оказаться непредсказуемыми. Так, при цене картофеля, равной нулю, оценка объемов продаж составит 3213,6 кг, данная формальная интерпретация противоречит здравому смыслу.
Значение коэффициента наклона линии регрессии b1 можно интерпрети­ровать как среднюю величину изменения значения выходной переменной при изменении значения входной переменной на единицу. При увеличении цены за один килограмм картофеля на одну денежную единицу можно ожидать умень­шения спроса в среднем на 145,4 кг.
Оценка соответствия линейной регрессии реальным данным выполняет­ся с помощью традиционных показателей: стандартной ошибки оценивания (равна корню квадратному среднеквадратической суммы квадратов остатков), коэффициента детерминации, коэффициента корреляции, а также t-критерия и
F-критерия.
75
n
1i
2
i
)yy(
м од
Q
)x(f
ост
Q
n
1i
2
i
)yy(
n
1i
2
i
)y)x(f(
n
1i
2
ii
))x(fy(
м од
Q
ост
Q
)x(f
...xbxbb
2
210
F
n
1i
2
ii
n
1i
2
i
))x(fy(
ln
1
)y)x(f(
1l
1
ост
м од
Q
Q
1l
ln
2
ост
2
м од
S
S
)ln,1l(
:H
0
0...bb
21
F
F
)ln,1l(
...,b,b
21
)x(fy
1
x
Источник
Сумм. кв.
Ст. св.
Средний кв.
F-отн.
выч
Модель
51675.236
1
51675.236
3307.10
.00000
Ошибка
906.28053
58
15.62553
Общее
52581.516
59
Для проверки адекватности модели и расчета коэффициента детерминации используется основное положение дисперсионного анализа о разбиении суммы квад-
ратов на слагаемые. Общая сумма квадратов отклонений отклика Q =
относительно его среднего значения y разлагается на сумму щую влияние факторов X, т. е. обусловленную регрессионной моделью остаточную сумму квадратов
, характеризующую влияние неучтенных факто-
, характеризую-
и
ров, т.е. обусловленную случайными ошибками относительно модели регрессии. Формальный вид разложения для однофакторной модели:
=
+
=
+
.
Очевидно, чем меньше влияние неучтенных факторов, тем лучше модель соответствует экспериментальным данным, так как вариация отклика Y в ос­новном объясняется влиянием фактора X.
Для проверки гипотезы об адекватности предлагаемой модели
=
используется F-отношение.
=
с числом степеней свободы
=
=
, где l число коэффициентов модели
(число связей).
Таким образом, критерий Фишера вычисляется как частное от деления дисперсии, обусловленной моделью регрессии, на остаточную дисперсию. По величине F-отношения проверяется гипотеза
. Когда коэф-
фициенты отличны от нуля, Fотношение имеет тенденцию к возрастанию. При F>
онная зависимость
, где критическое значение
, значения коэффициентов
значима.
имеет число степеней свободы
отличаются от нуля и регресси-
Пример. В табл. 6.1 приведены результаты анализа в пакете Statgraphics линейной модели зависимости поверхностной плотности трикотажа y от сум­марной длины нитей в петлях
.
Т а б л и ц а 6.1. Дисперсионный анализ однофакторной линейной модели
Коэффициент корреляции = -0.991345 R-квадрат = 98.28 % Станд. откл. = 3.95291
76
м од
Q
ост
Q
2
м од
S
2
ост
S
:H
0
0b1
1
b
)x(f
1
1
x
2n
Q
S
ост
ост
2
R
2
R
Q
Q
м од
n
1i
2
i
n
1i
2
i
)yy(
)y)x(f(
2
R
2
R
2
R
2
R
2
r
n
1i
2
i
n
1i
2
10
)yy(
)yxbb(
В табл. 6.1 показано разбиение общей суммы квадратов Q на сумму квадратов
раты приведены оценки дисперсий
и остаточную сумму квадратов
и
. В столбце средние квад-
, равные отношениям соответ-
ствующей суммы квадратов и числа степеней свободы. Нулевое значение вы­численного уровня значимости F-отношения говорит о том, что гипотеза
должна быть отвергнута, т. е.
= 672.34  39.75
является значимой.
олично от нуля и линейная модель
Под таблицей дисперсионного анализа приведены значения коэффициен­та корреляции r, коэффициента детерминации и стандартного отклонения
.
Коэффициент детерминации
является еще одним показателем каче-
ства подобранной модели, характеризующим ее информативность,
=
=
,
который обычно выражается в процентах (см. R-квадрат в табл. 6.1). Коэффи­циент
обусловленную регрессией, в общей сумме квадратов откликов. Чем ближе
показывает долю разброса отклика относительно средней точки y,
к 100 %, тем лучше подобранная модель описывает зависимость отклика от фактора, тем выше ее информативность.
Для одномерной линейной модели
есть квадрат выборочного коэффи-
циента корреляции Пирсона r:
=
=
.
6.2. Множественная линейная регрессия
Множественная линейная регрессия для моделирования линейных связей между выходной переменной и набором входных использует плоскость (если входных переменных две) или гиперплоскость (если входных переменных бо­лее чем две). Обычно входные переменные являются непрерывными, но в неко­торых задачах могут содержаться и номинальные входные переменные. В этом случае вводят так называемые фиктивные переменные.
Диаграммы рассеяния для входных и выходной переменных показывают, какие признаки способствуют повышению значений Y, а какие – уменьшению.
Интерпретация коэффициентов b1 и b2, определяющих положение плос- кости множественной регрессии, выполняется следующим образом. Например, если b1 = –2,2, то оцененное уменьшение значений Y на единицу увеличения X1
77
0b
0
S
b
1b
1
S
b
*
0
b
*
1
b
*
0
b
*
1
b
составляет 2,2 при фиксированном значении второй входной переменной, то есть X2. Аналогично коэффициент b2 = 3,8 говорит о том, что прирост Y на единицу
увеличения X2 составляет 3,8 при фиксированном значении X1.
Для множественной линейной регрессии с m входными переменными ко­эффициенты регрессии следует интерпретировать по следующему правилу: оценка изменения выходной переменной Y на единицу изменения входной пере­менной Xi составляет bi, при фиксированном значении остальных переменных.
Остаток для множественной регрессии представляются в виде расстояния между наблюдаемым значением Y и гиперплоскостью регрессии.
Множественный коэффициент детерминации R2 определяет относитель­ную долю изменчивости, объясненную регрессией, в полной изменчивости вы­ходной переменной. Всякий раз, когда в модель добавляется новая входная пе­ременная, коэффициент детерминации увеличивается. При этом если новая пе­ременная является полезной, то есть существенно увеличивает долю изменчи­вости, объясненную регрессией, то коэффициент детерминации увеличивается значительно, в противном случае увеличение может быть едва заметным.
Среднеквадратическая же ошибка уменьшается, если переменная полез­на, то есть способствует повышению точности оценки, в противном случае ошибка может увеличиться. Это делает ошибку более привлекательным показа­телем целесообразности добавления в модель новой переменной, чем коэффи­циент детерминации.
6.3. Поиск модели регрессии в специализированном пакете
Процедуры построения модели простой регрессии находятся в разделе Relate/ Simple Regression. В полях ввода данных задаются имена зависимой и независимой переменных y и входной переменной, например, x.
В таблице Regression Analysis - Linear model: Y = a + b*X приводятся оценки свободного члена (Intercept) b0 и коэффициента наклона (Slope) b1, а также их стандартные ошибки (Standard Error) Sb0 и Sb1, отношения Стьюдента
(T Statistic)
и
для проверки гипотезы H0 :
=
= 0 (где
,
– ко-
эффициенты истинной регрессии) и их вычисленные уровни значимости (P­Value). Малые значения P-Value (менее 0,01) говорят о том, что коэффициенты
линейной регрессии являются значимыми (значимо отличаются от нуля с 99%- м уровнем доверия).
6.3.1. Доверительные области линии истинной регрессии и прогнозов
наблюдений отклика
Оценка точности регрессионной модели с помощью построения довери­тельной области линии истинной регрессии (рис. 6.2) осуществляется графиче­ской процедурой Plot of fitted Model (построение графика подобранной модели). Красными (сплошными) линиями показаны 95%-е доверительные границы для
78
)xbby(
i10i
)x(y
средних значений y при наблюдаемых значениях входной переменной x. Более удаленные пунктирные линии – 95%-е границы прогнозов для новых значений x.
Рис. 6.2. Доверительные области для линейной регрессии
переменной y по фактору x
6.3.2. Глазомерная оценка адекватности регрессионной модели
Глазомерный анализ осуществляется в целях обнаружения в поведении остатков
какой-либо зависимости от x. Для построения графика
остатков (рис. 6.3) используется процедура Residuals versus X.
Рис. 6.3. График остатков для линейной регрессии
переменной y по фактору x
Если остатки разбросаны в горизонтальной полосе, симметричной отно­сительно оси абсцисс, то одномерную линейную модель можно рассматривать как адекватную. Если зависимость имеется, то приближенная регрессия
не полностью представляет закономерную часть отклика. Видимый линейный тренд означает необходимость введения в модель дополнительного фактора, параболическая зависимость – необходимость добавления квадратичного члена для погашения соответствующей закономерности в поведении остатков.
Для линейной зависимости переменной y от признака x1 график остатков (рис. 6.3) показывает наличие лишь случайной составляющей, что позволяет выдвинуть предположение об адекватности простой линейной модели регрес-
79
0
b
xb
1
0
b
11
xb
22
xb
n
1i
2
i
)y)(f( x
)X,...,X(
p1
сии. Поскольку нормализованные значения остатков лежат в диапазоне (–3, 3), можно сделать вывод об отсутствии выбросов. Незначительный случайный разброс наблюдений отклика (observed) относительно регрессионной модели можно также наблюдать на графике, построенном в зависимости от предска­занных значений (процедура Observed versus X, рис. 6.4).
Рис. 6.4. Разброс наблюдений отклика относительно
регрессионной модели y по x
6.3.3. Множественная регрессия
Адекватность простой линейной регрессии означает, что никакая другая модель не даст значимого улучшения в предсказании Y.
В противном случае осуществляется уточнение модели регрессии y =
+
вводом нелинейного члена или учетом дополнительных факторов, например, в уравнении двухфакторной линейной регрессии y =
+
+
.
Коэффициенты множественной модели регрессии вычисляются по мето­ду наименьших квадратов в разделе Relate/ Multiple Regression.
Окно ввода данных содержит поле Dependent variable для ввода зависи­мой переменной y и поле Independent variables. для ввода нескольких независи­мых переменных, например, x, x^2, ..., или x1, x1*x2, x1^2 и т. п.
Проверка адекватности и информативности множественной модели осу­ществляется по результатам второй таблицы Analysis of Variance (дисперсион­ный анализа), подобной таблице для однофакторного анализа. В ней показано разбиение общей суммы квадратов Q = Q
, характеризующая влияние группы факторов X=
мод
+ Q
, где Q
ост
– сумма квадратов
мод
.
Значение вычисленного уровня значимости (P-Value) F-отношения, меньшее 0.5, говорит о том, что подобранная модель является адекватной.
Под таблицей приводятся значение R², свидетельствующее о степени ин­формативности многофакторной модели регрессии, и статистика Дарбина­Уотсона d.
Значение d 2 указывает на отсутствие автокорреляции остатков и пол­ноту учета факторов. Если в поведении остатков есть значительная положи­тельная автокорреляция, то d 0, при значительной отрицательной автокорре-
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]