Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Методы обработки гидрологической информации. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

n

~

2

n

2

 

Sk =

 

(18.2)

(yi yi )

 

= [yi (a xi +b)] .

i=1

 

 

i=1

 

 

Для того чтобы сумма была минимальной, необходимо, чтобы частные производные выражения (18.2) по параметрам а и b равнялись нулю:

Sk

 

n

2

 

 

Sk

 

n

2

 

 

a

=

 

(yi a xi b)

 

= 0 ;

b

=

 

(yi a xi b)

 

= 0 . (18.3)

 

 

 

a i=1

 

 

 

 

b i=1

 

 

 

Продифференцировав выражения (18.3), приходим к двум уравнениям, содержащим параметры а и b (к так называемым нормальным уравнениям):

n

n

n

n

n

 

bxi + axi2

= xi yi ; b n + axi = yi .

(18.4)

i=1

i=1

i=1

i=1

i=1

 

Решая уравнения (18.4) относительно параметров а и b, получим

n [(xi x) (yi y)]

a =

i=1

 

 

 

, b =

 

a

 

.

(18.5)

 

 

 

y

x

n

(xi

 

)2

 

x

 

 

 

 

 

 

i=1

Коэффициент а, который характеризует тангенс угла наклона искомой прямой, принято называть коэффициентом регрессии зависимости ~y( x ) . Из вы-

ражения (18.5) следует, что коэффициент регрессии можно представить в виде

 

a =

r

σ

y / σ

x .

(18.6)

С учетом равенств (18.1) и (18.6) уравнение линейной регрессии у по x

можно представить в виде:

 

yi

 

= (xi

 

)

r

σ

y / σ

x .

(18.7)

y

x

Уравнение линейной регрессиих по у получается аналогично и имеет вид:

xi

 

= (yi

 

)

r

σ

x / σ

y .

(18.8)

x

y

Уравнения (18.7) и ( 18.8) не эквивалентны. Если по оси абсцисс откладывать значения X, а по оси ординат – значения Y, то уравнению (18.7) будет соответствовать минимальное отклонение точек от линии регрессии по вертикали (см. рис. 18.1), а уравнению (18.8) – по горизонтали.

Рис. 18.1

19. Оценка точности уравнения линейной регрессии для двух переменных

Полученное на основе эмпирических данных уравнение линейной регрессии может использоваться в качестве прогностической зависимости или расчет-

50

ной формулы, однако это является корректным только в случае, если данное уравнение обеспечивает необходимую точность расчета, или, проще говоря, является надежным.

Ранее отмечалось, что в качестве меры линейной зависимости между двумя переменными используется коэффициент парной корреляции. В соответствии с действующими в гидрологии нормативными документами [24] зависимость может использоваться для практических расчетов, если r > 0,7 |.

Смысл этого неравенства будет понятен, если рассмотреть величину r 2 , которую называют коэффициентом детерминации. Коэффициент детермина-

ции характеризует долю общего разброса относительно среднего значения y ,

объясняемую регрессией. Если зависимость функциональная и точки относительно линии регрессии лежат без разброса, то весь разброс относительно у

объясняется регрессией, т.е. r 2 = 1. При r = 0,7 коэффициент детерминации

r 2 = 0,49 ≈ 0,5. Таким образом, в гидрологии зависимость может использоваться для практических расчетов, если регрессия объясняет 50% или более разброса относительно y . Коэффициент корреляции – важный, но не единственный

показатель надежности уравнения регрессии. Рассмотрим еще ряд статистических характеристик, позволяющих судить о точности полученного уравнения.

Cтандартная ошибка уравнения линейной регрессии. Эта величина харак-

теризует СКО точек от принятой линии регрессии:

 

 

 

n

~

2

 

 

 

σ y(x) =

/(n θ)

 

(yi yi )

 

(19.1)

где yi – наблюденная величина;

~

 

i=1

 

 

,

– величина, рассчитанная по уравнению рег-

yi

рессии (в зависимости от хi). Параметр (n θ) называют числом степеней свободы. Число степеней свободы равно количеству наблюдений минус число параметров, определяемых по эмпирическим данным. В этом случае таких параметров два: коэффициент регрессии а и свободный член b.

Используя коэффициент корреляции, выражение (19.1) можно представить в виде

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

(1

r

2 ) (n 1)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

σ y(x) =σ y

 

 

 

n 2

 

 

σ y 1r

 

.

(19.2)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Cтандартная ошибка коэффициента парной корреляции

 

 

 

 

 

σ

r = (1

r

2 )/

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 1

 

 

 

 

 

 

 

 

 

 

(19.3)

При малой длине выборки (n < 25) рекомендуется в формулу (19.3) вво-

дить поправку

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σ

r =

1

r

 

 

1+

11

r

2

+

75

r

2 13

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2n

 

 

 

2n2 .

 

 

 

 

 

n 1

 

 

 

 

 

(19.4)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

51

Рассмотренная система оценок позволяет, как правило, составить правильное представление о надежности полученного уравнения регрессии и принять решение о возможности его применения для практических расчетов. Но иногда такого анализа оказывается недостаточно. Проиллюстрируем это с помощью рис. 19.1.

Cтандартная ошибка коэффициента регрессии

 

 

 

 

 

 

 

σ y(x)

σ

y

 

1

r

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σa =

 

 

 

 

 

 

 

 

 

 

=

 

 

 

 

 

 

 

n 2 .

 

 

 

 

 

 

 

 

 

 

 

 

 

(19.5)

n (xi

 

)2

 

σ

x

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

i=1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Стандартная ошибка свободного члена

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

(xi )2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

r

 

 

 

 

 

 

x

 

 

 

 

 

 

 

 

i=1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σb =σ y(x)

 

 

 

n

=σ y

 

 

 

 

 

 

 

 

 

 

 

 

1

+

 

 

 

 

 

 

.

(19.6)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n(xi

x

)2

 

 

 

 

 

 

 

 

 

 

n 2

 

 

 

 

 

σx

 

 

 

 

 

 

 

 

i=1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Сформулируем теперь полный набор требований, предъявляемых в гид-

рологии к уравнению линейной регрессии:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 10;

 

 

r

 

 

0,7;

 

 

r

 

 

/σ

r 2;

 

 

a

 

/σa 2.

 

 

 

 

 

 

 

 

(19.7)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Условия (19.7) использованы и в действующих нормативных документах

[24].

При использовании уравнения линейной регрессии (18.7) следует учитывать, что истинное значение yi, соответствующее аргументу xi, будет отличаться

от~ , полученного по (18.7), на некоторую величину ε. При этом предполагает-

yi i

ся, что εi является нормально распределенной случайной величиной с нулевым средним значением и СКО σy(x).

Рис. 19.1

На рис. 19.1 эмпирические точки расположены неравномерно. Точки основной группы образуют поле рассеяния в диапазоне значений x от 3 до 15, а две точки расположены в области больших значений x. Первая имеет координаты (25; 35), вторая (35; 17). Значение коэффициента корреляции, полученное для точек основной группы значительно меньше 0,7 (r = 0,45). Но если к основ-

ной группе точек добавить точку №1, коэффициент корреляции резко возрастет ( r = 0,82 ); линия регрессии – а. Использование всех данных, включая и точку

№2, вновь приводит к значительному изменению коэффициента корреляции ( r = 0,66). Заметно изменится и положение линии регрессии – b.

Таким образом, здесь мы сталкиваемся с ситуацией, когда добавление одной или двух точек может существенно повлиять на параметры уравнения ре-

52

грессии. Если в данном случае ориентироваться только на систему ограничений (19.7), можно принять ошибочное решение. Во втором варианте, когда из совокупности данных исключена точка №2, все условия (19.7) выполняются.

Основная причина возникших здесь трудностей состоит в том, что выборочные точки группируются крайне неравномерно. В подобных ситуациях следует провести расчет параметров уравнения регрессии с учетом и без учета «тяжелой» точки, и если они существенно различаются, уравнение не следует использовать в качестве расчетного, по крайней мере до тех пор, пока не появятся дополнительные данные. При этом надо понимать, что дополнительные данные могут как подтвердить, так и опровергнуть гипотезу о наличии высокой корреляции между X и Y, но в любом случае решение будет более обоснованным.

Ситуации, подобные той, которую мы рассмотрели, не так уж редки в гидрологической практике. Можно назвать, по крайней мере, две причины, по которым эмпирические точки могут группироваться очень неравномерно.

1. МНК подразумевает, что ряды X и Y являются выборками из нормальных совокупностей, что обеспечивает примерно равное количество больших и малых значений, а выборочная асимметрия гидрологических величин (особенно при небольших n) может быть весьма значительной.

2. Гидрологи, как правило, работают в условиях так называемого пассивного эксперимента и не могут по своему усмотрению изменять независимую переменную. В результате всегда есть риск получить нерепрезентативные выборки, особенно если длина выборки n недостаточно велика.

20. Уравнения линейной регрессии при нескольких аргументах

При изучении многих гидрологических процессов требуется установить вид линейной зависимости между несколькими переменными. Для решения этой задачи привлекается аппарат множественной линейной корреляции. Сущность этого подхода состоит в распространении основных положений метода линейной корреляции двух переменных на случай зависимости интересующей нас переменной Y от произвольного числа аргументов. Основой для поиска такой зависимости служат материалы наблюдений за величиной Y и определяющими ее величинами (X1, X2, X3, ..., XN). Опираясь на данные указанных наблюдений, требуется найти параметры уравнения множественной линейной регрессии, которое согласно МНК будет наилучшим образом описывать связь между зависимой переменной и предикторами. Уравнение линейной регрессии в этом

случае будет иметь вид:

(x1 x1 )+a2

(x2 x2 )+...+aN (xN xN ),

 

y y = a1

(20.1)

где a1,a2 ,...,aN – коэффициенты регрессии; x1, x2 ,..., xN – средние значения ар-

гументов.

Для выполнения поставленной задачи нужно решить систему нормальных уравнений относительно коэффициентов a1, a2 ,..., aN . Обычно эта задача

решается на компьютере с использованием численных методов линейной алгебры. При небольшом числе предикторов можно получить аналитическое реше-

53

ние задачи методом Крамера. Коэффициенты регрессии определяются выражением

a j = (1) j +1

σ

y

 

M0, j

,

(20.2)

σ

x, j

M0,0

 

 

 

 

где M – миноры главного определителя матрицы парной корреляции. Рассмотрим частный случай, когда число переменных равно трем (зави-

симая переменная – 0 и два аргумента – 1; 2). В этом случае:

 

 

 

 

 

 

1

 

 

r

0,1

 

 

r

0,2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

r1,2

 

 

 

 

 

 

)2

 

 

 

 

 

 

 

 

 

∆ =

 

r

 

 

1

 

 

r

 

 

 

; M

 

 

=

=1(

r

;

 

 

 

 

 

 

 

 

 

 

 

 

 

1,0

 

 

 

 

 

1,2

 

 

 

 

 

0,0

 

 

 

 

 

 

 

 

 

 

 

1,2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

r2,1

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

r2,0

r2,1

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

r1,0

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

M

 

 

 

r1,0

 

 

 

r1,2

 

 

r

 

 

r

 

 

r

 

; M

 

 

 

 

 

1

 

=

r

 

 

 

r

 

 

r

.

 

=

 

 

 

 

 

=

 

 

 

 

0,2

 

=

 

 

 

 

 

 

 

 

0,1

 

 

 

 

 

 

 

 

 

1,0

 

 

 

2,0

 

 

1,2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1,0

2,1

2,0

 

 

r2,0

1

 

 

 

 

 

 

 

 

 

 

 

 

r2,0

r2,1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Подставляя последние выражения в формулу (20.2), получаем:

a

=

 

σ

y

 

r1,0

r

2,0

r1,2

; a

2

= −

σ

y

 

r1,0

r

2,1

r

2,0

.

(20.3)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

σ

x,1

 

1(

r1,2 )2

 

 

σ

x,2

 

1(

r1,2 )2

 

В настоящее время разработано большое количество компьютерных программ, обеспечивающих быстрый и достаточно точный расчет параметров множественной регрессии. Такая программа, в частности, входит в «пакет анализа» электронных таблиц Microsoft Excel. В лабораторном практикуме показано, как получить уравнение множественной регрессии в среде Mathcad.

Остановимся на оценке точности уравнения множественной линейной регрессии. Также как и в случае парной линейной корреляции, теснота связи при множественной линейной корреляции оценивается коэффициентом корреляции, который называют общим, или сводным, коэффициентом корреляции:

 

 

=

1− ∆/ M0,0

.

(20.4)

R

В отличие от парного коэффициента корреляции, который может изменяться от –1 до +1, коэффициент множественной корреляции всегда положителен и имеет пределы изменения от 0 до +1.

Стандартная ошибка коэффициента множественной корреляции:

 

 

 

1

 

2

 

 

 

σ

R =

 

R

,

(20.5)

 

 

 

 

 

 

 

 

 

 

 

 

n

N 1

 

 

 

 

 

где n – длина анализируемых рядов; N – число независимых переменных. Оценка стандартной ошибки уравнения множественной линейной рег-

рессии:

 

 

 

 

 

 

.

 

σ

Y ( X ) σ

y 1

 

2

(20.6)

R

54

Оценка стандартной ошибки j-го коэффициента регрессии:

 

 

σ

 

 

 

(1

 

2 ) M

 

 

 

 

σa =

 

y

 

R

j, j

,

(20.7)

 

 

 

 

 

 

 

 

 

 

σ

x, j

(n N 1) M0,0

 

где Mj,j – минор определителя M0,0.

В соответствии с действующими нормативными документами уравнение множественной линейной регрессии должно удовлетворять требованиям, аналогичным (19.7). При этом третье условие считается выполненным, если оно справедливо для каждого коэффициента регрессии в отдельности. Что касается четвертого условия, то оно в данном случае является слишком слабым. Практика показывает, что при использовании одного аргумента длина рядов n должна быть не менее 10, двух – минимальная длина рядов должна составлять 25–30, четырех 50–60 и т. д. Только в этом случае можно получить более или менее надежные оценки параметров уравнения регрессии. Поскольку продолжительность гидрологических рядов относительно невелика, в практике гидрологических расчетов редко используются регрессионные модели, содержащие более четырех аргументов.

В расчетах по уравнению множественной регрессии необходимо использовать только те аргументы, которые дают объем информации, превышающий ошибку расчета. Неэффективные аргументы необходимо исключить. В противном случае привлечение дополнительных данных может привести не к уменьшению ошибки, а к ее увеличению.

Назовем несколько причин такой неэффективности:

1. Связь между зависимой переменной и аргументом отсутствует или выражена очень слабо.

2. Связь между зависимой переменной и аргументом существует, но в силу небольшой продолжительности рядов привлечение дополнительного аргумента приводит к тому, что коэффициенты регрессии становятся незначимыми.

3. Наличие дублирующих аргументов. Эта ситуация возникает, когда несколько аргументов имеют высокий коэффициент взаимной корреляции. Определитель M0,0 близок к нулю, и система нормальных уравнений будет либо неопределенной, либо иметь неустойчивое решение.

Однако даже если неэффективные аргументы отсеяны, может оказаться, что из имеющегося набора аргументов можно получить несколько уравнений, удовлетворяющих набору требований (19.7). В этом случае необходимо выб - рать «наилучшее» уравнение регрессии. Для решения этой задачи разработано несколько методов. Кратко остановимся на двух из них.

Метод всех возможных регрессий. При использовании этого метода рассчитываются все возможные уравнения регрессии, после чего исключаются те, которые не удовлетворяют системе ограничений (19.7). Из оставшихся уравнений наилучшим будет то, которое имеет самый высокий сводный коэффициент корреляции.

Метод исключения. Метод исключения более экономичен, чем метод всех регрессий, поскольку в нем делается попытка использовать только наилуч-

55

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]