Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Методы обработки гидрологической информации. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

СВ, полученных в результате тридцати природных опытов. Можно считать, что этот ряд представляет собой выборку объемом n = 30 из генеральной совокупности.

Если предположить, что эта выборка является репрезентативной, то по ней (на основе методов математической статистики) можно составить удовлетворительное представление обо всей генеральной совокупности, оценить параметры функции распределения. Однако определить вид функции распределения по такой короткой выборке весьма сложно. Поэтому на практике либо аналитическое выражение функции распределения задается априори, либо функция распределения выбирается из нескольких вариантов по наилучшему соответствию эмпирическим данным с использованием критериев согласия.

Опыт показывает, что большинство гидрологических величин имеет асимметричное распределение, которое хорошо аппроксимируется трехпараметрическими кривыми Крицкого – Менкеля и Пирсона III типа. В то же время многие теоретические методы, используемые в практике гидрологических расчетов, предполагают, что случайная величина имеет нормальное распределение. Если распределение случайной величины существенно отличается от нормального, то эти методы могут приводить к значительным ошибкам.

Таким образом, недостаточно констатировать, что для описания статистической структуры ряда выбрана модель случайной величины, необходимо еще указать тип функции распределения. При этом формальный подход к выбору функции распределения также может привести к ошибкам.

Например, расходы воды – это всегда положительные величины, абсолютный максимум для которых обычно не известен; коэффициент стока изменяется от нуля до единицы; уровни воды (в зависимости от нуля графика) могут быть как положительными, так и отрицательными. Если во всех этих случаях использовать в качестве функции распределения кривую Крицкого-Менкеля, то наилучшего соответствия эмпирическим данным следует ожидать для ряда расходов воды, так как кривая Крицкого-Менкеля разработана для случайных величин с положительной асимметрией и диапазоном значений от 0 до +∞. В двух других случаях ошибки при аппроксимации закона распределения могут быть весьма значительными.

17. Корреляционный анализ гидрологических и климатических рядов

Взаимная связь двух случайных величин X и Y называется корреляцией, корреляционный анализ позволяет определить наличие такой связи, оценить, насколько тесна и существенна эта связь.

Коэффициент парной корреляции Пирсона rxy является количественной мерой близости стохастической связи между СВ X и Y к линейной функциональной зависимости:

r = r =

 

Kxy

 

, K

xy

= M [(X m

) (Y m

)].

(17.1)

σ

 

σ

 

xy

x

y

x

y

 

 

 

 

 

 

 

 

 

 

46

Величина коэффициента парной корреляции лежит в диапазоне 1 rxy ≤ +1. Если r > 0, наблюдается положительная корреляция: увеличению

X, как правило, соответствует увеличение Y. Если r < 0, наблюдается отрицательная корреляция: увеличению X, как правило, соответствует уменьшение Y.

Чем меньше модуль r отличается от единицы, тем ближе связь междуX и Y к линейной функциональной зависимости. При rxy = ±1 имеет место линейная

функциональная зависимость между X и Y. При rxy = 0 СВ X и Y не коррелиро-

ванны (как правило, независимы).

Cтуденты задают вопрос: какие значения коэффициента корреляции указывают на сильную зависимость, а какие на слабую? Этот вопрос не имеет строгого ответа. В разных дисциплинах сложились разные традиции интерпретации коэффициента r (см., например, табл. 17.1).

Таблица 17.1

Интерпретация значений модуля коэффициента парной корреляции

Интервал значений модуля r

Интерпретация

0 – 0,19

Очень слабая корреляция

0,2 – 0,49

Слабая корреляция

0,5 – 0,69

Средняя корреляция

0,7 – 0,89

Высокая корреляция

0,9 – 0,99

Очень высокая корреляция

Пусть (x1, х2,..., xn) и (y1, y2,..., yn) – выборки длиной n из двух рядов. Точечная оценка коэффициента корреляции рассчитывается по формуле

n (xi x) (yi y)

i=1

 

r

=

 

xy =

 

 

 

 

 

 

.

(17.2)

 

r

 

 

 

 

 

 

 

 

 

 

 

 

 

n (xi x)2

n (yi y)2

 

 

 

 

 

 

 

i=1

i=1

 

 

Рассмотрим построение доверительного интервала для выборочного

коэффициента корреляции.

Если выполнены условия

r

0,4; n 40 , то

распределение СВ r хорошо аппроксимируется нормальным законом с СКО

σ

r = (1

r

2 )/

 

.

 

n 1

(17.3)

В указанном случае доверительный интервал для коэффициента корреляции генеральной совокупности можно представить в виде

r

t1α σ

r r <

r

+t1α σ

r ,

(17.4)

где t1–α – квантиль стандартного нормального распределения, соответствующий двустороннему уровню значимости 2α.

47

Если хотя бы одно из условий (r 0,4; n 40 ) нарушено, рекомендуется

для построения доверительного интервала использовать z-преобразование Фишера со стандартной ошибкой среднего SE:

z = 0,5

 

1+

r

 

, SE =

 

1

 

.

(17.5)

ln

1

r

 

 

 

 

 

 

 

n 3

 

 

 

 

 

 

 

При уровне значимости 2α границы доверительного интервала z:

zd = z t1α SE , zu = z +t1α SE .

(17.6)

Для 2α = 5 % из (17.6) получаем интервал

 

 

 

 

 

 

1

 

 

 

 

1

 

 

CI z = z 1,96

 

 

 

; z +1,96

 

 

 

 

 

 

 

 

 

 

 

n 3

n 3

 

 

 

 

.

Для построения доверительного интервала коэффициента корреляции сделаем обратное преобразование, получим:

 

e2zd

1

e2zu

1

 

CIr =

 

+1;

 

 

 

e2zd

e2zu

+1

.

Выборочный коэффициент корреляции используют для проверки значимости линейной зависимости между X и Y. Выдвигается нулевая гипотеза Ho: r = 0. Гипотеза опровергается и связь считается статистически значимой, если

 

r

 

/σ

r > t1α .

(17.7)

 

 

Если условие (17.7) не выполнено, связь считается статистически незначимой, т.е. линейная связь между СВ X и Y отсутствует.

Заметим, что при уровне значимости 2α = 5 % получаем t1α =t97,5 =1,96 2 . Это значение используется в качестве критического в нормативном документе [24].

18. Уравнение линейной регресии. Метод наименьших квадратов

При изучении гидрологических и климатических явлений часто встречаются ситуации, когда СВ Y зависит от других величин X1, X2, X3,..., XN и по эмпирическим данным требуется найти аналитическое выражение зависимости Y = F(X1, X2, X3, ..., XN). Величину Y называют зависимой переменной, а (X1, X2, X3, ..., XN) – независимыми переменными. В специальной литературе зависимую переменную иногда называют откликом, а независимые переменные– факторами.

Сначала рассмотрим ситуацию, когда Y зависит только от одного аргумента, т.е. Y = F(X). В этом случае данные наблюдений можно представить в виде простой таблицы или графика (см., например, рис. 18.1).

Обычно точки на графике не лежат на одной линии, а образуют так называемое поле рассеяния (или корреляционное поле). Причиной рассеяния при

48

наличии функциональной зависимости является неточность измерений. Для гидрологической практики более характерна другая ситуация. Гидрологические явления, как правило, обусловлены весьма большим числом факторов, полный учет которых практически невозможен (см. п. 1), а в большинстве случаев и нецелесообразен, так как только некоторые из них оказывают решающее влияние на зависимую переменную. В такой ситуации при любой точности измерений точки на графике будут образовывать поле рассеяния.

В обоих рассмотренных случаях мы имеем дело с так называемыми случайными функциями, когда одному и тому же значению X соответствует множество значений Y. Но в первом случае исследователь должен по эмпирическим данным выявить функциональную зависимость y = f(x), а во втором случае требуется найти некоторую осредненную кривую y(x) , относительно которой

будет наблюдаться минимальный разброс точек.

Линию, относительно которой наблюдается минимальный разброс точек, называют линией регрессии, а соответствующее ей аналитическое выражение –

уравнением регрессии.

Вид зависимости y(x) может быть известен заранее – из физических или

иных соображений. Тогда задача исследователя сводится к оценке параметров аналитического выражения по эмпирическим данным. Например, если зависимость является линейной, т.е. y(x) = ах +b, то достаточно найти такие а и b,

при которых разброс точек относительно этой прямой будет наименьшим. Если же вид y(x) не известен, то до определения параметров необходимо выдвинуть

гипотезу о виде этой зависимости.

Параметры известной или предполагаемой зависимости оцениваются с помощью излагаемого ниже метода наименьших квадратов.

Рассмотрим ситуацию, когда зависимость y(x) является линейной. Ли-

нейные зависимости довольно часто используются в гидрологической практике, так как аппарат для них хорошо разработан. В пользу линейных моделей говорят и следующие соображения.

1. Если вид зависимости y(x) не известен, то в качестве первой модели логично испытать линейную как наиболее простую.

2.Если зависимость является слабо нелинейной, то область допустимых значений (ОДЗ) переменной X можно разбить на несколько интервалов, в пределах которых зависимость можно считать линейной.

3.Почти всегда переменные Y и X можно преобразовать так, что зависимость между новыми переменными станет линейной.

Искомым уравнением регрессии в случае линейной зависимости является

~

(18.1)

yi = a xi +b .

Суть метода наименьших квадратов (МНК) состоит в том, чтобы определить такие расчетные параметры а и b, при которых сумма квадратов отклонений наблюденных значений yi, от рассчитанных по формуле (18.1) будет иметь минимальное значение. Сумма квадратов отклонений равна:

49

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]