- •МЕТОДЫ ОБРАБОТКИ ГИДРОЛОГИЧЕСКОЙ ИНФОРМАЦИИ
- •Оглавление
- •I. Основные понятия теории вероятностей, используемые в гидрологии
- •1. Обоснование применения вероятностных методов в инженерной гидрологии
- •2. Случайные события и случайные величины в гидрологии
- •3. Числовые характеристики случайных величин
- •4. Равномерное и нормальное распределения случайных величин
- •5. Распределение Пирсона III типа (непрерывное биномиальное распределение)
- •6. Распределение Крицкого-Менкеля (трехпараметрическое гамма-распределение)
- •7. Основные задачи математической статистики
- •8. Точечные и интервальные оценки параметров распределения
- •9. Статистическая гипотеза. Критерий статистической гипотезы
- •10. Случайные процессы в гидрологии
- •II. Статистические методы в инженерной гидрологии
- •11. Построение кривых обеспеченности по эмпирическим данным
- •12. Оценка параметров распределения по эмпирическим данным
- •13. Оценка погрешностей выборочных параметров распределения
- •14. Проверка однородности гидрологических рядов
- •15. Общие критерии согласия
- •16. Критерии случайности
- •17. Корреляционный анализ гидрологических и климатических рядов
- •18. Уравнение линейной регресии. Метод наименьших квадратов
- •19. Оценка точности уравнения линейной регрессии для двух переменных
- •20. Уравнения линейной регрессии при нескольких аргументах
- •21. Основные характеристики случайных процессов
- •22. Моделирование искусственных гидрологических рядов
- •23. Понятие о динамико-стохастических моделях многолетних колебаний речного стока
- •24. Вводные положения и термины основного нормативного документа
- •25. Определение расчетных гидрологических характеристик при наличии данных гидрометрических наблюдений
- •26. Учет неоднородности исходных данных и выдающихся значений
- •27. Расчетное внутригодовое распределение месячного стока
- •29. Наивысшие уровни воды
- •30. Определение расчетных гидрологических характеристик при недостаточности данных гидрометрических наблюдений
- •31. Учет данных кратковременных наблюдений
- •32. Расчетные расходы и уровни воды гидротехнических сооружений
- •33. Строительная климатология (СП 131.13330.2012)
- •Список литературы
- •Приложение А
тивные документы [24] рекомендуют кривую Крицкого-Менкеля в качестве стандартной кривой при проведении гидрологических расчетов.
Вразделе II будет показано, что можно гораздо быстрее и точнее найти функцию обеспеченности Крицкого-Менкеля с помощью современных математических пакетов, например в среде Mathcad.
Взаключение еще раз перечислим основные особенности данной кривой:
1.Кривая плотности вероятности является одномодальной с положительной асимметрией;
2.Нижним пределом кривой всегда является нуль;
3.Кривая Крицкого-Менкеля не ограничена верхним пределом;
4.При Сs = 2Сv кривая превращается в двухпараметрическое Г-распреде- ление, т.е. совпадает с кривой Пирсона III типа.
7. Основные задачи математической статистики
До сих пор, говоря о законах распределения случайных величин, мы не затрагивали вопроса о том, на каком основании устанавливаются эти законы распределения. Ответ на вопрос вполне определенен – в основе всех этих характеристик лежит опыт; каждое исследование случайных явлений, выполняемое методами теории вероятностей, прямо или косвенно опирается на экспериментальные данные. Каждое исследование в области случайных явлений, как бы отвлеченно оно ни было, корнями своими всегда уходит в эксперимент, в опытные данные, в систему наблюдений.
Известный математик А. Уайльд определяет математическую статистику как совокупность методов, которые дают возможность принимать оптимальные решения в условиях неопределенности. В качестве более строгого определения можно привести следующее: математическая статистика – раздел математики, посвященный математическим методам систематизации, обработки и использования статистических данных для научных и практических выводов. Фундаментальными понятиями статистической теории являются понятия генеральной совокупности и выборки.
Генеральная совокупность обычно интерпретируется как совокупность всех возможных значений случайной величины, которые в принципе могут иметь место при данных условиях. Смысл этого понятия состоит в том, что предполагается существование некоторых вполне определенных свойств, неслучайных закономерностей, присущих данной совокупности тех свойств, которые и должны быть выяснены исследователем. Фактически эти свойства являются объективным отображением вероятностных свойств изучаемого объекта, которые могут быть охарактеризованы с помощью соответствующих законов распределения вероятностей или связанных с ними числовых параметров. Считается, что указанные свойства не изменяются во времени и присущие генеральной совокупности неслучайные закономерности сохраняют постоянным свой характер, т.е. являются устойчивыми.
Выборка – это конечный набор значений случайной величины, полученный в результате наблюдений. В гидрологии в качестве выборок можно рас-
19
сматривать ряды наблюдений за среднегодовыми расходами воды, максимальными и минимальными расходами и уровнями воды, среднегодовой, максимальной и минимальной температурой воздуха и т.д. Число элементов выборки называется ее объемом. Выборка называется репрезентативной, если она достаточно полно характеризует генеральную совокупность.
Все задачи математической статистики касаются вопросов обработки наблюдений над массовыми случайными явлениями, но в зависимости от характера решаемого практического вопроса и от объема имеющегося экспериментального материала эти задачи могут принимать ту или иную форму. Оха - рактеризуем вкратце некоторые типичные задачи математической статистики.
Задача определения закона распределения СВ (или системы СВ) по данным стучайной выборки. При обработке обширных по своему объему статистических данных часто возникает вопрос об определении законов распределения тех или иных СВ. Теоретически при достаточном количестве опытов свойственные этим СВ закономерности будут осуществляться сколь угодно точно. На практике нам всегда приходится иметь дело с ограниченным количеством экспериментальных данных; в связи с этим результаты наших наблюдений и их обработки всегда содержат больший или меньший элемент случайности. Возникает вопрос о том, какие черты наблюдаемого явления относятся к постоянным, устойчивым и действительно присущи ему, а какие являются случайными и проявляются в данной серии наблюдений только за счет ограниченного объема экспериментальных данных. Естественно, к методике обработки экспериментальных данных следует предъявить такие требования, чтобы она, по возможности, сохраняла типичные, характерные черты наблюдаемого явления и отбрасывала все несущественное, второстепенное, связанное с недостаточным объемом опытного материала. В связи с этим возникает характерная для математической статистики задача сглаживания или выравнивания статистических данных, представления их в наиболее компактном виде с помощью простых аналитических зависимостей.
Задача проверки правдоподобия гипотез. При решении такого рода за-
дач мы обычно не располагаем настолько обширным статистическим материалом, чтобы выявляющиеся в нем статистические закономерности были в достаточной мере свободны от элементов случайности. Статистический материал может с большим или меньшим правдоподобием подтверждать или не подтверждать справедливость той или иной гипотезы. Например, может возникнуть такой вопрос: согласуются ли результаты эксперимента с гипотезой о том, что данная СВ подчинена закону распределения F(x)? Другой подобный вопрос: указывает ли наблюденная в опыте тенденция на зависимость между двумя случайными величинами, на наличие действительной объективной зависимости между ними, или же она объясняется случайными причинами, связанными с недостаточным объемом наблюдений? Для решения подобных вопросов математическая статистика выработала ряд специальных приемов.
Задача нахождения неизвестных параметров распределения. Часто при обработке статистического материала вовсе не возникает вопрос об определении законов распределения исследуемых СВ. Обыкновенно это бывает свя-
20
зано с крайне недостаточным объемом экспериментального материала. Иногда же характер закона распределения качественно известен до опыта, из теоретических соображений; например, часто можно утверждать заранее, что СВ подчинена нормальному закону. Тогда возникает более узкая задача обработки наблюдений – определить только некоторые параметры (числовые характеристики) СВ. При небольшом числе опытов задача более или менее точного определения этих параметров не может быть решена; в этих случаях экспериментальный материал содержит в себе неизбежно значительный элемент случайности; поэтому случайными оказываются и все параметры, вычисленные на основе этих данных. В таких условиях может быть поставлена только задача об определении так называемых «оценок» или «подходящих значений» для искомых параметров, т.е. таких приближенных значений, которые при массовом применении приводили бы в среднем к меньшим ошибкам, чем всякие другие. С задачей отыскания «подходящих значений» числовых характеристик тесно связана задача оценки их точности и надежности.
8. Точечные и интервальные оценки параметров распределения
Рассмотрим определение неизвестных параметров, от которых зависит закон распределения СВ, по ограниченному числу опытов. Прежде всего нужно отметить, что любое значение искомого параметра, вычисленное на основе ограниченного числа опытов, всегда будет содержать элемент случайности. Такое приближенное, случайное значение будем называть точечной оценкой параметра. Например, оценкой для математического ожидания может служить среднее арифметическое наблюденных значений случайной величины в n независимых опытах. При очень большом числе опытов среднее арифметическое будет с большой вероятностью весьма близко к математическому ожиданию. Если же число опытов n невелико, то замена математического ожидания средним арифметическим приводит к какой-то ошибке. Эта ошибка в среднем тем больше, чем меньше число опытов.
Так же будет обстоять дело и с оценками других неизвестных параметров. Любая из таких оценок случайна; при пользовании ею неизбежны ошибки. Желательно выбрать такую оценку, чтобы эти ошибки были по возможности минимальными.
Рассмотрим следующую общую задачу. Имеется СВ X, закон распределения которой содержит неизвестный параметр a. Требуется найти подходящую точечную оценку для параметра по результатам n независимых опытов (наблюдений), в каждом из которых величина X приняла определенное значение.
Обозначим наблюденные значения СВ (X1, X2, …, Xn). Их можно рассматривать как n «экземпляров» СВ X, т. е. n независимых случайных величин, каждая из которых распределена по тому же закону, что и СВ X.
Обозначим a точечную оценку для параметра a. Любая оценка, вычисляемая на основе наблюдений, должна представлять собой функцию:
a = a(X1, X 2 ,..., X n ) |
(8.1) |
21
и, следовательно, сама является величиной случайной. Закон распределения a зависит, во-первых, от закона распределения СВ X (и, в частности, от самого неизвестного параметра a); во-вторых, от числа опытов n.
Предъявим к оценке a ряд требований, которым она должна удовлетворять, чтобы быть в каком-то смысле «доброкачественной» оценкой.
1)Состоятельность: оценка a при увеличении числа опытов n приближается (сходится по вероятности) к параметру a .
2)Несмещенность: математическое ожидание a равно a
M[a] = a . |
(8.2) |
3) Эффективность: выбранная несмещенная оценка обладает по сравнению с другими наименьшей дисперсией, т.е.
D[a] = min . |
(8.3) |
На практике не всегда удается удовлетворить всем этим требованиям. Например, может случиться, что, даже если эффективная оценка существует, формулы для ее вычисления оказываются слишком сложными и приходится удовлетворяться другой оценкой, дисперсия которой несколько больше. Иногда применяются (в интересах простоты расчетов) незначительно смещенные оценки. Однако выбору оценки всегда должно предшествовать ее критическое рассмотрение со всех перечисленных выше точек зрения.
Точечная оценка a не позволяет указать, насколько близко она находится к истинному значению параметра a. Требуется знать – к каким ошибкам может привести замена параметра a его точечной оценкой a и с какой степенью уверенности можно ожидать, что эти ошибки не выйдут за известные пределы? Такого рода задачи особенно актуальны при малом числе наблюдений n, когда приближенная замена a на a может привести к серьезным ошибкам.
Чтобы дать представление о точности и надежности оценки a , в математической статистике пользуются так называемыми доверительными интервалами и доверительными вероятностями. Назначим некоторую достаточно большую вероятность β (например, 0,9; 0,95 или 0,99) такую, что событие с вероятностью β можно считать практически достоверным, и найдем такое значение ε, для которого
P( |
|
a − a |
|
<ε)= β . |
(8.4) |
|
|
Тогда диапазон практически возможных значений ошибки, возникающей при замене a на a , будет ±ε ; большие по абсолютной величине ошибки будут появляться только с малой вероятностью α =1− β .
Перепишем (8.4) в виде: |
|
P(a −ε < a < a +ε)= β . |
(8.5) |
Равенство(8.5) означает, что с вероятностью β неизвестное значение параметра a попадает в интервал
Iβ = (a −ε; a +ε). |
(8.6) |
22
Ранее мы рассматривали вероятность попадания случайной величины в заданный неслучайный интервал. Здесь дело обстоит иначе: величина a не случайна, зато случаен интервал Iβ. Случайно его положение на оси абсцисс, определяемое его центром a ; случайна вообще и длина интервала 2ε, так как величина ε вычисляется, как правило, по опытным данным. Поэтому в данном случае лучше будет трактовать величину β не как вероятность «попадания» точки a в интервал, а как вероятность того, что случайный интервал Iβ накроет точку a
(рис. 8.1).
Рис. 8.1. Доверительный интервал
Вероятность β называют доверительной вероятностью, а интервал Iβ – доверительным интервалом. Границы интервала Iβ: a1 = a −ε и a2 = a +ε назы-
вают доверительными границами.
Перейдем к вопросу о нахождении доверительных границ. Если бы нам был известен закон распределения величины a , задача нахождения доверительного интервала была бы весьма проста: достаточно было бы найти такое значение ε, для которого выполнено равенство (8.4). Затруднение состоит в том, что закон распределения оценки a зависит от закона распределения СВ X и, следовательно, от его неизвестных параметров (в частности, и от самого параметраa).
Чтобы обойти это затруднение, применяют следующий приближенный прием: заменяют в выражении для ε неизвестные параметры их точечными оценками. При сравнительно большом числе опытов n ( n > 20 ÷30) этот прием обычно дает удовлетворительные по точности результаты.
Используя функцию распределения выборочных значений параметра a, можно записать вероятности непревышения для 1 и 2 :
p{a ≤ 1}= F( 1) = (1− β) / 2 ; |
(8.7) |
p{a ≤ 2}= F( 2 ) = β +(1− β) / 2 = (1+ β) / 2. |
(8.8) |
Например, если рассматривается 90 %-ный доверительный интервал (β= 0,9), то F( 1) = 0,05 ; F( 2 ) = 0,95 или, соответственно, 5 и 95%.
Для построения интервальной оценки математического ожидания воспользуемся распределением Стьюдента. Величина (x −mx )
n / S имеет распре-
деление Стьюдента с числом степеней свободы ν=n–1. Таким образом, можно записать, что с вероятностью β она попадает в интервал
t(1−β) / 2 ≤ (x −mx ) |
|
/ |
|
< t(1+β) / 2 , |
(8.9) |
n |
S |
23
где t(1−β) / 2 , t(1+β) / 2 – квантили распределения Стьюдента, соответствующие
вероятностям непревышения (1– β)/2 и (1+ β)/2. Учитывая, что распределение Стьюдента симметрично относительно нуля, из (8.9) получим
−t(1+β) / 2 ≤ (x − mx ) |
n |
/ |
S |
< t(1+β) / 2 . |
(8.10) |
Преобразование (8.10) дает формулу для расчета доверительного интервала МО
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
. |
|
|
|
−t(1+β) / 2 |
|
S |
|
≤ mx < |
|
+t(1+β) / 2 |
S |
(8.11) |
||||||||
x |
x |
||||||||||||||||
|
|
|
|
|
|
|
|
|
|
||||||||
|
n |
|
|
||||||||||||||
|
|
|
|
|
|
|
|
|
|
n |
|
||||||
Кратко остановимся на доверительном интервале дисперсии. Величина (n −1)D / D имеет распределение χ2 с ν = n – 1 степенями свободы, и, следовательно, можно записать:
χ(21−β) / 2 ≤ (n −1) |
|
2 / D < χ(21+β) / 2 , |
(8.12) |
S |
где S 2 – точечная оценка дисперсии; D – дисперсия генеральной совокупности. После преобразований (8.12) получаем доверительные интервалы для
дисперсии и СКО:
|
|
(n −1) |
|
2 |
|
≤ D < |
(n −1) |
|
2 |
|
|
|
|
||||||||||||
|
|
S |
|
S |
, |
|
|
(8.13) |
|||||||||||||||||
|
|
|
|
χ2 |
|
χ2 |
|||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||||||
|
|
|
|
(1+β) / 2 |
|
|
|
|
|
|
|
(1−β) / 2 |
|
|
|
|
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||||
|
|
|
|
|
|
n −1 |
|
≤σ < |
|
|
|
|
n −1 |
. |
(8.14) |
||||||||||
|
S |
|
|
|
S |
||||||||||||||||||||
|
|
|
χ2 |
|
|
|
|
||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
χ2 |
|
|
|
|
||||||
|
|
|
|
|
|
(1+β) / 2 |
|
|
|
|
|
|
|
|
|
(1−β) / 2 |
|
||||||||
Пример. Дано: n = 37; |
x =12,0; |
|
= 6,0. Найти 90%-ные доверительные |
||||||||||||||||||||||
S |
|||||||||||||||||||||||||
интервалы математического ожидания mx и СКО σx. |
|
|
|
|
|||||||||||||||||||||
Решение. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
β = 0.9, |
|
|||||
1) Для 90%-ного доверительного интервала |
следовательно, |
||||||||||||||||||||||||
t(1+β) / 2 = t0,95 . В среде Mathcad при ν = 36 находим квантиль t-распределения Стьюдента qt(0.95,36) = 1.688. Следовательно, t0,95 =1,69 . Подставляем это значение в формулу (8.11):
12 −1,69 636,0 ≤ mx <12 +1,69 636,0 .
В окончательном виде 90%-ный доверительный интервал для mх имеет вид 10,31 ≤ mx <13,69 .
2) При β = 0,9 χ(21−β) / 2 = χ52 , χ(21+β) / 2 = χ952 . В среде Mathcad при ν = 36
находим квантили распределения хи-квадрат qchisq(0.05,36) = 23.269 и qchisq(0.95,36) = 50.998. Подставляем эти значения в формулу (8.14):
6 |
36 |
|
≤σx < 6 |
|
36 |
|
или 5,04 ≤σx < 7,46 . |
|
51,0 |
|
23,27 |
||||||
|
|
|
|
|
|
|
||
24
