Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методология научных исследований. Учебник
.pdf
КентбаеваБ.А.«Методологиянаучныхисследований»
x
y
R
y
x
R
x
y
d
d
=×
Термин «функция» употребляется не только для обозначения признака,
который зависит от аргумента, но и для обозначения формы этой зависимости.
Вскрыть функцию - это значит найти закономерность, по которой изменяется
изучаемый признак в зависимости от изменения одного или нескольких других признаков. Если изменения функции исследуются в зависимости от одного
аргумента, регрессия называется простой, если от двух и более аргументов множественной, если при любом значении (малом, среднем, большом) аргумента одинаковые приращения его вызывают (или имеют тенденцию вызывать) одинаковые приращения функции, регрессия называется прямо-
линейной.
Если при одинаковых приращениях аргумента, но при разных его
значениях (малом, среднем, большом) функция имеет неодинаковые
приращения, причем среднее течение изменений не идет по прямой,
регрессия называется криволинейной.
Термин регрессия был введен Ф.Гальтоном в связи с изучением им
наследовании признаков родителей потомством. С общестатистической точки зрения термин регрессия не совсем удачен, но достаточно прочно укоренился, так как получил широкое распространение, особенно в статистических работах биологического направления. Существует ряд синонимов
«уравнение регрессии», «кривая регрессии», «корреляционное уравнение»,
«корреляционная кривая».
Для изображения регрессии используется ряд регрессии (эмпирический и
теоретический), линия регрессии (эмпирическая и теоретическая), коэффициент регрессии, уравнение регрессии. Эмпирический ряд регрессии - это
двойной ряд цифр, включающий значения аргумента и соответствующие
средние значения функции, полу че н ные в оп ы те .
Итак, регрессия показывает как изменяется относительный признак, показатель или относительная величина при изменении главного признака, показателя или главной величины на какую-либо единицу меры.
Так как при изучении регрессии одновременно рассматриваются изменения двух статистических величин Х и У, то любая из них может рассматриваться или как главная или как относительная. В связи с этим для регрессии применяются два обозначения:
- регрессия Х по У;
- регрессия У по Х.
Соответственно при наличии двух регрессий для определения коэффициента регрессии используются и две формулы:
121
Rr
x
y
121
(49)

КентбаеваБ.А.«Методологиянаучныхисследований»
y
x
d
d
=×
x
y
R
y
x
R
0.85 0.85 1.31 1.11
0.85 0.85 0.76 0.65
x
y
d
d
=×
y
x
d
d
=×
0.05 0.05 1.31 0.06
0.05 0.05 0.76 0.04
x
y
R
где
- регрессия Х по У;
Rr
y
x
(50)
- регрессия У по Х;
r - коэффициент корреляции;
d
– среднее квадратическое отклонение.
х, dу
Следует отметить, что регрессия (R) имеет одинаковый знак с корреляцией (r): при прямой связи - положительный (+), при обратной - отрицательный (-).
Подставив известные значения (r=0.85,
d
=1.53,
x
d
=1.17, mr=0.05) вы-
y
числим коэффициенты регрессии:
R =×=×=
1.53
x
y
1.17
;
R =×=×=
y
x
1.17
1.53
Коэффициент регрессии, как и коэффициент корреляции, имеет свою
ошибку, которая определяется по следующим формулам:
mm
xr
R
y
mm
yr
R
x
(51)
(52)
где
m
R
x
y
и
m
- ошибка коэффициента регрессии;
y
R
x
mr – ошибка коэффициента корреляции;
d
– среднее квадратическое отклонение.
х, dу
m =×=×=
1.53
x
R
y
1.17
m =×=×=
y
R
x
1.17
1.53
Итак, получили следующий коэффициент регрессии и его ошибку:
= 1.11 ± 0.06 значит, при увеличении длины плода на 1 мм его диа-
метр увеличивается на 1.11± 0.06 мм.
122
122

КентбаеваБ.А.«Методологиянаучныхисследований»
y
x
R
18.53
f
= 0.65
±
0.04 значит, при увеличении диаметра на 1 мм, его длина
увеличивается на 0.65± 0.04 мм.
x
R
t =
y
R
m
x
R
y
x
R
t
R
y
===
m
x
R
y
и
1.11
0.06
t =
R
y
R
x
- критерий достоверности (53)
m
y
R
x
- определение критерия достоверности регрессии Х
по У.
Вскрывая усредненное течение функции, исследователь выявляет ту
закономерность изучаемого явления, которая в эмпирическом ряду была
вскрыта случайностями своего проявления. Эта закономерность, выраженная
формулой или теоретическим рядом регрессии, помогает более точно, с
меньшими ошибками дать описание внешних проявлений закономерности, что
в свою очередь, может помочь нахождению и внутренних факторов, управляющих данным явлением. В этом и заключается познавательное значение
исследований регрессии различных признаков у биологических объектов.
Результаты этих исследований имеют также широкое применение и в
практике. Каждый выровненный ряд дает возможность определить значение
функции при любом значении аргумента (или нескольких аргументов). Это
обстоятельство дает возможность использовать ряды и уравнения регрессии
при определении значений таких признаков, непосредственное измерение которых в обычных условиях или невозможно, или затруднительно.
В практических работах использование уравнений и линий регрессии
получило широкое распространение при определении без взвешивания, путем
измерения, нормального живого веса животных и их убойного веса при жизни, веса сена в стогах, веса овощей в овощехранилищах, веса силосной массы в силосах, веса древесины в стволах и штабелях и пр.
Контрольные вопросы:
1. Кем был введен термин «регрессия»?
2. Для какой цели служит коэффициент регрессии?
3. Какие обозначения применяются для регрессии?
4. Как определяется коэффициент регрессии и его ошибка?
Контрольное задание: рассчитать изученные показатели регрессионно-
го анализа (коэффициент регрессии, ошибку, критерий достоверности).
123
123

КентбаеваБ.А.«Методологиянаучныхисследований»
Раздел Х ДИСПЕРСИОННЫЙ АНАЛИЗ
§ 1 Решение дисперсионных комплексов
Глубокое и ценное понятие о наследуемости без знания основ дисперсионного анализа обычно воспринимается с большим трудом, далеко не всегда
правильно, что часто приводит к ошибочным выводам и не подтверждающимся
прогнозам как в теории, так и на практике. Новейшие вопросы биологической
теории - теория популяций, математическое моделирование биологических
процессов - не могли бы даже, и возникнуть без разработки специальных
математических методов (Н.А.Плохинский).
Дисперсионный анализ разработан англичанином Р.Фишером в 1925
году, со временем он стал наиболее распространенным методом обработки
статистических данных в самых различных областях науки и техники и,
особенно в биологии и сельском хозяйстве. Этот метод основан на разложении общей дисперсии статистического комплекса на составляющие компоненты (отсюда и название метода - dispersion (лат.) - рассеивание), сравнивая
которые, друг с другом посредством F-критерия, можно определить долю
общей вариации изучаемого признака, обусловленную действием на него
как регулируемых, так и нерегулируемых в опыте факторов.
При дисперсионном анализе одновременно обрабатываются данные нескольких выборок (вариантов), составляющих единый статистический комплекс, оформленный в виде специальной рабочей таблицы.
В каких случаях применяется дисперсионный анализ?
Прежде всего, он необходим при координации уровней статистическо-
го анализа. Обычно биолог работает с двумя и более уровнями, например,
число семян в чашке Петри у семеновода и число самих чашек, число делянок на пробной площади у геоботаника и число самих пробных площадей, число замеров признака на одном растении у физиолога и число самих растений. Эти показатели должны быть координированы так, чтобы,
во-первых, не делать лишней работы, а во-вторых, получить достаточную
достоверность результатов. Ясно, что если изменчивость между растениями
у физиолога велика, а на одном растении мала, то можно уменьшить по вторности на одном растении, но увеличить число растений в опыте.
Получить информацию об изменчивости внутри объекта и между объектами и правильно построить выборки помогает дисперсионный анализ.
Дисперсионный анализ при обработке результатов эксперимента дает
больше информации, чем метод сравнения средних, за счет отношения дисперсий и оценки степени влияния фактора. При двухфакторном анализе добавляется информация о взаимодействии двух факторов.
Дисперсионный анализ целесообразнее применять и в том случае,
когда исследователя не интересует конкретная средняя величина признака
в данном месте и в данное время, а он хочет получить общие принципи-
124
124

КентбаеваБ.А.«Методологиянаучныхисследований»
2
1раn
-
альные выводы. Например, испытывая новый синтезированный стимулятор, исследователь может задаться двумя различными вопросами:
1. Каковы средние урожаи обработанной и не обработанной стимуля-
тором делянок в данном году, на данной почве, при данном сроке
посева и режиме полива?
2. Действует ли данный стимулятор на растение или нет?
Чтобы ответить на первый вопрос, исследователь должен иметь достаточно много повторностей для получения достоверных средних величин. Для
ответа на второй вопрос он может провести дисперсионный анализ с очень
небольшим количеством повторностей, чем сэкономит силы и средства.
Ценность же информации, полученной в первом случае, весьма невелика,
так как ясно, что в другом году, на другой почве и при другом сроке посева действие стимулятора будет совершенно иным.
Дисперсионный анализ в подавляющем большинстве случаев предпочтительнее традиционного метода сравнения средних величин.
Дисперсионным он назван потому, что имеет дело с анализом дисперсии, которая представляет собой среднее квадратическое отклонение (d),
возведенное в квадрат. Дисперсия обозначается символом d
2
и получается
при расчетах делением суммы квадратов отклонений от средней величины
на число степеней свободы, т.е. число возможных независимых сравнений
объектов:
s
(54)
S
2
=
где d 2 – дисперсия, средний квадрат , средний квадрат отклонений, ва-
рианса;
S
ра2 – сумма произведений алгебраических сумм частот на условное
отклонение во второй степени;
n - число измерений, наблюдений, количество вариант, дата.
Иногда дисперсию называют средним квадратом или вариансой. Оче-
видно, дисперсия более чувствительный показатель, чем среднее квадратическое отклонение, так как малейшие сдвиги в последнем возводятся при
расчете дисперсии в квадрат.
Если рассчитать дисперсию для какого-либо вариационного ряда, то
мы не получим никакой дополнительной информации к той, которая уже
дана нам средним квадратическим отклонением. Для проведения дисперсионного анализа необходимо осуществление принципа суммирования
дисперсий.
Дисперсионный анализ бывает однофакторным и многофакторным.
Наиболее простой из них однофакторный, т.е. на возможные различия будет
влиять один фактор. Например, черенки высаживаются на различный суб-
125
125

КентбаеваБ.А.«Методологиянаучныхисследований»
страт (песок, торф и т.д.). В данном случае будем считать, что черенки являются абсолютно одинаковыми, срезанные с одного растения, в одно время, с равномерно развитых побегов, одинаковых размеров по длине и диаметру, то на уровень их развития будет влиять только различие субстрата. В
примере мы можем видеть принцип единственности различий столь не-
обходимый для правильной постановки и проведения экспериментов любого типа, т.е. в опыте различия представлены в виде контролируемого фактора.
Допустим, что генетически идентичные растения (клон, чистая линия)
выращиваются на идеально однородном участке (рисунок 9, а). В этом
случае (который может быть представлен только теоретически) дисперсия
равна нулю.
а)
б)
d
2
=0
d
е
2
126
126

КентбаеваБ.А.«Методологиянаучныхисследований»
2
g
d
2
ph
d
2
e
d
2
g
d
2 22
ph ge
d dd
=+
2
g
d
222
g phe
ddd
=-
2
g
d
2
в)
d
2
+
d
е
g
Рисунок 9 - Принцип суммирования дисперсий
Теперь рассмотрим случай, когда клон или чистая линия выращиваются в пестрых экологических условиях (рисунок 9, б). В этом случае будет наблюдаться дисперсия изучаемого признака, вызванная экологической
пестротой участка. Она называется экологической или средовой дисперсией и обозначается d
е
(е - первая буква английского слова environment -
среда).
Наконец, рассмотрим третий случай, когда генетически разные расте-
ния (популяция) выращиваются на пестром экологическом (рисунок 9, в).
При этом произойдет следующее. Генетически лучшие растения, попавшие в лучшие условия, увеличат общую амплитуду изменчивости в одну
сторону. Генетически худшие, попавшие в худшие условия, увеличат амплитуду в другую сторону. Общая дисперсия увеличится на величину, вызванную генетическими различиями растений, т.е. на
. Таким образом,
наблюдаемая общая изменчивость -
жется состоящей из двух компонент: экологической дисперсии (
тической (
). Это можно записать так:
(фенотипическая дисперсия) ока-
) и гене-
(55)
В задачу дисперсионного анализа как раз и входит количественное
нахождение компонент общей дисперсии, которую мы можем непосредственно наблюдать в природе или опыте. Так, в нашем примере можно
определить
следующим образом: вырастить на одном участке изучае-
мую популяцию и клон, взятый из этой популяции. Затем от общей дисперсии в популяции отнять экологическую дисперсию клона:
(56)
Знание
позволяет судить о генетической пестроте популяции и
помогает прогнозировать успешность отбора из данной популяции.
Мы рассмотрели пример суммирования экологической и генетической
дисперсий. Однако могут быть другие самые разнообразные компоненты
общей дисперсии.
127
127

КентбаеваБ.А.«Методологиянаучныхисследований»
§ 2 Техника проведения дисперсионного анализа (по Драгавцеву В.В.)
Например, четыре образца семян сосны обыкновенной, интродуцированных в новую местность из разных географических районов, испытали на
лабораторную всхожесть. Каждый образец испытывали в семи повторностях на аппарате проращивания. Полученные данные по всхожести
приведены в таблице 41.
При рассмотрении этой таблицы видно, что дисперсия имеется как
внутри столбцов, так и между столбцами, т.е. по вертикали и по горизонтали (по горизонтали варьируют средние величины столбцов). Столбцы в
таблице называются классами.
Минимальное число классов при дисперсионном анализе - 2, минимальное число повторностей - 2.
Дисперсия между классами называется факторной или факториаль-
ной (в нашем примере фактором, вызывающим ее, являются образцы се-
мян). Дисперсия внутри классов называется случайной, так как мы не
знаем, чем конкретно она вызвана (здесь и различия в механическом и
химическом составе почвы делянок, различия в аэрации, водном режиме и
т.п.).
Задачей дисперсионного анализа является определение, какая дисперсия выше - факториальная или случайная. Если выше факториальная дисперсия, значит факторы (образцы семян) достоверно различаются между
собой по всхожести и являются экотипами разных географических зон. Если выше случайная дисперсия, значит, достоверных различий по всхожести
нет, и наши образцы можно рассматривать как выборку из одной однородной совокупности (в данном случае вида). Таким образом, в данном примере общая дисперсия разлагается на две части - факториальную и случайную. А поскольку изучается действие только одного фактора (образцов семян), то дисперсионный анализ называется однофакторным.
Таблица 41 - Испытание на урожайность сосны обыкновенной, интродуцированную в новую местность из разных географических районов
Образцы се-
мян
Повторности,
делянки
1 72 74 78 69
2 69 72 74 67
3 63 70 70 66
4 59 69 58 64
х у z
1 2 3 4
128
128
l

КентбаеваБ.А.«Методологиянаучныхисследований»
S
S
S
S
N
S+S+S+S
777728
= + + + =+++=
63.5%
4
+++
2222
()()()()
Q nMMnMMnMMnMM
32
1 41
r
===
5 59 66 58 62
6 53 58 56 58
7 51 52 56 54
S
Средние клас-
сов, M, %
426 461 450 440
Mx = 60.9 My = 65.9 Mz = 64.3
Ml = 62.9
Рассмотрим технику проведения дисперсионного анализа:
1. Обозначим классы буквами: х, у, z, l;
2. Определим средние значения в каждом классе обычным путем,
т.е. суммируем все варианты в классе и делим сумму на число вариант:
v
y
=
y
n
y
9.65=
;
M
v
z
=
z
n
z
M
3.64=
;
v
l
=
l
n
l
9.62=
M
v
x
=
х
n
x
9.60=
;
M
3. Общее среднее по всей таблице определяется по формуле:
M
=
zyx
l
(57)
vvvv
где N определяется по формуле:
Nnnnn
xyz
l
60.9 65.9 64.3 62.9
M
==
(58)
4. Определим сумму квадратов отклонений от общего среднего между
классами (Q
м.к.
):
Q
= -+ -+ -+ -
..
мкxxyyzz
= 7(60.9-63.5)2 +7(65.9-63.5)2 +7(64.9-63.5)2 +7(62.9-63.5)2 = 94.64=95
м.к.
ll
5. Найдем дисперсию (среднеквадратическое отклонение) (
классами, r - число классов.
d
2
мк
..
Q
мк
--
..
95
6. Найдем сумму квадратов отклонений от средних внутри классов
(Q
):
в.к.
129
129
2
d
..км
(59)
) между
(60)

КентбаеваБ.А.«Методологиянаучныхисследований»
2222
( )( )( )( )
éù
ëû
60
284
Nr
===
95 1446 1541
=+=+=
57
1 281
N
===
QхМуМzММ
Итак, Q
=S-+-+-+-
..
вк х уя
=S[(72-60.9)
в.к.
2
+ [(69-60.9)2 + … (51-60.9)2] +
l
l
[(74-65.9)2 + (72-65.9)2 + … (52-65.9)2 +
[(78-64.3)2 + (74-64.3)2 + … (56-64.3)2 +
[(69-62.9)2 + (69-62.9)2 + … (69-62.9)2] = 1446
2
7. Найдем дисперсию внутри классов (
d
2
вк
..
Q
..
вк
--
1446
d
):
..кв
8. Теперь найдем общую сумму квадратов (Q):
QQQ
.. ..
мк вк
(63)
(61)
(62)
9. И, наконец, вычислим общую дисперсию (
2
d
d
2) по формуле:
Q
1541
--
(64)
10. Теперь сводные данные представим в виде таблицы 42.
Таблица 42 - Сводные данные
Изменчивость
Между классами Q
Внутри классов Q
Сумма
квадратов
= 95 f1 = r - 1 = 3
м.к.
= 1446 f2 = N - r = 24
в.к.
степеней свободы
По всем наблюдениям Q = 1541 f = N - 1 = 27
Число
Оценка
дисперсии
2
d
= 32
..км
2
d
= 60
..кв
2
= 57
d
Показатель силы влияния (критерий Фишера) равен отношению
факториальной дисперсии к общей. Он определяет ту долю общей дисперсии, которая приходится на факториальную дисперсию или долю влияния
изучаемого фактора в общей сумме влияния всех вообще факторов, определяющих величину и разнообразие результативного признака.
130
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
