Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методология научных исследований. Учебник

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
КентбаеваБ.А.«Методологиянаучныхисследований»
x
y
R
y
x
R
x
y
d
d
=×
Термин «функция» употребляется не только для обозначения признака,
который зависит от аргумента, но и для обозначения формы этой зависимости. Вскрыть функцию - это значит найти закономерность, по которой изменяется изучаемый признак в зависимости от изменения одного или нескольких дру­гих признаков. Если изменения функции исследуются в зависимости от одного аргумента, регрессия называется простой, если от двух и более аргументов ­множественной, если при любом значении (малом, среднем, большом) аргу­мента одинаковые приращения его вызывают (или имеют тенденцию вызы­вать) одинаковые приращения функции, регрессия называется прямо-
линейной.
Если при одинаковых приращениях аргумента, но при разных его значениях (малом, среднем, большом) функция имеет неодинаковые приращения, причем среднее течение изменений не идет по прямой, регрессия называется криволинейной.
Термин регрессия был введен Ф.Гальтоном в связи с изучением им наследовании признаков родителей потомством. С общестатистической точ­ки зрения термин регрессия не совсем удачен, но достаточно прочно укоре­нился, так как получил широкое распространение, особенно в статистиче­ских работах биологического направления. Существует ряд синонимов
«уравнение регрессии», «кривая регрессии», «корреляционное уравнение», «корреляционная кривая».
Для изображения регрессии используется ряд регрессии (эмпирический и
теоретический), линия регрессии (эмпирическая и теоретическая), коэффи­циент регрессии, уравнение регрессии. Эмпирический ряд регрессии - это
двойной ряд цифр, включающий значения аргумента и соответствующие средние значения функции, полу че н ные в оп ы те .
Итак, регрессия показывает как изменяется относительный признак, по­казатель или относительная величина при изменении главного признака, по­казателя или главной величины на какую-либо единицу меры.
Так как при изучении регрессии одновременно рассматриваются изме­нения двух статистических величин Х и У, то любая из них может рассмат­риваться или как главная или как относительная. В связи с этим для регрес­сии применяются два обозначения:
- регрессия Х по У;
- регрессия У по Х.
Соответственно при наличии двух регрессий для определения коэффи­циента регрессии используются и две формулы:
121
Rr
x
y
121
(49)
КентбаеваБ.А.«Методологиянаучныхисследований»
y
x
d
d
=×
x
y
R
y
x
R
0.85 0.85 1.31 1.11
0.85 0.85 0.76 0.65
x
y
d
d
=×
y
x
d
d
=×
0.05 0.05 1.31 0.06
0.05 0.05 0.76 0.04
x
y
R
где
- регрессия Х по У;
Rr
y
x
(50)
- регрессия У по Х;
r - коэффициент корреляции;
d
– среднее квадратическое отклонение.
х, dу
Следует отметить, что регрессия (R) имеет одинаковый знак с корреля­цией (r): при прямой связи - положительный (+), при обратной - отрицатель­ный (-).
Подставив известные значения (r=0.85,
d
=1.53,
x
d
=1.17, mr=0.05) вы-
y
числим коэффициенты регрессии:
R =×=×=
1.53
x
y
1.17
;
R =×=×=
y
x
1.17
1.53
Коэффициент регрессии, как и коэффициент корреляции, имеет свою
ошибку, которая определяется по следующим формулам:
mm
xr
R
y
mm
yr
R
x
(51)
(52)
где
m
R
x
y
и
m
- ошибка коэффициента регрессии;
y
R
x
mr – ошибка коэффициента корреляции;
d
– среднее квадратическое отклонение.
х, dу
m =×=×=
1.53
x
R
y
1.17
m =×=×=
y
R
x
1.17
1.53
Итак, получили следующий коэффициент регрессии и его ошибку:
= 1.11 ± 0.06 значит, при увеличении длины плода на 1 мм его диа-
метр увеличивается на 1.11± 0.06 мм.
122
122
КентбаеваБ.А.«Методологиянаучныхисследований»
y
x
R
18.53
f
= 0.65
±
0.04 значит, при увеличении диаметра на 1 мм, его длина
увеличивается на 0.65± 0.04 мм.
x
R
t =
y
R
m
x
R
y
x
R
t
R
y
===
m
x
R
y
и
1.11
0.06
t =
R
y
R
x
- критерий достоверности (53)
m
y
R
x
- определение критерия достоверности регрессии Х
по У.
Вскрывая усредненное течение функции, исследователь выявляет ту закономерность изучаемого явления, которая в эмпирическом ряду была вскрыта случайностями своего проявления. Эта закономерность, выраженная формулой или теоретическим рядом регрессии, помогает более точно, с меньшими ошибками дать описание внешних проявлений закономерности, что в свою очередь, может помочь нахождению и внутренних факторов, управ­ляющих данным явлением. В этом и заключается познавательное значение исследований регрессии различных признаков у биологических объектов.
Результаты этих исследований имеют также широкое применение и в практике. Каждый выровненный ряд дает возможность определить значение функции при любом значении аргумента (или нескольких аргументов). Это обстоятельство дает возможность использовать ряды и уравнения регрессии при определении значений таких признаков, непосредственное измерение ко­торых в обычных условиях или невозможно, или затруднительно.
В практических работах использование уравнений и линий регрессии получило широкое распространение при определении без взвешивания, путем измерения, нормального живого веса животных и их убойного веса при жиз­ни, веса сена в стогах, веса овощей в овощехранилищах, веса силосной мас­сы в силосах, веса древесины в стволах и штабелях и пр.
Контрольные вопросы:
1. Кем был введен термин «регрессия»?
2. Для какой цели служит коэффициент регрессии?
3. Какие обозначения применяются для регрессии?
4. Как определяется коэффициент регрессии и его ошибка?
Контрольное задание: рассчитать изученные показатели регрессионно-
го анализа (коэффициент регрессии, ошибку, критерий достоверности).
123
123
КентбаеваБ.А.«Методологиянаучныхисследований»
Раздел Х ДИСПЕРСИОННЫЙ АНАЛИЗ
§ 1 Решение дисперсионных комплексов
Глубокое и ценное понятие о наследуемости без знания основ дисперси­онного анализа обычно воспринимается с большим трудом, далеко не всегда правильно, что часто приводит к ошибочным выводам и не подтверждающимся прогнозам как в теории, так и на практике. Новейшие вопросы биологической теории - теория популяций, математическое моделирование биологических процессов - не могли бы даже, и возникнуть без разработки специальных математических методов (Н.А.Плохинский).
Дисперсионный анализ разработан англичанином Р.Фишером в 1925 году, со временем он стал наиболее распространенным методом обработки статистических данных в самых различных областях науки и техники и, особенно в биологии и сельском хозяйстве. Этот метод основан на разложе­нии общей дисперсии статистического комплекса на составляющие компо­ненты (отсюда и название метода - dispersion (лат.) - рассеивание), сравнивая которые, друг с другом посредством F-критерия, можно определить долю общей вариации изучаемого признака, обусловленную действием на него как регулируемых, так и нерегулируемых в опыте факторов.
При дисперсионном анализе одновременно обрабатываются данные не­скольких выборок (вариантов), составляющих единый статистический ком­плекс, оформленный в виде специальной рабочей таблицы.
В каких случаях применяется дисперсионный анализ?
Прежде всего, он необходим при координации уровней статистическо-
го анализа. Обычно биолог работает с двумя и более уровнями, например, число семян в чашке Петри у семеновода и число самих чашек, число де­лянок на пробной площади у геоботаника и число самих пробных площа­дей, число замеров признака на одном растении у физиолога и число са­мих растений. Эти показатели должны быть координированы так, чтобы, во-первых, не делать лишней работы, а во-вторых, получить достаточную достоверность результатов. Ясно, что если изменчивость между растениями у физиолога велика, а на одном растении мала, то можно уменьшить по ­вторности на одном растении, но увеличить число растений в опыте. Получить информацию об изменчивости внутри объекта и между объек­тами и правильно построить выборки помогает дисперсионный анализ.
Дисперсионный анализ при обработке результатов эксперимента дает больше информации, чем метод сравнения средних, за счет отношения дис­персий и оценки степени влияния фактора. При двухфакторном анализе до­бавляется информация о взаимодействии двух факторов.
Дисперсионный анализ целесообразнее применять и в том случае, когда исследователя не интересует конкретная средняя величина признака в данном месте и в данное время, а он хочет получить общие принципи-
124
124
КентбаеваБ.А.«Методологиянаучныхисследований»
2
1раn
-
альные выводы. Например, испытывая новый синтезированный стимуля­тор, исследователь может задаться двумя различными вопросами:
1. Каковы средние урожаи обработанной и не обработанной стимуля-
тором делянок в данном году, на данной почве, при данном сроке посева и режиме полива?
2. Действует ли данный стимулятор на растение или нет?
Чтобы ответить на первый вопрос, исследователь должен иметь доста­точно много повторностей для получения достоверных средних величин. Для ответа на второй вопрос он может провести дисперсионный анализ с очень небольшим количеством повторностей, чем сэкономит силы и средства. Ценность же информации, полученной в первом случае, весьма невелика, так как ясно, что в другом году, на другой почве и при другом сроке посе­ва действие стимулятора будет совершенно иным.
Дисперсионный анализ в подавляющем большинстве случаев предпо­чтительнее традиционного метода сравнения средних величин.
Дисперсионным он назван потому, что имеет дело с анализом диспер­сии, которая представляет собой среднее квадратическое отклонение (d), возведенное в квадрат. Дисперсия обозначается символом d
2
и получается при расчетах делением суммы квадратов отклонений от средней величины на число степеней свободы, т.е. число возможных независимых сравнений объектов:
s
(54)
S
2
=
где d 2 – дисперсия, средний квадрат , средний квадрат отклонений, ва-
рианса;
S
ра2 – сумма произведений алгебраических сумм частот на условное
отклонение во второй степени;
n - число измерений, наблюдений, количество вариант, дата.
Иногда дисперсию называют средним квадратом или вариансой. Оче- видно, дисперсия более чувствительный показатель, чем среднее квадрати­ческое отклонение, так как малейшие сдвиги в последнем возводятся при расчете дисперсии в квадрат.
Если рассчитать дисперсию для какого-либо вариационного ряда, то мы не получим никакой дополнительной информации к той, которая уже дана нам средним квадратическим отклонением. Для проведения диспер­сионного анализа необходимо осуществление принципа суммирования
дисперсий.
Дисперсионный анализ бывает однофакторным и многофакторным.
Наиболее простой из них однофакторный, т.е. на возможные различия будет влиять один фактор. Например, черенки высаживаются на различный суб-
125
125
КентбаеваБ.А.«Методологиянаучныхисследований»
страт (песок, торф и т.д.). В данном случае будем считать, что черенки яв­ляются абсолютно одинаковыми, срезанные с одного растения, в одно вре­мя, с равномерно развитых побегов, одинаковых размеров по длине и диа­метру, то на уровень их развития будет влиять только различие субстрата. В примере мы можем видеть принцип единственности различий столь не- обходимый для правильной постановки и проведения экспериментов любо­го типа, т.е. в опыте различия представлены в виде контролируемого факто­ра.
Допустим, что генетически идентичные растения (клон, чистая линия) выращиваются на идеально однородном участке (рисунок 9, а). В этом случае (который может быть представлен только теоретически) дисперсия равна нулю.
а)
б)
d
2
=0
d
е
2
126
126
КентбаеваБ.А.«Методологиянаучныхисследований»
2
g
d
2
ph
d
2
e
d
2
g
d
2 22
ph ge
d dd
=+
2
g
d
222
g phe
ddd
=-
2
g
d
2
в)
d
2
+
d
е
g
Рисунок 9 - Принцип суммирования дисперсий
Теперь рассмотрим случай, когда клон или чистая линия выращива­ются в пестрых экологических условиях (рисунок 9, б). В этом случае бу­дет наблюдаться дисперсия изучаемого признака, вызванная экологической пестротой участка. Она называется экологической или средовой дисперси­ей и обозначается d
е
(е - первая буква английского слова environment -
среда).
Наконец, рассмотрим третий случай, когда генетически разные расте-
ния (популяция) выращиваются на пестром экологическом (рисунок 9, в). При этом произойдет следующее. Генетически лучшие растения, попав­шие в лучшие условия, увеличат общую амплитуду изменчивости в одну сторону. Генетически худшие, попавшие в худшие условия, увеличат ам­плитуду в другую сторону. Общая дисперсия увеличится на величину, вы­званную генетическими различиями растений, т.е. на
. Таким образом,
наблюдаемая общая изменчивость -
жется состоящей из двух компонент: экологической дисперсии ( тической (
). Это можно записать так:
(фенотипическая дисперсия) ока-
) и гене-
(55)
В задачу дисперсионного анализа как раз и входит количественное
нахождение компонент общей дисперсии, которую мы можем непосред­ственно наблюдать в природе или опыте. Так, в нашем примере можно определить
следующим образом: вырастить на одном участке изучае-
мую популяцию и клон, взятый из этой популяции. Затем от общей дис­персии в популяции отнять экологическую дисперсию клона:
(56)
Знание
позволяет судить о генетической пестроте популяции и
помогает прогнозировать успешность отбора из данной популяции.
Мы рассмотрели пример суммирования экологической и генетической
дисперсий. Однако могут быть другие самые разнообразные компоненты общей дисперсии.
127
127
КентбаеваБ.А.«Методологиянаучныхисследований»
§ 2 Техника проведения дисперсионного анализа (по Драгавцеву В.В.)
Например, четыре образца семян сосны обыкновенной, интродуциро­ванных в новую местность из разных географических районов, испытали на лабораторную всхожесть. Каждый образец испытывали в семи повтор­ностях на аппарате проращивания. Полученные данные по всхожести приведены в таблице 41.
При рассмотрении этой таблицы видно, что дисперсия имеется как внутри столбцов, так и между столбцами, т.е. по вертикали и по горизон­тали (по горизонтали варьируют средние величины столбцов). Столбцы в таблице называются классами.
Минимальное число классов при дисперсионном анализе - 2, мини­мальное число повторностей - 2.
Дисперсия между классами называется факторной или факториаль- ной (в нашем примере фактором, вызывающим ее, являются образцы се- мян). Дисперсия внутри классов называется случайной, так как мы не знаем, чем конкретно она вызвана (здесь и различия в механическом и химическом составе почвы делянок, различия в аэрации, водном режиме и т.п.).
Задачей дисперсионного анализа является определение, какая диспер­сия выше - факториальная или случайная. Если выше факториальная дис­персия, значит факторы (образцы семян) достоверно различаются между собой по всхожести и являются экотипами разных географических зон. Ес­ли выше случайная дисперсия, значит, достоверных различий по всхожести нет, и наши образцы можно рассматривать как выборку из одной однород­ной совокупности (в данном случае вида). Таким образом, в данном приме­ре общая дисперсия разлагается на две части - факториальную и случай­ную. А поскольку изучается действие только одного фактора (образцов се­мян), то дисперсионный анализ называется однофакторным.
Таблица 41 - Испытание на урожайность сосны обыкновенной, интроду­цированную в новую местность из разных географических районов
Образцы се-
мян
Повторности, делянки
1 72 74 78 69 2 69 72 74 67 3 63 70 70 66 4 59 69 58 64
х у z
1 2 3 4
128
128
l
КентбаеваБ.А.«Методологиянаучныхисследований»
S
S
S
S
N
S+S+S+S
777728
= + + + =+++=
63.5%
4
+++
2222
()()()()
Q nMMnMMnMMnMM
32
1 41
r
===
5 59 66 58 62 6 53 58 56 58 7 51 52 56 54
S
Средние клас-
сов, M, %
426 461 450 440
Mx = 60.9 My = 65.9 Mz = 64.3
Ml = 62.9
Рассмотрим технику проведения дисперсионного анализа:
1. Обозначим классы буквами: х, у, z, l;
2. Определим средние значения в каждом классе обычным путем, т.е. суммируем все варианты в классе и делим сумму на число вариант:
v
y
=
y
n
y
9.65=
;
M
v
z
=
z
n
z
M
3.64=
;
v
l
=
l
n
l
9.62=
M
v
x
=
х
n
x
9.60=
;
M
3. Общее среднее по всей таблице определяется по формуле:
M
=
zyx
l
(57)
vvvv
где N определяется по формуле:
Nnnnn
xyz
l
60.9 65.9 64.3 62.9
M
==
(58)
4. Определим сумму квадратов отклонений от общего среднего между классами (Q
м.к.
):
Q
= -+ -+ -+ -
..
мкxxyyzz
= 7(60.9-63.5)2 +7(65.9-63.5)2 +7(64.9-63.5)2 +7(62.9-63.5)2 = 94.64=95
м.к.
ll
5. Найдем дисперсию (среднеквадратическое отклонение) ( классами, r - число классов.
d
2
мк
..
Q
мк
--
..
95
6. Найдем сумму квадратов отклонений от средних внутри классов (Q
):
в.к.
129
129
2
d
..км
(59)
) между
(60)
КентбаеваБ.А.«Методологиянаучныхисследований»
2222
( )( )( )( )
éù
ëû
60
284
Nr
===
95 1446 1541
=+=+=
57
1 281
N
===
QхМуМzММ
Итак, Q
=S-+-+-+-
..
вк х уя
=S[(72-60.9)
в.к.
2
+ [(69-60.9)2 + … (51-60.9)2] +
l
l
[(74-65.9)2 + (72-65.9)2 + … (52-65.9)2 +
[(78-64.3)2 + (74-64.3)2 + … (56-64.3)2 +
[(69-62.9)2 + (69-62.9)2 + … (69-62.9)2] = 1446
2
7. Найдем дисперсию внутри классов (
d
2
вк
..
Q
..
вк
--
1446
d
):
..кв
8. Теперь найдем общую сумму квадратов (Q):
QQQ
.. ..
мк вк
(63)
(61)
(62)
9. И, наконец, вычислим общую дисперсию (
2
d
d
2) по формуле:
Q
1541
--
(64)
10. Теперь сводные данные представим в виде таблицы 42.
Таблица 42 - Сводные данные
Изменчивость
Между классами Q
Внутри классов Q
Сумма
квадратов
= 95 f1 = r - 1 = 3
м.к.
= 1446 f2 = N - r = 24
в.к.
степеней свободы
По всем наблюдениям Q = 1541 f = N - 1 = 27
Число
Оценка
дисперсии
2
d
= 32
..км
2
d
= 60
..кв
2
= 57
d
Показатель силы влияния (критерий Фишера) равен отношению
факториальной дисперсии к общей. Он определяет ту долю общей диспер­сии, которая приходится на факториальную дисперсию или долю влияния изучаемого фактора в общей сумме влияния всех вообще факторов, опреде­ляющих величину и разнообразие результативного признака.
130
130