Способи розподілу таблиці даних на навчаючу та перевірочну послідовності даних
Розподіл таблиці даних здійснюється дослідником з урахуванням особливостей задачі, що розв’язується. Розподіл характеризується кількістю точок навчальної та перевірочної послідовності даних та способом, за яким приймається рішення про приналежність точки до навчальної чи перевірочної послідовності даних.
Кількість точок даних навчальної та перевірочної послідовності даних визначається такою, що забезпечує найбільшу завадостійкість алгоритму. З усіх можливих розподілів при рівному співвідношенні кількості даних у частинах А і В оптимальним вважається той, що забезпечує найбільше значення мінімуму зовнішнього критерію (принцип мінімакса).
Спосіб розподілу повинен відповідати декільком вимогам:
дані навчальної та перевірочної послідовності даних повинні покривати усю область даних;
дані кожної послідовності даних повинні бути лінійно незалежними;
якщо відома точність табличних даних, то більш точні дані відбирають до перевірочної послідовності даних (частини В), а менш точні дані – до навчальної послідовності даних (частини А).
Всі способи можна поділити на детерміновані та стохастичні. Детермінований спосіб означає, що точки вибираються за деяким правилом. Наприклад, кожна друга точка послідовності даних відноситься до навчальної послідовності, а всі інші – до перевірочної послідовності.
Випадковий (стохастичний) вибір точок даних використовують, щоб перевірити стійкість обраної моделі оптимальної складності по відношенню до вибору точок даних.
Дослідження впливу розподілу даних на значення зовнішнього критерію показали, що розподіл таблиці даних сильно впливає на значення критерію регулярності і не сильно впливає на значення критерію мінімуму зсуву.
Узагальнена схема алгоритму представлена на рисунку 9.6. Реалізація алгоритму засобами програмного забезпечення Mathcad 2000 Professional представлена на рисунках 9.7– 9.13.
Розподіл таблиці даних здійснюється програмою випадковим чином
узаданому співвідношенні NA/NB=2. Оскільки на значення критерію мінімуму зсуву розподіл таблиці даних не впливає, а на значення критерію регулярності – впливає, то розподіл таблиці даних обирається так, щоб отримати найточніше значення критерію регулярності. Коефіцієнт екстраполяції вибраний у розмірі 2 у відповідності до рекомендацій, що значення екстраполяції належить інтервалу (1; 3).