Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Оптимизирующие преобразования программ. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
849 Кб
Скачать

командным словом, грид3.3. Ви ,ы распараллелсистолическиевания программ, реконфигурируемые и др. Но параллельные программы на языках высокого уровня разрабатываются, в основном, на SIMD и MIMD.

3.3. Виды распараллеливания программ

Можно выделить следующие виды параллельных вычислений:

• Параллельное выполнение задач.

• Параллельное выполнение функций.

• Параллельное выполнение блоков.

• Параллельное выполнение циклов.

• Параллельное выполнение операций.

• Параллельное выполнение микрокоманд.

Понятие «параллельное выполнение» формально не определяется. Обычно под словом «параллельно» понимается «одновременно».

Можно говорить об абстрактных параллельных алгоритмах, т. е. алгоритмах, не ориентированных на выполнение на какой-то конкретной параллельной вычислительной системе. Для каждой конкретной (параллельной) вычислительной системы нужно иметь преобразования (алгоритмы преобразования, транслятор) на эту систему абстрактных алгоритмов.

В качестве абстрактного алгоритма может рассматриваться последовательная программа с графами зависимостей: управляющий граф программы и граф информационных связей. Тогда для конкретной параллельной вычислительной системы нужен распараллеливающий компилятор, отображающий эту программу на вычислительную систему.

В данной работе рассматривается только параллельное выполнение циклов. Параллельное выполнение цикла – это «одновременное» выполнение его итераций.

Если более формально, то распараллеливанием цикла называется замена цикла

101

3. Распараллеливание

For ( I=L; I<N; I=I+h){

цикломТЕЛОЦИКЛА(I) }

ParFor ( I=L; I<N; I=I+h){

ОператорТЕЛОЦИКЛАпараллельного(I) } цикла ParFor для архитектуры MIMD и для архитектуры SIMD действуют по-разному.

Распараллеливание, как преобразование, состоящее в замене заголовка последовательного цикла заголовком параллельного, тривиально. Вопрос в том, когда такое преобразование эквивалентно, и в том, чтобы вспомогательными преобразованиями привести цикл к виду, в котором распараллеливание является эквивалентным преобразованием.

3.4. Распараллеливание циклов на архитектуру SIMD

МодельДля всехраспараллеливаниязначений счётчика цикла сначалаархитектурувыполняетсяSIMDпервая операция (над разными данными), затем вторая и т. д.

Для обработки многих данных используется один поток команд. Это сокращает не только память команд, но и время выполнения, поскольку движение команд по вычислительной системе отнимает время. Ветвления внутри цикла препятствуют распараллеливанию. Все итерации цикла завершают выполнение одновременно. Более точно – пока для всех значений счётчика цикла выполнение операции не завершилось, выполнение новой операции не начинается.

ИнформационныеВ распараллеливаемомзавис мости прициклераспараллеливаниине должно быть дуг потоковыхцикла на SIMD, анти. - и выходных зависимостей, которые на графе информационных связей направлены снизу вверх: от вхождений, которые по тексту ниже, но раньше обращаются к общей ячейке

102

памяти, к вхождениям3.4. Распараллеливание, которыецикловпо текстуна архитектурувышеSIMD, но позже обращаются к этой же ячейке памяти. Такие недопустимые зависимости могут быть только циклически порождёнными.

Если цикл допускает распараллеливание на SIMDУтверждение-архитектуру,.то такой цикл может быть разбит на циклы, в каждом из которых по одному оператору присваивания.

Можно допустить другой цикл в теле распараллеливаемого цикла, если во внутреннем цикле только операторы присваивания. В этом случае предполагается, что перед параллельным выполнением внешнего цикла выполняется раскрутка внутреннего цикла.

В данном гнезде циклов все дуги зависимости направленыПримерот 104вхождений. , которые встречаются раньше, к вхождениям, которые встречаются в программе позже. Поэтому данное гнездо циклов допускает параллельное выполнение на архитектуре SIMD.

For (k = 1; k < N; k++){

X[k] = C[k]+B[k];

For (j = 1; j < M; j++){

A(J) = A(J) + D(k,J)*X(k);

Конец} } примера.

При распределённой памяти компьютеров типа SIMD возникает задача размещения данных с минимизацией межпроцессорных пересылок. При этом циклически порождённые зависимости (направленные сверху вниз) могут потребовать пересылку данных, которая должна быть сделана во время выполнения цикла. Входная циклически порождённая зависимость требует пересылки данных, которая должна быть сделана до выполнения цикла.

Предположим, что в вычислительной системе имеетсяПримерP процессорных105. элементов, и пусть все массивы размещены так, что I-й элемент массива находится в модуле памяти с номером (I mod P).

103

3. Распараллеливание

For(I = 1; I<N; I++) {

X[I] = A[I]+B[I];

A[I] = C[I-1]+X[I];

A[I-1] = X[I-1]*B[I+3];

В} приведённом цикле входная зависимость между вхождениями переменной B предполагает пересылку до выполнения цикла; истинная зависимость (X(I), X(I-1)) требует выполнения пересылки после первого оператора перед третьим. Антизависимости и выходная зависимость не влияют на параллельное выполнение – новые элементы массивов окажутся сдвинутыми относительно старых элементов.

Конец примера.

Вычислительные системы SIMD с общей памятью удобны для операций с векторами: сумма векторов, умножение вектора на число и др. Такие вычислительные системы иногда называют векторными. Например, SIMD-ускоритель процессоров Intel называют векторизатором, векторные операции делает устройство mali в процессорах ARM. Графические ускорители NVidia тоже предназначены для операций над векторами.

Последовательные циклы, допускающие замену на векторную команду, называются векторизуемыми, а сама такая замена – векторизацией. Векторизуются циклы, которые содержат только операторы присваивания.

Следующий цикл имеет рекуррентную зависимость и поэтомуПример 106не векторизуется. .

For (I = 1; I<N; I++) {

X[I] = A[I]*X[I-1]+B[I];

Конец} примера.

Приведённый пример показывает, что не всякий цикл, в теле которого только операторы присваивания, который можно раз-

104

бить на циклы, в каждом3.4. Распараллеливаниеиз которыхциклов на архитектурутолькоSIMDодин оператор присваивания, может быть векторизован.

Рассмотрим вопрос о том, как согласуется приведённый пример с условием SIMD-распараллеливания по информационным зависимостям. В этом примере присутствует скрытая дуга графа информационных связей, ведущая снизу вверх. Такой является дуга истинной информационной зависимости от вхождения X[I] к вхождению X[I-1]. При переводе этого кода в ассемблер ассемблерные операции будут выполняться с некоторым регистром R:

R = X[I-1];

МожетX[I] =случитьсяR , что цикл непосредственно не векторизуется, а после некоторых вспомогательных преобразований станет векторизуемым. Это, как правило, те же вспомогательные преобразования, которые используются при разрезании цикла. Рассмотрим такие примеры.

Следующий цикл имеет дуги зависимости, направленныеПримерснизу107. вверх, и поэтому не векторизуется. Но после перестановки операторов местами цикл становится векторизуемым.

For (I = 1; I<N; I++) {

X[I] = A[I]*Y[I-1]+B[I];

Y[I] = D[I]/X[I+1]

Конец} примера.

Следующий цикл содержит вхождения переменной X, котораяПримерне108зависит. от счётчика цикла. Эти два вхождения связаны двумя дугами, направленными в противоположные стороны.

For ( I = 1; I < N; I++){

X = A[I]*Y[I]+B[I];

Y[I] = D[I]/X ;

Преобразование} «растягивание скаляров» может удалить одну из этих дуг (антизависимость), после чего цикл станет векторизуемым.

105

3. Распараллеливание

For ( I = 1; I < N; I++){

XX[I] = A[I]*Y[I]+B[I]

Y[I] = D[I]/XX[I]

}

КонецXпримера= XX[N];.

Следующий цикл имеет две дуги антизависимости, однаПримериз которых109. направлена снизу вверх, а другая, наоборот, сверху вниз. По этой причине цикл не векторизуется, и перестановка операторов местами не приводит к векторизуемости.

For ( I = 1; I < N; I++){

X[I] = A[I]*Y[I+1]+B[I];

Y[I] = D[I]/X[I+1];

Введение} временного массива приводит данный цикл к векторизуемому виду.

For ( I = 1; I < N; I++){

TEMP[I] = X[I+1];

X[I] = A[I]*Y[I+1]+B[I];

Y[I] = D[I]/TEMP[I];

Конец} примера.

ВкомпьютерахНекоторыетипаособеннSIMD можности выполнятьSIMD-вычисленийнекоторые циклы

сусловными операторами. Вычислительные устройства (ядра) такого компьютера должны иметь возможность отключаться. Логическое выражение таких условных операторов может зависеть от счётчика цикла. Все устройства, в которых логическое условие ложно, сначала отключаются – и выполняются ветки условного оператора, в которых логическое условие истинно: все не отключённые процессоры в один момент времени выполняют одну и ту же операцию. Затем, наоборот, выполняются ветки условного оператора, в которых условие ложно.

106

В SIMD-ускорителях3.5. Распарал еливаниесовременныхконкатенации блоков напроцессорова хитектуру MIMD (Intel, AMD, ARM) необходимо, чтобы все координаты обрабатываемых векторов были в памяти рядом. Более строго – эти SIMD-ускорители обрабатывают 128-битные данные. Такие данные, в зависимости от контекста, могут представлять собой либо векторы из двух координат по 64 бит, либо из 4 координат по 32 бит, либо из 8 координат по 16 бит.

3.5. Распараллеливание конкатенации блоков

на архитектуру MIMD

Рассмотрим задачу распараллеливания фрагмента программы, представляющего собой конкатенацию блоков.

Каждый блок может рассматриваться как самостоятельный процесс, который выполняется на некотором устройстве.

Между блоками возможны информационные зависимости. Если между двумя блоками есть дуга одной из трёх зависимостей (истинная, выходная или антизависимость), то второй блок (соответствует концу дуги графа информационных связей) может выполняться только после завершения выполнения первого блока (соответствует началу дуги графа информационных связей).

По графу информационных связей можно построить фак- тор-граф, склеив вершины каждого блока. Вершины этого фак- тор-графа можно разбить на слои. Тогда блоки, соответствующие вершине одного и того же слоя, можно выполнять параллельно.

Рассмотрим препятствия, которые могут возникнуть при преобразовании блоков в параллельные процессы.

Распараллеливание блоков является более общим преобразованием по отношению к распараллеливанию циклов. Действительно, при распараллеливании циклов параллельно выполняются итерации циклов. Но итерации циклов можно рассматривать как блоки.

При распараллеливании блоков возникает задача выделения в программе тех блоков, которые могли бы выполняться параллель-

107

но. Для повышения параллельности3. Распараллел ваниеможно рассматривать задачу разбиения больших программных блоков на более мелкие блоки. С другой стороны, чтобы не тратить время на частые инициализации параллельных процессов, можно некоторые мелкие блоки склеивать в более крупные. Чтобы параллельно работающие процессоры были равномерно загружены, можно решать задачу загру-

зочного баланса (load balancing).

Для преобразования в процесс блок должен иметь один вход. Чтобы два блока могли параллельно выполняться, они должны быть независимы по управлению. Например, один блок не может быть вложен в другой, не должно быть перехода (условного или безусловного) из одного блока в другой. Для того чтобы два блока могли выполняться параллельно, необходимо, чтобы в программе они были связаны по управлению конкатенацией.

3.6. Распараллеливание циклов на архитектуру MIMD

Модель распараллеливания цикла

Для каждого значенияархитектурусчётчика циклаMIMDтело цикла представляет собой самостоятельный процесс, и все такие процессы выполняются независимо друг от друга. Каждое устройство архитектуры MIMD должно быть способным выполнять самостоятельную программу, т. е. является универсальным процессором (процессорным ядром). Ветвления внутри цикла не препятствуют распараллеливанию, но итерации цикла могут завершать выполнение в разное время – это необходимо учитывать при запуске фрагмента программы, следующей после данного цикла.

Задача распараллеливания на архитектуру MIMD (асинхронного распараллеливания) циклов сводится к задаче асинхронного распараллеливания блоков. Действительно, заменим

108

цикл его раскруткой3.6. Распар. Каждуюллеливаниеитерациюциклов на архитектуруисходногоMIMD цикла будем рассматривать как фрагмент (блок) программы, полученной в результате раскрутки. Итерации исходного цикла можно выполнять параллельно тогда и только тогда, когда параллельно могут выполняться соответствующие блоки результирующей программы.

При переходе от цикла к его раскрутке циклически независимые зависимости останутся внутри блоков, соответствующих итерациям исходного цикла, а циклически порождённые зависимости превратятся в зависимости между блоками.

Асинхронная архитектура (многоядерные процессоры, кластеры, мультитранспьютерные системы) позволяет распараллеливать циклы любой глубины вложенности. Эти циклы могут содержать условные операторы. Но в этих циклах допускаются только циклически независимые зависимости.

Всякое удаление циклически порождённых зависимостей либо приводит цикл к виду, допускающему параллельное выполнение, либо уменьшает количество необходимых синхронизаций при параллельном выполнении итераций.

В данном примере имеются циклически порождённыеПримерзависимости110. относительно внешнего цикла.

for(i=1; i <= N; ++i) for(j=1; j <= M; ++j)

{

a[j] = b[i,j]*c[i,j]

x[i,j] = a[j]*d[i,j];

Повышение} размерности массивов удаляет циклически порождённые зависимости и приводит внешний цикл к параллельно выполняемому виду.

for(i=1; i <= N; ++i) for(j=1; j <= M; ++j)

{

aa[i,j] = b[i,j]*c[i,j]

109

3. Распараллеливание

x[i,j] = aa[i,j]*d[i,j];

}

for(j=1; j <= M; ++j)

{

a[j] = aa[N,j];

Конец} примера.

Следует отметить, что повышение размерности массивов приводит к дополнительному расходу памяти. Эти расходы может сэкономить предварительно проведённое гнездование цикла.

Предположим, что вычислительная архитектура имеетПримерp асинхронно111. работающих вычислительных устройств, и пусть N = p*R. Рассмотрим фрагмент кода из предыдущего примера:

for(i=1; i <= N; ++i) for(j=1; j <= M; ++j)

{

a[j] = a[j]+b[i,j]*c[i,j]

x[i,j] = a[j]*d[i,j];

Выполнив} гнездование внешнего цикла, получим следующий фрагмент:

for(k=1; k <= p; ++k) for(l=1; l <= R; ++l) for(j=1; j <= M; ++j)

{

i = (k-1)*R+l

a[j] = a[j]+b[i,j]*c[i,j]

x[i,j] = a[j]*d[i,j];

Теперь} к внешнему циклу можно применить повышение размерности массивов:

for(k=1; k <= p; ++k) for(l=1; l <= R; ++l)

110

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]