СОВРЕМЕННАЯ ЭЛЕКТРОНИКА 2011-1

Известно, что системы связи харак теризуются пропускной способностью и качеством принимаемых сигналов. При возрастающих требованиях к пропускной способности каналов и всё более плотном заполнении эфира важно эффективно задействовать час тотно временной ресурс. Например, системы связи с TDMA и CDMA 20 лет назад применялись весьма ограничен но, сейчас это массовый рынок обору дования с множеством сервисов и при ложений. Системыподвижной связи, такие как сотовые сети, изначально были пред назначеныдля передачи голоса, но бы ли приспособлены для передачи боль ших объёмов информации. Сотовые сети и Интернет охватывают сотни миллионов пользователейпо всемуми ру. Возможно, в будущеммыувидимно вое поколение сетей связи, а Интернет ПРОЕКТИРОВАНИЕ И МОДЕЛИРОВАНИЕ 50 WWW.SOEL.RU СОВРЕМЕННАЯ ЭЛЕКТРОНИКА ◆ № 1 2011 Построение эффективного тракта обработки сигналов с использованием технологии CUDA Александр Тумачек, Андрей Ермаков (Москва) В статье приводится сравнение алгоритмов ЦОС на платформах ADSP TS201s и Nvidia GT240. Отмечено преимущество технологии CUDA при большой размерности матриц. преобразуется в симбиоз гибридных разноуровневых систем. Соединение связных сетей – от микро до макро ячеек, от частной телефонной сети до Интернета, от низкоорбитальных спут никовых комплексов – до геостаци онарных платформ – станет реально стью. Инфраструктурныепроектытако го масштаба возможно организовать толькоприснятиисуществующихогра ничений, увеличивая мощность и эф фективность связногооборудования [1]. С появлением высокоскоростных и широкополосных систем аналого цифрового преобразования возникает задача анализа и обработки массивов информации, полученной из эфира в реальноммасштабе времени. С расши рением полосы приёма возрастает на грузка на тракт обработки сигналов и, следовательно, на подсистемы, реали зующие их обработку, в том числе на демодулятор, где происходит получе ние оценок сигнала и восстановление энергии. Демодулятор является кри тичным к производительности вычис лительной платформы. Для получения оценок сигналаможет применяться многоканальный прост ранственно временнойфильтр с опти мальными коэффициентами, получен ными решением уравнения Винера Хопфа [2]. Основная математичес кая нагрузка при получении оценок ложится на узел расчёта оптимального вектора весовых коэффициентов (ВВК) на каждом шаге. Помимо этого, выполняется анализ спектра выбороч ной корреляционной матрицы сигна ла путём расчёта QR разложения и на копления собственных векторов и собственных значений. Для расчёта ВВК применяется реше ние системы линейных алгебраичес ких уравнений (СЛАУ) для квадратной выборочной корреляционной матри цы сигналов и шумов (ВКМ) размер ностью (N × Ntrackt) × (N × Ntrackt), где N × Ntrackt– длина линии задержки ли нейного корректора, умноженная на число трактов системы. Решение ос новано на процедуре LU разложения и вычислении коэффициентов из ли нейных уравнений для треугольных матриц. Для получения СЛАУ использу ются операции перемножения вектора на матрицу, внешнее и внутреннее произведение векторов, вычитание и сложение матриц. При обработке широкополосных сигналов большая часть времени уходит на выполнение этих действий. Для повышения скорости вычисле ний авторами были использованымас сивно паралельные процессорыи тех нология CUDA (Computer Unify Design Architecture) [3]. Для тестирования и проверки тракта обработки демодуля тора использовалось окружение Mat Lab 2010b с поддержкой GPU. Для рас чёта LU разложения и решения СЛАУ применялась следующая процедура: % code analog [L,U] = lu(RxxSum); % LU inplementation on CUDA dRxxSum = GPUArray(RxxSum); %set GPU Matri(NxNtrackt)x(NxN trackt) %dRxxSum on device [dL,dU,dpiv] = lu(dRxxSum,'vec tor'); L = gather(dL); U = gather(dU); y = L\f; Wopt = U\y; Итоговая реализация алгоритмов ре шения СЛАУ и вычисления QR разло жения была выполнена в виде динами ческих библиотек на C++ с использова нием CUDA и ADSP TS201s. Представим некоторые результаты сравнения производительностиGPU и ADSP TS201s. На рисунке 1 показан гра фик времени вычисления QR разложе ния для GPU. В таблице 1 приведены значения времени вычисленияQR раз ложения для ключевых размерностей на платформах ЦОС ADSP и GPU. Можно заметить, что система с GPU показывает наибольшую эффектив ность при размерности задачи больше числа вычислительных ядер; в наших экспериментах это 128. В сравнении с Размерность матрицы, N Время вычисления, с 0 16 × 16 32 × 32 64 × 64 80 × 80 100 × 100 128 × 128 140 × 140 160 × 160 180 × 180 256 × 256 542 × 542 1024 × 1024 2048 × 2048 0,05 0,1 0,15 0,2 0,25 0,3 Рис. 1. QR!разложение выборочных корреляционных матриц сигнала 0 5 × 5 8 × 8 10 × 10 12 × 12 16 × 16 32 × 32 64 × 64 Размерность матрицы, N Время вычисления, с 0,0005 0,001 0,0015 0,002 0,0025 ADSP CUDA Рис. 2. QR!разложение выборочных корреляционных матриц сигнала на платформе CUDA и ADSP TS!201s © СТА-ПРЕСС

RkJQdWJsaXNoZXIy MTQ4NjUy