ЖУРНАЛ СТА 4/2013

8 СТА 4/2013 ОБ ЗОР / Т Е Х НОЛОГ ИИ www.cta.ru стояние системы, сверяя информацию от датчиков с данными SDR (Sensor Da- ta Record), находящимися в его ПЗУ. При возникновении неполадки на од- ном сервере его функции берёт на себя второй. Всё это происходит автоматиче- ски и не требует участия оператора. BMC имеет свой сетевой контроллер, что позволяет управлять сервером без загрузки операционной системы. Пред- усмотрены удалённое управление через Web-консоль с использованием обычно- го браузера и поддержка оповещений по электронной почте и протоколу SNMP. Отличительной особенностью этого решения является не просто автомати- ческое восстановление системы после сбоя, а предотвращение сбоев, реали- зуемое проактивным мониторингом. Традиционные решения по обеспече- нию высокой доступности контроли- руют компоненты системы только на наличие обратной связи, и неисправ- ность распознаётся только в том случае, когда они выходят из строя. Взаимодей- ствуя с интегрированным контролле- ром управления сервера BMC, специ- альное программное обеспечение вы- являет потенциальные неполадки и пе- реносит приложения и данные на непо- вреждённый сервер. Всё это происходит совершенно незаметно для пользовате- лей. На рис. 3 показан скриншот кон- соли управления физическими маши- нами во время обнаружения сбоя на одном из серверов (node 1): отказ вен- тилятора (System Fan 3) и процесса пе- реноса приложения (миграции вирту- альных машин – VM) на второй сер- вер (node 0). На рис. 4 более подроб- но изображён процесс миграции вирту- альных машин. Виртуальные машины перемещаются поочерёдно. Одна ма- шина находится в процессе переноса (MyVM_2), а вторая (MyVM) пока ра- ботает на узле, на котором обнаружен отказ. Мониторинг производится более чем по 150 параметрам сервера, таким как напряжение питания и температура компонентов, скорость вращения вен- тиляторов, ошибки чтения/записи па- мяти и дисковой подсистемы и многим другим. Распознаются даже минималь- ные отклонения от заданных значений, и происходит быстрое реагирование на них. Наряду с мониторингом всех теку- щих процессов ведётся база данных про- шлых событий и ошибок. Можно отсле- дить любые произошедшие изменения и проанализировать их. Непрерывный контроль выполняемых приложений и аппаратного обеспечения позволяет вы- явить назревающие проблемы прежде, чем они приведут к сбою (табл. 2). Для обеспечения защиты от серьёз- ных внешних воздействий, таких как пожар, вандализм и т.д., предусмотрена возможность раздельной установки сер- веров – Split Site. Два рабочих сервера Условные обозначения: BMC (Baseboard Management Controller) – интегрированный контроллер управления; NIC (Network Interface Controller) – сетевой контроллер; Mgmt NIC – сетевой контроллер модуля управления; SDR (Sensor Data Record) – запись о параметрах и состоянии датчика (сенсора); FRU (Field Replaceable Unit) – сменный элемент/модуль. Рис. 2. Функциональная схема решения Рис. 3. Скриншот консоли управления во время обнаружения сбоя на одном из серверов Рис. 4. Перенос приложений

RkJQdWJsaXNoZXIy MTQ4NjUy