ЖУРНАЛ СТА 3/2019

в битах, что, в принципе, даёт примерно одинаковые значе- ния при расчётах. Значение URE весьма мало и приводится для одной ошиб- ки, то есть N error = 1. Исходя из этого, получаем выражение для объёма считы- ваемых данных, при котором произойдёт ошибка чтения: Типичные значения URE и объём считываемых данных, для которых вероятность возникновения ошибки чтения равна 1, приведены в табл. 1. Как видно, значение параметра URE , то есть вероятность ошибки считывания 1 бита, весьма мало. Но следует понимать, что высоконагруженные системы, осо- бенно в режиме восстановления, считывают значительные объёмы данных и возникновение ошибки чтения и, следова- тельно, потери данных довольно высоко. Так, при восстановлении RAID-массива происходит счи- тывание данных с работающих дисков и запись информации на новый диск, и общий объём данных будет составлять: С read = С bit × K или С read = С bit × ( N – R ). Здесь С read – объём прочитанных данных (в битах); С bit – объём (размер) одного диска (в битах); K – количество дис- ков с данными (полезный объём RAID-массива); N – коли- чество дисков в RAID-массиве; R – количество избыточных дисков. Для типичного дискового массива в 2U-шасси, состоящего из 12 дисков ёмкостью 12 Тбайт каждый, объединённых в RAID 5 (один диск для обеспечения избыточности), получа- ем объём считываемых данных 132 Тбайт: С read = 12 Тбайт × (12–1) = 132 Тбайт = 10 15 бит. При величине URE , соответствующей значению 10 15 , что является типичным значением для современных дисков боль- шой ёмкости, используемых в системах хранения данных, восстановление такого массива может не произойти, то есть информация будет потеряна. Таким образом, можно определить максимально допусти- мый объём дискового массива в зависимости от типа исполь- зуемых дисков, с заданной допустимой вероятностью восста- новления данных. С РЕДНЕЕ ВРЕМЯ ВОССТАНОВЛЕНИЯ ДИСКА В СИСТЕМЕ ХРАНЕНИЯ ДАННЫХ Следующим важным параметром при расчёте надёжности дисковой подсистемы, является время до полного восстанов- ления ( MTTR ) неисправного компонента (диска). В отличие от стандартных систем замена диска в систе- мах хранения данных не означает, что диск становится ра- ботоспособным. Для восстановления работоспособности заменённого диска необходимо записать на него данные, то есть перестроить RAID-массив и вернуть его в работоспо- собное состояние. Таким образом, время восстановления дис- ка в системе хранения данных определяется следующим вы- ражением: С URE bit = . 1 MTTR disk = T DIAG + T REP + T RBLD . Здесь MTTR disk – время ремонта (замены) диска; T DIAG – время обнаружения неисправного диска; T REP – время, не- обходимое для ремонта (замены) неисправного диска; T RBLD – время восстановления потерянных данных (Rebuild) на новом диске. Время замены может значительно варьироваться: часы, дни или нулевое время при «горячем» резерве (hot spare), когда ре- зервный диск уже установлен в системе и сразу же включает- ся в работу при обнаружении отказа какого-либо диска. Если принять, что в дисковом массиве операции записи и чтения выполняются одновременно на все диски, а вре- мя расчёта контрольных сумм значительно меньше времени чтения/записи на диск, то время восстановления можно оце- нить как Здесь C VOL – размер тома, P DISK – скорость чтения данных с диска. Учитывая, что при наличии диска, находящегося в «горя- чем» резерве, T DIAG = 0 и T REPL = 0, время восстановления диска будет: В спецификациях дисков приводится такой параметр, как максимальная постоянная скорость передачи данных по внешнему диаметру (Мбайт/с). Типичная скорость пере- дачи данных современных дисков со скоростью враще- ния шпинделя 7200 об./мин составляет от 130 до 250 Мбайт/с. Надо понимать, что это максимально возможная потоко- вая скорость. На внутренних диаметрах она значительно ниже. На практике восстановление конкурирует ещё и с рабочи- ми запросами ввода-вывода, поэтому скорость передачи дан- ных нужно оценивать как 1/3 от указанной в спецификации или получать экспериментальным путём для заданной кон- фигурации RAID-массива и рабочей нагрузки. О ЖИДАЕМОЕ ВРЕМЯ ДО ПОТЕРИ ДАННЫХ Для систем хранения данных основной метрикой надёжно- сти является среднее время до потери данных –Mean Time To Data Loss ( MTTDL ). Это оценка ожидаемого времени до мо- мента, когда хотя бы один блок данных не сможет быть счи- тан (или восстановлен), то есть время до потери данных. Для обеспечения надёжного хранения данных современные системы используют механизмы избыточного кодирования, в том числе технологии RAID-массивов (Redundant Array of Independent Disks – избыточный массив независимых дисков) различного уровня. Уровень RAID-массива выбирается из MTTR C P disk VOL disk = . T C P RBLD VOL disk = . В ЗАПИСНУЮ КНИЖК У ИНЖЕ Н Е РА СТА 3/2019 98 www.cta.ru Таблица 1 Типичные значения параметра невосстанавливаемой ошибки чтения (URE) Тип диска Значение URE Объём данных до возникновения сбоя Desktop 10 –14 12,5 Тбайт Nearline 10 –15 125 Тбайт Entrerprise 10 –16 1 250 Тбайт

RkJQdWJsaXNoZXIy MTQ4NjUy