К основному содержимому

Журнал событий сервера SEL: чтение и разбор аварий

Выделенные серверы · 29.09.2026

Что такое SEL и зачем его читать

SEL (System Event Log) — энергонезависимый журнал событий, который ведёт BMC сервера независимо от операционной системы. Туда попадают записи о падении напряжения, срабатывании ECC, перегреве, остановке вентилятора и других аппаратных событиях — даже если сервер в этот момент был выключен или завис намертво.

Когда сервер перезагрузился без видимой причины, а логи ОС молчат, первым делом смотрят именно в SEL, а не в syslog: ОС часто просто не успевает ничего записать до аварийной перезагрузки.

Как получить журнал через IPMI

ipmitool sel list
ipmitool sel elist

Команда sel list выводит краткую сводку: номер записи, дату, тип события. Команда sel elist расшифровывает событие подробнее — обычно этого достаточно, чтобы понять природу аварии без документации на конкретную плату.

Если доступа по SSH к самой ОС нет из-за зависания, журнал всё равно можно прочитать удалённо через IPMI и KVM-over-IP — BMC работает даже когда сама ОС не отвечает.

Типичные записи: ECC, питание, перегрев

Тип событияЧто означаетЧто проверить
Correctable ECCЕдиничная ошибка памяти исправленаЧастоту повторов, модуль DIMM
Uncorrectable ECCОшибка памяти не исправленаЗамену модуля, memtest
Power Supply FailureОдин блок питания отключилсяРезервный БП, нагрузку PDU
Temperature Upper CriticalПерегрев компонентаВентиляторы, пыль, термопасту

Uncorrectable ECC — самая серьёзная запись из таблицы: она означает, что данные в памяти были повреждены и не восстановлены на лету. После такой записи модуль стоит проверить через memtest86+, а не просто перезагрузить сервер и забыть.

Как расшифровать код события

Каждая строка SEL содержит sensor type, sensor number и event data — три поля, которые вместе с версией IPMI-спецификации указывают на точный смысл события. Для платы конкретного производителя (Supermicro, Dell iDRAC, HPE iLO) есть таблица соответствия кодов в документации к серверу — общий формат IPMI одинаков, но нумерация сенсоров у каждого вендора своя.

Если код события неочевиден, полезно свериться с выводом sensor list — он покажет текущие показания того же датчика, который сработал в момент аварии.

ipmitool sdr list
ipmitool sensor list

Когда очищать SEL и что при этом происходит

SEL имеет ограниченный размер — обычно несколько тысяч записей — и при переполнении старые записи начинают затираться новыми либо журнал блокируется. Некоторые платформы при полностью заполненном SEL перестают писать новые критические события, что опаснее, чем кажется.

ipmitool sel clear

Очищайте журнал только после того, как разобрали и зафиксировали причину аварии — например, в тикете о замене диска или модуля памяти. Это дополняет постоянный мониторинг железа через IPMI, который должен ловить новые события сразу, а не через ручной просмотр раз в месяц.

Чек-лист разбора аварии по SEL

  • Смотрите SEL раньше syslog, если сервер перезагрузился без видимой причины.
  • Фиксируйте время и тип события до очистки журнала.
  • При Uncorrectable ECC проверяйте модуль памяти отдельным тестом, а не полагайтесь на перезагрузку.
  • Настройте автоматический экспорт SEL в систему мониторинга, а не полагайтесь на память администратора.
← Назад в базу знаний Задать вопрос поддержке