Привет, PVE-узел неожиданно перезагрузился. Факты о PVE:
* Ядро: Linux 6.5.13-5-pve
* Хранилище: 2xSSD (ZFS Raid 1)
* CPU: AMD Ryzen 9 7950X3D (16 ядер)
* RAM: 128GB
Сбои начались после добавления еще одной ВМ, которая выполняет некое виртуализацию в виртуализации (VirtualBox внутри PVE). ВМ на PVE-узле:
* 6x ВМ с 4 CPU каждая (тип процессора: host)
* 1x ВМ с 8 CPU, выполняющая некую виртуализацию (тип процессора: host)
В общем, PVE-узел перегружен CPU (32 vCPU, 16 ядер CPU, 32 потока CPU). Вся остальная загрузка ресурсов (RAM, дисковое пространство) низкая и не перегружена.
Примерно между 5 минутами и 24 часами PVE-узел неожиданно перезагружается. В journalctl или /var/log/ нет записей о сбое (только загрузка PVE-узла с проверкой файловой системы).
Предпринятые шаги для решения проблемы:
* Включены и протестированы дамп ядра при сбое: дамп ядра не записывается
* Отключена автоматическая перезагрузка, если не удалось записать дамп ядра: все равно автоматически перезагружается
* Провайдер провел стресс-тест всех компонентов: проблем не обнаружено
* Добавлен пользовательский тип CPU (x86-64-v4 с флагом svm) (см. все равно сбоит/перезагружается
* Уменьшено общее количество vCPU до 8 (см. PVE-узел больше не сбоит
Несмотря на то, что обходной путь с уменьшением общего количества vCPU помог стабилизировать систему, это все равно не является для меня приемлемым решением, поскольку много CPU ресурсов простаивают, и гибкость PVE-узла довольно ограничена.
Основная проблема, с которой я сталкиваюсь сейчас, — это то, что я не могу определить первопричину проблемы. Проблема в ядре? Неисправный CPU? Неисправный блок питания? ...
У кого-нибудь были похожие проблемы и как вы их решили? Есть ли какие-нибудь еще идеи, как найти первопричину?
* Ядро: Linux 6.5.13-5-pve
* Хранилище: 2xSSD (ZFS Raid 1)
* CPU: AMD Ryzen 9 7950X3D (16 ядер)
* RAM: 128GB
Сбои начались после добавления еще одной ВМ, которая выполняет некое виртуализацию в виртуализации (VirtualBox внутри PVE). ВМ на PVE-узле:
* 6x ВМ с 4 CPU каждая (тип процессора: host)
* 1x ВМ с 8 CPU, выполняющая некую виртуализацию (тип процессора: host)
В общем, PVE-узел перегружен CPU (32 vCPU, 16 ядер CPU, 32 потока CPU). Вся остальная загрузка ресурсов (RAM, дисковое пространство) низкая и не перегружена.
Примерно между 5 минутами и 24 часами PVE-узел неожиданно перезагружается. В journalctl или /var/log/ нет записей о сбое (только загрузка PVE-узла с проверкой файловой системы).
Предпринятые шаги для решения проблемы:
* Включены и протестированы дамп ядра при сбое: дамп ядра не записывается
* Отключена автоматическая перезагрузка, если не удалось записать дамп ядра: все равно автоматически перезагружается
* Провайдер провел стресс-тест всех компонентов: проблем не обнаружено
* Добавлен пользовательский тип CPU (x86-64-v4 с флагом svm) (см. все равно сбоит/перезагружается
* Уменьшено общее количество vCPU до 8 (см. PVE-узел больше не сбоит
Несмотря на то, что обходной путь с уменьшением общего количества vCPU помог стабилизировать систему, это все равно не является для меня приемлемым решением, поскольку много CPU ресурсов простаивают, и гибкость PVE-узла довольно ограничена.
Основная проблема, с которой я сталкиваюсь сейчас, — это то, что я не могу определить первопричину проблемы. Проблема в ядре? Неисправный CPU? Неисправный блок питания? ...
У кого-нибудь были похожие проблемы и как вы их решили? Есть ли какие-нибудь еще идеи, как найти первопричину?
