Привет! Недавно я обновил один из трёх работающих узлов в кластере до ядра 6.17.2-1-pve, версия Ceph при этом осталась прежней на всех хостах (19.2.3). После перезагрузки сервера я заметил, что процессы ceph-osd сразу же начинают падать с ошибкой:
Код: ceph-osd[10805]: ./src/common/HeartbeatMap.cc: 85: ceph_abort_msg("hit suicide timeout")
И ядро выбрасывало такие стек-трейсы:
Код:
kernel: sd 0:2:0:0: [sda] tag#616 page boundary ptr_sgl: 0x00000000df48bcb9
kernel: BUG: unable to handle page fault for address: ff685a6f8dd63000
kernel: #PF: supervisor write access in kernel mode
kernel: #PF: error_code(0x0002) - not-present page
kernel: PGD 100000067 P4D 100874067 PUD 100875067 PMD 108abd067 PTE 0
kernel: Oops: Oops: 0002 [#1] SMP NOPTI
kernel: CPU: 81 UID: 0 PID: 1012 Comm: kworker/81:1H Tainted: P S OE 6.17.2-1-pve #1 PREEMPT(voluntary)
kernel: Tainted: [P]=PROPRIETARY_MODULE, [S]=CPU_OUT_OF_SPEC, [O]=OOT_MODULE, [E]=UNSIGNED_MODULE
kernel: Hardware name: Dell Inc. PowerEdge R660xs/00NDRY, BIOS 2.7.5 07/31/2025
kernel: Workqueue: kblockd blk_mq_run_work_fn
kernel: RIP: 0010:megasas_build_and_issue_cmd_fusion+0xeaa/0x1870 [megaraid_sas]
kernel: Code: ... <snippet> ...
kernel: RSP: 0018:ff685a6fa0b0fb50 EFLAGS: 00010206
kernel: RAX: 00000000fe298000 RBX: ff42339b0e6b2cc0 RCX: ff685a6f8dd63000
kernel: ...
kernel: Call Trace:
kernel: megasas_queue_command+0x122/0x1d0 [megaraid_sas]
kernel: scsi_queue_rq+0x409/0xcc0
kernel: blk_mq_dispatch_rq_list+0x121/0x740
kernel: ? sbitmap_get+0x73/0x180
kernel: __blk_mq_sched_dispatch_requests+0x408/0x600
kernel: blk_mq_sched_dispatch_requests+0x2d/0x80
kernel: blk_mq_run_work_fn+0x72/0x90
kernel: process_one_work+0x188/0x370
kernel: worker_thread+0x33a/0x480
kernel: ? __pfx_worker_thread+0x10/0x10
kernel: kthread+0x108/0x220
kernel: ? __pfx_kthread+0x10/0x10
kernel: ret_from_fork+0x205/0x240
kernel: ? __pfx_kthread+0x10/0x10
kernel: ret_from_fork_asm+0x1a/0x30
kernel: </TASK>
(Стек-трейсы одинаковые для всех 5 ceph-osd дисков в системе, меняется только буква диска)
Я пробовал перезагружать узел, пересоздавать osd — ничего не помогало. Единственное, что работает — это загрузка с более старого ядра, которое есть в системе, 6.14.11-3-pve. При загрузке с ним всё работает отлично. Проверял память memtest, чтобы исключить аппаратные проблемы, также переподключал кабели бэкплейна и всё прочее.
Вот немного информации о железе:
Dell Inc. PowerEdge R660xs
BIOS: 2.7.5 (самый свежий)
Raid контроллер: PERC H755N (версия: 52.30.0-6115 — самая свежая)
Диски передаются системе как NON-RAID диски.
Версия Ceph: 19.2.3 (2f03f1cd83e5d40cdf1393cb64a662a8e8bb07c6)
squid (stable)
pve-manager/9.0.18/5cacb35d7ee87217 (загружаемое ядро: 6.14.11-3-pve)
При чтении форумов заметил несколько тем, где люди жаловались на проблемы с новыми ядрами на Dell серверах (возможно, как раз про это?).
Код: ceph-osd[10805]: ./src/common/HeartbeatMap.cc: 85: ceph_abort_msg("hit suicide timeout")
И ядро выбрасывало такие стек-трейсы:
Код:
kernel: sd 0:2:0:0: [sda] tag#616 page boundary ptr_sgl: 0x00000000df48bcb9
kernel: BUG: unable to handle page fault for address: ff685a6f8dd63000
kernel: #PF: supervisor write access in kernel mode
kernel: #PF: error_code(0x0002) - not-present page
kernel: PGD 100000067 P4D 100874067 PUD 100875067 PMD 108abd067 PTE 0
kernel: Oops: Oops: 0002 [#1] SMP NOPTI
kernel: CPU: 81 UID: 0 PID: 1012 Comm: kworker/81:1H Tainted: P S OE 6.17.2-1-pve #1 PREEMPT(voluntary)
kernel: Tainted: [P]=PROPRIETARY_MODULE, [S]=CPU_OUT_OF_SPEC, [O]=OOT_MODULE, [E]=UNSIGNED_MODULE
kernel: Hardware name: Dell Inc. PowerEdge R660xs/00NDRY, BIOS 2.7.5 07/31/2025
kernel: Workqueue: kblockd blk_mq_run_work_fn
kernel: RIP: 0010:megasas_build_and_issue_cmd_fusion+0xeaa/0x1870 [megaraid_sas]
kernel: Code: ... <snippet> ...
kernel: RSP: 0018:ff685a6fa0b0fb50 EFLAGS: 00010206
kernel: RAX: 00000000fe298000 RBX: ff42339b0e6b2cc0 RCX: ff685a6f8dd63000
kernel: ...
kernel: Call Trace:
kernel: megasas_queue_command+0x122/0x1d0 [megaraid_sas]
kernel: scsi_queue_rq+0x409/0xcc0
kernel: blk_mq_dispatch_rq_list+0x121/0x740
kernel: ? sbitmap_get+0x73/0x180
kernel: __blk_mq_sched_dispatch_requests+0x408/0x600
kernel: blk_mq_sched_dispatch_requests+0x2d/0x80
kernel: blk_mq_run_work_fn+0x72/0x90
kernel: process_one_work+0x188/0x370
kernel: worker_thread+0x33a/0x480
kernel: ? __pfx_worker_thread+0x10/0x10
kernel: kthread+0x108/0x220
kernel: ? __pfx_kthread+0x10/0x10
kernel: ret_from_fork+0x205/0x240
kernel: ? __pfx_kthread+0x10/0x10
kernel: ret_from_fork_asm+0x1a/0x30
kernel: </TASK>
(Стек-трейсы одинаковые для всех 5 ceph-osd дисков в системе, меняется только буква диска)
Я пробовал перезагружать узел, пересоздавать osd — ничего не помогало. Единственное, что работает — это загрузка с более старого ядра, которое есть в системе, 6.14.11-3-pve. При загрузке с ним всё работает отлично. Проверял память memtest, чтобы исключить аппаратные проблемы, также переподключал кабели бэкплейна и всё прочее.
Вот немного информации о железе:
Dell Inc. PowerEdge R660xs
BIOS: 2.7.5 (самый свежий)
Raid контроллер: PERC H755N (версия: 52.30.0-6115 — самая свежая)
Диски передаются системе как NON-RAID диски.
Версия Ceph: 19.2.3 (2f03f1cd83e5d40cdf1393cb64a662a8e8bb07c6)
squid (stable)
pve-manager/9.0.18/5cacb35d7ee87217 (загружаемое ядро: 6.14.11-3-pve)
При чтении форумов заметил несколько тем, где люди жаловались на проблемы с новыми ядрами на Dell серверах (возможно, как раз про это?).

Кто-нибудь уже тестировал?