有一台 Linux 工控机,最近频繁死机。具体的现象就是,PING 无响应,串口连接无任何反应。但是网线的灯是闪的,插拔网线也会亮灯和灭灯。长按电源硬重启恢复。开启 kdump 后,在/var/crash 中无任何文件产生,查看/var/log/messages 无任何异常日志,只是日志停在了死机的那一刻,串口也没有任何崩溃输出。
系统负载低,CPU 硬盘负载接近 0%,内存 15%左右,没有跑什么业务,设备的温度不高,都在 40-50°C 以下,死机的时候没有进行任何操作。

目前怀疑方向是前段时间厂家给这个设备加了两个 PCI 扩展卡,目前该扩展卡上面还插了两个 PCI 网卡,以及网卡上面有一个光模块,但是没流量。

这个问题有没有什么好的排查方向,目前在排除扩展卡,还是 PCI 网卡,还是插入的光模块导致。只能一个一个组件进行排除,但是该问题复现时间不确定,整个排查周期可能非常久。有没有什么其他更好的方向分析那个问题呢,还有上面新增的这几个硬件有没有可能导致这种现象发生呢
举报· 210 次点击
登录 注册 站外分享
15 条回复  
Moyyyyyyyyyyye 小成 2024-9-20 14:38:53
电源是否稳定,检查内存硬盘是否有问题,大概率是硬件问题
tomemi 小成 2024-9-20 17:39:33
换个内核看看
yinmin 小成 2024-9-21 08:50:45
接显示器/键盘看看死机前有没有报错信息。

另外,你说的情况不一定 linux 死机,也许通过本机键盘能正常登录,只是网络故障。
hefish 小成 2024-9-21 09:25:06
硬件。。。慢慢换吧。。
sublimevsatom 初学 2024-9-21 19:35:24
用最新内核看看
bli22ard 小成 2024-9-21 22:08:04
我之前零刻 eq12 ,安装 pve 慢,然后运行中负载搞了就容易死机。换了内存尝试依旧。后面还了 ssd ,好了。奇怪的是这个 ssd 检测,当移动硬盘什么都正常。
flynaj 小成 2024-9-22 02:09:59
https://www.memtest.org/ 先跑内存测试。
basncy 小成 2024-9-22 11:55:47
遇到过同样的问题, 当时我的情况是 SSD 硬盘快坏了, 换了块硬盘就好了. 庆幸当时还能把数据读出来.
druggo 小成 2024-9-23 20:11:29
@bingfengfeifei 真正的问题日志可能没有机会存盘了,可以考虑开这个远程记录下内核日志 https://www.kernel.org/doc/html/latest/networking/netconsole.html
12下一页
返回顶部