Tin Tức
Những lỗi thường gặp khi sử dụng Máy chủ HPE ProLiant DL380 Gen11
Máy chủ HPE ProLiant DL380 Gen11 có hệ thống giám sát phần cứng, nhật ký sự kiện và quản trị từ xa khá đầy đủ, nhưng trong quá trình vận hành vẫn có thể phát sinh các sự cố liên quan đến nguồn điện, RAM, ổ đĩa, RAID, nhiệt độ, firmware hoặc HPE iLO 6.
Khi xuất hiện lỗi, quản trị viên không nên bắt đầu bằng việc tháo từng linh kiện để thử. Cách phù hợp hơn là xác định triệu chứng, kiểm tra đèn trạng thái và POST, đọc Integrated Management Log (IML), kiểm tra thông tin trên iLO 6 và tải Active Health System (AHS) Log trước khi can thiệp phần cứng.
HPE cũng hướng dẫn quy trình troubleshooting Gen11 theo hướng thu thập triệu chứng, trạng thái LED, lỗi POST, tình trạng boot hệ điều hành và nhật ký hệ thống để khoanh vùng nguyên nhân.
Bài viết dưới đây tổng hợp những lỗi thường gặp khi sử dụng máy chủ HPE ProLiant DL380 Gen11, nguyên nhân có khả năng xảy ra và cách kiểm tra theo thứ tự ưu tiên.
Dấu hiệu nào cho thấy HPE DL380 Gen11 đang gặp sự cố?

Không phải lỗi nào cũng khiến máy chủ dừng hoạt động hoàn toàn. Một số vấn đề chỉ xuất hiện dưới dạng cảnh báo và nếu không theo dõi thường xuyên có thể phát triển thành sự cố nghiêm trọng hơn.
Các dấu hiệu cần chú ý gồm:
| Dấu hiệu | Nhóm nguyên nhân nên kiểm tra |
|---|---|
| Server không bật nguồn | PSU, nguồn AC, dây nguồn, phân bổ công suất |
| Server bật nhưng không hoàn thành POST | RAM, CPU, firmware, PCIe hoặc phần cứng mới lắp |
| Xuất hiện cảnh báo DIMM | RAM không tương thích, lắp sai hoặc DIMM lỗi |
| Ổ đĩa báo lỗi hoặc biến mất | Drive, backplane, cable, controller hoặc RAID |
| RAID degraded | Một hoặc nhiều ổ trong array gặp vấn đề |
| Quạt chạy liên tục ở tốc độ cao | Nhiệt độ, fan, airflow hoặc linh kiện/cấu hình mới |
| iLO 6 không truy cập được | Network quản trị, cấu hình iLO hoặc firmware |
| Server tự reboot hoặc treo | Hardware, firmware, memory hoặc hệ điều hành |
| Hiệu năng storage giảm bất thường | Drive, RAID, controller hoặc workload |
| Có cảnh báo trong IML | Thành phần tương ứng với event cần được kiểm tra |
HPE cung cấp IML để lưu các sự kiện phần cứng theo thời gian và AHS để ghi lại tình trạng cũng như thay đổi cấu hình của hệ thống. Đây thường là hai nguồn dữ liệu cần kiểm tra sớm khi chẩn đoán sự cố.
HPE DL380 Gen11 không bật nguồn
Nguyên nhân có khả năng nhất
Khi DL380 Gen11 hoàn toàn không bật, nên kiểm tra nguồn điện và PSU trước, thay vì kết luận ngay rằng mainboard gặp lỗi.
Theo hướng dẫn troubleshooting Gen11 của HPE, nguyên nhân có thể gồm:
- Dây hoặc linh kiện nguồn chưa được kết nối chắc chắn.
- Ổ điện hoặc nguồn AC không hoạt động.
- Dây nguồn gặp lỗi.
- PSU chưa được lắp đúng vị trí.
- PSU bị lỗi hoặc đang ở trạng thái standby.
- Nguồn điện không đủ cho cấu hình phần cứng hiện tại.
- Các PSU trong cấu hình redundant không tương thích.
Cách kiểm tra
Ưu tiên thực hiện:
- Kiểm tra trạng thái LED trên PSU.
- Kiểm tra dây nguồn và PDU.
- Xác nhận nguồn điện đầu vào hoạt động bình thường.
- Kiểm tra PSU đã được cắm hết hành trình hay chưa.
- Nếu vừa nâng cấp CPU, GPU, ổ đĩa hoặc card PCIe, kiểm tra lại tổng yêu cầu công suất.
- Kiểm tra IML nếu iLO vẫn truy cập được.
Không nên tháo mainboard hoặc CPU ngay khi chưa loại trừ lỗi nguồn.
Máy chủ bật nguồn nhưng không hoàn thành POST
Server có điện nhưng dừng ở quá trình POST thường cho thấy một thành phần phần cứng hoặc cấu hình hệ thống đang ngăn máy hoàn tất quá trình khởi tạo.
Những thứ cần kiểm tra trước
Xác định:
- Server dừng ở bước nào.
- Có thông báo POST nào xuất hiện hay không.
- LED Health đang hiển thị trạng thái gì.
- Có thay đổi phần cứng ngay trước khi lỗi xảy ra hay không.
- Máy có vừa nâng cấp RAM, NIC, controller, riser hoặc drive hay không.
- IML ghi nhận event nào tại thời điểm phát sinh lỗi.
HPE khuyến nghị ghi lại nguyên văn thông báo POST và trạng thái LED trước khi tiếp tục troubleshooting.
Nếu lỗi xuất hiện ngay sau một lần nâng cấp, thành phần vừa thay đổi nên được kiểm tra trước.
Khi chưa xác định được linh kiện lỗi
HPE có quy trình giảm hệ thống về minimum hardware configuration để cô lập lỗi khi nguyên nhân chưa rõ. Không nên thực hiện quy trình này trên máy production khi chưa có kế hoạch downtime và bảo vệ dữ liệu.
HPE DL380 Gen11 không nhận RAM hoặc báo lỗi DIMM
RAM là một trong những nhóm cần kiểm tra khi server:
- Không nhận đủ dung lượng bộ nhớ.
- Xuất hiện DIMM error.
- Có correctable hoặc uncorrectable memory error.
- Không POST sau khi nâng cấp RAM.
- Một DIMM không xuất hiện trong inventory.
Nguyên nhân thường gặp
Theo HPE, lỗi RAM trên Gen11 có thể xuất phát từ:
- DIMM không đáp ứng yêu cầu của server.
- RAM không được lắp theo đúng population rule.
- DIMM chưa được cắm chắc.
- DIMM bị suy giảm hoặc hỏng.
- Cấu hình RAM mới xung đột với cấu hình hiện tại.
- System ROM chưa được cập nhật phù hợp.
Cách xử lý
Trước tiên kiểm tra inventory trong iLO và event trong IML.
Nếu vừa nâng RAM:
- Đối chiếu part number và khả năng tương thích.
- Kiểm tra lại vị trí DIMM.
- Kiểm tra population rule tương ứng với CPU đang được lắp.
- Tắt server đúng quy trình trước khi reseat DIMM.
- Tuân thủ yêu cầu ESD khi thao tác.
- Cập nhật System ROM nếu HPE yêu cầu.
- Cô lập từng DIMM nếu cần xác định linh kiện lỗi.
Không nên chỉ dựa vào việc DIMM có cùng dung lượng để kết luận chúng có thể phối hợp với nhau.
Ổ HDD, SSD hoặc NVMe không được nhận
Lỗi drive có thể biểu hiện dưới nhiều dạng:
- Ổ đĩa biến mất khỏi hệ thống.
- Drive không xuất hiện trong storage controller.
- SmartDrive LED báo bất thường.
- POST hoặc công cụ quản lý storage xuất hiện cảnh báo.
- Hệ điều hành không nhìn thấy volume.
- Hiệu năng lưu trữ giảm rõ rệt.
HPE liệt kê riêng các trường hợp drive failed, drive not recognized, không truy cập được dữ liệu, SSD wear và lỗi liên quan đến storage controller trong tài liệu troubleshooting Gen11.
Nên kiểm tra theo thứ tự
Drive → kết nối/backplane → controller → RAID → hệ điều hành.
Đừng bắt đầu bằng việc format hoặc tạo lại logical drive.
Nếu lỗi xảy ra sau khi thay ổ hoặc thay controller, cần kiểm tra chính xác:
- Drive có nằm trong danh sách tương thích hay không.
- Bay và backplane đang sử dụng loại kết nối nào.
- Controller đang vận hành ở chế độ nào.
- Logical drive có còn tồn tại hay không.
- Array có đang degraded hay rebuilding hay không.
Đặc biệt với DL380 Gen11, cấu hình lưu trữ phụ thuộc chassis, backplane, drive cage và controller. Hai hệ thống nhìn giống nhau ở mặt trước chưa chắc có cùng kiến trúc storage phía sau.
RAID degraded hoặc một ổ trong array báo failed
RAID degraded không đồng nghĩa với mất dữ liệu ngay, nhưng đây là tình trạng cần xử lý ưu tiên vì khả năng chịu lỗi của array có thể đã giảm.
Không nên làm gì?
Không nên:
- Reboot liên tục để thử.
- Rút nhiều ổ cùng lúc.
- Đổi vị trí các ổ tùy ý.
- Initialize hoặc tạo lại RAID khi chưa xác định trạng thái dữ liệu.
- Ép một ổ trở lại array nếu chưa hiểu nguyên nhân.
Quy trình kiểm tra
Xác định:
- RAID level hiện tại.
- Ổ nào đang failed hoặc predictive failure.
- Có hot spare hay không.
- Quá trình rebuild có đang chạy không.
- Có thêm drive nào đang phát sinh lỗi không.
- Backup gần nhất có sử dụng được không.
- IML và storage controller đang ghi nhận event gì.
Nếu đây là hệ thống chứa workload quan trọng, nên xác minh backup trước khi thay đổi cấu hình RAID.

Storage Controller không nhận ổ hoặc logical drive
Không phải mọi trường hợp mất ổ đều do drive.
Controller hoặc đường kết nối storage cũng có thể là nguyên nhân.
HPE có nhóm troubleshooting riêng cho các trường hợp:
- Controller xuất hiện lỗi trong POST.
- Logical drive không xuất hiện.
- Controller redundancy gặp vấn đề.
- Thay đổi giữa RAID và non-RAID gây vấn đề với dữ liệu hiện có.
- Array không xuất hiện sau khi di chuyển drive.
Cách kiểm tra
Kiểm tra đồng thời:
- Firmware controller.
- Cáp kết nối.
- Backplane.
- Drive mapping.
- Storage configuration.
- Event trong IML.
- Thay đổi phần cứng gần nhất.
Không flash firmware hoặc reset controller một cách ngẫu nhiên trên server production. Mọi thay đổi nên có bản backup và kế hoạch rollback.
Quạt chạy tốc độ cao hoặc server cảnh báo nhiệt độ
Quạt server tăng tốc trong thời gian boot là bình thường. Vấn đề cần kiểm tra là khi quạt tiếp tục chạy ở tốc độ cao bất thường trong thời gian dài hoặc xuất hiện cảnh báo thermal.
HPE dành riêng các mục troubleshooting Gen11 cho:
- General fan issues.
- Fans running at higher than expected speed.
- Excessive fan noise.
- Hot-plug fan issues.
Nguyên nhân nên kiểm tra
- Một fan bị lỗi hoặc không được nhận diện.
- Luồng khí bị cản.
- Nhiệt độ đầu vào rack cao.
- Air baffle hoặc linh kiện liên quan chưa được lắp đúng.
- Vừa bổ sung card PCIe, GPU hoặc thiết bị làm thay đổi profile nhiệt.
- Firmware chưa phù hợp.
- Một cảm biến đang phát hiện tình trạng nhiệt bất thường.
Cách xử lý
Vào iLO 6 để kiểm tra:
- Fan status.
- Temperature sensors.
- Overall health.
- IML.
- Thay đổi phần cứng gần nhất.
Không nên chỉ giảm tốc quạt để xử lý tiếng ồn nếu chưa tìm ra nguyên nhân khiến hệ thống yêu cầu tăng cooling.
iLO 6 không truy cập được hoặc hoạt động bất thường
DL380 Gen11 sử dụng HPE iLO 6 cho chức năng giám sát, cảnh báo, quản trị và hỗ trợ chẩn đoán từ xa. QuickSpecs hiện tại của HPE xác nhận iLO là nền tảng quản trị tích hợp của DL380 Gen11.
Nếu không truy cập được iLO, kiểm tra theo thứ tự:
- Kết nối vật lý tới mạng quản trị.
- Switch port và VLAN.
- Địa chỉ IP của iLO.
- Gateway và subnet.
- Khả năng ping từ mạng quản trị.
- Thay đổi network gần nhất.
- Phiên bản firmware iLO.
- Event liên quan đến iLO.
Không nên reset cấu hình iLO ngay từ đầu nếu chưa xác định nguyên nhân.
HPE từng phát hành advisory cho một số phiên bản iLO 6 cụ thể liên quan đến AHS logging và khuyến nghị cập nhật firmware. Điều này cho thấy khi gặp lỗi quản trị hoặc logging, quản trị viên nên kiểm tra release notes và advisory tương ứng với phiên bản firmware đang chạy, thay vì áp dụng một phiên bản cố định cho mọi hệ thống.
Firmware không đồng bộ sau khi nâng cấp phần cứng
Firmware không phải lúc nào cũng là nguyên nhân trực tiếp, nhưng cần được xem xét nếu lỗi bắt đầu xuất hiện sau:
- Thay CPU.
- Nâng RAM.
- Thay storage controller.
- Bổ sung NIC hoặc card PCIe.
- Thay drive.
- Cập nhật System ROM.
- Cập nhật iLO.
HPE đưa cập nhật firmware vào nhóm quy trình troubleshooting chung của ProLiant Gen11.
Nguyên tắc xử lý
Không nên áp dụng cách “update tất cả rồi kiểm tra sau”.
Trước khi cập nhật:
- Ghi lại phiên bản hiện tại.
- Kiểm tra release notes.
- Xác nhận compatibility.
- Kiểm tra advisory của HPE.
- Chuẩn bị maintenance window.
- Có kế hoạch rollback khi phù hợp.
- Xác minh backup của workload quan trọng.
Firmware nên được quản lý như một thay đổi có kiểm soát, đặc biệt đối với server production.
Card mạng không được nhận hoặc server mất kết nối
Khi server mất network sau khi nâng cấp hoặc bảo trì, cần tách hai trường hợp:
Mất kết nối hệ điều hành và mất kết nối iLO là hai vấn đề khác nhau.
Theo QuickSpecs của DL380 Gen11, network dữ liệu được cấu hình thông qua lựa chọn adapter như OCP 3.0 hoặc stand-up network adapter; không nên mặc định rằng máy luôn có một NIC dữ liệu tích hợp cố định trên mainboard.
Nếu NIC hệ điều hành không xuất hiện, kiểm tra:
- Adapter có được nhận trong hardware inventory không.
- PCIe/OCP adapter có được lắp chắc chắn không.
- Firmware và driver.
- Switch port.
- VLAN.
- Bonding/teaming.
- Interface naming của hệ điều hành.
- Thay đổi cấu hình gần nhất.
Nếu chỉ iLO mất kết nối trong khi network workload vẫn hoạt động, tập trung vào đường quản trị iLO thay vì card mạng của hệ điều hành.
Server bị treo, tự khởi động lại hoặc phát sinh lỗi không ổn định
Đây là nhóm khó chẩn đoán nhất vì nguyên nhân có thể nằm ở:
- Memory.
- CPU.
- PCIe device.
- Firmware.
- Storage.
- Nguồn.
- Hệ điều hành hoặc hypervisor.
HPE khuyến nghị khi thu thập triệu chứng cần xác định máy có xuất hiện machine check exception, blue screen, kernel panic, hang hoặc freeze hay không và lỗi xảy ra ở giai đoạn nào.
Đừng chỉ nhìn log hệ điều hành
Khi gặp reboot hoặc freeze ngẫu nhiên, nên đối chiếu cùng thời điểm giữa:
- Event log của hệ điều hành/hypervisor.
- IML.
- iLO Event Log.
- AHS Log.
- Monitoring bên ngoài.
Nếu nhiều nguồn cùng ghi nhận bất thường tại một thời điểm, việc khoanh vùng linh kiện sẽ chính xác hơn.
Quy trình chẩn đoán lỗi HPE DL380 Gen11 được khuyến nghị

Khi server xuất hiện sự cố, có thể áp dụng luồng sau:
Triệu chứng → LED → POST → iLO 6 → IML → AHS → thay đổi gần nhất → firmware/phần cứng → xử lý
Ghi nhận triệu chứng
Xác định chính xác:
- Server có nguồn hay không.
- Có hoàn thành POST không.
- Có boot được OS/hypervisor không.
- Lỗi xảy ra liên tục hay ngẫu nhiên.
- Workload nào bị ảnh hưởng.
Kiểm tra LED và thông báo POST
Không bỏ qua mã lỗi hoặc cảnh báo đang hiển thị.
Kiểm tra iLO 6
Xem:
- Server Health.
- Hardware inventory.
- Temperature.
- Fans.
- Power.
- Storage.
- Memory.
Đọc IML
Tìm event gần thời điểm phát sinh sự cố.
Tải AHS Log
Đặc biệt hữu ích với lỗi lặp lại, lỗi phần cứng khó tái hiện hoặc khi cần gửi dữ liệu cho kỹ thuật viên.
Kiểm tra thay đổi gần nhất
Hãy tự hỏi:
- Vừa thay RAM?
- Vừa thay ổ?
- Vừa update firmware?
- Vừa đổi network?
- Vừa thêm card PCIe?
- Vừa thực hiện maintenance?
Trong nhiều trường hợp, đây là cách nhanh nhất để thu hẹp phạm vi.
Chỉ can thiệp phần cứng khi đã khoanh vùng
Nếu cần tháo lắp DIMM, card hoặc drive, phải thực hiện đúng quy trình shutdown, ESD và hướng dẫn service của HPE.
Maintenance and Service Guide riêng cho DL380 Gen11 được HPE cập nhật đến tháng 6/2026 và là tài liệu nên được đối chiếu khi thực hiện thao tác phần cứng.
Checklist phòng ngừa lỗi khi vận hành HPE DL380 Gen11
- Theo dõi iLO 6 thường xuyên.
- Kiểm tra IML định kỳ.
- Thiết lập cảnh báo phần cứng.
- Theo dõi tình trạng drive và RAID.
- Kiểm tra backup bằng restore test, không chỉ nhìn trạng thái job.
- Kiểm tra nhiệt độ rack và airflow.
- Theo dõi PSU và nguồn điện.
- Quản lý firmware theo maintenance window.
- Kiểm tra compatibility trước khi nâng RAM, drive, controller hoặc NIC.
- Ghi lại mọi thay đổi cấu hình.
- Lưu BOM và serial/part number của linh kiện.
- Tải AHS Log trước khi xử lý những lỗi phức tạp.
- Chuẩn bị kế hoạch rollback cho thay đổi firmware.
- Không thực hiện nhiều thay đổi cùng lúc khi đang troubleshooting.

Xử lý sự cố HPE DL380 Gen11 và hỗ trợ kỹ thuật cùng NSTECH
Khi HPE ProLiant DL380 Gen11 xuất hiện cảnh báo, điều quan trọng không phải là thay linh kiện càng nhanh càng tốt mà là xác định đúng thành phần gây lỗi và hạn chế rủi ro cho dữ liệu cũng như workload đang vận hành.
Với các vấn đề liên quan đến RAM, ổ đĩa, RAID, storage controller, firmware, nguồn hoặc khả năng tương thích linh kiện, doanh nghiệp nên cung cấp đầy đủ cấu hình hiện tại, triệu chứng, IML/AHS Log và những thay đổi gần nhất để kỹ thuật viên có đủ dữ liệu khoanh vùng.
NSTECH có thể hỗ trợ doanh nghiệp kiểm tra cấu hình HPE DL380 Gen11, lựa chọn linh kiện thay thế hoặc nâng cấp, rà soát khả năng tương thích và tư vấn phương án xử lý phù hợp với hệ thống đang vận hành. Với hệ thống production hoặc dữ liệu quan trọng, nên ưu tiên chẩn đoán có kiểm soát và chuẩn bị phương án backup trước khi thực hiện thay đổi phần cứng.
Liên hệ NSTECH để trao đổi tình trạng máy chủ HPE ProLiant DL380 Gen11, kiểm tra cấu hình hiện tại và tư vấn phương án xử lý hoặc nâng cấp phù hợp.
NSTECH – CÔNG TY CỔ PHẦN NSTECH VIỆT NAM
Website: https://nstech.vn/
Hotline: 09 3333 5554
Email: ducnh@nstech.vn
Văn Phòng TPHCM: 419/2N Phan Xích Long, Phường Đức Nhuận, Tp.Hồ Chí Minh
Văn Phòng Hà Nội: Tầng 6 Số 95 Phố Hoàng Cầu, Phường Đống Đa, Thành phố Hà Nội
Văn Phòng Đà Nẵng: Số 36 đường Nguyễn Cư Trinh, Phường Hòa Cường, TP Đà Nẵng
Văn Phòng Quảng Ngãi: Số 02 Võ Thị Sáu, Phường Cẩm Thành, TP Quảng Ngãi

Tôi là Hoàng Đức – CEO Công ty Cổ phần NSTECH Việt Nam. Với nhiều năm kinh nghiệm trong lĩnh vực hạ tầng máy chủ và giải pháp công nghệ, tôi định hướng NSTECH không chỉ là đơn vị cung cấp thiết bị, mà là đối tác chiến lược giúp doanh nghiệp xây dựng nền tảng IT ổn định, an toàn và bền vững.


