Đối với quản trị viên hệ thống:XRISS DDR4 32GB 2666MHz RDIMM ECC là một mô-đun thay thế và mở rộng cho hệ sinh thái bộ nhớ máy chủ ECC đã đăng ký DDR4.Dưới đây là các thủ tục xác minh và giám sát mà chúng tôi đề nghị cho việc triển khai doanh nghiệp.
RDIMM này sử dụng các IC DRAM được tổ chức x4 với ECC 72 bit đầy đủ (64 dữ liệu + 8 ECC).cho phép hoạt động toàn tốc độ với tất cả các kênh bộ nhớ được lấp đầyMỗi mô-đun vượt qua một 72 giờ đốt trong 55 ° C với kiểm tra liên tục ECC lỗi tiêm trước khi vận chuyển,đảm bảo rằng không chỉ các chip DRAM mà cả chip đăng ký và đường dẫn tín hiệu liên quan đều đáng tin cậy trong điều kiện nhiệt trung tâm dữ liệu bền vững.
Đối với các cụm VMware vSphere, mô-đun này đã được xác nhận trong các cấu hình vSAN flash toàn bộ, nơi lỗi bộ nhớ có thể làm hỏng lớp lưu trữ vSAN. Đối với Proxmox VE với ZFS,bảo vệ ECC đảm bảo tính toán tổng kiểm tra trên bộ nhớ cache ARC là chính xác có thể kiểm chứngĐối với các máy chủ cơ sở dữ liệu bằng kim loại cởi mở chạy PostgreSQL hoặc MySQL với các hồ bơi đệm lớn,ECC ngăn chặn kịch bản hư hỏng dữ liệu im lặng khi một lỗi một bit trong bể đệm lan sang đĩa trong thời gian kiểm tra tiếp theo.
Q1. Làm thế nào để tôi theo dõi tỷ lệ lỗi ECC trên một máy chủ Linux đang chạy để phát hiện các vấn đề bộ nhớ trước khi chúng gây ra thời gian ngừng hoạt động?
A: Cài đặt và cấu hình rasdaemon (RAS - độ tin cậy, tính sẵn có, dịch vụ daemon) có sẵn trong kho lưu trữ của tất cả các bản phân phối Linux lớn.`ras-mc-ctl --summary` hiển thị số lỗi có thể sửa và không thể sửa cho mỗi DIMMMột lỗi có thể sửa chữa mỗi tháng là bình thường và dự kiến do bức xạ nền.xu hướng gia tăng từ 1 lỗi/tháng đến 1 lỗi/tuần đến 1 lỗi/ngày cho thấy pin DRAM đang suy giảm và mô-đun nên được thay thế chủ động. Hầu hết các máy chủ BMC (iDRAC, iLO, XClarity) cũng theo dõi lỗi bộ nhớ và có thể được cấu hình để gửi bẫy SNMP hoặc cảnh báo email khi tỷ lệ lỗi có thể điều chỉnh vượt quá ngưỡng có thể cấu hình.Đối với VMware ESXi, giám sát sức khỏe phần cứng của vCenter cung cấp chức năng tương đương thông qua nhà cung cấp CIM.
Q2. RDIMM này có thể được sử dụng trong một bo mạch chủ máy tính để bàn tiêu dùng hỗ trợ ECC (như một số bo mạch ASRock hoặc ASUS)?
A: Không. RDIMM (DIMM đã đăng ký) không tương thích điện với bo mạch chủ máy tính để bàn của người tiêu dùng.Các chip đệm đăng ký trên mô-đun đòi hỏi hỗ trợ cụ thể từ bộ điều khiển bộ nhớ và BIOS, chỉ có trên máy chủ và nền tảng máy trạm làm việc (Intel Xeon E5/E7/Scalable, AMD EPYC và một số dòng Intel Xeon E-2300 với chipset C256).Các bo mạch chủ tiêu dùng quảng cáo hỗ trợ ECC (thường là AMD AM4/AM5 với bộ xử lý Ryzen không phải APU) yêu cầu ECC UDIMM (DIMM không đệm với ECC), không phải RDIMM. sản phẩm ECC UDIMM của chúng tôi (55610999) là mô-đun chính xác cho các nền tảng đó. cài đặt một RDIMM trong một khe cắm UDIMM sẽ dẫn đến một trạng thái không có POST và không có thiệt hại,nhưng hệ thống chỉ đơn giản là sẽ không khởi động.
Q3. Sự khác biệt giữa tổ chức DRAM x4 và x8 cho bộ nhớ máy chủ là gì và tại sao nó quan trọng?
A: Tổ chức x4 có nghĩa là mỗi chip DRAM đóng góp 4 bit cho mỗi từ dữ liệu, yêu cầu 18 chip cho một từ ECC 72 bit (64 dữ liệu + 8 ECC). Tổ chức x8 sử dụng 8 bit mỗi chip, chỉ yêu cầu 9 chip.Tổ chức x4 là tiêu chuẩn cho bộ nhớ máy chủ doanh nghiệp vì nó cung cấp khả năng phục hồi lỗi chip vượt trội: nếu một chip x4 bị lỗi hoàn toàn, chỉ có 4 bit dữ liệu bị ảnh hưởng, và động cơ ECC có thể lý thuyết sửa chữa điều này (khả năng 'chipkill' hoặc SDDC).vượt quá khả năng điều chỉnh ECC 8-bit và dẫn đến lỗi không thể sửa chữa. Mô-đun này sử dụng các IC DRAM được tổ chức x4, đó là lý do tại sao nó phù hợp với việc triển khai máy chủ quan trọng trong nhiệm vụ, nơi yêu cầu khả năng phục hồi lỗi chip duy nhất.
Q4. Máy chủ của chúng tôi đã chạy trong 3 năm mà không có một lỗi ECC. Điều này có nghĩa là ECC không thực sự làm gì?
A: Không có nghĩa là ECC đang hoạt động hoàn hảo và im lặng sửa lỗi mà bạn không bao giờ cần phải biết về. tỷ lệ lỗi DRAM là thống kê:một hệ thống ở mực nước biển với 256GB DDR4 trải nghiệm khoảng 0.5-2 lỗi có thể sửa chữa mỗi ngày trung bình Thực tế là bạn đã không thấy bất kỳ lỗi báo cáo có thể có nghĩa là:(1) Giám sát của bạn không được cấu hình để báo cáo lỗi có thể sửa chữa (kiểm tra cấu hình rasdaemon), (2) máy chủ của bạn nằm trong một môi trường bức xạ nền thấp (trung tâm dữ liệu ngầm, vỏ bọc chì), (3) lô DRAM cụ thể của bạn có đặc điểm lỗi tốt hơn mức trung bình,hoặc (4) lỗi chỉ đơn giản là dưới ngưỡng báo cáo của thiết lập giám sát cụ thể của bạnKhông có lỗi được báo cáo không phải là bằng chứng cho thấy ECC là không cần thiết mà là bằng chứng cho thấy hệ thống hoạt động đúng.Lần đầu tiên bạn thấy một lỗi không thể sửa chữa mà ECC phát hiện (ngăn chặn sự tham nhũng dữ liệu im lặng có thể làm giảm cơ sở dữ liệu hoặc hệ thống tệp) là khi giá trị của ECC trở nên rõ ràng.
Q5. Tôi có thể sử dụng mô-đun này để mở rộng bộ nhớ trong máy chủ Dell PowerEdge hiện đang sử dụng bộ nhớ được chứng nhận bởi Dell?
Đáp: Vâng, hỗ trợ trộn XRISS RDIMM với bộ nhớ được chứng nhận bởi Dell, mặc dù cho hiệu suất tối ưu chúng tôi khuyên bạn nên làm theo hướng dẫn dân số của máy chủ của bạn cho các cấu hình cân bằng.Các cân nhắc chính: (1) Khớp với tốc độ: nếu bộ nhớ hiện tại của bạn là 2666MHz, mô-đun này sẽ hoạt động ở 2666MHz; nếu hiện có là 2400MHz, tất cả các mô-đun sẽ hoạt động ở 2400MHz;(2) Khớp tổ chức cấp bậc (một cấp độ so với. hai bậc) khi có thể, vì trộn các bậc có thể ảnh hưởng đến sự xen kẽ bộ nhớ;(3) Máy chủ Dell PowerEdge có thể ghi lại một sự kiện không quan trọng 'không được chứng nhận bộ nhớ Dell được phát hiện' trong nhật ký Lifecycle Controller.Chính sách bảo hành của Dell không yêu cầu sử dụng bộ nhớ được chứng nhận của Dell.