สถานะรายการที่เฝ้าดู 245 รายการ
- ปกติ198 (80.8%)
- มีคำเตือน40 (16.3%)
- วิกฤต7 (2.9%)
198 + 40 + 7 = 245 รายการ ✓ · 80.8 + 16.3 + 2.9 = 100.0% ✓ (ต้นแบบคำนวณถูก)
ต้นแบบแสดง "สุขภาพระบบ: ปกติ" ในการ์ดใหญ่ ทั้งที่ผังนี้ระบุว่ามีรายการวิกฤต 7 รายการ — และรายการแจ้งเตือนด้านล่างระบุว่ารายการหนึ่งยังไม่ได้แก้ · ระบบที่สรุปว่าปกติทั้งที่มีรายการวิกฤตค้างอยู่ ทำให้ผู้ดูแลที่ดูแค่การ์ดใหญ่ไม่รู้ว่าต้องทำอะไร ซึ่งเป็นรูปแบบเดียวกับที่พบในหน้า System Monitoring AI ระดับแพลตฟอร์ม
ค่าเฉลี่ยกับค่าสูงสุด ค่าเฉลี่ยกลบรายการที่มีปัญหา
| ทรัพยากร | ค่าเฉลี่ย | ค่าสูงสุด | เครื่องที่สูงสุด | สถานะจริง |
|---|---|---|---|---|
| หน่วยประมวลผล | 28.6% | 67% | เครื่องฐานข้อมูล | เฝ้าระวัง |
| หน่วยความจำ | 45.3% | 82% | เครื่องแอปพลิเคชัน | เฝ้าระวัง |
| พื้นที่ดิสก์ | 61.7% | 92% | เครื่องฐานข้อมูล | วิกฤต · ยังไม่แก้ |
| ปริมาณข้อมูลเครือข่าย | 42.6 Mbps | 78.4 Mbps | เครื่องแอปพลิเคชัน | ปกติ |
| เวลาตอบสนอง | 186 ms | 2,140 ms | เกตเวย์ API | เกินเกณฑ์ 2 วินาที |
ต้นแบบแสดงเฉพาะค่าเฉลี่ย ซึ่งกลบเครื่องที่มีปัญหาไปหมด — การใช้ดิสก์เฉลี่ย 61.7% ติดป้ายว่าปกติ ขณะที่รายการแจ้งเตือนบนหน้าเดียวกันระบุว่าเครื่องฐานข้อมูลใช้ดิสก์เกิน 90% และยังไม่ได้แก้ · ดิสก์ที่เต็มทำให้ฐานข้อมูลหยุดเขียนได้ทันที ซึ่งเป็นการหยุดแบบไม่มีสัญญาณเตือนล่วงหน้าสำหรับผู้ใช้ · ในการเฝ้าระวังระบบ ค่าที่มีความหมายคือค่าสูงสุด ไม่ใช่ค่าเฉลี่ย เพราะสิ่งที่ทำให้ระบบล่มคือเครื่องที่แย่ที่สุด ไม่ใช่เครื่องเฉลี่ย
กฎการตรวจสอบที่ตั้งไว้ 109 กฎ ครอบคลุม 245 รายการ
| หมวด | จำนวนกฎ | รายการที่ครอบคลุม | ตัวอย่างเกณฑ์ |
|---|---|---|---|
| ตรวจแอปพลิเคชัน | 32 | 68 | เวลาตอบสนองเกิน 2 วินาที |
| ตรวจเครือข่าย | 24 | 52 | ปริมาณข้อมูลเกิน 80% ของช่องสัญญาณ |
| ตรวจเซิร์ฟเวอร์ | 18 | 46 | หน่วยประมวลผลเกิน 80% นานเกิน 5 นาที |
| ตรวจความปลอดภัย | 15 | 38 | พยายามเข้าระบบล้มเหลวเกิน 5 ครั้ง |
| ตรวจฐานข้อมูล | 12 | 28 | พื้นที่ดิสก์เกิน 90% |
| ตรวจบันทึกกิจกรรม | 8 | 13 | พบข้อความแสดงข้อผิดพลาดรูปแบบที่กำหนด |
| รวม | 109 | 245 |
18 + 32 + 12 + 24 + 8 + 15 = 109 กฎ ✓ · ครอบคลุม 46 + 68 + 28 + 52 + 13 + 38 = 245 รายการ ✓
ต้นแบบแสดงจำนวนกฎ 109 ข้อในกล่องล่าง และจำนวนรายการที่เฝ้าดู 245 ในการ์ดบน โดยไม่บอกความสัมพันธ์ — ทำให้ดูเหมือนตัวเลขขัดกัน · ความจริงคือกฎหนึ่งข้อใช้กับหลายรายการได้ เช่นกฎ "หน่วยประมวลผลเกิน 80%" ใช้กับเซิร์ฟเวอร์ทุกเครื่อง · เขียนกำกับทั้งสองค่าแล้ว
รายการแจ้งเตือนที่ยังไม่แก้ 7 รายการวิกฤต
รายการแรกเป็นรายการเดียวที่ต้นแบบระบุว่า "ยังไม่แก้ไข" แต่ก็ยังแสดงสุขภาพระบบว่าปกติ · เมื่อดิสก์ของฐานข้อมูลเต็ม ระบบจะหยุดเขียนข้อมูลทันทีโดยไม่มีการเตือนผู้ใช้ รายการที่ผู้ใช้กำลังบันทึกจะหายไป และการสำรองข้อมูลรอบถัดไปก็จะล้มเหลวด้วย · รายการที่สี่ตรงกับการเชื่อมต่อที่ล้มเหลวในหน้า Integration Settings ซึ่งแสดงว่าระบบเฝ้าระวังจับได้ แต่ทั้งสองหน้าไม่ได้เชื่อมข้อมูลกัน ทำให้ผู้ดูแลต้องไปดูสองที่
ต้นแบบ — ข้อมูลตัวอย่าง · ค่าที่ตั้งในโมดูลนี้มีผลกับองค์กรนี้เท่านั้น ตัวเลขบนหน้าจึงเป็นคนละฐานกับโมดูล Super Admin ที่นับทั้งแพลตฟอร์ม · หน้านี้แก้จากต้นแบบ 3 จุด "สุขภาพระบบ: ปกติ" ทั้งที่มีรายการวิกฤต 7 รายการค้างอยู่ ซึ่งเป็นรูปแบบเดียวกับที่พบในหน้า System Monitoring AI ระดับแพลตฟอร์ม · ค่าเฉลี่ยกลบรายการที่วิกฤต — ต้นแบบแสดงการใช้ดิสก์เฉลี่ย 61.7% พร้อมป้ายว่าปกติ ขณะที่รายการแจ้งเตือนระบุว่าเครื่องหนึ่งใช้ดิสก์เกิน 90% และยังไม่ได้แก้ · จำนวนกฎการตรวจสอบรวมได้ 109 แต่การ์ดระบุรายการที่เฝ้าดู 245 ซึ่งเป็นคนละอย่าง — กฎหนึ่งข้อใช้กับหลายรายการได้