องค์ประกอบสุขภาพระบบ ค่าเฉลี่ย 98.9%
(99.2 + 99.1 + 99.0 + 98.9 + 98.6 + 98.5) ÷ 6 = 592.3 ÷ 6 = 98.883 → 98.9% ✓
ต้นแบบแสดง 98.7% ทั้งที่ค่าเฉลี่ยขององค์ประกอบทั้งหกที่วางอยู่รอบ ๆ คือ 98.9% — ต่างกันเพียง 0.2 จุดซึ่งดูเล็กน้อย แต่เมื่อตัวเลขสรุปไม่ตรงกับส่วนประกอบที่แสดงข้างกัน ผู้ดูแลจะเริ่มไม่เชื่อทั้งหน้า · และคำว่า "Excellent" ถูกถอดออก ระบบที่มีการแจ้งเตือนระดับวิกฤตค้างอยู่ไม่ควรถูกสรุปด้วยคำเดียวว่าดีเยี่ยม ค่าเฉลี่ยที่สูงเกิดจากการเฉลี่ยที่กลบปัญหาเฉพาะจุด
สถานะโครงสร้างพื้นฐาน 283 หน่วย
| ประเภท | ทั้งหมด | ปกติ | เฝ้าระวัง | สถานะ |
|---|---|---|---|---|
| เว็บเซิร์ฟเวอร์ | 34 | 34 | 0 | ปกติทั้งหมด |
| เซิร์ฟเวอร์แอปพลิเคชัน | 62 | 61 | 1 | APP-SEA-01 ใช้ CPU สูง |
| คลัสเตอร์ฐานข้อมูล | 12 | 12 | 0 | ปกติทั้งหมด |
| เซิร์ฟเวอร์แคช | 8 | 8 | 0 | ปกติทั้งหมด |
| คิวข้อความ | 6 | 6 | 0 | ปกติทั้งหมด |
| เซิร์ฟเวอร์จัดเก็บข้อมูล | 18 | 18 | 0 | ปกติทั้งหมด |
| โหนดประมวลผล AI | 16 | 15 | 1 | ตอบสนองช้าเกินเกณฑ์ |
| โหนดกระจายเนื้อหา | 128 | 128 | 0 | ปกติทั้งหมด |
| รวม | 283 | 281 | 2 |
34 + 62 + 12 + 8 + 6 + 18 + 16 + 128 = 283 หน่วย ✓ · ปกติ 281 + เฝ้าระวัง 2 = 283 ✓ ตรงกับจำนวนเหตุการณ์ที่ยังไม่ปิด
ต้นแบบแสดงทุกกลุ่มเป็น "ปกติทั้งหมด" รวมทั้งเซิร์ฟเวอร์แอปพลิเคชัน 62 จาก 62 ทั้งที่หน้าเดียวกันมีการแจ้งเตือนสองรายการที่ยังไม่ปิด คือ CPU สูงผิดปกติที่เครื่องหนึ่ง และเวลาตอบสนองเกินเกณฑ์ที่โหนด AI อีกเครื่อง · เมื่อรายการนับจำนวนไม่สอดคล้องกับรายการแจ้งเตือน ผู้ดูแลจะเชื่อรายการที่ดูสบายใจกว่า ระบบนี้จึงผูกทั้งสองส่วนเข้าด้วยกัน เครื่องที่มีการแจ้งเตือนค้างจะถูกย้ายออกจากคอลัมน์ปกติโดยอัตโนมัติ
บริการที่ตอบสนองช้าที่สุด เทียบเกณฑ์ที่ตั้งไว้
| บริการ | เวลาตอบสนอง | เกณฑ์ | สถานะ |
|---|---|---|---|
| บริการยืนยันตัวตน | 124 มิลลิวินาที | 300 | ปกติ |
| เกตเวย์ API | 165 มิลลิวินาที | 300 | ปกติ |
| บริการผู้ใช้ | 198 มิลลิวินาที | 300 | ปกติ |
| บริการ AI Agent | 245 มิลลิวินาที | 300 | ใกล้เกณฑ์ |
| บริการรายงาน | 310 มิลลิวินาที | 300 | เกินเกณฑ์ |
| บริการแจ้งเตือน | 512 มิลลิวินาที | 300 | เกินเกณฑ์มาก |
เพิ่มคอลัมน์เกณฑ์ที่ต้นแบบไม่มี — ต้นแบบติดป้าย “Good” และ “Warning” ให้แต่ละบริการโดยไม่บอกว่าใช้เกณฑ์อะไร ทำให้บริการที่ 245 มิลลิวินาทีถูกติดป้ายเตือนขณะที่ 198 มิลลิวินาทีติดป้ายปกติ โดยผู้อ่านไม่รู้ว่าเส้นแบ่งอยู่ตรงไหน · เมื่อเขียนเกณฑ์ไว้ ทุกแถวตรวจสอบได้เองและผู้ดูแลรู้ว่าต้องแก้ให้ถึงเท่าไร
การใช้ทรัพยากรและการคาดการณ์
ต้นแบบแสดง "AI Prediction Score 92/100 เสี่ยงต่ำ" คู่กับการแจ้งเตือนระดับวิกฤตที่ยังไม่ปิด — ระบบที่มีบริการหนึ่งตอบสนองช้ากว่าเกณฑ์ 68% อยู่ในขณะนั้น ไม่ควรถูกสรุปว่าความเสี่ยงต่ำ · คะแนนคาดการณ์วัดความน่าจะเป็นที่จะเกิดปัญหาในอนาคต ไม่ได้วัดปัญหาที่กำลังเกิดอยู่ สองอย่างนี้ต่างกันและไม่ควรวางไว้ในการ์ดเดียวกันโดยไม่แยก ระบบนี้จึงแยกเป็นสองส่วนคือรายการที่ยังไม่ปิด และรายการที่คาดว่าจะเกิด
ต้นแบบ — ข้อมูลตัวอย่าง · ข้อมูลจัดชั้น C5 — Super Admin เข้าถึงข้อมูลของทุกองค์กรได้ ทุกการกระทำถูกบันทึกและตรวจสอบย้อนหลังได้เสมอ · หน้านี้แก้จากต้นแบบ 3 จุด สุขภาพระบบ 98.7% ไม่เท่ากับค่าเฉลี่ยขององค์ประกอบทั้งหกที่แสดงข้างกันเอง (98.9%) · "Application Servers 62/62 Healthy" ขัดกับการแจ้งเตือนบนหน้าเดียวกัน ที่ระบุว่าเครื่องหนึ่งใช้ CPU สูงกว่าปกติ 35% เครื่องที่มีการแจ้งเตือนค้างอยู่ไม่ควรถูกนับว่าปกติ · และ"AI Prediction Score 92/100 เสี่ยงต่ำ" แสดงคู่กับการแจ้งเตือนระดับวิกฤตที่ยังไม่ปิด ซึ่งขัดกันเอง