การกล่าวอ้างที่ไม่มีหลักฐาน ตัวชี้วัดที่ต้นแบบไม่มีเลย
สำคัญที่สุด| ประเภทงาน | อัตราที่พบ | เกณฑ์ | ผลกระทบเมื่อเกิด |
|---|---|---|---|
| สรุปเอกสารและสัญญา | 3.8% | ไม่เกิน 1.0% | อ้างเลขข้อที่ไม่มีในเอกสาร |
| ตอบคำถามจากฐานความรู้ | 2.6% | ไม่เกิน 1.0% | ตอบด้วยข้อมูลที่ไม่มีในแหล่งอ้างอิง |
| วิเคราะห์ตัวเลขและแนวโน้ม | 1.9% | ไม่เกิน 0.5% | สร้างตัวเลขที่ไม่ได้มาจากข้อมูลจริง |
| ร่างเอกสารตามแม่แบบ | 1.2% | ไม่เกิน 1.0% | ใส่เงื่อนไขที่ไม่ได้อยู่ในแม่แบบ |
| จัดหมวดและติดป้ายข้อมูล | 0.4% | ไม่เกิน 1.0% | จัดผิดหมวด |
| เฉลี่ยถ่วงน้ำหนัก | 2.4% | ไม่เกิน 1.0% |
ต้นแบบไม่มีตัวชี้วัดนี้เลย ทั้งที่ผู้ใช้ระบุไว้ในโครงสร้างหน้านี้ · ความแม่นยำ 93.6% กับการกล่าวอ้างที่ไม่มีหลักฐาน 2.4% เป็นคนละเรื่อง ตัวแรกวัดว่าตอบถูกกี่ครั้ง ตัวหลังวัดว่าตอบผิดแบบที่ฟังดูน่าเชื่อกี่ครั้ง · คำตอบที่ระบบบอกว่า “ไม่ทราบ” ไม่เป็นอันตราย แต่คำตอบที่อ้างเลขข้อในสัญญาซึ่งไม่มีอยู่จริง จะถูกนำไปใช้ตัดสินใจโดยไม่มีใครตรวจ · งานสรุปเอกสารและสัญญามีอัตราสูงสุดที่ 3.8% ซึ่งเป็นงานที่โมดูล Legal ใช้อยู่ทุกวัน ระบบจึงบังคับให้ทุกคำตอบอ้างเลขหน้าและเลขข้อ เพื่อให้ทนายความตรวจย้อนได้ทันที
ประสิทธิภาพ 5 มิติ ค่าเฉลี่ย 91.6%
(94.1 + 93.6 + 91.2 + 90.3 + 88.7) ÷ 5 = 458.0 ÷ 5 = 91.6%
ต้นแบบแสดง "ประสิทธิภาพรวม 93.6%" ตรงกลางผัง ซึ่งเป็นค่าเดียวกับความแม่นยำพอดี — เมื่อค่ารวมเท่ากับค่าของมิติหนึ่งเป๊ะ ๆ มักหมายความว่าเอาค่านั้นมาแสดงแทนค่ารวม · ค่าเฉลี่ยจริงของทั้งห้ามิติคือ 91.6% ซึ่งต่ำกว่าและสะท้อนภาพรวมมากกว่า · มิติที่ต่ำที่สุดคือความครอบคลุมของงานที่ทำได้ 88.7% แปลว่ามีงานราว 11% ที่ผู้ใช้ขอแล้วระบบทำไม่ได้ ซึ่งเป็นตัวเลขที่ควรใช้วางแผนพัฒนามากกว่าค่าเฉลี่ยรวม
ค่าใช้จ่ายแยกตามผู้ให้บริการโมเดล 1,245,680 บาทต่อเดือน
- ผู้ให้บริการ A฿ 542,120 (43.6%)
- ผู้ให้บริการ B฿ 321,450 (25.8%)
- ผู้ให้บริการ C฿ 210,340 (16.9%)
- โมเดลที่ฝึกเอง฿ 98,650 (7.9%)
- อื่น ๆ฿ 73,120 (5.8%)
542,120 + 321,450 + 210,340 + 98,650 + 73,120 = ฿1,245,680 ✓ · 43.6 + 25.8 + 16.9 + 7.9 + 5.8 = 100.0% ✓
ใช้ชื่อทั่วไปแทนชื่อผู้ให้บริการจริง — ต้นแบบระบุชื่อผู้ให้บริการโมเดลและชื่อรุ่นจริงทั้งหมด ซึ่งขัดกับข้อความในแถบล่างของทุกหน้าที่ระบุว่าแพลตฟอร์มนี้ยังไม่ได้ผูกกับผู้ให้บริการโมเดลรายใด · เมื่อเชื่อมต่อจริงแล้วค่อยใส่ชื่อ พร้อมกับข้อตกลงการประมวลผลข้อมูลที่ระบุว่าห้ามนำข้อมูลไปฝึกโมเดล
ความพึงพอใจของผู้ใช้ จากผู้ตอบ 2,156 คน
(5×68 + 4×24 + 3×6 + 2×1 + 1×1) ÷ 100 = 457 ÷ 100 = 4.57 → 4.6 ✓
ต้นแบบแสดงคะแนนเฉลี่ย 4.7 ทั้งที่การกระจายดาวบนหน้าเดียวกันคำนวณได้ 4.57 — ต่างกัน 0.13 ซึ่งดูเล็กน้อยแต่ตรวจย้อนไม่ได้ · และหน้า Super Admin Strategy ระบุความพึงพอใจ 4.8 ซึ่งเป็นค่าที่สามที่ต่างออกไปอีก · เมื่อตัวเลขเดียวกันมีสามค่าในสามหน้า ผู้บริหารจะไม่รู้ว่าค่าไหนใช้อ้างอิงได้
การแจ้งเตือนด้านประสิทธิภาพ
รายการแรกควรเป็นรายการที่ปิดก่อนรายการอื่นทั้งหมด — ต้นแบบจัดลำดับการแจ้งเตือนโดยเอาความแม่นยำขึ้นก่อน แต่การกล่าวอ้างที่ไม่มีหลักฐานเป็นปัญหาที่ผู้ใช้ตรวจไม่ได้ด้วยตัวเอง ต่างจากความแม่นยำต่ำที่ผู้ใช้มักรู้สึกได้ · ตัวเลข 3.8% ในงานสรุปเอกสารหมายความว่าในทุก 100 ครั้งที่ AI สรุปสัญญา มีเกือบ 4 ครั้งที่อ้างสิ่งที่ไม่มีในเอกสาร ซึ่งในบริบทของโมดูล Legal เป็นความเสี่ยงที่ยอมรับไม่ได้
ต้นแบบ — ข้อมูลตัวอย่าง · ข้อมูลจัดชั้น C5 — Super Admin เข้าถึงข้อมูลของทุกองค์กรได้ ทุกการกระทำถูกบันทึกและตรวจสอบย้อนหลังได้เสมอ · หน้านี้แก้จากต้นแบบ 4 จุด ที่สำคัญที่สุดคือต้นแบบไม่มีตัวชี้วัดการกล่าวอ้างที่ไม่มีหลักฐานเลย ทั้งที่ผู้ใช้ระบุไว้ในโครงสร้าง และเป็นตัวชี้วัดที่สำคัญที่สุดของระบบ AI เพราะคำตอบที่ผิดแต่ฟังดูน่าเชื่ออันตรายกว่าคำตอบที่ระบบบอกว่าตอบไม่ได้ · คะแนนความพึงพอใจ 4.7 ไม่ตรงกับการกระจายดาวบนหน้าเดียวกัน ซึ่งคำนวณถ่วงน้ำหนักได้ 4.57 · "ประสิทธิภาพรวม 93.6%" เท่ากับค่าความแม่นยำพอดี ขณะที่ค่าเฉลี่ยของ 5 มิติที่แสดงคือ 91.6% · และ"AI Agents 48" ขัดกับ 2,568 ในหน้า AI Agent Management