การตรวจสอบ Load Average ของเซิร์ฟเวอร์
งานนี้ช่วยตรวจจับการโหลดเกินของเซิร์ฟเวอร์ Linux โดยใช้ค่าเฉลี่ยโหลดระบบ ไม่ใช่แค่เปอร์เซ็นต์ CPU
สำหรับประเภทงานนี้ต้องใช้แพ็กเกจ PRO
ฟิลด์ของฟอร์ม
| ฟิลด์ | ความหมาย | ควรระบุอะไร | ตัวอย่าง |
|---|---|---|---|
| ชื่อ | ชื่อการตรวจสอบ | ระบุว่าเป็นการตรวจสอบค่าโหลดเฉลี่ยของเซิร์ฟเวอร์ใด | Load Average production-เซิร์ฟเวอร์ |
| กลุ่ม | ช่วยจัดงานให้อยู่ในโปรเจกต์หรือหมวดหมู่ | เลือกกลุ่มหากต้องการให้งานของโปรเจกต์อยู่ด้วยกัน | โปรเจกต์หลัก |
| Load Average สูงสุด | เกณฑ์ค่าโหลดเฉลี่ยสำหรับแจ้งเตือน | ระบุค่าพิจารณาจำนวนคอร์และโหลดปกติของเซิร์ฟเวอร์ | 4 |
| ไทม์เอาต์ | ความล่าช้าที่ยอมรับได้ในการรับข้อมูลจากสคริปต์ | เว้นระยะเผื่อการทำงานปกติของสคริปต์ | 5 นาที |
| ช่วงเวลา | ความถี่ที่ค่าการโหลดจะถูกส่งมา | เลือกความถี่ที่ตรงกับการรันสคริปต์ | 1 นาที |
| ช่องทางแจ้งเตือน | ที่ส่งข้อความเกี่ยวกับปัญหาและการกู้คืน | เลือกช่องทางที่คุณอ่านการแจ้งเตือนจริง | Telegram และอีเมล |
| รายงาน | สรุปรายงานตามรอบของงาน | เปิดใช้งานหากต้องการรับภาพรวมโดยไม่ต้องเข้าหน้าจอด้วยตัวเอง | รายงานรายสัปดาห์ |
เมื่อจะได้รับการแจ้งเตือน
- หากค่า Load Average เกินเกณฑ์ที่ระบุ
- หากสคริปต์เซิร์ฟเวอร์ไม่ส่งข้อมูลทันเวลา
การตั้งค่าการแจ้งเตือน
สำหรับแต่ละช่องทางแจ้งเตือนในงาน สามารถกำหนดพารามิเตอร์เพิ่มเติมได้ พารามิเตอร์เหล่านี้ใช้ได้เฉพาะกับเหตุการณ์ DOWN
| พารามิเตอร์ | ทำอะไร |
|---|---|
| เปิดใช้งาน | อนุญาตหรือห้ามการส่งการแจ้งเตือนผ่านช่องทางนี้สำหรับงานนี้ |
| เลื่อน PRO | ชักการแจ้งเตือน DOWN ครั้งแรกไปตามเวลาที่เลือก (สูงสุด 12 ชั่วโมง) สะดวกสำหรับไม่รับการแจ้งเตือนจากปัญหาชั่วคราว |
| ทำซ้ำทุก PRO | ทำซ้ำการแจ้งเตือนเป็นระยะขณะที่งานยังอยู่ในสถานะ DOWN (สูงสุด 1 ชั่วโมงระหว่างการทำซ้ำ) เหมาะสำหรับกรณีที่สำคัญไม่ให้พลาดปัญหายืดเยื้อ |
พารามิเตอร์ «เลื่อน» และ «ทำซ้ำ» ไม่มีผลต่อเหตุการณ์ UP และการแจ้งเตือนการกู้คืน