Règles d'alerte et configuration des notifications
Configurez les règles d'alerte par hôte pour le CPU, la mémoire, le disque, la charge moyenne et la température. Définissez les défauts globaux et les fenêtres de durée pour éviter les alertes intempestives.
Watchflare envoie une notification lorsqu’une métrique franchit un seuil ou lorsqu’un hôte passe hors ligne. Les alertes sont évaluées toutes les 30 secondes et configurées par hôte. Les notifications vont à l’adresse e-mail configurée dans Settings → Notifications (par défaut, l’e-mail du premier compte) et vers tous les canaux de notification que vous avez configurés.
Pour un aperçu conceptuel de la façon dont les alertes, les incidents et les notifications fonctionnent ensemble, voir Alertes et notifications.
Remarque
L’envoi d’e-mails exige que le SMTP soit configuré. Voir Notifications e-mail.
Remarque
Les canaux de notification (Discord, Slack, Telegram, Matrix, Ntfy, Gotify, SMTP, HTTP générique, et d’autres) se configurent dans la même page Settings > Notifications. Voir Canaux de notification.
Types d’alertes
| Type | Description | Unité |
|---|---|---|
host_down | Aucun heartbeat reçu depuis plus de 15 secondes | Aucune |
cpu_usage | L’usage CPU dépasse le seuil | % |
memory_usage | L’usage mémoire dépasse le seuil | % |
disk_usage | L’usage disque dépasse le seuil | % |
load_avg | La charge moyenne 1 minute dépasse le seuil | Aucune |
load_avg_5 | La charge moyenne 5 minutes dépasse le seuil | Aucune |
load_avg_15 | La charge moyenne 15 minutes dépasse le seuil | Aucune |
temperature | La température CPU dépasse le seuil | °C |
Configurer les alertes
Défauts globaux
Allez dans Settings → Alerts pour définir les seuils par défaut qui s’appliquent à tous les hôtes. Ce sont les valeurs de référence pour chaque nouvel hôte.
Surcharges par hôte
- Ouvrez la page de détail d’un hôte.
- Cliquez sur l’onglet Alerts.
- Basculez les types d’alerte que vous souhaitez activer et définissez le seuil pour chaque hôte.
- Les modifications sont enregistrées immédiatement, sans étape de confirmation.
Les règles par hôte priment sur les défauts globaux. Vous pouvez par exemple définir un seuil CPU plus élevé sur un serveur de base de données que sur un hôte statique peu chargé.
Fenêtre de durée
Chaque règle d’alerte a une durée (par défaut : 5 minutes). Le seuil doit être dépassé de façon continue pendant cette durée avant qu’un incident s’ouvre et qu’une notification soit envoyée. Cela évite les alertes intempestives dues à de brefs pics.
Si la métrique redescend sous le seuil avant que la durée ne s’écoule, aucun incident n’est ouvert et aucune notification n’est envoyée.
Fonctionnement des incidents
Lorsqu’un dépassement de métrique est maintenu pendant la durée configurée, le Hub ouvre un incident :
- Une notification est envoyée lorsque l’incident s’ouvre (seuil franchi).
- Une seconde notification est envoyée lorsque l’incident se résout (la métrique redescend sous le seuil, ou l’hôte revient en ligne).
Les incidents sont visibles dans l’onglet Alerts de la page de détail de chaque hôte, avec l’heure de début, l’heure de résolution, la valeur du seuil et la valeur qui a déclenché le dépassement.
Détection d’hôte hors ligne
L’alerte host_down se déclenche lorsqu’aucun heartbeat n’a été reçu depuis plus de 15 secondes. Le contrôle des hôtes inactifs s’exécute toutes les 10 secondes, et un hôte est marqué hors ligne après environ 3 heartbeats consécutifs manqués (intervalle de heartbeat : 5 secondes).
L’incident se résout automatiquement lorsque le heartbeat suivant arrive.
Astuce
Les brèves interruptions réseau de moins de 15 secondes ne déclenchent pas d’alerte host_down. Un ou deux heartbeats manqués sont absorbés avant que l’hôte ne passe hors ligne.
Alertes de température
La collecte de température ne s’exécute que sur les hôtes physiques. Elle est ignorée sur les VM et les conteneurs où l’accès aux capteurs matériels n’est pas disponible, donc activer une alerte de température sur une VM ne se déclenchera jamais.