Watchflare docs
Sur cette page

Règles d'alerte et configuration des notifications

Configurez les règles d'alerte par hôte pour le CPU, la mémoire, le disque, la charge moyenne et la température. Définissez les défauts globaux et les fenêtres de durée pour éviter les alertes intempestives.

Watchflare envoie une notification lorsqu’une métrique franchit un seuil ou lorsqu’un hôte passe hors ligne. Les alertes sont évaluées toutes les 30 secondes et configurées par hôte. Les notifications vont à l’adresse e-mail configurée dans Settings → Notifications (par défaut, l’e-mail du premier compte) et vers tous les canaux de notification que vous avez configurés.

Pour un aperçu conceptuel de la façon dont les alertes, les incidents et les notifications fonctionnent ensemble, voir Alertes et notifications.

Remarque

L’envoi d’e-mails exige que le SMTP soit configuré. Voir Notifications e-mail.

Remarque

Les canaux de notification (Discord, Slack, Telegram, Matrix, Ntfy, Gotify, SMTP, HTTP générique, et d’autres) se configurent dans la même page Settings > Notifications. Voir Canaux de notification.


Types d’alertes

TypeDescriptionUnité
host_downAucun heartbeat reçu depuis plus de 15 secondesAucune
cpu_usageL’usage CPU dépasse le seuil%
memory_usageL’usage mémoire dépasse le seuil%
disk_usageL’usage disque dépasse le seuil%
load_avgLa charge moyenne 1 minute dépasse le seuilAucune
load_avg_5La charge moyenne 5 minutes dépasse le seuilAucune
load_avg_15La charge moyenne 15 minutes dépasse le seuilAucune
temperatureLa température CPU dépasse le seuil°C

Configurer les alertes

Défauts globaux

Allez dans Settings → Alerts pour définir les seuils par défaut qui s’appliquent à tous les hôtes. Ce sont les valeurs de référence pour chaque nouvel hôte.

Surcharges par hôte

  1. Ouvrez la page de détail d’un hôte.
  2. Cliquez sur l’onglet Alerts.
  3. Basculez les types d’alerte que vous souhaitez activer et définissez le seuil pour chaque hôte.
  4. Les modifications sont enregistrées immédiatement, sans étape de confirmation.

Les règles par hôte priment sur les défauts globaux. Vous pouvez par exemple définir un seuil CPU plus élevé sur un serveur de base de données que sur un hôte statique peu chargé.


Fenêtre de durée

Chaque règle d’alerte a une durée (par défaut : 5 minutes). Le seuil doit être dépassé de façon continue pendant cette durée avant qu’un incident s’ouvre et qu’une notification soit envoyée. Cela évite les alertes intempestives dues à de brefs pics.

Si la métrique redescend sous le seuil avant que la durée ne s’écoule, aucun incident n’est ouvert et aucune notification n’est envoyée.


Fonctionnement des incidents

Lorsqu’un dépassement de métrique est maintenu pendant la durée configurée, le Hub ouvre un incident :

  1. Une notification est envoyée lorsque l’incident s’ouvre (seuil franchi).
  2. Une seconde notification est envoyée lorsque l’incident se résout (la métrique redescend sous le seuil, ou l’hôte revient en ligne).

Les incidents sont visibles dans l’onglet Alerts de la page de détail de chaque hôte, avec l’heure de début, l’heure de résolution, la valeur du seuil et la valeur qui a déclenché le dépassement.


Détection d’hôte hors ligne

L’alerte host_down se déclenche lorsqu’aucun heartbeat n’a été reçu depuis plus de 15 secondes. Le contrôle des hôtes inactifs s’exécute toutes les 10 secondes, et un hôte est marqué hors ligne après environ 3 heartbeats consécutifs manqués (intervalle de heartbeat : 5 secondes).

L’incident se résout automatiquement lorsque le heartbeat suivant arrive.

Astuce

Les brèves interruptions réseau de moins de 15 secondes ne déclenchent pas d’alerte host_down. Un ou deux heartbeats manqués sont absorbés avant que l’hôte ne passe hors ligne.


Alertes de température

La collecte de température ne s’exécute que sur les hôtes physiques. Elle est ignorée sur les VM et les conteneurs où l’accès aux capteurs matériels n’est pas disponible, donc activer une alerte de température sur une VM ne se déclenchera jamais.