Polarys
Monitoring et supervision : les bases/Superviser au-delà des machines

Superviser au-delà des machines

Mesurer ce que vit l'utilisateur

Le paradoxe du tableau vert

Toutes les machines répondent, les processeurs sont détendus, la mémoire respire, et les utilisateurs ne peuvent pas travailler.

Cette situation est fréquente parce que la supervision d'infrastructure mesure la santé des composants, pas la disponibilité du service. Entre les deux se glissent le réseau, le certificat expiré, la dépendance externe en panne, la configuration erronée déployée le matin.

La règle qui en découle : si vous ne mesurez qu'une chose, mesurez le service depuis l'extérieur.

La sonde externe, ce qu'elle doit faire

Pas simplement répondre à un test réseau élémentaire : ce test réussit sur une machine dont l'application est morte.

Une sonde utile exécute un parcours réel, dans cet ordre de valeur :

  1. charger une vraie page et vérifier qu'elle contient un élément attendu
  2. suivre un parcours court : ouvrir une session de test, atteindre une page qui interroge la base
  3. mesurer le temps de ce parcours, pas seulement son succès

Le troisième point est celui qui prévient : une dégradation progressive du temps de réponse annonce une panne des jours avant qu'elle n'arrive.

Depuis où mesurer

Depuis l'extérieur de votre infrastructure, obligatoirement. Une sonde hébergée sur le même réseau que le service ne verra pas la panne du lien.

Depuis plusieurs endroits si les utilisateurs sont dispersés. Un service peut être inaccessible depuis un site et joignable depuis un autre, et cette information oriente immédiatement le diagnostic.

Le compte de test mérite une précaution : dédié, à privilèges minimaux, clairement identifié, pour que ses connexions ne polluent ni les statistiques ni les analyses de sécurité.

Le certificat, panne annoncée et pourtant subie

Un certificat expiré rend un service inaccessible d'un coup, à une date connue des mois à l'avance. C'est la panne la plus évitable qui existe, et elle se produit régulièrement.

Deux alertes, pas une : à trente jours et à sept jours. La première laisse le temps d'agir, la seconde rattrape l'oubli de la première.

Le renouvellement automatique ne dispense pas de la surveillance : ce sont souvent les renouvellements automatiques silencieusement cassés qui produisent l'expiration.

Les dépendances externes

Votre service dépend de fournisseurs : paiement, messagerie, authentification, stockage. Leur panne devient la vôtre aux yeux de l'utilisateur.

Surveillez-les comme le reste, et surtout notez, pour chacune, ce que votre application fait quand la dépendance ne répond pas. Le comportement souhaitable est une dégradation lisible, pas une page blanche.

À retenir

Mesurez le service depuis l'extérieur, avec un parcours réel et un temps mesuré. Surveillez les certificats à trente et sept jours, y compris les renouvellements automatiques. Et sachez ce que fait votre application quand une dépendance tombe.

Quiz de validation

Quiz - 3 questions

1. Pourquoi une sonde hébergée sur le même réseau que le service est-elle insuffisante ?

2. Quelle mesure prévient une panne plusieurs jours à l'avance ?

3. Pourquoi surveiller un certificat dont le renouvellement est automatique ?

Suis ta progression

Crée un compte gratuit pour suivre ta progression et accéder à toutes les leçons.