Le paradoxe du tableau vert
Toutes les machines répondent, les processeurs sont détendus, la mémoire respire, et les utilisateurs ne peuvent pas travailler.
Cette situation est fréquente parce que la supervision d'infrastructure mesure la santé des composants, pas la disponibilité du service. Entre les deux se glissent le réseau, le certificat expiré, la dépendance externe en panne, la configuration erronée déployée le matin.
La règle qui en découle : si vous ne mesurez qu'une chose, mesurez le service depuis l'extérieur.
La sonde externe, ce qu'elle doit faire
Pas simplement répondre à un test réseau élémentaire : ce test réussit sur une machine dont l'application est morte.
Une sonde utile exécute un parcours réel, dans cet ordre de valeur :
- charger une vraie page et vérifier qu'elle contient un élément attendu
- suivre un parcours court : ouvrir une session de test, atteindre une page qui interroge la base
- mesurer le temps de ce parcours, pas seulement son succès
Le troisième point est celui qui prévient : une dégradation progressive du temps de réponse annonce une panne des jours avant qu'elle n'arrive.
Depuis où mesurer
Depuis l'extérieur de votre infrastructure, obligatoirement. Une sonde hébergée sur le même réseau que le service ne verra pas la panne du lien.
Depuis plusieurs endroits si les utilisateurs sont dispersés. Un service peut être inaccessible depuis un site et joignable depuis un autre, et cette information oriente immédiatement le diagnostic.
Le compte de test mérite une précaution : dédié, à privilèges minimaux, clairement identifié, pour que ses connexions ne polluent ni les statistiques ni les analyses de sécurité.
Le certificat, panne annoncée et pourtant subie
Un certificat expiré rend un service inaccessible d'un coup, à une date connue des mois à l'avance. C'est la panne la plus évitable qui existe, et elle se produit régulièrement.
Deux alertes, pas une : à trente jours et à sept jours. La première laisse le temps d'agir, la seconde rattrape l'oubli de la première.
Le renouvellement automatique ne dispense pas de la surveillance : ce sont souvent les renouvellements automatiques silencieusement cassés qui produisent l'expiration.
Les dépendances externes
Votre service dépend de fournisseurs : paiement, messagerie, authentification, stockage. Leur panne devient la vôtre aux yeux de l'utilisateur.
Surveillez-les comme le reste, et surtout notez, pour chacune, ce que votre application fait quand la dépendance ne répond pas. Le comportement souhaitable est une dégradation lisible, pas une page blanche.
À retenir
Mesurez le service depuis l'extérieur, avec un parcours réel et un temps mesuré. Surveillez les certificats à trente et sept jours, y compris les renouvellements automatiques. Et sachez ce que fait votre application quand une dépendance tombe.