Aller au contenu
Toutes les réalisations
  • Architecture
  • Réseau

Supervision et sauvegardes sans angle mort

Métriques, journaux, alertes jusqu'au téléphone, et des sauvegardes chiffrées en trois copies — dont une hors site et une sur disque amovible.

Le problème

Des pannes qui tournent en silence pendant des semaines : une sauvegarde qui ne se fait plus, une synchronisation qui échoue, un service qui s’arrête « proprement » sans rien produire. On ne les découvre qu’en allant regarder — c’est-à-dire trop tard.

Ce que j’ai fait

  • Quatre étages de surveillance qui se couvrent les uns les autres : une alerte immédiate pour chaque tâche en échec sur chaque machine, un balayage quotidien du parc (tâches disparues, planifications en retard, sauvegardes périmées), les métriques et journaux centralisés, et une veille hebdomadaire des versions : ce qui a vieilli en amont, et les failles publiées (CVE) qui visent les versions réellement installées.
  • Des alertes jusqu’au téléphone, et des tableaux de bord générés par du code, donc jamais perdus.
  • Des sauvegardes chiffrées application par application, chacune avec un compte de stockage restreint à son seul emplacement, sur un stockage versionné qui refuse la suppression définitive.
  • Trois copies : locale, hors site, et sur disques amovibles en rotation quotidienne, dont l’un est toujours hors des murs.
  • Des témoins qui prouvent que chaque archive est bien arrivée à destination, et pas seulement qu’elle est partie.

Le résultat

Une panne silencieuse devient un message le jour même. Une sauvegarde qui ne se fait plus devient une alerte le lendemain matin. [À VALIDER : nombre de chaînes de sauvegarde et de machines supervisées]