Présentiel et distanciel
5 jours (35 heures)

Supervision et maintien en condition opérationnelle d'un système IT

Une panne qui dure plusieurs jours sans qu'aucune alerte ne remonte n'est pas un incident technique isolé : c'est un défaut de conception de la supervision. Cette formation construit la chaîne complète, de l'instrumentation du parc à la gestion d'incident structurée, en passant par des alertes réellement actionnables et un inventaire tenu à jour.

Objectifs de la formation

  • Définir une stratégie de supervision alignée sur les enjeux de service.
  • Déployer une plateforme de supervision, de métriques et de visualisation.
  • Instrumenter serveurs, hyperviseurs, cloud, stockage et équipements réseau.
  • Concevoir des alertes actionnables et maîtriser la fatigue d'alerte.
  • Centraliser et corréler les journaux d'un parc hétérogène.
  • Structurer la gestion d'incident et le cycle de vie des correctifs.

Public concerné

  • Responsables de l'exploitation IT et de la continuité de service.
  • Administrateurs systèmes et réseau.
  • Équipes d'astreinte et de support.

Prérequis

  • Administration système Linux ou Windows.
  • Compréhension des réseaux TCP/IP et notions de virtualisation.

Programme détaillé

Jour 1 — Fondamentaux de la supervision

  • Enjeux, observabilité et les trois piliers : métriques, journaux, traces
  • Architectures de collecte, protocoles et panorama des solutions
  • Déploiement de la plateforme : Zabbix, Prometheus et Grafana

Jour 2 — Instrumentation du parc

  • Métriques système, niveau de correctifs, licences et certificats
  • Supervision de la virtualisation, d'OpenStack, de Ceph et des conteneurs
  • Découverte automatique de ressources et validation de la collecte

Jour 3 — Alertes et journalisation

  • Conception d'alertes actionnables, corrélation et gestion du bruit
  • Tableaux de bord d'astreinte et tableaux de bord de direction
  • Journalisation centralisée, normalisation des formats et corrélation

Jour 4 — Maintien en condition opérationnelle

  • Inventaire du parc, cycle de vie et indicateurs de conformité
  • Politique de correctifs Windows et Linux, mise à jour sans interruption
  • Supervision de la chaîne de sauvegarde et tests de restauration

Jour 5 — Gestion d'incident et synthèse

  • Processus de gestion d'incident, gravité et chaîne d'escalade
  • Analyse de cause racine et rédaction d'un rapport d'incident
  • Exercice de crise, procédures d'exploitation et plan d'amélioration

Certification

À l'issue de cette formation, vous recevrez une attestation de participation délivrée par ECINTELLIGENCE.

Sur devis

Durée

5 jours (35 heures)

Modalité

Présentiel et distanciel

Prochaine session

Sur demande

Demander un devis

Autres formations qui pourraient vous intéresser

Administration Linux 1 — les fondamentaux de l'exploitation d'un serveur

Présentiel et distanciel

Linux est le socle sur lequel reposent le cloud, le stockage distribué et les plateformes conteneurisées. Les difficultés rencontrées sur …

5 jours (35 heures) En savoir plus

Administration Linux 2 — automatisation, sécurité et stockage

Présentiel et distanciel

Passer d'un serveur administré à un parc réellement exploité suppose d'automatiser les gestes répétitifs, de journaliser ce qui se produit, …

5 jours (35 heures) En savoir plus

Prêt à développer vos compétences ?

Rejoignez des centaines de professionnels qui ont fait confiance à ECINTELLIGENCE pour leur montée en compétences.

Voir toutes nos formations