Supervision et maintien en condition opérationnelle d'un système IT
Une panne qui dure plusieurs jours sans qu'aucune alerte ne remonte n'est pas un incident technique isolé : c'est un défaut de conception de la supervision. Cette formation construit la chaîne complète, de l'instrumentation du parc à la gestion d'incident structurée, en passant par des alertes réellement actionnables et un inventaire tenu à jour.
Objectifs de la formation
- Définir une stratégie de supervision alignée sur les enjeux de service.
- Déployer une plateforme de supervision, de métriques et de visualisation.
- Instrumenter serveurs, hyperviseurs, cloud, stockage et équipements réseau.
- Concevoir des alertes actionnables et maîtriser la fatigue d'alerte.
- Centraliser et corréler les journaux d'un parc hétérogène.
- Structurer la gestion d'incident et le cycle de vie des correctifs.
Public concerné
- Responsables de l'exploitation IT et de la continuité de service.
- Administrateurs systèmes et réseau.
- Équipes d'astreinte et de support.
Prérequis
- Administration système Linux ou Windows.
- Compréhension des réseaux TCP/IP et notions de virtualisation.
Programme détaillé
Jour 1 — Fondamentaux de la supervision
- Enjeux, observabilité et les trois piliers : métriques, journaux, traces
- Architectures de collecte, protocoles et panorama des solutions
- Déploiement de la plateforme : Zabbix, Prometheus et Grafana
Jour 2 — Instrumentation du parc
- Métriques système, niveau de correctifs, licences et certificats
- Supervision de la virtualisation, d'OpenStack, de Ceph et des conteneurs
- Découverte automatique de ressources et validation de la collecte
Jour 3 — Alertes et journalisation
- Conception d'alertes actionnables, corrélation et gestion du bruit
- Tableaux de bord d'astreinte et tableaux de bord de direction
- Journalisation centralisée, normalisation des formats et corrélation
Jour 4 — Maintien en condition opérationnelle
- Inventaire du parc, cycle de vie et indicateurs de conformité
- Politique de correctifs Windows et Linux, mise à jour sans interruption
- Supervision de la chaîne de sauvegarde et tests de restauration
Jour 5 — Gestion d'incident et synthèse
- Processus de gestion d'incident, gravité et chaîne d'escalade
- Analyse de cause racine et rédaction d'un rapport d'incident
- Exercice de crise, procédures d'exploitation et plan d'amélioration
Certification
À l'issue de cette formation, vous recevrez une attestation de participation délivrée par ECINTELLIGENCE.
Autres formations qui pourraient vous intéresser
Administration Linux 1 — les fondamentaux de l'exploitation d'un serveur
Présentiel et distancielLinux est le socle sur lequel reposent le cloud, le stockage distribué et les plateformes conteneurisées. Les difficultés rencontrées sur …
Administration Linux 2 — automatisation, sécurité et stockage
Présentiel et distancielPasser d'un serveur administré à un parc réellement exploité suppose d'automatiser les gestes répétitifs, de journaliser ce qui se produit, …
Prêt à développer vos compétences ?
Rejoignez des centaines de professionnels qui ont fait confiance à ECINTELLIGENCE pour leur montée en compétences.
Voir toutes nos formations