8 heures, 26 minutes ago

Operateur Monitoring & Observabilité

1. Présentation de l’ETNIC

L’ETNIC (Entreprise pour les Technologies de l’Information et de la Communication) est l’opérateur informatique de la Fédération Wallonie-Bruxelles. Organisme d’intérêt public, l’ETNIC a pour mission de concevoir, développer, maintenir et faire évoluer les systèmes d’information et les infrastructures technologiques au service des administrations et établissements de la FWB.

Acteur central de la transformation numérique du secteur public francophone belge, l’ETNIC intervient dans des domaines variés tels que :

  • La gestion des infrastructures IT (réseaux, sécurité, data centers, cloud),
  • Le développement d’applications métiers sur mesure,
  • L’accompagnement des projets digitaux (analyse fonctionnelle, UX/UI, gestion de projet),
  • La cybersécurité et la protection des données,
  • Le support utilisateurs et la formation.

Dans un souci constant d’innovation, de performance et de service public, l’ETNIC collabore régulièrement avec des partenaires externes pour renforcer ses équipes à travers des missions de consultance IT. Ces collaborations s’inscrivent dans un cadre éthique, professionnel et orienté vers la qualité et l’impact concret des solutions livrées.

2. Mission

Zabbix – Administration et exploitation

  • Maîtriser l’ensemble de l’environnement Zabbix : création et maintenance de dashboards, maps réseau, triggers, items et templates
  • Configurer et ajuster les seuils d’alerte (triggers) selon les besoins métier et techniques, y compris via macros utilisateur et triggers dépendants pour limiter le bruit
  • Créer et maintenir des templates de supervision réutilisables (items, macros, LLD, low-level discovery)
  • Concevoir et maintenir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon les cas d’usage
  • Développer des scripts de discovery personnalisés (LLD) pour l’auto-découverte d’équipements et de services
  • Diagnostiquer les faux positifs, alertes bruyantes et anomalies de collecte (proxy, pollers, timeouts) en coordination avec les équipes techniques sous la supervision du responsable
  • Assurer le suivi quotidien des alertes actives et leur qualification (incident réel vs bruit)
  • Configurer et maintenir les intégrations Zabbix ↔ ServiceNow (remontée automatique d’incidents) et Zabbix ↔ outils de notification
  • Administrer l’architecture Zabbix distribuée (proxies, serveurs, haute disponibilité) et en assurer la performance
  • Participer à l’évolution de l’architecture de supervision (proxies, intégrations SNMP v2/v3, API VMware, NetFlow, etc.)
  • Réaliser des analyses de causes racines (RCA) sur des incidents complexes multi-couches (réseau, système, application, stockage) à la demande des équipes techniques
  • Maîtriser le module Services de Zabbix (Business Service Monitoring) : construction d’arbres de services hiérarchiques, agrégation d’états (SLA/SLO) à partir des triggers, calcul et suivi du taux de disponibilité par service métier
  • Modéliser des services applicatifs de bout en bout en associant les composants techniques (hosts, triggers) aux services métier concernés, pour une vision orientée utilisateur/business plutôt que purement infrastructure
  • Configurer les problem tags et les règles de propagation d’état pour un mapping fidèle entre incidents techniques et impact sur les services
  • Exploiter les rapports de SLA générés par le module Services pour alimenter le reporting mensuel et les revues de disponibilité

Oh Dear – Surveillance des sites web

  • Mettre en place et maintenir la surveillance technique des sites web sur Oh Dear (disponibilité, certificats SSL, performance, uptime, broken links, mixed content)
  • Configurer les alertes (email, webhooks, intégrations tierces) et vérifier quotidiennement l’état des sites supervisés
  • Exploiter l’API REST d’Oh Dear pour l’extraction de données et l’intégration avec les outils de reporting (Power BI, un plus)
  • Assurer le suivi des incidents détectés et leur remontée aux équipes concernées, avec analyse d’impact

ServiceNow – Gestion des tickets et incidents

  • Vérifier quotidiennement les incidents créés dans ServiceNow liés au monitoring et en assurer la qualification technique
  • Prendre en charge l’ensemble des demandes des équipes IT arrivant via notre catalogue de demande dans ServiceNow et par email
  • Qualifier, prioriser (selon impact/urgence) et traiter les demandes liées au monitoring reçues via ServiceNow ou par email
  • Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte (VMware, réseau) et la résolution des conflits d’identification
  • Assurer un suivi rigoureux jusqu’à la clôture des tickets, avec documentation des actions menées

Observabilité

  • Participer à l’amélioration continue de l’observabilité des services IT en combinant les informations issues du monitoring, des logs, des événements et des outils de supervision
  • Contribuer à la définition et à l’évolution des indicateurs de santé, de disponibilité et de performance des services métiers
  • Corréler les alertes, métriques, événements et données techniques afin de faciliter l’identification rapide des causes d’incidents
  • Participer à la réduction du bruit opérationnel par l’amélioration des règles de supervision, des seuils d’alerte et des mécanismes de corrélation
  • Collaborer avec les équipes infrastructure, réseau, applications et intégration afin d’améliorer la visibilité de bout en bout des services critiques

Reporting

  • Identifier les incidents récurrents et tendances observées au travers des outils de monitoring et des rapports d’exploitation
  • Produire un rapport mensuel de monitoring (disponibilité, incidents, tendances, actions correctives, KPI/SLA) pour les bénéficiaires et le management et à la demande
  • Automatiser la production des rapports via scripts et API (Zabbix API, Oh Dear API, ServiceNow API) pour fiabiliser et accélérer le reporting
  • Construire et maintenir des tableaux de bord de pilotage (Power BI, un plus, ou équivalent) pour le management et les équipes techniques si besoin

Réseau, API & Automatisation

  • Diagnostiquer les incidents de connectivité et de collecte (SNMP, syslog, NetFlow, routage, ACL, VLAN, pare-feu)
  • Développer et maintenir des scripts d’automatisation (Python/Bash) pour les checks de supervision, les LLD discovery scripts et le traitement de données (ex. export/traitement CSV/Excel)
  • Consommer et intégrer des API REST entre les différents outils de l’écosystème (Zabbix, ServiceNow, Oh Dear, Power BI si nécessaire)
  • Contribuer à l’intégration applicative entre les systèmes (flux de données, formats JSON/XML) pour fiabiliser la chaîne de supervision de bout en bout
  • Documenter les procédures techniques et diagnostics (schémas, guides opérationnels)

Culture DevOps

  • Appliquer les bonnes pratiques CI/CD pour le versioning et le déploiement des configurations de supervision (templates, dashboards)
  • Utiliser Git pour la gestion de versions des scripts et configurations
  • Contribuer à l’automatisation de l’infrastructure de supervision via des approches Infrastructure as Code (Ansible, Terraform)
  • Participer à la conteneurisation d’outils de supervision (Docker) le cas échéant
  • Maintenir la documentation technique et opérationnelle (wiki) ainsi que les articles de la knowledge base (KB)
  • Assurer le transfert de connaissances vers les équipes support et exploitation

En tant que consultant, vous êtes soumis aux mêmes conditions de travail que notre personnel interne, soit un mode hybride alliant présentiel et télétravail, avec un minimum obligatoire de 50 % de présence dans nos bureaux.

La mission est en français exclusivement.

3. Activités

Assurer l’administration, l’exploitation et l’évolution des outils de monitoring et d’observabilité, sous la supervision du responsable Monitoring & CMDB. Les activités comprennent :

  • Administrer Zabbix : création et maintenance des dashboards, maps réseau, items, triggers et templates, automatisation de la découverte et optimisation de l’architecture de supervision
  • Modéliser et superviser les services métier et applicatifs de bout en bout, notamment via le module Services de Zabbix, afin d’évaluer l’impact des incidents et de suivre la disponibilité et les engagements SLA/SLO
  • Assurer la surveillance des sites web avec Oh Dear : disponibilité, certificats SSL, performance et anomalies
  • Qualifier et traiter les alertes, incidents et demandes de monitoring dans ServiceNow, assurer leur suivi jusqu’à la clôture et contribuer à la fiabilité de la CMDB
  • Améliorer l’observabilité en corrélant métriques, logs et événements, en réduisant les alertes inutiles et en contribuant au diagnostic des incidents avec les équipes techniques
  • Développer les intégrations entre outils et automatiser les contrôles, la collecte de données et le reporting à l’aide d’API REST et de scripts Python/Bash
  • Produire les rapports de disponibilité et de performance, analyser les incidents récurrents et maintenir les tableaux de bord de pilotage
  • Appliquer les pratiques Git, CI/CD et Infrastructure as Code, maintenir la documentation technique et assurer le transfert de connaissances aux équipes support et exploitation

Apply for this Job

This position was originally posted on Pro Unity.

It is publicly accessible, and we recommend applying directly through the Pro Unity website instead of going through third party recruiters.

Newsletter signup illustration