Domain manager informatique (IT)

STHREE SAS
Paris

Missions principales Le Domain Manager a pour mission de garantir la stabilité, la performance et la disponibilité des services sur les environnements de production et hors production, tout en promouvant une culture orientée fiabilité au sein des équipes. À ce titre, il : S'assure que les évolutions produits respectent les exigences de qualité avant leur mise en production. Maintient un équilibre entre innovation, rapidité de livraison et robustesse opérationnelle. Travaille en étroite collaboration avec les équipes Produit, Techniques et Plateforme afin d'améliorer continuellement la résilience des services. Responsabilités Fiabilité et observabilité Définir, suivre et communiquer les Service Level Objectives (SLOs). Mettre en place et piloter les Service Level Indicators (SLIs) et les Error Budgets. Garantir la mise en ?uvre et l'amélioration continue des dispositifs d'observabilité, de monitoring et d'alerting sur l'ensemble du domaine applicatif. Gouvernance des mises en production Superviser la préparation opérationnelle des releases. Assurer la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Techniques. Disposer d'un rôle de validation finale des mises en production et pouvoir bloquer une livraison lorsque les indicateurs qualité ne sont pas alignés avec les attentes des utilisateurs. Gestion des incidents et amélioration continue Piloter la gestion des incidents. Organiser et animer les analyses de causes racines (Root Cause Analysis). Conduire les revues post-mortem afin de renforcer la responsabilisation des équipes et l'amélioration continue. Résilience et optimisation Collaborer avec les équipes Plateforme et les équipes spécialisées en observabilité, performance et optimisation des coûts. Renforcer la résilience des systèmes. Contribuer à l'amélioration de l'efficacité opérationnelle et à la maîtrise des coûts d'exploitation. Pilotage et coordination Produire un reporting régulier sur la fiabilité des services, les risques identifiés et les plans d'amélioration. Fournir une visibilité claire aux responsables de programme, managers et parties prenantes métier. Participer activement aux cérémonies de pilotage Agile en portant les enjeux de fiabilité, de qualité et d'exploitation. Profil candidat: Profil recherché Compétences techniques Expertise confirmée en Site Reliability Engineering (SRE) dans des environnements SaaS ou cloud-native. Maîtrise des concepts d'observabilité, d'automatisation et des outils de supervision. Expérience significative dans la définition et le pilotage de SLOs, SLIs et Error Budgets en collaboration avec les équipes d'ingénierie. Bonne maîtrise des pratiques DevSecOps, des chaînes CI/CD et du monitoring continu. Compétences fonctionnelles Solide expérience en gestion d'incidents et préparation opérationnelle. Capacité démontrée à coordonner des initiatives de fiabilité impliquant des équipes Produit, Techniques et Plateforme. Forte sensibilité aux indicateurs de performance, à la prévention des causes racines et à la gouvernance opérationnelle. Qualités personnelles Esprit analytique et approche orientée données. Rigueur dans le suivi des indicateurs et la prise de décision. Excellentes capacités de coordination et de communication transverse. Culture de l'amélioration continue et de l'excellence opérationnelle. Points clés à retenir Poste orienté SRE / fiabilité opérationnelle. Rôle transverse entre les équipes Produit, Tech et Plateforme. Responsabilité forte sur la qualité des mises en production avec un véritable pouvoir de validation. Pilotage des SLO/SLI, observabilité, incidents et amélioration continue. Environnement SaaS / Cloud Native avec forte maturité DevSecOps.

Publié le 2026-08-21