Les missions du poste


Le besoinContexte & EnjeuxDans le cadre du renforcement d'une équipe dédiée à l'Observabilité et à la Fiabilité du Système d'Information, nous recherchons un Ingénieur de Production expérimenté spécialisé en Site Reliability Engineering (SRE).Vous intégrerez une équipe en charge de garantir la disponibilité, la performance, la résilience et l'observabilité d'un SI critique à grande échelle, composé de plusieurs milliers de serveurs, d'environnements conteneurisés et d'applications distribuées.La mission s'inscrit dans une démarche d'amélioration continue visant à renforcer la qualité de service, automatiser les opérations de production et optimiser la supervision des plateformes.MissionsAu sein de l'équipe Observabilité & Fiabilité, vous serez notamment en charge de :Assurer le maintien en conditions opérationnelles des infrastructures, plateformes et services.Garantir le respect des objectifs de disponibilité et de qualité de service.Surveiller les environnements de production et assurer le diagnostic ainsi que la résolution des incidents.Participer aux dispositifs d'astreinte (1 semaine sur 5 comprenant soirées, week-ends et jours fériés).Analyser les événements de production, coordonner les interventions avec les différentes équipes techniques et assurer le suivi des incidents.Anticiper les incidents grâce à l'analyse des tendances, des capacités et des signaux faibles.Réaliser les analyses post-incidents (RCA) et piloter les actions de fiabilisation.Concevoir, maintenir et faire évoluer les tableaux de bord, indicateurs et solutions d'observabilité.Optimiser les mécanismes d'alerting afin de réduire le bruit opérationnel.Participer aux cellules de crise et aux processus de gestion des incidents majeurs.Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités de production.Rédiger et maintenir la documentation technique ainsi que les procédures d'exploitation.Être force de proposition dans l'amélioration continue des pratiques de production.Environnement techniqueSupervision / ObservabilitéPrometheusGrafanaCentreonSplunkTempoConteneurisationKubernetesDockerSystèmesLinuxWindowsBases de donnéesPostgreSQLMariaDBMiddlewareJBossSpring BootDéveloppement & ScriptingPythonShell LinuxArchitectureArchitectures distribuéesMicroservicesCloud / Hybrid CloudVMwareMéthodologiesSite Reliability Engineering (SRE)ITILDevOpsAgileEnvironnement de productionLe périmètre couvre notamment :Environ 8 000 serveursDeux datacenters et un site de secoursEnviron 160 applications JavaEnvironnements virtualisés VMwareDéploiements KubernetesSupervision 24/7Astreinte :1 semaine sur 5En semaine : 18h30 à 00h30Week-end : 08h00 à 19h00Informations complémentairesLocalisation : Saint-Jean-de-Braye (45)Durée : 24 mois fermes renouvelables 12 moisCharge estimée : environ 630 joursDémarrage prévisionnel : Septembre 2026

Le profil recherché

Profil recherchéProfil recherchéVous justifiez d'une expérience significative en ingénierie de production ou en Site Reliability Engineering et disposez des compétences suivantes :Expertise techniqueMaîtrise des pratiques SRETrès bonne maîtrise des outils de supervision, monitoring, logs, métriques, traces et alertingSolide expérience de Kubernetes et des environnements conteneurisésBonne connaissance des architectures distribuées et des microservicesExpérience des environnements Cloud et hybridesCompétences en automatisation et pratiques DevOpsBonne maîtrise du scripting Python et Shell LinuxConnaissance des environnements Linux, Windows, PostgreSQL, MariaDB, JBoss et Spring BootCompétences fonctionnellesDiagnostic d'incidents complexesGestion des incidents majeursAnalyse des causes racines (RCA)Gestion des événements selon les pratiques ITIL/SREForte autonomieExcellentes qualités de communication écrites et oralesEsprit collaboratifCapacité à documenter et formaliser les procéduresForce de proposition dans les démarches d'amélioration continue

Compétences requises

  • Docker
  • SGBD
  • VMWare
  • Python
  • Java
  • Amélioration continue
  • Shell
  • Autonomie
  • ITIL
  • JBoss
  • Kubernetes
  • PostgreSQL
  • Création d'une base documentaire
  • Grafana
  • Windows
  • Monitoring
  • Force de proposition
  • Système d'information
  • Linux
  • Centreon
  • Analyse des causes
  • Prometheus
  • Spring Boot
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Recherches similaires

L’emploi par métier dans le domaine Production à Orléans