Site Reliability Engineer Sre - Observabilité et Fiabilité H/F - ITS Services
- CDI
- Télétravail accepté
- ITS Services
Les missions du poste
About Us : À propos d'ITS ServicesITS Services, entité d'ITS Group, est spécialisée dans le domaine des Infrastructures & Opérations IT avec + de 1 000 experts en ingénierie & MCO des services On Premise, Cloud, DevOps et Cybersécurité en France et en BelgiqueNos expertises : Infrastructure IT, Opérations IT, Cybersécurité Opérationnelle, ObservabilitéITS Services met au coeur de ses préoccupations son engagement RSE en développant un numérique durable et responsable et en valorisant l'épanouissement professionnel et personnel de ses collaborateurs.En savoir plus : https://www.itsservices.fr
About the Job :Au sein de la Direction Relation Client et Production, le SRE intègre le pôle Observabilité et Fiabilité, dont la mission est de garantir la disponibilité, la performance, la résilience et l'observabilité du Système d'Information.Missions :Maintien en conditions opérationnellesAssurer le MCO des services, infrastructures et plateformes conformément aux objectifs de disponibilité et de qualité de serviceParticiper au dispositif d'astreinte (1 semaine sur 5), incluant soirs, week-ends et jours fériésSupervision et traitement des incidentsSurveiller et analyser les événements, alertes et incidents de productionDiagnostiquer, traiter et coordonner les incidents avec les équipes concernéesParticiper aux cellules d'incident et de criseAnticipation et fiabilisationAnticiper les incidents par l'analyse des tendances, des capacités et des signaux faiblesRéaliser les analyses post-incidents (RCA - Root Cause Analysis)Piloter les plans d'actions de fiabilisationObservabilitéMaintenir et faire évoluer les tableaux de bord, indicateurs et alertesRéduire le bruit opérationnel en optimisant les règles d'alertingAmélioration continueContribuer à l'automatisation, l'industrialisation et la simplification de l'exploitationMaintenir et enrichir la documentation, procédures et référentielsParticiper aux démarches d'amélioration continue de la productionDispositif d'astreinte 24/7Lundi au vendredi : 18h30 - 0h30Samedi et dimanche : 8h - 19hRythme : 1 semaine sur 5Compétences techniques requisesSite Reliability Engineering (SRE) : maîtrise des concepts et pratiquesSupervision / Observabilité : très bonne maîtrise de Prometheus, Grafana, Splunk (monitoring, logs, traces, métriques, alerting)Conteneurisation : forte aisance sur Kubernetes (environnements conteneurisés et orchestrés)Systèmes : Linux, WindowsSGBD : PostgreSQL, MariaDBSocle applicatif : JBoss / Spring BootScripting : Python, Shell LinuxArchitectures : distribuées, microservices, infrastructures modernes Cloud/HybridesAutomatisation & DevOps : expérience confirmée des pratiques DevOpsGestion des incidents : ITIL / SRE, capacité à diagnostiquer et résoudre des incidents complexesFourchette de salaire :entre 50 K€ et 55 K€ About You :About the Process :Un premier rendez-vous pour faire connaissanceUn entretien RHUn entretien TechniqueUne proposition salarialeAbout « les petits + d'ITS SERVICES » :Chez nous :On coopte : prime de cooptation de 2000 €On transmet : communauté d'expertsOn partage : évènements et afterworksOn évolue : Management technique de proximité et formationsMais aussi :Accords RTT (1 jour/ mois) et Télétravail (2 à 3 jours/ semaine)Prise en charge pour moitié du titre de transport et de la mutuelleCarte titres restaurants EdenredChez ITS Services, nous célébrons la diversité et nous nous engageons à créer un environnement inclusif pour nos collaborateurs.Handi-bienveillante, ITS Services accueille des collaborateurs en situation de handicap.#LI-RA1
Compétences requises
- Python
- Amélioration continue
- Shell
- ITIL
- JBoss
- Kubernetes
- PostgreSQL
- Création d'une base documentaire
- Grafana
- Linux
- Prometheus
- Scripting
- Spring Boot