L'ingénieur senior en observabilité est un rôle pratique destiné à une personne ayant déjà construit des capacités d'observabilité en production — et non seulement consommé des plateformes d'observabilité en tant qu'utilisateur final. Vous aiderez à établir comment la télémétrie est instrumentée, collectée, traitée, visualisée, alertée et gouvernée à travers les équipes, en menant les premières intégrations et en façonnant des normes, processus et modes de travail pratiques.
Travaillant en étroite collaboration avec les équipes plateforme, produit et application, vous traduirez les exigences en solutions de télémétrie opérationnelles couvrant traces, métriques et logs, avec OpenTelemetry comme technologie centrale et obligatoire. Ce rôle suit une approche centrée sur les traces : les écarts basés sur les métriques aident à détecter les problèmes, les traces sont la voie principale d'investigation, et les logs sont utilisés lorsque des détails supplémentaires sont nécessaires. C'est une opportunité de façonner les standards d'observabilité et les pratiques d'ingénierie à l'échelle de l'entreprise, avec une influence directe sur la manière dont les équipes instrumentent, exploitent et dépannent les services critiques.
L'ingénieur senior en observabilité est un rôle pratique axé sur la construction et la fourniture de l'observabilité et de l'AIOps en tant que capacité et service d'ingénierie partagés. Vous aiderez à établir comment l'observabilité est conçue, mise en œuvre et consommée à travers les équipes, en menant les premières intégrations et en façonnant des normes, processus et modes de travail pratiques.
Travaillant en étroite collaboration avec les équipes plateforme, produit et application, vous traduirez les exigences en solutions d'observabilité exploitables, mettrez en œuvre et exploiterez les capacités clés, et améliorerez continuellement la manière dont les insights, les alertes et l'automatisation soutiennent des services fiables. En tant que contributeur clé du Centre d'Excellence Observabilité & AIOps, vous combinerez une exécution technique approfondie avec une forte responsabilité de la qualité du service, de la préparation opérationnelle et de la maturité des capacités.
Ce que vous ferez
concevoir, déployer et exploiter des capacités d'observabilité et d'AIOps pour des environnements cloud natifs et hybrides, soutenant des services fiables et de qualité production
mener l'intégration des équipes et services, définir et appliquer des normes pour l'instrumentation de la télémétrie, la collecte, les SLIs, SLOs et les alertes dans des systèmes réels utilisant OpenTelemetry
travailler directement avec les équipes d'ingénierie, SRE et opérations pour recueillir les exigences et les traduire en solutions d'observabilité et d'automatisation exploitables
installer, configurer, affiner et maintenir les collecteurs OpenTelemetry et les pipelines de télémétrie pour les applications et plateformes
construire et maintenir des tableaux de bord, alertes et flux de télémétrie couvrant le traçage distribué, les métriques et les logs, en tirant parti d'OpenTelemetry pour fournir des insights pertinents et réduire le bruit opérationnel
exploiter et faire évoluer les services d'observabilité qui soutiennent la détection moderne des incidents, l'investigation et la prise de décision opérationnelle
concevoir, configurer et maintenir des intégrations avec les systèmes de gestion d'événements et de tickets pour le routage des alertes, le contexte des incidents et les flux de travail opérationnels
Ce que vous apportez
plus de 8 ans d'expérience pratique en observabilité, SRE, plateforme ou ingénierie de fiabilité, incluant la responsabilité des capacités d'observabilité en production
expérience avérée dans la transformation des capacités d'observabilité depuis les exigences jusqu'à des solutions prêtes pour la production ; une expérience limitée aux tableaux de bord, requêtes ou backends d'observabilité en tant que consommateur n'est pas suffisante
expérience pratique de l'instrumentation des applications et infrastructures avec OpenTelemetry pour générer traces, métriques et logs
bonne compréhension des pratiques modernes d'observabilité centrées sur les traces, au-delà de la surveillance traditionnelle centrée sur les logs
expérience dans le déploiement, la configuration et l'exploitation des collecteurs OpenTelemetry et la conception de pipelines de télémétrie est un atout majeur ; ces responsabilités pratiques seront clés dans ce rôle
expérience avec des environnements cloud natifs, exploitation de charges de travail basées sur Kubernetes
expérience avec des chaînes d'outils et backends d'observabilité courants (par exemple : Elastic, Grafana, Dynatrace, Datadog, AppDynamics, etc.) - l'expérience Elastic Stack est un plus
compétences en scripting ou automatisation pour soutenir le déploiement, la configuration, la validation et les opérations continues répétables en utilisant des technologies telles que Helm, Terraform et Ansible
Si vous avez des questions,
consultez notre
page FAQ
ou appelez
Beata Czyzewska
au
+48 22 104 6571 / +41 58 399 9800 / +34 91 330 51 49
.
Pour ce poste, nous n'acceptons que les candidatures directes.
La diversité est importante pour nous. Par conséquent, nous souhaitons recevoir des candidatures indépendamment de tout contexte personnel.