Remote
Analista de SRE Pleno - Vaga Afirmativa para Mulheres
About this role
Estamos em busca de uma Site Reliability Engineer (SRE) Plena altamente motivada para integrar nossa equipe de Cloud, Data & AI Platform . Nesta função, você será responsável por projetar, operar e aprimorar continuamente a confiabilidade, escalabilidade, observabilidade e desempenho de plataformas cloud-native que suportam aplicações críticas para o negócio, pipelines de dados e cargas de trabalho de IA/ML. Você trabalhará em estreita colaboração com as equipes de Engenharia de Software, Engenharia de Dados, Engenharia de IA e Plataforma para criar sistemas resilientes, automatizar operações, melhorar a experiência dos desenvolvedores e estabelecer as melhores práticas de confiabilidade em toda a organização.
Como engenheira plena, você desempenhará um papel fundamental no avanço da excelência operacional por meio de automação, observabilidade, gestão de incidentes, otimização de custos e modernização da infraestrutura. Principais Responsabilidades: Projetar e operar plataformas em nuvem altamente disponíveis, escaláveis e seguras na AWS. Construir e manter infraestrutura baseada em Kubernetes para suportar aplicações, dados e cargas de trabalho de IA.
Melhorar a confiabilidade da plataforma por meio de automação, Infraestrutura como Código (IaC) e recursos de autoatendimento (self-service). Implementar e aprimorar soluções de observabilidade utilizando Datadog, incluindo monitoramento, logs, rastreamento (tracing), alertas, dashboards e gestão de SLOs. Suportar e otimizar ambientes de processamento de dados em larga escala utilizando Airflow, Amazon EMR, S3 e outros serviços de dados da AWS.
Trabalhar em parceria com as equipes de Dados e IA para melhorar a confiabilidade, escalabilidade e maturidade operacional de plataformas de Machine Learning e Inteligência Artificial. Liderar atividades de resposta a incidentes, análises de causa raiz e revisões pós-incidente, promovendo a melhoria contínua. Definir e medir Indicadores de Nível de Serviço (SLIs), Objetivos de Nível de Serviço (SLOs) e orçamentos de erro (error budgets).
Aprimorar processos de implantação, pipelines de CI/CD e a confiabilidade das releases. Otimizar a utilização, desempenho e custos da infraestrutura em nuvem. Mentorar membros da equipe e promover as melhores práticas de SRE em toda a organização de engenharia. O que define o sucesso nessa função Aumento da disponibilidade e confiabilidade da plataforma. Melhoria da observabilidade e redução do tempo de resolução de incidentes.