Analista de SRE Pleno - Vaga Afirmativa para Mulheres
Experian · Remote; São Carlos, , Brazil
- Junior
- Full-time
- Posted 2026-09-11
- Confirmed live on 25 September 2026
Job description
Job Description
Estamos em busca de uma Site Reliability Engineer (SRE) Plena altamente motivada para integrar nossa equipe de Cloud, Data & AI Platform. Nesta função, você será responsável por projetar, operar e aprimorar continuamente a confiabilidade, escalabilidade, observabilidade e desempenho de plataformas cloud-native que suportam aplicações críticas para o negócio, pipelines de dados e cargas de trabalho de IA/ML.
Você trabalhará em estreita colaboração com as equipes de Engenharia de Software, Engenharia de Dados, Engenharia de IA e Plataforma para criar sistemas resilientes, automatizar operações, melhorar a experiência dos desenvolvedores e estabelecer as melhores práticas de confiabilidade em toda a organização.
Como engenheira plena, você desempenhará um papel fundamental no avanço da excelência operacional por meio de automação, observabilidade, gestão de incidentes, otimização de custos e modernização da infraestrutura.
Principais Responsabilidades:
• Projetar e operar plataformas em nuvem altamente disponíveis, escaláveis e seguras na AWS.
• Construir e manter infraestrutura baseada em Kubernetes para suportar aplicações, dados e cargas de trabalho de IA.
• Melhorar a confiabilidade da plataforma por meio de automação, Infraestrutura como Código (IaC) e recursos de autoatendimento (self-service).
• Implementar e aprimorar soluções de observabilidade utilizando Datadog, incluindo monitoramento, logs, rastreamento (tracing), alertas, dashboards e gestão de SLOs.
• Suportar e otimizar ambientes de processamento de dados em larga escala utilizando Airflow, Amazon EMR, S3 e outros serviços de dados da AWS.
• Trabalhar em parceria com as equipes de Dados e IA para melhorar a confiabilidade, escalabilidade e maturidade operacional de plataformas de Machine Learning e Inteligência Artificial.
• Liderar atividades de resposta a incidentes, análises de causa raiz e revisões pós-incidente, promovendo a melhoria contínua.
• Definir e medir Indicadores de Nível de Serviço (SLIs), Objetivos de Nível de Serviço (SLOs) e orçamentos de erro (error budgets).
• Aprimorar processos de implantação, pipelines de CI/CD e a confiabilidade das releases.
• Otimizar a utilização, desempenho e custos da infraestrutura em nuvem.
• Mentorar membros da equipe e promover as melhores práticas de SRE em toda a organização de engenharia.
O que define o sucesso nessa função
• Aumento da disponibilidade e confiabilidade da plataforma.
• Melhoria da observabilidade e redução do tempo de resolução de incidentes.
• Maior automação e redução de esforços operacionais manuais e repetitivos.
• Plataformas de Dados e IA confiáveis, escaláveis e com eficiência de custos.
• Forte colaboração com as equipes de Engenharia para entregar sistemas de produção resilientes.
Qualifications
Qualificações obrigatórias
• Ensino Superior cursando/completo.
• Experiência sólida em Site Reliability Engineering, Platform Engineering, Cloud Engineering ou funções de DevOps.
• Forte experiência prática com serviços AWS e arquiteturas cloud-native.
• Conhecimento profundo de Kubernetes e workloads conteinerizadas em ambientes de produção.
• Experiência na gestão e resolução de problemas em sistemas distribuídos de grande escala.
• Sólida experiência com plataformas de observabilidade, preferencialmente Datadog.
• Experiência no suporte a plataformas e fluxos de dados utilizando tecnologias como Airflow, EMR, Spark e S3.
• Expertise em Infraestrutura como Código (IaC) utilizando Terraform ou ferramentas similares.
• Experiência na construção e manutenção de pipelines de CI/CD e automação de plataformas.
• Sólidos conhecimentos em Linux, redes e troubleshooting de desempenho de sistemas.
• Proficiência em scripts e automação utilizando Python, Bash ou linguagens similares.
Qualificações desejáveis
• Experiência no suporte a plataformas cloud-native de grande escala em ambientes AWS.
• Experiência com operações de plataformas Kubernetes e gerenciamento do ciclo de vida de clusters.
• Conhecimento dos princípios de Site Reliability Engineering, incluindo SLOs, SLIs, error budgets e práticas de excelência operacional.
• Experiência na implementação de soluções de observabilidade utilizando ferramentas como Datadog, Prometheus, Grafana, OpenTelemetry ou tecnologias similares.
• Familiaridade com plataformas de processamento de dados e orquestração de workflows, como Airflow, Spark ou EMR.
• Experiência com Infraestrutura como Código (IaC) e práticas de automação de plataformas.
• Certificações AWS, Kubernetes, Terraform ou Datadog.
• Experiência atuando em ambientes corporativos de grande escala, altamente disponíveis ou de missão crítica.
• Inglês técnico intermediário.
Additional Information
Esta é uma posição afirmativa para mulheres, como parte do nosso compromisso com o avanço da equidade de gênero no ambiente de trabalho.
A Serasa Experian investe na liderança feminina e possui a parceria com a TODAS Group. Além diss
Prepare for the interview
Nothing collected for this employer yet. The Blind 75 is what technical screens draw from; practise it here, with a coach, in Java or Python.
More at Experian
- Analista de Observabilidade Pleno · São Paulo, , Brazil
- Analista Sênior de Employer Branding - Vaga Afirmativa para Mulheres · São Paulo, , Brazil
- Analista de Recursos Humanos Júnior (Administração pessoal) · São Carlos, , Brazil
- Staff AI Architect, Remote · Remote; United States, UNITED STATES, United States
- Product Manager Pleno · São Paulo, , Brazil
- Senior ML Engineer – AI Safety · Remote; São Carlos, SP, Brazil
- Senior Director, Client Education - Healthcare SaaS · Remote; United Staters, UNITED STATES, United States
- Full Stack Software Engineer (Hybrid) · Phoenix, AZ, United States