Skills
Sobre a Vaga
Na Braze, buscamos uma pessoa Engenheira(a) de Site Reliability (SRE) Sênior para fortalecer a confiabilidade da plataforma de MongoDB que sustenta o engajamento em tempo real de grandes marcas. O foco da posição é ir além de manter o serviço funcionando: você vai projetar uma plataforma mais confiável, escalável e observável, com mentalidade de automação e rigor de engenharia.
Responsabilidades
- Assumir a confiabilidade do MongoDB em escala, garantindo disponibilidade, durabilidade e performance de consultas alinhadas a SLAs corporativos
- Construir monitoramento e alertas proativos baseados em sintomas, com observabilidade específica do MongoDB (como oplog lag, saúde de replicação, contenção de locks e taxas de index hit)
- Conduzir planejamento de capacidade e estratégia de sharding conforme volumes e padrões de consulta evoluem
- Realizar análises de causa raiz em incidentes e transformar aprendizados em melhorias permanentes do sistema
- Melhorar a experiência do desenvolvedor do MongoDB, revisando esquemas, estratégias de índices e pipelines de agregação para evitar anti-padrões de escalabilidade
- Desenvolver tooling, automações e runbooks para permitir que outras equipes operem o MongoDB com segurança e eficiência
- Definir e padronizar tamanhos de connection pool, write-concern e read-preference para toda a frota
- Gerenciar o ciclo de vida dos clusters (provisionamento, upgrades, failovers e descomissionamento) em Kubernetes, usando o MongoDB Enterprise Kubernetes Operator, com infraestrutura como código via Terraform e Ansible
- Automatizar e manter fluxos de backup, restore e recuperação ponto-a-ponto (PITR), com testes regulares em cargas reais
- Participar da rotação de on-call (PagerDuty), usando os períodos sem incidentes para eliminar a próxima página
- Manter runbooks para que qualquer pessoa da equipe consiga responder efetivamente a incidentes no MongoDB
Requisitos
- 5+ anos de experiência como Software Engineer, DevOps Engineer ou Site Reliability Engineer em ambientes de produção
- Experiência prática com MongoDB: replica sets, sharding, design de índices, aggregation pipelines, explain plans e performance tuning sob carga real
- Base sólida em Linux para operação no nível de sistema (I/O de disco, memória, rede e gestão de processos)
- Programação em uma ou mais linguagens: Python, Go, Ruby ou JavaScript (experiência com JavaScript/Python é um diferencial para automações e scripting no MongoDB)
- Experiência com Infrastructure as Code: Terraform, Ansible ou equivalente
- Conhecimento em orquestração de containers: Docker e Kubernetes
- Perfil analítico e orientado a falhas, considerando interfaces, modos de degradação e efeitos em cascata
- Compromisso com documentação e colaboração assíncrona com times globais
Beneficios
- Remuneração competitiva (com possibilidade de equity)
- Plano de aposentadoria e programas de compra de ações
- Folgas flexíveis e benefícios de saúde (médico, odontológico e visão), além de seguro de vida e invalidez
- Plano de desenvolvimento profissional com trilha de carreira e learning stipend anual
- Modelo de trabalho híbrido com foco em equilíbrio entre vida pessoal e profissional