Skills
Sobre a Vaga
Estamos buscando um(a) Engenheiro(a) de Site Reliability (SRE) para atuar com práticas de DevOps e confiabilidade de plataforma. A função será responsável por sustentar ambientes de produção, automatizar rotinas operacionais e apoiar a evolução da infraestrutura na AWS.
Responsabilidades
- Participar de escala de plantão (on-call) quinzenal para suporte a ambientes de produção
- Monitorar sistemas em produção, atuar em incidentes e garantir a estabilidade dos serviços
- Realizar análise de causa raiz (RCA) e implementar correções permanentes
- Construir e gerenciar infraestrutura na AWS com Terraform
- Desenhar, implementar e manter pipelines de CI/CD
- Automatizar tarefas operacionais recorrentes e melhorar ferramentas internas
- Reduzir dívida técnica por meio de melhorias de engenharia
- Manter observabilidade com Datadog (monitoramento, dashboards, alertas e métricas)
- Atuar em deploys e processos de change management
- Tratar vulnerabilidades relacionadas à infraestrutura
- Desenvolver e manter documentação operacional, padrões e runbooks
- Identificar oportunidades para elevar confiabilidade, escalabilidade, segurança e eficiência operacional
Requisitos
- Experiência em SRE, DevOps, Cloud Operations, Platform Engineering ou Systems Engineering
- Vivência no suporte a aplicações SaaS corporativas em produção
- Experiência prática com AWS (EC2, VPC, IAM, RDS, ECS, S3)
- Conhecimento e uso de Infrastructure as Code com Terraform
- Experiência com CI/CD usando GitHub Actions, Jenkins, GitLab CI/CD ou similar
- Experiência sólida com Datadog ou ferramentas equivalentes de observabilidade
- Conhecimento em Docker e Kubernetes
- Programação/scripting em Python e/ou Bash
- Participação em rotinas de on-call e forte habilidade de troubleshooting e RCA
- Boa comunicação em inglês
Beneficios
- Atuação em modelo remoto
- Oportunidade de contribuir para confiabilidade, automação e melhoria contínua da plataforma
- Ambiente colaborativo com times de Engenharia para preparação de releases