Skills
Sobre a Vaga
Estamos buscando um(a) Engenheiro(a) de Software Sênior para atuar no time de Site Reliability Engineering (SRE) de Produção. O foco da função é criar e manter ferramentas e sistemas que ajudem as equipes de engenharia a operar nossos serviços com confiabilidade e escala.
Responsabilidades
- Projetar, implementar e manter ferramentas e sistemas de confiabilidade, monitoramento e alertas
- Colaborar com outras equipes para garantir que os serviços sejam desenhados com confiabilidade desde o início
- Identificar oportunidades para melhorar confiabilidade, escalabilidade e eficiência e liderar a implementação
- Trabalhar com engenharia de infraestrutura para entender desafios operacionais e desenvolver soluções
- Atuar na resposta a incidentes e conduzir post-mortems para tratar causas sistêmicas
- Avaliar continuamente tecnologias e boas práticas do mercado para aprimorar o tooling e os processos de resposta
- Atuar como Incident Commander em incidentes de alta severidade, coordenando times multifuncionais
- Mentorar engenheiros com menos experiência na condução efetiva de incidentes
Requisitos
- Formação em Ciência da Computação ou área relacionada
- Experiência de 5+ anos em engenharia de software ou funções de SRE, com foco em sistemas distribuídos de larga escala
- Forte habilidade de programação em pelo menos uma linguagem como Java, Python ou Go
- Experiência com sistemas distribuídos e arquiteturas orientadas a serviços
- Vivência com AWS ou Google Cloud Platform
- Práticas sólidas de desenvolvimento, incluindo versionamento, testes automatizados e CI/CD
- Experiência com tecnologias de containerização como Docker e Kubernetes
- Boa capacidade de análise e resolução de problemas, com atenção a detalhes
- Comunicação clara e habilidades interpessoais para atuar em ambientes de alta pressão
- Inglês em nível profissional
Beneficios
- Ambiente que valoriza cultura de blamelessness e aprendizado contínuo
- Atuação estratégica no aprimoramento da confiabilidade dos serviços
- Oportunidade de liderar resposta a incidentes e influenciar processos de operação