Skills
Sobre a Vaga
Na Brex, você vai atuar como Senior Software Engineer na área de Infraestrutura de Release, construindo e operando os sistemas que sustentam o ciclo de releases, a observabilidade e a gestão de incidentes. A função exige autonomia técnica e colaboração próxima com produto, plataforma e operações para garantir entregas seguras, rápidas e confiáveis.
Responsabilidades
- Projetar, construir e manter a infraestrutura de release que alimenta pipelines de deployment e fluxos de incidentes
- Definir estratégia e arquitetura para sistemas de release e observabilidade, elevando escalabilidade, confiabilidade e segurança
- Trabalhar com times de produto, engenharia e operações para que as releases sejam previsíveis e de baixo atrito
- Propor melhorias do fluxo ponta a ponta (do merge ao ambiente de produção) para reduzir risco e tempo de ciclo
- Desenvolver e evoluir ferramentas de observabilidade e resposta a incidentes para detecção, triagem e resolução mais rápidas
- Identificar e mitigar riscos no stack de release e infraestrutura, considerando performance, confiabilidade e segurança
- Definir, instrumentar e acompanhar métricas-chave de release engineering (como frequência de deploy, change failure rate e MTTR)
- Apoiar a investigação de problemas complexos em produção e conduzir correções estruturais de longo prazo
- Promover boas práticas de release engineering, confiabilidade e excelência operacional, além de realizar code reviews e mentoria
- Manter-se atualizado com ferramentas e práticas emergentes em release, observabilidade e SRE para aplicar aprendizados no ambiente
Requisitos
- Experiência profissional de 7+ anos com design, construção e operação de sistemas backend ou de infraestrutura em produção
- Forte domínio de linguagens backend (Go, Java, Kotlin ou Python), com foco em confiabilidade e performance
- Experiência prática com CI/CD e pipelines de release (GitHub Actions, CircleCI, Buildkite, Argo, Spinnaker ou Jenkins), incluindo automação de build, testes e deploy
- Conhecimento de arquitetura e operação de sistemas distribuídos escaláveis e de alta disponibilidade em nuvem (AWS, GCP ou Azure)
- Experiência com containerização e orquestração (Docker, Kubernetes) e com infraestrutura como código (Terraform, CloudFormation)
- Vivência com ferramentas de observabilidade (métricas, logs e tracing) integradas a fluxos de resposta a incidentes
- Base sólida em práticas de confiabilidade e SRE, incluindo SLIs/SLOs, error budgets e gestão de incidentes
- Experiência em sistemas de dados para casos operacionais e de observabilidade (SQL e/ou NoSQL)
- Histórico de melhorias em processos de release, como redução de risco e aumento de frequência de deploy, além de automação de rollback
- Boa comunicação e colaboração para tomada de decisão técnica, escrita de design docs e atuação cross-funcional
Beneficios
- Ambiente híbrido em São Paulo com flexibilidade para trabalho remoto (até 4 semanas por ano)
- Atuação em sistemas críticos de release, observabilidade e incident management
- Mentoria e cultura de excelência operacional com times altamente colaborativos