O que esta vaga pede
Site Reliability Engineer (SRE) Pleno
Objetivo da posição
Atuar na sustentação, administração, observabilidade e evolução dos ambientes de infraestrutura e aplicações, garantindo disponibilidade, estabilidade, segurança e desempenho dos serviços.
O profissional será responsável principalmente pela administração dos ambientes AWS, Kubernetes, soluções de backup Veeam/AWS e observabilidade através do Datadog, atuando também na análise e resolução de incidentes.
Principais responsabilidades
Administração de Recursos AWS
- Administrar e acompanhar recursos e serviços hospedados na AWS.
- Realizar troubleshooting de infraestrutura, conectividade, disponibilidade e performance.
- Acompanhar utilização e capacidade dos recursos.
- Apoiar provisionamento, configuração e manutenção dos ambientes.
- Administrar recursos como EC2, EBS, S3, IAM, VPC, Load Balancers, Route 53 e demais serviços utilizados pela organização.
- Analisar eventos, logs e métricas através de Cloud
Watch e Cloud
Trail.
- Apoiar aplicação de boas práticas de segurança, disponibilidade e controle de acesso.
- Participar da análise e otimização de custos e recursos AWS.
- Apoiar processos de atualização, manutenção e mudanças de infraestrutura.
- Administração de Backup Veeam e AWS
- Administrar e monitorar rotinas de backup através do Veeam e serviços AWS.
- Acompanhar execução, sucesso e falhas dos jobs de backup.
- Investigar e corrigir falhas relacionadas às rotinas de backup.
- Executar e acompanhar procedimentos de restore quando necessário.
- Realizar testes periódicos de recuperação para garantir a integridade dos backups.
- Apoiar políticas de retenção, armazenamento e ciclo de vida dos backups.
- Acompanhar capacidade e utilização dos repositórios de backup.
- Apoiar procedimentos relacionados a Disaster Recovery e continuidade de negócio.
- Manter documentação e evidências das rotinas e testes de recuperação.
- Administração de Clusters Kubernetes
- Administrar e monitorar clusters Kubernetes.
- Acompanhar Pods, Deployments, Stateful
- Sets, Daemon
- Sets, Services, Ingress, Config
- Maps e Secrets.
- Realizar troubleshooting de aplicações e workloads executados nos clusters.
- Analisar eventos, logs, probes, consumo de CPU/memória e comportamento dos Pods.
- Investigar problemas como Crash
- LoopBackOff, Image
- PullBackOff, OOM
- Killed, falhas de probes e indisponibilidade de aplicações.
- Apoiar atualização e manutenção dos clusters e seus componentes.
- Administrar namespaces, permissões e recursos dos ambientes.
- Apoiar configurações de escalabilidade, requests, limits e autoscaling.
- Trabalhar em conjunto com os times de desenvolvimento na análise de problemas das aplicações.
- Apoiar processos de deploy e operação de aplicações utilizando práticas de CI/CD e GitOps.
- Administração de Observabilidade e Datadog
- Administrar e manter dashboards no Datadog.
- Criar e evoluir dashboards técnicos e operacionais.
- Criar e ajustar monitors e alertas.
- Acompanhar métricas de infraestrutura e aplicações.
- Realizar análise de logs, métricas e traces para troubleshooting.
- Utilizar recursos de APM para identificação de gargalos e falhas de aplicações.
- Acompanhar indicadores de disponibilidade, latência, erros e saturação.
- Apoiar definição e acompanhamento de SLIs e SLOs.
- Revisar alertas buscando redução de falsos positivos e melhoria da qualidade da monitoração.
- Apoiar times técnicos durante incidentes utilizando dados de observabilidade para identificação da causa raiz.
Atuação operacional
- O profissional também deverá:
- Atuar no atendimento e resolução de incidentes de infraestrutura e aplicações.
- Realizar troubleshooting de problemas de média complexidade.
- Participar de análises de causa raiz (RCA).
- Registrar procedimentos, incidentes e soluções em documentação técnica.
- Executar mudanças seguindo os processos internos de Change Management.
- Trabalhar em conjunto com os times de SRE, Infraestrutura, Redes, Segurança, Banco de Dados e Desenvolvimento.
- Apoiar automações para redução de atividades operacionais manuais.
- Participar da evolução contínua dos ambientes e processos de confiabilidade.
- Conhecimentos técnicos desejados
- AWS.
- Kubernetes.
- Veeam Backup & Replication.
- Datadog.
- Linux.
- Redes TCP/IP, DNS, HTTP/HTTPS e troubleshooting de conectividade.
- Conceitos de containers e Docker.
- Git.
- CI/CD.
- Shell Script e/ou Python.
- Terraform ou outra ferramenta de Infrastructure as Code.
- Conceitos de observabilidade: métricas, logs e traces.
- Conceitos de alta disponibilidade, backup e Disaster Recovery.
- Conhecimentos básicos de segurança em ambientes Cloud.
Perfil esperado
Buscamos um profissional de nível pleno, com autonomia para executar atividades operacionais e troubleshooting de média complexidade, capacidade de análise de incidentes e interesse em automação e melhoria contínua.
É importante possuir boa comunicação, organização, senso de responsabilidade sobre ambientes produtivos e capacidade de trabalhar de forma integrada com diferentes times técnicos.