# SRE Pleno

**Empresa:** SRM
**Local:** SP
**Modalidade:** Presencial
**Contrato:** CLT
**Publicada em:** 2026-09-11

## Descrição

Site Reliability Engineer (SRE) Pleno
Objetivo da posição
Atuar na sustentação, administração, observabilidade e evolução dos ambientes de infraestrutura e aplicações, garantindo disponibilidade, estabilidade, segurança e desempenho dos serviços.
O profissional será responsável principalmente pela administração dos ambientes AWS, Kubernetes, soluções de backup Veeam/AWS e observabilidade através do Datadog, atuando também na análise e resolução de incidentes.
Principais responsabilidades
Administração de Recursos AWS

Administrar e acompanhar recursos e serviços hospedados na AWS.
Realizar troubleshooting de infraestrutura, conectividade, disponibilidade e performance.
Acompanhar utilização e capacidade dos recursos.
Apoiar provisionamento, configuração e manutenção dos ambientes.
Administrar recursos como EC2, EBS, S3, IAM, VPC, Load Balancers, Route 53 e demais serviços utilizados pela organização.
Analisar eventos, logs e métricas através de Cloud
Watch e CloudTrail.

Apoiar aplicação de boas práticas de segurança, disponibilidade e controle de acesso.
Participar da análise e otimização de custos e recursos AWS.
Apoiar processos de atualização, manutenção e mudanças de infraestrutura.

Administração de Backup Veeam e AWS
Administrar e monitorar rotinas de backup através do Veeam e serviços AWS.
Acompanhar execução, sucesso e falhas dos jobs de backup.
Investigar e corrigir falhas relacionadas às rotinas de backup.
Executar e acompanhar procedimentos de restore quando necessário.
Realizar testes periódicos de recuperação para garantir a integridade dos backups.
Apoiar políticas de retenção, armazenamento e ciclo de vida dos backups.
Acompanhar capacidade e utilização dos repositórios de backup.
Apoiar procedimentos relacionados a Disaster Recovery e continuidade de negócio.
Manter documentação e evidências das rotinas e testes de recuperação.

Administração de Clusters Kubernetes
Administrar e monitorar clusters Kubernetes.
Acompanhar Pods, Deployments, Stateful
Sets, Daemon
Sets, Services, Ingress, Config
Maps e Secrets.
Realizar troubleshooting de aplicações e workloads executados nos clusters.
Analisar eventos, logs, probes, consumo de CPU/memória e comportamento dos Pods.
Investigar problemas como Crash
LoopBackOff, Image
PullBackOff, OOM
Killed, falhas de probes e indisponibilidade de aplicações.
Apoiar atualização e manutenção dos clusters e seus componentes.
Administrar namespaces, permissões e recursos dos ambientes.
Apoiar configurações de escalabilidade, requests, limits e autoscaling.
Trabalhar em conjunto com os times de desenvolvimento na análise de problemas das aplicações.
Apoiar processos de deploy e operação de aplicações utilizando práticas de CI/CD e GitOps.

Administração de Observabilidade e Datadog
Administrar e manter dashboards no Datadog.
Criar e evoluir dashboards técnicos e operacionais.
Criar e ajustar monitors e alertas.
Acompanhar métricas de infraestrutura e aplicações.
Realizar análise de logs, métricas e traces para troubleshooting.
Utilizar recursos de APM para identificação de gargalos e falhas de aplicações.
Acompanhar indicadores de disponibilidade, latência, erros e saturação.
Apoiar definição e acompanhamento de SLIs e SLOs.
Revisar alertas buscando redução de falsos positivos e melhoria da qualidade da monitoração.
Apoiar times técnicos durante incidentes utilizando dados de observabilidade para identificação da causa raiz.
Atuação operacional

O profissional também deverá:
Atuar no atendimento e resolução de incidentes de infraestrutura e aplicações.
Realizar troubleshooting de problemas de média complexidade.
Participar de análises de causa raiz (RCA).
Registrar procedimentos, incidentes e soluções em documentação técnica.
Executar mudanças seguindo os processos internos de Change Management.
Trabalhar em conjunto com os times de SRE, Infraestrutura, Redes, Segurança, Banco de Dados e Desenvolvimento.
Apoiar automações para redução de atividades operacionais manuais.
Participar da evolução contínua dos ambientes e processos de confiabilidade.

Conhecimentos técnicos desejados
AWS.
Kubernetes.
Veeam Backup &amp; Replication.
Datadog.
Linux.
Redes TCP/IP, DNS, HTTP/HTTPS e troubleshooting de conectividade.
Conceitos de containers e Docker.
Git.
CI/CD.
Shell Script e/ou Python.
Terraform ou outra ferramenta de Infrastructure as Code.
Conceitos de observabilidade: métricas, logs e traces.
Conceitos de alta disponibilidade, backup e Disaster Recovery.
Conhecimentos básicos de segurança em ambientes Cloud.
Perfil esperado
Buscamos um profissional de nível pleno, com autonomia para executar atividades operacionais e troubleshooting de média complexidade, capacidade de análise de incidentes e interesse em automação e melhoria contínua.
É importante possuir boa comunicação, organização, senso de responsabilidade sobre ambientes produtivos e capacidade de trabalhar de forma integrada com diferentes times técnicos.

## Habilidades

- AWS
- Kubernetes
- Veeam Backup
- Datadog
- Linux
- TCP/IP
- Docker
- Git

**Página original:** https://www.123vagas.com.br/vaga/sre-pleno-sao-paulo-sp-82861
