Skills
Sobre a Vaga
Na Honeycomb, estamos construindo uma plataforma de observabilidade para o futuro próximo, ajudando times a elevarem o padrão do que ferramentas de developer podem entregar. Como Field Reliability Engineer para LATAM, você atuará diretamente com clientes em ambientes reais, garantindo confiabilidade, escalabilidade e evolução dos serviços gerenciados.
Responsabilidades
- Operar e gerenciar infraestrutura de serviços gerenciados voltados a clientes, incluindo Refinery as a Service (RaaS) e Honeycomb Private Cloud (HnyPC) em múltiplas contas e regiões AWS
- Desenvolver e manter módulos Terraform, charts Helm e automações de implantação para provisionar e gerenciar clusters EKS, pools de coletores e instâncias do Refinery
- Projetar e implementar monitoramento, alertas e práticas de observabilidade para a infraestrutura do serviço gerenciado
- Conduzir scaling, upgrades e resposta a incidentes, realizando capacity planning e otimização de custos na infraestrutura AWS
- Construir ferramentas autônomas de deploy e gestão para serviços operados em campo
- Atuar como ponto de escalonamento técnico para situações críticas, incluindo incidentes de produção, configurações complexas de coletores e tuning do Refinery
- Diagnosticar e resolver problemas profundos envolvendo sistemas distribuídos, Kubernetes, redes AWS (ALB, PrivateLink, NLB, VPC) e service meshes
- Participar de plantões (on-call) para suporte de nível 2 em questões de infraestrutura voltadas a clientes
- Manter SOPs, runbooks e frameworks de diagnóstico para acelerar resolução e apoiar times de campo
- Contribuir para ferramentas internas e interfaces que aumentem a eficiência operacional dos serviços gerenciados
Requisitos
- Experiência avançada com Kubernetes e operação de ambientes em produção
- Conhecimento sólido de AWS e arquitetura de redes (ALBs, PrivateLink, NLBs e VPC)
- Vivência com observabilidade e troubleshooting em sistemas distribuídos
- Experiência com automação e infraestrutura como código (Terraform) e empacotamento/execução (Helm)
- Capacidade de fazer escalonamento técnico e conduzir análises de arquitetura com foco em confiabilidade
- Experiência com OpenTelemetry (distribuições, coletores, exporters e instrumentação)
- Habilidade para colaborar com SRE, Platform e Engenharia do cliente sob pressão e com impacto direto em receita
Beneficios
- Programa de equity com condições favoráveis
- PTO ilimitado para recarregar
- Trabalho remoto com subsídios (home office, co-working e internet)
- Cobertura de benefícios para funcionários, com opção para dependentes
- Licença parental remunerada de até 16 semanas
- Auxílio anual de desenvolvimento