O que esta vaga pede
Buscamos um(a) Engenheiro(a) de DevOps & Infraestrutura Sênior para projetar, automatizar e operar plataformas de Kubernetes on-premises em ambientes de rede restritos, com acesso à internet controlado por proxy. O papel exige domínio profundo de infraestrutura self-managed (do bare metal ao cluster), automação de ponta a ponta e capacidade de manter operações confiáveis mesmo com egresso limitado e forte segregação de rede. Espera-se autonomia técnica para definir padrões, diagnosticar problemas complexos de rede e conectividade, e sustentar ambientes críticos.
Responsabilidades e atribuições
Kubernetes On-Premises
Provisionar, operar e atualizar clusters Kubernetes self-managed on-premises (ex.: kubeadm, RKE2, k3s ou OpenShift). Administrar componentes de baixo nível: etcd, control plane, CNI (Calico/Cilium), CoreDNS e runtime de containers. Configurar balanceamento em bare metal (ex.: MetalLB), Ingress e exposição de serviços sem dependência de cloud. Definir e operar armazenamento persistente on-premises (ex.: Longhorn, Ceph, NFS) e estratégias de backup/restore (ex.: Velero). Planejar upgrades, capacity planning, DR e hardening dos clusters (CIS Benchmarks). Redes Restritas e Conectividade via Proxy
Operar em ambientes de egresso restrito, configurando corretamente HTTP_PROXY / HTTPS_PROXY / NO_PROXY no runtime, kubelet, pipelines e workloads. Implantar e manter registries e mirrors internos (ex.: Harbor, Nexus, Artifactory) e repositórios offline de pacotes, imagens e charts Helm. Lidar com proxies corporativos e inspeção TLS (SSL bump), incluindo distribuição e gestão de CAs internas na cadeia de confiança. Diagnosticar e resolver problemas de conectividade, DNS, roteamento e firewall em redes segmentadas. Garantir que builds, deploys e atualizações funcionem em cenários air-gapped ou semi-isolados. DevOps e Automação
Projetar e manter pipelines de CI/CD [Azure DevOps / GitLab CI / Harness], contemplando build, testes, segurança e deploy. Adotar Infraestrutura como Código (Terraform, Ansible) e configuração declarativa. Implementar GitOps (ex.: Argo CD, Flux) para gestão de estado dos clusters. Padronizar versionamento, estratégias de release, rollback e automação de tarefas operacionais. Observabilidade e Confiabilidade
Implantar e operar stack de observabilidade on-premises (ex.: Prometheus, Grafana, Loki, OpenTelemetry). Definir métricas, alertas, SLOs e runbooks de resposta a incidentes. Atuar em análise de causa raiz e melhoria contínua de confiabilidade. Segurança e Hardening
Aplicar hardening de sistemas Linux, clusters e pipelines. Gerenciar segredos (ex.: Vault) e políticas de acesso. Implementar segmentação, políticas de rede (Network
Policies) e princípios de menor privilégio.
Requisitos e qualificações
Requisitos obrigatórios
Experiência sólida operando Kubernetes on-premises / self-managed (não apenas serviços gerenciados de cloud) [definir anos mínimos de experiência]. Experiência comprovada em ambientes de rede restritos com acesso via proxy (egresso controlado, air-gapped ou semi-isolado). Domínio de administração Linux e redes (TCP/IP, DNS, roteamento, firewall, TLS). Automação com Infraestrutura como Código (Terraform e/ou Ansible). Construção e manutenção de pipelines de CI/CD. Experiência com registries/mirrors internos e distribuição de artefatos em ambientes isolados. Capacidade forte de troubleshooting de infraestrutura e conectividade. Requisitos desejáveisGitOps (Argo CD / Flux) e gestão declarativa de clusters. Armazenamento distribuído on-premises (Ceph, Longhorn). Stack de observabilidade (Prometheus, Grafana, Loki, OpenTelemetry). Gestão de segredos com Vault e hardening por CIS Benchmarks. Experiência com proxies corporativos e inspeção TLS. Vivência em ambientes regulados (ISO 27001, setor financeiro). Competências comportamentais
Autonomia e senso de dono na operação de ambientes críticos. Método e clareza no diagnóstico de problemas complexos. Boa comunicação com times de desenvolvimento, segurança e redes. Rigor com automação, documentação e confiabilidade.