O que esta vaga pede
SRE de Plataforma de IA
Missão da posição
Projetar, construir, automatizar e operar a Plataforma de Engenharia de IA , garantindo que aplicações, modelos, LLMs, agentes e serviços de IA possam ser desenvolvidos e executados com segurança, observabilidade, escalabilidade, confiabilidade e governança.
O profissional atuará na interseção entre SRE, Platform Engineering, DevOps, Cloud, Observabilidade e AI Engineering , construindo a camada de infraestrutura e automação necessária para transformar iniciativas de IA em serviços produtivos e sustentáveis.
A posição terá forte atuação em AWS, Kubernetes, GitOps, Infrastructure as Code, CI/CD, Observabilidade e AI Observability .
Principais responsabilidades
- Plataforma AWS
Projetar, administrar e evoluir a infraestrutura AWS utilizada pela plataforma de IA.
Responsabilidades
- Administração e evolução de ambientes AWS.
- Arquitetura de workloads distribuídos e altamente disponíveis.
- Administração de EKS.
- ECR para gerenciamento de imagens.
- S3 para datasets, artefatos, modelos e logs.
- IAM e políticas de acesso.
- Secrets Manager e Parameter Store.
- Load Balancers e networking.
- Route 53.
- Cloud
Watch.
- SQS/SNS/Event
- Bridge para arquiteturas orientadas a eventos.
- RDS/Aurora e serviços de persistência quando necessários.
- Elasti
- Cache/Redis.
- Integração com serviços de IA da AWS.
- Gestão de custos, capacidade e eficiência dos workloads.
O profissional deverá aplicar conceitos de:
High Availability, Disaster Recovery, Security by Design, FinOps e Well-Architected Framework.
- Kubernetes e Plataforma de Containers
- Construir e operar clusters Kubernetes utilizados pelos serviços e workloads de IA.
Principais atividades
- Administração de clusters Amazon EKS.
- Helm.
- Kubernetes Operators.
- Ingress Controllers.
- Service Accounts e RBAC.
- Network Policies.
- Secrets.
- Persistent Volumes.
- Autoscaling.
- HPA.
- KEDA.
- Cluster Autoscaler/Karpenter.
- Troubleshooting de workloads Kubernetes.
- Capacity Planning.
- Também será responsável por definir padrões de deployment para:
- APIs de IA;
- serviços Python;
- aplicações Java;
- agentes de IA;
- gateways;
- workers;
- pipelines assíncronos;
- aplicações de inferência;
- ferramentas internas da plataforma.
- Infrastructure as Code
- Toda infraestrutura deverá ser tratada como código.
Stack principal:
Terraform / OpenTofu + Terragrunt + Atlantis
Responsabilidades
- desenvolvimento de módulos reutilizáveis;
- versionamento da infraestrutura;
- revisão de mudanças via Pull Request;
- execução automatizada de Plan;
- aprovação controlada de Apply;
- gestão de múltiplos ambientes;
- padronização de módulos;
- controle de drift;
- políticas de segurança;
- automação do ciclo de vida da infraestrutura.
O Atlantis deverá funcionar como camada de governança do processo de IaC.
Fluxo esperado:
Developer
↓
Pull Request
↓
GitHub
↓
Atlantis
↓
Terraform / OpenTofu
↓
AWS
- GitOps e Continuous Delivery
- Responsável pela implementação e evolução do modelo GitOps da plataforma.
Stack principal:
GitHub + GitHub Actions + ArgoCD + Helm
Fluxo esperado:
Developer
↓
GitHub
↓
GitHub Actions
↓
Build / Test / Security
↓
Container Image
↓
Amazon ECR
↓
GitOps Repository
↓
ArgoCD
↓
Amazon EKS
Responsabilidades
- construção de pipelines CI/CD;
- criação de workflows reutilizáveis;
- gerenciamento de secrets;
- integração com ECR;
- deployment GitOps;
- estratégias de rollback;
- promoção entre ambientes;
- controle de versões;
- políticas de aprovação.
- Desejável conhecimento de:
- Argo Rollouts;
- Blue/Green Deployment;
- Canary Deployment;
- Progressive Delivery.
- Observabilidade da Plataforma
- Responsável por implementar observabilidade completa dos workloads.
Stack principal:
OpenTelemetry + Datadog
- A plataforma deverá coletar:
- Metrics
- Logs
- Traces
- Events
O OpenTelemetry deverá ser utilizado como camada de instrumentação e coleta independente de fornecedor.
Arquitetura esperada:
Applications
AI Services
AI Agents
Kubernetes
↓
OpenTelemetry SDK
↓
OpenTelemetry Collector
↓
Datadog
Responsabilidades
- instrumentação OpenTelemetry;
- administração de OpenTelemetry Collectors;
- distributed tracing;
- dashboards;
- alertas;
- correlação entre logs, métricas e traces;
- definição de SLIs e SLOs;
- monitoração de disponibilidade;
- monitoração de performance;
- análise de incidentes;
- troubleshooting distribuído.
- AI Observability / LLM Observability
Um dos diferenciais da posição será operar a camada de observabilidade específica para Inteligência Artificial.
- Além da observabilidade tradicional, deverão ser acompanhados indicadores como:
- Latência de inferência.
- Time to First Token.
- Tokens de entrada.
- Tokens de saída.
- Custo por requisição.
- Custo por modelo.
- Custo por aplicação/agente.
- Taxa de erro.
- Falhas de ferramentas.
- Retries.
- Context size.
- Model/provider utilizado.
- Consumo por usuário ou aplicação.
- Qualidade das respostas.
- Avaliações de LLM.
- Traces de agentes.
Para arquiteturas Agentic AI:
User Request
↓
Agent
↓
LLM
↓
Tool
↓
Agent
↓
Another Agent
↓
LLM
↓
Response
O profissional deverá ser capaz de reconstruir e diagnosticar todo esse fluxo através de traces.
- Conhecimentos desejáveis:
- OpenTelemetry GenAI Semantic Conventions;
- OpenLIT;
- Langfuse;
- Arize Phoenix;
- avaliação e tracing de aplicações LLM.
- Plataforma de Engenharia de IA
O profissional participará da construção de uma Internal Developer Platform — IDP direcionada para workloads de IA.
Objetivo:
Permitir que desenvolvedores e times de IA publiquem serviços sem precisar conhecer toda a complexidade da infraestrutura.
Exemplo:
Developer
↓
Developer Portal
↓
Service Template
↓
GitHub Repository
↓
GitHub Actions
↓
ECR
↓
ArgoCD
↓
EKS
↓
OpenTelemetry
↓
Datadog
A plataforma deverá fornecer Golden Paths para criação de:
- APIs;
- microserviços;
- workers;
- aplicações Python;
- serviços Java;
- agentes de IA;
- aplicações RAG;
- serviços de inferência.
- Cada Golden Path deverá entregar automaticamente:
- repositório;
- pipeline;
- Dockerfile;
- Helm Chart;
- deployment Kubernetes;
- observabilidade;
- health checks;
- secrets;
- dashboards;
- alertas;
- políticas básicas de segurança.
- AI Gateway e acesso aos modelos
- Participará da construção da camada de abstração entre aplicações e provedores/modelos de IA.
Arquitetura conceitual:
Applications
Agents
Services
↓
AI Gateway
↓
Model Router
↓
┌──────────────┬──────────────┬──────────────┐
│ AWS Bedrock │ External LLM │ Local Models │
└─────────...