123Vagas
Vagas Vagas Remotas Vagas Híbridas Cidades Empresas Skills Blog 123Vagas Plus Para Empresas

Institucional

Sobre Como Funciona FAQ Contato Privacidade Termos de Uso

Sou candidato

Entrar / Criar conta

Sou empresa

Entrar como empresa Cadastrar empresa grátis
LU

Especialista em Avaliação e Infraestrutura de Testes de IA (Evals & Harness) | Remoto

Luby Ontem
Remoto PJ Tecnologia 1 visualização
LLM-as-judge frameworks de avaliação IA/ML CI/CD com GitHub Actions Python para evals observabilidade e logging estruturado

Sobre a Vaga

Você vai atuar na camada que torna a qualidade de sistemas de IA mensurável, repetível e confiável. A missão é criar evidências técnicas para que times de produto e stakeholders confiem no que está sendo entregue, conectando a plataforma de agentes às rotinas de avaliação e testes.

Responsabilidades

  • Projetar e manter suítes de testes comportamentais (goal + evals) para features de IA
  • Construir e evoluir pipelines de LLM-as-judge para scoring automatizado, com rubricas e calibração
  • Instrumentar bases de código existentes com testes comportamentais, sensores de CI e empacotamento do System Under Test (SUT)
  • Manter a infraestrutura de eval na plataforma de agentes, incluindo harness, tagueamento de traces, revisão humana e dashboards
  • Definir critérios de aceite para migrações com equivalência comportamental e preservação de invariantes
  • Detectar e alertar modos de falha de IA, como regressão de latência, distribution shift e drift de acurácia
  • Implementar evals para alucinação, verificando factualidade contra fontes recuperadas e emitindo alertas
  • Apoiar as equipes de stream na configuração do AGENTS.md e na criação da suíte inicial de sensores
  • Manter o pipeline de amostragem de revisão humana e realimentar scores para calibração contínua

Requisitos

  • Ensino superior completo em Ciência da Computação, Engenharia de Software ou área correlata
  • Experiência com desenvolvimento de software e engenharia de qualidade (mínimo 6 anos), com 2+ anos em frameworks de avaliação de IA/ML em produção
  • Base sólida em testes de software, com asserções comportamentais e entendimento de invariantes
  • Experiência com frameworks de avaliação de IA/ML, como LLM-as-judge, preference pairs e scoring por rubricas
  • Fluência em CI/CD (ex.: GitHub Actions), com foco em desenho e construção de pipelines
  • Proficiência em Python para scripting de evals, tooling de harness e pipelines de dados
  • Experiência com logging estruturado, correlação de traces e observabilidade
  • Comunicação escrita forte para elaborar critérios de aceite acionáveis
  • Inglês avançado/fluente

Beneficios

  • Trabalho remoto no Brasil, com autonomia e flexibilidade
  • Plano de saúde e odontológico, seguro de vida e Wellhub (Gympass)
  • Benefícios de educação com descontos em cursos da FIAP e MBA USP Esalq
  • Wellhub, descontos em lojas Multilaser, bonificação por indicação, horário adaptável e bônus anual
Esta vaga foi curada e enriquecida pelo 123Vagas para facilitar sua busca. A candidatura é feita no site original: luby.inhire.app. Saiba como funciona.
Publicada em 26 de julho de 2026
Compartilhar:
Candidatar-se