123Vagas
Vagas Vagas Remotas Vagas Híbridas Cidades Empresas Skills Blog 123Vagas Plus Para Empresas

Institucional

Sobre Como Funciona FAQ Contato Privacidade Termos de Uso

Sou candidato

Entrar / Criar conta

Sou empresa

Entrar como empresa Cadastrar empresa grátis
LU

Engenheiro(a) de RLHF e Aprendizado por Preferência Sênior (Remoto)

Luby Ontem
Remoto CLT Tecnologia 3 visualizações
RLHF reward modeling RLAIF

Sobre a Vaga

Na Luby, você atuará ponta a ponta no loop de feedback que evolui agentes de IA de uma plataforma de saúde a partir de preferências de clínicos, profissionais de apoio e pacientes. O trabalho é remoto e exige atenção rigorosa à segurança clínica e ao tratamento de dados sensíveis (PHI).

Responsabilidades

  • Projetar e manter a infraestrutura de coleta de dados de preferência, incluindo UIs de revisão e fluxos para revisores clínicos
  • Construir e evoluir a infraestrutura de reward modeling, com datasets, pipelines de treino e metodologias de avaliação
  • Assumir o ciclo RLHF/RLAIF dos agentes principais, apoiando automações como inbox, prontuário, documentação clínica e encaminhamentos
  • Definir e manter a hierarquia de sinais de qualidade, determinando quando cada tipo de feedback exige revisão especialista, apoio ou automação via RLAIF
  • Desenvolver pipelines de RLAIF para escalar a anotação com abordagens como Constitutional AI e geração automatizada de pares de preferência
  • Atuar em conjunto com a engenharia de inteligência na estratégia de fine-tuning, prompt engineering e RAG, entendendo como o aprendizado por preferência se integra
  • Garantir conformidade com PHI em todas as etapas do pipeline, com interfaces seguras, auditoria e requisitos de residência de dados

Requisitos

  • Mestrado em Ciência da Computação, Ciência de Dados ou experiência equivalente
  • Experiência de pelo menos 8 anos em Ciência de Dados ou Engenharia de ML, com no mínimo 3 anos em aprendizado por preferência, RLHF ou reward modeling em produção
  • Experiência hands-on com RLHF/RLAIF, incluindo vivência com reward hacking e desenho de soluções para mitigação
  • Expertise em reward modeling: construção de datasets de preferência, treino de reward models e avaliação com estabilidade sob distribution shift
  • Fundamentos sólidos de engenharia de ML, com experiment tracking (MLflow ou equivalente), versionamento e avaliação em CI
  • Domínio de Python e frameworks de ML, com PyTorch preferencialmente, além de familiaridade com fine-tuning eficiente (PEFT/LoRA)
  • Entendimento de ambientes regulados e do perfil de risco de IA clínica para desenhar fluxos de anotação com segurança
  • Certificação GCP Machine Learning Engineer (ou equivalente)
  • Inglês fluente/avançado

Beneficios

  • Plano de Saúde e Odontológico
  • Seguro de Vida e Wellhub (Gympass)
  • Descontos em cursos da FIAP e MBA USP Esalq
  • Horário adaptável e bônus anual
  • Bonificação por indicação e descontos em lojas Multilaser
Esta vaga foi curada e enriquecida pelo 123Vagas para facilitar sua busca. A candidatura é feita no site original: luby.inhire.app. Saiba como funciona.
Publicada em 26 de julho de 2026
Compartilhar:
Candidatar-se