Caro usuário, habilite o javascript para que esse site funcione corretamente.

Profissional Engenheiro(a) de Aprendizado por Preferência (RLHF) - Remoto

* Salário: R$ 2.000 a R$ 3.500 por mês (estimado)

* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.

Área: Engenharia

Nível: Estagio

#VemPraConfidencial (Apenas para Cadastrados)💙

Aqui você terá a oportunidade de:

  • Evoluir em um ambiente de alta performance: Uma cultura onde o desenvolvimento é contínuo, com autonomia e envolvimento em projetos nacionais e internacionais que realmente testam suas habilidades e impulsionam seu potencial.
  • Integrar um time apaixonado por tecnologia: Aqui, você vai trabalhar ao lado de talentos experientes em um ambiente colaborativo e disruptivo, utilizando as tecnologias mais avançadas do mercado.
  • Deixar sua marca no mundo: Nossas soluções digitais impactam diretamente a vida de milhares de pessoas, e é a sua chance de ser parte ativa na construção de um futuro mais digital e conectado.
  • Trabalhar de forma remota e com flexibilidade: Seja qual for o seu lugar, estamos prontos para te receber no nosso time!

Sua Missão:

Buscamos uma pessoa Engenheira de RLHF e Aprendizado por Preferência (nível sênior) para assumir, de ponta a ponta, o loop de feedback que faz agentes de IA de uma plataforma de saúde evoluírem continuamente a partir das preferências de clínicos, profissionais de apoio e pacientes que os utilizam. Você será responsável pela infraestrutura de coleta de sinais de preferência humana, pelos pipelines que transformam esses sinais em dados de treinamento e pela infraestrutura de reward modeling que molda o comportamento dos agentes. Tudo isso em um ambiente regulado, com dados sensíveis de saúde (PHI) e implicações diretas de segurança clínica, onde você define o peso de cada sinal de qualidade e assume o ciclo completo: interface de anotação, pipeline de treinamento, framework de avaliação e rollout em produção.

Principais Atividades:

  • Projetar e manter a infraestrutura de coleta de dados de preferência: UIs de revisão humana, fluxos de trabalho para revisores clínicos e pipelines de anotação de pares de preferência.
  • Construir e manter a infraestrutura de reward modeling: datasets de preferência, pipelines de treino de reward models e metodologia de avaliação, incluindo detecção de reward hacking.
  • Assumir o loop de aprendizado RLHF/RLAIF dos agentes principais: automação de inbox, criação de prontuário, documentação clínica e acompanhamento de encaminhamentos.
  • Definir e manter a hierarquia de sinais de qualidade: quais sinais de feedback exigem revisão de especialista clínico, quais podem ser tratados por revisão de apoio e quais podem ser automatizados via RLAIF.
  • Construir pipelines de RLAIF onde a anotação humana não escala: abordagens de Constitutional AI, calibração de LLM-as-judge contra ground truth clínico e geração automatizada de pares de preferência.
  • Atuar em parceria com a engenharia da camada de inteligência na estratégia de fine-tuning: quando aplicar fine-tuning, prompt engineering ou RAG, e como o aprendizado por preferência interage com cada caminho.
  • Garantir conformidade com PHI em todos os pipelines de feedback: interfaces de anotação que não expõem PHI bruto, requisitos de residência de dados (PIPEDA/PHIPA) e acesso de revisores logado e auditável.

Requisitos essenciais:

  • Mestrado em Ciência da Computação, Ciência de Dados ou experiência equivalente.
  • Pelo menos 8 anos de experiência em Ciência de Dados ou Engenharia de ML, com no mínimo 3 anos em aprendizado por preferência, RLHF ou reward modeling em produção.
  • Experiência prática (hands-on) com RLHF/RLAIF: pipelines de aprendizado por preferência já colocados em produção, com vivência real de reward hacking e desenho de soluções para contorná-lo.
  • Expertise em reward modeling: construção de datasets de preferência, treino de reward models, metodologia de avaliação e estabilidade sob distribution shift.
  • Fundamentos sólidos de engenharia de ML: pipelines de treinamento, experiment tracking (MLflow ou equivalente), versionamento de modelos e frameworks de avaliação rodando em CI de produção.
  • Domínio de Python e frameworks de ML, com PyTorch preferencialmente, e familiaridade com fine-tuning eficiente (PEFT/LoRA).
  • Vivência em domínios regulados, compreendendo por que loops de feedback de IA clínica têm perfil de risco distinto do de IA de consumo e desenhando os fluxos de anotação com essas implicações em mente.
  • Certificação GCP Machine Learning Engineer (ou certificação equivalente em cloud ML).
  • Inglês fluente/avançado

Será um diferencial:

  • Experiência com fluxos de anotação em IA clínica: painéis de revisores clínicos, controle de qualidade de anotação e medição de concordância entre anotadores em domínios clínicos ambíguos.
  • Familiaridade com Constitutional AI / AI feedback em escala (abordagem de RLAIF da Anthropic ou equivalente).
  • Experiência com GCP/Vertex AI para fine-tuning: Vertex AI managed fine-tuning e Vertex AI Pipelines para orquestração de treinamento.
  • Conhecimento de frameworks de segurança clínica para IA: model cards, auditorias de viés e monitoramento de distribution shift para desfechos clínicos.

O que oferecemos:

  • Trabalho Remoto: Desfrute da flexibilidade de trabalhar de qualquer lugar do Brasil, com total autonomia e organização.
  • Saúde e Bem estar: Plano de Saúde e Odontológico, Seguro de Vida e Wellhub (Gympass).
  • +Educação: Descontos em cursos da FIAP e MBA USP Esalq para você continuar aprendendo e se desenvolvendo.
  • Diferenciais exclusivos: Descontos em lojas Multilaser, bonificação por indicação de profissionais e negócios, horário adaptável e bônus anual.

Saiba mais sobre cultura, diferenciais e como é ser um #Luber em nossa Página de Carreiras!