* Salário: R$ 2.000 a R$ 3.500 por mês (estimado)
* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.
Área: Engenharia
Nível: Estagio
#VemPraConfidencial (Apenas para Cadastrados)💙
Aqui você terá a oportunidade de:
- Evoluir em um ambiente de alta performance: Uma cultura onde o desenvolvimento é contínuo, com autonomia e envolvimento em projetos nacionais e internacionais que realmente testam suas habilidades e impulsionam seu potencial.
- Integrar um time apaixonado por tecnologia: Aqui, você vai trabalhar ao lado de talentos experientes em um ambiente colaborativo e disruptivo, utilizando as tecnologias mais avançadas do mercado.
- Deixar sua marca no mundo: Nossas soluções digitais impactam diretamente a vida de milhares de pessoas, e é a sua chance de ser parte ativa na construção de um futuro mais digital e conectado.
- Trabalhar de forma remota e com flexibilidade: Seja qual for o seu lugar, estamos prontos para te receber no nosso time!
Sua Missão:
Buscamos uma pessoa Engenheira de RLHF e Aprendizado por Preferência (nível sênior) para assumir, de ponta a ponta, o loop de feedback que faz agentes de IA de uma plataforma de saúde evoluírem continuamente a partir das preferências de clínicos, profissionais de apoio e pacientes que os utilizam. Você será responsável pela infraestrutura de coleta de sinais de preferência humana, pelos pipelines que transformam esses sinais em dados de treinamento e pela infraestrutura de reward modeling que molda o comportamento dos agentes. Tudo isso em um ambiente regulado, com dados sensíveis de saúde (PHI) e implicações diretas de segurança clínica, onde você define o peso de cada sinal de qualidade e assume o ciclo completo: interface de anotação, pipeline de treinamento, framework de avaliação e rollout em produção.
Principais Atividades:
- Projetar e manter a infraestrutura de coleta de dados de preferência: UIs de revisão humana, fluxos de trabalho para revisores clínicos e pipelines de anotação de pares de preferência.
- Construir e manter a infraestrutura de reward modeling: datasets de preferência, pipelines de treino de reward models e metodologia de avaliação, incluindo detecção de reward hacking.
- Assumir o loop de aprendizado RLHF/RLAIF dos agentes principais: automação de inbox, criação de prontuário, documentação clínica e acompanhamento de encaminhamentos.
- Definir e manter a hierarquia de sinais de qualidade: quais sinais de feedback exigem revisão de especialista clínico, quais podem ser tratados por revisão de apoio e quais podem ser automatizados via RLAIF.
- Construir pipelines de RLAIF onde a anotação humana não escala: abordagens de Constitutional AI, calibração de LLM-as-judge contra ground truth clínico e geração automatizada de pares de preferência.
- Atuar em parceria com a engenharia da camada de inteligência na estratégia de fine-tuning: quando aplicar fine-tuning, prompt engineering ou RAG, e como o aprendizado por preferência interage com cada caminho.
- Garantir conformidade com PHI em todos os pipelines de feedback: interfaces de anotação que não expõem PHI bruto, requisitos de residência de dados (PIPEDA/PHIPA) e acesso de revisores logado e auditável.
Requisitos essenciais:
- Mestrado em Ciência da Computação, Ciência de Dados ou experiência equivalente.
- Pelo menos 8 anos de experiência em Ciência de Dados ou Engenharia de ML, com no mínimo 3 anos em aprendizado por preferência, RLHF ou reward modeling em produção.
- Experiência prática (hands-on) com RLHF/RLAIF: pipelines de aprendizado por preferência já colocados em produção, com vivência real de reward hacking e desenho de soluções para contorná-lo.
- Expertise em reward modeling: construção de datasets de preferência, treino de reward models, metodologia de avaliação e estabilidade sob distribution shift.
- Fundamentos sólidos de engenharia de ML: pipelines de treinamento, experiment tracking (MLflow ou equivalente), versionamento de modelos e frameworks de avaliação rodando em CI de produção.
- Domínio de Python e frameworks de ML, com PyTorch preferencialmente, e familiaridade com fine-tuning eficiente (PEFT/LoRA).
- Vivência em domínios regulados, compreendendo por que loops de feedback de IA clínica têm perfil de risco distinto do de IA de consumo e desenhando os fluxos de anotação com essas implicações em mente.
- Certificação GCP Machine Learning Engineer (ou certificação equivalente em cloud ML).
- Inglês fluente/avançado
Será um diferencial:
- Experiência com fluxos de anotação em IA clínica: painéis de revisores clínicos, controle de qualidade de anotação e medição de concordância entre anotadores em domínios clínicos ambíguos.
- Familiaridade com Constitutional AI / AI feedback em escala (abordagem de RLAIF da Anthropic ou equivalente).
- Experiência com GCP/Vertex AI para fine-tuning: Vertex AI managed fine-tuning e Vertex AI Pipelines para orquestração de treinamento.
- Conhecimento de frameworks de segurança clínica para IA: model cards, auditorias de viés e monitoramento de distribution shift para desfechos clínicos.
O que oferecemos:
- Trabalho Remoto: Desfrute da flexibilidade de trabalhar de qualquer lugar do Brasil, com total autonomia e organização.
- Saúde e Bem estar: Plano de Saúde e Odontológico, Seguro de Vida e Wellhub (Gympass).
- +Educação: Descontos em cursos da FIAP e MBA USP Esalq para você continuar aprendendo e se desenvolvendo.
- Diferenciais exclusivos: Descontos em lojas Multilaser, bonificação por indicação de profissionais e negócios, horário adaptável e bônus anual.
