Caro usuário, habilite o javascript para que esse site funcione corretamente.

Profissional Especialista em Avaliação e Infraestrutura de Testes de IA - Remoto

* Salário: R$ 2.000 a R$ 5.000 por mês (estimado)

* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.

Área: Outros

Nível: Senior

#VemPraConfidencial (Apenas para Cadastrados)💙

Aqui você terá a oportunidade de:

  • Evoluir em um ambiente de alta performance: Uma cultura onde o desenvolvimento é contínuo, com autonomia e envolvimento em projetos nacionais e internacionais que realmente testam suas habilidades e impulsionam seu potencial.
  • Integrar um time apaixonado por tecnologia: Aqui, você vai trabalhar ao lado de talentos experientes em um ambiente colaborativo e disruptivo, utilizando as tecnologias mais avançadas do mercado.
  • Deixar sua marca no mundo: Nossas soluções digitais impactam diretamente a vida de milhares de pessoas, e é a sua chance de ser parte ativa na construção de um futuro mais digital e conectado.
  • Trabalhar de forma remota e com flexibilidade: Seja qual for o seu lugar, estamos prontos para te receber no nosso time!

Sua Missão:

A pessoa Especialista em Avaliação e Infraestrutura de Testes de IA (Evals & Harness) é responsável por tornar a qualidade dos sistemas de IA mensurável, repetível e acionável nas equipes de desenvolvimento do cliente. Atuando na interseção entre a plataforma de agentes e os produtos de IA, você instrumenta o harness, projeta as suítes de avaliação (evals), constrói pipelines de LLM-as-judge e é responsável por instrumentar bases de código existentes com suítes de testes comportamentais, sensores de CI e empacotamento de SUT. Seu trabalho é a camada de evidência que permite que os times de produto e stakeholders confiem que o que é entregue está correto, e que os engenheiros entreguem com confiança.

Principais Atividades:

  • Projetar e manter suítes de testes comportamentais (pares de goal + evals) para features de IA nas equipes de stream — o goal define o que é sucesso; o eval prova que o sistema chegou lá.
  • Construir e manter pipelines de LLM-as-judge para scoring automatizado de qualidade: design de rubricas, seleção do modelo avaliador e calibração contra revisão humana como ground truth.
  • Instrumentar bases de código existentes (sistemas EMR e afins) com suítes de testes comportamentais, sensores de CI e empacotamento de SUT.
  • Manter a camada de infraestrutura de eval na plataforma de agentes: primitivas de harness, tagueamento de traces, UIs de revisão humana e dashboards de métricas de qualidade.
  • Definir critérios de aceite para migrações de sistemas: specs de equivalência comportamental que garantem que os sistemas sucessores mantenham as invariantes do sistema estabelecido.
  • Detectar e alertar sobre modos de falha específicos de IA: regressão de latência, esgotamento de janela de contexto, distribution shift e drift de acurácia.
  • Ser responsável pela detecção de alucinação como categoria própria de eval: checagens de factualidade que verificam as saídas do agente contra fontes recuperadas, pipelines de comparação com ground truth e alertas quando o modelo afirma conteúdo não suportado pelo seu contexto.
  • Apoiar as equipes de stream na configuração do AGENTS.md, no wiring dos workflows de CI e na criação da suíte inicial de sensores — transferindo capacidade, não dependência.
  • Manter o pipeline de amostragem de revisão humana: definir taxas de amostragem, fluxos de revisão e o loop de feedback dos scores de volta para a calibração das suítes de eval.

Requisitos essenciais:

  • Ensino superior completo em Ciência da Computação, Engenharia de Software ou área correlata.
  • Pelo menos 6 anos de experiência em desenvolvimento de software e engenharia de qualidade, sendo 2+ anos projetando frameworks de avaliação de IA/ML em produção.
  • Fundamentos sólidos de teste de software: escrever asserções comportamentais (não click-path tests) e distinguir invariantes de complexidade acidental.
  • Experiência projetando frameworks de avaliação para sistemas de IA/ML: LLM-as-judge, preference pairs e scoring baseado em rubricas.
  • Fluência em CI/CD (GitHub Actions ou equivalente) em nível de design de pipeline — construir pipelines, não apenas configurá-los.
  • Proficiência em Python para scripting de evals, tooling de harness e trabalho com pipelines de dados.
  • Experiência prática com logging estruturado, correlação de traces e observabilidade de sistemas de software.
  • Comunicação escrita forte: redigir critérios de aceite que engenheiros, líderes de produto e revisores consigam acionar.
  • Inglês avançado/fluente.

Será um diferencial:

  • Experiência com IA clínica ou avaliação de IA em domínios regulados.
  • Familiaridade com requisitos de compliance PIPEDA/PHIPA para tratamento de dados de teste (PHI em fixtures, requisitos de anonimização).
  • Experiência com empacotamento de SUT (System Under Test) e ambientes de teste efêmeros.
  • Familiaridade com padrões de modernização de sistemas legados (Strangler Fig, teste de equivalência comportamental).

O que oferecemos:

  • Trabalho Remoto: Desfrute da flexibilidade de trabalhar de qualquer lugar do Brasil, com total autonomia e organização.
  • Saúde e Bem estar: Plano de Saúde e Odontológico, Seguro de Vida e Wellhub (Gympass).
  • +Educação: Descontos em cursos da FIAP e MBA USP Esalq para você continuar aprendendo e se desenvolvendo.
  • Diferenciais exclusivos: Descontos em lojas Multilaser, bonificação por indicação de profissionais e negócios, horário adaptável e bônus anual.

Saiba mais sobre cultura, diferenciais e como é ser um #Luber em nossa Página de Carreiras!