Caro usuário, habilite o javascript para que esse site funcione corretamente.

Engenheiro de Confiabilidade Pleno - SRE

* Salário: R$ 12.000 a R$ 20.000 por mês (estimado)

* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.

Área: Engenharia

Nível: Senior

Sobre a Vaga

No Reclame AQUI, não somos apenas um site de reclamações; somos a maior plataforma de confiança do país e estamos em plena expansão global. Nossa infraestrutura é o palco onde milhões de vozes encontram solução e onde as empresas constroem suas reputações. Como SRE Pleno, você entra em um momento estratégico: nosso desafio é escalar com previsibilidade e transformar nossa monitoração em uma aliada da experiência real do usuário.

Buscamos um(a) profissional que entenda que soft skills são tão importantes quanto hard skills e que demonstre capacidade de manter um alto nível de entrega continuamente, não apenas em projetos pontuais. Procuramos alguém com atitude colaborativa e mentalidade de dono para ajudar a blindar nossa plataforma, garantindo que a confiança nunca fique offline. Aqui, você terá autonomia para errar, aprender rápido e ser protagonista na evolução da nossa cultura de confiabilidade.

Missão do Cargo

Sua missão é ser o guardião da estabilidade, previsibilidade e performance do ecossistema Reclame AQUI. Esperamos que você colabore ativamente com a squad no dimensionamento de tarefas, trazendo previsibilidade para o fluxo de trabalho. Daqui a um ano, esperamos que você tenha consolidado um ambiente onde o monitoramento proativo seja o padrão, onde falhas simples sejam mitigadas por rotinas preditivas criadas por você, e onde a nossa plataforma de desenvolvimento (FAÍSCA) seja uma ferramenta de aceleração diária para todos os times de produto.

Principais Responsabilidades

  • Previsibilidade e Planejamento: Apoiar o time no dimensionamento e refinamento técnico de tarefas de SRE nas cerimônias da sprint, garantindo entregas consistentes e previsíveis.

  • Excelência em Observabilidade (Predictive Ops): Implementar rotinas preditivas para reduzir e evitar falhas simples, evoluindo nosso monitoramento para os Golden Signals (Latência, Erro, Tráfego e Saturação) com o objetivo de antecipar impactos na jornada do consumidor.

  • Gestão de Confiabilidade: Apoiar ativamente a definição e o cumprimento de SLOs e SLAs das squads, acompanhando os Error Budgets para equilibrar a velocidade de deploy com a estabilidade do sistema.

  • Engenharia de Plataforma (IDP): Colaborar na evolução do FAÍSCA (nosso portal baseado em Backstage), desenvolvendo templates e automatizando o provisionamento de recursos (como buckets, bancos e microsserviços) para eliminar a fricção operacional dos desenvolvedores.

  • Operação e Resiliência em Kubernetes: Realizar o troubleshoot e o ajuste fino de workloads no K8s, tratando problemas de recursos de forma ágil (como CPU, memória, storage) e atuando diretamente na contenção de gargalos como DiskPressure.

  • Cultura Blameless e Segurança Psicológica: Participar ativamente de rituais de post-mortem, focando no aprendizado técnico, na correção de processos e no fortalecimento da segurança psicológica do time para reportar erros e aprender com eles.

  • Infraestrutura como Código (IaC): Desenvolver, modularizar, versionar e manter códigos em Terraform, garantindo que nossa infraestrutura na GCP seja segura, padronizada e reprodutível.

  • Eficiência Financeira (FinOps): Auxiliar no controle de custos e desperdício de nuvem, apoiando o monitoramento do faturamento na GCP e a eficiência das ferramentas de escalabilidade inteligente (como Spotinst Ocean).

  • Automação e Redução de Toil: Mapear tarefas operacionais repetitivas no dia a dia da infraestrutura e desenvolver scripts (Python ou Golang) para eliminá-las, liberando o time para atuações mais estratégicas.

O que Buscamos (Pré-Requisitos)

  • Experiência Prática Consistente: Bagagem anterior atuando como SRE, DevOps ou Engenheiro(a) de Infraestrutura, demonstrando capacidade de entrega contínua de alto nível.

  • Domínio de Kubernetes: Conhecimento sólido em gerenciamento de pods, troubleshoot diário de workloads, Helm Charts e ciclo de vida de containers.

  • Vivência em Cloud (GCP): Experiência de mercado com os principais serviços da Google Cloud Platform.

  • Cultura de Automação: Prática no desenvolvimento de IaC com Terraform e habilidade para escrever scripts utilitários em Python ou Golang.

  • Foco em Entrega Contínua (CI/CD): Familiaridade com pipelines de integração e entrega contínua, utilizando ferramentas como Argo CD e Bitbucket.

  • Mente de Observabilidade: Prática na configuração de métricas, alertas e painéis utilizando Prometheus e Grafana.

  • Habilidade de Colaboração (Soft Skills): Boa comunicação para atuar de forma cross-functional com desenvolvedores, facilitando a cultura de qualidade e entrega segura.

O que fará nossos olhos brilharem (Diferenciais)

  • Conhecimento prático ou forte interesse em portais internos baseados em Backstage.

  • Noções de FinOps e análise de consumo de recursos em nuvem (GCP / Flexera / Spotinst).

  • Vivência com redes em nuvem (VPC, Cloud Ingress, Service Mesh).

  • Familiaridade com monitoramento e operação de bancos de dados gerenciados (como MongoDB Atlas).