Caro usuário, habilite o javascript para que esse site funcione corretamente.

SRE SR | Remoto

* Salário: R$ 2.000 a R$ 5.000 por mês (estimado)

* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.

Área: Outros

Nível: Senior

Quais serão suas principais entregas?


Responsável por garantir que os serviços operem com alta disponibilidade, desempenho, segurança, observabilidade e capacidade de recuperação. Sua atuação deve combinar práticas de engenharia de software voltadas para infraestrutura, automação, gestão de incidentes e melhoria contínua.

Mais do que executar atividades operacionais, espera-se que o profissional identifique riscos sistêmicos, proponha soluções estruturais, automatize processos repetitivos, defina padrões técnicos e lidere a evolução da confiabilidade dos ambientes.

Como será o seu dia a dia?

· Monitorar continuamente a saúde dos ambientes utilizando Datadog e OpenSearch.

  • Acompanhar a operação dos clusters Amazon EKS, identificando e resolvendo problemas de infraestrutura.
  • Administrar e otimizar containers Docker e repositórios no Amazon ECR.
  • Configurar, revisar e manter Nginx, Lua, ALBs e NLBs para garantir disponibilidade e desempenho das aplicações.
  • Monitorar e administrar o Amazon MSK, acompanhando filas, brokers, tópicos e consumer lag.
  • Gerenciar pipelines de logs com Fluent Bit, Fluentd e Logstash.
  • Provisionar, revisar e evoluir infraestrutura utilizando Terraform.
  • Automatizar configurações e tarefas operacionais com Ansible.
  • Investigar incidentes, realizar troubleshooting e executar ações de mitigação e recuperação.
  • Criar e manter dashboards, alertas, métricas e SLOs para acompanhamento da plataforma.
  • Planejar melhorias de capacidade, desempenho, segurança e redução de custos.
  • Trabalhar em conjunto com os times de desenvolvimento para garantir entregas confiáveis, escaláveis e observáveis.

Conhecimentos que estamos buscando:

  • Vivência em ambiente de desenvolvimento ágil;
  • Conhecimento de uso com o JIRA e CONFLUENCE;
  • Possuir perfil analítico, proativo e participativo, com habilidade de solucionar problemas e boa adaptabilidade nas mudanças;
  • Possuir comunicação para interagir diretamente com sua equipe e pessoas de outros times;
  • Disposição para colaborar com o crescimento das pessoas de seu convívio, querendo impactar suas carreiras profissionais;
  • Profissional autogerenciável e comprometido/a com o todo, buscando entender o produto, tirando dúvidas e trazendo soluções.
  • Estar sempre estudando e atualizado em novas tecnologias buscando o aperfeiçoamento contínuo;
  • Experiência sólida com Docker, incluindo criação, otimização e gerenciamento de imagens e containers.
  • Conhecimento em Kubernetes, preferencialmente Amazon EKS, com experiência em administração, troubleshooting e escalabilidade de clusters.
  • Experiência com Terraform para provisionamento e gerenciamento de infraestrutura como código (IaC).
  • Conhecimento em Ansible para automação de configurações, deploys e padronização de ambientes.
  • Experiência na administração e configuração de Nginx, incluindo proxy reverso, balanceamento de carga, SSL/TLS e otimização de desempenho.
  • Conhecimento em Lua para customizações e automações em ambientes Nginx/OpenResty.
  • Experiência com Amazon ECR (AWS Registry) para gerenciamento de imagens Docker e versionamento de containers.
  • Conhecimento em Application Load Balancer (ALB) e Network Load Balancer (NLB) para gerenciamento de tráfego e alta disponibilidade.
  • Experiência com Amazon MSK (Kafka), incluindo monitoramento de brokers, tópicos, consumer groups e análise de consumer lag.
  • Conhecimento em pipelines de logs utilizando Fluent Bit, Fluentd e Logstash, incluindo coleta, transformação e envio de logs.
  • Experiência com Datadog para observabilidade, criação de dashboards, métricas, logs, traces, APM e alertas.
  • Conhecimento em OpenSearch para indexação, consulta e análise de logs e dados operacionais.
  • Experiência em monitoramento, troubleshooting e resolução de incidentes em ambientes críticos.
  • Conhecimento em boas práticas de alta disponibilidade, escalabilidade, segurança, observabilidade e automação.
  • Vivência com metodologias DevOps, SRE, Infraestrutura como Código (IaC) e cultura de melhoria contínua.
  • Conhecimento em ambientes AWS e seus principais serviços relacionados à plataforma de containers e infraestrutura.

Desejável conhecimento em:

  • Docker – Criação, otimização e gerenciamento de imagens e containers
  • Nginx – Configuração de proxy reverso, roteamento, balanceamento de carga, SSL/TLS e otimização de desempen
  • Lua – Desenvolvimento e manutenção de scripts para customização e automação em Nginx/OpenResty.
  • Fluent Bit / Fluentd – Coleta, processamento, enriquecimento e encaminhamento de logs.
  • Logstash – Construção e manutenção de pipelines para transformação, filtragem e distribuição de logs.
  • AWS Cloud – Experiência com arquitetura, redes, segurança, disponibilidade, escalabilidade, monitoramento e otimização de custos na AWS.
  • Amazon MSK (Kafka) – Administração e monitoramento de clusters Kafka, brokers, tópicos, partições, consumer groups e consumer lag.
  • Amazon ECR (AWS Registry) – Gerenciamento, versionamento, armazenamento e análise de segurança de imagens Docker.
  • Amazon EKS (Kubernetes) – Administração de clusters, deployments, autoscaling, segurança, alta disponibilidade e troubleshooting.
  • Application Load Balancer (ALB) – Configuração de listeners, target groups, health checks e roteamento de tráfego HTTP/HTTPS.
  • Network Load Balancer (NLB) – Configuração de balanceamento de tráfego TCP, UDP e TLS, com foco em desempenho e disponibilidade.
  • Datadog – Monitoramento de infraestrutura e aplicações por meio de métricas, logs, traces, APM, dashboards e alertas.
  • OpenSearch – Indexação, pesquisa, análise, retenção e visualização de logs e dados operacionais.
  • F5 BIG-IP – Administração de Virtual Servers, Pools, Monitors, iRules, balanceamento de carga, SSL Offloading e alta disponibilidade.
  • Ansible – Automação de configurações, instalações, atualizações e padronização de ambientes.
  • Terraform – Provisionamento e gerenciamento de infraestrutura como código, com módulos reutilizáveis, controle de estado e automação de ambientes AWS.