* Salário: R$ 2.000 a R$ 5.000 por mês (estimado)
* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.
Área: Outros
Nível: Senior
Quais serão suas principais entregas?
Responsável por garantir que os serviços operem com alta disponibilidade, desempenho, segurança, observabilidade e capacidade de recuperação. Sua atuação deve combinar práticas de engenharia de software voltadas para infraestrutura, automação, gestão de incidentes e melhoria contínua.
Mais do que executar atividades operacionais, espera-se que o profissional identifique riscos sistêmicos, proponha soluções estruturais, automatize processos repetitivos, defina padrões técnicos e lidere a evolução da confiabilidade dos ambientes.
Como será o seu dia a dia?
· Monitorar continuamente a saúde dos ambientes utilizando Datadog e OpenSearch.
- Acompanhar a operação dos clusters Amazon EKS, identificando e resolvendo problemas de infraestrutura.
- Administrar e otimizar containers Docker e repositórios no Amazon ECR.
- Configurar, revisar e manter Nginx, Lua, ALBs e NLBs para garantir disponibilidade e desempenho das aplicações.
- Monitorar e administrar o Amazon MSK, acompanhando filas, brokers, tópicos e consumer lag.
- Gerenciar pipelines de logs com Fluent Bit, Fluentd e Logstash.
- Provisionar, revisar e evoluir infraestrutura utilizando Terraform.
- Automatizar configurações e tarefas operacionais com Ansible.
- Investigar incidentes, realizar troubleshooting e executar ações de mitigação e recuperação.
- Criar e manter dashboards, alertas, métricas e SLOs para acompanhamento da plataforma.
- Planejar melhorias de capacidade, desempenho, segurança e redução de custos.
- Trabalhar em conjunto com os times de desenvolvimento para garantir entregas confiáveis, escaláveis e observáveis.
Conhecimentos que estamos buscando:
- Vivência em ambiente de desenvolvimento ágil;
- Conhecimento de uso com o JIRA e CONFLUENCE;
- Possuir perfil analítico, proativo e participativo, com habilidade de solucionar problemas e boa adaptabilidade nas mudanças;
- Possuir comunicação para interagir diretamente com sua equipe e pessoas de outros times;
- Disposição para colaborar com o crescimento das pessoas de seu convívio, querendo impactar suas carreiras profissionais;
- Profissional autogerenciável e comprometido/a com o todo, buscando entender o produto, tirando dúvidas e trazendo soluções.
- Estar sempre estudando e atualizado em novas tecnologias buscando o aperfeiçoamento contínuo;
- Experiência sólida com Docker, incluindo criação, otimização e gerenciamento de imagens e containers.
- Conhecimento em Kubernetes, preferencialmente Amazon EKS, com experiência em administração, troubleshooting e escalabilidade de clusters.
- Experiência com Terraform para provisionamento e gerenciamento de infraestrutura como código (IaC).
- Conhecimento em Ansible para automação de configurações, deploys e padronização de ambientes.
- Experiência na administração e configuração de Nginx, incluindo proxy reverso, balanceamento de carga, SSL/TLS e otimização de desempenho.
- Conhecimento em Lua para customizações e automações em ambientes Nginx/OpenResty.
- Experiência com Amazon ECR (AWS Registry) para gerenciamento de imagens Docker e versionamento de containers.
- Conhecimento em Application Load Balancer (ALB) e Network Load Balancer (NLB) para gerenciamento de tráfego e alta disponibilidade.
- Experiência com Amazon MSK (Kafka), incluindo monitoramento de brokers, tópicos, consumer groups e análise de consumer lag.
- Conhecimento em pipelines de logs utilizando Fluent Bit, Fluentd e Logstash, incluindo coleta, transformação e envio de logs.
- Experiência com Datadog para observabilidade, criação de dashboards, métricas, logs, traces, APM e alertas.
- Conhecimento em OpenSearch para indexação, consulta e análise de logs e dados operacionais.
- Experiência em monitoramento, troubleshooting e resolução de incidentes em ambientes críticos.
- Conhecimento em boas práticas de alta disponibilidade, escalabilidade, segurança, observabilidade e automação.
- Vivência com metodologias DevOps, SRE, Infraestrutura como Código (IaC) e cultura de melhoria contínua.
- Conhecimento em ambientes AWS e seus principais serviços relacionados à plataforma de containers e infraestrutura.
Desejável conhecimento em:
- Docker – Criação, otimização e gerenciamento de imagens e containers
- Nginx – Configuração de proxy reverso, roteamento, balanceamento de carga, SSL/TLS e otimização de desempen
- Lua – Desenvolvimento e manutenção de scripts para customização e automação em Nginx/OpenResty.
- Fluent Bit / Fluentd – Coleta, processamento, enriquecimento e encaminhamento de logs.
- Logstash – Construção e manutenção de pipelines para transformação, filtragem e distribuição de logs.
- AWS Cloud – Experiência com arquitetura, redes, segurança, disponibilidade, escalabilidade, monitoramento e otimização de custos na AWS.
- Amazon MSK (Kafka) – Administração e monitoramento de clusters Kafka, brokers, tópicos, partições, consumer groups e consumer lag.
- Amazon ECR (AWS Registry) – Gerenciamento, versionamento, armazenamento e análise de segurança de imagens Docker.
- Amazon EKS (Kubernetes) – Administração de clusters, deployments, autoscaling, segurança, alta disponibilidade e troubleshooting.
- Application Load Balancer (ALB) – Configuração de listeners, target groups, health checks e roteamento de tráfego HTTP/HTTPS.
- Network Load Balancer (NLB) – Configuração de balanceamento de tráfego TCP, UDP e TLS, com foco em desempenho e disponibilidade.
- Datadog – Monitoramento de infraestrutura e aplicações por meio de métricas, logs, traces, APM, dashboards e alertas.
- OpenSearch – Indexação, pesquisa, análise, retenção e visualização de logs e dados operacionais.
- F5 BIG-IP – Administração de Virtual Servers, Pools, Monitors, iRules, balanceamento de carga, SSL Offloading e alta disponibilidade.
- Ansible – Automação de configurações, instalações, atualizações e padronização de ambientes.
- Terraform – Provisionamento e gerenciamento de infraestrutura como código, com módulos reutilizáveis, controle de estado e automação de ambientes AWS.
