* Salário: R$ 2.000 a R$ 5.000 por mês (estimado)
* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.
Área: Outros
Nível: Pleno
Sobre a vaga
Se você curte construir a plataforma sobre a qual dezenas de engenheiros entregam produto, e quer ver o efeito disso em milhões de km rodados e na segurança de motoristas reais, esse desafio é pra você.
Como Staff Engineer de Infra & DevTools, você vai liderar a execução técnica dos projetos mais importantes da Confidencial (Apenas para Cadastrados). Você propõe e implementa soluções de infraestrutura em nuvem e de ferramentas internas que tornam o desenvolvimento fácil, rápido, eficiente e escalável para as squads de Produto, Hardware e Dados.
No dia a dia, o foco do time está nos aspectos comuns a toda a plataforma: custo, segurança e observabilidade.
Na prática, isso significa cuidar de clusters Kubernetes na AWS que processam telemetria e vídeo de frotas em tempo real, dos caminhos padronizados (Golden Paths) da nossa Internal Developer Platform, da observabilidade e do custo da nuvem.
Responsabilidades e atribuições
Propor e evoluir a arquitetura da plataforma (Kubernetes/EKS, rede, IaC, CI/CD, IDP), usando dados para priorizar melhorias alinhadas às metas da área.
Liderar a execução técnica de projetos importantes da plataforma, coordenando com as squads impactadas, como upgrades de EKS, migrações de Karpenter e de ingress e mudanças no modelo de gestão de cargas.
Escrever e revisar design docs e ADRs, explicitando trade-offs entre confiabilidade, custo, segurança e velocidade de entrega.
Identificar gaps nos fluxos de desenvolvimento e propor padrões de plataforma (Golden Paths, templates, políticas), apoiando (e liderando) a adoção pelas squads.
Evoluir a Internal Developer Platform com base nas dores dos times, propondo o que construir, adotar ou descontinuar (build vs. buy)
Evoluir a observabilidade (Datadog) e as práticas de FinOps: ownership de alertas e de custo por squad, cobertura de tags e redução de custo AWS.
Implementar e evoluir práticas de segurança na infraestrutura e do ciclo de desenvolvimento junto a SecOps (IAM, segredos, Cognito, desenvolvimento seguro).
Ser a referência de escalação técnica em problemas complexos de infraestrutura e performance
Elevar o nível técnico do time por meio de revisão de código e de design, pareamento e mentoria técnica.
Ser agente ativo na adoção de IA na operação da plataforma: automação operacional, investigação de incidentes e ferramentas que aumentem a produtividade das squads.
Seguir hands-on, implementando as partes mais críticas das iniciativas que lidera.
Requisitos obrigatórios
Experiência sólida em infraestrutura, SRE, DevOps ou Platform Engineering, com parte relevante em produção de alto volume.
Histórico de liderar a execução técnica de projetos de plataforma complexos, coordenando com outras equipes do design à adoção.
Experiência propondo soluções de arquitetura com trade-offs documentados (design docs, ADRs).
Domínio profundo de AWS (EKS, EC2, VPC, IAM, S3, RDS ou equivalentes), incluindo desenho de rede, multi-conta e modelo de permissões.
Domínio de Kubernetes em produção: operação multi-cluster, upgrades sem downtime, autoscaling, networking e troubleshooting avançado.
Infraestrutura como código com Terraform e empacotamento de aplicações com Helm, incluindo módulos e padrões reutilizáveis por outros times.
CI/CD (CircleCI ou similar), com experiência evoluindo fluxos de deploy usados por vários times, e noções de GitOps.
Experiência construindo ou evoluindo uma plataforma interna de desenvolvimento (self-service, templates, catálogo), tratando outros engenheiros como clientes.
Confiabilidade e observabilidade: SLIs/SLOs, error budgets, estratégia de alertas e análise de logs, métricas e traces (Datadog ou equivalente), usando esses dados para priorizar melhorias.
Programação para automação e ferramentas internas (Python, Go ou similar) com qualidade de código de produção.
Liderança de incidentes de alta severidade e de post-mortems.
Fundamentos sólidos de Linux, redes (DNS, TLS, load balancing) e segurança em nuvem.
Experiência prática usando IA para acelerar a engenharia, elevando a produtividade do time e não apenas a própria.
Inglês avançado para leitura técnica.
Diferenciais
Experiência com Karpenter, Emissary-ingress/Envoy ou service mesh.
Experiência prática com Flux ou outra ferramenta de GitOps (ex.: ArgoCD).
Operação de bancos distribuídos (ScyllaDB, Cassandra) ou sistemas de streaming (Kafka, Kinesis).
Prática de FinOps em AWS: alocação de custo por time, tagging, Savings Plans e rightsizing.
Conhecimento de DevSecOps: scanning de imagens e dependências, políticas de admissão, gestão de segredos.
Vivência com o ecossistema JVM em produção (tuning de memória, heap dumps, profiling).
Contato com plataformas de dados (Snowflake, data warehouses) do ponto de vista de infraestrutura.
Gestão de infraestrutura para IA: controle de consumo e custo de tokens de LLMs (gateways, quotas e observabilidade de uso por squad) e MLOps (pipelines de treino e deploy de modelos, serving com GPU no Kubernetes, versionamento e monitoramento de modelos em produção).
