Caro usuário, habilite o javascript para que esse site funcione corretamente.

Gerente SRE e Operações TI

CLT (Efetivo)Presencial (Local)São Paulo-SPEmpresa Confidencial (Cadastre-se)

* Salário: R$ 18.000 a R$ 30.000 por mês (estimado)

* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.

Área: Tecnologia da Informação

Nível: Gerente

Buscamos uma pessoa para atuar como Gerente de Observabilidade em TI, liderando a evolução da operação, da monitoração proativa, da gestão de eventos e da resposta a incidentes críticos em um ambiente de alta complexidade, missão crítica e grande relevância para a experiência dos clientes.


Essa posição exige uma liderança técnica e operacional capaz de atuar em um cenário real de transformação: ambientes legados convivendo com novas arquiteturas, sistemas monolíticos, múltiplas ferramentas de observabilidade, alto volume de demandas, necessidade de resposta rápida a problemas de produção e uma cultura organizacional ainda em amadurecimento quanto aos papéis e responsabilidades de observabilidade.


A pessoa será responsável por conduzir equipes, processos e fornecedores na busca por maior estabilidade, previsibilidade operacional, redução de ruído, eliminação de toil, automação e evolução das práticas de confiabilidade. É uma posição para quem tem maturidade para lidar com pressão, ambiguidade, problemas complexos e, ao mesmo tempo, capacidade de construir uma operação mais simples, integrada, orientada a indicadores e conectada ao negócio.

A área é responsável por garantir a estabilidade, disponibilidade e evolução contínua dos serviços e plataformas tecnológicas que suportam a operação do negócio.

  • Ter atendimento voltado a necessidade do negócio;
  • Equilibrar estabilidade e agilidade;
  • Monitorar e medir serviço sob a perspectiva de negócio;
  • Ser uma operação preditiva;
  • Ter processos simples e eficientes;
  • Pessoas certas nos lugares certos;
  • Gestão por indicadores.

Dentro do contexto da Diretoria, a Gerência Sênior de TI é responsável pelos Processos de melhoria e evolução da Confiabilidade de TI, como:

  • Resiliência, Gestão de Eventos (Monitoramento e Alarmística), Observabilidade e AIOps;
  • Evolução baseada nas práticas modernas de Engenharia da Confiabilidade (SRE) e ModernOps.

Responsabilidades e atribuições


  • Liderar as equipes internas e parceiras responsáveis por monitoração, gestão de eventos, observabilidade, operação e apoio à resposta a incidentes críticos.
  • Garantir a estabilidade, disponibilidade e performance dos serviços críticos, atuando tanto na prevenção quanto na resposta a problemas em produção.
  • Evoluir o modelo de monitoração proativa, alarmística, gestão de eventos e observabilidade, reduzindo ruído operacional e aumentando a capacidade de detectar impactos relevantes ao negócio.
  • Atuar em ambientes complexos, com sistemas legados, aplicações monolíticas, integrações críticas, ambientes cloud, on-premises e híbridos.
  • Conduzir a melhoria contínua dos processos de operação, monitoração, incidentes críticos, reincidência de falhas, postmortem e gestão de problemas.
  • Apoiar a adoção e evolução de práticas de Engenharia de Confiabilidade, SRE, ModernOps, SLA, SLO, automação e AIOps.
  • Atuar de forma próxima à operação, com postura hands on quando necessário, especialmente em eventos relevantes, crises, incidentes críticos e problemas recorrentes.
  • Promover maior clareza sobre papéis e responsabilidades de observabilidade, apoiando a transformação cultural e operacional da organização.
  • Definir, acompanhar e evoluir OKRs, KPIs e indicadores de desempenho operacional, confiabilidade, eficiência e qualidade, sempre pautado em como a engenharia de confiabilidade e observabilidade podem apoiar nessa evolução.
  • Reduzir toil por meio de automações, padronização de procedimentos, melhoria de processos e uso mais inteligente das ferramentas existentes.
  • Garantir comunicação clara, objetiva e executiva em situações de eventos, incidentes críticos, riscos operacionais, evolução de indicadores e planos de ação.
  • Gerenciar fornecedores, contratos, capacidade de atendimento, orçamento e níveis de serviço relacionados às soluções e operações sob sua responsabilidade.
  • Assegurar conformidade com políticas, normas, controles operacionais, requisitos de auditoria e boas práticas de gestão de serviços.
  • Desenvolver lideranças e equipes, incentivando colaboração, senso de dono, produtividade, aprendizado contínuo e foco em resultado.
  • Conectar as demandas técnicas e operacionais às prioridades do negócio, equilibrando estabilidade, agilidade, eficiência e experiência do cliente.

Requisitos e qualificações

  • Experiência sólida em liderança de operações de TI, monitoração, observabilidade, gestão de eventos, produção e suporte a ambientes de missão crítica.
  • Vivência em ambientes de alta complexidade, com múltiplos sistemas, integrações, tecnologias legadas, arquiteturas monolíticas e forte dependência operacional.
  • Capacidade de liderar equipes técnicas em contextos de pressão, alto volume de demandas, incidentes críticos e mudanças organizacionais.
  • Perfil analítico, com pensamento crítico, capacidade de priorização e tomada de decisão baseada em dados, riscos e impacto ao cliente.
  • Comunicação executiva clara, especialmente para reportar incidentes, riscos, planos de ação, indicadores e evolução operacional.
  • Postura hands on, com disposição para se envolver na operação quando necessário, sem perder a visão estratégica e de transformação.
  • Experiência na gestão de equipes internas, fornecedores e modelos híbridos de trabalho.
  • Visão de tecnologia aplicada ao negócio, com foco em estabilidade, eficiência operacional, satisfação do cliente e continuidade dos serviços.
  • Conhecimento em práticas de gestão de incidentes, problemas, mudanças, eventos, postmortem e melhoria contínua.
  • Capacidade de atuar em uma cultura ainda em transformação, ajudando a organizar responsabilidades, alinhar expectativas e construir maturidade operacional.
  • Desejável formação superior em Tecnologia da Informação, Engenharia, Administração, Matemática, exatas ou áreas correlatas.
  • Necessário inglês ou espanhol, avançado, para interação com fornecedores, documentação técnica ou contextos corporativos.
  • Disponibilidade para atuação em situações críticas e participação em escalas ou acionamentos previamente definidos, quando necessário.

Conhecimentos

  • Observabilidade, monitoração proativa, gestão de eventos, alarmística, correlação de eventos e redução de ruído operacional.
  • Ferramentas de monitoração e observabilidade Elastic, Datadog, Zabbix e plataformas correlatas.
  • Gestão de serviços de TI, ITIL, ITOM em ServiceNow e processos de operação de produção.
  • SRE, ModernOps, confiabilidade, disponibilidade, resiliência, SLA, SLO, indicadores operacionais e gestão por OKRs/KPIs.
  • Ambientes legados, sistemas monolíticos, integrações críticas, infraestrutura, aplicações, cloud pública, privada ou híbrida.
  • Automação operacional, redução de toil, melhoria de processos e padronização de rotinas operacionais.
  • Gestão de incidentes críticos, gestão de problemas, análise de causa raiz, blameless postmortem e prevenção de reincidências.
  • Noções de integração entre monitoração, multicloud, CMDB, ITSM, operação, atendimento e times de sustentação.
  • Consolidação de ferramentas – migração, tombamento, desativação: SPLUNK, ELK OPEN, NINSOFT, ZABBIX 6.X, etc.
  • Conhecimento básico sobre pipelines, DevOps, CI/CD, automação, versionamento e práticas modernas de engenharia será valorizado.
  • Fundamentos de AIOps, uso de IA aplicada à operação, observabilidade de agentes de IA e governança operacional de automações são conhecimentos desejáveis.

Diferenciais

  • Experiência anterior em empresas de grande porte, operações críticas, serviços digitais ou ambientes com alta dependência tecnológica.
  • Vivência em transformação de modelos operacionais tradicionais para modelos mais preditivos, automatizados e orientados a confiabilidade.
  • Experiência prática com ServiceNow, ITOM, Zabbix, Elastic, Datadog ou ferramentas equivalentes.
  • Conhecimento ambientes heterogêneos com tecnologias legadas e modernas convivendo.
  • Experiência com AIOps, automação de eventos, correlação inteligente, uso de IA para suporte operacional e proatividade.
  • Familiaridade com métodos ágeis, DevOps, SRE, CI/CD e práticas de engenharia aplicadas à operação.
  • Experiência em gestão de fornecedores, contratos, orçamento, capacidade de atendimento e melhoria de desempenho operacional.
  • Capacidade de influenciar diferentes áreas, alinhar times técnicos e executivos, e conduzir mudanças em ambientes complexos e com baixa clareza inicial de responsabilidades.

Informações adicionais

Benefícios

  • Pacote flexível de benefícios (VA, VR, assistência médica e odontológica, seguro de vida, auxílio farmácia e academia).
  • Participação nos Resultados (PPR) ou bônus anual.
  • Previdência privada.
  • Auxílio creche, escola ou babá.
  • Modelo híbrido, com até 2 dias de trabalho remoto por semana.
  • Horário flexível.
  • Day Off.
  • Programas de desenvolvimento, capacitação e parcerias educacionais.
  • Oportunidades de crescimento e mobilidade interna.

Etapas do processo

  1. Etapa 1: Cadastro
  2. Etapa 2: Triagem
  3. Etapa 3: Teste
  4. Etapa 4: Entrevista com RH
  5. Etapa 5: Avaliação comportamental
  6. Etapa 6: Entrevista com Gestor
  7. Etapa 7: Proposta
  8. Etapa 8: Contratação