* Salário: R$ 18.000 a R$ 30.000 por mês (estimado)
* O valor exibido é uma estimativa calculada com base em dados públicos e referências do mercado. Não garantimos que este seja o salário oferecido para esta vaga específica.
Área: Tecnologia da Informação
Nível: Gerente
Buscamos uma pessoa para atuar como Gerente de Observabilidade em TI, liderando a evolução da operação, da monitoração proativa, da gestão de eventos e da resposta a incidentes críticos em um ambiente de alta complexidade, missão crítica e grande relevância para a experiência dos clientes.
Essa posição exige uma liderança técnica e operacional capaz de atuar em um cenário real de transformação: ambientes legados convivendo com novas arquiteturas, sistemas monolíticos, múltiplas ferramentas de observabilidade, alto volume de demandas, necessidade de resposta rápida a problemas de produção e uma cultura organizacional ainda em amadurecimento quanto aos papéis e responsabilidades de observabilidade.
A pessoa será responsável por conduzir equipes, processos e fornecedores na busca por maior estabilidade, previsibilidade operacional, redução de ruído, eliminação de toil, automação e evolução das práticas de confiabilidade. É uma posição para quem tem maturidade para lidar com pressão, ambiguidade, problemas complexos e, ao mesmo tempo, capacidade de construir uma operação mais simples, integrada, orientada a indicadores e conectada ao negócio.
A área é responsável por garantir a estabilidade, disponibilidade e evolução contínua dos serviços e plataformas tecnológicas que suportam a operação do negócio.
- Ter atendimento voltado a necessidade do negócio;
- Equilibrar estabilidade e agilidade;
- Monitorar e medir serviço sob a perspectiva de negócio;
- Ser uma operação preditiva;
- Ter processos simples e eficientes;
- Pessoas certas nos lugares certos;
- Gestão por indicadores.
Dentro do contexto da Diretoria, a Gerência Sênior de TI é responsável pelos Processos de melhoria e evolução da Confiabilidade de TI, como:
- Resiliência, Gestão de Eventos (Monitoramento e Alarmística), Observabilidade e AIOps;
- Evolução baseada nas práticas modernas de Engenharia da Confiabilidade (SRE) e ModernOps.
Responsabilidades e atribuições
- Liderar as equipes internas e parceiras responsáveis por monitoração, gestão de eventos, observabilidade, operação e apoio à resposta a incidentes críticos.
- Garantir a estabilidade, disponibilidade e performance dos serviços críticos, atuando tanto na prevenção quanto na resposta a problemas em produção.
- Evoluir o modelo de monitoração proativa, alarmística, gestão de eventos e observabilidade, reduzindo ruído operacional e aumentando a capacidade de detectar impactos relevantes ao negócio.
- Atuar em ambientes complexos, com sistemas legados, aplicações monolíticas, integrações críticas, ambientes cloud, on-premises e híbridos.
- Conduzir a melhoria contínua dos processos de operação, monitoração, incidentes críticos, reincidência de falhas, postmortem e gestão de problemas.
- Apoiar a adoção e evolução de práticas de Engenharia de Confiabilidade, SRE, ModernOps, SLA, SLO, automação e AIOps.
- Atuar de forma próxima à operação, com postura hands on quando necessário, especialmente em eventos relevantes, crises, incidentes críticos e problemas recorrentes.
- Promover maior clareza sobre papéis e responsabilidades de observabilidade, apoiando a transformação cultural e operacional da organização.
- Definir, acompanhar e evoluir OKRs, KPIs e indicadores de desempenho operacional, confiabilidade, eficiência e qualidade, sempre pautado em como a engenharia de confiabilidade e observabilidade podem apoiar nessa evolução.
- Reduzir toil por meio de automações, padronização de procedimentos, melhoria de processos e uso mais inteligente das ferramentas existentes.
- Garantir comunicação clara, objetiva e executiva em situações de eventos, incidentes críticos, riscos operacionais, evolução de indicadores e planos de ação.
- Gerenciar fornecedores, contratos, capacidade de atendimento, orçamento e níveis de serviço relacionados às soluções e operações sob sua responsabilidade.
- Assegurar conformidade com políticas, normas, controles operacionais, requisitos de auditoria e boas práticas de gestão de serviços.
- Desenvolver lideranças e equipes, incentivando colaboração, senso de dono, produtividade, aprendizado contínuo e foco em resultado.
- Conectar as demandas técnicas e operacionais às prioridades do negócio, equilibrando estabilidade, agilidade, eficiência e experiência do cliente.
Requisitos e qualificações
- Experiência sólida em liderança de operações de TI, monitoração, observabilidade, gestão de eventos, produção e suporte a ambientes de missão crítica.
- Vivência em ambientes de alta complexidade, com múltiplos sistemas, integrações, tecnologias legadas, arquiteturas monolíticas e forte dependência operacional.
- Capacidade de liderar equipes técnicas em contextos de pressão, alto volume de demandas, incidentes críticos e mudanças organizacionais.
- Perfil analítico, com pensamento crítico, capacidade de priorização e tomada de decisão baseada em dados, riscos e impacto ao cliente.
- Comunicação executiva clara, especialmente para reportar incidentes, riscos, planos de ação, indicadores e evolução operacional.
- Postura hands on, com disposição para se envolver na operação quando necessário, sem perder a visão estratégica e de transformação.
- Experiência na gestão de equipes internas, fornecedores e modelos híbridos de trabalho.
- Visão de tecnologia aplicada ao negócio, com foco em estabilidade, eficiência operacional, satisfação do cliente e continuidade dos serviços.
- Conhecimento em práticas de gestão de incidentes, problemas, mudanças, eventos, postmortem e melhoria contínua.
- Capacidade de atuar em uma cultura ainda em transformação, ajudando a organizar responsabilidades, alinhar expectativas e construir maturidade operacional.
- Desejável formação superior em Tecnologia da Informação, Engenharia, Administração, Matemática, exatas ou áreas correlatas.
- Necessário inglês ou espanhol, avançado, para interação com fornecedores, documentação técnica ou contextos corporativos.
- Disponibilidade para atuação em situações críticas e participação em escalas ou acionamentos previamente definidos, quando necessário.
Conhecimentos
- Observabilidade, monitoração proativa, gestão de eventos, alarmística, correlação de eventos e redução de ruído operacional.
- Ferramentas de monitoração e observabilidade Elastic, Datadog, Zabbix e plataformas correlatas.
- Gestão de serviços de TI, ITIL, ITOM em ServiceNow e processos de operação de produção.
- SRE, ModernOps, confiabilidade, disponibilidade, resiliência, SLA, SLO, indicadores operacionais e gestão por OKRs/KPIs.
- Ambientes legados, sistemas monolíticos, integrações críticas, infraestrutura, aplicações, cloud pública, privada ou híbrida.
- Automação operacional, redução de toil, melhoria de processos e padronização de rotinas operacionais.
- Gestão de incidentes críticos, gestão de problemas, análise de causa raiz, blameless postmortem e prevenção de reincidências.
- Noções de integração entre monitoração, multicloud, CMDB, ITSM, operação, atendimento e times de sustentação.
- Consolidação de ferramentas – migração, tombamento, desativação: SPLUNK, ELK OPEN, NINSOFT, ZABBIX 6.X, etc.
- Conhecimento básico sobre pipelines, DevOps, CI/CD, automação, versionamento e práticas modernas de engenharia será valorizado.
- Fundamentos de AIOps, uso de IA aplicada à operação, observabilidade de agentes de IA e governança operacional de automações são conhecimentos desejáveis.
Diferenciais
- Experiência anterior em empresas de grande porte, operações críticas, serviços digitais ou ambientes com alta dependência tecnológica.
- Vivência em transformação de modelos operacionais tradicionais para modelos mais preditivos, automatizados e orientados a confiabilidade.
- Experiência prática com ServiceNow, ITOM, Zabbix, Elastic, Datadog ou ferramentas equivalentes.
- Conhecimento ambientes heterogêneos com tecnologias legadas e modernas convivendo.
- Experiência com AIOps, automação de eventos, correlação inteligente, uso de IA para suporte operacional e proatividade.
- Familiaridade com métodos ágeis, DevOps, SRE, CI/CD e práticas de engenharia aplicadas à operação.
- Experiência em gestão de fornecedores, contratos, orçamento, capacidade de atendimento e melhoria de desempenho operacional.
- Capacidade de influenciar diferentes áreas, alinhar times técnicos e executivos, e conduzir mudanças em ambientes complexos e com baixa clareza inicial de responsabilidades.
Informações adicionais
Benefícios
- Pacote flexível de benefícios (VA, VR, assistência médica e odontológica, seguro de vida, auxílio farmácia e academia).
- Participação nos Resultados (PPR) ou bônus anual.
- Previdência privada.
- Auxílio creche, escola ou babá.
- Modelo híbrido, com até 2 dias de trabalho remoto por semana.
- Horário flexível.
- Day Off.
- Programas de desenvolvimento, capacitação e parcerias educacionais.
- Oportunidades de crescimento e mobilidade interna.
Etapas do processo
- Etapa 1: Cadastro
- Etapa 2: Triagem
- Etapa 3: Teste
- Etapa 4: Entrevista com RH
- Etapa 5: Avaliação comportamental
- Etapa 6: Entrevista com Gestor
- Etapa 7: Proposta
- Etapa 8: Contratação
