CONSULTOR SRE
Será que seu currículo passa pelo filtro desta vaga?
Envie seu CV e descubra, em segundos, sua compatibilidade real com CONSULTOR SRE — o que já atende, e onde seu currículo pode estar perdendo aderência.
Descricao da vaga
VP: TI
Diretoria: Infraestrutura e Operações de TI
Area: Infraestrutura e Cloud - Command Center TI
A missão da Diretoria de Infraestrutura e Operações de TI é assegurar o funcionamento, assistência e suporte técnico especializado na infraestrutura e soluções de TI responsáveis pelo suporte ao negócio baseando-se nos direcionadores:
- Ter atendimento voltado a necessidade do negócio;
- Equilibrar estabilidade e agilidade;
- Monitorar e medir serviço sob a perspectiva de negócio;
- Ser uma operação preditiva;
- Ter processos simples e eficientes;
- Pessoas certas nos lugares certos;
- Gestão por indicadores.
Dentro do contexto da Diretoria, a Gerencia de Produção do Command Center é responsável por:
- Monitoração de Eventos;
- Processo de melhoria e evolução de gestão de Eventos;
- Incidentes de Infraestrutura;
- Incidentes de Negócio Major;
- Evolução AIOps.
Responsabilidades e atribuicoes
Estamos em busca de um Consultor com forte habilidade em liderança técnica, troubleshooting avançado e visão de confiabilidade, capaz de atuar tanto em sistemas corporativos críticos quanto em soluções modernas de IA e agentes inteligentes.
Missão do Papel
Atuar como referência técnica em confiabilidade, suporte à produção e excelência operacional, conectando as disciplinas de SRE, Observabilidade, Automação e Inteligência Artificial para garantir a estabilidade, disponibilidade e evolução contínua de serviços críticos.
Esse profissional será responsável por liderar a resolução de incidentes complexos, acelerar a identificação de causas raiz, promover a adoção de práticas modernas de engenharia e impulsionar o uso de IA aplicada às operações, transformando dados operacionais em ações concretas para melhoria da experiência dos clientes e da eficiência dos times.
Responsabilidades
Confiabilidade e Suporte à Produção
- Atuar como referência técnica para equipes de Suporte à Produção, Observabilidade, Hub de Eventos e integrações no ecossistemas modernos em multicloud, MCPs, fabricas de agentes e IA generativa.
- Liderar tecnicamente a resposta a incidentes críticos, coordenando equipes multidisciplinares na definição de estratégias de mitigação e solução definitiva.
- Conduzir análises de causa raiz (RCA), post-mortems e planos de ação, garantindo sua execução e acompanhamento.
- Identificar oportunidades de redução de falhas recorrentes, aumento da disponibilidade e melhoria contínua dos serviços.
- Elaborar e comunicar análises técnicas e executivas para diferentes níveis da organização.
SRE, Observabilidade e Operações Inteligentes
- Evoluir processos de monitoração, observabilidade e gestão de incidentes utilizando práticas de SRE, ITIL, AIOps e Engenharia de Confiabilidade.
- Definir, implementar e acompanhar indicadores de confiabilidade como SLI, SLO, Error Budget, MTTD, MTTR e métricas de experiência dos serviços.
- Apoiar a construção e evolução de dashboards, painéis operacionais e indicadores para ambientes produtivos e não produtivos.
- Garantir a adoção de padrões operacionais, automações e controles de conformidade alinhados às políticas corporativas.
- Atuar na implementação e evolução de ferramentas de monitoração, observabilidade, automação e ITOM.
Inteligência Artificial Aplicada à Operação
- Utilizar IA, copilots, agentes inteligentes e automação avançada para acelerar análises, diagnósticos e tomadas de decisão.
- Contribuir para a integração de modelos de IA e agentes com plataformas corporativas de observabilidade, eventos e operação.
- Apoiar iniciativas de AIOps e automação inteligente voltadas para prevenção, detecção e remediação de incidentes.
- Disseminar o uso responsável de IA como acelerador de produtividade, confiabilidade e eficiência operacional.
Liderança Técnica e Transformação
- Influenciar e orientar equipes multidisciplinares na adoção de práticas modernas de engenharia e operação.
- Participar da definição e acompanhamento de OKRs, KPIs e indicadores estratégicos.
- Atuar como agente de transformação cultural, promovendo automação, excelência operacional, colaboração e aprendizado contínuo.
- Colaborar com áreas internas, times de engenharia, arquitetura, operações e fornecedores para garantir a evolução sustentável das plataformas.
Requisitos
Formação:
- Desejável Formação superior em Tecnologia da Informação, Engenharia, Ciência da Computação, Matemática, Administração ou áreas correlatas.
Conhecimentos Técnicos:
- Sólida experiência em troubleshooting avançado e análise de causa raiz (RCA).
- Experiência com operações de ambientes críticos de alta disponibilidade.
- Conhecimento prático em SRE, Engenharia de Confiabilidade e Gestão de Incidentes.
- Experiência com observabilidade moderna, incluindo métricas, logs, traces, OpenTelemetry e dashboards operacionais.
- Vivência na definição e acompanhamento de SLI, SLO, Error Budget, MTTD e MTTR.
- Experiência com ferramentas de monitoração e observabilidade como Dynatrace, Datadog, Elastic, Splunk, Zabbix ou similares.
- Conhecimento em ambientes de nuvem pública, privada ou híbrida.
- Experiência com automação operacional, pipelines e integração de ferramentas.
- Conhecimento dos fundamentos de IA Generativa, LLMs, agentes inteligentes, governança e ciclo de vida de modelos.
Competências Comportamentais:
- Forte capacidade analítica e pensamento sistêmico.
- Perfil "hands-on", com habilidade para atuar em cenários de alta pressão e criticidade.
- Excelente comunicação técnica e executiva.
- Capacidade de influenciar e liderar tecnicamente equipes multidisciplinares.
- Orientação a resultado, melhoria contínua e experiência do cliente.
- Mentalidade de aprendizado contínuo e adoção de novas tecnologias.
Diferenciais:
- Experiência em ambientes de Telecomunicações, Financeiro ou ecossistemas digitais de grande escala.
- Vivência em práticas Agile, DevOps e CI/CD.
- Conhecimento em AIOps e automação inteligente aplicada a operações.
- Experiência com Docker, Kubernetes e arquiteturas baseadas em microsserviços.
- Conhecimento em linguagens como Python, Go, Java, C#, Shell Script ou similares.
- Experiência com ferramentas de automação e configuração, como Ansible, Chef, Puppet ou equivalentes.
- Familiaridade com ServiceNow, ITOM e plataformas de gestão operacional.
- Experiência com definição e gestão de OKRs e KPIs.
- Certificações relacionadas a Cloud, SRE, DevOps, Observabilidade, ITIL, IA ou tecnologias correlatas.
- Histórico de utilização prática de IA para aceleração de diagnósticos, automação operacional e aumento de produtividade técnica.