Analista de SRE PL
Responsável por executar processos de SRE – Site Reliability Engineering (Engenharia de Confiabilidade de Site), visando garantir a disponibilidade, escalabilidade e confiabilidade dos sistemas de tecnologia da empresa.
Principais Atribuições
- Monitorar, analisar e otimizar sistemas, aplicações, infraestrutura e plataformas corporativas.
- Atuar na identificação, diagnóstico e resolução de incidentes, contribuindo para a redução do MTTR e aumento da disponibilidade dos serviços.
- Apoiar a definição e acompanhamento de indicadores de confiabilidade, disponibilidade e desempenho (SLI, SLO e SLA).
- Desenvolver automações para reduzir atividades operacionais manuais e aumentar a eficiência dos ambientes.
- Identificar gargalos de performance, capacidade e escalabilidade, propondo melhorias contínuas.
- Participar de análises de causa raiz (RCA), acompanhando ações corretivas e preventivas.
- Colaborar com as equipes de Desenvolvimento, Infraestrutura, Arquitetura, Segurança da Informação, Banco de Dados e Dados para garantir a confiabilidade das soluções.
- Apoiar a implementação e evolução de arquiteturas em AWS, Azure e Kubernetes.
- Contribuir para processos de backup, recuperação de desastres e continuidade dos serviços.
- Documentar processos, procedimentos e soluções técnicas.
- Disseminar conhecimento técnico e apoiar o desenvolvimento da equipe.
Requisitos Obrigatórios
- Ensino superior completo ou em andamento em Tecnologia da Informação, Ciência da Computação, Engenharia de Software ou áreas correlatas.
- Experiência em operações, infraestrutura, cloud, observabilidade ou SRE.
- Conhecimento em Amazon Web Services (AWS) e Microsoft Azure.
- Conhecimento em Datadog (APM, Logs, Dashboards, Monitors e Synthetics).
- Conhecimento em Zabbix e AWS CloudWatch.
- Conhecimento em observabilidade, métricas, logs e traces.
- Conhecimento em Kubernetes e Docker.
- Conhecimento em Azure DevOps, Git e pipelines de CI/CD.
- Conhecimento em Linux e Windows.
- Conhecimento em redes, DNS, balanceadores de carga e APIs.
- Conhecimento em automação utilizando PowerShell, Bash ou Python.
- Conhecimento em gestão de incidentes e análise de causa raiz.
- Conhecimento em metodologias ágeis.
Diferenciais
- Experiência com Terraform e Infraestrutura como Código (IaC).
- Experiência com Kong ou outras soluções de API Gateway.
- Experiência com Kafka e plataformas de mensageria.
- Vivência com práticas de SRE Cultura FINOPS, Error Budget, SLI, SLO e SLA.
- Experiência em ambientes críticos e de alta disponibilidade.
Ferramentas e Tecnologias Utilizadas no Ambiente
- AWS
- Microsoft Azure
- Datadog
- Zabbix
- AWS CloudWatch
- Kubernetes
- Docker
- Azure DevOps
- Git
- Cloudflare
- Kong API Gateway
- Linux e Windows Server
- PowerShell, Bash e Python
- Observabilidade (APM, Logs, Traces, Métricas e Synthetics)
Benefícios:
-
- VR (R$ 1.042,60 / mês);
- VA (R$ 805,80 / mês);
- Plano de Saúde SulAmérica Apartamento;
- Plano Odontológico SulAmérica;
- PLR;
- Vale Cesta de Natal Alelo R$ 805,80;
- Seguro de vida;
- Auxílio creche ou Babá (R$ 522,38 até 6 anos);
- Licença maternidade de 6 meses e paternidade de 20 dias;
- Day off no dia do seu aniversário;
- Antecipação do 13º no mês de maio;
- TotalPass;
- Modelo de trabalho: Remoto
- Modelo de contratação: CLT
- Local: Belo Horizonte/MG
Todas as nossas vagas são inclusivas a Pessoas com Deficiência (PCD) e todas as diversidades.