Descrição de Vaga
| Código: | 16085 |
| Título da vaga: | Site Reliability Engineer (SRE) |
| Local: | São Paulo, SP |
| Nível Profissional: | Sênior |
| Nível Acadêmico: | Ensino Superior Completo |
| Áreas de Atuação Profissional: | TI - Projetos |
| Descrição: | "Será responsável por garantir a confiabilidade e eficiência operacional dos ambientes através de automação, observabilidade e boas práticas de engenharia. Automação e Eficiência Operacional Automatizar processos operacionais, deploys e provisionamento. Desenvolver scripts e ferramentas internas (Python, Bash, etc.). Implementar e evoluir pipelines CI/CD. Reduzir atividades manuais e operacionais repetitivas. Infraestrutura Cloud e IaC Provisionar e manter ambientes em nuvem. Trabalhar com Infrastructure as Code (Terraform, CloudFormation). Garantir escalabilidade e alta disponibilidade. Implementar estratégias de auto-scaling e self-healing. Confiabilidade e Performance Monitorar sistemas através de métricas, logs e traces. Definir e acompanhar SLIs, SLOs e SLAs. Executar capacity planning. Realizar troubleshooting e otimização de performance. Gestão de Incidentes Atuar em incidentes críticos de produção. Conduzir análises de causa raiz (RCA). Desenvolver planos de melhoria contínua. Observabilidade Implementar ferramentas de monitoramento e alertas. Criar dashboards operacionais. Aumentar a visibilidade end-to-end dos sistemas. Engenharia de Plataforma Trabalhar em conjunto com times de desenvolvimento. Apoiar práticas DevOps e SRE. Melhorar arquitetura, deploys e resiliência das aplicações. Continuidade de Negócios Disaster Recovery. Testes de carga e stress. Chaos Engineering. Estratégias de resiliência operacional. Governança e Boas Práticas Definir padrões operacionais. Documentar processos e arquiteturas. Aplicar práticas de segurança e DevSecOps. Requisitos: Inglês avançado/fluente. Bacharelado em Ciência da Computação, Engenharia ou áreas correlatas. Sólida experiência em Site Reliability Engineering (SRE) DevOps Infraestrutura Cloud Engineering Experiência prática com AWS, Azure ou GCP Terraform (preferencial) Docker Kubernetes CI/CD Python ou Bash Linux/Unix Monitoramento e observabilidade Gestão de incidentes Diferencial: Experiência em ambientes de grande escala. Vivência em consultorias. Experiência com Chaos Engineering. Experiência com arquiteturas altamente distribuídas. Forte background em observabilidade. Conhecimento avançado em Kafka. Experiência em plataformas financeiras ou ambientes críticos." |
| Habilidades: | Qualquer localidade - Hibrido ou Remoto |