Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage
Dell Technologies
- Location
- ELDORADO DO SUL, RS, Brazil
- Work model
- On-Site
- Level
- Mid
- Posted
- 19h ago
Skills
About this role
Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage em nossa equipe de Engenharia de Infraestrutura em Eldorado do Sul/RS para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo. O que você conquistará Como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage, você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida dos serviços de armazenamento, garantindo escalabilidade, disponibilidade, desempenho e confiabilidade dos ambientes corporativos. Você trabalhará com equipes de Engenharia de Storage, Automação de Plataforma, Observabilidade e Infraestrutura para entregar uma operação altamente automatizada, suportando cargas de trabalho críticas por meio de práticas modernas de SRE, automação e engenharia de confiabilidade. Você irá: Projetar, desenvolver e manter automações para todo o ciclo de vida dos serviços de armazenamento, incluindo provisionamento de volumes e LUNs, gerenciamento de snapshots e replicação, monitoramento de capacidade, gestão de firmware, descomissionamento e remediação automatizada utilizando Ansible, APIs REST e pipelines CI/CD Definir e operar práticas de confiabilidade para serviços de storage por meio da criação e manutenção de SLIs, SLOs e error budgets, aprimorando a observabilidade, reduzindo ruídos operacionais, conduzindo análises pós-incidente e transformando problemas recorrentes em soluções automatizadas Colaborar com equipes de Engenharia de Storage, Automação de Plataforma e Observabilidade para estabelecer requisitos operacionais, integrar automações à plataforma corporativa de IA, definir critérios de prontidão operacional e contribuir com políticas como código voltadas à proteção da disponibilidade, durabilidade e capacidade dos ambientes Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação, aumento das taxas de resolução autônoma, manutenção da base de conhecimento estruturada, identificação de oportunidades de automação e avaliação de novas ferramentas para integração ao ecossistema corporativo Participar da escala de plantão da torre de Storage, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço estabelecidos e utilizando diagnósticos previamente consolidados para acelerar a tomada de decisão e resolução Dê o primeiro passo para a carreira dos seus sonhos Todas as pessoas da nossa equipe agregam algo único. Veja o que estamos buscando para esta posição: Requisitos Essenciais Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em Engenharia de Storage, SRE, Operações de Armazenamento ou Infraestrutura corporativa de grande porte Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais Experiência prática avançada em pelo menos duas das seguintes áreas: armazenamento SAN/Block, NAS/File Storage, Object Storage ou plataformas corporativas equivalentes, incluindo soluções Dell, Pure Storage, NetApp, HPE ou similares Experiência comprovada no desenvolvimento de automações para plataformas de armazenamento utilizando Ansible, Python, APIs REST, Git, pipelines CI/CD e práticas de GitOps, incluindo provisionamento, replicação, gerenciamento de capacidade e ciclo de vida dos ambientes Conhecimento sólido em observabilidade, monitoramento, confiabilidade de serviços, análise de incidentes, troubleshooting e resolução de falhas complexas envolvendo desempenho, replicação, capacidade, controladoras, discos e arquiteturas distribuídas de armazenamento Requisitos Desejáveis Experiência com ambientes multivendor de storage, plataformas de monitoramento como Zabbix ou vROps, ServiceNow CMDB,