yoinka

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server

Dell Technologies

ELDORADO DO SUL, RS, BrazilMid
Sign in to applyVerified 1h ago
Location
ELDORADO DO SUL, RS, Brazil
Work model
On-Site
Level
Mid
Posted
19h ago

Skills

AnsibleCI/CDGitLinuxPythonServiceNow

About this role

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Infraestrutura Compute Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) em nossa equipe de Engenharia de Infraestrutura em Eldorado do Sul/RS para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo. O que você conquistará Como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) , você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida da infraestrutura compute, garantindo escalabilidade, disponibilidade e confiabilidade dos serviços. Você trabalhará com equipes de Engenharia Compute, Automação de Plataforma, Observabilidade e Infraestrutura em uma plataforma corporativa baseada em automação, suportando cargas de trabalho críticas e impulsionando a excelência operacional por meio de práticas modernas de SRE e automação em larga escala. Você irá: Projetar, desenvolver e manter automações para todo o ciclo de vida da infraestrutura compute, incluindo descoberta de servidores, provisionamento bare-metal, implantação de sistemas operacionais, gerenciamento de firmware e patches, configuração de hipervisores, descomissionamento e processos automatizados de diagnóstico e remediação utilizando Ansible, Python e pipelines CI/CD Definir e operar práticas de confiabilidade para serviços compute por meio da criação e manutenção de SLIs, SLOs e error budgets, além de aprimorar a observabilidade, reduzir ruídos de monitoramento, conduzir análises pós-incidente e transformar falhas recorrentes em soluções automatizadas Colaborar com equipes de Engenharia Compute, Automação de Plataforma e Observabilidade para definir requisitos operacionais, integrar automações à plataforma corporativa de IA e automação, garantir critérios de prontidão operacional e contribuir para políticas como código voltadas à operação segura e escalável de plataformas compute Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação, aumento das taxas de resolução autônoma, manutenção de bases de conhecimento estruturadas, identificação de oportunidades para eliminação de atividades manuais e avaliação de novas ferramentas para integração ao ecossistema corporativo Participar da escala de plantão da torre de Compute, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço definidos e utilizando informações de diagnóstico previamente consolidadas para acelerar a resolução Dê o primeiro passo para a carreira dos seus sonhos Todas as pessoas da nossa equipe agregam algo único. Veja o que estamos buscando para esta posição: Requisitos Essenciais Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em SRE, Engenharia de Infraestrutura, Engenharia de Servidores ou Operações de Plataformas em larga escala Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais Experiência prática avançada em pelo menos duas das seguintes áreas: VMware vSphere/vCenter, plataformas de servidores bare-metal (Dell PowerEdge, HPE, Cisco UCS ou equivalentes), sistemas operacionais Linux (Oracle Linux, RHEL ou equivalentes) ou ambientes Windows Server Experiência comprovada no desenvolvimento de automações de infraestrutura utilizando Ansible, Python, Git, pipelines CI/CD e práticas de GitOps, incluindo gerenciamento automatizado do ciclo de vida de plataformas compute Conhecimento sólido em observabilidade, monitoramento de infraestrutura, confiabilidade de sistemas, troubleshooting, gestão de incidentes, análise de causa raiz e resolução de falhas complexas envolvendo hardware, hipervisores, sistemas operacionais e ambientes distribuídos Requisitos Desejáveis Experiência com vROps, Zabbix, Dynatrace, ServiceNow CMDB, NetBox,

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server at Dell Technologies — ELDORADO DO SUL, RS, Brazil | Yoinka