Engenheiro(a) de Automação de Infraestrutura
Dell Technologies
- Location
- ELDORADO DO SUL, RS, Brazil
- Work model
- On-Site
- Level
- Mid
- Posted
- 18h ago
Skills
About this role
Engenheiro(a) de Automação de Infraestrutura O(A) Engenheiro(a) de Automação de Infraestrutura é responsável por projetar, desenvolver e operar uma plataforma compartilhada de automação que habilita operações de infraestrutura nos domínios de computação, rede e armazenamento em escala corporativa. A função tem foco na criação de capacidades de automação orientadas a eventos, remediação autônoma, integração de plataformas e excelência operacional por meio de práticas de engenharia de software, permitindo que as equipes de Site Reliability Engineering (SRE) automatizem e escalem operações de infraestrutura de forma eficiente. Junte-se a nós para realizar o melhor trabalho da sua carreira e gerar um impacto significativo como Engenheiro(a) de Automação de Infraestrutura na equipe Infrastructure Reliability & Intelligent Systems (I.R.I.S.). O que você irá alcançar Nesta função, você será responsável por projetar e entregar capacidades compartilhadas de automação que suportam operações de infraestrutura em múltiplos domínios tecnológicos. Você trabalhará em parceria com equipes de SRE, Engenharia, Observabilidade e Governança para desenvolver frameworks de automação, fluxos orientados a eventos, serviços de integração e capacidades de remediação inteligente que aumentem a eficiência operacional, confiabilidade e conformidade. Você irá: Projetar, desenvolver, manter e evoluir a plataforma compartilhada de automação utilizada pelas equipes de SRE, incluindo frameworks Ansible, roles compartilhadas, inventários dinâmicos, padrões de execução, templates GitLab CI/CD e bibliotecas de integração via API. Desenvolver, orquestrar e aprimorar continuamente capacidades de plataforma agentic, incluindo agentes de remediação baseados em LLM responsáveis por consumir telemetria, correlacionar eventos, executar runbooks automatizados e aumentar os índices de resolução autônoma. Desenvolver e manter frameworks de automação orientados a eventos, garantindo mecanismos de concorrência, segurança operacional, rollback e confiabilidade da plataforma. Criar padrões reutilizáveis de automação para provisionamento zero-touch, gerenciamento de firmware, correção de desvios de configuração, gestão de capacidade e remediação automática de incidentes. Desenvolver e administrar integrações entre a plataforma de automação e sistemas corporativos, incluindo ServiceNow CMDB, ServiceNow ITSM, NetBox, Jira, Archer e APIs de fornecedores de infraestrutura. Colaborar com equipes de Observabilidade para garantir o correto fluxo, processamento e consumo de telemetria para suportar decisões automatizadas e operações orientadas a eventos. Construir e manter bases estruturadas de conhecimento para armazenar e disponibilizar informações de resolução de incidentes para usuários e agentes inteligentes. Definir e manter contratos de API, SDKs e padrões de integração para onboarding de automações específicas de domínio na plataforma compartilhada. Definir e monitorar SLIs, SLOs e error budgets da plataforma de automação, incluindo confiabilidade de execução, latência de agentes, eficiência de resolução autônoma e qualidade da base de conhecimento. Implementar e evoluir práticas de observabilidade da própria plataforma, garantindo monitoramento, alertas, análise de falhas e capacidades de auto recuperação. Liderar análises pós-incidente sem atribuição de culpa, produzindo documentação estruturada de causa raiz e relatórios executivos quando falhas da plataforma ou automações gerarem impacto operacional. Identificar oportunidades de automação compartilhada entre diferentes domínios de infraestrutura e implementar soluções de plataforma reutilizáveis. Trabalhar em parceria com equipes de SRE de Computação, Rede e Armazenamento para definir integrações, controles de segurança, requisitos de testes e adoção da plataforma. Colaborar com