SOVOS COMPLIANCE DESENVOLVIMENTO DE SISTEMAS LTDA.
Brasília, DF, Brasil
Pessoa Engenheira de HPC & AI Infrastructure
Sênior.
onsiteFull time
📍 Brasília, DF, BrasilonsitePublicada 09 de setembro de 2026capturada em 09/09/2026
ANÁLISE DE COMPATIBILIDADE COM IA
Será que seu currículo passa pelo filtro desta vaga?
Envie seu CV e descubra, em segundos, sua compatibilidade real com Pessoa Engenheira de HPC & AI Infrastructure - Sênior — o que já atende, e onde seu currículo pode estar perdendo aderência.
100% grátis
Resultado em segundos
Sem criar conta pra ver o preview
grátis · leva menos de 1 minuto
Descricao da vaga
PcDs são sempre bem-vindas.
Buscamos um(a) profissional sênior para atuar na arquitetura, administração, automação, sustentação e otimização de ambientes HPC e infraestrutura para IA/Deep Learning.
A posição exige forte experiência prática em ambientes Linux, administração de cluster e troubleshooting de ambientes de alta performance, atuando desde o sistema operacional, rede, storage, GPUs, headnode e tunning de aplicações cientificas e corporativas.
Responsabilidades e atribuicoes
- Implantar, administrar e otimizar ambientes de virtualização free e de mercado, como QEMU, Proxmox, Hyper-V, VMWare.
- Administração de sistemas operacionais Linux, desde configuração, hardening, troubleshooting, performance tuning, serviços, kernel, drivers, filesystem, networking e automação.
- Maximizar a eficiência de clusters de computação de alto desempenho através da configuração de partições e políticas de prioridade utilizando o Slurm ou soluções de mercado como PBS Professional e LSF
- Vivência no ecossistema LiCO para gerenciamento de clusters, monitoramento de infraestrutura e gerenciamento de templates de IA.
- Conhecimento em alternativas ao LiCO, familiaridade com ferramentas concorrentes de portais e orquestração de HPC/IA, como Open OnDemand, Run:ai, ou frameworks baseados em Kubernetes para HPC
- Automatizar provisionamento e operação de infraestrutura utilizando Ansible, Shell Script e Python, aplicando práticas de infrastructure as code.
- Administrar nós com GPUs NVIDIA/AMD, incluindo drivers CUDA, DCGM, MIG, NVLink, NCCL.
- Realizar monitoramento constante de infraestrutura e aplicações, identificando gargalos de CPU, GPU, memória, storage e rede.
- Atuar junto a pesquisadores e engenheiros no diagnóstico e otimização de workloads MPI/OpenMP, IA e Deep Learning.
- Contribuir para segurança, documentação, capacity planning, governança e evolução da arquitetura HPC.
Requisitos
- Graduação completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação, Engenharia da Computação ou áreas correlatas;
- Experiência sênior e hands-on em Linux, preferencialmente RHEL/Rocky/ Ubuntu Server
- Domínio de administração e troubleshooting Linux em ambientes de alta performance e/ou larga escala.
- Experiência avançada na administração de Slurm
- Forte conhecimento de Shell Scripting, Python, Ansible e Git.
- Experiência prática com pelo menos uma solução de storage paralelo (Lustre, BeeGFS, GPFS/Spectrum Scale ou equivalente).
- Conhecimentos sólidos de redes, Linux e autenticação centralizada (LDAP/FreeIPA/Kerberos ou equivalente).
- Capacidade de atuar de forma independente em troubleshooting complexo, análise de performance e resolução de problemas de infraestrutura.
Curtiu a vaga? Veja se seu CV se encaixa.
Sobe seu currículo lá em cima e receba seu score em segundos.
ALERTA DE VAGA CERTA
Quer receber vagas como essa antes da multidão do LinkedIn? De graça.