Offres d'emploi › Île-de-France
Ingénieur Système HPC / GPU / SLURM F/H (réf. 2026-1400)
Sorbonne Université– Services UniversitairesPubliée le 29 juillet 2026
- Entreprise
- Sorbonne Université– Services Universitaires — Paris (75)
- Lieu
- 75
- Contrat
- Catégorie B — Emploi ouvert uniquement aux contractuels
- Expérience
- Confirmé · Niveau 4 Baccalauréat
- Secteur
- Numérique
Description du poste
Fonctions : Ingénieur.e Système HPC / GPU / SLURM
Catégorie : B
Corps : TECH
BAP : E
CDD de 12 mois.
Missions principales :
1. Administration système
Déploiement et maintenance des nœuds de calcul GPU sous Debian
Déploiement et maintenance de nœuds proxmox, vm et docker
Gestion des mises à jour système, des pilotes NVIDIA et des librairies CUDA
Configuration et optimisation du réseau haute performance (bonding, VLAN)
Mise en œuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS)
Automatisation des déploiements via Ansible
2. Administration SLURM
Installation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd)
Définition des partitions, QOS, comptes et limites de ressources
Intégration des GPU NVIDIA dans les ressources SLURM (GRES)
Surveillance des jobs, diagnostics et interventions sur les nœuds en défaut
Rédaction et mise à jour des procédures SLURM à destination des utilisateurs
3. Support utilisateurs et opérateurs
Support de niveau 2/3 pour les utilisateurs de la plateforme HPC
Accompagnement des utilisateurs sur l’optimisation de leurs soumissions SLURM
Participation aux réunions techniques et rédaction des comptes-rendus
Rédaction de la documentation technique et des runbooks
4. Supervision et performance
Mise en place et maintenance des outils de supervision (Prometheus, Grafana)
Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink)
Optimisation des politiques d’ordonnancement selon la charge de la plateforme
Gestion des incidents et participation aux astreintes selon planning
Profil recherché :
Compétences techniques indispensables :
Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseau
Expérience confirmée sur SLURM : configuration, partitions, GRES GPU, accounting
Bonne connaissance de l’écosystème NVIDIA : drivers, CUDA, NVML, DCGM
Maîtrise des outils d’automatisation : Ansible, Bash, Python
Expérience sur les réseaux : Bonding, Vlan, routage
Compétences appréciées :
Connaissance de systèmes de fichiers distribués : Ceph, cephfs
Pratique de la supervision avec Prometheus, Grafana, Alertmanager
Notions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL)
Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC)
Connaissances en gestion de version : Git, GitLab CI
Qualités personnelles :
Rigueur, méthode et sens de la documentation
Autonomie et capacité à gérer les priorités en environnement de production
Bon relationnel et goût pour le travail en équipe
Curiosité technique et veille active sur l’écosystème HPC/GPU
L'employeur :
Choisir Sorbonne Université, c’est rejoindre une université engagée sur les enjeux de développement durable, de diversité, d’égalité, d’innovation, de diffusion des savoirs, d’ouverture sur le monde et de qualité de vie au travail de ses personnels.
Université pluridisciplinaire de recherche intensive de rang mondial, elle s’attache à répondre aux enjeux scientifiques du 21e siècle et à transmettre les connaissances issues de ses laboratoires et de ses équipes de recherche.
Déployant ses formations auprès de 55 000 étudiantes et étudiants dont 4000 doctorantes et doctorants et 12300 étudiantes et étudiants étrangers, elle regroupe plus de 3300 enseignantes et enseignants, enseignantes-chercheuses et enseignants-chercheurs, chercheuses et chercheurs, près de 4 000 enseignants-chercheurs et enseignants partenaires, environ 3 000 personnels de bibliothèque, administratifs, technique, sociaux et de santé (BIATSS) et 2000 ITA partenaires. Son budget est de plus de 700 M€.
Située au cœur de Paris, elle présente une organisation avec des directions interfacultaires et trois facultés de « Lettres », « Santé » et « Sciences et Ingénierie » et est présente dans plus de 27 sites en Île-de-France et en régions http://www.sorbonne-universite.fr
Ce poste est à pourvoir au sein des Directions Interfacultaires • http://www.sorbonne-universite.fr
Descriptif du service
Dans un contexte national et international marqué par la compétition autour de l'intelligence artificielle, Sorbonne Université a créé le Sorbonne Cluster for Artificial Intelligence (SCAI), qui réunit un ensemble stratégique de disciplines de l'IA moderne. Son ambition est de renforcer l'excellence de la recherche interdisciplinaire en favorisant les échanges entre chercheurs, enseignants, étudiants et partenaires industriels.
Le candidat ou la candidate rejoint une équipe en charge de l'administration, de la maintenance et de l'évolution du cluster PostGenAI@Paris, projet académique majeur porté par Sorbonne Université, lauréat de l'appel « IA-Cluster » (France 2030), doté de 35 M€ sur 5 ans. Ce cluster rassemble un large consortium d'acteurs académiques (CNRS, Inria, Inserm, UTC, MNHN, AP-HP, Cnam, Sciences Po, Onera…) et plus de 60 partenaires industriels, avec pour objectif de devenir un pôle d'excellence international en IA post-générative à l'horizon 2030.
L'infrastructure HPC repose sur des nœuds GPU NVIDIA sous Debian GNU/Linux, avec l'ordonnanceur SLURM pour la gestion des ressources. Elle répond aux besoins de recherche et de formation en IA du consortium.
Stack technique principale : Debian GNU/Linux, GPU NVIDIA (CUDA), SLURM, réseau 25/100G, stockage NFS/Ceph, supervision Prometheus/Grafana, automatisation Ansible/Bash/Python, authentification SSH/LDAP/SSO.
Catégorie : B
Corps : TECH
BAP : E
CDD de 12 mois.
Missions principales :
1. Administration système
Déploiement et maintenance des nœuds de calcul GPU sous Debian
Déploiement et maintenance de nœuds proxmox, vm et docker
Gestion des mises à jour système, des pilotes NVIDIA et des librairies CUDA
Configuration et optimisation du réseau haute performance (bonding, VLAN)
Mise en œuvre et gestion des systèmes de fichiers distribués (NFS, CEPH, CephFS)
Automatisation des déploiements via Ansible
2. Administration SLURM
Installation, configuration et mise à jour de SLURM (slurmctld, slurmd, slurmdbd)
Définition des partitions, QOS, comptes et limites de ressources
Intégration des GPU NVIDIA dans les ressources SLURM (GRES)
Surveillance des jobs, diagnostics et interventions sur les nœuds en défaut
Rédaction et mise à jour des procédures SLURM à destination des utilisateurs
3. Support utilisateurs et opérateurs
Support de niveau 2/3 pour les utilisateurs de la plateforme HPC
Accompagnement des utilisateurs sur l’optimisation de leurs soumissions SLURM
Participation aux réunions techniques et rédaction des comptes-rendus
Rédaction de la documentation technique et des runbooks
4. Supervision et performance
Mise en place et maintenance des outils de supervision (Prometheus, Grafana)
Analyse des performances GPU (utilisation, mémoire, température, bande passante NVLink)
Optimisation des politiques d’ordonnancement selon la charge de la plateforme
Gestion des incidents et participation aux astreintes selon planning
Profil recherché :
Compétences techniques indispensables :
Solide maîtrise de Linux/Debian : administration système, packaging, systemd, réseau
Expérience confirmée sur SLURM : configuration, partitions, GRES GPU, accounting
Bonne connaissance de l’écosystème NVIDIA : drivers, CUDA, NVML, DCGM
Maîtrise des outils d’automatisation : Ansible, Bash, Python
Expérience sur les réseaux : Bonding, Vlan, routage
Compétences appréciées :
Connaissance de systèmes de fichiers distribués : Ceph, cephfs
Pratique de la supervision avec Prometheus, Grafana, Alertmanager
Notions de MPI (OpenMPI, MVAPICH2) et de librairies de calcul (cuBLAS, NCCL)
Expérience avec des frameworks IA/ML : PyTorch, TensorFlow (usage sur HPC)
Connaissances en gestion de version : Git, GitLab CI
Qualités personnelles :
Rigueur, méthode et sens de la documentation
Autonomie et capacité à gérer les priorités en environnement de production
Bon relationnel et goût pour le travail en équipe
Curiosité technique et veille active sur l’écosystème HPC/GPU
L'employeur :
Choisir Sorbonne Université, c’est rejoindre une université engagée sur les enjeux de développement durable, de diversité, d’égalité, d’innovation, de diffusion des savoirs, d’ouverture sur le monde et de qualité de vie au travail de ses personnels.
Université pluridisciplinaire de recherche intensive de rang mondial, elle s’attache à répondre aux enjeux scientifiques du 21e siècle et à transmettre les connaissances issues de ses laboratoires et de ses équipes de recherche.
Déployant ses formations auprès de 55 000 étudiantes et étudiants dont 4000 doctorantes et doctorants et 12300 étudiantes et étudiants étrangers, elle regroupe plus de 3300 enseignantes et enseignants, enseignantes-chercheuses et enseignants-chercheurs, chercheuses et chercheurs, près de 4 000 enseignants-chercheurs et enseignants partenaires, environ 3 000 personnels de bibliothèque, administratifs, technique, sociaux et de santé (BIATSS) et 2000 ITA partenaires. Son budget est de plus de 700 M€.
Située au cœur de Paris, elle présente une organisation avec des directions interfacultaires et trois facultés de « Lettres », « Santé » et « Sciences et Ingénierie » et est présente dans plus de 27 sites en Île-de-France et en régions http://www.sorbonne-universite.fr
Ce poste est à pourvoir au sein des Directions Interfacultaires • http://www.sorbonne-universite.fr
Descriptif du service
Dans un contexte national et international marqué par la compétition autour de l'intelligence artificielle, Sorbonne Université a créé le Sorbonne Cluster for Artificial Intelligence (SCAI), qui réunit un ensemble stratégique de disciplines de l'IA moderne. Son ambition est de renforcer l'excellence de la recherche interdisciplinaire en favorisant les échanges entre chercheurs, enseignants, étudiants et partenaires industriels.
Le candidat ou la candidate rejoint une équipe en charge de l'administration, de la maintenance et de l'évolution du cluster PostGenAI@Paris, projet académique majeur porté par Sorbonne Université, lauréat de l'appel « IA-Cluster » (France 2030), doté de 35 M€ sur 5 ans. Ce cluster rassemble un large consortium d'acteurs académiques (CNRS, Inria, Inserm, UTC, MNHN, AP-HP, Cnam, Sciences Po, Onera…) et plus de 60 partenaires industriels, avec pour objectif de devenir un pôle d'excellence international en IA post-générative à l'horizon 2030.
L'infrastructure HPC repose sur des nœuds GPU NVIDIA sous Debian GNU/Linux, avec l'ordonnanceur SLURM pour la gestion des ressources. Elle répond aux besoins de recherche et de formation en IA du consortium.
Stack technique principale : Debian GNU/Linux, GPU NVIDIA (CUDA), SLURM, réseau 25/100G, stockage NFS/Ceph, supervision Prometheus/Grafana, automatisation Ansible/Bash/Python, authentification SSH/LDAP/SSO.
Source : Choisir le service public. Publiée le 29 juillet 2026. Toujours en ligne chez la source : vérifiée il y a 8 h.
Décodeur de l'annonce
Lecture automatique du texte de l'annonce : chaque point cite le passage dont il provient. Vérifiez auprès du recruteur avant de vous engager.
| Contrat | Catégorie B — Emploi ouvert uniquement aux contractuels Source : champ « contrat » |
|---|---|
| Horaires | « Gestion des incidents et participation aux astreintes selon planning » Source : texte de l'annonce |
| Lieu | 75 Source : champ « lieu » |
| Expérience | Confirmé · Niveau 4 Baccalauréat Source : champ « expérience » |
| Salaire | Non précisé dans l'annonce |
| Télétravail | Non précisé dans l'annonce |
| Date de prise de poste | Non précisé dans l'annonce |
Ce qui est seulement souhaité
- « Compétences appréciées »
Questions à poser au recruteur
- Quel est le salaire brut mensuel proposé (et les primes éventuelles) ?
- À quelle date le poste est-il à pourvoir ?
- Le télétravail est-il possible, et combien de jours ?
- À quelle fréquence travaille-t-on le week-end, la nuit ou d'astreinte, et comment est-ce compensé ?
- Quelles sont les prochaines étapes du recrutement ?
Vocabulaire de l'annonce (1)
- Astreinte
- Période pendant laquelle le salarié doit rester joignable pour intervenir si besoin ; elle donne lieu à compensation.
Offres similaires en Île-de-France
Stage - Assistant chef de produit contenus digitaux F/H
FNAC DARTY PARTICIPATIONS ET SERVICES
STAGE - Spécialiste de la gestion des rémunérations (F/H)
Dassault Systèmes
STAGE-Continuité d'Activité et Résilience Opérationnelle (F/H)
Dassault Systèmes
Spécialiste en processus métiers CRM & IA (F/H)
Dassault Systèmes
