Machine Learning Training Infrastructure Engineer
- Type de contrat
- Temps plein
- Lieu
- Lausanne · Télétravail possible
- Première publication
Logitech est l'endroit idéal pour les personnes qui veulent que leurs actions aient un impact mondial positif tout en ayant la flexibilité de le faire à leur manière. Le Rôle : Nous recherchons un Machine Learning Training Infrastructure Engineer pour élever les pratiques d'ingénierie au sein de nos équipes Machine Learning et EdgeAI et améliorer leur vélocité. Dans ce rôle, vous agirez en tant que champion partagé de l'excellence DevOps / MLOps. Votre mission est de piloter un excellent entraînement de modèles en concevant l'échafaudage réutilisable (templates, pipelines CI/CD et flux de gestion des données) qui permet à nos ingénieurs ML de travailler plus vite, plus intelligemment et avec une cohérence absolue. Un aspect clé de ce rôle est l'optimisation des pipelines d'entraînement pour tirer pleinement parti de notre infrastructure High Performance Computing (HPC), garantissant ainsi l'évolutivité et la performance. Vous êtes l'interface avec notre Digital Office (qui gère les ressources centrales AWS/HPC et l'infrastructure MLOps) et les équipes ML appliquées, assurant que le transfert de connaissances et les meilleures pratiques d'ingénierie sont intégrés de manière fluide. Votre Contribution : Soyez vous-même. Soyez ouvert. Restez affamé et humble. Collaborez. Défiez. Décidez et agissez simplement. Partagez notre passion pour l'égalité et l'environnement. Ce sont les comportements et les valeurs dont vous aurez besoin pour réussir chez Logitech. Dans ce rôle, vous vous occuperez de : Déploiement et intégration de l'infrastructure : Diriger la migration et l'adoption de l'infrastructure en guidant les ingénieurs ML vers de nouveaux environnements de calcul partagés, en optimisant les flux de travail des développeurs pour réduire les frictions, et en fournissant une documentation complète et une formation pratique pour assurer la montée en compétences de l'équipe. Facilitation et transfert de connaissances : Agir en tant que consultant interne et coach pour les équipes ML pour l'optimisation du High Performance Computing (HPC). Animer des ateliers, faire du pair-programming sur les goulots d'étranglement des pipelines, et documenter les standards MLOps modernes pour monter en compétence l'organisation d'ingénierie et faciliter le partage des connaissances. Standardisation et modélisation : Concevoir et maintenir des modèles de projets "cookie-cutter". S'assurer que tout ingénieur ML peut lancer un nouveau dépôt qui est automatiquement conforme, structuré et intégré avec le versionnage des données/artefacts. CI/CD et Continuous Training (CT) : Construire et maintenir des pipelines d'automatisation robustes. Concevoir les déclencheurs et les flux de travail qui automatisent la validation des données, le réentraînement des modèles et l'évaluation lorsque de nouvelles données arrivent ou que les bases de référence de performance changent. Optimisation du calcul et du code : Collaborer avec les ingénieurs ML pour profiler et optimiser les pipelines d'entraînement et le code d'inférence local/edge en travail en binôme, garantissant une haute efficacité sur les ordinateurs hôtes locaux et les ressources de calcul spécialisées. Liaison avec le Digital Office : Agir en tant que principal point de contact technique pour traduire les politiques AWS du Digital Office, les configurations de calcul à haute efficacité et les réalités de l'infrastructure en flux de travail pratiques et conviviaux pour les développeurs des équipes ML. Vous êtes le product owner de la chaîne d'outils MLOps, vous assurant que les exigences de l'équipe ML sont implémentées sous forme d'outils par le Digital Office. Gouvernance de l'IA et gestion des données : Établir et faire respecter des cadres pour une IA éthique, la transparence des modèles (via des model cards) et la conformité à la confidentialité des données. Agir en tant que gestionnaire de notre écosystème de données en alignant les processus pour l'inventaire des données, la gestion du cycle de vie et l'accessibilité, garantissant que des données de haute qualité et conformes sont prêtes pour l'entraînement et l'inférence sur tous les projets. Qualifications Clés : Pour être considéré, vous devez apporter les compétences et expériences minimales suivantes à notre équipe : Éducation : Doctorat ou MSc en informatique, ingénierie informatique ou dans un domaine étroitement lié. Expérience : Plus de 5 ans d'expérience en MLOps, DevOps ou Software Engineering avec un fort accent sur les outils de développement, l'automatisation, l'habilitation des plateformes et l'optimisation des pipelines. Expérience pratique de la conception, de la construction ou de la maintenance d'une infrastructure d'entraînement ML à grande échelle. Vous avez entraîné des modèles ML sur des plateformes HPC dans le cadre de votre expérience préalable et avez été familiarisé avec les différents éléments de la pile, de la gestion des données à la gestion des pilotes. L'état d'esprit "Leadership" : Expérience avérée dans le mentorat d'équipes, l'établissement de meilleures pratiques et la création de documentations propres que les ingénieurs apprécient réellement utiliser. Outils de données et de flux de travail : Solide expérience pratique du versionnage de données, des outils de suivi d'expériences et des plateformes CI/CD modernes (ex: GitLab CI, GitHub Actions). Maîtrise du logiciel et du packaging : Grande maîtrise de Python et PyTorch, avec une expérience de l'exécution de charges de travail d'entraînement sur des GPU/TPU. Bonne compréhension de la conteneurisation (Docker) et du packaging de modèles pour la distribution vers des appareils edge ou des ordinateurs hôtes. Fortes pratiques d'ingénierie logicielle : qualité du code, revues de conception, tests, observabilité, CI/CD. Familiarité avec l'infrastructure : Solide compréhension des concepts de cloud (AWS) pour collaborer efficacement avec le Digital Office, même si le déploiement cloud est hors périmètre. Optimisation des système
Traduit automatiquement depuis l’original.
Publié il y a 2 semaines