Le contexte
Dans ce scénario illustratif, une équipe développe des modèles à partir d'images, de documents ou de données structurées. Les jeux de données évoluent avec les nettoyages, annotations et enrichissements. Les environnements de calcul changent selon les projets, tandis que les corpus doivent rester identifiables, accessibles et documentés dans la durée.
Le problème à résoudre
Les copies locales se multiplient et les liens entre données sources, versions préparées et expériences deviennent difficiles à suivre. Certains transferts sont répétés inutilement. L'équipe doit aussi vérifier que les performances d'accès conviennent aux traitements envisagés depuis ses environnements de calcul.
La mission proposée
- 01
Définir une organisation des corpus et des sorties avec des conventions de version, des manifestes et les métadonnées nécessaires pour relier chaque expérience à ses données.
- 02
Tester l'accès S3 depuis les outils de préparation et les environnements de calcul, puis mesurer lecture, transfert et comportement des lots avec des données représentatives.
- 03
Déployer progressivement l'organisation retenue, documenter les droits d'accès et définir avec l'équipe les règles de conservation, de duplication utile et de nettoyage des fichiers devenus obsolètes.
Les gains attendus
- Des corpus mieux identifiés pour retrouver les données utilisées lors d'une expérience.
- Moins de copies dispersées grâce à une organisation partagée et des règles explicites.
- Une préparation plus claire des traitements et des transferts vers les environnements de calcul.
Comment mesurer le résultat
- Volume conservé par corpus
- Temps de préparation des données
- Part des expériences avec manifeste
La situation initiale et les objectifs sont définis au cadrage, puis comparés aux résultats du pilote.