« Nous avons un téraoctet de données : connectons-le à une IA. » Le volume ne dit presque rien sur le travail à réaliser. Des vidéos, des scans, des tableurs et des archives compressées ne demandent pas le même traitement. Il n’existe pas de conversion universelle entre un téraoctet stocké et une quantité de tokens à facturer.
Commencer par la question métier
Dans un scénario fictif de maintenance industrielle, un technicien cherche la procédure applicable à un modèle d’équipement. La réponse dépend de la référence, de la version et parfois du site. Une procédure proche mais obsolète peut être plus dangereuse qu’une absence de réponse.
Le premier atelier doit donc préciser les questions attendues, les documents faisant autorité, les utilisateurs et les erreurs inacceptables. À partir de là, on choisit un corpus représentatif. Il n’est pas nécessaire de réorganiser tout le système d’information avant de vérifier la valeur d’un premier usage.
Préparer la donnée pour retrouver les bons éléments
La recherche augmentée consiste à retrouver des informations avant de produire une réponse. Selon le corpus, on peut combiner recherche par termes exacts et recherche par sens. Les éléments sélectionnés alimentent ensuite le modèle. Le choix technique doit être testé ; une base vectorielle n’est pas obligatoire dans tous les cas.
Pour notre exemple, nous proposerions le travail suivant :
- Inventorier : repérer les emplacements, formats, responsables et restrictions d’accès.
- Extraire : rendre le texte exploitable et contrôler la qualité des scans, tableaux et références.
- Qualifier : identifier les versions applicables, écarter les doublons et isoler les contenus périmés.
- Structurer : conserver le modèle d’équipement, la date, le statut et la provenance avec les contenus.
- Évaluer : vérifier que les questions métier retrouvent les bons éléments, y compris lorsqu’aucune réponse ne devrait être fournie.
L’index est un moyen de retrouver la connaissance. Il ne corrige pas automatiquement un document faux et ne remplace pas son propriétaire métier. Le corpus doit pouvoir évoluer sans perdre la trace de ses versions.
Distinguer préparation et utilisation
Nous recommandons de construire le budget sur trois ensembles. Le premier couvre la préparation : connecteurs, extraction, contrôle, indexation et reprise des exceptions. Le deuxième couvre les requêtes : recherche, éventuel reclassement, appels au modèle et génération. Le troisième couvre l’exploitation : mises à jour, tests, surveillance et maintenance.
Une architecture qui limite les informations transmises à chaque demande peut maîtriser leur volume, mais conserve un coût de préparation. À l’inverse, parcourir les données à la demande peut éviter certains traitements initiaux et augmenter le travail au moment de répondre. Ce compromis se décide sur l’usage réel.
Ce que l’accompagnement doit livrer
Mintera propose de cadrer le besoin, cartographier le corpus, définir les règles de gouvernance et concevoir une architecture adaptée. Le premier périmètre sert à éprouver les choix avec vos équipes avant d’étendre le dispositif.
Les livrables attendus sont précis : diagnostic, règles de préparation, jeu de questions de référence, résultats d’évaluation et feuille de route. Nous recommandons de suivre la pertinence des documents retrouvés, les réponses étayées, les refus justifiés, le délai de traitement et le coût par tâche aboutie. Le résultat recherché est un usage vérifiable et maintenable.
