Avertissement : Cette interview est une fiction journalistique destinée à explorer de manière approfondie les problématiques de la donnée et de l’intelligence artificielle à travers le prisme de l’approche prônée par Mistral AI.

Introduction
Depuis sa création en 2023, la pépite française Mistral AI s'est imposée comme le principal challenger européen des géants américains de l’intelligence artificielle générative. Fondée par Arthur Mensch (ancien chercheur chez Google DeepMind) et ses acolytes Guillaume Lample et Timothée Lacroix (ex-Meta), l’entreprise défend un modèle fondé sur l’open source, l’efficacité algorithmique et l’indépendance technologique de l’Europe. Dans cet entretien exclusif, nous abordons en profondeur le véritable carburant des modèles de langage : la donnée. Qualité des jeux d’entraînement, souveraineté numérique, modèles ouverts versus fermés, données synthétiques et droits d’auteur : Arthur Mensch répond à nos questions sans langue de bois.
Aurélien Hottin : Arthur Mensch, bonjour. On parle souvent de la course à la puissance de calcul, mais l'un des véritables goulots d'étranglement de l'intelligence artificielle aujourd'hui réside dans la donnée. Quel est aujourd'hui le rôle exact de la data dans l'entraînement d'un modèle comme Mistral Large ou Mixtral ?
Arthur Mensch : Bonjour. Vous avez tout à fait raison de recadrer le débat. Le processeur graphique et les gigawatts de puissance de calcul ne sont que le moteur ; la donnée est le carburant. Et comme dans tout moteur à haute performance, si vous mettez un carburant de mauvaise qualité, vous abîmez la mécanique ou vous obtenez des rendements très faibles.Chez Mistral AI, dès le premier jour, notre philosophie n'a pas été de collecter aveuglément tout le Web pour le jeter dans un réseau de neurones.
Ce paradigme du « toujours plus grand », hérité des premiers travaux sur les grands modèles de langage (LLM), atteint aujourd'hui ses limites. Ce qui compte désormais, c'est l'efficience. Un modèle entraîné sur un jeu de données restreint mais extrêmement bien filtré, structuré et nettoyé peut surpasser un modèle trois fois plus volumineux alimenté avec du contenu bruité.
La donnée intervient à plusieurs étapes critiques : le pré-entraînement, où le modèle apprend la structure du monde et du langage ; le post-entraînement (alignement, apprentissage par renforcement ou RLHF), où l'on affine ses comportements ; et enfin l'évaluation, pour s'assurer qu'il ne régurgite pas d'inexactitudes ou de biais majeurs. La data n'est pas un bloc homogène, c'est une ingénierie fine.
Aurélien Hottin: Concrètement, comment procède-t-on pour filtrer plusieurs téraoctets de données texte à l'échelle du Web sans altérer la diversité des concepts ? Quels sont vos critères de sélection ?
Arthur Mensch : C’est un travail d'orfèvre scientifique qui mêle de l'heuristique classique, du filtrage statistique et des modèles de classification spécialisés. Lorsque vous aspirez des données publiques sur Internet, vous récupérez une quantité astronomique de doublons, de fermes de liens SEO, de contenus générés automatiquement de faible valeur, de spams ou de code malveillant.
Notre pipeline d'ingestion de données se découpe en plusieurs phases :
- La déduplication stricte et floue : Nous éliminons les milliards de pages identiques ou quasi identiques. La répétition abusive d'un même texte lors du pré-entraînement biaise le modèle, qui risque de mémoriser au lieu de généraliser.
- Le filtrage qualitatif : Nous appliquons des classificateurs de qualité formés sur des corpus de référence (littérature scientifique, encyclopédies, code relu par des pairs). Ces algorithmes attribuent un score d'exploitabilité à chaque document.
- Le filtrage de sécurité et d'éthique : Il s'agit d'écarter les contenus haineux, les données personnelles identifiables (PII) et les injections de code malveillant.
- L'équilibrage linguistique et thématique : C'est un point capital pour une entreprise européenne. Le Web anglophone représente une part disproportionnée d'Internet. Si vous ne rééquilibrez pas artificiellement vos données d'entraînement, votre modèle sera incapable d'appréhender subtilement le français, l'allemand, le espagnol ou l'italien, ainsi que les spécificités juridiques et culturelles continentales.
Aurélien Hottin : Vous évoquez l'équilibre linguistique. La maîtrise du français et des langues européennes est-elle uniquement une question de quantité de texte injectée, ou faut-il revoir l'architecture même de la tokenisation ?
Arthur Mensch : C'est une excellente question technique. La réponse réside dans les deux aspects, mais la tokenisation est le parent pauvre de la littérature scientifique grand public.
Un LLM ne lit pas des mots, il lit des tokens (des morceaux de mots ou des sous-unités linguistiques). Si votre découpage linguistique (tokenizer) est optimisé exclusivement pour l'anglais, il découpera un mot français ou allemand complexe en quatre ou cinq sous-unités, là où il n'en utilisera qu'une seule pour un mot anglais équivalent. Résultat : vous consommez une fenêtre de contexte considérable, la vitesse d'inférence s'effondre pour les utilisateurs non anglophones, et le coût d'utilisation explose.
Chez Mistral AI, nous avons développé des tokenizers multilingues natifs avec des vocabulaires beaucoup plus larges (32 000 à plus de 128 000 entrées). Cela permet de traiter le français, l'allemand ou le code informatique avec le même niveau d'efficience et de vitesse que l'anglais. La maîtrise linguistique est autant une affaire d'architecture et de structuration initiale que de volume de texte.
ARCHITECTURE DU PIPELINE DATA (MISTRAL AI)
[ Web Public / Corpus ] --> [ Déduplication (Stricte & Floue) ]
│
▼
[ Modèles de Langage ] <-- [ Filtrage Qualitatif & Curatage ]
[ Prêts à l'Emploi ] │
▲ ▼
│ [ Tokenisation Multilingue ]
│ │
└─────────────────────────────────────┘
Aurélien Hottin : Une vive controverse secoue le monde de l'IA concernant le droit d'auteur et l'utilisation des données publiques du Web pour entraîner des modèles commerciaux. Quelle est la position de Mistral AI sur la propriété intellectuelle ?
Arthur Mensch : Nous devons aborder ce sujet avec pragmatisme et rigueur juridique. L'entraînement d'un modèle d'intelligence artificielle ne consiste pas à copier ou à redistribuer des œuvres protégées ; il s'agit d'analyser des structures statistiques, des concepts et des représentations sémantiques afin de développer une capacité de raisonnement et de génération. En droit européen, cela relève de l'exception de fouille de textes et de données (Text and Data Mining ou TDM), encadrée par la directive sur le droit d'auteur dans le marché unique numérique.
Cela dit, nous respectons scrupuleusement les choix d'opposition (opt-out) exprimés par les ayants droit via des standards techniques comme les fichiers robots.txt ou des métadonnées dédiées.
Il faut comprendre un équilibre fondamental : si l'Europe impose des restrictions disproportionnées sur l'accès aux données publiques tout en laissant les acteurs américains ou asiatiques s'entraîner sur l'ensemble du patrimoine informationnel mondial sans contrainte, nous condamnons l'écosystème européen à la dépendance technologique. Nous soutenons la mise en place de rémunérations équitables ou d'accords de licence pour les corpus privés de haute valeur, mais nous devons préserver la possibilité d'apprendre à partir des données ouvertes.
Aurélien Hottin : On parle beaucoup aujourd’hui du « mur de la donnée » (data wall). Certains chercheurs affirment que d'ici deux à trois ans, l'humanité aura épuisé l'intégralité des données textuelles de haute qualité disponibles sur Internet. Partagez-vous ce constat d'une pénurie imminente ?
Arthur Mensch : Le « mur de la donnée » est une réalité si l'on conserve une vision naïve de l'entraînement des modèles. Oui, le volume de texte humainement rédigé, lisible et à forte valeur ajoutée disponible publiquement sur le Web n'est pas infini. Nous avons fait le tour des bibliothèques numérisées, des forums de discussion de qualité et des dépôts de code open source.
Cependant, ce constat oublie deux leviers d'innovation majeurs :
- Les données synthétiques (synthetic data) : Il s'agit de données générées par des modèles de langage eux-mêmes, puis rigoureusement filtrées, vérifiées par des compilateurs, des exécuteurs de code ou des moteurs de preuve logique. Les modèles de raisonnement avancés s'entraînent aujourd'hui en résolvant des millions de problèmes mathématiques ou informatiques générés synthétiquement.
- La qualité de la donnée plutôt que la quantité brute : Nous pouvons réentraîner nos modèles sur des données structurées différemment, en éliminant 80 % du bruit informationnel pour ne garder que la substantifique moelle.
Le mur n'est donc pas une impasse, c'est une transition paradigmatique. Nous passons d'une ère d'accumulation passive à une ère de synthèse et d'ingénierie active de la donnée.
Aurélien Hottin : Entrons plus en détail sur ces données synthétiques. N'y a-t-il pas un risque majeur de consanguinité algorithmique, ce que certains universitaires appellent le « re-capture effect » ou le « modèle collapse », où un modèle formé sur des données générées par de l'IA finit par dégénérer ?
Arthur Mensch : C'est un risque bien réel si la génération synthétique est réalisée sans contrôle ni ancrage logique externe. Si vous demandez à un LLM de rédiger des poèmes pour entraîner un autre LLM, vous obtenez rapidement une paupérisation stylistique et une amplification des stéréotypes. C'est la consanguinité que vous décrivez.
En revanche, la donnée synthétique devient vertueuse lorsqu'elle est associée à une vérification déterministe. Prenons deux exemples simples :
- Le code informatique : Un LLM peut générer des milliers de programmes Python. Nous faisons passer ces programmes dans un exécuteur de code ou un banc de tests unitaires. Si le code s'exécute parfaitement, résout le problème et respecte les contraintes de performance, la donnée synthétique est validée. Elle possède une valeur d'apprentissage inestimable.
- Le raisonnement mathématique et logique : Un vérificateur formel peut valider les étapes d'une démonstration étape par étape (Chain of Thought).
Dans ces cas précis, la donnée synthétique n'est pas du bavardage réinjecté ; c'est une recherche d'optimisation validée par une vérité terrain tangible. C'est ainsi que l'on évite la dégénérescence des modèles.
Aurélien Hottin : Mistral AI est un pionnier et un fervent défenseur du modèle open weights (poids ouverts). Quel est le lien direct entre l'open source et la gestion de la donnée stratégique pour les entreprises qui utilisent vos modèles ?
Arthur Mensch : C’est le cœur absolu de notre vision. Pour une grande entreprise — qu'il s'agisse d'une banque, d'un groupe pharmaceutique, d'un hôpital ou d'un acteur de la défense —, les données internes constituent le patrimoine le plus précieux et le plus confidentiel.
Lorsqu'une entreprise utilise un modèle fermé hébergé via une API propriétaire aux États-Unis, elle accepte, de fait, une fuite ou au moins un transit de ses données critiques vers une infrastructure tiers. Même avec des engagements contractuels, le risque d'espionnage économique, d'application de lois extraterritoriales (comme le Cloud Act) ou de réutilisation implicite des requêtes pour entraîner de futurs modèles reste élevé.
En publiant nos modèles sous forme de poids ouverts (Mixtral 8x7B, Mistral 7B), nous permettons aux entreprises de télécharger le modèle, de l'installer sur leurs propres serveurs ou dans leurs nuages souverains privatifs, et d'y injecter leurs données métier en toute sécurité.
Aurélien Hottin : Arthur Mensch, merci pour cet éclairage d'une remarquable clarté sur les enjeux de la donnée et l'avenir de l'intelligence artificielle.
Arthur Mensch : Merci à vous pour ces questions pertinentes. C'est toujours un plaisir d'échanger sur ces thématiques fondamentales pour notre avenir technologique.