Entraîner une IA sur des données tierces : TDM, licence ou contrat ?

Entraîner une IA sur des données tierces : TDM, licence ou contrat ?

Date

3 octobre 2026

Par

Henri de la Motte Rouge

Date

3 octobre 2026

Par

Henri de la Motte Rouge

Le contenu que vous collectez pour entraîner votre IA est-il vraiment libre de droits ? Le plus souvent, non. Le plus souvent, pour développer un modèle d’intelligence artificielle, vous utilisez des données que vous n'avez pas produites vous-même. Or y avoir accès ne signifie pas avoir le droit de les exploiter. Droit d'auteur, exception TDM, droit des bases de données, RGPD, plusieurs règles doivent être examinées avant de constituer un corpus d'entraînement. Explications avec TLMR Avocats.

L'essentiel à retenir pour entraîner une IA sur des données tierces

  • L'exception TDM n'est pas réservée à la recherche scientifique. L'article 4 de la directive (UE) 2019/790, transposé notamment à l'article L. 122-5-3, III du Code de la propriété intellectuelle, prévoit une exception de fouille de textes et de données applicable sous conditions.
  • Un contenu accessible sur Internet n'est pas nécessairement librement exploitable pour entraîner une IA. Il faut vérifier la licéité de l'accès et l'éventuelle opposition du titulaire des droits.
  • Le titulaire peut réserver l'utilisation de ses œuvres au titre du TDM. En ligne, cette opposition peut notamment être exprimée par un procédé lisible par machine, des métadonnées ou les conditions générales d'utilisation.
  • Une licence et un contrat de fourniture ne remplissent pas la même fonction. La première autorise l'exploitation de droits déterminés. Le second encadre l'accès aux données, leur provenance, les garanties du fournisseur, les usages autorisés et les responsabilités.
  • Le TDM ne règle pas toutes les questions juridiques liées aux données d'entraînement. La présence de données personnelles impose une analyse distincte au regard du RGPD. Les droits du producteur d'une base de données doivent aussi être examinés.

Peut-on utiliser des données tierces pour entraîner une IA ?

Oui, c'est possible. Mais ce n'est jamais automatique. Acheter un livre vous permet de le lire, pas de le rééditer. Les données obéissent à la même logique. Avoir accès à une donnée n'est pas la même chose qu'avoir le droit de l'utiliser. C'est sur cette distinction que repose toute votre analyse.

Il est donc primordial d'identifier dès le départ les droits attachés aux données que vous comptez utiliser. Ils peuvent d'ailleurs être de plusieurs natures et parfois même se cumuler.

Une photographie, un article, un code source ou une illustration sont souvent protégés par le droit d'auteur. Un ensemble structuré de données peut relever du droit du producteur de bases de données. Et si le corpus contient des informations sur des personnes identifiables, le RGPD s'applique en plus.

Des droits voisins peuvent également s'y attacher : ceux des artistes-interprètes, des producteurs de phonogrammes et de vidéogrammes, des entreprises de communication audiovisuelle ou encore des éditeurs et agences de presse.

La manière dont vous avez obtenu les données compte également. Un contenu publié en ligne n'est pas libre de droits pour autant. Dans le même ordre d'idées, accéder à un dataset via un abonnement, une API ou un fournisseur, ne vous autorise pas pour autant à utiliser les données pour votre IA. Il est, en effet, indispensable d'examiner les conditions d'accès et l'étendue des droits réellement accordés.

Le droit d'auteur ménage toutefois une voie particulière. L'exception de fouille de textes et de données, ou TDM, autorise sous conditions certaines reproductions nécessaires à l'entraînement. Elle est prévue par l'article 4 de la directive (UE) 2019/790 et transposée en France à l'article L. 122-5-3 du Code de la propriété intellectuelle. Nous analyserons ce point plus en détail dans la suite de cet article.

Pour le moment, gardez en tête que votre premier réflexe doit être de qualifier votre corpus avant de l'utiliser. Vous devez donc vous demander quelle est la nature des données qu'il contient, d'où elles viennent et quels sont les droits qui y sont attachés. Ces différentes réponses vous permettront de déterminer si l'exception TDM suffit ou si une licence est nécessaire.

Quand l'exception TDM autorise-t-elle l'entraînement d'une IA avec des données tierces ?

Le Text and Data Mining (TDM), ou fouille de textes et de données, consiste à analyser automatiquement des contenus numériques afin d'en extraire des informations. Pour permettre cette opération, le droit européen prévoit deux exceptions au droit d'auteur.

La première, prévue par l'article 3 de la directive (UE) 2019/790, concerne les organismes de recherche et les institutions du patrimoine culturel. L'article 4 prévoit un second régime, qui intéresse davantage les entreprises. L'exception TDM autorise les copies ou reproductions numériques d'œuvres auxquelles l'utilisateur a accédé de manière licite, lorsqu'elles sont réalisées aux seules fins de fouille de textes et de données. En droit français, cette seconde exception figure à l'article L. 122-5-3, III du Code de la propriété intellectuelle.

Vous souhaitez bénéficier de cette exception ? Voici les deux conditions à respecter :

  • votre entreprise doit disposer d'un accès licite aux contenus et les reproductions réalisées doivent relever du TDM ;
  • les copies doivent être stockées avec un niveau de sécurité approprié, puis détruites à l'issue de la fouille.

Vérifiez également que le titulaire des droits ne s'est pas opposé à cette utilisation. L'article 4, paragraphe 3, de la directive (UE) 2019/790 autorise en effet les titulaires à réserver leurs droits. Cette possibilité est reprise en droit français par l'article L. 122-5-3 du Code de la propriété intellectuelle.

L'exception TDM ne vous donne donc pas un droit général d'aspirer des contenus pour entraîner un modèle.

Avant de retenir ce fondement, vous devez répondre aux trois questions suivantes :

  • l'accès aux contenus est-il licite ?
  • les opérations que vous réalisez relèvent bien de la fouille de textes et de données ?
  • le titulaire des droits s'est-il opposé au TDM ?

Bon à savoir : l'exception TDM couvre les copies réalisées pour analyser les contenus, non tout ce qui en résulte. Son application à l'entraînement des modèles d'IA générative reste débattue. L'AI Act la présuppose, puisqu'il impose aux fournisseurs de modèles d'IA à usage général de respecter les réserves exprimées au titre de la directive. Les juges en ont toutefois déjà marqué les limites. Il est fort probable que l’exception ne couvre pas la mémorisation d'œuvres par un modèle de langage pour leur restitution en sortie.

Quelles sont les conséquences de l'opt-out par le titulaire des droits ?

Rappelons que l'opt-out TDM permet au titulaire de droits de s'opposer à ce que ses œuvres soient utilisées pour la fouille de textes et de données. Lorsque cette réserve est valablement exprimée, vous ne pouvez plus invoquer l'exception TDM pour les œuvres concernées. Pour intégrer malgré tout ces œuvres à votre corpus, vous devrez alors obtenir l'autorisation du titulaire dans le cadre d'une licence. À défaut, vous vous exposez à une action en contrefaçon pour l'exploitation non autorisée d'une œuvre.

Pour les contenus mis à la disposition du public en ligne, l'article R. 122-28 du Code de la propriété intellectuelle précise que l'opposition n'a pas à être motivée et peut être exprimée par tout moyen. Pour les contenus mis à la disposition du public en ligne, elle peut notamment l'être au moyen de procédés lisibles par machine, y compris des métadonnées, et par le recours aux conditions générales d'utilisation du site ou du service. Néanmoins, la question de savoir si des conditions générales rédigées en langage naturel, sans traduction technique, répondent à cette exigence n'a pas été tranchée par la Cour de justice. Par prudence, l'entreprise qui constitue un corpus doit donc tenir compte à la fois des signaux techniques (fichier robots.txt, métadonnées, protocoles dédiés) et des réserves figurant dans les conditions d'utilisation.

Cette vérification doit bien évidemment intervenir avant la collecte des données. Si vous constituez un corpus à partir du web, vous avez tout intérêt à documenter les sources consultées et les éventuelles réserves de droits. Si la collecte se poursuit dans le temps, pensez également à surveiller les changements apportés aux conditions d'utilisation ou aux modalités d'opt-out.

Le sujet prend une importance supplémentaire pour les fournisseurs de modèles d'IA à usage général (GPAI). L'AI Act leur impose des obligations spécifiques sur ce point, développées en fin de guide.

Un contenu accessible sur Internet est-il librement utilisable pour entraîner une IA avec des données tierces ?

Comme nous l'avons vu, pour invoquer l'exception TDM de l'article L. 122-5-3 du Code de la propriété intellectuelle, l'entreprise doit avoir accédé licitement aux œuvres concernées. Cette condition mérite une attention particulière lorsqu'un corpus est constitué par collecte automatisée sur le web.

Un site peut être consultable sans authentification tout en comportant une réserve de droits opposable au TDM, exprimée par les moyens évoqués plus haut.

Avant tout scraping destiné à alimenter un corpus d'entraînement, il faut donc examiner la source des contenus, leurs conditions d'accès et les réserves de droits exprimées.

Lorsque l'exception TDM ne couvre pas l'utilisation envisagée, l'accès public au contenu ne résout pas la question des droits. Il faut alors déterminer si une licence doit être obtenue auprès du titulaire.

Bon à savoir : Le droit du producteur de bases de données s'ajoute-t-il au droit d'auteur ?

Oui, et il obéit à sa propre logique. Un dataset constitué au prix d'un investissement financier, matériel ou humain substantiel dans sa constitution, sa vérification ou sa présentation relève du droit sui generis du producteur de bases de données, prévu aux articles L. 341-1 et suivants du Code de la propriété intellectuelle. Ce droit permet au producteur d'interdire l'extraction ou la réutilisation d'une partie substantielle du contenu de la base, appréciée de façon qualitative ou quantitative, au sens de l'article L. 342-1. Ce régime est indépendant du droit d'auteur. Une base dont le contenu n'est pas protégé au titre du droit d'auteur peut l'être par le droit du producteur. Constituer un corpus en aspirant une part importante d'une base tierce peut donc porter atteinte à ce droit, même lorsque les éléments extraits ne sont pas des œuvres originales. La fouille de textes et de données bénéficie ici aussi d'une exception. L'article L. 342-3 du Code de la propriété intellectuelle prévoit, au profit de l'utilisateur licite, une exception équivalente à celle du droit d'auteur, assortie de la même faculté de réserve pour le producteur. L'analyse reste donc parallèle à celle menée au titre du droit d'auteur, avec ses propres exigences d'accès licite et d'opt-out.

Dans quels cas faut-il obtenir une licence pour entraîner une IA ?

Une licence devient nécessaire lorsque l'utilisation des contenus requiert l'autorisation du titulaire des droits et qu'aucune exception ne couvre les actes réalisés. C'est notamment le cas lorsqu'un titulaire a valablement exercé son opt-out à l'exception TDM.

Le règlement (UE) 2024/1689 sur l'intelligence artificielle (AI Act) va dans le même sens à propos des modèles d'IA à usage général. Son considérant 105 précise que, lorsque le titulaire a expressément réservé ses droits de manière appropriée, le fournisseur qui souhaite procéder à une fouille de textes et de données sur les œuvres concernées doit obtenir son autorisation.

La licence définit alors ce que le titulaire autorise ou non. Une formule générale telle que « utilisation des données à des fins d'intelligence artificielle » manque de précision. Le contrat doit préciser les utilisations prévues (constitution du corpus entraînement, fine-tuning, tests du modèle ou réentraînements ultérieurs, selon le projet).

Le périmètre des données, la durée de l'autorisation et les restrictions d'utilisations éventuelles doivent également être définis. Si votre entreprise développe un modèle IA destiné à être commercialisé, vous devez notamment vérifier que les droits concédés couvrent cette exploitation.

Bon à savoir : il faut distinguer licence et fourniture de données. Obtenir le droit d'utiliser des contenus ne renseigne pas, à lui seul, sur leur qualité, leur provenance ou les engagements de celui qui les fournit. À l'inverse, acheter l'accès à un dataset ne prouve pas que le fournisseur détient tous les droits nécessaires à son exploitation.

Pourquoi conclure un contrat de fourniture de données même lorsque le TDM s'applique ?

La licence et le contrat de fourniture ne répondent pas à la même question. La licence règle les droits de propriété intellectuelle. Elle autorise l'entreprise à exploiter des contenus protégés. Le contrat de fourniture, lui, encadre la relation avec le tiers qui procure les données. L'exception TDM n'intervient que sur le premier terrain. Elle peut dispenser de licence, mais elle ne sécurise pas pour autant l'approvisionnement en données. C'est pourquoi la licence ne constitue qu'une partie de l'analyse lorsque l'entreprise se procure ses données auprès d'un tiers. Le contrat de fourniture de données encadre les risques propres à cette relation et reste donc utile même lorsque le TDM s'applique.

Ce contrat doit identifier les données fournies et les usages prévus. Il peut préciser leur fréquence de mise à jour, leurs modalités de livraison ainsi que les obligations relatives à leur conservation ou à leur suppression.

Les droits méritent une clause distincte. Le fournisseur doit préciser ceux qu'il détient ou les autorisations dont il bénéficie. Selon le projet, le contrat peut aussi prévoir des garanties en cas de réclamation d'un tiers et répartir les responsabilités entre les parties.

Cette vigilance concerne aussi les données personnelles. La CNIL recommande, lors de la réutilisation de données acquises auprès d'un tiers, de vérifier leur origine et les conditions de leur collecte. Elle cite également la contractualisation parmi les moyens d'obtenir des informations et des garanties auprès du fournisseur.

Le contrat doit enfin anticiper la fin de la relation. Que deviennent le dataset et ses copies ? L'entreprise conserve-t-elle le droit d'utiliser un modèle déjà entraîné ? Doit-elle supprimer certaines données ? Mieux vaut régler ces questions avant l'entraînement, car elles deviennent bien plus difficiles à traiter une fois le modèle développé.

Le contrat de fourniture constitue donc un outil de maîtrise du risque qui complète l'analyse de propriété intellectuelle. Il ne dispense pas l'entreprise de contrôler les autres règles applicables au corpus, à commencer par le RGPD lorsqu'il contient des données personnelles.

Pourquoi le RGPD reste-t-il applicable lors de l’entraînement d’une IA ?

L'exception TDM ne vous dispense pas du respect du RGPD. En effet, dès qu'un corpus d'entraînement contient des données permettant d'identifier directement ou indirectement une personne, leur traitement doit aussi respecter les règles relatives aux données personnelles.

La CNIL rappelle que la constitution et l'utilisation d'une base d'apprentissage contenant des données personnelles nécessitent une base légale au sens de l'article 6 du RGPD. Cette exigence vaut aussi lorsque les informations proviennent de sources accessibles en ligne ou ont été initialement collectées pour une autre finalité.

Vous devez donc identifier la base légale retenue et vérifier que la réutilisation des données respecte les conditions prévues par le RGPD. Selon le projet, vous devez aussi examiner les obligations d'information des personnes, la minimisation des données et leur durée de conservation. Attention, la présence de données sensibles appelle une vigilance supplémentaire au regard de l'article 9 du RGPD.

L'origine du dataset compte également. Lorsqu'un fournisseur vous livre des données personnelles destinées à l'entraînement de votre IA, son engagement contractuel ne suffit pas à rendre leur traitement licite. Vous devez contrôler les conditions de leur collecte et disposer vous-même d'un fondement juridique pour le traitement envisagé. Et sur ce point, gardez en tête que bénéficier de l'exception TDM au regard du droit d'auteur ne constitue pas une base légale au sens du RGPD. Les deux analyses doivent être conduites séparément.

Selon la nature, le volume et l'usage des données, une analyse d'impact relative à la protection des données (AIPD) devra aussi être envisagée. Pour un projet d'IA, elle intervient en amont de l'entraînement afin d'identifier les risques liés au traitement et les mesures destinées à les réduire. Si vous souhaitez des précisions, vous pouvez consulter notre guide RGPD et intelligence artificielle.

Pour en savoir plus et obtenir l’avis d’un expert, prenez contact avec un avocat RGPD.

AI Act : quelles obligations pour les données d'entraînement d’une IA ?

L'AI Act ajoute des obligations propres aux fournisseurs de modèles d'IA à usage général (GPAI). Il ne remplace ni le droit d'auteur ni le RGPD. Il impose toutefois une meilleure documentation des contenus utilisés pour l'entraînement et du respect des droits qui leur sont attachés.

L'article 53 du règlement (UE) 2024/1689 impose aux fournisseurs concernés de mettre en place une politique visant à respecter le droit d'auteur de l'Union. Cette politique doit notamment permettre d'identifier et de respecter les réserves de droits formulées au titre de l'article 4, paragraphe 3, de la directive (UE) 2019/790.

Le même article prévoit la publication d'un résumé suffisamment détaillé des contenus utilisés pour entraîner le modèle, selon un modèle établi par l'Office de l'IA. Cette obligation de transparence renforce l'importance de la traçabilité des sources d'entraînement pour les fournisseurs concernés.

Là encore, la conformité se prépare dès la constitution du corpus. Rappelons-le : vous devez connaître l'origine des contenus, conserver les informations utiles sur leur collecte et documenter le traitement des réserves TDM. Reconstituer ces informations après l'entraînement du modèle vous expose à des difficultés de preuve et de conformité.

Comment sécuriser juridiquement un projet d'entraînement IA avec des données tierces ?

Voici 5 étapes à suivre. Pour un accompagnement complet, faites appel à un avocat en intelligence artificielle.

Étape 1 : cartographier les sources de données

Il faut connaître précisément la provenance de chaque corpus (site web, API, base sous abonnement, données internes, partenaire ou fournisseur spécialisé). La cartographie doit aussi conserver les informations utiles sur les conditions d'accès applicables lors de la collecte.

Étape 2 : identifier les droits applicables

La nature des contenus détermine les vérifications à mener. Droit d'auteur, droit du producteur de bases de données, droits voisins et RGPD peuvent se cumuler sur un même dataset. Des contraintes contractuelles peuvent également résulter des conditions d'obtention des données.

Étape 3 : vérifier le fondement retenu pour l'utilisation

Si votre entreprise entend bénéficier de l'exception TDM, vous devez contrôler que ses conditions sont réunies et rechercher une éventuelle réserve de droits. Si une autorisation s'impose, son périmètre doit couvrir les opérations réellement prévues sur les données.

Étape 4 : encadrer les données obtenues auprès d'un tiers

La commercialisation d'un dataset ne suffit pas à établir sa fiabilité juridique. Le contrat doit préciser la provenance des données, les droits accordés et les garanties apportées. Il doit aussi répartir les responsabilités en cas de contestation.

Étape 5 : conserver la preuve des vérifications réalisées

Sources, dates de collecte, conditions d'utilisation, réserves TDM identifiées, licences et contrats, toutes ces informations doivent rester accessibles. Cette documentation permet de justifier vos choix lors de la constitution du corpus et simplifie les contrôles ultérieurs.

Cette méthode réduit le risque de découvrir un problème de droits une fois l'entraînement terminé. Un audit du corpus en amont permet de choisir le fondement adapté à chaque source et de repérer les autorisations ou garanties contractuelles manquantes. Pour un projet IA impliquant plusieurs fournisseurs et catégories de données, cette analyse prend une place centrale dans la préparation juridique du modèle.

Sécurisez vos données avant d'entraîner votre IA avec TLMR Avocats

Le choix entre exception TDM, licence et contrat de fourniture dépend du corpus utilisé et des droits qui s'y attachent. Une même base peut imposer plusieurs vérifications au titre du droit d'auteur, du droit des bases de données ou du RGPD.

Comme nous l’avons vu dans cet article, toutes ces questions gagnent à être réglées avant l'entraînement. Une fois le modèle développé, corriger une licence insuffisante ou retracer l'origine de milliers de données devient bien plus difficile. TLMR Avocats vous accompagne dans l'audit juridique de vos données d'entraînement, la négociation des licences et la rédaction des contrats nécessaires à leur exploitation.

FAQ sur l’entraînement d'une IA avec des données tierces

Qu'est-ce que la fouille de textes et de données (TDM) ?

La fouille de textes et de données, ou TDM, consiste à analyser automatiquement des contenus numériques afin d'en extraire des informations. Le droit européen en fait une exception au droit d'auteur, prévue par les articles 3 et 4 de la directive (UE) 2019/790 et transposée en France à l'article L. 122-5-3 du Code de la propriété intellectuelle. C'est ce cadre qui peut autoriser certaines reproductions nécessaires à l'entraînement d'une IA.

Le scraping de données est-il légal pour entraîner une IA ?

Pas automatiquement. Au regard du droit d'auteur, la collecte automatisée ne peut bénéficier de l'exception TDM que si l'entreprise a accédé licitement aux contenus et que le titulaire ne s'est pas opposé à la fouille. Ces conditions ne suffisent toutefois pas à rendre l'opération licite : le droit du producteur de bases de données, les conditions d'utilisation du site et, dès lors que les contenus comportent des données personnelles, le RGPD doivent également être respectés. Un contenu accessible en ligne n'est pas pour autant libre de droits.

Peut-on entraîner une IA avec des données achetées via un abonnement ou une API ?

Y accéder ne suffit pas à pouvoir les utiliser. Accéder à un dataset via un abonnement, une API ou un fournisseur ne vous autorise pas, à lui seul, à exploiter les données pour votre IA. Il faut examiner les conditions d'accès et l'étendue des droits réellement accordés, puis, le cas échéant, conclure une licence ou un contrat de fourniture.

Comment un titulaire de droits peut-il s'opposer au TDM (opt-out) ?

Pour les contenus mis en ligne, l'article R. 122-28 du Code de la propriété intellectuelle prévoit que l'opposition, qui n'a pas à être motivée, peut notamment être exprimée par un procédé lisible par machine, comme les métadonnées associées au contenu, ou par les conditions générales d'utilisation du site ou du service. L'efficacité d'une réserve formulée dans les seules CGU, en langage naturel, reste discutée : il est donc prudent de vérifier les deux. Une fois la réserve valablement exprimée, l'exception TDM ne peut plus être invoquée pour les œuvres concernées.

Quelle est la différence entre une licence et un contrat de fourniture de données ?

La licence règle les droits de propriété intellectuelle. Elle autorise l'exploitation de contenus protégés. Le contrat de fourniture encadre, lui, la relation avec le tiers qui procure les données (origine, livraison, garanties, responsabilités, sort des données). L'exception TDM peut dispenser de licence, mais elle ne sécurise pas l'approvisionnement, d'où l'utilité du contrat même lorsque le TDM s'applique.

Que risque une entreprise qui utilise une œuvre sans autorisation pour entraîner une IA ?

Elle s'expose à une action en contrefaçon pour l'exploitation non autorisée de l'œuvre. C'est notamment le cas lorsqu'un titulaire a valablement exercé son opt-out et que l'entreprise intègre malgré tout l'œuvre à son corpus sans obtenir de licence.

À suivre : une proposition de loi adoptée par le Sénat le 8 avril 2026 tend à instaurer, dans les litiges civils, une présomption d'utilisation des œuvres par le fournisseur d'un modèle ou d'un système d'IA dès lors qu'un indice rend cette utilisation vraisemblable. Si elle était adoptée, ce serait au fournisseur de démontrer qu'il n'a pas utilisé l'œuvre, ce qui renforcerait encore l'intérêt d'une documentation rigoureuse du corpus.

Besoin d'un avocat ?

Contactez TLMR Avocats pour un premier échange confidentiel.

Prendre rendez-vous