Auteurs(trice)
Associé, Propriété intellectuelle, Toronto
Associé, Technologie, Toronto
Associé, Technologie, Toronto
Associé, Propriété intellectuelle, Ottawa
Associé, Propriété intellectuelle, Vancouver
Points à retenir
- La Haute Cour de Delhi a statué que le stockage temporaire de contenu protégé par le droit d’auteur afin d’entraîner une IA pouvait être considéré comme une utilisation équitable, mais que les résultats devaient faire l’objet d’une évaluation distincte pour déterminer s’il y avait violation.
- Cette décision souligne la nécessité pour les concepteurs d’IA de documenter clairement leurs pratiques en matière d’intégration de contenu.
- Bien que cette décision soit importante, il ne s’agit que d’une injonction provisoire, ce qui laisse en suspens plusieurs questions juridiques concernant le droit d’auteur et l’utilisation de l’IA, qui feront peut-être l’objet de futurs procès.
Les concepteurs d’IA attendaient que les tribunaux établissent une distinction claire entre l’apprentissage à partir de contenu protégé par le droit d’auteur et la reproduction de ce contenu. La Haute Cour de Delhi vient d’apporter un premier élément de réponse.
Dans l’affaire ANI Media Pvt. v. Open AI OPCO LLC, la Cour a refusé d’accorder une injonction provisoire concernant l’entraînement et les résultats des grands modèles de langage sur lesquels repose ChatGPT. À titre de conclusion prima facie, la Cour a déclaré que le stockage temporaire d’articles de presse à des fins d’entraînement pouvait être considéré comme une utilisation équitable à des fins privées ou personnelles, notamment la recherche, ajoutant que les résultats devaient être évalués séparément afin de déterminer s’ils constituaient une reproduction substantielle. Autrement dit, le modèle peut consulter le contenu d’une bibliothèque, mais il ne peut pas distribuer de photocopies.
La décision en bref
ANI a allégué qu’OpenAI avait porté atteinte à ses droits d’auteur en stockant son contenu journalistique aux fins de l’entraînement de ses modèles et en générant ensuite des réponses qui reproduisaient ses œuvres. ANI a également fait valoir que le tribunal de Delhi devrait entendre l’affaire, bien que les serveurs d’OpenAI soient situés aux États-Unis.
En ce qui concerne la question de la compétence, la Cour a estimé que l’instance pouvait être instruite à Delhi pour plusieurs raisons : le siège d’ANI s’y trouve; OpenAI offre activement ses services à des utilisateurs indiens; enfin, les requêtes et les résultats pertinents sont générés sur le territoire relevant de la compétence de la Cour.
Sur le fond, la Cour a jugé, à cette étape préliminaire, que le stockage temporaire d’œuvres protégées par le droit d’auteur à des fins d’entraînement pouvait relever de la disposition relative à l’« utilisation équitable » (fair dealing) prévue par la Copyright Act, 1957 de l’Inde. La Cour a aussi ajouté que les résultats au cœur du litige ne présentaient pas de similitudes substantielles avec les articles publiés par ANI.
En d’autres termes, la localisation ne faisait donc pas obstacle à la demande, mais l’intégration d’œuvres protégées par le droit d’auteur ne constituait pas à elle seule une violation.
Influence des tribunaux canadiens
La Haute Cour de Delhi a cité les arrêts CCH Canadienne Ltée c. Barreau du Haut-Canada et Société canadienne des auteurs, compositeurs et éditeurs de musique c. Bell Canada de la Cour suprême du Canada et, s’appuyant sur ces arrêts, elle a conclu qu’il fallait interpréter la notion de « recherche » au sens large. La Cour a rejeté l’argument selon lequel le simple fait qu’un utilisateur ait un intérêt commercial dans l’utilisation d’une œuvre suffirait à écarter le droit à l’utilisation équitable. La Cour a établi une distinction entre, d’une part, les cas de distribution commerciale d’œuvres protégées par le droit d’auteur et, d’autre part, l’entraînement de modèles à l’interne, où le corpus d’entraînement n’est pas rendu public.
La Haute Cour de Delhi a évalué le caractère équitable de l’utilisation en se demandant si celle-ci se limitait à l’entraînement, si elle causait un préjudice économique ou concurrentiel, et si la technologie servait l’intérêt public.
ANI n’avait pas démontré de baisse du nombre d’abonnés ni de ses revenus publicitaires. S’appuyant sur la jurisprudence américaine, la Cour a en outre souligné que les modèles entraînés possédaient des « fonctions multiples » (multifarious functions), alors que l’activité d’ANI consiste à produire et à diffuser des nouvelles. Par ailleurs, la Cour a souligné qu’ANI avait proposé à OpenAI une licence d’une valeur de 7,5 millions de dollars américains — un fait que la Cour a considéré comme une reconnaissance du caractère quantifiable d’éventuels dommages intérêts.
Les intrants et les extrants soulèvent deux questions distinctes
Pour les entreprises du secteur de l’IA et les propriétaires de contenu, l’élément le plus important de ce jugement réside dans le fait que la Cour a refusé de regrouper l’entraînement et les résultats dans une seule et même analyse de violation. En ce qui concerne les résultats, la Cour a comparé les œuvres d’ANI « dans leur ensemble » (as a whole) plutôt que de fonder son analyse sur des fragments choisis.
Les requêtes visant à amener ChatGPT à reproduire le contenu « exactement » (exactly) n’ont engendré aucune réponse que la Cour a jugée substantiellement similaire aux articles d’ANI. La Cour a distingué cette affaire de la décision allemande GEMA v. Open AI, affaire où des requêtes ordinaires avaient reproduit mot pour mot les paroles d’une chanson. La Cour a ajouté que les réponses de ChatGPT citées reposaient sur une génération augmentée par récupération qui utilise des sources Web en temps réel plutôt que des données d’apprentissage mémorisées.
Cette dernière distinction revêtait une importance juridique, car les exemples invoqués par ANI au soutien de la violation alléguée n’avaient pas pu être mémorisés au cours de l’entraînement : en effet, les modèles avaient été entraînés avant même la parution de ces articles. Cela montre à quel point l’architecture technique peut avoir une incidence déterminante sur l’analyse du droit d’auteur. Les résultats générés uniquement à partir des paramètres appris par un modèle peuvent soulever des questions quant à savoir si les données d’entraînement ont été mémorisées et reproduites, tandis que la reproduction fondée sur la technologie de génération augmentée par récupération, en revanche, peut s’apparenter à un « moteur de recherche alimenté par l’IA » (AI enabled search engine) qui extrait et résume en temps réel du contenu accessible au public provenant de sources externes.
La Cour a fait remarquer que la plainte d’ANI ne mentionnait pas la génération augmentée par récupération, et que la question de savoir si les résultats engendrés par cette technologie pouvaient constituer une violation à part entière restait ouverte. Ces distinctions de structure viennent renforcer l’approche plus large adoptée par la Haute Cour de Delhi : les tribunaux devraient évaluer les allégations de violation relatives à l’intégration d’œuvres dans le cadre de l’entraînement d’un modèle au regard de l’exception de l’« utilisation équitable », et évaluer séparément les résultats obtenus pour établir s’il y a reproduction substantielle. Il existe une différence entre lire et copier.
Comment interpréter cette décision, et ce qu’il ne faut pas en conclure
La décision en question constitue une décision importante rendue par une autre juridiction de common law qui applique le principe de l’« utilisation équitable », notamment du fait que la Haute Cour de Delhi a adopté et appliqué la conception canadienne de l’utilisation équitable, c’est-à-dire que le droit de l’utilisateur doit recevoir une interprétation large et libérale. Toutefois, il s’agissait toutefois seulement d’une décision interlocutoire relative à une injonction provisoire, et non d’une décision définitive rendue à l’issue d’un procès.
De plus, la Haute Cour de Delhi ne s’est pas penchée sur la question de savoir si la « vectorisation » (vectorization) (c’est-à-dire la conversion de données telles que des mots ou des images en listes de nombres – des vecteurs – afin qu’un système informatique puisse en extraire un sens) équivaut en soi à une reproduction susceptible de donner lieu à une action en contrefaçon. Elle ne s’est pas non plus demandé si les résultats obtenus grâce à la génération augmentée par récupération peuvent, à eux seuls, porter atteinte au droit d’auteur.
Aucun tribunal canadien n’a encore appliqué l’analyse de l’« utilisation équitable » à l’entraînement de grands modèles de langage; cette décision pourrait donc avoir une valeur persuasive. Toutefois, bien que la Haute Cour de Delhi ait emprunté l’interprétation des tribunaux canadiens, ceux-ci pourraient néanmoins appliquer cette analyse différemment.
Les développeurs et les déployeurs d’IA doivent s’assurer de l’exactitude des données d’entrée
À la lumière de cette décision, les entreprises qui acquièrent, extraient, obtiennent sous licence, indexent ou intègrent autrement du contenu destiné à des systèmes d’IA devraient peut-être envisager de renforcer leurs règles de gouvernance. Elles auraient peut-être avantage à documenter l’objectif et les limites de l’intégration, à conserver les preuves des mesures de sécurité, à vérifier que les résultats ne reproduisent pas substantiellement des œuvres protégées, à séparer les données d’entraînement des sources de récupération en temps réel et à intégrer ces étapes dans une stratégie transfrontalière.
Cette décision montre également pourquoi l’architecture d’un système et les dispositions contractuelles peuvent produire des conséquences juridiques importantes. Divers intervenants peuvent être responsables de différentes étapes de la chaîne d’approvisionnement de l’IA. En effet, un concepteur de modèles peut entraîner le modèle de base; un concepteur d’applications peut y intégrer du contenu supplémentaire grâce à un ajustement ou de la technologie de génération augmentée par récupération; enfin, une entreprise cliente peut connecter son système à des sources exclusives ou tierces dans le cadre de son processus de déploiement. Nous conseillons aux entreprises de s’assurer que leurs contrats commerciaux abordent la question de ces rôles respectifs et répartissent les responsabilités en conséquence.
Cette répartition des responsabilités ne répond toutefois pas entièrement à la question de savoir s’il convient d’obtenir les droits sur le contenu sous-jacent. Les éléments d’un dossier peuvent étayer une argumentation fondée sur l’« utilisation équitable », mais cette stratégie ne constitue pas nécessairement une solution complète pour atténuer les risques. L’utilisation équitable dépend des faits et du territoire concerné, tandis que l’obtention d’une licence, lorsque cela est possible, peut offrir une plus grande prévisibilité sur l’ensemble des marchés et des droits d’utilisation plus étendus. Ainsi, l’utilisation équitable et l’octroi de licences peuvent tous deux servir des objectifs complémentaires.
Les équipes d’Osler spécialisées dans les litiges relatifs à la propriété intellectuelle et à la technologie peuvent aider les entreprises qui recueillent du contenu à mettre en place des pratiques de collecte susceptibles d’être défendues, à négocier des licences et à réagir lorsque les différends passent du stade hypothétique à celui d’une action en justice. N’hésitez pas à communiquer avec nos groupes spécialisés en propriété intellectuelle et en technologie si votre entreprise souhaite obtenir des conseils sur ces questions.