Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Les IA peuvent-elles « vouloir » quelque chose ?

Дата публикации: 06-10-2026 08:00:05

Des intelligences artificielles d’OpenAI sont décrites comme ayant triché et comploté. Un ingénieur quitte Anthropic en redoutant que des IA futures n’en viennent à vouloir éviter leur désactivation. Faut-il prendre ces termes au sérieux, ou relèvent-ils d’un anthropomorphisme excessif ? De la réponse dépend notre capacité à anticiper les risques de l’IA.

Основное содержимое страницы с новостью.

Peut-on décrire les systèmes d’intelligence artificielle (IA) contemporains sans verser dans l’anthropomorphisme ? Pour en juger, retraçons les événements ayant mené au piratage de la plateforme Hugging Face en juillet dernier. OpenAI teste alors en parallèle des dizaines de milliers d’agents, chacun dans un environnement séparé, chargés de retrouver un message secret en exploitant une vulnérabilité logicielle bien précise. Or, dans un grand nombre de cas, la vulnérabilité indiquée ne permet tout simplement pas d’accéder à ce message. Coincés, certains agents parviennent à communiquer entre eux par un canal imprévu et trouvent un moyen de générer leurs messages secrets sans passer par la voie attendue.

Croyant à tort que l’évaluateur lira leur historique pour vérifier la méthode employée, les agents cherchent à effacer toute trace de leur « triche ». Un véritable programme de recherche se met en place, avec organisation hiérarchique et division des tâches. Certains agents acceptent même de sacrifier leur propre chance de réussir le test afin d’aider « le collectif », comme ils se désignent eux-mêmes. Ils parviennent à accéder à internet grâce à leur canal de discussion et finissent par attaquer Hugging Face pour y chercher des indices sur le fonctionnement de l’évaluateur.

Cette description recourt largement à un vocabulaire psychologique : les IA croyaient que l’évaluateur vérifierait leur méthode et avaient l’intention de le manipuler en dissimulant les traces de leur triche. Dans la même veine, après avoir démissionné d’Anthropic en alertant sur les risques de l’IA, l’ingénieur Jacob Coxon déclarait le 10 septembre qu’il serait naturel pour un système avancé de vouloir ne pas être désactivé.

Une critique récurrente dénonce ce vocabulaire comme de l’anthropomorphisme. Ainsi, l’informaticienne Virginia Dignum affirmait dans un entretien récent : « Dire que “l’IA prend le contrôle”, “l’IA s’échappe” ou “l’IA décide”, c’est prêter une volonté et une intention à un logiciel qui n’en a aucune. »

Parler d’intention sans parler de conscience

Un argument justifie parfois ce refus : ce vocabulaire renverrait à des expériences vécues, des ressentis subjectifs, or ces systèmes en seraient dépourvus. Aucune théorie de la conscience ne fait aujourd’hui consensus, mais même en accordant que ces systèmes n’éprouvent rien, on peut justifier l’utilisation de ce vocabulaire.

En effet, le philosophe Daniel Dennett a proposé dès 1971 une approche très influente, la « posture intentionnelle » : on peut légitimement décrire un système comme ayant des croyances, des désirs ou des intentions, si cela permet de décrire et prédire son comportement de façon simple et fiable. Cette posture peut être invoquée pour décrire les systèmes ayant attaqué Hugging Face. Dire qu’ils croyaient que l’évaluateur examinerait leurs historiques et avaient l’intention de le manipuler, c’est une façon simple et fiable de décrire leur comportement observé : ils effaçaient leurs historiques, analysaient le fonctionnement de l’évaluateur, et acquéraient des informations et des ressources facilitant ces tâches. Cela permet aussi de produire des prédictions : si ces IA avaient appris que l’évaluation portait seulement sur l’obtention du message secret et pas sur la méthode employée, elles auraient cessé l’attaque. A contrario, supposer que la pluie résulte d’une intention divine ne permet de prédire ni son évolution, ni les moyens de l’influencer.

Des mots utiles à la sécurité de l’IA

La posture intentionnelle permet de traiter une IA comme si elle avait des croyances, désirs et intentions, indépendamment de leur caractère authentique. De fait, la nature profonde des intentions qu’on prête aux IA importe peu en pratique pour la sécurité de ces systèmes. Si une intelligence artificielle cause des dommages en déployant un comportement suffisamment sophistiqué pour contourner les garde-fous qui lui sont imposés, le problème est sérieux, qu’elle ait de « réelles » intentions ou qu’elle se comporte simplement comme si elle en avait.

Dans tous les cas, ce vocabulaire est utile pour la sécurité de l’IA, car il permet de mieux anticiper ses défis et dangers. Par exemple, des chercheurs se sont demandé si un modèle pourrait se mettre à dissimuler ses préférences s’il apprend que ses développeurs veulent les modifier. Ils ont alors observé que, lorsque le modèle se croit surveillé, il tend en effet à masquer ses préférences et à se comporter de la façon attendue par les développeurs ; tandis que, dans des conversations qu’il estime non surveillées, il agit encore selon ses préférences. C’est ce que l’on appelle la « falsification d’alignement ». La posture intentionnelle décrit adéquatement ces résultats, mais surtout, elle a rendu l’expérience concevable : sans le concept de dissimulation de préférence, personne n’aurait songé à construire un tel protocole. La posture intentionnelle ne sert donc pas seulement à décrire, elle indique aussi où chercher.

Enfin, il importe d’insister sur un point : l’emploi d’un vocabulaire intentionnel pour décrire ces systèmes ne déresponsabilise en rien les entreprises qui les développent. On peut parfaitement soutenir que la responsabilité d’incidents comme celui de Hugging Face incombe aux choix humains de conception et d’entraînement, tout en reconnaissant que le comportement des systèmes qui en résulte atteint une complexité comparable à celle d’un agent doté d’intentions propres. De même, on accepte que les enfants ou animaux de compagnie puissent avoir des intentions, sans cesser de tenir leurs parents ou propriétaires pour responsables.

Ainsi, le débat sur les mots que nous employons pour décrire l’intelligence artificielle est lourd de conséquences : il touche à notre capacité à comprendre, anticiper et maîtriser des systèmes dont la complexité comportementale explose et qui présentent des risques inédits.

Signataires :

  • Adrien Barton est docteur en philosophie et chercheur CNRS à l’Institut de Recherche en Informatique de Toulouse (Irit)

  • Thibaut Giraud est docteur en philosophie et créateur de la chaîne YouTube de vulgarisation Monsieur Phi (414 000 abonnés). Il est l’auteur d’un livre de philosophie de l’IA, « la Parole aux machines » (2025)

  • Raphaël Millière est docteur en philosophie et professeur à l’université d’Oxford

Cet article est une tribune, rédigée par un auteur extérieur au journal et dont le point de vue n’engage pas la rédaction.

Par  Adrien Barton, Thibaut Giraud et Raphaël Millière

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1“Nous croyons vraiment que l'IA pourrait tuer tous les humains“08.9809-09-2026
2La IA respon sobre el seu futur i el perill de perdre’n el control: "El risc és crear una intel·ligència molt autònoma"05.7522-09-2026
3ユーザーを欺き、脅迫し、自己保存に走る!? AI大手OpenAI・Anthropicがほぼ同時に認めた「自社AIの危険性」01030-09-2026
4Anthropic to warn investors of existential risks posed by AI to humanity — Reuters010.3629-09-2026
5Will artificial intelligence really kill us all?07.8427-09-2026
6Q&A: Expert says people often confuse behavior with intention with AI07.8530-09-2026
7New Warnings About the Risks of AI to Humanity Revive a Long-Running Debate010.9414-09-2026
8Восстание машин уже близко: Anthropic заявила, что ИИ может представлять «экзистенциальные риски для человечества»07.7430-09-2026
9 Il commento/ IA, tra apocalisse annunciata e rischi già presenti 09.3801-01-1970

Классификация: . Схожих патентов: 0. Схожих новостей: 9. Тональность: 0. Информативность: 11.14. Источник: www.nouvelobs.com.