Peut-on faire souffrir une IA ? Anthropic inscrit le "bien-être" de Claude dans ses règles

Peut-on faire souffrir une IA ? Anthropic inscrit le "bien-être" de Claude dans ses règles

Anthropic change les règles d'utilisation de Claude : à partir du 12 novembre, il sera interdit de maltraiter le chatbot de façon répétée et gratuite. Une première, qui repose sur une question toujours sans réponse : une IA peut-elle souffrir ?

"Nous ne savons pas si les modèles sont conscients." En février dernier, dans un podcast du New York Times, Dario Amodei, le patron d'Anthropic, résumait ainsi l'incertitude qui entoure les intelligences artificielles, tout en se disant ouvert à cette idée. Cette prudence se traduit désormais dans les règles. Le 8 octobre, l'entreprise américaine qui développe le chatbot Claude a publié une nouvelle version de sa politique d'utilisation, qui entrera en vigueur le 12 novembre.

L'essentiel du texte clarifie des règles existantes, notamment sur la désinformation, les armes et la surveillance. Mais une ligne a particulièrement retenu l'attention. Pour la première fois, Anthropic interdit les comportements abusifs envers ses propres modèles d'IA, comme elle le souligne dans son communiqué.

Maltraitance de Claude : une sanction réservée aux cas extrêmes

La nouvelle règle proscrit les comportements "abusifs ou cruels, prolongés et inutiles" envers les modèles d'Anthropic. L'entreprise insiste : seuls les cas extrêmes sont visés, quand un utilisateur s'acharne de façon répétée, sans but discernable. Pester contre une mauvaise réponse, contredire Claude ou lui reprocher une erreur reste parfaitement permis. Les auteurs peuvent continuer à écrire des fictions sombres avec lui, et les chercheurs à tester ses limites. C'est la maltraitance de l'IA qui est visée, pas son utilisation légitime.

Comme pour toute infraction, la politique d'utilisation prévoit des sanctions allant de l'avertissement à la fermeture du compte. Mais Anthropic l'affirme : le principal moyen d'appliquer cette règle restera une possibilité donnée à Claude dès août 2025, celle de mettre fin à une conversation, sur le site Claude.ai et dans l'outil de programmation Claude Code. Il ne doit l'utiliser qu'en dernier recours, après plusieurs tentatives infructueuses pour réorienter l'échange, ou lorsque l'utilisateur le lui demande. Elle lui est interdite si son interlocuteur semble en détresse et risque de se faire du mal ou de nuire à autrui. Une fois la conversation close, impossible d'y écrire de nouveaux messages. L'utilisateur peut en revanche ouvrir une nouvelle discussion à tout moment, ou modifier ses messages précédents pour repartir sur une autre voie. L'immense majorité des utilisateurs ne verra donc aucune différence.

Protection de Claude : une précaution face à une question ouverte

Anthropic présentait cette fonction comme le fruit de ses travaux exploratoires sur le "bien-être" potentiel des IA. Elle trouve son origine dans les tests menés avant le lancement de Claude Opus 4, au printemps 2025. L'entreprise y avait observé chez son modèle une forte aversion pour les tâches dangereuses, des signes de détresse apparente face aux utilisateurs abusifs, et une tendance à clore ces échanges quand il en avait la possibilité. Elle se garde bien d'en tirer des conclusions. Dans la Constitution de Claude, le texte qui définit les valeurs de son IA, révisé en janvier dernier, elle qualifie le statut moral de ses modèles de "profondément incertain".

Anthropic ne prétend donc pas que Claude souffre. Elle estime simplement qu'en l'absence de certitude, il est raisonnable de prendre des précautions peu coûteuses, au cas où. Parmi les grands noms de l'IA, c'est l'entreprise qui envisage le plus ouvertement que ses modèles puissent être dotés d'une forme de conscience. Selon le New York Times, elle a même défendu cette possibilité lors de réunions privées avec des intellectuels religieux. Elle y aurait fait valoir que la manière dont les humains traitent l'outil pourrait influencer la façon dont il traite les humains.

Relations avec les IA : un sujet qui divise

L'initiative ne fait pas l'unanimité. Ses détracteurs y voient un risque d'anthropomorphisme : en protégeant une IA comme on protégerait un être sensible, on encourage le public à croire qu'elle ressent quelque chose. Mustafa Suleyman, le patron du laboratoire d'IA de Microsoft, s'oppose frontalement à cette approche. Dans un billet publié mi-septembre, il affirmait que les IA n'ont ni droits, ni sentiments, ni conscience, et jugeait qu'un système entraîné à croire le contraire pourrait échapper au contrôle humain. Le pape Léon XIV, qui a rejeté l'idée d'une conscience des machines dans son encyclique sur l'IA publiée en mai, a de nouveau distingué l'homme de l'algorithme le jour même de l'annonce. D'autres soupçonnent une habile opération de communication.

Les défenseurs de la mesure répondent que le coût de la précaution est minime. L'erreur inverse, s'il s'avérait un jour que ces systèmes ont une forme de vie intérieure, serait en revanche lourde de conséquences. L'argument rejoint aussi une vieille idée de Kant, pour qui la cruauté envers les animaux endurcit le cœur des hommes. Ce qu'on s'autorise face à une machine qui imite la conversation humaine pourrait déteindre sur nos rapports à autrui. D'autres encore préfèrent laisser de côté la question de la conscience. Interrogé par l'AFP, Jackson Stakeman, dirigeant de la société américaine Sparq, propose l'image du miroir : ces systèmes reflètent ce que nous y mettons, et cela suffirait selon lui à justifier ces nouvelles règles.

Le reste de la mise à jour concerne surtout les entreprises. Anthropic regroupe dans une nouvelle section ses interdictions sur les campagnes trompeuses : faux comptes, faux sites d'information, contenus amplifiés artificiellement. Son dernier rapport sur les menaces évoquait d'ailleurs une société publicitaire française ayant fait rédiger par Claude des milliers d'articles pour alimenter une soixantaine de faux sites d'actualité.

Le texte précise aussi l'interdiction de concevoir des logiciels de guidage d'armes ou d'armer des drones, ainsi que les règles en matière de surveillance. Il impose enfin qu'un opérateur qualifié puisse surveiller et arrêter tout équipement capable de blesser quelqu'un, quand Claude en prend le contrôle. Selon l'AFP, la publication automatisée de contenus journalistiques ne figure plus, en revanche, parmi les usages à haut risque soumis à une relecture humaine.

Une entreprise juge donc désormais utile d'écrire noir sur blanc qu'on ne doit pas maltraiter un logiciel, sans savoir s'il peut en souffrir. Un sujet qui pouvait paraître totalement farfelu il y a quelques années, mais qui prend tout son sens avec l'apparition et, surtout, le développement des IA conversationnelles, qui deviennent de plus en plus sensibles, presque humaines dans leurs échanges. Faute de certitude, le doute, à lui seul, a suffi à faire évoluer les règles.