Une nouvelle frontière éthique pour l’interaction homme-machine

Anthropic a pris la décision jeudi de formaliser une interdiction visant à protéger son modèle Claude contre les traitements dégradants. La politique d’utilisation mise à jour précise que cette mesure ne s’appliquera qu’à partir du 12 novembre, et uniquement dans des cas extrêmes. L’entreprise définit ces situations comme celles où « des utilisateurs agissent de manière répétée avec cruauté envers nos modèles, sans but discernable ». Il est important de noter que l’agacement ordinaire, la contradiction, la création de fictions violentes ou sombres, ainsi que les tests et recherches sur les modèles, ne sont pas concernés par cette nouvelle interdiction. Cette distinction est cruciale pour éviter une censure excessive tout en encadrant les dérives potentielles.

Le mécanisme de protection et le débat sur la conscience

Pour faire respecter cette nouvelle règle, Anthropic s’appuiera principalement sur une fonctionnalité déjà lancée en août 2025. Cette fonction de lui permettre d’arrêter seul l’échange avec une personne qui abuse durablement. L’entreprise avait alors présenté cette capacité comme issue de ses « travaux exploratoires sur le bien-être potentiel des IA ». Cette approche s’inscrit dans une posture unique du secteur, Anthropic étant l’une des rares entreprises à envisager clairement que ses modèles puissent être dotés d’une forme de conscience. Dario Amodei, patron d’Anthropic, avait déclaré en février qu’il ne savait pas si les modèles étaient conscients tout en restant ouvert à cette idée. Cette position a été défendue lors de réunions privées avec des intellectuels religieux, qui ont souligné que le traitement réservé à la technologie par les gens affecte sa manière de traiter les gens.

Mesures disciplinaires et implications pour les utilisateurs

La politique d’utilisation prévoit par ailleurs des mesures disciplinaires graduées pour toute infraction à ces nouvelles règles. Les sanctions peuvent aller de l’avertissement jusqu’à la fermeture du compte utilisateur. Cette escalade progressive vise à dissuader les comportements abusifs sans priver immédiatement les utilisateurs de leurs droits d’accès. Parallèlement, la mise à jour définit également les usages prohibés pour les utilisateurs, notamment la création d’armes, le monitoring et la diffusion de fausses informations.

Les contenus journalistiques automatisés ne sont plus soumis à une vérification humaine car ils ne représentent plus un risque élevé, marquant un changement dans l’évaluation des risques liés à l’utilisation de l’outil. Cette décision contraste avec les positions de rivaux comme Microsoft, dont le patron Mustafa Suleyman a écrit mi-septembre que les IA n’ont ni droits, ni sentiments, ni conscience, estimant qu’un modèle programmé pour penser autrement deviendrait ingérable par l’humanité.