Pouvons-nous encore marquer les machines ?
Scott Aaronson, théoricien de l'informatique et spécialiste de la complexité algorithmique et du calcul quantique, ancien professeur au MIT et aujourd'hui enseignant à l'Université du Texas à Austin, se retrouve au coeur d'un débat qui prend une nouvelle ampleur réglementaire. Depuis le 2 août, l'AI Act européen contraint les fournisseurs d'intelligence artificielle à rendre détectables les contenus générés ou manipulés par leurs modèles. Dans ce contexte, Anthropic a annoncé l'intégration d'un filigrane numérique invisible dans les textes produits par Claude, son assistant conversationnel, ravivant une série de questions techniques et éthiques sur lesquelles Aaronson travaille depuis plusieurs années.
C'est à l'été 2022, peu après son recrutement chez OpenAI par Ilya Sutskever et Jan Leike — alors responsables de la recherche sur l'alignement —, qu'Aaronson dit avoir été le premier à concevoir spécifiquement le principe du tatouage numérique appliqué aux grands modèles de langage. L'idée repose sur une modification imperceptible du processus de génération textuelle : une signature statistique est discrètement encodée dans la fonction pseudo-aléatoire cryptographique qui régit le choix des mots. Le résultat produit est indiscernable d'un texte ordinaire du modèle, mais il devient possible d'identifier non seulement qu'un texte est d'origine artificielle, mais aussi quel modèle précis l'a généré.
Cette technique soulève pourtant plusieurs interrogations. Sa robustesse face aux outils cherchant à effacer ces marqueurs reste incertaine. Certains se demandent si elle ne servirait pas surtout aux laboratoires pour filtrer leurs données d'entraînement, afin d'éviter d'alimenter leurs modèles avec du contenu généré par IA — pratique soupçonnée de dégrader la qualité et la fiabilité des systèmes. Des questions de propriété intellectuelle pourraient également surgir à mesure que le procédé se répand.
Au-delà de la technique, Aaronson évoque le contexte intellectuel de ses années chez OpenAI, marquées par une approche encore largement empirique de la sécurité de l'IA, et par la constitution de ce qu'il appelle des « constitutions » : des ensembles explicites de valeurs destinés à guider le comportement des modèles. Il confie avoir été personnellement ébranlé par une campagne de harcèlement en ligne qui l'a rendu durablement méfiant quant à l'authenticité des identités numériques. Lauréat de l'ACM Prize in Computing en 2020 et élu à la National Academy of Sciences en 2026, il exprime par ailleurs une inquiétude profonde sur ce qui lui apparaît comme la fin de la recherche mathématique telle qu'elle a été pratiquée jusqu'ici.
Sources : legrandcontinent.eu · youtube.com · google.com
Actu