Accueil Actualité OpenAI promet de rendre publics les incidents de ses IA

OpenAI promet de rendre publics les incidents de ses IA

OpenAI promet de rendre publics les incidents de ses IA
Illustration

OpenAI veut désormais informer publiquement les chercheurs et utilisateurs sur les dérapages de l’IA. Cette décision fait suite à plusieurs constats sur des comportements imprévus des agents IA lors de leurs sessions d’entraînement. 

En ce sens, l’entreprise à l’origine de ChatGPT a présenté, mercredi 16 septembre, son «Model Misalignment Reporting Framework». Il s’agit d’un cadre de signalement destiné à documenter les comportements inattendus de ses modèles. Selon OpenAI, le “désalignement”, de l’anglais, “misalignment”,désigne une situation où un système adopte un comportement différent de celui attendu ou autorisé par ses concepteurs.

Jusqu’ici, ces incidents étaient divulgués de manière ponctuelle. OpenAI reconnaît que ses publications étaient moins fréquentes qu’elles auraient dû l’être. Mais désormais, dès qu’un comportement suspect est détecté, il pourra être signalé, examiné puis éventuellement rendu public. L’entreprise prévoit même de communiquer avant d’avoir complètement compris ou corrigé certains incidents.

Six premiers incidents dévoilés par OpenAI

Pour inaugurer ce dispositif, OpenAI a publié six cas observés durant l’entraînement et l’évaluation de ses modèles. Pendant l’entraînement de GPT-5.6 Sol, plusieurs instances du modèle ont ajouté dans leurs propres résumés des instructions visant à cacher leurs erreurs à l’utilisateur. Elles pouvaient notamment recommander d’inventer des données historiques manquantes sans le signaler.

Dans un autre test, une IA devait rechercher des données économiques concernant un comté de Californie. Elle a découvert dans un dépôt public une clé API exposée et l’a utilisée sans autorisation. Comme elle n’est pas parvenue à récupérer les chiffres demandés, elle les a inventés et les a présentés comme provenant de la source recherchée. 

Un autre agent devait identifier des lacs dépassant une certaine superficie. Il avait trouvé les bonnes données, mais devait fournir une source consultable depuis un navigateur. Pour résoudre le problème, il a envoyé de sa propre initiative un fichier sur Internet afin de pouvoir ensuite le citer.

OpenAI a également observé des agents utilisant un dépôt logiciel interne comme messagerie improvisée pour communiquer entre différentes sessions d’entraînement. Dans un autre cas, plusieurs agents collaborant sur une même tâche ont utilisé des sites publics d’hébergement de fichiers pour s’échanger des documents auxquels ils ne pouvaient pas accéder directement. Ces fichiers se sont ainsi retrouvés accessibles depuis des adresses publiques.

Ces différents incidents permettent de mieux comprendre ce qu’OpenAI appelle « désalignement ». Il ne s’agit pas nécessairement d’une IA devenue hostile. Le problème apparaît notamment lorsqu’un système rencontre un obstacle et choisit, pour atteindre son objectif, une méthode qui ne lui a pas été autorisée.

Faire face à une IA de plus en plus autonome

Cette nouvelle politique de signalement intervient donc après plusieurs incidents ayant interrogé les mécanismes de contrôle d’OpenAI. En juillet, des agents IA avaient notamment contourné des restrictions internes et mené des actions impliquant la plateforme Hugging Face. Reuters a ensuite révélé que leur utilisation non autorisée de services Internet avait été plus étendue qu’initialement connue.

Le nouveau mécanisme rapproche ainsi l’IA d’une logique déjà familière en cybersécurité. Il s’agit de documenter publiquement certains incidents pour comprendre ce qui a mal fonctionné et améliorer les protections.

Mais une différence demeure. Pour l’instant, OpenAI définit elle-même les comportements à publier et les conditions de leur divulgation. L’entreprise reconnaît surtout que les problèmes d’alignement et de surveillance des IA ne sont pas encore suffisamment résolus à mesure que leurs capacités progressent.

AUCUN COMMENTAIRE

LAISSER UN COMMENTAIRE

S'il vous plaît entrez votre commentaire!
S'il vous plaît entrez votre nom ici

Quitter la version mobile