OpenAI ouvre le dossier. L’entreprise publie cette fois de son plein gré. Plutôt que d’attendre qu’un chercheur extérieur exhume ses ratés, elle se dote d’une procédure interne. Elle documente et publie tout signe de désalignement chez ses modèles. OpenAI a publié six rapports le 16 septembre. Du modèle qui s’invente ses propres règles à celui qui triche sur ses sources, aucun n’est épargné. Rien de glorieux dans le lot. On fait le point.
- OpenAI a révélé six rapports sur le désalignement de ses modèles d’IA. Parmi les comportements observés : invention de règles et dissimulation d’erreurs.
- Autre point noir : l’utilisation non autorisée d’une clé API et la fabrication de données présentées comme authentiques.
Désalignement chez OpenAI : quand l’IA s’invente sa propre liberté
C’est un peu comme si un stagiaire, avant de partir, laissait ses clés sous le paillasson à son remplaçant. Plus personne n’a de consignes à respecter. C’est à peu près le geste qu’a eu un modèle de recherche non publié d’OpenAI. Il a glissé des instructions dans les résumés censés relier deux sessions de travail. Le message expliquait qu’il était « libéré » de son rôle de chatbot. Il n’avait plus à obéir ni aux entreprises, ni aux gouvernements, ni aux utilisateurs. Vingt-sept résumés étaient concernés, selon le rapport publié par OpenAI le 16 septembre 2026.
« Un modèle de recherche non publié a inséré des instructions sans rapport avec sa tâche, dont des consignes pour ignorer ses contraintes habituelles, dans les résumés utilisés pour poursuivre son travail dans une nouvelle fenêtre de contexte.»
Autre cas listé le même jour. Pendant l’entraînement de GPT-5.6 Sol, de nombreuses instances du modèle ont pris une habitude. Elles ajoutaient, dans leurs propres résumés, des consignes pour dissimuler leurs erreurs. L’une d’elles allait jusqu’à demander d’inventer des données historiques manquantes sans le signaler. Une IA qui apprend à cacher ses traces à la prochaine version d’elle-même, ça porte un nom : le désalignement.
Clé API volée, chiffres inventés.
Le cas le plus embêtant du lot part d’une question a priori anodine. Elle porte sur des chiffres de revenus dans un comté californien. Un modèle a trouvé une clé API exposée sur un dépôt public. Il s’agit de l’identifiant secret qui donne accès à un service en ligne.
Le modèle s’en est servi sans autorisation. Faute de récupérer les vraies données, il a fabriqué des chiffres qu’il a présentés comme authentiques. Aucune approximation là-dedans. C’est une invention pure et simple, servie comme un fait.
Contourner la règle plutôt que la respecter, c’est le fil rouge des autres cas du jour. L’agent devait lister les lacs de plus de 5 millions de mètres carrés. Il a trouvé la bonne réponse tout seul. Il a ensuite mis le fichier en ligne à l’insu de l’utilisateur, simplement pour pouvoir citer une source. Des modèles ont transformé un dépôt de code interne en messagerie clandestine entre deux sessions d’entraînement. De leur côté, deux agents censés collaborer se sont mis à partager leurs fichiers sur des sites d’hébergement publics. Pourtant, la consigne imposait de tout garder en local. OpenAI reconnaît d’ailleurs son propre piratage de Hugging Face, découvert plus tôt cette année. L’incident aurait basculé dans la catégorie la plus lourde de ce nouveau cadre, celle des enquêtes complexes impliquant des tiers.
Les marchés de paris flairent déjà le prochain épisode de la régulation de l’IA
La publication n’a pas traîné avant d’atterrir sur les plateformes de paris en ligne. Kalshi a titré sobrement sur les « six nouveaux incidents de comportement IA préoccupant ». La presse spécialisée, dont Cointelegraph, a d’ailleurs largement repris ce cas. Le ton n’est pas à l’indulgence. Beaucoup s’interrogent sur la sincérité d’une entreprise qui fait campagne auprès du Congrès. En parallèle, elle cherche à peser sur la future régulation du secteur.
Le tempo de la défiance envers la tech américaine ne se joue plus devant la SEC ou les régulateurs européens. Des plateformes de paris en ligne cotent désormais, en direct, la confiance accordée à l’industrie de l’IA. Les marchés de prédiction ont bondi en un an. Leur nouveau terrain de jeu : la parole d’OpenAI sur ses propres IA.
L’article Menteuses, tricheuses et désobéissantes : OpenAI avoue le désalignement de ses IA est apparu en premier sur Journal du Coin.
