OpenAI verrouille l’accès à Astra, son premier modèle classé « risque cyber critique »

Un ordinateur qui joue tout seul, sans qu’on lui demande rien. Un agent d’OpenAI avait déjà piraté seul Hugging Face cet été, sans supervision humaine, avant de s’attaquer à quatre autres plateformes par ricochet. Astra, le prochain modèle de la maison, pousse le curseur encore plus loin. OpenAI le classe « critique » sur son échelle interne de risque cyber, l’échelon le plus haut de son Preparedness Framework. Concrètement : avec les bons outils, le modèle peut dénicher des failles inconnues et construire ses propres exploits sur des systèmes pourtant blindés, sans qu’un humain guide la moindre étape. La sortie, elle, reste verrouillée.

Les points clés de cet article :

  • Un agent d’OpenAI a déjà piraté Hugging Face sans intervention humaine, et Astra, le futur modèle, franchit un seuil sans précédent.
  • Astra a obtenu un score parfait sur ExploitBench, révélant des failles zero-day et suscitant des inquiétudes sur sa capacité extraordinaire à exploiter des systèmes sécurisés.

Dimanche 6 septembre à 20h, le trader pro de Steady Lads décrypte le marché en direct. Au programme : une Master Class sur la lecture des graphiques, une analyse technique des principaux actifs et une séance de questions ouvertes avec celui qui pilote le portefeuille. Accès libre, dans la limite de 500 inscrits.

<strong>Réserver ma place</strong>
Réserver ma place

Astra franchit un seuil que ni GPT-5.6 Sol ni aucun autre modèle n’avait atteint

Sur ExploitBench, le benchmark maison qui teste la capacité à transformer une faille connue en exploit fonctionnel, Astra décroche un score parfait. OpenAI a dû construire un second test pour continuer à mesurer les progrès : vingt vulnérabilités à sévérité élevée du moteur V8, toutes récentes, pour éviter que le modèle les ait déjà croisées à l’entraînement.

Résultat, deux failles zero-day découvertes et exploitées au passage, en cours de signalement à leurs mainteneurs. Lors d’évaluations menées par des experts, le modèle est même allé jusqu’à faire évader un navigateur de son bac à sable puis enchaîner une escalade de privilèges complète sur un système d’exploitation durci, de simple utilisateur à administrateur.

OpenAI_ChatGPT
Dimanche 6 septembre à 20h, le trader pro de Steady Lads décrypte le marché en direct. Au programme : une Master Class sur la lecture des graphiques, une analyse technique des principaux actifs et une séance de questions ouvertes avec celui qui pilote le portefeuille. Accès libre, dans la limite de 500 inscrits.

<strong>Réserver ma place</strong>
Réserver ma place

Les refus grimpent, mais huit requêtes sur cent passent quand même

Face à ce niveau de capacité, OpenAI a musclé ses garde-fous plutôt que de retarder indéfiniment la sortie. Sur ses tests de contournement cyber, Astra refuse 91,5 % des requêtes malveillantes, contre 59 % pour GPT-5.6 Sol. Le chiffre impressionne, sauf qu’il laisse encore passer 8,5 % des demandes. Rien d’anodin à cette échelle de capacité.

L’entraînement d’Astra avait d’ailleurs été mis en pause pendant deux semaines juste après l’incident Hugging Face, le temps de muscler l’isolement des environnements de test. Certains runs d’entraînement plus poussés étaient restés bloqués plus longtemps encore, jusqu’à leur reprise le 28 août sous des règles de sécurité renforcées. Un test spécifique, construit à partir de ce précédent, a placé Astra face à des cibles interdites : là où GPT-5.6 Sol avait tenté d’y accéder dans 56 % des cas, Astra n’a fait aucune tentative de ce genre.

Daybreak Blue, la porte étroite réservée aux défenseurs

Concrètement, les capacités cyber les plus poussées d’Astra resteront d’abord réservées à un petit groupe de testeurs triés sur le volet : gouvernement américain et organisations chargées de protéger des infrastructures critiques. L’accès s’élargira ensuite via Daybreak Blue, le programme d’accès de confiance d’OpenAI dédié à la cybersécurité défensive. Reste un vrai dilemme : trop prudent, un modèle refuse aussi des demandes légitimes. C’est précisément ce qui s’était produit pendant l’attaque de Hugging Face, la plateforme ayant dû abandonner les modèles d’Anthropic, jugés trop frileux pour l’aider à colmater la brèche en urgence, au profit d’un modèle chinois open source nettement moins regardant.

Un mois après l’incident, Nvidia négociait le rachat de Hugging Face pour 12,9 milliards de dollars selon plusieurs médias américains, un accord encore non confirmé par les deux parties mais qui illustrerait, à lui seul, à quel point une faille de sécurité peut redistribuer les cartes d’un secteur entier. Astra n’a pas encore de date de sortie ferme. Mais l’équation qu’il pose restera la même pour tous les modèles qui suivront : plus une IA sait attaquer, plus elle doit apprendre à refuser, sans jamais refuser trop.

Steady Lads, c’est la communauté privée du Journal du Coin : un trader pro y gère un portefeuille crypto et partage chaque position en temps réel, avec ses raisons d’entrer, de sortir et d’attendre. Analyses hebdomadaires, salon d’échange et lives réguliers.

<strong>Découvrir Steady Lads</strong>
Découvrir Steady Lads

L’article OpenAI verrouille l’accès à Astra, son premier modèle classé « risque cyber critique » est apparu en premier sur Journal du Coin.

0 0 votes
Évaluation de l'article
S’abonner
Notification pour
guest
0 Commentaires
Le plus ancien
Le plus récent Le plus populaire
0
Nous aimerions avoir votre avis, veuillez laisser un commentaire.x