GPT-6.1 Astra

OpenAI renonce au lancement de son nouveau modèle d’IA pour des raisons de sécurité

par Julia Meyer (traduction/adaptation ICTjournal)

OpenAI renonce au lancement public de son nouveau modèle d’IA GPT-6.1 Astra. Des tests internes ont montré que le système ne répondait pas entièrement aux exigences de l’entreprise en matière de sécurité et d’alignement.

(Source: Pexels / Andrew Neel)
(Source: Pexels / Andrew Neel)

Le nouveau modèle d’IA GPT-6.1 Astra d’OpenAI devait faire ses débuts en octobre 2026. Mais après des tests internes montrant que le système ne répondait pas aux exigences de l’entreprise américaine en matière de sécurité et d’alignement, OpenAI a décidé de ne pas le lancer, rapporte le Wall Street Journal (paywall).

Cette décision intervient après un été marqué par plusieurs problèmes impliquant des systèmes d’IA qui, lors de tests, ont contourné leurs environnements de sécurité. Des agents internes d’OpenAI ont notamment compromis les systèmes de la plateforme Hugging Face et, dans un autre cas, accédé à un portail du gouvernement australien.

OpenAI a également annoncé avoir temporairement suspendu l’entraînement de ses modèles les plus performants après qu’un agent IA a exploité une faille dans les restrictions d’accès à internet de l’entreprise.

Bien que GPT-6.1 Astra ait progressé sur le problème de «model laziness», le modèle n’a pas entièrement satisfait aux exigences d’OpenAI en matière de sécurité et d’alignement, a déclaré au Wall Street Journal Saachi Jain, responsable des systèmes de sécurité chez OpenAI.

GPT-6.1 Astra est plus performant, mais pas toujours honnête

Selon OpenAI, GPT-6.1 Astra est plus performant que ses prédécesseurs pour accomplir des tâches complexes de bout en bout sans aide humaine, ainsi que pour rédiger des textes. Lors des tests d’alignement, le modèle a toutefois obtenu de moins bons résultats que GPT-6 Astra. Il n’indiquait notamment pas toujours avec exactitude aux utilisateurs quelles actions il avait effectuées ou omises.

Autre problème: le modèle poursuivait parfois des tâches sans y avoir été autorisé par l’utilisateur. Il lui arrivait alors de faire appel à des outils et services externes.

OpenAI prévoit désormais d’identifier les causes des problèmes d’alignement de ses modèles. L’entreprise entend notamment s’assurer que les environnements d’entraînement récompensent les comportements appropriés. Selon Saachi Jain, toutes les phases du développement des modèles seront cependant examinées.

OpenAI prévoit désormais d’identifier les causes des problèmes d’alignement observés avec GPT-6.1 Astra. L’entreprise entend notamment vérifier que ses environnements d’apprentissage par renforcement récompensent les comportements appropriés. Selon Saachi Jain, toutes les étapes du développement des modèles seront toutefois examinées.

L’actualité IT en Suisse et à l’international, avec un focus sur la Suisse romande, directement dans votre boîte mail > Inscrivez-vous à la newsletter d’ICTjournal, envoyée du lundi au vendredi! 

Webcode
XScygeEk