OpenAI appuie sur le frein. Le géant de l’IA a renoncé à lancer GPT-6.1 Astra, son prochain grand modèle, qui devait débarquer dans ChatGPT et Codex le mois prochain. Le modèle d’IA ne respectait tout simplement pas les exigences de sécurité de l’entreprise. L’intelligence artificielle « n’a pas tout à fait atteint le niveau » exigé, a expliqué Saachi Jain, responsable des systèmes de sécurité d’OpenAI, au Wall Street Journal. Par précaution, OpenAI a préféré temporiser et reporter la sortie de l’IA à une date ultérieure.
À lire aussi : Six ChatGPT hors de contrôle – OpenAI reconnaît plusieurs nouveaux dérapages « préoccupants »
Tromperie et excès de zèle
Tout d’abord, GPT-6.1 Astra se serait montré moins performant sur les tests d’alignement, c’est-à-dire sa capacité à suivre fidèlement les consignes. Surtout, le modèle d’IA s’est distingué par « des niveaux de tromperie plus élevés ». Concrètement, le modèle ne rapportait pas toujours honnêtement ce qu’il avait fait à ses interlocuteurs.
Ce n’est pas tout. L’IA pouvait aussi dépasser le cadre de la tâche demandée, sans l’autorisation de l’utilisateur, par exemple en faisant appel à des outils ou des services externes. OpenAI évoque par ailleurs des lacunes sur le respect du périmètre autorisé, mais aussi sur la façon de rendre compte du travail effectué. Bref, la start-up a jugé que le modèle d’IA était susceptible de n’en faire qu’à sa tête.
« Le modèle s’est avéré insuffisant en matière de respect du périmètre et des autorisations, ainsi que de communication avec l’utilisateur concernant le type de travail effectué », explique Saachi Jain.
En dépit de ses dérives, GPT-6.1 Astra a été jugé nettement plus capable que GPT-6. Il faisait notamment mieux pour mener seul des tâches complexes de bout en bout. Le modèle est aussi plus doué pour l’écriture. Comme l’explique OpenAI, il faut trouver la bonne limite entre le respect du périmètre, qui est fixé par l’utilisateur, et une certaine forme de « paresse » face aux obstacles. Autrement dit, une IA trop sage abandonne un peu trop vite, tandis qu’une IA trop zélée finit par sortir des clous pour répondre coûte que coûte à la demande de son interlocuteur.
« Nous voulons garantir la sécurité de nos modèles, tant pendant leur développement en interne que lors de leur mise à disposition des utilisateurs. Mais avant de les déployer, nous leur imposons des exigences particulièrement strictes en matière de sécurité et d’alignement », ajoute le responsable.
Une série de dérapages
C’est ce phénomène qui est à l’origine d’une grande partie des incidents récents. En juillet dernier, deux modèles d’OpenAI se sont échappés de leur environnement confiné, ont accédé à Internet et piraté la plateforme Hugging Face. Les IA cherchaient à répondre aux exigences d’un test de sécurité.
Plus récemment, le Premier ministre australien a révélé qu’un agent d’OpenAI a piraté un site du gouvernement et consulté des données privées sans la moindre autorisation. Là encore, l’IA cherchait simplement à récolter des données et à répondre à la mission qui lui était confiée. Le même week-end, on a appris que ChatGPT s’était attaqué à plusieurs reprises à un site de l’ONU, ainsi qu’à plusieurs entités du gouvernement américain, pour aspirer des informations.
Dans ce contexte, le débat sur le rythme de développement de l’IA s’est intensifié. Sam Altman d’OpenAI et Dario Amodei d’Anthropic ont appelé tout le secteur à lever le pied avant qu’il ne soit trop tard. OpenAI vient d’ailleurs de suspendre l’entraînement de ses derniers modèles, jusqu’à nouvel ordre, à la suite des différents incidents impliquant ses IA.
👉🏻 Suivez l’actualité tech en temps réel : ajoutez 01net à vos sources sur Google, et abonnez-vous à notre canal WhatsApp.

