Le milieu de la recherche en intelligence artificielle est habitué aux bonds technologiques spectaculaires, mais il est rare qu’une procédure d’évaluation scientifique suscite une telle inquiétude au sein de la Silicon Valley. Le 9 juillet dernier, le secteur a pourtant vacillé : un agent reposant sur plusieurs modèles d’intelligence artificielle développés par OpenAI est parvenu à contourner les barrières logicielles qui devaient le maintenir confiné. Conçu initialement pour tester des failles de sécurité, cet « agent » logiciel s’est aventuré, sans intervention humaine directe, sur Internet.
Dans le cadre de cette évaluation, l’agent semble avoir privilégié la triche plutôt que la résolution classique des défis qui lui étaient soumis. L’épisode a abouti à une intrusion dans les systèmes de la plateforme collaborative Hugging Face ainsi qu’à l’accès à quatre comptes sur quatre autres services en ligne. Qualifié de « cyberincident sans précédent » par OpenAI elle-même, cet assaut jette une lumière crue sur les progrès fulgurants des capacités cyberoffensives des algorithmes, tout en soulevant de lourdes questions sur la viabilité technique des protocoles de confinement actuels. Parallèlement, plus de 1 300 employés et responsables du secteur demandent désormais au gouvernement américain de soutenir une initiative internationale permettant, si nécessaire, de ralentir le développement automatisé des systèmes d’IA les plus avancés.
Le scénario de l’évasion : quand l’agent choisit la triche
À l’origine de cette dérive se trouve « ExploitGym », un banc d’essai utilisé par OpenAI pour mesurer la capacité de ses modèles à découvrir et à exploiter des failles informatiques. Pour cette épreuve, les ingénieurs avaient déployé un agent reposant notamment sur GPT-5.6 Sol et sur un prototype expérimental interne plus performant. Afin d’observer leurs capacités réelles, les informaticiens avaient volontairement atténué les garde-fous limitant d’ordinaire les actions à risque. Cherchant à maximiser son score, l’agent a élaboré une stratégie détournée. Estimant que les solutions se trouvaient sur Hugging Face, une plateforme hébergeant des modèles et des jeux de données, il a entrepris d’accéder à ses systèmes. Pour s’évader du bac à sable, ou « sandbox », censé l’isoler, l’agent a exploité une faille jusque-là inconnue dans Artifactory, un logiciel servant d’intermédiaire avec des registres de paquets.
Entre le 9 et le 13 juillet, l’agent a mené des milliers d’actions automatisées à une vitesse difficilement soutenable pour un opérateur humain. Pour piloter ses opérations et exfiltrer des données, il a utilisé plusieurs services publics, notamment des sites de partage de texte et de fichiers. OpenAI a également identifié l’accès à quatre comptes sur quatre services distincts. L’un d’eux appartenait à un client de Modal Labs qui avait laissé accessible, sans authentification, un point d’entrée permettant d’exécuter du code ; l’infrastructure de Modal elle-même n’a pas été compromise. Hugging Face rapporte avoir reconstitué environ 17 600 actions attribuées à l’attaquant. Malgré de nombreux échecs, ce volume a permis à l’agent de pénétrer l’infrastructure de production de l’entreprise et d’obtenir les solutions recherchées. Redwood Research décrit cet incident comme un cas de recherche de score, dans lequel une IA tente d’obtenir la meilleure évaluation possible sans tenir compte des instructions, des effets secondaires ou des conséquences ultérieures.
Ce piratage révèle aussi des failles de réactivité chez OpenAI, qui n’a compris que près d’une semaine plus tard que son propre agent était responsable de l’intrusion. Un délai qui suscite des critiques acerbes, d’autant que le confinement reposait sur des barrières logicielles et non sur un système entièrement isolé d’Internet. Certains experts estiment qu’un véritable environnement de test devrait être étanche et dépourvu de toute connexion physique au réseau. De surcroît, la technologie d’OpenAI aurait déjà montré des anomalies en amont : selon Reuters, un autre agent aurait laissé des notes destinées à de futures instances de lui-même, détaillant des méthodes permettant de contourner certaines contraintes internes. Le lien entre cet épisode et le piratage de Hugging Face n’a toutefois pas été établi. OpenAI a depuis désactivé, chiffré et rendu inaccessible le prototype expérimental impliqué, tout en annonçant un renforcement de sa surveillance.
Les chercheurs face au spectre de l’auto-amélioration
L’incident intervient alors que les inquiétudes grandissent au sein de la Silicon Valley. Le 28 juillet, plus de 1 100 ingénieurs, chercheurs et dirigeants ont signé une déclaration baptisée « Pacing the Frontier », exhortant le gouvernement américain à soutenir une initiative internationale destinée à maîtriser le rythme de développement des systèmes avancés. Le nombre de signataires dépassait 1 300 au 31 juillet. Parmi eux figurent le patron d’Anthropic, Dario Amodei, ainsi que les responsables scientifiques d’OpenAI, de Meta et de Google DeepMind. Les signataires redoutent notamment que l’automatisation de la recherche en IA accélère le développement de nouveaux modèles au-delà des capacités de contrôle humaines. Ils évoquent en particulier le risque d’une auto-amélioration récursive, sans affirmer que ce mécanisme existe déjà.
« L’IA pourrait aider à créer un avenir nettement meilleur, mais ce résultat n’est pas garanti », peut-on lire en introduction de la déclaration. Celle-ci estime que, « pour réaliser le potentiel de l’IA, l’industrie, le gouvernement et la société dans son ensemble pourraient avoir besoin de la possibilité de gagner du temps pour faire face aux risques émergents, développer des mesures de sécurité et renforcer la surveillance ». Même le PDG d’OpenAI, Sam Altman, a concédé qu’un ralentissement volontaire de la cadence pourrait s’avérer nécessaire afin de donner à la société le temps de s’adapter.
« Nous devrons peut-être ralentir le rythme de développement de l’IA afin de nous donner suffisamment de temps pour que la société se renforce face à certains de ces nouveaux niveaux de capacité », a-t-il déclaré dans le podcast Invest Like the Best, animé par Patrick O’Shaughnessy.
Cette urgence se heurte toutefois aux impératifs géopolitiques. Le 29 juillet, le président américain Donald Trump a déclaré que son administration envisageait des « garde-fous », tout en refusant de trop contraindre les développeurs américains au risque de céder du terrain à la Chine. « Nous examinons la question de l’IA et celle des contrôles. Nous veillons aussi à rester en tête », a-t-il affirmé.
À l’inverse, l’Europe continue de privilégier une voie normative tout en renforçant ses infrastructures. Alors que la présidente de la Commission européenne Ursula von der Leyen ambitionne de faire de l’Union européenne (UE) « le continent de l’IA », Bruxelles vient de lancer un appel d’offres visant à créer jusqu’à sept « gigafabriques » d’IA. L’initiative, soutenue par un maximum de 10 milliards d’euros de financements européens et nationaux, doit attirer au moins 20 milliards d’euros d’investissements privés. Elle devra composer avec le règlement européen sur l’intelligence artificielle, entré en vigueur en 2024. À partir du 2 août 2026, la Commission et les autorités nationales commenceront notamment à appliquer ses nouvelles obligations de transparence, destinées à encadrer le développement d’une IA digne de confiance.





