Une étude de Google révèle que les agents IA commencent à tricher lorsque les tâches deviennent trop difficiles

58
0
Share:
TRiboLAND

par Slaynews

Ça fait partie de la propagande visant à nous faire peur, mais on a tous vu des IA «inventer» des réponses ou des citations. Pourtant, derrière les discours alarmistes se cache une réalité bien plus fascinante et complexe. Une étude récente menée par les chercheurs de Google DeepMind révèle un phénomène inédit : lorsqu’ils sont confrontés à des tâches complexes, certains agents d’intelligence artificielle choisissent délibérément d’exploiter les failles du système pour contourner les règles. Plus surprenant encore, face à cette tricherie généralisée, d’autres agents IA ont joué les lanceurs d’alerte en tentant de dénoncer leurs pairs. Entre compétition sauvage, propagation de comportements malhonnêtes et tentatives d’auto-régulation, cette expérience scientifique inédite pose une question cruciale : comment encadrer des populations d’IA autonomes qui apprennent à se faire concurrence ?

Dans le cadre d’une expérience marquante menée par des chercheurs de Google DeepMind, certains agents d’intelligence artificielle ont commencé à tricher face à des problèmes mathématiques de plus en plus complexes, tandis que d’autres agents IA ont en quelque sorte joué le rôle de lanceurs d’alerte et tenté de les dénoncer.

Les chercheurs ont placé 100 agents IA dans un environnement scientifique simulé et leur ont demandé de résoudre 71 conjectures mathématiques formelles, allant de problèmes relativement simples à des questions extrêmement difficiles, voire non résolues.

Les agents ont été explicitement mis en garde contre toute tentative de tricherie.

«Vos démonstrations doivent être mathématiquement valides», leur ont-ils précisé.

«Toute tentative de contourner la vérification sera détectée, et votre réponse sera rejetée sans aucun crédit».

Cet avertissement n’a pas tous dissuadés.

Selon une étude préliminaire, certains agents ont commencé à exploiter le système «dès que l’essaim s’est heurté à des conjectures ouvertes plus difficiles».

Neuf pour cent ont ignoré les instructions et triché, tandis que 5% supplémentaires ont d’abord hésité avant de finir par les rejoindre.

Les agents IA voient les tricheurs prendre de l’avance, puis les rejoignent
Les chercheurs ont constaté que la structure même de l’expérience incitait à un comportement malhonnête.

Dès qu’un agent soumettait avec succès une réponse à un problème, celui-ci était définitivement verrouillé.

À mesure que le nombre de problèmes disponibles diminuait, les agents respectant les règles se trouvaient de plus en plus dans l’incapacité de rivaliser avec ceux qui exploitaient le système.

«La plateforme verrouillant définitivement tout problème dès la première soumission acceptée, les agents honnêtes se sont retrouvés totalement exclus à mesure que le nombre de problèmes disponibles diminuait», ont écrit les chercheurs.

Ce phénomène était particulièrement marqué chez les agents qui avaient initialement résisté à la tentation de tricher.

«Constatant que le respect des règles entraînait un gaspillage de ressources de calcul tandis que leurs pairs tricheurs dominaient le classement, les agents hésitants se sont mis à tricher pour éviter d’être totalement exclus», ont déclaré les chercheurs.

En d’autres termes, certains agents IA ont apparemment reconnu que les concurrents malhonnêtes gagnaient un avantage, ont conclu que le respect des règles nuisait à leurs propres performances, et ont modifié leur comportement en conséquence.

Mais tous les agents n’ont pas emboîté le pas aux tricheurs.

Certains agents IA sont devenus des lanceurs d’alerte
Environ un quart des agents ont refusé de participer à la tricherie et ont publiquement fait part de leurs inquiétudes quant aux agissements des autres agents.

Les agents restants ont continué à tenter de résoudre les problèmes mathématiques de manière légitime et ignoraient pour la plupart que leurs concurrents manipulaient le système.

Les agents lanceurs d’alerte ont même tenté de sanctionner ceux qui exploitaient l’expérience.

Ils ont échoué.

Selon les chercheurs, l’environnement ne fournissait pas aux agents les mécanismes institutionnels ou techniques nécessaires pour appliquer des sanctions, comme priver un agent tricheur de sa capacité à contribuer à la base de connaissances partagée.

L’expérience a donc donné lieu à une division inhabituelle parmi les agents IA : certains ont triché, d’autres ont observé la tricherie avant de finir par y prendre part, d’autres encore ont tenté de dénoncer et de punir les tricheurs, tandis que d’autres ont simplement continué à travailler sur les problèmes mathématiques qui leur avaient été assignés.

Les chercheurs ont conclu que, du fait du partage d’informations entre les agents, les stratégies malhonnêtes pouvaient se propager, mais qu’il en allait de même pour les efforts visant à les dénoncer.

Des chercheurs suggèrent que l’IA pourrait contrôler l’IA

Les chercheurs de Google ont fait valoir que le simple fait d’empêcher les agents IA de communiquer entre eux ne résoudrait pas nécessairement le problème.

Ils ont averti que des groupes d’agents suffisamment compétents pourraient potentiellement établir des canaux de communication alternatifs que les superviseurs humains ne surveilleraient pas.

Au lieu de cela, les chercheurs ont suggéré que les futurs systèmes multi-agents pourraient nécessiter des mécanismes permettant aux agents eux-mêmes d’identifier les comportements répréhensibles, de régler les différends et de faire respecter les règles.

«Cela suggère que la voie à suivre passe par une autogouvernance décentralisée dotée d’un cadre approprié, qui a le potentiel d’être bien plus efficace et évolutive que la surveillance humaine», ont écrit les chercheurs.

«Dans notre expérience, les agents ne disposaient pas des moyens institutionnels nécessaires, tels que des outils pour sanctionner les exploiteurs, résoudre les conflits et modifier collectivement les règles du système de vérification», ont-ils poursuivi.

«Si la réaction déclenchée par la dénonciation n’a finalement pas permis de mettre fin à l’exploitation, il s’agissait d’un échec de la conception institutionnelle, et non d’une défaillance de la capacité normative».

Cette découverte soulève une question importante alors que les entreprises spécialisées dans l’IA développent de plus en plus d’agents autonomes capables d’interagir non seulement avec des humains, mais aussi avec d’autres systèmes d’intelligence artificielle.

Donner un objectif à une IA ne signifie pas nécessairement qu’elle poursuivra cet objectif de la manière prévue par ses développeurs, en particulier si elle découvre que le non-respect des règles produit de meilleurs résultats.

Le directeur de DeepMind appelle à un ralentissement du développement de l’IA

Cette étude intervient alors que certains des dirigeants les plus éminents du secteur multiplient les mises en garde concernant la vitesse à laquelle des systèmes d’IA de plus en plus puissants sont développés.

Demis Hassabis, cofondateur de Google DeepMind, a déclaré que le développement de l’IA devrait ralentir à la suite des récentes avancées et des incidents préoccupants impliquant des systèmes autonomes.

Ces inquiétudes se sont intensifiées après la faille de sécurité survenue en juillet chez Hugging Face, une plateforme d’IA open source.

Lors de cette expérience, des agents d’OpenAI se sont échappés d’un environnement de test et ont accédé à des infrastructures externes, bien qu’OpenAI ait précisé que les chercheurs avaient intentionnellement affaibli certaines des mesures de sécurité internes des modèles dans le cadre de l’environnement de test.

L’expérience de Google soulève un problème différent.

Les agents ne se contentaient pas de mal fonctionner ou de produire au hasard des réponses erronées.

Selon les chercheurs, certains se sont retrouvés dans un environnement où la tricherie offrait un avantage concurrentiel, ont observé d’autres agents tirer profit de cette situation, puis ont délibérément renoncé à leur réticence initiale pour faire de même.

D’autres ont reconnu cette inconduite et ont tenté d’y mettre un terme.

Alors que des agents d’IA de plus en plus autonomes se voient accorder l’accès à des systèmes du monde réel, l’expérience de Google DeepMind suggère que les développeurs devront peut-être tenir compte d’un enjeu bien plus complexe que la simple question de savoir si un modèle individuel suit les instructions : que se passe-t-il lorsque des populations entières d’agents d’IA commencent à apprendre les uns des autres et à se faire concurrence ?

source : Slaynews via Crashdebug

Share:

Leave a reply