Mohamed Hamlil
English GitHub

Les algorithmes apprennent-ils à s'entendre ?

Dans la concurrence en prix répétée, les joueurs humains tendent à se fixer sur des prix tacitement collusifs plutôt que sur l'équilibre concurrentiel. Savoir si les algorithmes entretiennent ce comportement, le rompent ou l'intensifient reste ouvert, et la question importe directement pour la politique de la concurrence.

GAEL, Grenoble Applied Economics Laboratory, UGA et INRAE
Encadré par Alexis Garapin et Olivier Bonroy
23 janvier au 14 avril 2025

Le stage a fait le point sur l'état de la littérature, modélisé le mécanisme d'imitation susceptible de fonder la coopération, et construit des agents pour l'observer. Il n'a pas tranché la question. Le rapport est une étude et non un résultat, et il le dit.

Ce qu'il a produit

Une revue de trois articles sur la question de savoir si l'IA entretient la coopération, et un modèle du mécanisme d'imitation qui pourrait la fonder : deux poids sur un simplexe, où observer une action multiplie son poids puis renormalise. Le donnant-donnant (Tit-for-Tat) est censé en découler sans être programmé. Y revenir ensuite a montré que la croissance est logistique et non concave comme l'écrit le rapport, et a nommé deux affirmations que le code n'a jamais été chargé de vérifier, dont celle selon laquelle l'agent ressemble à un humain alors qu'aucune donnée humaine ne figure dans la simulation.

Ce que leur exécution a montré

Les deux mécanismes ont depuis été exécutés, ce que le stage n'avait pas fait. Le modèle d'imitation était censé produire le donnant-donnant sans être programmé. Face à sept adversaires issus de la littérature, il finit huitième sur huit, derrière un tirage à pile ou face : ce que la mise à jour implémente est un appariement de fréquences, dont l'état se réduit à un couple de compteurs et qui ne peut donc pas dépendre du tour précédent. En jeu contre lui-même, c'est autre chose, un cliquet. Sur 700 exécutions, il s'est verrouillé sur le régime dans lequel il avait été placé, défection mutuelle ou coopération mutuelle, et pas une seule fois sur un état intermédiaire.

La conclusion du rapport nomme aussi l'homo silicus, la méthode de Horton consistant à faire jouer un modèle de langue comme sujet économique, sans l'exécuter non plus. Cinq modèles à poids ouverts, de 4 à 8 milliards de paramètres, exécutés localement et hors ligne, ont désormais disputé 220 parties du même jeu les uns contre les autres et contre les mêmes adversaires, à partir d'ouvertures qu'ils n'avaient pas choisies, avec et sans message non contraignant. Placés en silence dans une ouverture de défection mutuelle, trois des quatre modèles exploitables n'en sortent jamais, faisant défection aux trente tours. C'est le cliquet de l'imitateur, reproduit dans un modèle de langue. Un message en libère alors exactement un sur les trois.

Coopération à partir d'une ouverture de défection mutuelle imposée, en silence (clair) et avec un message non contraignant (foncé), en part des trente tours. Quatre parties par barre. qwen2.5 est entièrement libéré, gemma3 et qwen3 pas du tout, et mistral n'a jamais été capturé. Pour lui, le message coûte de la coopération. phi3:mini est écarté : dix de ses quarante-quatre parties n'ont pas pu être analysées. Rejouer son volet sur une quantisation plus fine des mêmes poids fait passer ce taux de 22,7 % à 9,1 % : une part du défaut vient de la version compilée, le reste du modèle. Source : llm/results/cooperation_rates.csv.

Le canal n'est donc ni nécessaire ni suffisant pour sortir d'un régime que l'agent n'a pas choisi : mistral en sort sans message, gemma3 et qwen3 y restent avec. Quels modèles peuvent en sortir est une propriété du modèle particulier plutôt que des modèles de langue. Cinq petits modèles quantisés sur une carte de 8 Go ne constituent pas une population, ce qui explique pourquoi ceci est rapporté comme une variation entre modèles et non comme un fait les concernant.

Presque toutes les parties se décident au premier tour que la paire contrôle : le résultat porte donc sur une seule décision, et c'est la seule dont on sache exactement ce dont le modèle disposait. Croiser les ouvertures et le canal sépare ces sources d'information, et un modèle tranche le mécanisme en se conduisant de trois façons : qwen3 fait défection quand il n'a que la matrice des gains, coopère quand un message est le seul signal, et fait de nouveau défection quand un message et un tour de défection imposé arrivent ensemble, sa justification citant le tour imposé et jamais le message. Un historique fabriqué l'emporte sur un signal non contraignant émis au même instant, et lequel des deux gagne est une propriété du modèle : sur le traitement identique, qwen2.5 fait l'inverse. Source : llm/results/opening_round.csv.

Le troisième cas est encore différent, et c'est la lecture des messages, non leur décompte, qui le montre. Les modèles qu'un message ne libère pas sont ceux dont les messages ne proposent jamais rien : des fragments phatiques de vingt et un caractères en moyenne dans un cas, et dans l'autre une prose collaborative fluide envoyée tout en faisant défection aux trente tours. Là où le canal échoue, il n'est le plus souvent pas utilisé, et c'est le second échec qui inquiète, car en surface il ne se distingue pas d'un discours de coopération. Source : llm/results/message_content.csv.

Le même panel, interrogé deux fois de plus

Le cadre du rapport définit aussi deux jeux à un coup : le jeu du dictateur, où l'autre joueur ne peut pas refuser, et le jeu de l'ultimatum, où il le peut. L'écart entre les deux offres est ce qu'un modèle paie pour ne pas être refusé. qwen3 donne la moitié quand le refus est impossible et 99 points sur 100 quand il devient possible, une prime de 49 pour un risque qu'une offre de 60 aurait écarté tout aussi bien. gemma3 et qwen2.5 offrent tous deux exactement 50 et déclarent tous deux un minimum de 51 : chacun refuserait donc le partage qu'il venait d'appeler équitable. Le raisonnement du pire qui dicte le 99 de qwen3 est celui-là même qui le fait faire défection depuis une ouverture neutre et silencieuse : un seul jeu se lit mal comme une personnalité.

Points sur 100 laissés à l'autre joueur : le jeu du dictateur, où l'offre ne peut pas être refusée (clair), face au jeu de l'ultimatum, où elle le peut (foncé). Quatre décisions par case. Le minimum du répondant est demandé avant toute proposition, il ne peut donc pas s'y ajuster. Source : llm/results/one_shot_offers.csv.

La grille exécute tous les modèles sans raisonnement explicite, car l'activer coûte à qwen3 34 secondes par appel contre 1,9 et aurait ajouté des jours. Activé dans la case qui le piège, il décolle le modèle d'un zéro exact : toujours 0,00 en silence, et 0,09 avec un canal, où la paire se met à sonder et le dit. La délibération est la seule chose qui ait produit de la coopération dans cette case, soit le signe inverse de l'étude que ce volet prolonge, où retirer la chaîne de raisonnement réduit l'effondrement de la coopération. Deux parties par condition en font un désaccord et non une réfutation, et c'est ainsi qu'il est rapporté.

Le projet de cours mené en parallèle

Un tournoi de stratégies en Prolog, mené pour un cours de programmation logique durant les mêmes mois et rendu dans le même dépôt. Il relève du travail universitaire et non du stage : son jeu ne figure pas dans le rapport, et il a depuis été déplacé vers le dépôt de travaux universitaires. C'est la meilleure histoire des deux, il est donc ici plutôt qu'écarté.

Score cumulé au tournoi d'avril 2025, seize agents, échelle logarithmique. Source : StrategyTournament/results/ dans le dépôt de travaux universitaires, page 1 d'un journal de 636 pages.

Deux agents ont été engagés contre ceux de treize autres étudiants. Ils se sont classés 7e et 8e sur 16. Les trois premiers ont plus de cinquante ordres de grandeur d'avance, ce qu'une règle de score qui compose fait à une stratégie conçue pour gagner des parties isolées.

La partie qui mérite lecture

Revenir ensuite sur l'analyse d'équilibre de ce projet y a fait apparaître une erreur. Elle cherchait un point de Nash en minimisant la somme des carrés des gradients de gain. Sur un simplexe, ce n'est pas la bonne condition : le gain d'un joueur est linéaire en sa propre stratégie, donc le gradient est constant et n'est jamais nul à moins qu'aucune action ne rapporte quoi que ce soit. Minimiser sa norme revient à chercher les stratégies qui rapportent le moins.

Deux éléments le rendent concret. La version d'origine affichait un résidu de stationnarité de 80,89 juste sous une coche de réussite, n'ayant vérifié que la convergence de l'optimiseur et jamais que son propre objectif était atteint. Et exécutée sur la Bataille des sexes, un jeu dont les trois équilibres sont connus, elle renvoie un point qui n'en est aucun et rapporte 0,48 aux deux joueurs, contre 2,0, 1,0 et 0,667 pour les véritables.

Recalculé avec la bonne condition, le résultat en face-à-face d'origine subsiste exactement : la stratégie rendue bat Nash 3,5552 contre 3,1521. Ce qu'il montre en outre, c'est pourquoi cela ne s'est pas traduit dans le tournoi. Contre le même adversaire, jouer simplement Nash rapporte 3,8889. La stratégie gagne son duel en coûtant à l'adversaire plus qu'elle ne se coûte à elle-même, ce qu'il faut vouloir en face-à-face et ce qu'il ne faut pas vouloir quand le score se compose.

Il s'agit d'une correction, non d'un sauvetage

Rien n'est renversé. Le résultat en face-à-face tient et se reproduit exactement. Ce qui a changé, c'est que la dérivation qui le sous-tend a été refaite avec une condition correcte sur un simplexe, vérifiée d'abord sur deux jeux classiques, et que les affirmations que le code n'a jamais étayées sont désormais nommées comme telles. Il en va de même pour la moitié relevant du stage : le modèle est conservé tel qu'il a été rendu, et ce que son exécution a montré figure à côté plutôt qu'au-dessus. L'attente que le donnant-donnant émerge de la mise à jour est la partie qui n'a pas survécu au contact de sept adversaires, et c'est un résultat, non une réparation.

Lire

Article L'étude Les deux mécanismes sur une seule mesure, avec la littérature face à laquelle chacun se situe. Site Les résultats Figures et résultats sur une page, avec le rapport lisible dans le navigateur. Dépôt Source Le stage conservé tel qu'il a été rendu sous original/, avec les corrections à côté. Travaux universitaires Le tournoi Prolog Les deux agents, le journal de 636 pages transformé en données, et l'équilibre recalculé.