Text
                    • t
Manuel et exercices corrigés
• •
r. i •! ••
iltl»
e - If I


Introduction à la théorie des jeux
Tout le catalogue sur www.dunod.com DUNOD ÉDITEUR DE SAVOIRS
Introduction à la théorie des jeux Murât Yildizoglu 2e édition DUNOD
Le pictogramme qui figure ci-cantre mérite une explication. San abjet est d'alerter le lecteur sur la menace que représente paur l'avenir de l'écrit, particulièrement dans le domaine de l'édition technique et universitaire, le développement massif du phatocapillage. Le Cade de la propriété intellectuelle du 1er juilletl 992 interdit en effet expressément la photocopie à usage collectif sans autorisation des ayants droit. Or, cette pratique s'est généralisée dans les établissements DANGER d'enseignement supérieur, provoquant une baisse Drutale des achats de livres et de revues, au point que la possibilité même pour les auteurs de créer des œuvres nouvelles et de les faire éditer correctement est aujourd'hui menacée. Naus rappelons donc que faute reproduction, partielle au totale, de la présente publication est L£ PHOTOCOPULAGEI interdite sans autorisation de TUE LE LIVREj l'auteur, de san éditeur au du Centre français d'exploitation du droit de copie (CFC, 20, rue des Grands-Augustins, 75006 Paris). © Dunod, Paris, 2003, 2011 ISBN 978-2-10-055837-7 Le Code de la propriété intellectuelle n'autorisant, aux termes de l'article L. 122-5, 2° et 3° a), d'une part, que les «copies ou reproductions strictement réservées à l'usage privé du copiste et non destinées à une utilisation collective » et, d'autre part, que les analyses et les courtes citations dans un but d'exemple et d'illustration, « toute représentation ou reproduction intégrale ou partielle faite sans le consentement de l'auteur ou de ses ayants droit ou ayants cause est illicite »(art. L. 1224). Cette représentation ou reproduction, par quelque procédé que ce soit, constituerait donc une contrefaçon sanctionnée par les articles L. 335-2 et suivants du Code de la propriété intellectuelle.
I able des matières Avant-propos IX Première partie Premie* éléments 1. Introduction 3 I. Différents types de jeux 4 IL La question de la rationalité 6 III. Prérequis et plan de route 9 2. Jeux, stratégies et information 11 I. Définition et représentation des situations d'interaction 12 II. Représentation de l'information 16 III. Définition des stratégies 18 IV. Solutions et équilibres d'un jeu 23 Deuxième partie Les jeux non coopératifs avec information complète 3. Équilibre de Nash (1951) 35 I. Fonctions de meilleures réponses et équilibre de Nash 38 II. Insuffisances de l'équilibre de Nash 43 III. Application : le modèle de Hotelling 49 IV. Application : le problème de l'entrant potentiel 53 4. Dynamique et rétroduction 61 I. Sous-jeux et équilibre parfait en sous-jeux (EPSJ)-Selten (1975) 62 II. EPSJ et crédibilité des menaces 66 III. Paradoxes de la rétroduction 68 IV. Application : une taxinomie des stratégies d'investissement 70 Table des matières • V
5. Jeux répétés 85 I. L'idée de base 85 II. Émergence de la coopération : le théorème folk 88 III. Observations imparfaites 94 IV. Application : l'émergence du cartel 95 V. Application : qualité des produits et réputation 98 6. Jeux de négociation 109 I. Négociation avec propositions alternées 110 II. Application : la paillote du Soleil 114 III. Stratégies pour affaiblir l'autre partie 115 Troisième partie Jeux non coopératifs avec information incomplète 7. Jeux simultanés avec information incomplète 121 I. Le rôle de la Nature 122 II. Application : le duopole de Cournot sous information incomplète 123 III. Équilibre de Nash bayésien 126 8. Jeux séquentiels avec information incomplète 137 I. La perfection en sous-jeux devient insuffisante 138 II. Équilibre bayésien parfait 141 III. Application : retour au jeu de l'entrée 142 Quatrième partie Jeux evolutionnaires 9. Une approche alternative : équilibres evolutionnaires 157 I. Stratégies, mutations, sélection 159 II. Stabilité évolutionnaire 160 III. Règles de comportement et dynamique de réplication 163 Bibliographie 171 Index 173 VI • INTRODUCTION À LA THÉORIE DES JEUX
A Edith, Elsa-Nuray et Romain pour leur patience et leur amour
/tvant-propos Cet ouvrage s'adresse à toute personne désirant s'initier à la théorie des jeux. Il a été conçu de manière à compléter l'ensemble des ouvrages déjà existants en français. En effet, pendant la préparation d'un premier cours de théorie des jeux dans mon université, je me suis rendu compte que les ouvrages existants ne facilitaient pas cette tâche. Il existe bien sûr d'excellents ouvrages mais soit ils sont trop complets, avec une structuration assez peu adaptée aux contraintes académiques françaises, soit ils se limitent à une simple introduction au domaine, soit ils couvrent au contraire des besoins trop spécifiques. L'objectif de cet ouvrage est de fournir une base facile à utiliser pour un premier cours de théorie des jeux dans les seconds cycles des filières d'économie et de gestion. Par conséquent, ce manuel propose une initiation rigoureuse à la théorie des jeux sans semer d'embûches mathématiques sur la route du lecteur. Une bonne connaissance des mathématiques et de la microéconomie, telles qu'elles sont enseignées dans le premier cycle des filières économiques est suffisante pour bénéficier pleinement de cet ouvrage car la compréhension de la majeure partie des concepts de la théorie des jeux demande avant toute chose un raisonnement logique, plutôt que des outils mathématiques très sophistiqués. Cet ouvrage ne vise pas à couvrir la totalité de la théorie des jeux. Néanmoins, dans une optique d'hypertexte, il propose des lectures complémentaires aux lecteurs qui désirent approfondir les concepts et les résultats mathématiques. Dans une approche qui allie la rigueur et la nature ludique de la théorie des jeux, chaque chapitre expose les concepts en se basant sur des exemples et des applications appartenant à un domaine de l'économie où l'introduction de la théorie des jeux a dramatiquement modifié les approches théoriques : l'organisation industrielle. Chaque chapitre est suivi d'un résumé des concepts étudiés et d'exercices corrigés. Un fichier Acrobat regroupant les transparents des principaux résultats et principales figures sera mis à la disposition des enseignants qui adopteront cet ouvrage pour leur cours. La totalité du manuel peut être enseignée dans le cadre d'un cours d'une quarantaine d'heures. Si l'enseignant a la possibilité de réserver les applications à des séances de travaux pratiques, l'ouvrage peut être couvert en une vingtaine Avant-propos • IX
d'heures. Sinon, avec les applications, les deux premières parties de l'ouvrage peuvent constituer la base d'un premier cours de théorie des jeux d'une vingtaine d'heures. La seconde édition apporte des corrections par rapport à la première édition, ainsi qu'un nouveau chapitre sur les jeux de négociation (chapitre 6) qui sont de plus en plus utilisés dans la modélisation économique des interactions sociales (y compris en macroéconomie). Il existe un site web dédié à cet ouvrage à l'adresse suivante : http://yildizoglu.xl0.mx/livretj/index.html où des éléments complémentaires seront mis à la disposition des lecteurs de cet ouvrage : - des exercices corrigés supplémentaires qui seront ajoutés dans le temps ; - des liens vers d'autres ressources disponibles sur Internet ; - des transparents pour les enseignants qui adopteront cet ouvrage. X • INTRODUCTION À LA THÉORIE DES JEUX
Première partie y Premiers éléments I. Introduction 3 2m Jeux, stratégies et information 11
i« Introduction La théorie des jeux est un ensemble d'outils analytiques qui ont été développés pour nous faciliter la compréhension des situations d'interaction entre des décideurs (agents, joueurs) rationnels. La concurrence que se livrent les firmes sur les marchés est typiquement une situation d'interaction. Pour cette raison, les stratégies des firmes et leurs conséquences quant à V organisation industrielle nous fourniront les principales applications des concepts développés. Mais le concept de jeu couvre une large gamme de situations : les jeux de société (les échecs, le poker...) ; les interdépendances entre les politiques nationales (coordination des politiques de relance en Europe...) ; la détermination des stratégies militaires (Sun-Tzu (1972), 400 AC) ; la détermination des cartes électorales... Par conséquent, on peut approcher la théorie des jeux de plusieurs points de vue, allant de la philosophie (politique) à la topologie différentielle. Cet ouvrage ne couvre pas toute cette gamme et prend le parti de présenter une vision relativement simple de la théorie des jeux dans le but de constituer une introduction aux principaux résultats et intuitions qu'on peut développer grâce à cette théorie. La première formulation cohérente d'un ensemble de résultats de la théorie des jeux date de la Seconde Guerre mondiale et nous la devons à John von Neumann et à Oscar Morgenstern (Von Neuman & Morgenstern (1944)). CALVIN AND HOBBES © 1991 Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved © 1993 Hors Collection/Presses de la Cité pour l'édition française. Figure 1.1 Le jeu selon Calvin et Hobbes... Introduction • 3
Les hypothèses de base de cette théorie sont les suivantes : - les décideurs sont rationnels et ils poursuivent des objectifs exogènes et indépendants ; - ils tiennent compte de la connaissance qu'ils ont ou des anticipations qu'ils font du comportement des autres décideurs (ils raisonnent de manière stratégique). Sur la base de ces deux hypothèses, la théorie des jeux propose des modèles qui sont des représentations très abstraites des situations réelles. La nature abstraite de ces modèles est aussi la source de leur généralité : ils couvrent ainsi une gamme très large de phénomènes. Par exemple, le concept d'équilibre de Nash (qui fera l'objet du chapitre 3), a été utilisé pour étudier la concurrence oligopolistique mais aussi politique. La théorie des jeux utilise les mathématiques pour exprimer formellement ses idées mais ces idées ne sont pas essentiellement mathématiques. La formulation mathématique est utilisée par commodité, dans le but de définir précisément les concepts, de vérifier leurs implications avec rigueur. Dixit & Nalebuf (1993), par exemple, exposent les concepts de base de la théorie des jeux de manière non formalisée. L'objet de cet ouvrage ne sera pas l'intérêt mathématique de la théorie des jeux mais son rôle dans la compréhension du comportement des décideurs stratégiques. I ■ Différents types de jeux Différents contextes d'interaction induisent différents types de jeux entre les agents. Mais le point commun de ces situations est la difficulté, pour la théorie économique, de prédire le résultat auquel elles vont aboutir. La théorie des jeux propose des prédictions basées sur les solutions du jeu concerné. Un jeu est une description de l'intérêt des joueurs et de l'interaction stratégique qui spécifie les contraintes qui pèsent sur les actions (stratégies) que les joueurs peuvent choisir. Une solution est la description systématique des situations qui peuvent émerger comme le résultat d'une famille de jeux. La théorie des jeux propose des solutions potentielles pour des familles de jeux et étudie leurs propriétés. Les différents contextes d'interaction peuvent être classés selon trois dimensions basées sur : - le type de relation entre les agents (coopératif vs. non coopératif) ; - le déroulement dans le temps (simultané vs. séquentiel) ; - l'information dont disposent les agents (information parfaite vs. imparfaite et complète vs. incomplète). 4 • PREMIERS ÉLÉMENTS
Ai Jeux coopératifs et jeux non coopératifs L'entité de base de la théorie des jeux est le joueur. Un joueur peut être interprété comme un individu seul ou un groupe d'individus prenant une décision. Une fois que nous avons défini l'ensemble des joueurs, nous pouvons distinguer deux types de modèles : les jeux dont les éléments de base sont les actions des joueurs individuels et ceux basés sur les actions jointes d'un groupe de joueurs. Les modèles du premier type sont appelés les jeux non coopératifs et ceux de second type, les jeux coopératifs. Les firmes composant un duopole de Cournot participent à un jeu non coopératif tandis que les firmes formant un cartel et donc maximisant leur profit joint, participent à un jeu coopératif. Cet ouvrage est consacré aux jeux non coopératifs et quand nous considérons la coopération, la question est celle de son émergence dans les jeux non coopératifs. D. Jeux simultanés et jeux séquentiels Nous pouvons aussi distinguer deux types de modèles en fonction de leur déroulement. Un jeu simultané (ou stratégique) est le modèle d'une situation où chaque joueur choisit son plan d'action complet une fois pour toutes au début du jeu. Par conséquent les choix de tous les joueurs sont simultanés. Ainsi, au moment de faire son choix, le joueur n'est pas informé des choix des autres. Un jeu séquentiel, au contraire, spécifie le déroulement exact du jeu ; chaque joueur considère son plan d'action non seulement au début du jeu mais aussi chaque fois qu'il doit effectivement prendre une décision pendant le déroulement du jeu. En général on représente les jeux simultanés sous forme d'un tableau (la forme normale du jeu). Cela convient surtout quand les stratégies des joueurs sont discrètes, sinon le duopole de Cournot aussi est un jeu simultané. Les jeux séquentiels sont en général représentés par un arbre du jeu qui permet la représentation complète de la structure et du déroulement du jeu. Nous allons néanmoins voir plus tard que cette distinction est loin d'être rigide et que nous pouvons utiliser l'une ou l'autre forme pour représenter tous les jeux. Ci Nature de l'information L'information dont on dispose chaque fois qu'on doit choisir une action est une dimension très importante des jeux. Elle possède une in.uence déterminante sur l'évaluation des stratégies par les joueurs et même sur leur perception des stratégies. Introduction • 5
L. On dit que Vinformation est parfaite si chaque joueur est paifaitementl ^informé des actions passées des autres joueurs. L'information est imparfaitej jÊau^nd un joueur ignore certains des choix qui ont été effectués avant le sieji^ Le jeu d'échecs est par définition un jeu à information parfaite puisque chaque joueur observe tous les coups joués. Le jeu de la Bataille Navale est à information imparfaite puisqu'on ignore l'emplacement choisi par l'adversaire pour chacun de ses navires. On utilise les ensembles d'information pour représenter l'information dont dispose chaque joueur chaque fois qu'il doit choisir une action. Dans les jeux simultanés, l'information est imparfaite par définition puisqu'on ne peut observer les choix des autres joueurs. Parfois certains joueurs peuvent même ignorer certaines composantes du jeu auquel ils jouent. Par exemple, dans un duopole de Cournot, les profits (donc les gains) peuvent dépendre d'un événement aléatoire influençant la demande. Un jeu est à information incomplète si au moins un des joueurs ne connaît^) s parfaitement la structure du jeu. Dans le cas contraire, il est à inform Les deux parties centrales de cet ouvrage vont suivre cette dernière distinction : la première partie sera consacrée aux jeux avec information complète tandis que la seconde proposera des solutions pour des jeux avec information incomplète. II. La question de la rationalité Ai Comportement rationnel Les modèles de la théorie des jeux supposent que les agents sont rationnels : chacun est conscient des alternatifs, fait des anticipations sur les éléments inconnus, possède des préférences claires et choisit délibérément son action après un processus d'optimisation. 6 • PREMIERS ÉLÉMENTS
En l'absence d'incertitude, les é éments suivants constituent un modèle de choix rationnel : Un ensemble d'actions, A, à partir duquel le décideur fait son'cfiôix'^^| £- Un ensemble des conséquences possibles, C, de ces actions ; f.- Une fonction de conséquence (résultat), g : A -> C, qui associe une conséquence à chaque action ; Une relation de préférence (une relation binaire transitive, réflexive) >: sur l'ensemble C. Parfois les préférences sont représentées par une fonction d'utilité, U : C -> M, qui représente une relation de préférence > par la condition suivante : x >z y si et seulement si U(x) ^ U(y). Étant donné un ensemble B ç. A d'actions réalisables dans un cas particulier, un décideur rationnel choisira une action a* qui est réalisable {a* g B) et optimal dans le sens que g(a*) >^ g(a) pour tout a g B. De manière alternative, il résoudra le problème suivant : maxU(g(a)). Une hypothèse dont dépend la validité d'un tel modèle de choix est que l'agent utilise les mêmes préférences quand il fait son choix dans différents ensembles B. Le comportement de nos joueurs sera donc tout à fait similaire à celui des agents de la microéconomie. Dans les modèles que nous allons étudier, nous serons souvent amenés à considérer des agents qui font des choix sous incertitude. Il peut arriver que les joueurs soient : - incertains quant aux paramètres objectifs de leur environnement ; - informés imparfaitement à propos des événements qui ont lieu dans le jeu ; - incertains quant aux actions des autres joueurs qui ne sont pas déterministes ; - incertains quant au raisonnement des autres joueurs. Pour modéliser les choix sous incertitude, la théorie des jeux utilise quasi- systématiquement les théories de Von Neuman & Morgenstern (1944) (VNM) et de Savage (1954). Dans ce cas, la fonction de conséquence est stochastique et connue par le décideur : pour tout a G A, la conséquence g (a) est une loterie (une distribution de probabilité) sur C. Alors le décideur est supposé se comporter comme s'il maximisait la valeur espérée d'une fonction (d'utilité de VNM) qui attribue un nombre à chaque conséquence. Si la relation stochastique entre les actions et les conséquences n'est pas donnée, le décideur est supposé se comporter comme s'il avait dans l'esprit une distribution de probabilité (subjective) qui détermine Introduction • 7
les conséquences de chaque action (extension de Savage). Dans ce cas le décideur est supposé se comporter comme s'il avait en tête : - un ensemble d'états co e £2, - une mesure de probabilité \x sur £2, - une fonction g : A x £2 -> C et - une fonction d'utilité u : C -> M : Il est alors supposé choisir une action a qui maximise la valeur espérée de u(g(a, co)) en fonction de la mesure de probabilité /x. Il faut néanmoins signaler que cette vision du décideur rationnel est largement critiquée aujourd'hui par les psychologues et économistes expérimentalistes. C'est la seule cohérente dont nous disposons aujourd'hui, même si elle limite sévèrement la validité des théories que nous allons étudier. D. Rationalité limitée Dans la vie, quand nous considérons des jeux, nous nous intéressons souvent à l'asymétrie entre les capacités des joueurs. Par exemple, certains joueurs peuvent mieux percevoir une situation ou avoir une capacité d'analyse plus forte. C'est typiquement la différence qui existe entre un ordinateur qui joue aux échecs et un joueur humain. Ces différences sont exclues de la théorie des jeux du fait de l'hypothèse de rationalité. Si tous les joueurs du monde étaient des décideurs rationnels, le jeu d'échecs n'aurait aucun intérêt. En effet nos agents rationnels se comportent plutôt comme un ordinateur qui joue aux échecs : l'ordinateur utilise la force brute et explore toutes les branches futures du jeu tandis qu'un joueur humain procède par une appréhension globale et intuitive de la situation. Or, les joueurs diffèrent du point de vue de leur connaissance du jeu et de leurs capacités d'analyse dans les jeux réels. C'est cela même qui fait l'intérêt des jeux que les sociétés humaines inventent. C'est seulement très récemment qu'on a commencé à tenter de modéliser des situations où la rationalité des agents n'est pas parfaite tandis que les travaux d'Herbert Simon (voir par exemple, Simon (1972)) ont souligné depuis longtemps la pertinence du concept de rationalité limitée (voir Nelson & Winter (1982), Kirman & Salmon (1995) pour des approches alternatives, Kahneman & Tversky (1982) et Rubinstein (1998) pour des tentatives d'axiomatiques nouvelles). Simon propose une vision très différente du comportement rationnel. Une vision dans laquelle les agents se contentent de leurs choix dès qu'ils leur permettent d'atteindre un niveau suffisant de satisfaction : c'est le principe de satisfaction (satisficing) de Simon. Cela explique notamment une certaine stabilité dans les comportements des agents qui ne répondent pas nécessairement à toute variation de leur environnement tant que la conséquence de cette variation reste limitée. 8 • PREMIERS ÉLÉMENTS
D'autre part, nous savons depuis Darwin qu'il existe, dans la Nature, une dynamique basée sur des mécanismes simples, dépourvus de rationalité propre et que cette dynamique conduit à des solutions relativement efficaces et stables étant données les conditions caractérisant chaque niche écologique : c'est la dynamique d'évolution. Ce mécanisme fascine depuis longtemps les chercheurs qui étudient la dynamique économique et, plus récemment, tout un domaine de la théorie des jeux s'est développé pour étudier les conséquences de ce type de dynamique : les jeux évolutionnaires. Nous consacrerons la dernière partie de cet ouvrage à ce type de jeux et les concepts de solutions qu'il propose pour les situations d'interaction. Prérequis et plan de route Il y a assez peu de prérequis pour cet ouvrage. Une maîtrise des outils mathématiques de base, de l'analyse et de l'algèbre telles qu'elles sont enseignées pendant les deux premières années des filières d'économie et de gestion, vous aidera certainement, mais l'outil que nous allons le plus souvent utiliser est le raisonnement logique. Vous aurez néanmoins souvent besoin des concepts de base en ce qui concerne l'optimisation et les probabilités. Les applications en organisation industrielle vont se situer dans la continuité du cours de microéconomie tel qu'il est enseigné pendant la seconde année des filières d'économie. Ce manuel s'insère dans un ensemble d'ouvrages de théorie des jeux en français. Plutôt que de reproduire les mêmes explications que ces ouvrages, l'auteur a choisi de leur faire appel quand ils proposent une explication particulièrement satisfaisante et complémentaire. Les ouvrages les plus sollicités ont été dotés d'une référence simplifiée : - [KB]Binmore(1999); - [GG] Giraud (2000) ; - [GU] Umbhauer (2002). La notation suivante est utilisée dans le texte pour indiquer des lectures complémentaires conseillées : fL £? [KB] Chapitres 0 et 1 fait référence ici à Binmore (1999), chapitres 0 et 1 (c'est ^^ une réelle suggestion par ailleurs). Les lecteurs intéressés peuvent aussi bénéficier de la lecture des trois ouvrages suivants : - Kreps (1999) ; - Kreps (1996) ; - Gremaq (1988) ; Introduction • 9
Plan de l'ouvrage : 1. Les concepts de base (chapitre 2). 2. Les jeux en information complète : après avoir considéré les principaux concepts d'équilibre (chapitres 3 et 4), nous nous intéresserons plus spécifiquement au rôle du temps dans les interactions (chapitre 5) et aux processus de négociation (chapitre 6). 3. Les jeux en information incomplète : les jeux statiques (chapitre 7) et les jeux dynamiques (chapitre 8). 4. Les jeux proches de la rationalité limitée : les jeux évolutionnaires (chapitre 9). Chacune des étapes sera accompagnée d'exemples et d'applications en organisation industrielle, ainsi que d'exercices corrigés. Les lecteurs qui désirent approfondir les questions abordées dans cet ouvrage pourront continuer leur lecture avec Kreps (1996). Kreps (1999) approfondit la ré.exion sur la nature de certains résultats forts et de certains paradoxes de la Théorie des jeux, ainsi que sur la cause de certaines de ses faiblesses. Osborne & Rubinstein (1994) et Fudenberg & Tirole (1991) sont dédiés à une présentation plus complète et aussi plus rigoureuse de la théorie des jeux non coopératifs. Osborne & Rubinstein (1994) contient aussi une dernière partie qui couvre les jeux coopératifs. Moulin (1979) et Myerson (1991) accordent une place plus importante aux jeux coopératifs. 10 • PREMIERS ÉLÉMENTS
2.1 eux, stratégies et information L'apport principal de la théorie des jeux en économie est la prise en compte et l'analyse des comportements stratégiques des agents. Plus spécifiquement, en organisation industrielle, la question principale à laquelle la théorie des jeux nous permet de répondre est la suivante : Quelle est la structure de marché qui résulte du comportement non coopératif des firmes? Le comportement des firmes est non coopératif dans la mesure où chaque firme prend sa décision de manière à obtenir la meilleure situation pour elle, sans aucune coordination avec les autres firmes. ^Concepts clés étudiés : ce chapitre définit les différents types de jeux et les concepts de stratégie pertinents pour ces jeux : - les jeux en forme normale ; - les jeux en forme extensive ; - les ensembles d'information ; - l'information parfaite/imparfaite ; - l'information complète/incomplète ; - les stratégies pures et mixtes pour la forme normale ; -les stratégies pures, mixtes, locales et comportementales pour la forme extensive ; - les stratégies équivalentes ; - l'élimination des stratégies strictement dominées. Jeux, stratégies et information • 11
I. Définition et représentation des situations d'interaction Les éléments qui caractérisent les jeux non coopératifs sont les suivants : - un petit nombre d'agents (les joueurs) qui interagissent ; - les décisions de chaque agent influencent les gains des autres ; - la prise en compte de l'information dont chaque agent dispose au moment de prendre sa décision ; - la prise en compte du déroulement des décisions dans le temps (décisions simultanées ou séquentielles). Les décisions simultanées sont en général représentées sous la forme d'un tableau (jeux en forme normale) et les décisions séquentielles, sous la forme d'un arbre de jeu (jeux en forme extensive). Ai La forme normale d'un jeu La définition d'un jeu en forme normale doit répondre aux trois questions suivantes : 1. Qui joue ? 2. Quelles sont les actions disponibles pour chaque joueur ? 3. Quelle est la valeur pour chaque joueur des différents résultats possibles du jeu? La définition suivante introduit ces composantes d'un jeu en forme normale. % définition 2.1 Un jeu en forme normale est décrit par les éléments suivants : Un ensemble de n joueurs : / = {1, 2, - Pour chaque joueur /, / e /, un ensemble de stratégies Sh qui contient!.) toutes les stratégies possibles de ce joueur. s{ e 5f- est une stratégie particu--| lière du joueur i. Par conséquent, 5; = {sj, .s-?,..., s/} si kf stratégies | sont disponibles pour le joueur /. Si chaque joueur / choisit une stratégie s,,., nous pouvons représenter le résultat (ou profil de stratégies) du jeu par uni vecteur qui contient toutes ces stratégies S = (s{,S2,.-,Sn) 12 • PREMIERS ÉLÉMENTS
Dour chaque joueur /, une fonction de gain, w,, qui représente les préfé- ? P rences (VNM) du joueur / en donnant la valeur pour le joueur / de chaque^ ^résultat du jeu : u^s). C'est un nombre réel : iij : S = X Si -> M /G/ ;-r- 5 = (j,, j2,j.-,,^i,) \-*.u;(s):. Précisons ces concepts à l'aide d'un premier exemple. ► Exemple 2.1 (le dilemme du prisonnier) Deux individus (Bonnie et Clyde) sont arrêtés par la police suite à un vol à main armée et ils sont enfermés dans deux cellules séparées sans possibilité de communication.Chaque individu est interrogé séparément et il a le choix entre nier d'avoir commis le vol (stratégie N) ou dénoncer son complice comme seul responsable (stratégie D). Nous avons donc un jeu non coopératif avec n = 2 joueurs, I = {1, 2} = {Bonnie, Clyde}. Uensemble de stratégies de chaque joueur est S\ = S2 = {N,D}. Chaque déroulement possible de ce jeu correspond au choix d'une stratégie par Bonnie et d'une stratégie par Clyde. Il y a donc 4 résultats possibles du jeu : (Sl=N9s2 = N),(N,D), (D,D), (D,N) -[ Les gains des individus (connus par eux, comme les autres éléments du jeu) représentent leur situation qui résulte des années de prisons auxquelles ils sont condamnés en fonction de leurs dépositions et ils sont négativement liés avec ces années : - Si Bonnie et Clyde dénoncent tous les deux, ils sont condamnés à 8 ans de prison. - S'ils nient tous les deux, ils auront 1 année de prison du fait d'absence de preuves accablantes. - Si un seul dénonce, il est relâché en récompense de sa coopération et l'autre est condamné à 10 ans de prison. Nous avons donc les gains (symétriques) suivants : ux(N,N) = u2(N,N) = -1, ul(N,D) = u2(D,N) =-10, ul(D,N) = u2(N,D) = 0, Ui(D,D) = u2(D,D) = -8. Nous pouvons alors représenter ce jeu en forme normale, sous forme d'un tableau où nous mettons les stratégies de Bonnie en ligne et celles de Clyde en colonne. Au croisement d'une stratégie de Bonnie avec une stratégie de Clyde nous avons un résultat du jeu et les gains correspondants. Jeux, stratégies et information • 13
Ces gains sont représentés par convention sous la forme d'un vecteur (wi, u2) où le gain du joueur qui est en ligne (ici Bonnie) apparaît en première place. Nous obtenons alors la forme normale qui est donnée dans le tableau 2.1. Tableau 2.1 Dilemme du prisonnier. N Bonnie D Clyde N D (-1,-1) (-10,0) (0,-10) (-8,-8) Le vecteur de gains (—1, —1) correspond alors (u^N^N), u2(N,N)). m > Remarque 2.1 Il ne faut pas confondre la stratégie d'un joueur individuel st et le résultat s qui est une combinaison particulière des stratégies de tous les joueurs. ■—>* Remarque 2.2 Dans notre définition de l'ensemble de stratégies, il y a un nombre fini k' de stratégies pour chaque agent mais en économie, les ensembles de stratégies sont en général continus et contiennent une infinité de stratégies possibles (choix de quantité, de prix, etc.). Ces jeux nécessiterons d'autres formes de représentation pour être analysés. - > Remarque 2.3 Les gains représentent en général des utilités ordinales et non des sommes monétaires. En organisation industrielle, néanmoins, les gains des firmes correspondent souvent à des profits. La formulation sous la forme d'un jeu permet de clarifier une situation conflictuelle. Il nous faut en plus comprendre à quel type de solution ce jeu peut nous conduire. Pour déterminer cette solution, nous allons étudier plus tard les équilibres du jeu. Nous allons maintenant introduire la représentation de la structure et du déroulement des jeux séquentiels. D. La forme extensive d'un jeu La forme normale est surtout - mais pas exclusivement - adaptée à la représentation des jeux simultanés. Selten (1975) a popularisé une représentation arborescente et plus intuitive des jeux : la forme extensive. Nous pouvons alors représenter des jeux séquentiels où les décisions sont prises à des moments différents et où chaque joueur peut être amené à jouer plusieurs fois. 14 • PREMIERS ÉLÉMENTS
► Exemple 2.2 (le problème de Ventrant potentiel) Considérons le problème d'entrée d'une nouvelle firme sur le marché d'un monopole. 1. L'entrant (E) doit choisir entre Entrer ou Ne pas entrer. 2. S'il entre, la firme installée (I) peut choisir de le Combattre en cassant les prix ou de Coopérer avec lui, de manière à créer un monopole joint. Nous pouvons alors représenter ce jeu sous la forme d'un arbre (figure 2.1). Entrer E Non (0,300) Coopérer (uE, ui) (40,50) Combattre^ (-10,0) Figure 2.1 Le Jeu de VEntrée I. Le premier nœud de cet arbre représente la décision du premier joueur. À la suite de chacun de ses choix, la possibilité est donnée au joueur suivant d'effectuer son choix. Une fois que tous les joueurs ont pris leurs décisions, on arrive à un résultat du jeu auquel les gains correspondants sont associés. Ainsi l'arbre permet-il de faire apparaître les gains associés aux différents résultats possibles. w éfinition 2.2 ¥: Un jeu en forme extensive est donné par un arbre de jeu contenant un \ I nœud initial, des nœuds de décisions, des nœuds terminaux et des branches\ pïeliant chaque nœud à ceux qui lui succèdent. |> |- Un ensemble de n ^ 1 joueurs, indexés par / = 1, 2,... n. Pour chaque nœud de décision, le nom du joueur qui a le droit de choisir^ une stratégie à ce nœud. $ |;- Pour chaque joueur /, la spécification de l'ensemble des actions permises à'|j chaque nœud où il est susceptible de prendre une décision. tSr La spécification des gains de chaque joueur à chaque nœud terminal., ^ Jeux, stratégies et information • 15
II. Représentation de l'information Parfois un joueur qui doit prendre une décision ne connaît pas les choix effectués par les joueurs qui ont joué avant lui. Dans ce cas, il ne connaît pas parfaitement le nœud auquel il se situe. Si à un moment donné, un joueur ne peut distinguer deux nœuds, nous dirons que ces deux nœuds appartiennent au même ensemble d'information. "^?<?5^ Définition 2.3 [ À chaque étape d'un jeu en forme extensive, on appelle un ensemble d'in- I formation (/*,) la collection de tous les nœuds que le joueur qui doit jouer à 1 cette étape (/) ne peut distinguer, compte tenu de l'information dont il dis- | pose. Chaque nœud contenu dans /z, contient alors exactement le même ensemble d'actions localement disponibles. On note par H, l'ensemble des» ^ensembles d'information du joueur/. , Dans l'arbre du jeu, on représente chaque ensemble d'information en reliant par une courbe en pointillé les nœuds qui appartiennent à cet ensemble. Clarifions tout de suite avec un exemple le sens de cette définition. Le jeu simultané du dilemme du prisonnier peut être représenté sous forme extensive en utilisant les ensembles d'information (figure 2.2). Comme il s'agit d'un jeu simultané, nous pouvons arbitrairement faire démarrer l'arbre du jeu soit par le choix de Bonnie (l'arbre (a)), soit par celui de Clyde (l'arbre (b)). Dans l'arbre (a), l'ensemble C = {CUC2} est l'ensemble d'information de Clyde qui résulte du fait qu'il ne peut observer le choix initial de Bonnie. Il ne peut dire par conséquent s'il doit faire face à une dénonciation par Bonnie ou non. On représente cet ensemble d'information par une ligne en pointillé qui B : Bonnie ; C : Clyde p Gains : (uB, uq) B (-1,-1) (-10,0) (0,-10) (-8,-8) (-1,-1) (-10,0) (0,-10) (-8,-8) (a) (b) Figure 2.2 Dilemme du prisonnier et ensembles d'information. 16 • PREMIERS ÉLÉMENTS
relie les deux sommets qu'il contient. De manière similaire, dans l'arbre (è), l'ensemble B = {Bu B2] est l'ensemble d'information de Bonnie. Nous avons alors un jeu en information imparfaite. définition 2.4 j , Un jeu en forme extensive est 1. un jeu avec information imparfaite si au moins un ensemble d'infor^ mation contient plus d'un nœud ; 2. un jeu avec information parfaite si chaque ensemble d'information est:| . réduit à un seul nœud. 1^1 Pour pouvoir analyser des jeux avec information imparfaite, nous devons adapter le concept de stratégie pour tenir compte de l'incapacité des joueurs à distinguer entre les nœuds d'un même ensemble d'information. définition 2.5 - ^Mv"-'*"*-' * is i '^ ■•■■■> '•'' -J *■ - ••■•"• -l-""r v--<W^ ''■ f-f Dans un jeu avec information imparfaite, chaque stratégie d'un joueur-/ |doit préciser une action à choisir pour chaque ensemble d'information de ce\ rjôueur. •■ , ., •.-■.... ■-..■■• Dans un jeu avec information parfaite, cette définition de la stratégie coïncide avec celle que nous avons déjà implicitement introduite, car dans ce cas, chaque ensemble d'information correspond à un nœud de décision du joueur. L'information imparfaite n'est pas le seul cas d'information partielle pour les joueurs. : '■'■ r&fltfff^p^ >éfinition2.6 r v - ^ - ^ " if Un jeu est à information incomplète si au moins un des joueurs ne connaît ■ |pas parfaitement la structure du jeu. Dans le cas contraire, il est à information Complète. , 'yj?('j| Nous allons revenir dans la seconde partie de cet ouvrage sur les problèmes liés à l'information incomplète de certains joueurs. ■ > Remarque 2.4 L'exemple du dilemme du prisonnier nous montre que plusieurs représentations en forme extensive peuvent correspondre au même jeu en forme normale. Nous devons maintenant définir plus précisément un des concepts clé de la théorie des jeux : la stratégie. Jeux, stratégies et information • 17
Définition des stratégies Jusqu'à maintenant, nous avons délibérément confondu les stratégies des agents avec leurs actions propres : dénoncer, combattre l'entrée... Cela est souvent vrai pour les jeux très simples mais la théorie des jeux est basée sur une représentation plus fine des stratégies des joueurs en fonction de la situation d'interaction et de la représentation retenue du jeu. De manière générale, une stratégie d'un joueur doit spécifier une action pour ce joueur chaque fois qu'il est susceptible de jouer (s'il joue, par exemple, à plusieurs tours du jeu, nous devons spécifier une action pour chacun des tours). Un profil de stratégies (appelé parfois résultat) spécifie un déroulement complet du jeu en précisant une stratégie par joueur. Quelle que soit la complexité du jeu,les stratégies des joueurs doivent nous permettre de dérouler complètement le jeu quand on les combine (on considère donc un profil de stratégies). Par conséquent,le concept de stratégie de la théorie des jeux est plus complet que celui du langage courant. Considérons une version plus détaillée du jeu de l'entrée afin de développer la définition des différents types de stratégies. ► Exemple 2.3 (Le Jus de l'entrée II) Prenons le jeu représenté dans la figure 2.3. Augmenter capacité il Produire (uE,Ui) —* (-50,40) Installer capacité Ei Non Produire Non (0,100) (-10,120) (50,60) Non -* (-10,100) Figure 2.3 Le jeu de Ventrée IL Il s'agit d'une analyse plus fine des interactions concernant le problème d'entrée sur un marché. Le jeu commence par la décision de l'entrant potentiel (E) : il doit choisir s'il met en place les capacités de production nécessaires à son entrée sur ce nouveau marché. Ayant observé cette décision, la firme installée (I) doit choisir si elle augmente ses propres 18 • PREMIERS ÉLÉMENTS
capacités de production ou non. L'entrant doit alors prendre sa décision de procéder effectivement à la production du bien ou non et cela, sans pouvoir observer la décision de la firme installée. Si E choisit dès le début de ne pas installer de capacités de production, le problème de l'entrée ne se pose plus et I garde son monopole. Or, même dans ce dernier cas, nous ne pouvons réduire la stratégie de E à Non (ne pas installer capacité) car cette stratégie ne spécifie pas ce que Efait à son ensemble d'information Ex. Or, comme nous l'avons vu, chaque stratégie d'un joueur doit préciser une action chaque fois que ce joueur est susceptible déjouer. Par conséquent, chaque stratégie de E doit préciser ici une action pour l'ensemble d'information E0 et une autre pour Ei : (Non /E0, Produire /Ex) est par exemple une stratégie complète même si elle correspond à des actions qui semblent être contradictoires. De la même manière, tout profil de stratégies doit préciser une action pour la firme I aussi même si elle n'a pas l'occasion déjouer effectivement une fois que E choisit Non en E0 et termine le jeu. Un profil de stratégies complet de ce jeu serait par exemple ((Non /E0, Produire /Ex), Non/I). Pourquoi se donner tant de mal ? En quoi la précision de Produire /E\ et de Non // est nécessaire dans le profil précédent puisque le jeu s'arrête après Non /E0 ? Deux raisons à cela : - Couvrir les possibilités d'erreur (de la firme E en E0) : pour évaluer ses choix, I aura besoin de connaître ce qui pourrait se passer dans la suite du jeu si E choisissait en E0, par erreur, Installer au lieu de Non et donner l'occasion déjouer effectivement à I. Pour déterminer sa stratégie, I aura donc besoin de connaître ce que fera E en Ex. - Permettre le test de l'optimalité des actions : pour trouver les solutions d'un jeu, nous supposerons par la suite que chaque joueur cherche la stratégie optimale pour lui. Or, l'optimalité d'une action dépendra de ce qui se passe dans la suite du jeu quand le joueur choisit une action alternative. L'optimalité de Non /E0 dépendra du résultat qu'on pourrait obtenir avec Installer /E0 mais aussi du choix en Ex. Remarquons aussi qu'en Ex nous n'avons besoin de spécifier qu'une seule action pour E même s'il joue à deux sommets. En effet, il ne peut distinguer ces deux sommets (ils appartiennent au même ensemble d'information Ex) et il ne peut que choisir la même action pour les deux sommets. Un tel profil de stratégies nous permet maintenant de dérouler complètement le jeu et de déboucher au nœud final où les gains des joueurs sont (0, 100). Ces précisions ne sont pourtant pas suffisantes pour caractériser toutes les situations. Les stratégies ne sont pas toujours composées d'actions pures comme nous l'avons considéré jusqu'à maintenant. En effet nous avons uniquement considéré des stratégies pures. Il existe d'autres types de stratégies basés sur le fait Jeux, stratégies et information • 19
que l'agent peut aussi utiliser une composition aléatoire d'actions (de stratégies pures) comme, par exemple, au tennis : 60 % de coups droits et 40 % de revers. On parle alors de stratégies mixtes. Les deux définitions suivantes précisent ces deux types de stratégies. efînition 2.7 Une stratégie pure du joueur / est un plan d'actions qui prescrit une action de ce joueur pour chaque fois qu'il est susceptible de jouer. On note par S, *'l'ensemble des stratégies pures du joueur / et par s, e Sj une stratégie pure de II e joueur. ... . v. , , péfinition 2.8 • • -MB }/■■ Une stratégie mixte du joueur / est une mesure de probabilités pf définie V's'ur l'ensemble de stratégies pures du joueur i. On note P( l'ensemble des stratégies mixtes du joueur /. /?, e Pi correspond donc à une stratégie mixte du H ^joueur i. ^ Dans les jeux en forme extensive, nous pouvons utiliser l'information dont nous disposons sur le déroulement du jeu pour construire des concepts de stratégie encore plus fins. iëRnition 2.9 t Stratégies dans un jeu en forme extensive : ^ Une stratégie pure du joueur / est une application Si qui attribue à chaque" | ensemble d'information du joueur / une action qu'il est susceptible de choi- f sir dans cet ensemble d'information. S, représente l'ensemble des stratégies \ pures du joueur /. } •-- Une stratégie locale du joueur / est similaire à une stratégie mixte, sauf (. qu'elle est définie au niveau d'un ensemble d'information, au lieu du jeu /.' global. Pour un joueur /, elle définit par conséquent, pour chaque ensemble f d'information /*, une mesure de probabilités sur l'ensemble des actions dis- ■ ponibles en cet ensemble d'information. On la note par nih (la stratégie locale du joueur / à son ensemble d'information h) et Uih est l'ensemble *" des stratégies locales de / pour l'ensemble d'information /?. ■■- Une stratégie comportementale du joueur / est un vecteur de stratégies i locales de ce joueur, contenant une stratégie locale par ensemble d'infor- |. mation de ce joueur. On la note par 71, et n,- est l'ensemble des stratégies,, comportementales du joueur i. ^ , -.,.■.. âJ 20 • PREMIERS ÉLÉMENTS
Les stratégies mixtes sont définies de la même manière que pour la précédente définition, une fois qu'on tient compte de la nouvelle définition de S,. Nous avons maintenant une batterie de concepts de stratégies pour décrire les différents types de jeux et les différents stades d'un jeu. Les stratégies pures et mixtes existent donc pour tout type de jeu, tandis que les stratégies locales et comportementales ne peuvent être définies que dans les jeux en forme extensive (car on a besoin de connaître le déroulement du jeu). À partir du jeu de la figure 2.3, page 18, nous pouvons déterminer les ensembles de stratégies des deux joueurs : Le joueur E possède deux ensembles d'information (E0 et Ex) et donc chacune de ses stratégies pures doit préciser une action en E0 et une autre en Ex : [(Installer/E0, Produire/Ex), (Installer/E0, Non/Ex), E ~ (Non/E0, Produire/Ex), (Non/E0, Non/Ex)} Le joueur / possède un seul ensemble d'information (/) et il dispose de 2 actions à cet ensemble d'information. Chacune de ses stratégies doit préciser une action différente en cet ensemble d'information : Sj = [Augmenter//, Non/I) = [Augmenter, Non) Nous pouvons utiliser ces stratégies pour représenter la forme normale de ce jeu (tableau 2.2). Tableau 2.2 La forme normale du jeu de l'Entrée IL {Installer!E0, Produire IE{) {Installer 1 £o, Non/E\ ) {Non/Eo, Produire/E[ ) {NonlE^NonlE{) I Augmenter Non (-50,40) (50,60) (- 10,120) (- 10,100) (0,100) (0,100) (0,100) (0,100) Les gains (—50,40) correspondent donc à uE((Installer, Produire), Augmenter) = —50 pour l'entrant potentiel et u{ ((Installer, Produire), Augmenter) = 40 pour la firme installée. ■—>* Remarque 2.5 Cet exemple montre qu'on peut représenter sous forme normale tout jeu sous forme extensive et cela, grâce à une définition précise des stratégies. Une stratégie mixte du joueur E va assigner des probabilités à chacune de ses stratégies pures pE(s) G [0, 1] avec 2>e(*) = 1 (2.D seSE Jeux, stratégies et information «21
Un exemple de stratégie mixte, pE est pE(Installer/E0, Produire/E\) = -; pE(Installer/E0, Non/Ex) = - ; pE(Non/E0, Produire/Ei) = -; pE(Non/E0, Non/Ex) = 0 ou, un autre exemple : pE(Installer/E0, Produire/Ex) = 1 qui correspond à la stratégie pure (Installer/E0, Produire/Ex) puisque les autres stratégies ont une probabilité nulle d'être jouées. On dit souvent que les stratégies pures sont des stratégies mixtes dégénérées. Jouer une stratégie mixte correspond donc à tirer au hasard une des stratégies pures en respectant la distribution de probabilités spécifiée par la stratégie mixte (comme si le joueur jetait un dé au début du jeu pour choisir ses actions effectives, ce dé étant pipé de manière à respecter les probabilités de la stratégie mixte utilisée). CALVIN AND HOBBES © 1989 Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved. © 1999 Waterson pour la traduction française. © 2000 Hors Collection pour l'édition française. Figure 2.4 Faut-il toujours mixer ?... [KB] Sections 2.1 et 2.2 pour les distributions de probabilités. Pour les stratégies locales, nous devons donc avoir nih(Si) £ [0, 1] avec !>„(*/) = 1 (2.2) Pour le joueur £, le profil de stratégies locales suivant forme un exemple de stratégie comportementale : en E0 : nEEo(Installer) = -, nEEo(Non) = - 1 3 en Ei : nEE. (Produire) = -, nEE. (Non) = - 1 4 ' 4 22 • PREMIERS ÉLÉMENTS
Une stratégie comportementale contient donc une distribution de probabilités (stratégie locale) par ensemble d'information du joueur. Les probabilités portent alors sur l'ensemble d'actions élémentaires contenues dans cet ensemble d'information. Il ne faut pas confondre cela avec une stratégie mixte qui contient une unique distribution de probabilités sur l'ensemble des stratégies pures du joueur et donc sur le déroulement total du jeu pour ce joueur. Ainsi, jouer une stratégie mixte revient à jouer une seule fois, quand chaque joueur fait son tirage au sort, au début du jeu. La stratégie pure qui résulte du tirage au sort détermine alors toutes les actions que le joueur va jouer pendant le déroulement du jeu. La stratégie comportementale représente au contraire le déroulement temporel du jeu. Chaque joueur fait un tirage au sort à chacun de ses ensembles d'information, une fois que cet ensemble est atteint. Pourquoi des stratégies mixtes ? - Généralisation des stratégies pures : les stratégies pures deviennent alors des stratégies mixtes dégénérées (le poids des autres stratégies pures étant nuls) car les stratégies mixtes couvrent un ensemble de possibilités plus large pour les stratégies. - Adaptation à certaines situations où il n'est pas optimal pour un joueur de s'engager à une action unique de manière certaine. Si vous jouez au tennis avec un partenaire dont la faiblesse est son revers, vous n'avez pas pour autant intérêt à jouer systématiquement sur son revers puisque vos balles deviendraient dans ce cas totalement prévisibles. - Qualités techniques : convexité et compacité des ensembles de stratégies. En effet, les stratégies mixtes projettent l'ensemble de stratégies pures sur l'intervalle [0, 1] et donc sur un ensemble fermé et borné (donc compact) et la manière dont on les construit (comme des combinaisons convexes) assure la convexité. Ces qualités auront leur importance quand on s'intéressera à l'existence des solutions pour les jeux. [GU] pages 41-47. IV. solutions et équilibres d'un jeu Parmi l'ensemble des résultats possibles nous devons déterminer ceux auxquels le jeu peut aboutir : les résultats d'équilibre. Nous pouvons alors prédire les situations auxquelles ce jeu pourrait conduire une fois que tous les ajustements entre les stratégies des joueurs {rationnels) ont eu lieu. La solution idéale correspondrait à un équilibre unique. Dans ce cas nous pouvons précisément prédire la solution de cette situation conflictuelle. Néanmoins on a souvent des équilibres multiples. Parfois il n'existe même pas d'équilibre. Introduisons une notation supplémentaire. Jeux, stratégies et information • 23
Notation 2.1. Considérons le profil de stratégies qui contient les stratégies de tous les joueurs sauf le joueur i. Nous pouvons alors le noter de la manière suivante : S-i = (^1,^2» •••» si-\> si+l> •••A)> «S-i £ X Oj Le profil de stratégies complet s correspond alors à s = (sh .?_/). Avant de chercher un équilibre d'un jeu, on peut essayer de simplifier ce jeu en éliminant des stratégies redondantes et/ou des stratégies ouvertement inférieures à d'autres. Ce type d'élimination simplifiera notre jeu et nous facilitera la recherche de solutions mais il ne faut pas oublier que toute élimination réduit nécessairement l'information qu'on représente dans le jeu. L'information qu'on élimine peut être sans importance avec certains concepts de solution mais elle peut aussi jouer un rôle important dans la détermination d'autres types de solution. L'élimination des stratégies doit donc être effectuée avec réflexion et soin. Ai Elimination des stratégies équivalentes Une première idée est d'éliminer certaines des stratégies qui semblent redondantes. On les appelle les stratégies équivalentes. On obtient alors une forme normale réduite du jeu. ^Définition 210 Deux stratégies st et s\ sont équivalentes si et seulement si, pour tout pro- } f fil de stratégies donné des autres joueurs, tous les joueurs obtiennent la même [' utilité quand / joue s{ ou s'; , ^ I, V/ g /, V.v_,- G S_f-, utsus-,) = ujis^). $ [&- Toutes les stratégies équivalentes à une stratégie st forment une classe^ pd'équivalence. •'"•© ^Définition 2.11 M £-.. La forme normale réduite d'un jeu s'obtient à partir de la forme normale.! j (initiale en remplaçant toutes les stratégies d'une classe d'équivalence par une ; ||seule stratégie. , , ,^ Si nous reprenons le jeu en forme normale de notre exemple (voir tableau 2.2, page 21), nous observons que toutes les stratégies du joueur E qui contiennent l'action Non/E0 sont équivalentes. En effet, toutes ces stratégies terminent 24 • PREMIERS ÉLÉMENTS
le jeu et donc le choix en Ex n'a plus vraiment d'importance les gains. Nous pouvons donc remplacer (Non/E0, Produire/Ex) et (Non/E0, Non/Ex) par (Non/E0) pour construire la forme normale réduite du jeu (voir tableau 2.3). Tableau 2.3 Élimination des stratégies équivalentes. (Installer /E0, Produire IE\ ) E (Installer/E0t Non/Ex) (Non/Eo) I Augmenter Non (-50,40) (50,60) (- 10,120) (- 10,100) (0,100) (0,100) Sans oublier le fait que nous perdons par cette élimination les choix possibles du joueur E en Êi, entre Produire et Non, et des erreurs qui peuvent accompagner ces choix (qui pourraient par exemple indiquer que E n'est pas très rationnel). Une autre simplification possible du jeu peut être basée sur une évaluation des stratégies. Du Elimination des stratégies dominées Certaines des stratégies des joueurs peuvent être globalement plus mauvaises que d'autres. On pourrait s'attendre à ce que ces stratégies ne soient jamais choisies par des joueurs rationnels. On peut alors choisir de les éliminer d'emblée du jeu. ;■"*&'.":%.->- ,'* : y^^.^^^^i^y^ rr* ^Définition 2.12 La stratégie p-x du joueur / est strictement dominée par la stratégie p\ si et: seulement si, quelque soit le comportement des autres joueurs, le joueur •i obtient avec pi une utilité strictement inférieure à celle obtenue avec p\ Wp_i e P_,, Uiipt, p-i) < Ui(pfn p-i) , La stratégie /;, est faiblement dominée par/?,' si l'inégalité est faible pour toutes les stratégies des autres joueurs et qu'il existe au moins un profil de stratégies des autres joueurs pour lequel l'utilité avec /?, est strictement inférieure à celle avec p\ Vp-t e P_,, Uj(pi, p-d ^ «,(/?;, p-i) ;..t«.v,x V, .-.V. et3P~i G P-i\Ui(Pi> P-i) < Ui(Pn P.-,/) \ -M.^.^V Dans notre exemple (voir tableau 2.2), la stratégie (Installer/E0, Non/Ex) est strictement dominée par (Non/E0, Produire/Ex) et par (Non/E0,Non/Ex). '4 Jeux, stratégies et information • 25
Par conséquent, le joueur E, s'il est rationnel, ne devrait jamais choisir la stratégie (Installer/E0iNon/Ei) en présence de la stratégie (Non/E0, Produire/Ei) ou (Non/E0, Non/Ei). En cumulant les deux types d'élimination, on obtiendrait le jeu réduit du tableau 2.4. Tableau 2.4 Le jeu réduit. {Installer IEq , Produire IEi ) E (Non/Eo) I Augmenter Non (-50,40) (50,60) (0,100) (0,100) Remarquons que nous ne pouvons encore prédire les résultats auxquels cette situation d'interaction peut conduire car la stratégie Augmenter de / n'est que faiblement dominée par sa stratégie TV (égalité si E joue (Non/E0)) et donc on ne peut être sûr que / choisira Non en présence de Augmenter. Pour aller plus loin dans la résolution du jeu nous devons introduire des concepts de solutions constructifs qui ne se contentent pas d'éliminer des stratégies. Cela fera l'objet de la première partie de cet ouvrage. 'TV [GU] pages 47-53 et [KB] pages 145-151. Remarquons néanmoins que dans notre exemple du dilemme du prisonnier : « . N Bonnie D Clyde N D (-1,-1) (-10,0) (0,-10) (-8,-8) N est strictement dominé par D pour les deux joueurs. L'élimination des stratégies strictement dominées nous conduit donc à la solution (D, D). Quand il existe et qu'il est unique, ce type de solution nous fournit une prédiction très claire et intuitive sur le résultat d'un jeu. En fait il est assez proche de la manière dont les acteurs économiques interagissent dans le monde réel. Malheureusement, ce type d'équilibre n'existe que pour très peu de jeux. ► Exemple 2.4 (La bataille des sexes) Paul et Jacqueline doivent décider comment organiser leur soirée. Ils ont le choix entre aller à un match de football (F) ou à Vopéra (O). Pour les deux, ce qui compte avant tout, c'est d'être ensemble. Néanmoins, Jacqueline a une préférence pour le football et Paul pour l'opéra... Le tableau suivant représente ce jeu. Les gains correspondent à des utilités. Nous donnons ce jeu en forme normale dans le tableau 2.5, page ci- contre. 26 • PREMIERS ÉLÉMENTS
Tableau 2.5 La bataille des sexes. o Paul F Jacqueline 0 F (2,1) (0,0) (0,0) (1,2) On appelle aussi ce type de jeu, un jeu de coordination. Par exemple les choix de standards de télévision ou de lecteur de disquette des Macs et des PCs correspondent à ce type de jeux.Chaque constructeur voudrait imposer son propre standard mais en cas de désaccord, les consommateurs pourraient refuser d'acheter le produit. Ce jeu ne comporte pas de stratégies dominées. Nous devons donc introduire un autre concept d'équilibre pour pouvoir prédire la solution de ce type de jeux. ^Exercices I Exercice 2.1 Papier-Ciseaux-Caillou I II s'agit d'un jeu entre deux enfants Leyla et Paul. Les deux choisissent simultanément I un objet parmi les trois objets suivants : papier, ciseaux et caillou. Selon ces choix, soit I un enfant gagne le jeu, soit il n'y a pas de gagnant (ce dernier cas apparaît s'ils choisis- I sent le même objet). Caillou gagne contre ciseaux, ciseaux gagne contre papier et papier I gagne contre caillou. Soit 2 le gain de l'enfant qui gagne, 0 le gain de celui qui perd et 1 I les gains en cas d'égalité. I 1. Décrivez l'ensemble des joueurs et l'ensemble de stratégies de chaque joueur. I 2. Écrivez le jeu simultané en forme normale. I 3. Est-ce qu'il existe des stratégies strictement dominées ? I 4. Écrivez le jeu simultané en forme extensive. I 5. Même question si Paul triche et observe le choix de Leyla avant de jouer. I 6. Même question si Paul n'observe le choix de Leyla que si elle choisit caillou. I Solution I 1. / = [Leyla, Paul] ; S, = S2 = [P, Ci, Ca}. I 2. Le jeu en forme normale : P Leyla Ci Ca Paul P G Ca (1,1) (0,2) (2,0) (2,0) (1,1) (0,2) (0,2) (2,0) (1,1) Jeux, stratégies et information • 27
3. Il n'existe pas de stratégies dominées dans ce jeu. 4. La forme extensive de ce jeu doit tenir compte du fait que, pour chaque joueur, le choix de l'autre n'est jamais observé avant de faire son propre choix. On peut par conséquent commencer par Leyla ou par Paul. Si l'on commence par Leyla : Leyla Figure 2.5 5. L'arbre du jeu : Leyla Figure 2.6 28 • PREMIERS ÉLÉMENTS
6. L'arbre du jeu : * (i,D * (0,2) -(2,0) * (2,0) * (1,1) -(0,2) * (0,2) * (2,0) -d.D Figure 2.7 Exercice 2.2 Deux pays (A et B) considèrent séparément l'état des relations politiques entre eux. Ils doivent choisir entre un état de guerre (G) ou un état de paix (P). Si les deux choisissent la guerre alors chacun aura un gain de 2. Si un seul déclare la guerre alors il obtient 6 et son voisin obtient 0. S'ils choisissent de préserver la paix, chacun obtient un gain de 4. 1. Donner l'ensemble des joueurs et l'ensemble de stratégies de chaque joueur. 2. Représentez ce jeu en forme normale. Solution l.I = [A,B}\ S{ =S2 = {G,P}. 2. La forme normale de ce jeu : A G P B G P (2,2) (6,0) (0,6) (4,4) Exercice 2.3 Soit le jeu en forme normale suivant : A G D B G D (1,1) (1,1) (-1,-1) (2,0) Proposez des jeux en forme extensive dont la forme normale peut correspondre à ce jeu. Jeux, stratégies et information • 29 Leyla p / P1 / Paul \ G \ Pz Ca / Ci \ca P / G \ca P / a \Ca
Solution Différents jeux séquentiels peuvent donner lieu à cette représentation en forme normale. Voici deux exemples. (a) (l.D G B, * (-1,-1) D D (2,0) Figure 2.8 L'arbre du jeu (a) correspond à une situation où A joue le premier mais son choix n'est pas observé par B. Cela pourrait correspondre, par exemple à un jeu simultané. L'arbre (b) correspond à une situation où le choix initial de A est observé par B mais le jeu s'arrête si A choisît G. Exercice 2.4 Considérez le jeu en forme normale donné dans le tableau suivant A B a (k,[) ($.h) b (e,f) <c,d) Déterminez les conditions sur les paramètres c, d, e, f, g, h, ketl pour que 1. le résultat (A, a) résulte de l'élimination des stratégies strictement dominées ; 2. le jeu ait la même structure que le dilemme du prisonnier ; 3. le jeu ait la même structure que la bataille des sexes. Solution 1. Les conditions minimales pour que résultat (A, a) résulte de l'élimination des stratégies dominées : / > / et h > d (la stratégie b du joueur // est dominé par a) et k > g. 2. Le jeu possède la même structure que le dilemme du prisonnier si : k < g et k>oe\l<f(til>d>h. 3. Le jeu possède la même structure que la bataille des sexes si : k > c > [e,g}\ d>l> [fM 30 • PREMIERS ÉLÉMENTS
Exercice 2.5 Déterminez les solutions possibles du jeu en forme normale suivant sans faire appel au concept d'équilibre de Nash : d A e f B abc (4,3) (5,1) (6,2) (2,1) (8,4) (3,6) (3,0) (9,6) (2,8) Solution La stratégie b est strictement dominée par c pour le joueur B (2 > 1,6 > 4,8 > 6) et on peut donc l'éliminer. Le jeu devient : A d e f B a (4,3) (2,1) (3,0) c (6,2) (3,6) (2,8) Il apparaît alors que les stratégies e et/sont strictement dominées par d pour le joueur A. Le jeu devient alors A d B a c (4,3) (6,2) La stratégie c est alors dominée par a pour le joueur B et nous débouchons sur la solution de ce jeu : (dya). C'est donc par l'élimination des stratégies strictement dominées que nous avons résolu ce jeu. Jeux, stratégies et information «31
Y- "■ • ^y*f Deuxième partie v Les jeux non coopératifs avec information complète 3. Equilibre de Nash (1951) 35 4. Dynamique et rétroduction 61 5. Jeux répétés 85 0. Jeux de négociation 109
■ Equilibre de Nash (1951) /ohn Nash a généralisé le concept d'équilibre de Cournot(1). L'idée de l'équilibre de Nash est extrêmement simple en soi et cohérent avec l'essence des jeux non coopératifs. Les jeux non coopératifs correspondent à des situations d'interactions entre individus libres dans leurs choix et poursuivant des objectifs propres et indépendants. Ces individus ne communiquent pas avant le jeu et n'ont pas nécessairement le moyen de s'engager à poursuivre une stratégie particulière. Dans ce contexte, l'équilibre de Nash cherche les résultats qui sont stables par rapport aux déviations individuelles, donc unilatérales. L'absence de communication implique une absence de coordination explicite et des déviations multilatérales. Un équilibre de Nash (EN) est donc un résultat dont aucun joueur n'a envie de dévier unilatéralement, étant données les stratégies jouées par les autres joueurs. clés étudiés : Ce chapitre est consacré à l'équilibre de Nash : - l'équilibre de Nash ; - les fonctions de meilleures réponses ; - l'efficacité et domination au sens de Pareto ; - le problème de la multiplicité des équilibres ; - les points focaux dans un jeu ; - l'équilibre corrélé. 1. Pour un exposé simplifié du duopole de Cournot, voir http://yildizoglu.xlOmx- /livremicro/index.html 3 Équilibre de Nash (1951) • 35
p Un profil p* = (p*,..., p*) (p* ePi,i = l...n) est un équilibre de NashA V si aucun joueur n'a intérêt à dévier unilatéralement de sa stratégie p* quand les Poutres joueurs continuent à jouer le profil p*_r Par conséquent nous devons avoir^l fc UiipÎiP^^UiiPiiPlj), Vp,eP/?l. Vî = lv./i. (3A)4 ft>. p* est un équilibre de Nash strict si ut(p*, p*.) > «,- (p,-, p*,.), Vp,- e /^| Si l'équilibre de Nash est strict, en dévier doit avoir un coût pour les joueurs. Pour tester si un résultat p est un équilibre de Nash, nous devons vérifier si un des joueurs au moins n'a pas intérêt à choisir une autre stratégie. Si ce n'est pas le cas alors p est un équilibre de Nash. Reprenons l'exemple du dilemme du prisonnier (tableau 3.1). Tableau 3.1 Dilemme du prisonnier (reprise). « . N Bonnie D Clyde N D (-1,-1) (-10,0) (0,-10) (-8,-8) (N, N) n'est pas un équilibre de Nash car u2(N,N) = -l <0 = u2(N,D) et donc Clyde choisira de jouer D au lieu de N. Nous savons déjà que (£>, D) est une solution qui apparaît après l'élimination des stratégies dominées. Cela implique qu'aucun joueur n'a intérêt à dévier de D quel que soit le choix de l'autre et donc, en particulier, si l'autre choisit D. Par conséquent, c'est aussi un équilibre de Nash : ux(D, D) = -S> -10 = Ul(N, D) u2(D, D) = -S> -10 = u2(D, N) Donc ni Bonnie, ni Clyde n'ont intérêt à dévier de D si l'autre joue D. Qu'en est-il des stratégies mixtes ? Notons les stratégies mixtes des deux joueurs par px = (g, 1 - q) et p2 = (t, 1 - t) avec q, t e [0, 1]. q est la fréquence du choix de la stratégie N par Bonnie et t est la fréquence du choix de N par Clyde. L'équilibre que nous venons de calculer correspond donc aux stratégies mixtes : p* = (0, 1) et p\ = (0, 1) où Bonnie et Clyde choisissent toujours D. Nous pouvons 36 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
représenter les stratégies mixtes des joueurs dans la forme normale du jeu pour faciliter leur compréhension (voir le tableau 3.2). Tableau 3.2 Dilemme du prisonnier et stratégies mixtes. Bonnie <7 \-q N D Clyde t \- t N D (-1,-1) (-10,0) (0,-10) (-8,-8) Peut-il y avoir d'autres équilibres en stratégies mixtes ? Étant donné que les stratégies mixtes (et donc les événements correspondant au choix de D ou de AO, sont indépendantes entre les deux joueurs, nous pouvons calculer la probabilité jointe de réalisation de chaque profil de stratégies (voir tableau 3.3). Tableau 3.3 Probabilités jointes des profils de stratégies. q N Bonnie 1- q D Clyde t \- t N D qx t qx (1 - t) {\-q)Xt (l-0x(l-O Les gains espérés des deux joueurs sont alors donnés : Ui(pup2) = Eui(pup2) = EuAq, 0 = qtui(N,N) + q(l-t)ui(NfD) +(1 - q)tUi{D, N) + (1 - q)(\ - t)ut(D, D) Ui(0,0) = ui(D,D) Avec les valeurs numériques, le gain espéré du joueur 1 devient : tfifo, t) = qt(-l) + q(\ - 0(-10) + (1 - q)t(0) +(l-ç)(l-0(-8) = 9(f-2) + 8(f-l) Par conséquent dUx dq t -2<0=ïq* =0 Le même raisonnement pour le second joueur implique t* = 0. Équilibre de Nash (1951) • 37
Le seul équilibre de Nash est donc p* = (0, 0). Cela n'est pas surprenant dans la mesure où la stratégie pure N est strictement dominée par D et donc toute stratégie mixte qui accorderait un poids strictement positif (q > 0) à N ferait moins bien que la stratégie pure D. m > Remarque 3.1 Vérifiez que le Jeu de l'entrée II possède bien trois équilibres de Nash en stratégies pures : ((N, P),A)-> (0, 100), ((TV, N), A)-+ (0, 100) et ((/,/>),#)-► (50,60). Il est en fait possible de déterminer l'équilibre de Nash de manière plus constructive, en utilisant les fonctions de meilleures réponses (ou fonctions de réaction) des joueurs. I. Fonctions de meilleures réponses et équilibre de Nash Étant données la structure du jeu et donc celle des gains, nous pouvons déterminer pour chaque joueur i les stratégies qui correspondent à la plus grande satisfaction qu'il peut obtenir face à chaque /?_,. Alors ces stratégies correspondent à la meilleure situation que i peut obtenir face à/?_,-. Le concept de meilleure réponse généralise cette idée. >éfmition 3.2 '''k-*M;rM$ Dans un jeu à n joueurs, la fonction de meilleure réponse du joueur i,hj fyRi(p-i) associe, à chaque combinaison de stratégies des autres joueurs p_h la$ stratégie du joueur / qui maximise son gain : ■ÉfcV^fe,- Mi(Ri(P-i),Prl) > Ui(pi, p_i),; .Vpi E Pi,P-i £ P-i Ai meilleures réponses avec stratégies pures Construisons la fonction de meilleure réponse en stratégies pures de Bonnie et de Clyde dans le jeu initial de Dilemme du Prisonnier (voir tableau 3.4, page ci-contre). Par commodité pédagogique, nous résumons les meilleures réponses des joueurs dans le tableau 3.5, page ci-contre. Dans la colonne concernant Bonnie, TV -> D signifie que la meilleure réponse de Bonnie à la stratégie N de Clyde est déjouer D. Cela provient du fait 38 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Tableau 3.4 N Bonnie D Clyde N D (-1,-1) (-10,0) (0,-10) (-8,-8) Tableau 3.5 Meilleures réponses : caractérisation. Bonnie - R\ (si) N ->D D -> D Clyde- R2(sO N ->D D -> D que Mi (D, N) = 0 > —1 = ux(N, N) comme on l'observe dans la colonne TV de la matrice du jeu. Une manière encore plus simple de visualiser les meilleures réponses de chaque joueur est de les représenter dans la matrice du jeu. Représentons dans la matrice initiale, la fonction de réaction de Bonnie par des carrés ( | | ) et celle de Clyde par des étoiles (^f ). Cela nous donne le tableau 3.6. Tableau 3.6 Meilleures réponses : représentation. N Bonnie D Clyde N D Cette analyse nous montre que face au choix de D par un joueur, l'autre ne peut rien faire de mieux que choisir D. Donc (D, D) est l'équilibre de Nash et il correspond à l'intersection des deux courbes de réaction. De la même manière, construisons la fonction de meilleure réponse en stratégies pures de Paul et de Jacqueline dans le jeu initial de la Bataille des Sexes : 0 Paul F Jacqueline 0 F (2,1) (0,0) (0,0) (1,2) Équilibre de Nash (1951) • 39
En suivant la même démarche que pour le Dilemme du prisonnier nous obtenons les tableaux 3.7 et 3.8. Tableau 3.7 Meilleures réponses : caractérisation. Paul-Ri(s2) F -> F Jacqueline - Ri (s\) F ->F Représentons dans la matrice initiale, la fonction de réaction de Paul par des carrés et celle de Jacqueline par des étoiles (tableau 3.8). Tableau 3.8 Meilleures réponses : représentation. o Paul F Jacqueline 0 F H H L'intersection des deux courbes de réaction correspond aux deux résultats (O, O) et (F, F) et ce sont bien les équilibres de Nash en stratégies pures de ce jeu. De manière plus générale : Proposition 3.1. Si s* est un équilibre de Nash, s* = /?($*,•), Vï = 1... n. Preuve. Par définition, /?,(£*,) maximise w,fe, s*,-), pour tout joueur i. Par conséquent, aucun joueur n'a intérêt à dévier unilatéralement de sa stratégies*. □ Dans un duopole de Cournot, les fonctions de réactions sont les fonctions de meilleures réponses des firmes dans un jeu où les stratégies sont des quantités produites. L'équilibre de Cournot (et de Nash) correspond à l'intersection des courbes de réaction où chaque firme produit de manière à maximiser son profit étant donnée le niveau de production de son concurrent. La recherche de l'équilibre de Nash est donc équivalente à la recherche d'un point d'intersection entre les fonctions de meilleures réponses de tous les joueurs. Bi Meilleures réponses avec stratégies mixtes La prise en compte des stratégies mixtes pourrait faire apparaître d'autres possibilités de meilleure réponse. Pour observer cela, reprenons la Bataille des sexes. Notons les stratégies mixtes des deux joueurs parpi = (#, 1 — q) etp2 = (t, 1 — 0 avec q, t e [0,1]. Nous obtenons alors le tableau 3.9, page ci-contre. 40 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Tableau 3.9 Bataille des sexes et stratégies mixtes. q 0 Paul \- q F Jacqueline t 1- / 0 F (2,1) (0,0) (0,0) (1,2) Comparons alors l'espérance d'utilité de Paul pour ses deux stratégies pures : O : Ul(pl,p2) = Euiipi.pi) = 2f + 0(1 -t) = 2t F : Ui(pi, Pi) = EutipuPi) = Of + 1(1 - t) = 1 - t Face à la stratégie mixte p2 de Jacqueline, Paul choisira O si : 2t > 1 - t 1 Paul choisira tout le temps d'aller à l'Opéra (q = 1) si Jacqueline va à l'Opéra plus d'une soirée sur trois (t > 1/3). Il choisira tout le temps d'aller au Foot (q = 0) si Jacqueline va au Foot plus de deux soirées sur trois (t < 1/3 =» 1 - t > 2/3). Si t = 1/3, Paul est indifférent entre aller l'Opéra et Foot. En fait, dans ce cas, toute combinaison de ces stratégies est équivalente pour lui. Ce dernier point correspond à un principe général qui est souvent utile : Lemme 3.1. Un joueur qui maximise son utilité en utilisant une stratégie mixte sera nécessairement indifférent entre toutes les stratégies pures auxquelles la stratégie mixte attribue une probabilité strictement positive. Si cette indifférence n'était pas vérifiée, une stratégie qui donne une probabilité nulle à la stratégie pure la moins préférée serait meilleure. Preuve. Voir Osborne & Rubinstein (1994), p. 33-34. □ Par conséquent, sa fonction de meilleure réponse est : Ri (0 = q* (0 = 1 Si t > 1/3 [0, 1] Si t = 1/3 10 Si t < 1/3. De même pour Jacqueline, nous avons : O : U2(pup2) - Eu2{pup2) = \q+0(\-q)=q F : U2(pu p2) = Eu2(pup2) =0q+2(l-q) = 2-2q Équilibre de Nash (1951) • 41
Face à la stratégie mixte p\ de Paul, Jacqueline choisira O (t = 1) si q >2-2q -. 2 >3- donc seulement si Paul va à l'Opéra plus de deux soirées sur trois. Par conséquent, la fonction de meilleure réponse de Jacqueline est f 1 Si q > 2/3 R2(q) = t*(q)= [0, 1] Si 4=2/3 [ 0 Si q < 2/3. Nous pouvons représenter ces fonctions de réaction sur un graphique (voir figure 3.1). t 0 1 Jacqueline 1/3 F 0< ( F RAq) ■— — — ^ r -I 1 | 1 1 1 1 1 1 _ 1 1 ) 2/3 1 Paul c ► [ « ) Figure 3.1 Les fonctions de meilleures réponses en stratégies mixtes. Ce graphique fait apparaître trois points d'intersection entre les courbes de réaction. Nos deux équilibres en stratégies pures (O, O) et (F, F) apparaissent aux extrêmes (respectivement (1, 1) et (0,0)). Un nouvel équilibre en stratégies mixtes apparaît As'b} Dans cet équilibre, Paul va à l'Opéra deux soirées sur trois et Jacqueline, une soirée sur trois. Leur gain espéré est alors Eut = 2/3, i = 1,2. 42 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
-~->- Remarque 3.2 Vérifiez que les trois équilibres correspondent bien à des couples de stratégies (pj\ P2) telles que P*i=Ri{PÏ) Pî = *2(pr)- et calculez les gains correspondants aux trois équilibres. +/ [KB] pages 280-293. II. Insuffisances de l'équilibre de Nash A. Non -existence de l'équilibre de Nash Il n'existe pas nécessairement un équilibre de Nash pour les jeux où les stratégies sont des actions directes des joueurs. Si l'on reprend la bataille des sexes après 30 ans de mariage (voir le tableau 3.10). Tableau 3.10 Bataille des sexes IL o Paul F Jacqueline 0 F (2,0) (0,2) (0,1) (1,0) Dans ce cas, le désir de Jacqueline de passer ses soirées avec Paul a disparu avec le temps, tandis que Paul a gardé son amour romantique et il préfère toujours être avec Jacqueline plutôt qu'être seul. Dans ce jeu il n'existe pas d'équilibre de Nash en stratégies pures. Vérifiez qu'il existe néanmoins un équilibre de Nash en stratégies mixtes p* = (l/3,l/3). La non-existence de l'équilibre de Nash correspond à l'absence d'intersection entre les fonctions de meilleure réponse. S'il y a des fortes discontinuités dans les fonctions de réaction, cela devient tout à fait possible. De manière plus précise, on est assuré d'avoir au moins un équilibre de Nash si : 1. L'ensemble de stratégies de chaque joueur est convexe et compact, et si 2. la fonction de paiement de chaque joueur est continue et concave en la propre stratégie du joueur. Équilibre de Nash (1951) • 43
Ces propriétés assurent que les fonctions de réactions se comportent bien et se croisent au moins une fois. Un ensemble compact est un ensemble fermé et borné. La convexité d'un ensemble assure que quand on combine différents points d'un tel ensemble, la combinaison appartiendra à cet ensemble. Un jeu fini est un jeu où les ensembles de stratégies des joueurs sont finis. La continuité et la concavité en son propre argument de la fonction de paiement va assurer que sur l'ensemble convexe et compact des stratégies, le maximum de cette fonction (la meilleure réponse) va se modifier de manière continue et en restant dans l'ensemble des stratégies. Cela va assurer l'intersection des fonctions (ou dans un cadre plus générale, des correspondances) de meilleures réponses. Quand on utilise les stratégies mixtes dans un jeu fini, celles-ci étant définies dans l'intervalle fermée [0, 1], et sur un support fini (S,), la compacité est vérifiée ainsi que la convexité (puisqu'une stratégie mixte est par définition une combinaison convexe de stratégies pures). Cette discussion concerne un problème assez technique. Les arguments que nous venons de considérer ci-dessus sont très imprécis et ils sont uniquement donnés pour vous suggérer l'intuition qui est derrière le théorème suivant. Théorème 3.1 (Nash). Tout jeu fini possède au moins un équilibre de Nash si les stratégies mixtes sont autorisées. [KB] pages 316-326. D. Equilibre de Nash et le bien-être social Les concepts d'équilibre correspondent à des mécanismes particuliers de coordination des stratégies individuelles. Dans les jeux non coopératifs, chaque joueur cherche unilatéralement à améliorer sa situation individuelle. Est-ce que la solution qui est donnée par l'équilibre de Nash correspond à un mécanisme de coordination efficace ? Pour répondre à cette question nous allons utiliser le concept d'efficacité parétienne et le concept d'optimum de Pareto. Nous pouvons définir ces concepts dans le cadre de nos jeux. 44 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
wQn résultat s* est un optimum de Pareto s'il n'existe pas un autre résultat]! P qui le Pareto-domine. ' ] jk Les résultats S et s ne sont pas Pareto-comparable si JE tim<*M^ ^uÂsÏ^M.^t, Ijjy^typ) <fuj(s), ■-^■-otf Dans le dilemme du prisonnier (£>, D) est un équilibre de Nash mais le résultat (N, N) Pareto-domine cet équilibre. Proposition 3.2. Un équilibre de Nash n'est pas nécessairement un optimum de Pareto. Dans la bataille de sexes, les résultats (O, O) et (F, F) ne sont pas Pareto- comparables. Ci Multiplicité de l'équilibre de Nash et sélection d'équilibre L'équilibre de Nash n'est pas nécessairement unique. Reprenons l'exemple de la bataille des sexes. 0 Paul F Jacqueline 0 F (2,1) (0,0) (0,0) (1,2) Dans ce jeu (O, O) et (F, F) sont des équilibres de Nash. Dans ce cas, nous ne sommes pas capables, sans aucune information supplémentaire, de prédire quelle sera exactement la solution du jeu. Les deux résultats sont également vraisemblables. De manière générale, il arrive souvent que les courbes de réaction se coupent plus d'une fois. Que doit-on faire dans ce cas pour pouvoir prédire les résultats possibles de ce jeu ? 1) Interchangeabilité et équivalence des équilibres Si les différents équilibres correspondent à des situations suffisamment similaires, la multiplicité ne pose pas de problème. Nous pouvons préciser cette idée avec les deux définitions suivantes. )ëfinition 3.4 lEteux équilibres de Nash./? et p' sont équivalents si Ui(p), = Uj(.//), Y/, g /., Équilibre de Nash (1951) • 45
|Deux équilibres de Nash p = (pi9 p_t) et p' — [p\, //_,), sont interchanM jçgçables si (/?/, /?/_,) et (p/, /?_/),,Vz_ -sont aussi des équilibres de Nash, yém Si les équilibres de Nash d'un jeu sont équivalents, alors on pourra prédire ce qui va résulter de ce jeu malgré la multiplicité. Dans la Bataille des sexes, les deux équilibres ne sont pas équivalents car les gains des joueurs sont asymétriques. Ils ne sont pas interchangeables non plus puisque (F, O) et (O, F) ne sont pas des équilibres de Nash. En fait, l'équivalence et surtout l'interchangeabilité sont des propriétés assez rares. Que peut-on alors dire dans le cas d'équilibres multiples ? 2) Conventions et points focaux Le problème principal que la multiplicité fait apparaître dans les interactions, est celui de la coordination des choix. En effet, Paul et de Jacqueline doivent se coordonner pour organiser leur soirée. Si vous avez donné un rendez-vous à un ami pour aller au cinéma ce soir, vous allez naturellement vous retrouver devant... la porte du cinéma, même si vous n'avez pas initialement précisé le lieu du rendez-vous. Ce type de choix évident pour tous les joueurs a été appelé un point focal par Schelling. ► Exemple 3.1 (Le jeu du cartel) Deux firmes similaires forment un cartel de manière à constituer un monopole. Elles doivent décider de la manière dont elles vont partager les profits du cartel Chaque firme propose une proportion Sj qu yelle désire obtenir, s( e S,- = {0,1/2, 1}, i = 1,2. Si les choix sont compatibles {s\+s24il) alors Ui{sus2) = st. Sinon le cartel explose etu-x = —1. Nous pouvons construire la forme normale de ce jeu (tableau 3.11). Tableau 3.11 Un premier jeu de cartel 0 Firme A 1/2 1 Firme B 0 1/2 1 (0,0) (0,1/2) (0,1) (1/2,0) (1/2,1/2) (-1,-1) (1,0) (-1,-1) (-1,-1) Ce jeu possède trois équilibres de Nash (1,0), (0, 1) et (1/2, 1/2). Ces équilibres ne sont ni équivalents, ni interchangeables. Pourtant un équilibre correspond mieux que les autres à la nature des relations qui existent entre les firmes. Les firmes sont similaires et donc. 46 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
elles vont estimer que le partage ne doit pas leur être trop défavorable. L'équilibre (1/2, 1/2) reflète bien Végalité de taille qui existent entre les firmes et, en connaissant cette information, on peut s'attendre à ce que les firmes se coordonnent sur cet équilibre. En cela, étant donnée cette connaissance (qui est par ailleurs fournie en dehors du jeu puisque la matrice de jeu définit complètement ce jeu), ce partage égalitaire des profits constitue un point focal. Les conventions en vigueur dans les sociétés humaines constituent ce type de points focaux en vue de faciliter la coordination : rouler du même côté de la route (à gauche en Grande Bretagne), s'arrêter aux feux rouges, se retrouver au point de rencontre dans un aéroport ou dans une gare, faire la queue... 3) Domination au sens de Pareto Un équilibre de Nash n'est pas nécessairement un optimum de Pareto mais quand il y a multiplicité, un équilibre peut Pareto-dominer un autre. Quand cette domination est claire, cela peut fournir un statut de point focal à l'équilibre dominant. Prenons dans le tableau 3.12 une nouvelle version de la Bataille des sexes. Tableau 3.12 Bataille des sexes III. 0 Paul F Jacqueline 0 F (2,2) (0,0) (0,0) (*,*) Si 0 < x < 2 alors (O, O) et (F, F) sont tous les deux des équilibres et (O, O) Pareto-domine (F, F). La coordination sur (O, O) est facile à prédire si x = 1 mais que doit-on penser pour x = 1.9 ou pour x = 1.99999 ? Parfois, la dynamique de déroulement du jeu et la rationalité des joueurs peuvent nous guider quant aux résultats qui peuvent émerger du jeu. Si dans la Bataille des Sexes, Paul rentre à la maison avec deux billets pour l'Opéra, cela va impliquer l'équilibre (O, O). Si les joueurs ont la possibilité de communiquer avant le jeu, on peut penser que cela modifiera la structure du jeu. 4) Communication avant le jeu En effet, les joueurs ne pourraient-ils pas se mettre d'accord avant le jeu (grâce à une bonne conversation au coin du feu) sur l'équilibre qu'ils vont jouer ? Bonnie et Clyde ne pourraient-ils pas se mettre d'accord pour ne jamais dénoncer, de manière à avoir la situation Pareto-optimale ? Ces deux situations sont Équilibre de Nash (1951) • 47
bien différentes. En effet, quoi qu'ils se disent avant (cheap talk), les joueurs seront dans une situation non-coopérative une fois que le jeu commence. Étant donnée que Dénoncer domine fortement Nier, aucune entente tacite ne pourrait forcer les joueurs à s'en tenir à la stratégie N. Étant donnée la tentation pour l'autre de dénoncer, le joueur respectant l'entente risque de se trouver dans une très mauvaise posture. CALVIN AND HOBBES © 1992 Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved. © 1997 Hors Collection pour l'édition française. Figure 3.2 Tenir une promesse... Dans un jeu non coopératif, si les joueurs respectent un accord tacite, c'est parce que cela est dans leur intérêt et non parce qu'ils doivent le respecter. C'est le principe de rationalité individuelle. Ce n'est sûrement pas le cas d'un accord sur la stratégie TV dans le Dilemme du prisonnier. Tout accord qui sera respecté doit nécessairement changer la structure du jeu (sa temporalité, les ensembles de stratégies ou les paiements). Si Bonnie et Clyde font partie d'une bande qui promet de punir sérieusement à sa sortie le joueur qui dénonce, cela peut correspondre à une telle modification (les paiements seront nécessairement modifiés pour le joueur qui dénonce seul !). Il s'agit alors d'une menace crédible. Les menaces crédibles peuvent considérablement changer les résultats d'un jeu comme nous allons le voir dans le prochain chapitre. La coordination entre équilibres multiples est un problème différent. Nous avons vu que les conventions ou la particularité de certaines situations peuvent faciliter la coordination. L'intervention neutre d'une tierce personne aussi peut faciliter la coordination. 5) Équilibre corrélé (Aumann-1974) La tierce personne la plus neutre est la Nature et son intervention aléatoire. C'est en jouant à pile-ou-face qu'on détermine quelle équipe commence un match de football. À partir du moment où un événement aléatoire peut être observé conjointement par tous les joueurs, il peut faciliter la coordination. 48 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Dans la Bataille des sexes, Paul et Jacqueline peuvent demander à leur voisin de jouer à Pile ou Face entre F et O, et dire à chacun de jouer O si Pile est tiré et de jouer F si Face est tiré. Leur gain espéré devient dans ce cas U, = Eui = -u,(0, O) + -u,(F, F) K K 3 = 22+21 = 2- Ces gains espérés sont supérieurs à ceux obtenus à l'équilibre de Nash en stratégies mixtes : p* = (2/3, 1/3). À partir du moment où le voisin n'est pas corruptible, les joueurs ont intérêt à suivre sa recommandation (même si Pile sort plusieurs soirs de suite). Tout événement aléatoire et objectif peut jouer ce rôle de coordination (y compris l'absence ou la présence des taches solaires chaque jour) à partir du moment où les probabilités 0.5/0.5 sont respectées. Ces événements instaurent une corrélation entre les choix des agents, d'où le concept d'équilibre corrélé d'Aumann. —>- Remarque 3.3 Malgré les apparences, il s'agit bien d'un équilibre non coopératif puisqu'aucun joueur ne s'est engagé en une action particulière à l'avance et s'il suit l'indication, c'est parce qu'il y a intérêt. III. Application : le modèle de Hotelling Le modèle de Hotelling est un modèle de différenciation des biens dans un duopole. W D'Aspremont et ai, 1979, On Hotelling's "Stability in Compétition", Econo- ^ metrica, 47(5). On a deux vendeurs localisés sur une plage linéaire où les consommateurs sont uniformément distribués. Chaque consommateur achète au plus une unité du produit. Représentons dans la figure 3.3, page suivante, cette plage par une ligne de longueur L et les localisations des deux firmes par les points A et B. Il existe un coût de transport unitaire c pour les consommateurs. Un consommateur qui achète une unité du produit au prix p à un vendeur qui est à la distance d a l'utilité suivante : u(p, d) = u0 — p — cd Nous posons u0 = 0 sans perte de généralité. Équilibre de Nash (1951) • 49
L !>• • • r— 0 ...a... >• A -pfc x i i a t L- a-b- i B ... J> r y L- b b '"1 1 L Figure 3.3 La cité linéaire de Hotelling. Pour décider chez qui ils vont acheter, les consommateurs comparent donc le prix et la distance correspondant à chaque vendeur. Regardons les consommateurs localisés sur les différents segments du marché. À gauche de A : Le consommateur qui est à la distance x de A achètera chez A si et seulement si pA + ex < pB + c(L — a — b) + ex Pa < Pb+ c(L -a-b) (3.2) Donc la variable x n'intervient pas dans cette condition et dès que la condition 3.2 est vérifiée, tous les consommateurs à gauche de A achètent chez lui, sinon, ils vont tous chez B. À droite de B : | Le consommateur qui est à la distance )> de B achètera chez B si et seulement si pA + c{L - a-b)+cy > pB+cy Pa> Pb -c{L-a- b) (3.3) Entre A et B : | En fonction des prix, il y aura un consommateur limite qui sera indifférent entre les deux vendeurs. Ce consommateur sera à distance t de A si pA+ct = pB + c{L - a-b -t) t = —[Pb -pA+c(L-a- b)] (3.4) 2c et la demande qui s'adresse à A sera a + t. Etant donné pB, nous avons donc trois zones pour pA : Pa < Pb ~ c{L - a - b) = pj Zone (/) \Pa -pB\^c(L-a-b) Zone (II) (3.5) Pa> Pb+ c(L -a-b) = pB Zone (III) 50 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Nous pouvons alors construire la fonction de demande de A étant donné pB L (/) DA(pA\ pB) = a + ^-[pB -pA+c(L-a- b)] (II) (3.6) 2c l o (///) Nous représentons cette fonction de demande dans la figure 3.4. Da(Pa\Pb) i L L-b a ' (I) P (II) B (m) Pb Figure 3.4 La fonction de demande. La firme fait donc faire face à une demande qui n'est pas continue. Cette discontinuité va aussi apparaître au niveau du profit : 7*a(Pa ; pB) = Pa ' &a(Pa ; Pb) (3.7) t*a(Pa\ Pb) = { PaL (/) ^(L + a-è) + ^-^ (//) 2 2c 2c 10 (///) Cette fonction de profit est strictement concave uniquement dans la zone (II). Dans les zones (/) et (III), elle est linéaire et donc concave et convexe. De plus, elle n'est pas continue. Nous représentons cette fonction de profit dans la figure 3.5, page suivante. La fonction de meilleure réponse de A va résulter de la maximisation de son profit étant donné pB Ra(Pb) = argmax nA(pA ; pB) PA (3.8) Dans la zone / : RA(pB) — Pb — c(L — a — b). Équilibre de Nash (1951) • 51
\^A{PA\PB)k (III) Pb Ra(Pb) Pa Figure 3.5 La fonction de profit. Dans la zone // : Nous avons une fonction de profit concave et donc nous pouvons déterminer RA par d7tA l,r ÏN 1 1 —- = -(L + a - b) + — pB --pA=0 apA 2 2c c 1 c RA(PB) = -PB + -(L + a-b) (3.9) Dans la zone///: RA(pB) = Pa est quelconque avec pA ^ pB + c(L — a — b). Nous avons donc une fonction de réaction discontinue. Par symétrie, nous avons la fonction de réaction de B Rb(Pa) = [ pA-c(L-a-b) (I) X-pA + C-(L + b-a) (II) y Pb> pA+c(L-a-b) (III) Si l'équilibre a lieu dans la zone // pour les deux firmes alors il va correspondre à l'intersection de la seconde partie de chaque courbe de réaction Pa = ^Pb + \ (L + a - b) et pB = -p*A + |(L + b - a) Et les profits d'équilibre sont donnés dans cette zone par 2 (3.10) c ( a — b\ dn*A a — b\ dnt , —- ^0 db 52 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Donc en ce qui concerne les localisations, A a intérêt à augmenter a et B, b. Les deux firmes vont donc se rapprocher : c'est le principe de différenciation minimale de Hotelling. Mais la zone de concavité // disparaît dès que nous avons a + b = L : les deux firmes sont localisées au même endroit sur la ligne et il n'y a plus de différenciation. Cela correspond alors au duopole de Bertrand avec pA = pB = 0 et 7r,=0,V/. L'équilibre de Nash obtenu dans la zone concave est donc très fragile dans ce cas par rapport à la localisation des firmes. En fait, dans le cas d'une localisation symétrique {a = b), cet équilibre n'existe que si et seulement si a,b ^ L/4 (les firmes doivent se localiser en dehors des quartiles). Cet exemple illustre donc le problème de non-existence de l'équilibre de Nash quand les fonctions de gains sont discontinues. Par exemple, si les coûts de transport étaient quadratiques (de type ex2), les fonctions de gains auraient les bonnes propriétés pour que l'existence de l'équilibre de Nash soit assurée. IV. Application : le problème de l'entrant potentiel Rappel du problème d'entrée d'une firme dans le marché d'un monopole. 1. L'entrant (JE) doit choisir entre Entrer ou Ne pas entrer (Non). 2. S'il entre, la firme installée (7) peut choisir de le Combattre en cassant les prix ou de Coopérer avec lui de manière à créer un monopole joint. Nous pouvons alors représenter ce jeu sous la forme d'un arbre dans la figure 3.6. Figure 3.6 Le jeu de l'entrée I (reprise). Équilibre de Nash (1951) • 53
Quel va être le résultat de ce jeu ? Quelles sont les meilleures réponses des deux joueurs ? Pour répondre à ces questions, construisons la forme normale de ce jeu. Les ensembles de stratégies des joueurs sont SE = {Entrer, Non], Sj = {Coopérer, Combattre}. Nous pouvons construire la forme normale en mettant les stratégies de E en lignes et celles de / en colonnes : Tableau 3.13 Forme normale du jeu de Ventrée. Entrer E Non I Coopérer Combattre (40, 50) (- 10, 0) (0, 300) (0, 300) Nous pouvons maintenant construire les fonctions de meilleures réponses des joueurs. [ Coopérer Si Entrer l {Coopérer, Combattre) Sinon {Entrer Si Coopérer Non Sinon Utilisons la forme normale du jeu donnée dans le tableau 3.14 pour représenter ces fonctions de réaction ( Q pour E et ^f pour /). Tableau 3.14 Meilleures réponses dans le Jeu de Ventrée I. E Entrer Non Coopérer m * i Combattre El Il y a donc deux équilibres de Nash : (Entrer, Coopérer) et (Non, Combattre). Ces équilibres ne sont ni équivalents, ni interchangeables et il n'y a pas de dominance parétienne entre eux. Aucun ne constitue un point focal et donc les deux sont a priori aussi vraisemblables du point de vue de l'équilibre de Nash. Cela implique alors qu'il existe une possibilité pour / de bloquer l'entrée sur son marché, grâce au combat de l'entrée. Nous allons revenir sur ce résultat dans le chapitre suivant. 54 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
^Exercices I Exercice 3.1 I Soit le jeu en forme normale suivant : A ° D B G D (l.D (1,D (-1,-1) (2,0) 1. Quels sont les équilibres de Nash en stratégies pures de ce jeu? 2. Existe-t-il des équilibres de Nash en stratégies mixtes? Solution 1. On peut déterminer les équilibres de Nash en stratégies pures en considérant les déviations unilatérales à partir de chaque profil de stratégies : - (G, G) : C'est un équilibre de Nash (A : 1 > -1, B : 1 = 1) ; - (D, G) : Ce n'est pas un équilibre de Nash (A : -1 < 1, B : -1 < 0) ; - (G, D) : Ce n'est pas un équilibre de Nash (A : 1 < 2) ; - (D, D) : C'est un équilibre de Nash (A : 2 > 1, B : 0 > -1). On peut aussi utiliser les fonctions de meilleures réponses des joueurs. Représentons dans la matrice initiale, la fonction de réaction de A par des carrés ( Q) et celle de B par des étoiles ( >f ) : A G D B G D Cela conduit aussi aux deux équilibres de Nash en stratégies pures : (G, G) et (D, D). 2. La même démarche peut être utilisée pour les équilibres de Nash en stratégies mixtes. Notons les stratégies mixtes des deux joueurs par p\ = (q,\ — q) et p2 = (t, 1 — t) avec q,t e [0,1]. A « G 1- q D B t 1- t G D (1,1) (l.D (-1,-1) (2,0) Équilibre de Nash (1951) • 55
Considérons le gain espéré de A avec ces stratégies G:UA = EuA=t-l + (l-t)-l = l D:UA=EuA = -l't + (l-t)-2 = 2-3t Il préfère sa stratégie pure G si 1 > 2 - 3t =* t > 1/3 Il jouera donc tout le temps G si B joue G plus d'une fois sur trois et il est indifférent entre ses deux stratégies pures si t = 1/3. Considérons maintenant le cas de B G:UB = EuB=q-\ + (-1) -(\-q)=2q-\ D:UB = EuB = \-q + (\-q)-0 = q Elle préfère toujours sa stratégie pure G si 2q - 1 > q => q > 1 Elle jouera donc tout le temps D car q < 1 par définition. Elle est indifférente entre les deux stratégies pour q = 1 (si A joue tout le temps G). Nous retrouvons donc les deux équilibres en stratégies pures : (0,0) et (1, 1). Mais il existe aussi un continuum d'équilibres en stratégies mixtes : (t e 1/3, 1 , q = 1 j. 1 f ' G 1 B 1/3 D 0< ( L RaO) w ) ) RB(q) A ( 1 G q Figure 3.7 Exercice 3.2 Considérez le jeu en forme normale donné dans le tableau suivant n A B a (M ig,h) b ie,f) (c,d) 56 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Déterminez les conditions sur les paramètres c, d, e,/, g, h,ketl pour que 1. le résultat (A, a) soit un équilibre de Nash ; 2. le résultat (A, a) soit un optimum de Pareto ; 3. le résultat (A, a) ne soit pas Pareto-comparable avec (B,b). Solution 1. Le résultat (A, a) est un équilibre de Nash si : k ^ g et / ^ /. 2. Le résultat (A, a) est un optimum de Pareto si : k ^ max{e,g,c} et / ^ max{/,/î,d}. 3. Le résultat (A, a) n'est pas Pareto-comparable avec (P, b) : k > c et l < d. Exercice 3.3 Deux pays (A et B) considèrent séparément l'état des relations politiques entre elles. Elles doivent choisir entre un état de guerre (G) ou un état de paix (P). Si les deux choisissent la guerre alors chacun aura un gain de 2. Si un seul déclare la guerre alors il obtient 6 et son voisin obtient 0. S'ils choisissent de préserver la paix, chacun obtient un gain de 4. 1. Donnez les fonctions de meilleures réponses en stratégies pures. 2. Que pouvez-vous en conclure sur les équilibres de Nash ? 3. Classez les différents résultats du point de vue de l'efficacité parétienne. Solution Ce jeu est de type dilemme du prisonnier : la stratégie P est dominé par G, avec un équilibre de Nash (G, G) pareto-dominé par (P, P). Il n'y a pas d'autre équilibre de Nash en stratégies mixtes puisqu'aucune stratégie mixte optimale peut donner un poids strictement positif à la stratégie pure dominée, P. Exercice 3.4 Fureur de vivre Deux conducteurs (A et B) dirigent leur voiture l'une contre l'autre dans une rue trop étroite pour qu'elles puissent se croiser sans provoquer d'accident. Si un conducteur ralentit tandis que l'autre garde la même vitesse, il perd la face : il obtient alors une utilité de 0 et son adversaire obtient 4. Si les deux ralentissent en même temps alors le jeu se termine en égalité et les deux obtiennent une utilité de 2. Si aucun ne ralentit alors l'accident arrive et chacun obtient une utilité de -2. 1. Précisez l'ensemble des joueurs et l'ensemble de stratégies de chaque joueur. 2. Donnez la forme normale du jeu. 3. Déterminez les équilibres de Nash en stratégies pures du jeu. 4. Déterminez les équilibres de Nash en stratégies mixtes après avoir précisé les fonctions de meilleure réponse des joueurs. Solution 1. L'ensemble des joueurs est / = {A, B}. Pour les ensembles de stratégies, nous avons SA = SB = {P, N] avec R : ralentir et N : Non. 2. La forme normale du jeu est donnée par le tableau suivant : R A N B R N (2,2) (0,4) (4,0) (-2,-2) Équilibre de Nash (1951) • 57
3. Les deux équilibres de Nash en stratégies pures sont (R, N) et (N, R) car 4 > 2 et 0> -2. 4. Soient les stratégies mixtes q = P[sA =R] = l- P[sA = N](pA) t = P[sB = R] = l- P[sB = N](pB) Face à la stratégie pB de By le joueur A obtient EuA(R\ pB)=2t EuA(N; pB) =6t -2 A choisira de ralentir si 2t > 6t — 2 => t < 1/2. A sera indifférent entre R et N si t = 1/2. De la même manière, face à la stratégie/^, B obtient EuB(R\ pA) = 2q EuB(N ; pA) =6q -2 et B choisira de ralentir si q < 1/2. B sera indifférent entre R et N si q = 1/2. Cela nous donne donc les fonctions de meilleures réponses des deux joueurs que nous pouvons représenter de la manière habituelle. Il Si t < 1/2 [0,1] Si t = \/2 0 Si t > 1/2. Il Si q < 1/2 [0,1] Si 4 = 1/2 0 Si q > 1/2. R B N t U 1/21 0 ( l\ R„(q) i- — — — — —i i i i 1 RA(t) , ) 1/2 / A -j ] F t > l « > Figure 3.8 58 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Nous avons donc au total 3 équilibres de Nash : deux en stratégies pures et un en stratégies mixtes (q*, t*) = l -, - I. Dans ce dernier équilibre A et B choisiront de ralentir une fois sur deux. Exercice 3.5 Déterminez les équilibres de Nash du jeu Papier-Ciseaux-Caillou. Solution Il n'existe pas équilibre de Nash en stratégies pures dans ce jeu. Il existe un équilibre de Nash en stratégies mixtes où chaque enfant joue chaque stratégie une fois sur trois (on peut voir cela en notant les stratégies mixtes sous la forme pLeyia = (qp, g a A — qp — qa) etPpa«i = (tP, ta, \-tP- ta) : p* = ( -, -, - J et U(p\ p*) = 1. Équilibre de Nash (1951) • 59
l/ynamique et rétroduction t' équilibre de Nash est très peu contraignant sur les actions choisies par les joueurs en dehors du chemin d'équilibre. Or, l'optima- lité de ces choix peut parfois justement dépendre du fait que les actions correspondantes ne sont pas effectivement exécutées par les joueurs (car aucun ne dévie du chemin d'équilibre). Cela correspond à une optimalité faible dans la mesure où, une fois en dehors du chemin d'équilibre, l'optimalité de telles actions sera mise en cause, ainsi que leur choix par les joueurs. Cette faiblesse réduit alors considérablement le pouvoir prédictif et la robustesse de tout équilibre de Nash se basant sur de telles actions. Nous allons maintenant voir un premier concept d'équilibre qui cherche à pallier cette insuffisance. Il se base sur le principe bien connu de la programmation dynamique (Bellman) : Yinduction rétroactive ou la rétroduction (1) (backward induction). clés étudiés : Ce chapitre est consacré à l'équilibre parfait en sous-jeux de Selten : - le principe de Bellman et la rétroduction ; - les sous-jeux d'un jeu ; - l'équilibre parfait en sous-jeux ; - les menaces crédibles ; - les jeux de Stackelberg ; - les stratégies complémentaires et substituables. 1. Le terme rétroduction est proposé par Umbhauer (2002) et il a l'avantage d'être plus léger que le terme induction rétroactive. oncept Dynamique et rétroduction • 61
Reconsidérons les équilibres de Nash du Jeu de l'entrée I (voir figure 2.1, page 15). Il y en a deux en stratégies pures : (Entrer, Coopérer) et (Non, Combattre). L'équilibre (Non, Combattre) est basé sur la menace que l'entrée sera combattue si elle a lieu. Il est donc basé sur une menace qui ne sera jamais effectivement exécutée, puisque l'entrée n'aura pas lieu à cet équilibre. Est-ce-que la firme installée (7) aurait choisi cette stratégie de Combattre si elle devait effectivement faire face à l'entrée ? Ui (Entrer, Combattre) = 0 < w7 (Entrer, Coopérer) = 50 Donc si par chance l'entrée a lieu, / a intérêt à ne pas combattre l'entrant et sa menace ne serait pas exécutée dans ce cas : il s'agit d'une menace non- crédible et l'équilibre de Nash (Non, Combattre) est soutenu par cette menace. L'existence de telles menaces souligne la faiblesse de l'équilibre de Nash. En effet ce concept d'équilibre ne distingue pas les plans d'action et le jeu effectif: l'équilibre de Nash est établi au niveau des plans d'actions définis sur le déroulement total du jeu. Cela ne pose pas de problème dans les jeux simultanés. Mais quand il y a une séquentialité des décisions, un joueur ne s'en tiendra à son plan d'action que si et seulement si cela est optimal pour lui quand c'est son tour de jouer. Cela est dans la continuité du concept même de jeu non coopératif et du principe de la rationalité individuelle. Par conséquent, quand l'entrée a lieu et que c'est le tour de la firme installée de jouer, il n'y a aucune raison qu'elle choisisse de combattre l'entrée. I. Sous-jeux et équilibre parfait en sous-jeux (EPSJ)-Selten (1975) Nous pouvons généraliser cette approche qui exige l'optimalité des choix chaque fois qu'un joueur doit jouer,en introduisant le concept de sous-jeu et le combiner avec le principe de rétroduction. Un sous-jeu est l'ensemble formé par un nœud de décision du jeu original et tous les nœuds qui en découlent directement. En étudiant les équilibres des sous-jeux, nous allons pouvoir vérifier si les stratégies annoncées pour ces nœuds par les joueurs sont crédibles. PDefinition 4.i ': ' L '' '^':" ' "^ ""r? • " -^^'- ySfË l| Un sous-jeu d'un jeu en forme extensive / est constitué par : A [ê;. - un ensemble K de sommets, comprenant un sommet de J et les sommets ] m consécutifs à celui-ci, muni de la propriété suivante : si un sommet k W, de K appartient à un ensemble d'information h non-réduit à un singleton J Bfc... alors tous les sommets de h appartiennent à K (h c K) ; . ,jfl 62 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
l'ensemble des arcs reliant les différents sommets de K ; TJJ |f - les gains terminaux de J correspondants aux sommets terminaux de K.'M définition 4.2 I |- Quand un sous-jeu est différent du jeu original, on l'appelle un sous-jeu propre. Tout jeu J en forme extensive contient au moins un sous-jeu : lui-même. Le Jeu.de l'entrée /possède clairement deux sous-jeux : le jeu original et un sous- jeu propre qui commence au sommet I (voir la figure 4.1). Figure 4.1 Le sous-jeu propre du jeu de Ventrée I. Quand le jeu contient des sous-jeux propres,on utilise cette particularité pour affiner le concept d'équilibre de manière à éliminer les menaces non-crédibles. Cela nous permettra alors d'appliquer le concept d'équilibre de Nash dans chaque sous-jeu et donc de manière plus pertinente. ^Définition 4.3 (Selten (1975)) -.-.—--,<-t - ^ h Un profil de stratégies du jeu J est un équilibre (de Nash) parfait en sous- ijeux (EPSJ) s'il correspond à un équilibre de Nash dans chaque sous-jeu du |jeu 7. Par conséquent, un EPSJ doit être un équilibre de Nash du jeu original car ce dernier correspond à l'un des sous-jeux. m Le principe de Bellman nous apprend que pour résoudre un problème (d'optimisation dynamique |^ on commence par chercher le choix optimal de la dernière période ; f- on remonte le temps de période en période en cherchant à chaque période ;' le choix optimal, une fois qu'on a pris en compte les choix optimaux des • périodes ultérieures. Dynamique et rétroduction • 63
Pour chercher les EPSJ d'un jeu fini on utilise la rétroduction : - on commence par chercher les équilibres de Nash des sous-jeux les plus proches des nœuds terminaux et on remplace ces sous-jeux par les résultats d'équilibre correspondants ; - on remonte alors vers les sous-jeux qui contiennent ces sous-jeux terminaux et on recommence l'opération jusqu'à ce que l'on ait atteint l'équilibre de Nash du sous-jeu qui découle du nœud initial. Dans l'exemple, nous devons remplacer le sous-jeu propre par le résultat correspondant au choix de ne pas combattre l'entrant (voir ces deux étapes du raisonnement dans la figure 4.2). (a) le sous-jeu Coopérer ^r (40,50) I Combattre^* (-10,0) (b) le jeu-réduit Entrer E Non (0,300) (40,50) Figure 4.2 Détermination de l'EPSJ. L'entrant potentiel choisit alors d'entrer et nous avons l'équilibre (Entrer, Coopérer). Par conséquent, la menace de combattre l'entrée n'est pas une menace crédible car elle ne fait pas partie de l'équilibre de Nash d'un sous-jeu et ne sera jamais choisie quand il faudra exécuter effectivement cette menace. Cette démarche se généralise de la manière suivante : Proposition 4.1. Dans tout jeu sous forme extensive, l'ensemble des EPSJ est l'ensemble des profils de stratégies obtenus en combinant l'équilibre de Nash avec le principe de rétroduction. La structure du jeu de l'entrée est trop simple pour observer pleinement le fonctionnement de l'EPSJ. Reprenons le Jeu de l'entrée II représenté dans la figure 2.3, page 18 (voir la figure 4.3, page ci-contre). Ici, l'Entrant ne peut pas observer le choix d'augmentation de capacité de la firme installée. Ce jeu possède un seul sous-jeu propre, commençant au sommet I. Nous représentons ce sous-jeu dans la figure 4.4, page ci-contre. Nous pouvons facilement construire la forme normale de ce sous-jeu (voir tableau 4.1, page ci-contre) pour en déterminer les équilibres de Nash (1). 1. Les symboles utilisés pour les stratégies sont : /(nstaller capacité), N(on), Augmenter capacité), P(roduire). 64 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Augmenter capacité l! Produire (ue, ui) -* (-50,40) Installer capacité er~ Ei Non (0,100) Non Produire Non (- 10,120) (50,60) (-10,100) Figure 4.3 Le jeu de l'entrée II-reprise. Augmenter capacité Ei: Produire * Non Produire (uE, ui) (-50,40) * (- 10,120) (50,60) Non Non -* (-10,100) Figure 4.4 Le sous-jeu propre du Jeu de Ventrée II. Tableau 4.1 La forme normale du sous-jeu 4.4. E P N I A N (-50,40) (50,60) (- 10,120) (- 10,100) Ce sous-jeu possède deux équilibres de Nash : s* = (s*E, s*) = (N, A) —> (-10, 120) et v* = (v*E, v*) = (P, N) —> (50,60). Considérons les deux jeux réduits correspondant à ces équilibres de Nash (voir figure 4.5, page suivante). Les deux EPSJ sont donc ((N, N), A) et ((/, P), N). L'équilibre de Nash ((N, P), A) (voir page 38) est éliminé car le profil w = (P, A) ne fait pas partie des équilibres de Nash du sous-jeu. Dynamique et rétroduction • 65
Installer capacité ^(_10120) Non> KO, 100) | (a) Figure 4.5 Les jeux réduits du Jeu de l'entrée IL m > Remarque 4.1 Chaque équilibre de Nash du jeu original n'est pas nécessairement un EPSJ comme l'ont montré nos exemples. CALVIN AND HOBBES © 1990 Wateison. Repiinted with permission of Univeisal Press Syndicate. Ail rights reserved © 1992 Presses de la Cité pour l'édition française. Figure 4.6 Calvin découvre les menaces crédibles... II. Epsj et crédibilité des menaces Dans le Jeu de Ventrée I le blocage de l'entrée est donc basé sur une menace qui ne sera jamais réellement exécutée. Ce type de menace ne peut faire partie des EPSJ puisqu'on considère l'optimalité des choix dans chaque sous-jeu, au lieu de considérer uniquement dans le jeu entier. Dans le Jeu de Ventrée //, la menace d'augmenter la capacité est bien crédible puisqu'elle fait partie de l'équilibre de Nash du sous-jeu et la firme installée à intérêt à l'exécuter effectivement. Par conséquent, si ce qui se passe avant le jeu (la menace, la communication, etc.) doit changer l'ensemble des équilibres, il doit se baser sur une menace crédible et modifier la structure du jeu. Nous devons alors construire le nouveau jeu qui tient compte de cette modification. Dixit (1982) a enrichi notre compréhension des barrières à l'entrée en clarifiant Installer capacité (W, A) i * (50,60) - (P, A0 Non^ > (0,100) (b) 66 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
le rôle des menaces de la firme installée (l'installation des capacités excédentaires, campagne de promotion coûteuse,...). Il a démontré que ce type de menaces n'est effectif que si et seulement s'il est accompagné d'un engagement réel de la part de la firme installée, de manière à modifier les gains dans la suite du jeu. Nous pouvons alors étudier cette crédibilisation des menaces en reprenant une nouvelle version du Jeu de l'entrée adaptée de Dixit(1982). ► Exemple 4.1 (Le Jeu de l'entrée III) Nous considérons maintenant la possibilité pour la firme installée d'effectuer un investissement irréversible avant le début du jeu initial (voir la figure 4.7). Cet investissement est parfaitement observable par E et I ne peut le rentabiliser que s'il Vutilise pour combattre Ventrée (des capacités qui resteront excédentaires ou campagne de promotion qui ne sera pas pleinement exploitée dans le cas où I ne combat pas l'entrant). Engagement E / Combattre Io Non Coopérer («£,"/) / ► (30,-10) Ji ' >a (-10,0) -*> (0,300) Coopérer ,Arx ^v F —► (40,50) K Combattre *(-10,0) No- * (0,300) Figure 4.7 Le Jeu de Ventrée III. Si I choisit de ne pas s'engager dans l'investissement, nous retrouvons le jeu initial dont nous connaissons VEPSJ : (Entrer, Coopérer ). Nous pouvons déjà remplacer cette branche par le résultat de ce sous-jeu. Nous obtenons alors la figure 4.8, page suivante. Nous représentons alors avec une flèche (-») les stratégies optimales de chaque joueur, à chacun de ses ensembles d'information. Cela nous donne donc VEPSJ : {(Non/Ey, Entrer/E-i), (Engagement, Combattre /Ix, Coopérer//2)) où l'entrée est bien bloquée de manière optimale puisque la menace de combattre est maintenant crédible. Nous connaissons maintenant les conditions sous lesquelles un investissement de la part d'une firme Dynamique et rétroduction • 67
Coopérer Entrer It Engagement g * (30,-10) (-10,0) Non Combattre ->* * (0,300) Io Non (40,50) Figure 4.8 Le jeu réduit du Jeu de Ventrée III. installée peut lui permettre de protéger son marché. Cet investissement doit 1. être irréversible ; 2. être parfaitement observable par Ventrant potentiel ; 3. modifier les gains du jeu de marché de manière à crédibiliser la menace de combattre la firme installée. Paradoxes de la rétroduction Ai Le paradoxe de la rationalité ► Exemple 4.2 (Jeu de l'entrée II en information parfaite) La figure 4.9, page ci-contre, représente ce jeu. Cette fois-ci l'entrant observe le choix de capacité de la firme installée. Le seul EPSJ de ce jeu est : ((N/E0, N/Eh Produire /E2), A /I) Cet équilibre est notamment soutenu par le fait qu'au nœud I la firme installée anticipe le fait que son choix d'augmenter la capacité sera suivi par le choix optimal de l'entrant potentiel de ne pas produire. C'est la réaction qu'elle peut attendre d'un concurrent rationnel. Mais si son concurrent était rationnel, elle n'aurait même pas eu à se poser la question de l'augmentation de la capacité (puisqu'un concurrent rationnel ne serait jamais entré). D'où ce que Von appelle le paradoxe de la rationalité : 68 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Augmenter capacité Installer capacité Produire (Ue'Ui) tt-oouire (_5M0) + (-10,120) Non Produire * (50,60) Non ^ (-10,100) Figure 4.9 Le Jeu de Ventrée II en information parfaite. si le nœud auquel on considère les choix ne peut être atteint que comme résultat des choix erronés, comment peut-on supposer que le concurrent va jouer de manière rationnelle dans la suite du jeu ? Cette possibilité d'incohérence peut conduire parfois à des résultats surprenants. B. Sous-optimalité des EPSJ L'application de la rétroduction et l'EPSJ se base sur des choix optimaux dans tous les sous-jeux. Est-ce que cela implique que le résultat de l'EPSJ est nécessairement socialement optimal ? La réponse est négative. Comme pour les équilibres de Nash, il n'y a aucune raison pour que l'EPSJ nous conduise à un optimum de Pareto. Pour voir cela, considérons un jeu bien connu. ► Exemple 4.3 (Le jeu du mille-pattes de Rosenthal (1980)) Ce jeu est donné dans la figure 4.10. Appliquons la rétroduction à ce jeu : à la dernière étape, B choisit d puisque 101 > 100. Alors A —> D(99 > 98) ; B —► d ; - A O- R. B • ■ A R R B • - (i,D la (0,3) B A |d Jd |d (98,98) (97,100) (99,99) (98,101) r 1» .(100,100) Figure 4.10 Le Jeu du mille-pattes de Rosenthal. Dynamique et rétroduction • 69
Anticipant ces choix, à la première étape A choisit D et l'EPSJ de ce jeu donne les gains (1, 1) <t (100, 100),/ = A, B. L'équilibre de ce jeu correspond donc à la pire des situations du point de vue social. Quand on fait des expériences, cet équilibre sort très rarement. Au moins au début du jeu, les joueurs choisissent R et r plutôt que D et d. Cela indiquerait-il que ces joueurs soient irrationnels ? Il est évident que si A pense que B possède un minimum d'esprit coopératif, il peut espérer obtenir plus que 1 en choisissant R plutôt que D à la première étape. Observant R, B peut en déduire que A cherche à coopérer pour améliorer leurs gains et cela peut Vinciter à choisir r. Ce qui veut dire qu'en déviant de l'EPSJ, le joueur A peut donner un signal à B en vue de modifier ses choix futurs. Ce raisonnement est à la base d'une approche des équilibres d'un jeu séquentiel bien différente de la rétroduction : l'induction projective (Torward induction). [GU] Chapitre 4, Section I. IV. Application : une taxinomie des stratégies d'investissement Dans le modèle de Dixit et, de manière générale, dans les modèles de type Stackelberg où la firme installée peut s'engager dans un investissement irréversible, cet investissement n'a de valeur stratégique que dans la mesure où il influence les comportements du concurrent. Nous allons présenter un cadre à deux périodes où ces influences seront étudiées plus en détail (Tirole (1988), 8.3, Fudenberg & Tirole (1986a)). Ai Digression : stratégies complémentaires et substituables Prenons un jeu simultané entre deux agents, où les actions a, appartiennent à l'ensemble des nombres réels. Les fonctions de profits IT"(«/,«/) sont deux fois continûment différentiables et strictement concaves en ax. Les conditions suffisantes pour l'équilibre de Nash sont alors données par : 70 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Soit Rifa) la meilleure réponse de la firme / quand son concurrent choisit a^ Nous avons alors : ^(R,(aj),aj) = 0. (4.1) S'il existe une solution intérieure alors a{ — Ri(cij) est unique du fait de la stricte concavité et c'est la fonction de réaction de la firme /. Un équilibre de Nash de ce jeu est une paire de stratégies (a*, a*) telle que a* = Ri (a*), i -=f=- j = 1,2. Dans cet équilibre chaque firme réagit de manière optimale à l'action anticipée de son concurrent. La pente de la fonction de réaction joue un rôle important dans la détermination de l'équilibre. En différentiant l'équation (4.1) nous pouvons obtenir : R*aj> ~ -8'n,/0fl|)' (4'2) La pente de la courbe de réaction dépend donc de la dérivée seconde croisée du profit de la firme /. Cette dérivée nous donne l'influence de l'action dey sur le profit marginal de /. - La courbe de réaction est croissante si »'"> »0. ddjdcij Les actions des deux firmes sont alors des stratégies complémentaires (1) : à partir d'une situation où ——- = 0, oax an, aJ/l=ï — >0=ï as = R(aj) / OClj pour atteindre a nouveau —— = 0. OClj - Elle est décroissante sinon. Les actions des deux firmes sont des stratégies substituables. Les prix sont souvent des stratégies complémentaires et les quantités sont des stratégies substituables. Les courbes de réaction correspondants aux deux types de stratégies sont représentées dans la figure 4.11, page suivante. 1. Cette terminologie a été introduite par Bulow, Geanakoplos & Klemperer (1985). Dynamique et rétroduction • 71
Figure 4.11 Concurrence et nature des stratégies. B. Le modèle à deux périodes et à deux firmes Dans la période 1 la firme 1 (la firme installée) choisit le niveau d'une variable K (par exemple sa capacité). Nous appellerons K Y investissement de la firme 1. Un jeu de marché a lieu en seconde période où qx et q2 représentent les variables de décisions des deux firmes. La firme 2 observe K et elle décide d'entrer ou non. Si elle n'entre pas alors elle a un profit nul et la firme installée a le monopole du marché à la seconde période. Son profit de monopole est donné par : n?(K,q»(K))9 où qx est sa décision de seconde période (par exemple sa production) étant donnée sa décision de première période, K. Si la firme 2 entre alors les deux firmes choisissent simultanément qx et q2 et leur profit de seconde période sont donnés par : Ul(K,quq2) et U2(Kiquq2). Nous supposons que ces fonctions sont différentiables et que le profit de chaque firme est strictement concave en sa propre variable de décision : d2Ui/dqf < 0. De plus, les coûts d'entrée de l'entrant sont intégrés dans son profit. Étant donné le choix K de la firme 1 à la première période, le jeu de la seconde période est caractérisé par un équilibre de Nash que nous supposons unique et stable : (q*(K),q*(K)). Nous allons maintenant étudier les influences du choix de première période de la firme 1, K, sur l'équilibre de Nash de la seconde période. Nous dirons que l'entrée est dissuadée si U2(Kiq^K)^2(K))^0. 72 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Nous dirons que la firme 1 accommode Ventrée si Tl2(K,qî(K),q;(K))>0. La situation que la firme installée va choisir dépend de l'intérêt qu'elle a pour bloquer l'entrée ou pour la laisser libre. 1) La dissuasion de l'entrée Nous négligerons le cas où la décision de monopole non-contraint suffit pour bloquer l'entrée (le cas blockaded entry de Bain) car ce cas n'est pas très intéressant pour l'étude des stratégies optimales. Par conséquent pour bloquer l'entrée la firme installée doit choisir un K tel que Tl2(K,qî(K),q;(K))^0. Regardons comment le choix de K peut influencer le profit et donc les choix de seconde période de l'entrant potentiel. dU2 _ dU2 dU2 dq\ dU2 dq* ~dK ~JF + ~d^'jK+~dq2~'JK' Or nous savons que le choix d'une décision optimale pour l'entrant potentiel à la deuxième période implique : ^ = 0. dq2 Par conséquent nous devons avoir (le théorème d'enveloppe) : dTl2 _ dU2 dU2 dq* ~dK ~ ~dK+~dq~x' JK' Le premier terme (dU2/dK) correspond à un effet direct de l'investissement de la firme 1 sur le profit de la firme 2. Cet effet est souvent nul (le cas de Dixit (1980), par exemple) : l'investissement de la firme 1 influence uniquement sa propre technologie dans ce cas. Le second effet montre comment la stratégie optimale de la firme installée à la seconde période est influencée par sa décision d'investissement à la première période : c'est l'effet stratégique de l'investissement (d'où l'influence sur le profit) : 9n2 ^ dTl2 dU2 dq* = 0 => = • —. dK dK dq{ 8K Fudenberg et Tirole adoptent la classification suivante : - l'investissement rend la firme installée agressive (tough) si —— < 0 et, dK - l'investissement rend la firme installée pacifique (soft) si —— > 0. Dynamique et rétroduction • 73
Évidemment, si elle veut dissuader l'entrée, la firme installée doit apparaître agressive. Fudenberg et Tirole introduisent la taxinomie suivante pour les stratégies d'investissement : - top dog : être grand pour apparaître agressif ; - puppy dog : être petit pour apparaître pacifique et inoffensif ; - lean and hungry look : être petit (maigre) pour apparaître agressif ; -fat cat : être grand (gros) pour apparaître pacifique et inoffensif. Pour dissuader l'entrée la firme installée a intérêt à sur-investir par rapport à la situation où elle ne prend pas en compte cet effet stratégique (la stratégie de top dog) si l'investissement la rend agressive et, si l'investissement la rend pacifique, elle doit sous-investir {lean and hungry). 2) L'accommodation de l'entrée Si le blocage de l'entrée est trop coûteux pour la firme installée alors elle peut choisir d'accommoder l'entrée. Dans ce cas le choix de son investissement, K, sera guidé non pas par le niveau du profit de son concurrent mais par celui de son propre profit. L'incitation à investir est alors donnée par la dérivée totale de Oi par rapport à K. De nouveau on peut appliquer le théorème d'enveloppe de sorte que dïh_ _ djh_ djh_ dql ~dK ~ ~ÏK+~dq^ ' ~dK' Cette influence peut donc être de nouveau décomposée en un effet direct de minimisation des coûts et un effet indirect stratégique. Le premier effet existerait même si l'entrant potentiel ne pouvait pas observer l'investissement de la firme 1. L'effet stratégique provient de l'influence de la décision d'investissement de la firme installée sur le choix optimal de la firme 2 à la seconde période. Un effet stratégique positif incite la firme installée à sur-investir et un effet stratégique négatif l'incite à sous-investir. Le signe de l'effet stratégique peut être exprimé en termes de l'effet de l'investissement sur le comportement de seconde période de la firme installée (pacifique ou agressif) et du signe des pentes des courbes de réaction des firmes à la seconde période. Supposons que les actions de seconde période des deux firmes soient de même nature, c'est-à-dire sgn(dTl]/dq2) = sgn(dU2/dql) (par exemple s'il s'agit d'un jeu de seconde période en quantités alors ces dérivées sont négatives et s'il s'agit d'un jeu en prix alors ces dérivées sont positives). En utilisant la dérivation en chaîne : dq\ _dq\ dq\ _ R, ( „ dq\ 74 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
où R2(q*) est la dérivée de la fonction de réaction de l'entrant potentiel, calculée pour la stratégie d'équilibre de son concurrent. Par conséquent nous avons : Par ailleurs, en utilisant l'équation (4.4), nous obtenons : /an, dq;\ /an2 dqr\ Le signe de l'effet stratégique avec l'accommodation de l'entrée est donc égal au produit du signe de l'effet stratégique avec la dissuasion de l'entrée et du signe de la dérivée de la courbe de réaction de la firme 2. Or nous savons que la pente des courbes de réaction permet de distinguer les stratégies complémentaires et substituables. Dans le cas où la firme installée décide d'accommoder l'entrée sa stratégie d'investissement sera donc déterminé par deux éléments : 1. l'investissement la rend pacifique (dU2/dK > 0) ou agressive (dYl2/dK < 0) ; 2. les stratégies de la seconde période sont substituables (R' < 0) ou complémentaires (R' > 0). Nous avons donc quatre cas possibles pour l'accomodation de l'entrée : - Si l'investissement rend la firme 1 agressive et les courbes de réactions sont décroissantes alors, l'investissement par la firme 1 pacifie et discipline le comportement de son concurrent. La firme installée a alors intérêt à sur-investir : stratégie de top dog. - Par le même raisonnement, si l'investissement rend la firme 1 agressive et les stratégies sont complémentaires alors, l'investissement provoque une réaction agressive. Elle va alors sous-investir pour ne pas inciter son concurrent à un comportement agressif : stratégie de puppy dog. - Si l'investissement la rend pacifique et les stratégies sont substituables alors elle doit sous-investir pour rester agressif : stratégie lean and hungry. - Si l'investissement la rend pacifique et les stratégies sont complémentaires alors l'investissement rend son concurrent pacifique aussi. La firme installée doit alors sur-investir pour avoir un concurrent pacifique : stratégie de fat cat. Nous résumons ces cas, ainsi que la situation de la dissuasion de l'entrée dans le tableau 4.2, page suivante, où nous utilisons la notation suivante : A : accommoder l'entrée. D : dissuader l'entrée. Cette taxinomie généralise donc le cas de Dixit de manière à considérer tous les cas possibles d'influence de l'investissement sur l'équilibre de seconde période. Dynamique et rétroduction • 75
Tableau 4.2 Stratégies optimales d'investissement. L'investissement rend la firme 1 Agressive Pacifique Str.comp.(/T> 0) A : Puppy dog D : Top dog A : Fat cat D: L. andh. Str. subs.(/T < 0) Top dog Land h. Ci Apprentissage par l'expérience et barrières à l'entrée L'existence d'une possibilité d'apprentissage par l'expérience implique qu'une firme installée peut réduire ses coûts de seconde période en augmentant sa production de la première période. Le supplément de production initiale correspond alors à un investissement en apprentissage et cet investissement est réducteur de coût. Nous pouvons montrer aisément que, dans ce cas, l'investissement rend la firme installée agressive. Si, de plus, le jeu de seconde période est en quantités (stratégies substituables)alors la firme installée doit sur-investir et adopter un profil de top dog. Soit une demande de marché linéaire : p = A-bQ, où Q = qx + q2. Soit le coût unitaire à la deuxième période de la firme installée : c = c(q0), avec c(0) = c0, c' < 0, c" > 0, où q0 représente la production à la première période de la firme installée. L'entrant potentiel a le coût unitaire c(0) = c0 car il n'a aucune expérience de cette technologie quand il entre. Alors, étant donnée la production de la firme installée à la première période, les quantités d'équilibre de Cournot du jeu de marché et le profit correspondant pour la firme 2 sont donnés par : A-2c(q0) + c0 A-2c0 + c(q0) <?,* = ^7 , qî = ~ n2(«r.«2) 3b ll 3b [A + c(q0) - 2c0]2 an2 9b dqo <0. Nous avons donc un effet stratégique négatif. De plus, les stratégies sont substituables (jeu de Cournot). 76 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Par conséquent, on est dans un cas où la firme installée a intérêt à surinvestir : stratégie de top dog. On peut aussi montrer que cette stratégie peut conduire la firme installée à bloquer l'entrée si cela est intéressant pour elle. Nous allons considérer dans le chapitre suivant une classe de jeu où le rôle du temps apparaîtra pleinement. ►* ercices Exercice 4.1 Soit le jeu en forme extensive suivant : g .(0,0) H 1 B 2 / (2,2) m O **\ rf^(3,l) Figure 4.12 Déterminez les équilibres de Nash de ce jeu. Commentez ces équilibres. Déterminez les équilibres parfaits en sous-jeux. Discutez leur relation avec les équilibres de Nash. Solution (H,g) —> (2,2) et(B,d) —> (3,1) sont les équilibres de Nash de ce jeu car étant donnée la stratégie d'équilibre de 1, le joueur 2 n'a pas intérêt à dévier de sa stratégie d'équilibre et vice versa. Dans l'équilibre (H,g) le joueur 2 n'a pas l'occasion déjouer. Cela implique que Foptimalité de la stratégie H pour le joueur 1 est basée sur une stratégie du joueur 2 qui ne sera jamais jouée (g). Pour calculer les EPSJ de ce jeu, nous commençons par résoudre le seul sous-jeu propre de ce jeu qui commence au sommet 2 : l'équilibre de ce sous-jeu correspond au choix optimal de 2 : d (car 1 > 0). Nous avons alors un jeu réduit simple : (2,2) JL, 1-1* (3,1) où le joueur 1 choisit/? de manière optimale. Le seul EPSJ de ce jeu est donc (B,d). En considérant le sous-jeu propre nous nous sommes demandés ce que le joueur 2 choisirait s'il avait effectivement l'occasion déjouer (suite au choix effectif de B par le joueur 1). Cela nous a permis de voir que la menace de jouer g n'est en fait pas crédible et elle ne soutient l'équilibre de Nash (//, g) que parce qu'elle n'est jamais exécutée. Cela nous permet donc d'éliminer cet équilibre de Nash basé sur une menace non-crédible. Dynamique et rétroduction • 77
Exercice 4.2 La figure 4.13 représente la forme extensive d'un jeu de Bataille des sexes. Jacqueline Figure 4.13 Encore une scène de ménage ? 1. Quelle est la différence entre ce jeu et le jeu en forme normale 2.5, page 27, dont nous avons étudié les équilibres de Nash dans le chapitre précédent ? 2. Combien de sous-jeux y a-t-il dans ce jeu? 3. Donnez l'équilibre de Nash dans chaque sous-jeu. 4. Donnez tous les équilibres parfaits en sous-jeux (EPSJ) de ce jeu. 5. Avant que Jacqueline ne fasse son choix, elle entend Paul dire au téléphone qu'il compte aller à l'opéra. Cela changerait-il les résultats concernant les EPSJ ? Justifiez votre réponse. Solution 1. Le jeu que nous avons exposé dans le corps du texte était un jeu simultané tandis que cette forme séquentielle montre que Paul observe le choix de Jacqueline avant d'organiser sa soirée. Sinon, malgré le fait que les gains sont deux fois plus élevés dans cet arbre du jeu, la structure des gains n'est pas différente. 2. Il y a deux sous-jeux propres dans ce jeu, chacun commençant à un nœud de Paul, après chaque choix de Jacqueline. Il y a en plus le jeu entier. 3. Dans le sous-jeu qui suit le choix de l'Opéra par Jacqueline, l'équilibre correspond au choix optimal de Jacques : O. Dans le sous-jeu qui suit le choix du Football par Jacqueline, l'équilibre correspond au choix optimal de Jacques : F. 4. Nous avons alors le jeu réduit suivant : o f (2,4) <— Jacqueline > (4,2) où Jacqueline choisira de manière optimale, d'aller au match de Football. L'EPSJ de ce jeu est donc : (F,(0,F)). 5. Cette information ne change pas la structure du jeu car, après avoir observé que Jacqueline choisit F, Paul choisira d'aller au match de Football. Si Jacqueline entend • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
au téléphone que Paul a acheté un billet pour l'Opéra, cela change alors la structure du jeu car Paul s'engage avant le début du jeu et la perte du billet s'il va au match de Football va changer les préférences des joueurs. Dans ce nouveau jeu (0,0) peut émerger comme un EPSJ mais uniquement sous les conditions que nous venons de discuter. Exercice 4.3 Soit le jeu en forme extensive suivant : 12 12 1 O —£+ • —S-* • —£-► « —§-► • —2-^ (5,5) |D |d |D ld iD (1,0) (0,1) (3,0) (2,4) (6,3) Figure 4.14 Déterminez l'EPSJ de ce jeu. Commentez ce résultat en le comparant avec les différents gains possibles dans le jeu. Le joueur 2 vient d'observer que 1 a choisi G au début du jeu. Qu'est-ce que cela implique pour la suite du jeu ? Discutez les différents cas possibles. Que peut-on en conclure sur la rationalité de l'EPSJ ? Solution Ce jeu est une variante du jeu du mille-pattes de Rosenthal. Les conclusions que nous avons établies dans le cadre de cet exemple s'appliquent telles qu'elles à ce jeu : l'EPSJ de ce jeu correspond au choix de D par le premier joueur à la première étape et cela conduit à un résultat Pareto-dominé par le résultat qu'on aurait obtenu si les joueurs choisissaient G et g tout au long du jeu. Exercice 4.4 Une firme considère l'entrée sur un marché où il existe déjà une firme. Si l'entrée a lieu, la firme installée a le choix entre accommoder l'entrée et punir l'entrant potentiel pour l'évincer du marché. L'arbre du jeu est le suivant : Figure 4.15 Dynamique et rétroduction • 79
Partie A : 1. Donner le jeu en forme normale. 2. Donner les équilibres de Nash de ce jeu. 3. Déterminer les EPSJ en utilisant l'arbre du jeu. Partie B : La firme installée a maintenant la possibilité de mettre en place, en première période, une capacité de production supplémentaire qui va lui imposer un coût supplémentaire de C = 3 uniquement dans le cas où elle n'utilise pas cette capacité pour combattre l'entrée. En cas d'installation, cette capacité est parfaitement observée par l'entrant potentiel. 1. Donner l'arbre de ce jeu. 2. Donner les EPSJ. 3. Discuter ce résultat en le comparant avec celui de la question 3 de la partie A. Solution Partie A : 1. La forme normale du jeu est : Entrer E Non I Accommoder Non (1,0) (-1,-1) (0,5) (0,5) 2. Les deux équilibres de Nash de ce jeu sont : (Entrer, Accomoder) et (N,N). 3. Il y a un seul sous-jeu propre dont l'équilibre de Nash correspond au choix optimal de la firme installée : Accomoder. Donc le seul EPSJ est (Entrer, Accomoder) —> (1,0). Partie B : Si la firme installée la met en place, le coût de la capacité pèse uniquement dans le cas où / ne combat pas l'entrée. 1. L'arbre du jeu est donné par : Entrer Non Ji (UE, M/) M-l.-l) Engagement Eli <z Accomoder 3) loi ■*■ (0,2) Non M-1,-1) 0) Non Non Accomoder MO, 5) Figure 4.16 80 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
2. Il y a maintenant 4 sous-jeux propres dans ce jeu, un après chacun de ces sommets : /i, 72, Eu E2. Nous représentons dans l'arbre suivant les équilibres de Nash de ces sous-jeux avec des flèches (—» ) : Engagement M Non Entrer El/ v^ Non Entrer w \ Non Non (UE>UI) / >> > (-1.-1) J1/ ^ ) (1 3) Accomoder 1 * IV, z; y22 M-1,-1) J2/ > >■> > (1,0) Accomoder ^ ^u, j; Figure 4.17 Le seul EPSJ de ce jeu est alors ((Engagement, Non II\, Accomoder Ih), (Non/E\, Entrer IE2))—+ (0,2). 3. L'engagement a permis à / de rendre sa menace de combattre l'entrée crédible et donc de bloquer effectivement l'entrée. Malgré le coût de l'engagement, la firme installée garde son monopole et améliore sa situation à l'équilibre puisque son profit passe maintenant de 0 à 2. Exercice 4.5 Soit le jeu séquentiel à deux joueurs (E et I) suivant (voir figure 4.18, page suivante). 1. Précisez l'ensemble de stratégies de chaque joueur. 2. Donnez la forme normale de ce jeu. 3. Déterminez les équilibres de Nash de ce jeu. 4. Déterminez les sous-jeux de ce jeu et leurs équilibres de Nash. 5. Déterminez les équilibres parfaits en sous-jeux de ce jeu. Solution 1. Nous avons deux joueurs : / = {£,/}. Une stratégie d'un joueur doit préciser une action pour chacune de ses ensembles d'information. Une stratégie de E doit donc préciser une action pour E0, une pour E\ et une pour E2. Pour /, nous devons connaître une action pour I\ et une pour I2 : SE = {(A,E,I), (B,E,I), (A,F,/), (B,FJ), (A,E,J),(B,E,J)t(A,F,J),(B,FfJ)} Dynamique et rétroduction • 81
(uE, ui) - (1.1) - (0,2) Ei: ■*• (2,0) Eo -* (0,0) * (0,0) E2: ► (2,0) * (0,2) ► (2,2) Figure 4.18 On remarque qu'on a bien 2x2x2 = 8 stratégies pour le joueur E. S, = {(C,G),(C,HUD,G),(D,H)} Ce qui donne bien 2x2 = 4 stratégies différentes pour /. 2. Pour construire la forme normale, nous allons mettre les stratégies de E en ligne de manière à respecter l'ordre des gains dans l'arbre et nos conventions sur la forme normale. (A.E.I) (B,E,I) (A, F,I) (B.F.I) E (A,E,J) {B,E,J) (A, f, y) (B,F,J) (C,G) (1,1) (0,0) (0,2) (0,0) (1,1) (2,0) (0,2) (2,0) (C. H) (1,1) (0,2) (0,2) (0,2) (1,1) (2,2) | (0,2) (2,2) | [ (A G) (2,0) (0,0) (0,0) (0,0) (2,0) (2,0) (0,0) (2,0) (D,H) (2,0) (0,2) (0,0) (0,2) (2,0) |(2,2)| (0,0) |(2,2)| 82 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Tous les profils de stratégies qui donnent les gains (2,2) sont des équilibres de Nash : EN = [((B,E,J), (C,H)), ((B,E,J), (£»,//)), ((B,F,J),(C,H)),«B,F,J),(D,H))) 4. Il existe deux sous-jeux propres de ce jeu. Un qui commence en I\ et l'autre commençant en I2. On peut présenter en forme normale pour déterminer leur équilibre de Nash E E F I C D (l.D (2,0) (0,2) (0,0) / E J I G H (0,0) (0,2) (2,0) (2,2) Sous-jeu en I\ Sous-jeu en I2 EN = {(£,C)} EN = {(/,#)} On peut aussi remarquer que dans chaque sous-jeu il existe une stratégie strictement dominante pour E : la stratégie E dans le sous-jeu I\ et la stratégie J dans le sous-jeu I2. Ces stratégies font bien partie des équilibres de Nash. 5. Les équilibres Nash parfaits en sous-jeux (EPSJ) doivent contenir des stratégies qui appartiennent, pour chaque joueur, aux équilibres de Nash des sous-jeux Pour E : E en Ex et J en E2 Pour I : C en I{ et H en I2 Nous pouvons alors remplacer les sous-jeux par leur équilibre de Nash unique pour déterminer l'EPSJ de ce jeu (uE,ui) ^ (1,1) ^ (2,2) Figure 4.19 L'EPSJ de ce jeu est donc EPSJ = {((B,E,J)y(C,H))} et il contient bien les stratégies d'équilibre de Nash dans chacun des sous-jeux. (C,E) E0; (H,J) Dynamique et rétroduction • 83
5.1 eux répétés Jft *ous avons étudié jusqu'à maintenant des situations où l'interac- Ê\Ê tion n'a lieu qu'une seule fois entre les joueurs. Or, beaucoup m W d'interactions sociales se déploient dans le temps et souvent de manière répétée. La relation entre vous et votre boulanger ou celle entre un producteur et son sous-traitant sont de ce type. Les modèles de jeux répétés servent à analyser la logique de ce type d'interactions de long terme. L'objectif est de tenir compte du fait que les joueurs vont considérer que leurs actions immédiates auront une influence sur les actions futures des autres joueurs. On cherche alors à expliquer les phénomènes comme l'émergence de la coopération ou l'exécution des menaces... Dans cet ouvrage nous allons uniquement considérer les jeux répétés avec information complète, d'où le traitement de ce type de jeux dans cette deuxième partie. Concepts clés étudiés : Ce chapitre est consacré aux jeux répétés en information complète : - les jeux répétés finis et infinis ; - la caractérisation des stratégies et des gains dans un jeu répété ; - le théorème de tout le monde -folk theorem ; - le rôle des menaces rationnelles et des observations imparfaites ; - la réputation. I. L'idée de base L'idée de base peut être illustrée par le dilemme du prisonnier auquel deux joueurs sont confrontés de manière répétée. Prenons une nouvelle version de ce jeu avec des gains légèrement modifiés pour simplifier les calculs, sans que cela change la structure du jeu (voir le tableau 5.1, page suivante). Jeux répétés • 85
Tableau 5.1 Dilemme du prisonnier IL N Bonnie D Clyde N D (3,3) (-1,4) (4,-1) (0,0) Nous savons que le seul équilibre de Nash de ce jeu est (D,D) et il est Pareto-dominé par (N,N). Le résultat est fort car il est dû au fait que pour chaque joueur la stratégie D domine strictement N. Par conséquent, s'ils ne jouent qu'une seule fois, les deux prisonniers ont peu de chances de coopérer (en niant) de manière à éviter une longue condamnation. L'idée principale qui est derrière la théorie des jeux répétés est que, malgré ce résultat fort, la situation de coopération peut devenir stable si le jeu est répété et si chaque joueur pense que s'il arrête de coopérer, cela supprimera toute possibilité de coopération à l'avenir. Auquel cas, la perte à long terme peut dominer le gain à court terme obtenu en ne coopérant pas à une période. Le bénéfice majeur de cette théorie est de déterminer les types de stratégies qui soutiennent les résultats mutuellement désirables dans tout type de jeu. La théorie nous fournit des intuitions sur les régularités de comportements quand les individus interagissent de manière répétée et ces régularités peuvent être interprétées comme l'émergence des normes sociales. Le résultat que nous décrivons montre que la norme sociale nécessaire au soutien du résultat mutuellement bénéfique implique que chaque joueur doit punir tout joueur dont le comportement est indésirable. Quand nous imposons la règle sous-jacente à l'équilibre parfait en sous-jeux (EPSJ) selon laquelle les menaces de punition doivent être crédibles, la norme sociale qui émerge doit assurer que les joueurs qui doivent punir aient effectivement intérêt à le faire chaque fois que la norme sociale l'implique. Dans ce cas, la nature de la punition dépend de la manière dont les joueurs évaluent les résultats futurs. Parfois il est suffisant que la phase de punition dure quelques périodes seulement, au terme desquelles les joueurs retournent au résultat mutuellement désirable. Parfois la norme sociale doit impliquer une compensation future pour les joueurs qui doivent exécuter des punitions coûteuses. Même si les principaux résultats de la théorie concernent la structure des stratégies d'équilibre, la majorité des résultats de la littérature se consacrent à la caractérisation des gains qui peuvent être soutenus par l'équilibre. C'est notamment l'objet des théorèmes folk que nous allons étudier. Ces théorèmes ont deux aspects. D'une part, ils montrent que les résultats socialement désirables, qui ne peuvent être soutenus si les joueurs sont myopes, peuvent effectivement être soutenus s'ils ont des objectifs de long terme. D'autre part, ils montrent que l'ensemble des équilibres d'un jeu répété est immense et que le concept d'équilibre possède peu de pouvoir prédictif. 86 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
•Rappel : Actualisation d'un flux de gains - : >, Le temps intervient de manière cruciale dans un jeu répété. En effet, les répétitions du jeu génèrent un flux d'utilités (gains) pour chaque joueur. À chaque moment du temps où un joueur doit faire un choix, il doit pouvoir évaluer les conséquences de ce choix dans la suite du jeu. Or les joueurs accorderont de l'importance à la date à laquelle ils obtiennent les différents gains : un euro obtenu aujourd'hui n'aura pas la même valeur aux yeux d'un joueur * qu'un euro qui ne sera obtenu que demain. Quand le joueur doit arbitrer entre ces deux possibilités, il doit pouvoir les comparer. Cette comparaison se fait j^par le biais de l'actualisation. On peut observer la préférence de l'agent entre aujourd'hui et demain en Hui demandant de nous indiquer le gain futur minimal, xt+u qu'il acceptera •d'échanger contre un gain xt aujourd'hui. On appelle alors 8 = x,/x,+i le facteur d'actualisation de l'agent. xT est alors la valeur actualisée d'une période de xt+l xt = VAt(xt+x) = 8xf+l. pOn peut alors utiliser le facteur d'actualisation de l'agent pour comparer des [[revenus à des différentes dates ou pour faire voyager les gains dans le temps. ^Étant donné son facteur d'actualisation <5, l'agent économique sera indifférent ientre obtenir x dans t périodes et obtenir 8rx aujourd'hui. iï- En économie, l'hypothèse standard concernant la relation au temps est la préférence pour le présent : on suppose en général que les agents préfèrent, toutes choses égales par ailleurs, les revenus actuels aux revenus futurs. Cette hypothèse correspond alors à 8 ^ 1. Si le joueur du jeu répété obtient un flux infini (Y e [0,oo)) de gains «,(/), fla valeur actualisée au début du jeu de ce flux est donnée par oc £>«,(>)• (5-1) t=0 ^Si mit) = //, Vr alors cette valeur actualisée devient uJ2st = ---u (5.2) t=Q e manière corollaire, si l'on s'intéresse à la valeur actualisée du flux qu'on btient à partir de t = 1 : M = 2> i 1-8 S u = - -h. (5.3) 1 — O Jeux répétés • 87
Ai Jeux répétés finis et jeux répétés infinis Cette distinction fait référence à l'horizon des jeux. Or les résultats sont très différents entre ces deux types de jeux. Si Ton reprend par exemple le Dilemme du prisonnier, dans le cas où la répétition est finie, le seul équilibre de Nash est celui où les joueurs choisissent (D, D) à chaque période. Si le jeu se répète infiniment, l'ensemble des profils de stratégies d'EPSJ est immense comme nous allons le voir ci-dessous. Donc chaque fois qu'on doit appliquer ce type de jeu à une situation, nous devons bien déterminer si l'horizon doit être fini ou infini ; les résultats en dépendront de manière cruciale. En fait, notre jeu doit décrire la situation (jeu fini/infini) telle qu'elle est perçue par les joueurs et non telle qu'elle est objectivement, comme la pourrait percevoir un observateur extérieur. Car ce qui va déterminer les résultats est le comportement des joueurs et cela dépend de leur perception du jeu. Même si le jeu possède en réalité un horizon fini, si les joueurs pensent à chaque période qu'il y aura encore une période ultérieure alors ils se comporteront comme s'ils étaient dans un jeu à horizon infini et alors, c'est ce type de jeu qui est adéquat pour une telle situation. Ce n'est pas parce que la vie des joueurs est nécessairement finie (sauf peut-être pour les organisations) que nous devons utiliser un horizon fini. Si le jeu est joué suffisamment fréquemment, ils auront l'impression que l'horizon n'existe pas en fait. Si les joueurs perçoivent une date terminale bien définie pour le jeu alors le jeu fini est plus adéquat (même s'ils se trompent et que le jeu est en fait infini). II. Émergence de la coopération: le théorème folk Reprenons le Dilemme du prisonnier du tableau 5.1, page 86. Imaginons que la condamnation soit courte (le vol était petit) mais que nos voleurs recommencent de manière répétée. Ils additionnent alors leurs gains à travers le temps. Ce type de situation a été utilisé dans les expériences. On dit aux étudiants qu'ils vont jouer plusieurs fois de suite, sans leur donner de date finale. Ces étudiants choisissent alors souvent de coopérer (ils jouent (N, N)\ du moins au début du jeu. S'ils choisissent ces stratégies sous-optimales à court terme, c'est parce qu'ils prennent en compte leur intérêt à long terme. Si chacun pense que le gain de court terme sera dominé par la perte de long terme, il choisira alors de coopérer. Cette coopération n'est pas en l'occurrence expliquée par l'altruisme ou par le souci de l'intérêt de l'autrui. 88 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
CALVIN AND HOBBES © 1989 Waterson. Reprinted with permission of Universal Press Syndicate. AH rights reserved. © 1999 Waterson pour la traduction française. © 2000 Hors Collection pour l'édition française. Figure 5.1 L'importance de l'horizon du jeu... L'analyse formelle de ce type de situation correspond donc aux jeux répétés. Imaginons deux joueurs qui jouent au dilemme du prisonnier répété pour toujours. Comment pouvons-nous représenter les gains pour un tel jeu ? 'V [KB] pages 344-349, 359-364. Les gains des joueurs pour toute la séquence de répétitions du jeu pourraient être représentés par la moyenne des gains qu'ils obtiennent à chaque période. Ainsi, si les gains du joueur 1 forment la suite {wi(l), Wi(2), u{(3), ...} alors sa fonction de gain sur l'ensemble du jeu est 1 T Km-£>,(;) (5.4) On pourrait aussi imaginer que le joueur utilise la valeur actualisée de ses gains sur la totalité de la séquence de jeux (voir l'encadré de la page 87) : oo £«'-'«, (0, <5e(0,l) (5.5) t = \ où S est le facteur d'actualisation du joueur 1. Dans ce cas, la moyenne de ses gains est donnée par oo (l-S)^'-1^), S g (0,1) (5.6) t=\ Quand u\(t) = w, Vf, cette moyenne est égale à u. L'utilisation de cette moyenne facilite la comparaison des gains avec celui du jeu qui est répété (le jeu d'étape). Jeux répétés • 89
On pourrait aussi imaginer que le jeu est répété un nombre fini mais indéfini de fois. Après chaque tour,il y a une probabilité 1 - q que le jeu s'arrête. Alors l'espérance des gains sur la totalité de la séquence est 00 5>'-'h,(0, ?e(0,l) (5.7) Il existe donc plusieurs possibilités pour représenter les gains dans un super- jeu. Les approches (5.5) et (5.7) sont équivalentes et nous allons utiliser ce type de représentation basée sur la valeur espérée/actualisée des gains. Quels sont les résultats qui émergent si l'on passe du jeu statique au dilemme de prisonnier répété ? Le résultat principal correspond à nos intuitions initiales : la coopération devient un résultat d'équilibre. Reprenons le dilemme du prisonnier : N Bonnie D Clyde N D (3,3) (-1,4) (4,-1) (0,0) Considérons la stratégie suivante de Bonnie : - elle joue N tant que Clyde joue N et - si jamais Clyde joue D, Bonnie joue D jusqu'à la fin du jeu. Face à cette stratégie de Bonnie, il est facile d'imaginer la stratégie optimale de Clyde. S'il joue tout le temps N, il va obtenir un flux continu de gains égaux à 3 jusqu'à la fin des temps. La valeur actualisée/espérée de ce flux est 00 ^35' =3/(1 -S) S'il commence avec D à ce tour, alors il va obtenir 4 maintenant mais 0 pour le reste des périodes. Il a donc intérêt à coopérer si 3 1 >4&8 >-=25%. 1 - S 4 Par conséquent, cette stratégie de Bonnie et sa symétrique pour Clyde forment un équilibre de Nash de ce jeu pour ces valeurs de S. Un équilibre de Nash qui correspond à l'émergence et à la persistance de la coopération. Mais cette histoire simple pose au moins deux problèmes : la multiplicité des équilibres et la particularité des jeux à horizon fini et défini. 90 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Ai Multiplicité des équilibres et des menaces hors équilibre L'équilibre de Nash que nous avons exposé est loin d'être le seul. Supposons par exemple que Bonnie annonce la stratégie suivante : - Elle va alterner entre N et D tant que Clyde joue N. - Si jamais Clyde dévie et joue D, Bonnie joue D pour toujours. Si Clyde joue N face à cette stratégie, ses gains vont alterner entre 3 et -1 jusqu'à la fin des temps. Si Clyde joue D alors il obtient 4 à cette période mais 0 pour le reste du jeu. Il est évident que pour une valeur suffisamment élevée de S, la solution de coopération est à nouveau préférable. Cela émerge comme équilibre si Clyde annonce une menace suffisante pour inciter Bonnie à respecter sa stratégie (par exemple de jouer D pour toujours si jamais Bonnie arrête d'alterner). On peut en imaginer d'autres (par exemple un équilibre où les deux alternent tant que l'autre continue à alterner). Donc la formulation sous forme de jeu répété pose le problème de la profusion d'équilibres. Qu'est-ce qu'il faut pour que les stratégies forment un équilibre ? Il est clair que nous ne pouvons avoir un équilibre qui donne à un joueur une valeur espérée/actualisée strictement négative. Pourquoi ? Parce qu'en jouant D chacun peut s'assurer au moins 0. Et ses concurrents peuvent utiliser le fait de le caler contre cette valeur comme une menace. Par conséquent, toute paire de stratégie qui donne une valeur espérée strictement positive peut être soutenue comme un équilibre. Dans un jeu à horizon infini, sans actualisation, cette proposition est parfaitement correcte. Pour les jeux avec actualisation ou avec un horizon fini indéfini, il faut l'amender légèrement : une situation qui laisse l'un des joueurs trop proche de 0 ne peut être soutenue dans ce cas. Les joueurs doivent avoir suffisamment à perdre en déviant à une étape (suivie par des gains nuls pour toutes les autres étapes) pour qu'un tel accord puisse être soutenu. Ce résultat, au demeurant très intuitif, à été montré pour des jeux répétés plus généraux. Il nous indique la conclusion suivante : tout vecteur de gains réalisables espérés peut être soutenu à l'équilibre s'il donne à chaque joueur au moins autant que ce qu'il aurait pu s'assurer comme gain si tous les autres joueurs s'étaient ligués contre lui (rationalité individuelle). L'intuition de la preuve de cette proposition est très simple : chaque joueur est assuré que s'il dévie de l'accord, tous les autres joueurs vont se liguer contre lui pour le punir. Alors, aucun n'a intérêt à dévier unilatéralement de l'accord. Ce qui est la condition nécessaire pour l'équilibre de Nash. Ce résultat est connu sous le nom du théorème folk (ou le théorème de tout le monde) car il appartient au folklore de la théorie des jeux puisque, comme il semblait être connu de tous avant d'être publié la première fois, personne n'a eu la prétention d'en réclamer la « paternité ». Jeux répétés • 91
On peut se poser à ce stade la question de l'intérêt des autres joueurs à punir celui qui a dévié de l'accord. Une telle punition peut être très coûteuse non seulement pour celui qui la subit mais aussi pour ceux qui l'infligent. Alors ces derniers pourraient ne pas être incités à l'appliquer. Ce qui impliquerait que les équilibres basés sur ce type de menaces ne seraient pas parfaits en sous-jeux. Pour illustrer cela, considérons le jeu statique du tableau 5.2. Tableau 5.2 Dilemme du prisonnier (variante). Bonnie D Clyde N D (5,5) (-1,-2) (6,-1) (0,-3) Dans ce jeu, Clyde peut menacer Bonnie de la caler sur un gain nul en jouant D. Dans ce cas, les stratégies suivantes forment un équilibre de Nash : Bonnie joue N tout le temps. Clyde joue N tant que Bonnie joue N et adopte D si jamais Bonnie joue D. Le problème est alors le suivant : Bonnie n'aura pas envie (si 8 est suffisamment élevé) déjouer D si elle croit que Clyde va exécuter sa menace mais elle aura du mal à croire que Clyde va effectivement exécuter cette menace. Après tout, Clyde n'obtiendra pas plus de -2 s'il exécute sa menace tandis qu'en jouant N, il obtient au pire -1. Par conséquent Bonnie va être incitée à jouer impunément D en pensant que Clyde ne va pas exécuter sa menace : la coopération ne correspond pas dans ce cas à un EPSJ car les menaces qui la soutiennent ne sont pas crédibles. Mais il a été montré (Fudenberg & Tirole (1986)) que le théorème folk s'applique aussi pour les EPSJ. Il suffit pour cela de modifier légèrement les stratégies de punition. Étant donné que les gains du jeu statique sont finis, le gain maximal qu'un joueur peut obtenir en déviant à une étape est borné. Il suffit alors d'un nombre fini d'étapes pour infliger au joueur qui a dévié une punition suffisante pour que la déviation ne soit plus intéressante a posteriori. Une fois leur devoir accompli, les punisseurs peuvent revenir à leur stratégie d'équilibre comme s'il n'y avait jamais eu de déviation. Comme toute la période de punition a été effectuée dans un temps fini, elle a un poids négligeable dans les gains des joueurs avec un horizon infini. Donc la punition est une menace crédible et le théorème folk s'applique pour les EPSJ. Théorème 5.1 (Friedman (1971)). Soit J un jeu fini statique en information complète. Soient u = (u\,...uu) le vecteur des gains des joueurs à V équilibre de Nash de ce jeu, u = (u\,...u„) un vecteur de gains réalisables dans ce jeu et 8, le facteur d'actualisation commun à tous les joueurs. Si ux > u] pour tout joueur i et si 8 est suffisamment proche de l'unité alors il existe un EPSJ du jeu répété de manière infinie qui donne u comme le vecteur des gains moyens. 92 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Par conséquent, tout vecteur de gains qui respecte la rationalité individuelle peut être obtenu grâce à un EPSJ. Nous avons non seulement une profusion d'équilibres mais aussi une multitude de réponses hors-équilibre qui les soutiennent. Dans l'équilibre que nous avons donné pour le dilemme du prisonnier, Bonnie annonce que si jamais Clyde joue D, elle va jouer D pour toujours. Mais si S est suffisamment élevé, il est suffisant pour Bonnie de menacer que si Clyde joue D, elle jouera D à la prochaine période. En effet, Bonnie pourrait aisément inclure une telle menace dans une stratégie globale : « Je (Bonnie) vais commencer par jouer Net, dans chaque période ultérieure, je vais faire ce que Clyde a fait dans la période précédente ». C'est la stratégie que Axelrod a appelé tit-for-tat (donnant-donnant). Tant que S est suffisamment proche de 1, on n'aura pas besoin d'une punition qui durera jusqu'à la fin des temps pour soutenir la coopération. Tit-for-tat est suffisante mais aussi beaucoup d'autres stratégies de punition. Laquelle de ces menaces a le plus de chance d'être exécutée ? Il est difficile d'y répondre. D'autant plus que si la menace est efficace, nous n'assisterons jamais à son exécution. [KB] : Sections 8.4 et 8.5. D. Jeux avec horizon fini et défini Le second problème avec la formulation en termes de jeux répétés provient du fait que cela donne un résultat fondamentalement différent quand l'horizon est fini et défini. Considérons encore le dilemme du prisonnier répété cette fois-ci exactement 100 fois. Ainsi, si l'on atteint la période 100, on sait de manière certaine que le jeu s'arrête à la fin de la période car c'est la dernière période. Si nous sommes à la période 100, les deux joueurs sauront cela et ils vont nécessairement jouer D car il n'y a plus de perte à long terme qui puisse balancer le gain à court terme. Si nous sommes à la période 99, il y a bien une période qui va suivre mais les joueurs savent que chacun va jouer D dans cette dernière période. Par conséquent, personne n'a intérêt à coopérer à la période 99. Ce raisonnement détruit totalement les possibilités de coopération car nous pouvons ainsi remonter jusqu'à la période initiale du jeu et les joueurs vont y jouer D. Cela démontre donc qu'il existe un EPSJ unique et il implique l'absence de coopération. On peut aussi démontrer que la coopération ne peut être soutenue sur aucun chemin d'équilibre de Nash. Ce résultat rappelle le « Chain store paradoxe » de Selten (qui n'est rien d'autre que la répétition k fois Jeux répétés • 93
du Jeu de l'entrée I) et son résultat est similaire à celui du jeu centripète de Rosenthal. C'est pour cette raison que nous avons besoin ici d'un argument un peu plus sophistiqué que la retroduction. Comme pour le jeu centripète, le résultat théorique du Dilemme du prisonnier répété est loin d'être intuitif, ni vérifié empiriquement. Quand on expérimente ce jeu répété 100 fois avec des étudiants, on observe que la coopération est choisie dans la majeure partie du jeu. On observe même la coopération quand on répète le jeu une vingtaine de fois. Il manque donc un élément fondamental à notre analyse. III. Observations imparfaites r Notre analyse est basée sur l'hypothèse que toute déviation est immédiatement observée et punie. Dans les applications de ces idées, nous pouvons être amenés à traiter des cas où un des partis n'est pas sûr quant aux choix effectifs de l'autre. Les observations peuvent indiquer que l'autre n'a peut-être pas respecté l'accord. Il existe différentes manière de modéliser une telle situation. On peut reprendre le dilemme du prisonnier et supposer que les gains sont aléatoires et que la matrice du jeu contient en fait la moyenne de la distribution des gains dans chaque cas. Les gains actuels peuvent, par exemple, être distribués selon différentes lois normales avec ces moyennes et un écart-type de 5 unités, par exemple. Chaque joueur observe les deux gains (résultant du tirage aléatoire) mais pas le choix actuel de l'autre. « . N Bonnie D Clyde N D (3,3) (-1,4) (4,-1) (0,0) Par exemple, si Bonnie choisit D et Clyde choisit TV, Bonnie obtient un gain tiré d'une loi normale A/*(4, 5) et le gain de Clyde provient de la distribution Af(—l, 5). Les erreurs sont indépendantes dans les deux dimensions. Imaginons que vous êtes Clyde et qu'au premier tour vous choisissez TV et vous obtenez un gain de 3.5 et Bonnie obtient 3.2. Au second tour vous jouez TV est vous obtenez 2.5 et Bonnie obtient 2.4. Au troisième tour vous jouez TV et vous obtenez -2 et Bonnie obtient 3.9. Avec ces observations vous ne pouvez être sûr que Bonnie a joué D. 94 • LES JEUX rfON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Tous ces cas appartiennent à l'intersection des deux distributions pour chaque joueur (voir figure 5.2). Figure 5.2 Distribution des gains de Clyde. Devez-vous punir Bonnie ? Si oui, quelle doit être la force de la punition ? Si -2 déclenche la punition, quid de 0 ? La punition doit-elle être proportionnelle à vos pertes ? Vous pouvez essayer de pardonner Bonnie. Mais dans ce cas, elle n'aura aucune incitation à jouer N et elle peut tout le temps jouer D et justifier vos gains par la malchance. En même temps vous n'avez pas envie de punir trop souvent et trop brutalement. Même si Bonnie joue tout le temps TV, parfois vos gains seront faibles et si vous déclenchez une punition en jouant D, par exemple suite à un gain de 1, alors vous allez passer beaucoup de temps à la punir injustement (et elle aussi à vous punir en retour) et les gains de la coopération vont s'évaporer à force de punitions. Il y a définitivement un compromis à établir ici. Vous allez en général chercher à punir suffisamment souvent et suffisamment fortement pour inciter l'autre à jouer tout le temps N. Cela peut donc favoriser une menace par rapport aux autres et résoudre le problème de la multiplicité des menaces hors-équilibre. Mais si le bruit augmente, alors il sera de plus en plus difficile de distinguer le choix de l'autre et le coût des punitions va baisser les gains des deux partis à l'équilibre (cela peut même conduire à la disparition de la coopération). IV. Application : l'émergence du cartel Le problème que rencontrent les duopolistes dans la constitution d'un cartel est un résultat bien connu de l'économie industrielle. Reprenons rapidement ce problème. Si la collusion est possible, l'objectif du cartel est la maximisation du Jeux répétés • 95
profit total du secteur. Les firmes partagent ce profit maximal. Leur problème est : max n \ + 7r2. n = 7i\ + n2 = P(qi+qi)(qi +qi) - cx{q\) - c2{qi) où p(q) représente la demande inverse de marché (/?' < 0) et <:,(•) est la fonction de coût total de la firme i (cf > 0, c" > 0). Les conditions d'optimalité sont -H = p(qi + qi) + (qi +q2)_L_ CmMi) = 0, i = 1,2 (5.8) oqx dqt Quand l'entreprise évalue l'impact d'une augmentation de sa quantité, elle tient maintenant aussi compte de l'impact de la baisse de prix sur le profit de son partenaire. Donc, en s'associant, les deux firmes sont capables d'atteindre ensemble le profit du monopole. Soit qf les quantités produites par la firme i à la solution du cartel et nf la part qu'elle obtient du profit du cartel. Cette situation n'est pourtant pas un équilibre non coopératif et cela implique un problème de stabilité pour le cartel. Nous pouvons voir cela en reprenant les conditions d'optimalité et en imaginant que la firme envisage d'augmenter sa quantité à partir de la solution de cartel. Nous pouvons alors récrire la condition (5.8) pour faire apparaître le profit marginal de la firme i ^ j à la solution du cartel : dn; dp v dp -r1 = P(q, + qf) + qi^~ CmMi) = -«//■> 0. (5.9) dqs J dq{ J dq( Ce profit marginal est donc positif à l'optimum du cartel (/?' < 0). Ce qui veut dire que la firme sera incitée à augmenter sa production si elle pense que son partenaire ne va pas modifier la sienne : la solution du cartel ne correspond pas à sa meilleure réponse. Par conséquent, le cartel risque de déboucher dans un duopole de Cournot où chaque firme va obtenir, enfin de compte, des profits plus faibles que dans le cartel : c'est un cas typique de dilemme du prisonnier. Le cartel sera donc instable si le problème du cartel ne se pose qu'une seule fois. Or les firmes sont en relation de jour en jour sur le marché et la question de la cartellisation se pose (quand on peut éviter la détection par les autorités de la concurrence) de manière périodique et répétée. La prise en compte de cette répétition peut-elle changer le résultat négatif sur la stabilité du cartel ? L'équation (5.9) montre que face à la quantité de cartel de son concurrent, la firme i a intérêt à augmenter sa production pour améliorer son profit mais alors son concurrent arrêtera de coopérer et jouera sa meilleure réponse et le cartel se transformera en duopole de Cournot. 96 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Considérons le cas où la firme 1 ne dévie pas de la solution de cartel et produit qf. Si la firme 2 ne dévie pas de la solution de cartel, les deux firmes obtiennent à chaque période nf dont la valeur actualisée est 00 *, = £>,* /=0 Si la firme 2 en dévie à une période donnée Tet produit sa meilleure réponse à q*, elle obtient un meilleur profit nD à cette période et son profit de Cournot n2 pour le reste du jeu. La valeur actualisée de ses gains est alors 7-1 D = J2stn2K+STnD+ J2 *'*: /=o t=T+l avec nD > n? > n$ i2 — Jt>2 Pour faciliter la comparaison, nous pouvons récrire K2 7-1 oo K2 = / 8*712 ~\~ 8 7Ï2 ~\~ / S 7U2 (5.10) /=0 t=T+\ La firme 2 n'aura pas intérêt à dévier de la solution de cartel si K2 - D ^ 0 a7(7TD-7T2*K J2 *'(*2*-*2C) t=T+l 8T ^0 t = \ Ce qui implique (avec le résultat 5.3) s ^ nD-n2K , —^ ~F < 1 7TD-7T9C car n2 > n2 (du fait de la condition (5.10)). Cette condition est donc vérifiée si S est suffisamment proche de 1. Par conséquent, si la firme 2 accorde suffisamment d'importance à ses revenus futurs, elle ne déviera pas du cartel. La même situation est bien sûr valable pour la firme 1 et donc la solution de cartel fait partie de l'ensemble des équilibres de Nash du jeu répété. Jeux répétés • 97
V. Application : qualité des produits et réputation Un monopoleur vend un produit qu'il peut fabriquer soit de bonne qualité, soit de mauvaise qualité. La demande pour ce bien dépend de sa qualité : - Si la qualité est haute, la demande est donnée par pH = AH - Q = 20 - Q ; - Si la qualité est basse, nous avons pB = AB - Q = 6 - Q. Le coût de production d'une unité de bien de qualité haute est cH = 4 et ce coût est de cB = 2 pour la qualité basse. Les consommateurs ne peuvent observer la qualité du bien au moment de l'achat mais ils l'apprennent peu après l'achat. Si les consommateurs pouvaient observer le choix de la qualité, nous aurions les deux solutions du tableau 5.3 en fonction de la qualité(,) : Tableau 5.3 Les deux solutions en information complète. Quantités Prix Profit se Qualité basse QB=2 pB= 4 JtB=4 SCB = 2 Qualité haute G" =8 p" = 12 nH = 64 SCH = 32 Et la firme choisirait de produire la qualité haute. Ce qui aurait conduit à la solution socialement préférable (Surplus social = surplus des consommateur + profit de la firme = 96 > 6). Avec l'information asymétrique, si nous imaginons un marché qui n'a lieu qu'une seule fois, nous obtenons un jeu dont l'arbre est représenté dans la figure 5.3, page ci-contre. L'équilibre de ce jeu est inefficient : Quelle que soit la stratégie utilisée par les consommateurs,la firme a un meilleur profit si elle choisit la qualité basse. Dans la mesure où les consommateurs n'observent pas la qualité, leur décision d'achat ne peut dépendre de la qualité. En anticipant cela, ils vont s'attendre à ce que la firme produise la qualité basse. Ce que la firme va effectivement faire. On aboutit alors à l'équilibre socialement sous-optimal. Imaginons maintenant que la firme ne vende pas le produit une seule fois mais de manière répétée dans le temps : un marché pour ce bien a lieu à des dates dont la séquence est t = 1, 2,... Nous pouvons imaginer que les mêmes 1. Si la demande inverse est égale à p = A — Q, la solution de monopole donne : Q"1 = (A — c)/2, nm = (A- c)2/4, SC = (A- c)2/8. 98 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Figure 5.3 Monopole et réputation. consommateurs achètent le bien à chaque période ou que chaque fois de nouveaux consommateurs viennent sur le marché. L'essentiel est que les consommateurs potentiels à la date t soient informés de la qualité des unités vendues dans les précédentes périodes t — 1, t — 2, ... La firme cherche à maximiser son profit actualisé avec un facteur d'actualisation S. Dans ce nouveau jeu, la qualité basse (avec les prix, quantités et le profits correspondants) est toujours un équilibre. Mais il y a aussi d 'autres équilibres plus intéressants. Imaginons que les consommateurs adoptent la règle de décision suivante : Supposer que la firme produit la qualité haute si les biens produits dans les trois dernières périodes étaient de bonne qualité. Sinon, supposer que le bien de cette période sera de mauvaise qualité. Alors la firme peut obtenir les profits élevés nHH =64 à chaque période à partir de la quatrième période et cela, en produisant systématiquement la qualité haute. Tableau 5.4 Demandes, coûts et profits. Profits : cB=2 Coûts cH =4 Demande AB = 6 AH = 20 JlBB=4 nBH =gl nHB = { nHH = 64 Elle pourrait néanmoins être tentée d'en profiter et de produire la mauvaise qualité à une période et ses profits monteraient alors, pour cette période, de Jeux répétés • 99
64 à nBH = 81. Si la firme veut revenir à la solution haute, elle doit accepter d'avoir, pendant les trois périodes suivantes, le profit nHB = 1. Elle préférera alors toujours produire la qualité haute si et seulement si (81 - 64) ^ (S + S2 + <53)(64 -l)&8^ 21,42 %. Ce résultat correspond au phénomène bien connu d'établissement de réputation par une firme. Cette firme aura soit une réputation de vendeur de camelote, soit de vendeur de bonne qualité. Les consommateurs basent leurs anticipations sur la production récente de la firme. Alors, maintenir la réputation de producteur de bonne qualité est viable comme équilibre. Pour <5 suffisamment proche de l'unité, une firme dans une telle situation choisira d'investir dans sa réputation. Elle produira pendant quelques périodes la qualité élevée même si convaincre les consommateurs est coûteux. Il est essentiel ici que la firme soit persuadée que ses actions actuelles influencent sa réputation et donc la demande future. Si la qualité des biens vendus à la date t n'est jamais connue par les consommateurs futurs ou si elle est connue avec beaucoup de retard alors l'investissement en réputation ne sera pas viable comme équilibre dans la mesure où la firme qui a acquis une telle réputation sera incitée à l'exploiter à court terme. Ce résultat est très proche du raisonnement du théorème folk et il souffre des même limites. D'abord, il y a beaucoup d'équilibres de réputation. Cela va en plus de pair avec une absence de point focal. Ensuite, si l'horizon est fini et déterminé, toute la construction de la réputation s'écroule : À la dernière période les consommateurs vont rationnellement anticiper que la qualité sera basse et à l'avant-dernière période la firme n'aura pas d'incitation à investir en réputation et ainsi de suite. De même, si les observations ex post ne sont pas parfaites, les choses se compliquent considérablement. Si la firme ne peut parfaitement contrôler la qualité de son bien alors elle aura des difficultés à établir une réputation. Imaginons la situation suivante : - Quand la firme cherche à produire la qualité basse, chaque unité produite est effectivement de qualité basse avec une probabilité pB = 0.9 et elle est de qualité haute avec une probabilité pH = 0.1 ; -Quand la firme cherche à produire la qualité haute, les probabilités sont respectivement pB =0.2 et/?" =0.8. Alors si la firme produit et vend 4 unités dont 2 sont de qualité basse, que doivent faire les consommateurs ? S'ils ne punissent pas la firme de temps en temps alors celle-ci aura tendance à produire tout le temps la qualité basse enmettant cela sur le dos d'une série incroyable de malchance. Mais alors, même si la firme cherche tout le temps à produire la qualité haute, deux unités sur dix seront de qualité basse. Donc les choses se compliquent comme on l'a vu dans le cas général. 100 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Il ne faut pas imaginer pour autant que la construction de la réputation marche toujours de la même manière que la répétition standard des jeux non coopératifs. Imaginons qu'un joueur joue au dilemme de prisonnier avec une succession de complices indépendants. Si chacun de ces complices est myope alors les tentatives de ce joueur pour construire une réputation ne vont pas conduire à l'émergence de la coopération. Étant donné que D est une stratégie strictement dominante dans le jeu statique, chacun des complices va la choisir. Alors le joueur n'a aucune incitation à construire une réputation. »» ercices Exercice 5.1 Dans le dilemme du prisonnier étudié dans ce chapitre 1. Est-ce que le résultat (N,D) peut appartenir à l'ensemble des équilibres du super-jeu correspondant à la répétition à l'infini du dilemme du prisonnier ? Pourquoi ? 2. En utilisant l'idée des théorèmes folk, représentez dans l'espace (u\,u2) tous les gains que les joueurs peuvent atteindre comme équilibre de ce jeu répété à l'infini, si le facteur d'actualisation commun est 8 = 1. Solution Dans le dilemme du prisonnier N Bonnie D Clyde N D 3,3 -1,4 4,-1 0,0 1. Le résultat (N,D) ne peut appartenir à un équilibre même si l'on répète à l'infini ce jeu car ce résultat ne respecte pas la rationalité individuelle : Bonnie peut s'assurer au moins 0 > — 1 en choisissant D au lieu N. 2. Les gains que les joueurs peuvent atteindre dans les EPSJ de ce jeu répété à l'infini, doivent respecter la rationalité individuelle (le Théorème de Friedman). Si le facteur d'actualisation commun est 5 = 1, les gains de toutes les périodes ont la même importance aux yeux des joueurs. Nous représentons dans le graphique suivant les gains moyens qui sont accessibles aux joueurs dans ce jeu répété (zone en gris clair). Seuls les gains moyens respectant la rationalité limitée, w,- ^ 0, peuvent correspondre à un équilibre (ces gains correspondent à la zone en gris foncé). Jeux répétés • 101
-1 0 Exercice 5.2 Soit le marché d'un bien homogène produit par deux firmes. La demande inverse de marché est donnée par p = 100 — Q et les fonctions de coûts des deux firmes sont C,(q,)=2qhi = l,2. 1. Déterminez l'équilibre de cette industrie si chaque firme choisit son niveau de production au début de la période, sans communication avec son concurrent. 2. Même question si les firmes coopèrent de manière à maximiser le profit joint (considérez le cas où les firmes partagent de manière égalitaire les quantités et le profit du cartel). 3. Quel sera l'équilibre de ce marché s'il n'a lieu que dix fois, avec chaque firme actualisant ses revenus avec le facteur d'actualisation commun 8 ? 4. Quel sera l'équilibre du marché si le marché peut continuer sans fin, sachant que si une firme dévie de sa stratégie de coopération, son concurrent jouera non coopératif jusqu'à la fin des temps. Sous quelles conditions la solution coopérative peut émerger comme un équilibre ? 5. Même question s'il faut à la firme seulement une période pour convaincre son concurrent qu'elle ne déviera plus de la stratégie coopérative. Solution Il s'agit d'un duopole. 1. Cette situation correspond à un duopole de Cournot où chaque firme cherche à maximiser son profit individuel Jti = (100 - (qx + q2) - 2)qi9 i = 1, 2 ^=9Z-2ql-qJ=0=*qr(qj)=49-qj/2, i?j = 1,2 102 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
q*\Qn est la fonction de meilleure réponse de la firme i. Nous devons donc avoir à l'équilibre de Nash (qf, qf\ qC = 49-qf/2 qf=A9-qf/2 La résolution de ce système linéaire très simple donne 98 qf = — =32,67, î = l,2 11 3 Et les profit de Cournot des firmes sont symétriques r /„„ 2x98\98 /98\2 __ 1 2. Il s'agit d'une situation de cartel où les deux firmes maximisent ensemble le profit joint max(98 - (qx + q2))(q\ + qi) <7l.'/2 mais nous ne pouvons traiter séparément q\ et q2. Posons Q = cj\ + q2. Le problème du cartel est alors celui d'un monopole max(98-G)g Q an -=98-20=0 Les profit du cartel et des firmes sont alors donnés par k 2 2 401, -(?).= no2 itf = — = 1 200.5 > tt,c, 1 = 1,2 8 3. Si la firme y produit #* = 98/4, le profit de la firme / devient ni(qi\qJK) = (9S-qi-^jqi et ce profit est (par définition) maximal si la firme / produit sa meilleure réponse à qf. H */ K\ 98 98 3X98 nr~,e K Jeux répétés • 103
La firme / augmente alors son profit à n°=n(q*(qï),qï) - (q« - 3x98 _ ^\ 3x98 ~l, 8 4/8 = (^)2 = 1 350.56 >** Si le problème de la formation du cartel se pose uniquement sur dix périodes alors à la dernière période la firme i sera tentée de produire qP de manière à augmenter son profit puisqu'elle n'a rien à attendre de la stratégie coopérative (le jeu s'arrête à la fin de cette période). Puisque cela est vrai pour les deux firmes, elles vont toutes les deux jouer leur meilleure réponse, ce qui va conduire, à l'équilibre, à la solution de Cournot pour cette période. Or, à la période 9, les firmes vont anticiper cela et en déduire que la stratégie coopérative ne peut de toute façon pas conduire à la solution de cartel à la dernière période. Il ne leur reste plus qu'à jouer leur meilleure réponse. De proche en proche, l'équilibre de Cournot va s'imposer alors à chacune des périodes, jusqu'à la période initiale du jeu. Nous allons donc observer une répétition pendant dix périodes de l'équilibre de Cournot. Nous sommes bien face à jeu de type Dilemme du prisonnier. 4. Nous avons maintenant un jeu infini où chaque joueur utilise une stratégie à déclenchement (trigger strategy) : dès qu'une firme arrête de coopérer (en jouant sa meilleure réponse), cela déclenche l'utilisation, par son concurrent, de sa meilleure réponse jusqu'à la fin des temps. Si le joueur / joue q*[qf) à une période T, il pourra augmenter ses profits à nP à cette période mais il réduira alors ses profits de nf à nf à partir de la période T + 1. Nous devons alors comparer les flux de gains avec qi(T) =q*(qj(j et avec qi (T) = qf pour déterminer sa stratégie optimale : - Si qi(t) = qf, Vf, il obtiendra le flux de profit actualisé r=0 t=T+\ Tl* =J28'nlK+8TniK+ £ 8'n* ■Siqi(T)=q*(qf) c ) Jl i=T+l La firme / ne déviera pas de la solution du cartel si nf ^ nf oo «r(*,*-*/>)+ £«'(*,*-jt,c)>0 i=T+l 00 / \ 104 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
{7Ti —TTiJ^TT —7T 1-5 5 1-5 5 133.4 ^ 150.06 ^ 1.125 1-5 5 ^ 0.529 Sous cette condition seulement, le cartel sera stable dans le temps avec les stratégies qu'on considère. 5. Dans ce cas, après sa déviation en période 7, la firme / peut convaincre son concurrent à revenir au cartel si elle accepte de produire qx = qf = 98/4 en période T + 1, tandis que son concurrent, en anticipant la non-coopération, produira qj(q,K) =3x98/8. Le profit de la firme i en T + 1 sera alors r /„„ 98 3x98\ 98 T 4*'- Le flux de gains de la firme i qui dévie de la solution de cartel en T sera alors T-\ oo t=0 t=T+2 La firme ne déviera pas de la solution du cartel dans ce cas si (en comparant ce flux avec Uf ) 6T(*,K -x,D)+6T+1(n,K -*,')* 0 ST[(n,K-n,D)+B(n,K-nl')]>0 „D-„k _ 982 (ë4 ~ 8 J &Z Nous observons que la condition sur la stabilité du cartel se relâche du fait que l'effort de convaincre l'autre à revenir à la coopération coûte cher à la firme (du fait de la faiblesse de n?). Exercice 5.3 Supposez que ces deux firmes se font concurrence en prix (duopole de Bertrand). La demande de marché est donnée par D(p) = A — p et les fonctions de coûts des deux Jeux répétés • 105
firmes sont C,(^,) = c,-^,-, i = 1, 2 avec c, = c < A. Selon les prix fixés au début de chaque période, la demande est partagée entre les deux firmes selon la règle de Bertrand : ^i{phPj) = 0 si pi > pj D^ «; —^— si p, = pj = p D(p{) si pi < pj. 1. Déterminez l'équilibre de ce jeu s'il n'a lieu qu'une seule fois et que les firmes se comportent de manière non-coopérative. 2. Même question si les firmes se comportent de manière coopérative et maximisent le profit joint qu'elles partagent à parts égales. 3. Même question si le jeu a lieu 10 fois et que les firmes non-coopératives utilisent le facteur d'actualisation commun 8. 4. Même question si le jeu a lieu à l'infini avec des firmes non-coopératives. Sous quelles conditions peuvent-elles atteindre les gains coopératifs comme un équilibre parfait en sous-jeux de ce jeu, sachant que si jamais une firme dévie de la coopération, l'autre la punit en jouant non coopératif jusqu'à la fin du jeu. Solution 1. Nous connaissons l'équilibre de Nash de ce jeu : c'est 1 'équilibre de Bertrand - voir un cours de Microéconomie sur les structures concurrentielles, par exemple le cours de Microéconomie II à l'adresse suivante : http://beagle.u-bordeaux4.fr/yildi/micro2web/node34.html L'équilibre de Bertrand correspond aux résultats suivants : p*=c, JtiB=Ot / = 1,2 2. Si les firmes maximisent le profit joint, elles vont choisir le prix de monopole et obtenir ensemble le profit de monopole max(/? — c)(A — p) M A+c M 1 (A - c)2 =*Pi = P = —; ir, =2~1— Mais cette solution n'est pas stable car à partir ce point, chaque firme a intérêt à légèrement baisser son prix et obtenir la totalité de la demande Pî(p?)=PU-e *r=«(Pî(P?),Pr) = {^-s-c)(A-T+*) or e peut être arbitrairement petit par définition. 106 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Si le jeu a lieu 10 fois, les firmes ne vont pas coopérer à la dernière période et, de proche en proche, l'équilibre de Bertrand statique se réalisera à chaque période. 4. Dans le jeu infini, chaque joueur utilise une stratégie à gâchette, de sorte que si la firme / dévie de la solution de monopole à une date 7, elle est condamnée à l'équilibre de Bertrand pour le reste du jeu. En déviant, elle obtient à la période T un gain de 8T(7TiD-7TiM)=8T Tandis que ses pertes dans le reste du jeu sont 00 TT," J2 8' < ° Elle choisira de ne pas dévier si \{A-c\2 2 1 (A-c?~\ t=T+l (*/>-*»)-*»£«' ^o */>-*,"£«'«> 2n ■ s — 1-5 1-5 <0 <0 Quand e -> 0 (e peut être aussi petit qu'on veut pour la firme qui dévie), cette condition devint : 2nf - 28n^ - nf1 ^(1-25X0 Donc le paradoxe de Bertrand disparaît quand la concurrence en prix est répétée de manière infinie et le facteur d'actualisation des firmes est supérieure à 1/2 (dans ce cas chaque firme utilise sa stratégie de cartel de manière optimale). Jeux répétés • 107
6.1 eux de négociation Comment partager les profits d'un cartel entre les participants ? Comment partager les profits de l'entreprise entre les actionnaires et les salariés ? De manière générale, comment des agents ayant des intérêts opposés peuvent-ils finir par négocier un compromis ? ^Concepts clés étudiés : ce chapitre introduit une analyse des processus simples de négociation : - la négociation par offres et contre-offres alternées ; - le rôle du temps dans les négociations ; - le rôle des opportunités dont disposent les partis indépendamment des négociations ; -les stratégies pour influencer le résultat du processus de négociation. La théorie de la négociation représente bien plus qu'une simple application de la théorie des jeux car, dès le début de cette discipline, les modèles de négociation ont suscité beaucoup d'intérêt (le premier article publié de Nash portait sur ce sujet). Comment les agents impliqués dans une négociation peuvent-ils dépasser leur opposition et s'engager volontairement dans une action acceptable pour tous ? ► Exemples Négociations salariales dans une entreprise ; négociations commerciales ; établissement d'accords de coopération entre les entreprises. Jeux de négociation • 109
Nous allons introduire les concepts de base de la théorie des négociations dans un cadre très simple où deux individus cherchent à partager un bien ou un gain. Il est bien sûr possible d'étendre ce cadre pour tenir compte des négociations qui portent sur plusieurs objectifs à la fois. On pourrait aussi distinguer les processus de négociations plutôt informels, comme celles que nous allons considérer dans ce chapitre, de ceux qui ont lieu dans un cadre officiel bien défini (les négociations sociales annuelles de branche entre le patronat et les syndicats, les négociations internationales sur le climat ou sur les quotas de pêche). Pendant les négociations, le passage du temps aura en général un coût pour les participants (l'entreprise ne produit pas pendant une grève et les salaires ne sont pas versés). Dans ce cas, deux éléments joueront un rôle important dans l'établissement du compromis : - les procédures de négociations : la séquence des offres et des contre-offres ; - l'urgence, pour chaque partie, de terminer le conflit. Pour analyser la manière dont ces deux dimensions peuvent influencer le résultat des négociations, nous pouvons envisager deux exemples de protocoles simples de négociation : - à prendre ou à laisser. Il s'agit d'une forme de négociation extrême dans sa structure, mais néanmoins assez courante (quand vous allez à un supermarché, vous n'essayez pas de négocier les prix affichés) ; - propositions alternées. Un déroulement dans le temps des offres et contre- offres émanant alternativement de chaque partie. Mais en réalité, la première forme peut, elle aussi, être analysée comme un cas particulier du protocole de propositions alternées. I. Négociation avec propositions alternées Considérons le problème de négociation classique où deux joueurs rationnels cherchent à partager un objet (un profit réalisé ensemble, un butin), d'une valeur X avec un protocole de négociation particulier : - un joueur fait une première offre : un partage des gains, (*, 1 — jc) (par exemple, (60 %, 40 %)) ; - l'autre a le choix de l'accepter, auquel cas il obtient la part 1 — x ou de refuser ; -s'il refuse, il fait à son tour une proposition pour le partage {y A - y) ; - le premier joueur peut à son tour soit accepter, soit faire une nouvelle proposition. Chaque fois qu'un joueur refuse l'offre qu'on vient de lui faire, il obtient la possibilité de faire une offre à son tour. Ce processus continue jusqu'à ce que les 110 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
deux joueurs aboutissent à un partage acceptable pour les deux, ou que l'objet de la négociation disparaisse. Très souvent, le passage du temps est effectivement néfaste pour l'objet à partager et sa valeur diminue pendant chaque session de négociation (l'usine ne produit rien pendant que la grève continue et les ouvriers perdent leur salaire) : une fraction S de la valeur X disparaît à chaque offre non acceptée. Considérons un exemple très simple pour analyser les résultats possibles d'un tel processus de négociation. f Exemple 6.1 Bart et Lisa veulent partager une bûche glacée. Bart propose un partage initial Si Lisa refuse, c'est à elle défaire une offre, mais une partie de la glace aura fondu (il fait chaud et ils n'ont pas la possibilité de la laisser dans un congélateur le temps de la négociation). De même si c'est Bart qui refuse et doit faire une contre-offre. Quel va être le partage décidé par les deux enfants ? Considérons différentes possibilités de négociation. A prendre ou à laisser Imaginons qu'il y ait une seule période possible (la glace fond complètement si la proposition initiale de Bart est refusée). Par conséquent Lisa n'aura pas la possibilité de faire une contre-offre. Nous sommes effectivement dans un cas où l'offre initiale de Bart est « à prendre ou à laisser ». Quelle part de la glace pourrait alors demander Bart ? Il sait que si son offre est refusée, Lisa n'aura rien (la glace aura disparu). Il suffirait donc qu'il lui propose une petite portion de la glace pour que Lisa accepte. En effet, dans ce cas, elle est mise devant le choix entre ne rien obtenir et manger la portion proposée par Bart. Ce dernier pourra donc obtenir la quasi-totalité de la glace. Ce résultat peut paraître extrême. En effet, si on sort du cadre strict des décisions rationnelles (où une miette est mieux que rien), il est fort probable que Lisa refuse l'offre si elle lui paraît trop inéquitable et si elle a effectivement la liberté de la refuser (ce type de résultats est couramment observé dans les expériences menées par les psychologues et les économistes). Dans la mise en œuvre réelle de la théorie de négociation, il faut tenir compte de ces marges plus étroites dont dispose le joueur qui fait la première offre. Si la liberté de choix n'est pas présente, on aboutit facilement à ce type de résultat extrême. Rappelez-vous la réplique de Don Vito Corleone dans Le Parrain : « Je vais lui faire une offre qu'il ne pourra pas refuser ». Deux périodes de négociation S'il y a une seconde période de négociation (la glace prend deux périodes pour fondre), les choses seront plus favorables pour Lisa. Elle sait maintenant que si elle refuse l'offre initiale de Bart, elle pourra s'assurer la Jeux de négociation • 111
presque totalité de la moitié restante de la glace. En effet, ce sera à elle, dans ce cas, de faire une offre « à prendre et à laisser ». Anticipant que s'il fait une offre inacceptable à Lisa, il n'aura pas de glace, à la première période Bart ne pourra pas demander plus que la moitié de la glace. Le partage se fera alors à parts égales. Trois périodes de négociation Considérons maintenant le cas où seulement un tiers de la glace fond à chaque période, en cas de désaccord. Représentons l'évolution des possibilités de négociation et des parts des deux parties dans un tableau pour faciliter l'analyse de la situation (cf. tableau 6.1). Tableau 6.1 Négociation en trois périodes. Période 1 2 3 4 Offreur Bart Lisa Bart Demande maximale possible 1 2/3 1/3 0 Demande effective 2/3 1/3 1/3 En accord avec le principe de rétroduction que nous avons introduit dans le chapitre 4, commençons par la dernière période car, pour formuler son offre, chaque joueur doit anticiper ce qui peut se passer si elle est refusée. Si la négociation atteint la troisième période, Bart pourra s'assurer 1/3 de la glace (on a une situation de type « à prendre ou à laisser » avec le dernier tiers restant de la glace). Anticipant cela, Lisa ne pourra demander au plus que 1/3 de la glace à la seconde période (la moitié des 2/3 restants de la glace), sinon Bart refuserait son offre. Bart pourra alors demander les 2/3 de la glace à la première période et Lisa acceptera cette proposition. Le partage se fera en parts Quatre périodes de négociation Supposons que seulement 1/4 de la glace fond en cas de désaccord (cf. tableau 6.2). Tableau 6.2 Négociation en quatre périodes. Période 1 2 3 4 Offreur Bart Lisa Bart Lisa Demande maximale possible 1 3/4 1/2 1/4 Demande effective 1/2 1/2 1/4 1/4 112 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE U's}
Avec le même raisonnement, nous remarquons que si la négociation atteint la quatrième période, Lisa pourra s*assurer 1/4 de la glace. Anticipant cela, Bart ne pourra demander au plus que 1/4 de la glace à la troisième période (la moitié des 1/2 restants de la glace). Lisa pourra 12 3 1 alors demander 1/2 de la glace à la seconde période : - = - = . 2 4 4 4 En anticipant cela, Bart demandera la moitié de la glace à la première période et Lisa va accepter cette offre. Le partage se fera en parts égales : Cinq périodes de négociation Pour finir, supposons que seulement 1/5 de la glace fond en cas de désaccord (cf. tableau 6.3). Tableau 6.3 Négociation en cinq périodes. Période 1 2 3 4 5 6 Offreur Bart Lisa Bart Lisa Bart Demande maximale possible 1 4/5 3/5 2/5 1/5 0 Demande effective 3/5 2/5 2/5 1/5 1/5 Le partage se fera dans ce cas en parts : Evolution du partage en fonction des conditions de négociation Nous pouvons, à partir de ces exemples, généraliser la manière dont le partage se fera en fonction du nombre de périodes de négociation (cf. tableau 6.4). Tableau 6.4 Périodes de négociation et partage des gains. Nb. Périodes Part de Bart Part de Lisa 1 1 0 2 1/2 1/2 3 2/3 1/3 4 1/2 1/2 5 3/5 2/5 pair 1/2 1/2 impair r + 1 2t t-\ t= 101 102 _ 1 202 % 2 100 _ 1 202 ^ 2 m- §■§• Jeux de négociation • 113
■ > Remarque 6.1 Quand le nombre de périodes de négociation est suffisamment grand, on tend vers le partage à parts égales et le fait de faire la première ou la dernière offre n'apporte plus d'avantage. ■ > Remarque 6.2 Dans tous les cas, le partage sera accepté dès la première proposition mais il tient compte de la fonte de la glace, car les joueurs l'anticipent. - > Remarque 6.3 Le raisonnement stratégique dans la conception du cadre de négociation (le protocole, la longueur des négociations) joue un rôle important dans le partage final. II. Application : la paillote du Soleil Le snack de la plage va ouvrir pour une nouvelle saison. Il ouvre pour les 101 jours qui constituent la saison haute pour cette plage. Pendant une telle saison, le snack fait 1 000 € de bénéfices par jour. Les deux salariés de la paillote trouvent que leur salaire n'a pas augmenté depuis plusieurs années et qu'il est temps d'en discuter avec leur patron. Les négociations salariales doivent donc conduire à un partage des bénéfices et les salariés ouvrent les négociations en faisant une proposition au patron, proposition qu'il peut accepter ou refuser... S'il refuse, la paillote n'ouvre pas, il n'y a pas de bénéfice et les salaires ne sont pas versés. Donc chaque jour de retard dans l'ouverture est coûteux pour les deux parties. Si un accord n'a pas été trouvé à la veille du dernier jour de la saison, il ne reste plus qu'une journée de bénéfices à réaliser (1 000 €). Les salariés (dont c'est le tour de faire une proposition) pourraient alors obtenir la quasi-totalité de ces bénéfices en laissant une part minime au patron pour l'inciter à ouvrir la paillote. En anticipant cela, le patron proposera (à la période 100) de partager également les deux journées de bénéfices (2 000 €) qui restent à réaliser (les salariés n'accepteraient rien de moins que les 1 000 € qu'ils peuvent obtenir à la dernière période). Le principe qu'on a observé dans l'exemple 6.1 s'applique ici aussi et conduit à un partage en parts quasiment égales des bénéfices. L'avantage des salariés (faire l'offre finale de type « à prendre ou à laisser ») se réduit quand la négociation se prolonge. On obtient des résultats assez similaires si les offres ne sont pas alternées ou s'il n'y a pas d'horizon défini à la négociation (Rubinstein). 114 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
—^- Remarque 6.4 À nouveau, l'accord est trouvé dès la première période. —^- Remarque 6.5 Si toutes les négociations se passaient comme cela, il n'y aurait jamais de grève ou de blocage. Nous avons dû laisser de côté certaines dimensions importantes du processus dont les opportunités externes. III. Importance des opportunités externes Une dimension importante du partage est le coût de l'attente pour chaque joueur. Ce coût dépend des opportunités dont ils peuvent bénéficier en dehors du cadre de la négociation. Si les salariés peuvent avoir un job temporaire ailleurs pendant qu'ils font grève, ils peuvent s'assurer un revenu minimum. Cela réduit du coup le coût de l'attente et leur impatience à trouver un accord. Le partage doit tenir compte de ces revenus supplémentaires. Imaginons que les salariés peuvent s'assurer 200 € de revenus chaque jour de grève, en travaillant ailleurs. À la période 100, quand le patron fera sa proposition, il faut maintenant qu'il tienne compte de ces revenus dans le partage des 2 000 € de bénéfices potentiels car les salariés peuvent s'assurer 1 000 € demain en refusant l'accord aujourd'hui, et en plus gagner 200 € aujourd'hui en travaillant ailleurs. Donc ils n'accepteront pas un accord qui leur donnerait moins de 1 200 € sur les 2 000 €. La règle de partage égal des gains futurs restants ne s'applique plus à la totalité de la somme, mais au solde, une fois enlevé le revenu que les salariés peuvent s'assurer de toute façon : 1 000 - 200 = 800 Ces 800 € seront donc partagés également et le patron obtiendra 400 et les salariés 600. Les opportunités extérieures des salariés deviennent un handicap pour le patron dans les négociations. De manière similaire, une opportunité extérieure pour le patron lui aurait donné un avantage dans les négociations (s'il peut louer sa paillote à quelqu'un d'autre pendant la grève, par exemple). Si les salariés peuvent obtenir 200 € en travaillant ailleurs chaque jour de grève et le patron, 300 € en louant sa paillote, il ne reste plus que 500 € à partager dans le cadre de la négociation. Jeux de négociation • 115
1 000 - (200 + 300) = 500 = 2 x 250 Dans ce cas, les salariés obtiendront : 200 + 250 = 450 Et le patron : 300 + 250 = 550 Ces observations se généralisent en fait assez facilement. Dans les négociations, la partie qui est la plus patiente obtiendra la part la plus grande. U impatience doit être comprise ici comme le besoin d'arriver vite à un accord. La partie qui peut supporter relativement plus facilement l'absence d'accord pourra obtenir la part la plus importante dans la négociation. IV. Stratégies pour affaiblir l'autre partie Dans les deux exemples précédents, nous observons que : - dans le premier cas, les salariés obtiennent un gain supplémentaire de 200 € par rapport à leur patron ; - dans le second cas, le patron obtient un gain supplémentaire de 100 € par rapport aux salariés. Ces gains supplémentaires correspondent à l'opportunité extérieure relative de chaque partie par rapport à celle de l'autre (cf. tableau 6.5). Tableau 6.5 Opportunités extérieures et avantage dans les négociations. Partie Cas 1 Cas 2 Salariés 200 200 Patron 0 300 Différence 200 -100 Part des salariés 600 450 Par conséquent, on peut être amené à adopter une stratégie qui réduit nos opportunités extérieures si elle réduit encore plus celles de l'autre partie. Ce qui peut parfois engager les parties dans une escalade qui risque de devenir coûteuse collectivement. C'est ainsi qu'une menace de grève peut finir par conduire à la grève elle-même, même si aucune des parties ne la désirait vraiment. Il suffit pour cela qu'on apprécie mal les opportunités extérieures ou la patience de l'autre partie. À nouveau, c'est la partie qui a le plus d'opportunités extérieures qui aura recours à ce type de stratégie d'escalade. Dans une grève, les salariés vont essayer de rendre crédible la menace d'une grève longue et coûteuse et le patron va essayer de convaincre les salariés qu'il peut supporter facilement une telle grève et qu'elle sera donc effectivement coûteuse pour les salariés. 116 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Une petite erreur d'appréciation quant aux opportunités extérieures de l'autre partie peut conduire au blocage des négociations. Il faut donc savoir bien apprécier jusqu'où on peut pousser l'adversaire pour ne pas avoir des surprises. ercices Exercice 6.1 Le producteur de jeux MegaGames et la société Apple négocient pour déterminer la manière dont les profits réalisés par MegaGames, grâce aux ventes sur AppStore (la boutique de vente en ligne d'Apple), vont être partagés. Soit P le montant de ces profits pour une année. La création des jeux que MegaGames va proposer sur AppStore lui a déjà coûté P/4. Apple fait une offre à prendre et à laisser à MegaGames. 1. Quel montant pourrait réclamer Apple ? 2. Même question si MegaGames peut facilement transformer ses jeux pour les proposer sur Android Market (la boutique de vente en ligne de Google) et réaliser un profit de P/2. Solution 1. L'investissement de MegaGames étant déjà effectué de manière irréversible, il ne peut pas peser directement sur la négociation et tout profit obtenu par lui est préférable à rien. Dans ces conditions, Apple pourrait réclamer la presque totalité de ces profits. 2. Dans ce cas, MegaGames refuserait toute offre qui ne lui laisserait pas au moins PI2 de profit. Par conséquent, Apple ne peut réclamer plus de PI2 de profits. Exercice 6.2 Dilbert et Dogbert cherchent à partager une prime de 100 €. Dilbert fait une offre à Dogbert : il propose de garder une partie (s\) de la somme et de laisser (100 — s\) à Dogbert. Si Dogbert refuse cette offre, il fera une offre à son tour mais cette offre lui coûtera 10 € : il proposera alors de garder la partie (s2) de la somme à partager et de laisser (100 — s2) à Dilbert. Si ce dernier refuse cette offre, il fera à son tour une offre fo) après avoir payé un coût c. Si aucune offre n'a été acceptée au bout des trois essais, la prime est attribuée à Catbert. 1. Quel serait le partage d'équilibre si c = 0 ? 1. Même question si c = 90. 2. Même question si c = 10. 3. Même question si c = 0 mais qu'il est bien connu de tout le monde que Dogbert ne supporterait pas une offre de s\ = 100 de la part de Dilbert et qu'il bloquerait les négociations et laisserait les 100 € à Catbert pour se venger. NB : Dilbert, Dogbert et Catbert sont des personnages créés par Scott Adams. H9ËX Jeux de négociation • 117
Solution 1. La structure du problème de négociation peut être résumée dans le tableau suivant : Période 1 2 3 4 Offreur Dilbert Dogbert Dilbert Catbert ! Demande maximale 100 100 100 Demande 100 0 100 Gain 100 0 100 100 À la troisième étape, Dilbert pourra demander la totalité de la prime. Anticipant cela, à la deuxième étape, Dogbert ne pourra demander plus que 0. Ce qui conduit à un accord dès la première période où Dilbert obtient la totalité de la prime : (100, 0). Sa menace de récupérer la totalité de la prime à la dernière période lui permet de s'assurer ce gain dès la première période. 2. La structure du problème de négociation peut être résumée dans le tableau suivant : Période 1 2 3 4 Offreur Dilbert Dogbert Dilbert Catbert ! Demande maximale 100 100 100 Demande 20 90 100 Gain 20 80 10 100 Cette fois-ci, le maximum que peut s'assurer Dilbert à la dernière période est 100-90 = 10. Anticipant cela, Dogbert ne lui laissera plus pendant sa proposition de la seconde étape. Étant donné que Dogbert peut s'assurer 80 à cette étape-là, Dilbert ne pourra obtenir plus que 20 à la première période : (20, 80). 3. Il s'agit de la situation inverse par rapport au cas 2. Nous résumons à nouveau les étapes de la négociation dans un tableau : Période 1 2 3 4 Offreur Dilbert Dogbert Dilbert Catbert ! Demande maximale 100 100 100 Demande 100 10 100 Gain 100 0 90 100 Dilbert pourra à nouveau récupérer la totalité de la prime dès la première période, puisque Dogbert ne peut obtenir un gain supérieur à 0 en refusant cette offre : (100,0). 4. Ce cas est similaire au cas 1, mais Dilbert, craignant la réaction brutale de Dogbert, ne peut proposer de récupérer la totalité de la prime. Il doit laisser une part suffisante (A) à ce dernier pour que le partage ne lui paraisse pas trop injuste : (100 - A, A). Période 1 2 3 4 Offreur Dilbert Dogbert Dilbert Catbert ! Demande maximale 100 100 100 Demande 100 -A A 100-A Gain 100-A A 100-A 100 118 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Troisième partie V Jeux non coopératifs avec information incomplète 7» Jeux simultanés avec information incomplète 121 o. Jeux séquentiels avec information incomplète 137
7.1 eux simultanés avec information incomplète Dans les jeux que nous avons étudiés jusqu'à maintenant, nous avons chaque fois supposé que les joueurs connaissent toutes les données du problème auquel ils sont confrontés. Cela correspond par exemple au cas du jeu d'échecs où les joueurs connaissent les règles du jeu et où ils observent tous les coups qui ont eu lieu avant chaque fois qu'ils doivent jouer. Ce n'est pas du tout le cas d'un jeu de cartes comme le poker où chaque joueur dispose d'une information à laquelle il est le seul à avoir accès : les cartes qu'il a en main. Alors chaque joueur doit non seulement anticiper la stratégie de ses concurrents pour mieux les contrer, mais aussi deviner leur main. Quand le jeu est séquentiel (comme le poker), la principale préoccupation de ses adversaires est alors de brouiller ces anticipations en cherchant à le tromper par le bluff. Les jeux en information incomplète (ou les jeux bayésiens) cherchent à analyser ce type de situation où les joueurs ne connaissent pas parfaitement les données du jeu. Le problème majeur dans ce cas est bien sûr l'incomplétude : si les joueurs ne connaissent pas parfaitement le jeu, comment peuvent-ils réagir de manière rationnelle et à quel type de résultats pourrons-nous aboutir dans ce type de jeu ? Si l'incomplétude ne peut être corrigée, il n'y a pas de réponse à ces questions. Concepts clés étudiés : Ce chapitre est consacré à l'analyse des jeux statiques en information incomplète : - compléter l'information avec la méthode de Harsanyi ; - les types d'un joueur ; - la forme normale des jeux statiques bayésiens ; - les croyances des joueurs dans un jeu bayésien ; - la règle de Bayes ; - la définition des stratégies dans un jeu bayésien ; - les stratégies mélangeantes et séparatrices ; - l'équilibre de Nash bayésien. Jeux simultanés avec information incomplète • 121
I. Le rôle de la Nature Harsanyi (1967-68) a le premier développé l'outil nécessaire à la modélisation de ce type de situation qui correspond à l'incomplétude de l'information dans un jeu stratégique. Considérons un jeu stratégique J opposant deux joueurs. Le joueur 1 connaît parfaitement les gains résultant de chaque paire de stratégies possibles, tandis que le joueur 2 ne les connaît pas parfaitement. Ce dernier ignore donc une composante essentielle du jeu. Chacun connaît néanmoins la liste des stratégies qui est à la disposition de chaque joueur. Supposons qu'elles soient en nombre fini. Comme le joueur 2 ne connaît pas précisément les gains du jeu auquel il participe, il possède des croyances sur ces gains. Ces croyances sont représentées sous la forme d'un ensemble de fonctions de gains possibles et de probabilités attachées à chacune de ces fonctions. Notons par Jk le jeu correspondant au /rième fonction de gain et pk la probabilité que le vrai jeu auquel le joueur est confronté soit Jk. Chacun de ces jeux a exactement la même structure, sinon le joueur 2 pourrait deviner à quel jeu il participe en observant cette structure. De plus, le joueur 2 sait que le joueur 1 connaît parfaitement le jeu. La manière dont le joueur 2 perçoit le jeu peut être représentée, selon Harsanyi, par un coup initial d'un joueur fictif, la Nature, qui choisit le jeu (figure 7.1). P\/ : Nature .<^-—^*—*/* Figure 7.1 Passage à Vinformation imparfaite. D'abord la Nature tire au hasard le vrai jeu auquel doivent jouer les deux joueurs, ensuite le joueur 1 est informé de ce choix et les joueurs jouent. Le dé qu'utilise la Nature possède autant de faces que le nombre de jeux possibles et ce dé est truqué de telle manière que la probabilité pk que le jeu Jk soit tiré corresponde exactement aux croyances du joueur 2. Harsanyi propose donc de remplacer le jeu stratégique en information incomplète J par un jeu séquentiel en information complète (mais imparfaite), 122 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
/', où la Nature joue le premier. L'asymétrie entre les deux joueurs ne disparaît pour autant dans /'. Elle est transposée de la définition des règles du jeu (les deux joueurs font maintenant face au même jeu) vers la définition des stratégies dont disposent les deux joueurs. Maintenant, le manque d'information du joueur 2 se traduira par un manque d'observation, celle du coup joué par la Nature, tandis ce coup sera parfaitement observé par le joueur 1. La stratégie du joueur 1 va prescrire une action différente pour chacun des jeux possibles, tandis que la stratégie du joueur 2 ne précisera qu'une seule action pour tous les jeux, indépendamment du choix de la Nature, puisqu'il ne peut observer ce choix (et il ne peut distinguer les différents nœuds qui sont conditionnés par ce choix - ils appartiennent nécessairement au même ensemble d'information). Dans un contexte dynamique, les choix du joueur 1 auront un intérêt par- ticulier pour le joueur 2 dans la mesure où ces choix suivent l'observation du choix de la Nature. C'est dans ce contexte que des phénomènes vraiment intéressants, comme l'utilisation des choix comme des signaux ou la révélation de l'information privée, peuvent apparaître. Nous allons considérer ces possibilités dans le prochain chapitre. Nous pouvons néanmoins déjà observer que l'information incomplète, qu'on complète pour la rendre imparfaite, modifie considérablement les jeux et la manière dont on peut les résoudre. Une application va nous permettre de clarifier cette approche avant d'aller plus loin. II. Application : le duopole de Cournot sous information incomplète Considérons un duopole produisant un bien homogène dont la demande inverse est donnée par/?(g) = A — Q. Les fonctions de coûts des deux firmes qui se font concurrence en quantités sont données par Ci(qi) =c(qiy i = 1,2 avec C\ parfaitement connu par les deux firmes, tandis qu'il existe une incertitude pour la firme 1 sur c2 car elle ne l'observe pas : c2 £ {cF>cE} avec cE > C\ > cF. P[cF] = a = 1 — P[cE] donne la probabilité que la firme 2 ait des coûts faibles (figure 7.2, page suivante). La firme 2 connaît bien sûr ses coûts. Jeux simultanés avec information incomplète • 123
Figure 7.2 Distribution des coûts de la firme 2. La fonction de meilleure réponse de la firme 2 dépend de son type de coût : max (A — q\ — q2)q2 — cFq2i si c2 = cF n max (A-q* - q2)q2 ~ cEq2i si c2 = cE La production optimale de la firme dépendra bien sûr de ses coûts et la firme 1 doit tenir compte de cela. Soit q\(cF) la quantité qu'elle attend du type faible et ql(cE), celle attendue du type élevé. La firme 1 sait que la probabilité de faire face au type F est a. Elle doit alors maximiser son profit espéré max a [(A -qx- q2{cF))qx - cxqA +(1 - a) [(A -qx- q2(cE))qx - cxqx] Les meilleures réponses des firmes résulteront alors des conditions de premier ordre de ces problèmes q2(qi ; cF) = A A -1i 2 -tfi -cF -cE et nous avons alors q2(q\ ; cE) = q2(q\ ; cF) > q*(qx ; cE), Vqx et E[q2] = Le problème de la firme 1 devient alors : max(A-^! -E[q2]-cx)qx <71 124 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
et il conduit à la fonction de meilleure réponse suivante : A - E[q2] - c, q"x(qi) = j _ A - [aq2(cF) + (1 - a)q2(cE)] - C\ 2 Dans ce jeu simultané, l'équilibre de Nash correspond à une situation dont aucune firme n'a intérêt à dévier ; ce qui correspond à l'intersection de q\{q2) avec E[q2] (point E dans la figure 7.3, page suivante). Du fait de l'incertitude de la firme 1, les deux types de la firme 2 se trouvent liés , A + E[c2] - 2c, q2(cF) = q2(cE) = 3 1A - E[c2] + 2c, - 3cF 6 1A - E[c2] + 2c, - 3cE 6 avec q2(cF) > q2(cE) puisque cE > cF (respectivement q£ et q£ dans la figure 7.3, page suivante). On peut récrire ces quantités d'équilibre pour faciliter la comparaison avec la production de la firme 2 en information complète (les points EF et EE représentent les équilibres qu'on aurait eu en information complète) : A — lCj + c,.,. 1ï = 3 i,i#y = l,2 qïicF) = ^ L - (cE ~ cF)(l - A-2cF + c, A - 2cF + c, -«)< ^ A - 2cE + c, Dans l'équilibre de Nash avec information incomplète, la firme avec des coûts élevés produit plus que ses quantités de Cournot et celle avec des coûts faibles est amenée à produire moins que ses quantités en information complète : l'incertitude de son concurrent l'empêche de profiter pleinement de ses coûts faibles car elle sait que la réaction de son concurrent va résulter d'une espérance qui inclut nécessairement cE : q*\cF <q\ <qî\cE et la firme 2 doit en tenir compte pour éviter une baisse trop forte du prix. Jeux simultanés avec information incomplète • 125
Figure 7.3 Duopole de Cournot en information incomplète. ■ > Remarque 7.1 Dans cet exemple la prise en compte des espérances des profits et des quantités se réduit au remplacement de c2 par son espérance. Si les coûts n'interviennent pas de manière linéaire, cela ne sera pas nécessairement le cas. ■ > Remarque 7.2 Du fait de l'imperfection de l'information de la firme 1, les deux jeux (l'un avec cF et l'autre avec cE) sont liés et l'on ne peut les résoudre séparément. Comment pouvons-nous généraliser l'approche que nous avons utilisée pour résoudre ce jeu ? Ml. Equilibre de Nash bayésien Nous avons complété l'information en considérant que la firme 2 pouvait être de deux types différents et que la firme 1 n'observait pas le choix du type de son concurrent par la Nature. Chaque fois que l'incertitude porte sur une des caractéristiques d'un joueur, nous pouvons représenter les différents états de la Nature comme des types différents de ce joueur. Quand l'incertitude porte sur une autre caractéristique du jeu, il est quand même souvent possible d'utiliser cette approche pour compléter l'information, en modifiant notamment les gains des joueurs en conséquence pour les rendre dépendants de son type : w,(s ; tf) qui est connu par le joueur i pour tout type possible tt de ce joueur. 126 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Dans le jeu précédent : t2 e {cFi cE] et t\ e {c\} et les fonctions de gains sont 7ix(quq2 ; cx) pour le joueur 1, n2(quq2 ; cE) et 7t2(quq2 ; cF) pour le joueur 2. Étant donnés les types possibles de tous les joueurs (contenus dans 7} pour chaque joueur), t = (t\y..., t„) représente une distribution particulière des types t e T = X Tj. Dans notre exemple de duopole des joueurs T = {(cucF), (cucE)} avec Tx = {c^ et T2 = {cF,cE}. Nous pouvons alors noter, comme pour un profil de stratégies, par f_. = (r,,..., *._,, ti+i,..., tn) une distribution particulière des types de tous les joueurs sauf celui du joueur /. Dans cette approche le joueur i connaît son propre type f, mais il a juste une distribution de probabilités conditionnelles sur les types des autres joueurs : Pi(t-i\ti). Si les types des joueurs sont indépendants, cette distribution se réduit à/?,-(*_,■) comme c'est le cas dans notre exemple. J6 Mfc Dl5AI£...PAPA EÔT un type &anal ,mai£ ce n'e^t peut-être que PB LA COMéD\& i P6UT-ETGE QUAPÛEfc NOU& AVOIR COUCWÉ6, PARA ENFILE UN CO&TUMe e»J2Acne et rapt com - &ATTOE l£ CfclMg. PEUT- ETRE QUE SON RÔLE DE " RAPA" E3TJU6TE UNE lD6NTlTé 6ECflëTE ? peuT-ÉTce Que tewAice L'APPELLE SUP UNe U6NE eeccère qoànp la ville e^T 6N DAUGta » PEOT- éTce que c eer un euPEft [ Wé£0& MA9Qué.' ^ FI ei c'était VPAl, IL CONDUIRAIT UNE v/oiToPePUi&y i J££>A!€>. UNÔTCe / N'A MEME PAC» DE £ADIO- LCA&eETT6- 1 ! Ljî/ CALVIN AND HOBBES © 1991 Waterson. Reprinted with permission of Universal Press Syndicate. Ail riglits reserved. © 1993 Hors Collection/Presses de la Cité pour l'édition française. Figure 7.4 Connais-tu le type de papa ?... La représentation en termes de types nous permet de formuler un cadre général pour analyser ce type de jeux. iDéfînition 7.1 ^ Un jeu bayésien statique en forme normale est décrit par les éléments suivants : - Un ensemble de n joueurs : / = {1, 2,..., n}. - Pour chaque joueur /, / e I, - un ensemble d'action A,-, qui contient toutes les actions possibles de ce joueur et un ensemble 7} qui contient les différents types possibles de ce joueur, ax e A,- est une action particulière du joueur / et t; e Tj est un type du joueur /. Soit T = X Tt l'ensemble des types des joueurs et /e/ t e T, un profil de types. Jeux simultanés avec information incomplète • 127
myy- une fonction de gain (VNM), uh qui représente les préférences du joueur! r^ / et qui donne la valeur pour le joueur / de chaque résultat du jeu étant - u-t\ [X Ai ) XT (aua2,.. ■, an ; tu t2l..., t„) f-> w,(a ; t). (7.1) "| ^ - une distribution de probabilités p-x qui donne ses croyances quant aux^ types des autres joueurs ,jj Pi- r-^[o,i] j (*1, '2,..., *„)»-► Piit-Mi). i qui résulte de la règle de Bayes quand elle peut être appliquée après la révélation de son type au joueur / Mt-i\ti) = —— = -= (7.2) | Le dernier élément de cette définition donne son nom à ce type de jeux. S V tKBl Sections 3.6.2 et 10.5. Les stratégies d'un joueur dans ce jeu doivent être construites à partir de l'ensemble des actions du joueur et de son ensemble de types : j Définition 7.2 Une stratégie du joueur / n'est pas directement donnée dans la définition du jeu mais elle est définie de manière à préciser une action pour chaque type tj e T{ à partir de l'ensemble des actions A,- : s-, : T, -> A-, ^;:^;.r'-1'.-..,-1V:':.!..---ir ':- V, .■-<■■■■ • • * ^ ■*''(''") = ai\: ■ - ' . :■ -:;-. .-'-' On parle alors de stratégie séparatrice quand chaque type choisit une action différente et de stratégie mélangeante (pooling strategy) quand tous les types du joueur choisissent la même action. Cette distinction jouera surtout un rôle quand nous allons considérer les jeux dynamiques. Cette définition des stratégies peut paraître assez lourde et, en quelques sorte, superflue dans la mesure où elle demande la précision d'une action pour chaque type du joueur i. Or, une fois que la Nature a choisi le type de chaque joueur, avons-nous besoin de préciser ce que vont faire les autres types ? L'optimalité des choix du type r, R 128 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
La règle de Bayes et le théorème du même nom, se basent sur les^ propriétés des distributions de probabilités conditionnelles. En effet, la probabilité conditionnelle de l'événement 9 sachant que l'événement x s'est déjà produit se note par /?[0|.x:]. Si p[9,x] est la probabilité que l'événement 9 et F événement x se produisent et p[9] et p[x] sont les probabilités a priori des événements 9 et.*, cette probabilité conditionnelle se définit de la manière gsuivante : P[e\x] = ^^. p[x] . Imaginons maintenant qu'un joueur doit prendre une décision qui dépend d'une variable aléatoire 9 e £2 et qu'il a la possibilité d'observer un événement x auquel est lié 9. Soit/(#) la fonction de densité a priori de 9 pour ce joueur. S'il connaît la distribution conditionnelle /?[.*" !#] pour tout 9 avec/(jr|0) la fonction de densité correspondante, après avoir observé une réalisation x, le joueur peut en déduire la distribution de probabilité a ^posteriori induite par cette observation en utilisant le Théorème de Bayes /(9w-57ôww (7'3) si nous avons des distributions discrètes. Le résultat (7.3) correspond à la règle de Bayes (voir Cyert & DeGroot (1987) pour d'autres applications de l'approche bayésienne en économie). dépend de ce que les autres joueurs vont faire et ce que les autres joueurs vont faire dépend de ce que le joueur i aurait fait s'il avait un autre type. Dans le duopole de Cournot la firme 1 tient compte des quantités possibles des deux types de la firme 2 et cela conditionne le choix optimal de chaque type à l'équilibre. L'utilisation de la règle de Bayes dans la définition du jeu (condition (7.2)) implique que la distribution de probabilités a priori, p(t)> utilisée pour représenter l'incertitude concernant le choix de la Nature, soit connaissance commune pour les joueurs. Si les joueurs ne partagent pas cette connaissance commune, leurs croyances sont quelconques et, par conséquent, leurs comportements ne peuvent être anticipés par les autres joueurs. C'est uniquement sous cette condition que nous pouvons résoudre ce type de jeu et prédire leur conséquence. L'optimalité des choix de chaque joueur dépend dans ce jeu de ses actions, mais aussi de son type et de ses croyances quant au type des autres joueurs étant donné que ce type va conditionner leurs choix. L'équilibre de Nash de ce jeu peut maintenant être défini de manière habituelle : la stratégie d'équilibre de chaque joueur doit être sa meilleure réponse aux stratégies d'équilibres des autres joueurs et cela pour tous les types, et étant données les croyances. Jeux simultanés avec information incomplète • 129
* Définition 7.3 L'équilibre de Nash en stratégies pures d'un jeu statique bayésien est^ un profil de stratégies s* = (s*,.. .s*) si s*(t,) est la solution du problème suivant pour chaque joueur / et pour chacun des types ts e Ts de ce joueur i (Vî,Vff-g7}) : max Y] Ui(s*(fx)9... ,*;_,(//_,), a,, ^fo+i),..., <(i„) ; t) x M'-/k/) .-.•^ss^^v.-^s- afcJtit"4fe«Ui^iSJ t; -^»-^ - -... ■ i -. — *\ t., Donc la stratégie d'équilibre du joueur i maximise son utilité espérée pour chacun de ses types. Par conséquent, quel que soit son type, le joueur / n'aura pas intérêt à dévier de sa stratégie d'équilibre si les autres joueurs continuent à jouer leur stratégie d'équilibre quel que soit leur type. Il s'agit bien d'un équilibre de Nash construit de manière à couvrir toutes les combinaisons des types de joueurs. Cette approche devient vraiment intéressante quand on s'intéresse aux jeux dynamiques. ►* ercices Exercice 7.1 Considérez un jeu simultané dans lequel les ensembles de stratégies des deux joueurs sont donnés par Si = {—2, 0, 1). La fonction d'utilité du joueur 1 est connue avec certitude par les deux joueurs et elle est donnée par u\ (s) = s\. Mais le joueur 1 ne connaît pas exactement celle du joueur 2 qui peut être de deux types u^is) = s\s2 ou u%(s) = (sis2)2 avec P[A] = l- = 1 - P[B] L'information est asymétrique dans la mesure où le joueur 2 connaît bien sûr sa fonction d'utilité. Tous ces éléments sont par ailleurs connaissance commune. 1. Donnez les types des deux joueurs. 2. Donnez la forme normale du jeu correspondant à chacun des types du joueur 2. Déterminez les équilibres de Nash dans ces jeux. 3. Donnez l'arbre du jeu après avoir complété l'information avec la méthode de Harsanyi. 4. Représentez ce jeu complet en forme normale. 5. Déterminez les fonctions des meilleures réponses du joueur 1 et des deux types du joueur 2. 6. Déterminez l'équilibre de Nash bayésien de ce jeu. 130 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Solution L'information est asymétrique dans la mesure où le joueur 2 connaît sa fonction d'utilité. Tous ces éléments sont par ailleurs connaissance commune. 1. Les types des deux joueurs sont respectivement T\ = {t\} et T2 = {A,B}. 2. Les formes normales des deux jeux peuvent être représentées dans un tableau Tableau 7.1 Jeu avec le type A. -2 Joueur 1 o 1 Joueur 2 -2 0 1 (4,4) (4,0) (4,-2) (0,0) (0,0) (0,0) (1,-2) (1,0) (1,1) Tableau 7.2 Jeu avec le type B. -2 Joueur 1 o 1 Joueur 2 -2 0 1 (4,16) (4,0) (4,4) (0,0) (0,0) (0,0) (1,4) (1,0) (1,1) Quel que soit le jeu, les deux dernières stratégies (0 et 1) du joueur 1 sont dominées par sa première stratégie : -2. Dans les jeux réduits, la meilleure réponse du joueur 2 à cette stratégie est -2 dans le jeu A et dans le jeu B. Donc les équilibres de Nash sont (-2, -2) dans le jeu A et (-2, -2), dans le jeu B. 3. L'arbre du jeu représente le choix de la Nature et le fait que ce choix n'est observé que par la firme 2 (figure 6.5). 4. Le joueur 1 a un seul ensemble d'information tandis que le joueur 2 en possède deux. La forme normale de ce jeu représente cette situation : "2 Joueur1 0 1 Joueur 2 Type A -2 0 1 (4,4) (4,0) (4,-2) (0,0) (0,0) (0,0) (1,-2) (1,0) (1,1) Typefl -2 0 1 (4,16) (4,0) (4,4) (0,0) (0,0) (0,0) (1,4) (1,0) (1,1) Jeux simultanés avec information incomplète • 131
-2 / ■ L \° V Joueur 1 -2, / /. V V c^~. \J—, -2 -2 \L-L : -2 SjLI -2 -2 (ui,u2) (4,16) (0,0) (1,4) (4,0) (0,0) (1,0) (4,4) (0,0) (1,1) (4,4) (0,0) (1,-2) (4,0) (0,0) (1,0) (4,-2) (0,0) (1,1) Figure 7.5 5. La meilleure réponse du joueur 1 est - 2 quelque soit la stratégie du joueur 2 (c'est une stratégie dominante). La fonction de meilleure réponse du type A du joueur 2 est f -2 si s, = -2 s2*(s,)= I {-2,0,1} si «i=0 Il si Si = 1 La fonction de meilleure réponse du type B du joueur 2 est si s\ — —2 s2*(s,) = r-2 {-2,0,1} si sx =0 —2 si si = 1 6. L'équilibre de Nash bayésien de ce jeu est donc un triplet (■s*,(^,Sfl)) = (-2, (-2,-2)). V V " Note : Cet exercice est un peu particulier dans la mesure où le choix optimal du joueur moins informé ne dépend pas du type de son adversaire et donc on n'a pas besoin de considérer la maximisation de l'utilité espérée pour lui. 132 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Exercice 7.2 Reconsidérez le duopole de Cournot de l'application mais avec une incertitude initiale sur la demande. La fonction de demande sur le marché peut être de deux niveaux selon la conjoncture : A e {AFi AE], AF < AE avec P[AF] = a = 1 — P[AE]. Les fonctions de coûts des deux firmes sont symétriques : C,(#,) = cqitc < AF. L'information est asymétrique dans la mesure où la firme 1 connaît parfaitement le niveau de la demande tandis que la firme 2 ne possède que les croyances a priori données ci-dessus. Tous ces éléments sont connaissance commune. 1. Définissez les ensembles de types des joueurs. 2. Définissez les stratégies des joueurs. 3. Définissez l'équilibre de Nash bayésien pour ce jeu. 4. Déterminez cet équilibre. Solution 1. Les ensembles de types des joueurs : T\ = {AFl AE], T2 = {/}. Ce qui est nouveau ici est le fait que le profit de la firme 2 dépend maintenant du type de son concurrent : 7t2(g\, qi ; '0 = Ci - q\ - qi - c)q2. Ce qui est incertain. La firme 2 doit donc maximiser son profit espéré (elle est neutre au risque) E [n2(qu q2)] = a(AF -qx-q2- c)q2 +(1 - a)(AE -q\-q2- c)q2 2. Les stratégies des joueurs doivent maintenant préciser une action pour chaque combinaison des types des joueurs sx(AF) = qlF, Sx(AE) = qf, s2(t2) = q2. 3. L'équilibre de Nash bayésien de ce jeu doit correspondre à des stratégies qui maximise le profit espéré de chaque firme pour chacun de ses types : (.s*(A/r),1s*(A£),.S2('2)) tel que s*(af) = argmax {AF - q{ - s^(t2) - cjqx (/) s*(AE) = argmax ( AE - qx - s^(t2) - c)qi (II) s*(t2) = argmax \a[AF - s^(AF) - q2 - cjq2 +(1 - a)[AE - sï(AE) -q2- c)q2] (III) Les conditions (/) et (II) assurent qu'aucun des types de la firme 1 n'a intérêt à changer de stratégie. La condition (III) assure que la firme 2 n'a pas intérêt à changer de stratégie. L'équilibre est constitué par l'intersection des solutions de ces trois problèmes. Jeux simultanés avec information incomplète • 133
4. Pour déterminer l'équilibre on doit chercher l'intersection des fonctions de meilleures réponses. Avec : E[A] = aAF + (l-a)AE E[sï] = asï(AF) + (l-a)si(AE) La meilleure réponse de la firme 2 est donnée par : aE[jr2(tf,fc)] _ E[A]-2q2-E[Sl]-c = 0 E[A]-E[Sl]-c tâ (s\) = 2 (/V) Les meilleures réponses des deux types de la firme 1 sont données par : dnAqXiq2\ tx) —^ -=o dqi tl-q2-2s;(tl)-c = 0 *{ .\ h-qi-c *r(*;*i) = —2— q*M2,AF)=AF~q22-C (V) 4te;AE)=AE-*-c (vi) L'équilibre (q*(Ap),q*(AE),q2f sera donné par l'intersection des conditions (IV), (V) et (Vf). En substituant (V) et (VI) dans (IV), nous pouvons déterminer q\ : E[A] _^AL-^-1 + {x_a)A£-^-1yi H2 2 g[A]- 2 -c £[A] + g._c 92 _ 2 _ 4 =>«î = ^ cm En substituant (V7/) dans (V) et (V7), on obtient respectivement q*(AF) et 9*(/4£) : £[A]-c .,. , Af~ 3 ~C 3AF-E[A]-2c qî(AF) = ^ = . £[A]-c ... , Ae~ 3 ~C 3A£-£[A]-2c «fG^c) = 7T = 2 134 • JEUX NON COOPÉRATIFS AVEC INFORMATION INCOMPLÈTE
Si A était connu dès le début, on aurait eu les quantités de Cournot correspondant à A-c Or nos pouvons écrire les quantités q*(AF) et q\(AE) de manière à pouvoir les comparer aux quantités obtenues avec les deux valeurs de A dans le cas avec certitude : car (AF — A/r) < 0 et 1 — a > 0 ; *iA ^ \ae~^ , (Ae ~ AF) qx{AE) = —-— +a > q;\A=AE Donc, dans le cas avec information asymétrique, la firme 1 produit plus que sa quantité de Cournot en certitude quand A = AE et moins que cette quantité quand A = AF. Cela provient du fait que les quantités de la firme 2 ne peuvent s'ajuster pleinement à la demande quand elle ignore cette demande (ses quantités sont basées sur E[A], au lieu de AF ou AE) : AF-c ^ AE-c —r— <<Ï2 < —;— • Jeux simultanés avec information incomplète • 135
■ Jeux séquentiels avec information incomplète ans les jeux dynamiques avec information incomplète, on complète l'information exactement de la même manière que pour les jeux statiques, en introduisant un coup initial par le joueur fictif « Nature ». Dans un jeu séquentiel, les choix d'un joueur informé de son type pourraient être observés par les autres joueurs qui jouent après lui et ces choix pourraient alors les informer sur le type choisi par la Nature pour ce joueur. Mais chaque joueur est conscient de cette possibilité et cherchera a en tirer parti en influençant les croyances des autres joueurs : il pourra alors émettre un signal grâce à ces choix. Avant d'aller plus loin dans l'analyse de ce contexte riche en interactions, nous pouvons déjà remarquer que la présence de l'information incomplète implique une diminution de la pertinence du concept d'EPSJ. Concepts clés étudiés: Ce chapitre est consacré à l'analyse des jeux dynamiques en information incomplète : •};;&* - l'insuffisance de l'équilibre parfait en sous-jeux ; ,^y - la rationalité séquentielle ; ;.,.^ - l'équilibre bayésien parfait ; - les équilibres séparateurs et mélangeants. CALVIN AND HOBBES ©1990 Waterson.Reprinted with permission of Universal Press Syndicate. Ail rights reserved. ©1992 Presses de la Cité pour l'édition française. Figure 8.1 Attention au signal... D Jeux séquentiels avec information incomplète • 137
I. La perfection en sous-jeux devient insuffisante La perfection en sous-jeux est une propriété désirable des solutions des jeux en information incomplète, mais l'imperfection de l'information de certains joueurs implique que quand c'est leur tour de jouer, ils ne sauront pas nécessairement dans quel sous-jeu ils se trouvent. Pour observer cela reconsidérons le Jeu de l'Entrée I (figure 8.2). Figure 8.2 Le jeu de Ventrée I (reprise). L'EPSJ de ce jeu est bien sûr (Entrer, Coopérer) tandis que les équilibres de Nash sont (Entrer, Coopérer) et (Non, Combattre). L'EPSJ élimine donc la menace non-crédible de Combattre face à l'entrée. Exemple 8.1 (Le Jeu de l'Entrée IV) Imaginons maintenant que deux types d'entrant puissent se présenter devant ce marché : un entrant avec des coûts de production faibles (B) et donc relativement agressif, et un entrant avec des coûts élevés (H). La firme installée ne connaît pas le type de l'entrant auquel elle est confrontée. Elle a les croyances suivantes: pB = 0.5 et pH =0.5. L'entrant connaît bien sûr ses coûts, donc son type, ainsi que les croyances a priori de la firme installée. Nous représentons l'arbre modifié de ce jeu en information incomplète dans la figure 8.3, page ci-contre. Le concept d'EPSJ n'apporte rien dans ce jeu car le seul sous-jeu est le jeu en entier. Cela provient du fait que les nœuds I\ et I2 de la firme installée appartiennent au même ensemble d'information car, n'ayant pas observé le type de l'entrant, elle ne peut distinguer ces deux nœuds. 138 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
B E1( —5 *" N- L0.5 Non H E2 Non Coopérer^ (40,50) II Entrer J Combattre^* (- 10,0) h: ►(0,300) Coopérer ., (40,50) Entrer / Combattre^ (-10, II/) -(0,300) Figure 8.3 Le jeu de l'entrée IV Nous paramétrisons par Y\t les gains de I dans le résultat (H, Entrer, Combattre) pour pouvoir étudier différentes situations du point de vue de l'asymétrie qui existe entre les deux types de l'entrant quand on le combat (il est a priori plus intéressant de combattre un entrant faible, donc avec des coûts élevés (H)). Si n7 = 1 alors l'information n'est en définitive pas fortement asymétrique. Les deux firmes savent que, face à l'entrée, I n'a pas intérêt à combattre. Ce que I ne sait pas c'est son gain exact (1 ou 0). Mais ici nous ne pouvons utiliser l'EPSJ pour éliminer les menaces non-crédibles. Par conséquent (Non, Combattre) reste un équilibre (de Nash). Si Von veut éliminer les menaces non- crédibles, nous devons affiner le concept d'équilibre. Pour comprendre le problème posé par l'EPSJ, reconsidérons le jeu de l'entrée II dans lequel l'EPSJ nous a permis d'éliminer l'équilibre de Nash ((Af,P),A) tout en laissant l'équilibre de Nash ((N,N),A) où, malgré l'absence de l'entrée, la firme installée augmente sa capacité (figure 8.4, page suivante). Cela est dû au fait que l'entrant ne peut distinguer les nœuds composant Ex et lafirme installée ne peut compter sur le fait que chacune de ses décisions sera suivie par une réaction optimale de l'entrant : Augmenter —> Non et Non —> Produire. Nous pouvons nous approcher de l'idée de l'EPSJ dans ce cadre : nous pouvons demander à l'entrant de choisir une stratégie optimale dans son ensemble d'information Eu étant données ses croyances concernant l'histoire du jeu. S'il pense qu'il y a une probabilité a pour que l'action choisie par la firme installée soit Augmenter, alors il choisira l'action qui maximise Jeux séquentiels avec information incomplète • 139
Augmenter Installer capacité^- E0^ Non\ capacité , Non * (0,100) E, r. Non Produire \ , Non Produire (»k,ui) (-50,40) ^ (-10,120) (50,60) (- 10,100) Figure 8.4 Le jeu de l'entrée II (reprise). son utilité espérée dans Ex E[u(Pwduire)] = a(-50 + (1 - a)50 = (1 - 2a)50 E[u(Non)] = a(-10) + (1 - a)(-10) = -10 1 E[u(Produire)] ^ E[u(Non)] 3 a ^ - (1 - 2a) ^ Si a ^ -, connaissant ces croyances et anticipant la décision de produire de l'entrant, la firme installée choisira alors d'éviter de payer le coût de la capacité supplémentaire et le seul équilibre qui reste est ((Installer, Produire), Non) où l'entrée a lieu. L'introduction des croyances dans ce contexte permet alors de compenser l'insuffisance de l'EPSJ dans la prédiction du résultat du jeu. Un équilibre correspond alors à la précision du profil de stratégies d'équilibre, accompagné d'un profil de croyances (une distribution par ensemble d'information) qui justifie l'optimalité de ce profil de stratégie. On peut alors reprendre l'idée de base de l'EPSJ qui impose que la stratégie de chaque joueur soit optimale étant donné le déroulement du jeu avant que ça soit son tour de jouer. On utilise alors le concept de rationalité séquentielle : pour chaque ensemble d'information de chaque joueur /, la stratégie (comportementale) du joueur i doit être sa meilleure réponse aux stratégies des autres joueurs, étant données les croyances du joueur i à cet ensemble d'information. Le concept d'équilibre bayésien parfait se base sur cette idée. 140 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
II. Equilibre bayésien parfait Reconsidérons le jeu de l'entrée IV. Lafîrme installée ne connaît pas le type de l'entrant potentiel mais elle observe bien son choix quant à l'entrée. Ne pourrait-elle pas chercher à en inférer le type de son concurrent ? Elle a ses croyances a priori quant au type de l'entrant. Elle pourrait alors chercher à calculer les probabilités : P(N = B/Entrer) et P(N = B/Non) après avoir observé une entrée ou une absence d'entrée. Mais alors l'entrant potentiel essayera de manipuler ces croyances expost étant donné qu'il connaît, par hypothèse, les croyances a priori de lafîrme installée et le fait que ce dernier observe son choix en vue d'en tirer une information. Donc il n'y a pas de solution simple à ce problème. Kreps &Wilson (1982) cherchent à résoudre ce problème. Ils partent des probabilités a priori communes à tous les joueurs, quant au choix de la Nature au début du jeu. Certains joueurs observent le choix de la Nature et ils actualisent en conséquence leurs croyances tandis que d'autres ne peuvent se baser que sur les choix des autres joueurs (les joueurs informés) pour actualiser leurs croyances. Cette actualisation est basée sur l'hypothèse que les joueurs jouent des stratégies optimales et, plus spécifiquement,que leurs stratégies d'équilibre sont conditionnées par leurs croyances. Mais comme l'équilibre lui-même dépend maintenant des croyances, on ne peut plus le définir uniquement en termes de stratégies. Avec une information asymétrique, l'équilibre doit préciser à la fois les stratégies qui sont optimales, étant données les croyances et les croyances qui sont rationnelles, étant données les stratégies optimales. Donc pour définir l'équilibre nous devons spécifier une combinaison de stratégies et de croyances. Combinaison que Kreps & Wilson appellent une évaluation. En fait, mathématiquement, l'équilibre est maintenant un point fixe dans l'espace des évaluations et non dans l'espace des stratégies. Après une observation,une manière assez habituelle en économie d'actualiser ses croyances est la règle de Bayes. Mais cela ne peut s'appliquer que pour les actions qui sont sur le chemin d'équilibre et donc qui ont une probabilité non-nulle d'être observées à l'équilibre. En dehors du chemin d'équilibre, la règle de Bayes ne peut être utilisée par les joueurs. Imaginons qu'à l'équilibre l'entrant entre toujours. Alors si la firme installée observe que l'entrée n'a pas eu lieu, que doit-elle en conclure quant à la probabilité suivante ? P(Non/H) • P(H) P(H/Non) = ' J P(Non) Jeux séquentiels avec information incomplète • 141
puisque P[Non] = 0 à l'équilibre et la règle de Bayes ne peut être utilisée pour définir cette probabilité ? Une manière naturelle de définir l'équilibre est alors de considérer une combinaison de stratégies qui est la meilleure réponse dans la mesure où les croyances d'équilibre suivent la règle de Bayes sur le chemin d'équilibre et ne contredisent pas cette règle en dehors de l'équilibre. ^Définition 8.1 —— :-■/...-----. -w,:,.^ [■..■■ Un Equilibre Bayésien Parfait (EBP) est une combinaison de stratégies':1 l et un ensemble de croyances jx* tels qu'à chaque nœud du jeu ; 1. Les stratégies dans le reste du jeu sont des meilleures réponses aux strate *''; gies spécifiées par l'équilibre et étant données les croyances d'équilibre ; ff 2. Les croyances à chaque nœud sont rationnelles, étant données les | ^. connaissances fournies par le jeu jusqu'à ce point : elles sont actualisées,/ selon la règle de Bayes quand cela est possible, à partir des croyances a yc priori et des actions observées des autres joueurs, sous l'hypothèse qu'ils \ fe>jouent leur stratégie d'équilibre. . .. ; , • • La première condition correspond à la rationalité séquentielle. La seconde condition impose la cohérence des croyances avec les stratégies. La règle de Bayes doit être appliquée en accord avec les actions précisées dans les stratégies d'équilibre, en tenant compte du fait que,pour chacun des nœuds contenus dans un ensemble d'information, la probabilité d'être atteint dépend des stratégies d'équilibre des joueurs qui jouent avant ce nœud. ■ > Remarque 8.1 Si les stratégies sont complètement mixtes alors la règle de Bayes peut toujours s'appliquer. ■ > Remarque 8.2 Le concept d'EBP étend donc le concept d'EPSJ aux jeux avec information incomplète. En cela, la condition (1) assure que tout EBP est aussi un EPSJ, étant donné le système de croyances qui le compose. Application : retour au jeu de l'entrée Si nous considérons uniquement les stratégies pures, nous avons uniquement deux types d'équilibres possibles du point de vue des croyances : -Les équilibres séparateurs où la stratégie d'équilibre de l'entrant révèle parfaitement son type (c'est une stratégie révélatrice). 142 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
- Les équilibres mélangeants où la stratégie d'équilibre de l'entrant n'apprend rien de plus que les croyances a priori à la firme installée (c'est une stratégie mélangeante). Donc si on a un équilibre séparateur, en observant la stratégie d'équilibre de l'entrant sE> la firme installée doit pouvoir en déduire son type avec certitude. Nous devons avoir dans ce cas H*{B/sE) = 1 ou n*(H/sl) = 1 (8.1) et /jL*(B/s)(Vs =£ s*e) est quelconque tout en respectant l'équilibre (sE,s*). Dans les équilibres mélangeants, l'observation de s*E n'apprend rien à l'installée et si on a la distribution de probabilités a priori P(B) = a = 1 - P(H)y cela va impliquer les probabilités a posteriori H'(B/sl)=a=l-n*(H/sl) (8.2) Si nous n'excluons pas les stratégies mixtes,nous pouvons aussi avoir des équilibres serai-séparateurs où la firme installée actualise ses croyances sans que cela corresponde à une révélation parfaite. Dans le dernier jeu de l'entrée, tant que n7 reste inférieur à 50, nous ne pouvons avoir un équilibre où l'entrant choisira de rester en dehors de l'industrie et cela, qu'il soit faible (//), ou fort (B). La stratégie d'équilibre de l'entrant sera donc s*E = ((Entrer/H).{Entrer/B)). Cette stratégie n'apprendra rien à la firme installée (puisque sE ne peut séparer les deux types d'entrants). Les croyances d'équilibre de la firme installée seront donc p,*(B/sE) = Q.5 = ii*(H/sE) Les gains espérés correspondant aux deux stratégies, avec ces croyances, sont alors donnés par EU (Coopérer) = 0.5 x 50 + 0.5 x 50 = 50 EU (Combattre) = 0.5 x 0 + 0.5 x n7 = -y- EU (Coopérer) > EU (Combattre) <£> n7 < 100. Donc si n7 < 100, s* = Coopérer. Il nous reste à définir les croyances hors-équilibre : Que doit penser la firme installée, si elle observe que l'entrant potentiel choisit de rester en dehors de l'industrie ? Nous ne pouvons utiliser la règle de Bayes puisque fji*(s) = 0 si s ^ sE =» ii* {Non) = 0 Les croyances hors-équilibre ne sont donc pas vraiment contraintes. Tout système de croyances qui n'oblige pas les joueurs à dévier de la stratégie Jeux séquentiels avec information incomplète • 143
d'équilibre est compatible avec cet équilibre et fji*(B/Non)=0A est une possibilité. Mais il n'est pas très important de bien spécifier les croyances hors-équilibre dans cet exemple très simple. En effet, si l'entrant choisit de dévier et donc de rester en dehors de l'industrie, le jeu s'arrête et la manière dont / actualise ses croyances n'a pas d'importance. Ce n'est bien sûr pas le cas de tous les jeux en information incomplète. En déviant, le joueur peut donner une information et chercher à manipuler la suite du jeu. Comme notre exemple très simple le montre, trouver des EBP n'est pas... simple. On ne peut utiliser des algorithmes simples, notamment du fait de l'indétermination concernant les croyances hors-équilibre. Pour chercher un EBP, on commence par les actions qui ne font partie d'aucun équilibre et on spécifie les croyances qui seront utilisées pour interpréter ces actions. On teste alors si la stratégie de chaque joueur est optimale étant données ses croyances à chacun des nœuds ou, au contraire, s'il ne désire pas choisir une action hors- équilibre et déclencher les croyances et les stratégies hors-équilibre des autres joueurs. ■Exercices I Exercice 8.1 (Adapté de Umbhauer (1989)) I Nous reprenons le problème de la qualité des biens fournis par un producteur. Prenons I une version très simple de ce problème. Le monopole produit un bien qui peut être de I deux qualités : 6\ et 62 avec 1 < 6\ < 62 < 2. 6\ désigne donc la qualité inférieure et 62 I correspond à la qualité supérieure. Dans une première étape, le monopole fixe un prix I pour son produit dont la qualité est une donnée pour lui. Le consommateur prend I connaissance du prix et, dans une seconde étape, il demande une certaine quantité de bien I en fonction de la qualité proposée. La firme maximise son profit I mO,p,q) = (p-c(0))q I Le consommateur maximise sa fonction d'utilité I Q2 I Uie,piq)=eq-^-pq I où c(6) représente le coût de production unitaire d'un bien de qualité 6 avec I 0<c(<9,) <c(62) < l,0<c' < 1. 144 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
1. Calculer les EPSJ du jeu quand le consommateur connaît à l'avance la qualité du bien qu'il achète (le cas en information complète). Dessiner d'abord l'arbre du jeu. 2. Le consommateur n'observe pas la qualité du bien au moment de son achat. Il a néanmoins les croyances a priori (connues par le monopole) P(6 = 6i) = p= \- P(6=e2) 1 Supposez p = -. Dessinez l'arbre du jeu et donner la définition générale des EBP de ce jeu. 3. Sous la condition suivante (p*(0,) - c(0,)) • q*(p*m) > (p*(0j) - c(ft)) • q*(p*(0j)) ,/#./ = 1,2 (7.3) (a) Expliquez la condition (7.3). (b) Déterminez les EBP séparateurs de ce jeu. (c) Déterminez les EBP mélangeants de ce jeu. Solution L'information incomplète est due au fait que laftrme connaît la qualité de son bien tandis que le consommateur l'ignore. À partir du prix proposé par le monopole, le consommateur va chercher à déduire la qualité du bien. Le prix va alors jouer un rôle de signal. Le monopole est bien sûr conscient de cela et il choisira son prix en conséquence. 1. Dans ce premier cas la qualité est connue par les deux joueurs. L'arbre du jeu est très simple et il est donné dans la figure 8.5. Figure 8.5 Jeu de la qualité en information complète. Etant donné 0, la firme propose un prix en vue de maximiser son profit et le consommateur choisît une quantité qui maximise son utilité étant donnés 6 et le prix proposé. Pour calculer l'EPSJ, nous commençons par le dernier choix,c'est-à-dire, par celui du consommateur : ^2 max 6q — —— pq <i 2 q\e-P) = e-p En anticipant ce choix optimal du consommateur, la firme cherche le prix qui maximise son profit n(0; p, q*(6; p)) = (p - c{6)){6 - p) / \ 0 + c(6) max n(0; p, q*(6 ; p)) =» p*(0) = ^^ Jeux séquentiels avec information incomplète • 145
L'équilibre correspond alors à P*(0) = e + cm q'(0;p*(0))=q*(0) = e - c(6) n*(j9) = n(0;p*(0),q*(0)) = (0 - c(6))2 Sous les hypothèses posées au début de cet exercice, nous observons dq*/d6 > 0, dp*/d6 > 0, dW/dO > 0 quand la qualité est plus élevée, la firme propose un prix plus élevé mais la demande du consommateur est néanmoins plus élevée aussi. En conséquence, le profit de la firme est croissant avec la qualité. La relation qui existe entre le prix optimal de la firme et la qualité peut être exploitée par le consommateur pour apprendre la qualité du bien quand il existe une incertitude sur cette qualité. 2. Nous sommes dans un cas avec information incomplète (pour le consommateur). Nous utilisons la démarche de Harsanyi pour compléter l'information. L'arbre du jeu avec information complète mais imparfaite est donné dans la figure 8.6. (Jt(di\p,q),u(0\\p,q)) (n(e2\P,q),u(02\P,q)) Figure 8.6 Jeu de la qualité en information complétée. Un EBP de ce jeu peut-être défini de la manière qui a été exposée dans ce chapitre : Définition 8.2. Un EBP de ce jeu sera donné par un couple de stratégies (/?*(•),#*(•)) et une famille de distributions de probabilités a posteriori \x* (•/•) tels que : 1. V0 G {#i,02}> p*(0)est la solution de max(p — c(6))q*(p) (maximisation du p profit de la firme) ; 2.Vp e P (l'ensemble des prix possibles), q*(p) est la solution de max5Z/=i q0j/jL*(6j/p) — -q2 — pq (maximisation de l'utilité espérée du consommateur) ; 146 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Vp g P* (le support des prix d'équilibres p*(-)), M*(7p) est déduite de la distribution a priori P(6) par la règle de Bayes et la connaissance de p*(-) ; pour tout p £ P*, le choix de m*(7p) est arbitraire. Note : Seule la dernière condition mérite une explication. P* contient tous les prix qu'on peut observer dans les équilibres de ce jeu. /x*(-/p) donne les probabilités a posteriori des différentes qualités 6 après avoir observé un prix d'équilibre joué par la firme (et donc après l'observation d'un signal d'équilibre). Si la firme choisit un prix quelconque, on ne peut rien apprendre sur 6 en ayant observé un tel prix et donc p,* est quelconque. 3.aLa condition (8.3) correspond à la situtaion où aucun type n'a intérêt à imiter le comportement d'équilibre de l'autre. Par conséquent, s'il le peut, chaque type préfère appliquer son prix d'équilibre suivi de la demande correspondante, plutôt que le prix d'équilibre du concurrent suivi de la demande qui en découle. En particulier, le monopole avec la qualité faible ne sera pas tenté, dans ce cas, d'imiter le prix d'équilibre de la qualité haute. Chaque type est incité à jouer sa propre stratégie d'équilibre : on appelle ce type de condition une condition d'incitation. 3.b Dans un équilibre séparateur, chaque type de la firme utilise un prix qui révèle son type (stratégies séparatrices). En fait, sous la condition (8.3), les deux types vont pouvoir pratiquer leur prix de monopole en information complète correspondant. Les croyances expost du consommateur, à cet équilibre vont correspondre à la révélation parfaite n*(oi\p*m) = un*(oj\p*m) = o, / #y = 1,2. Pour tout autre prix (prix hors-équilibre, p ^ p*(6\) et p ^ p*(62)) les croyances sont arbitraires. Il existe par conséquent une infinité d'EBP séparateurs. L'équilibre de séparation suivant est soutenu par le fait que le consommateur attribue un tel prix au type avec une qualité faible (6\ ). Défînition 8.3. Un EBP séparateur de ce jeu sera donné par un couple de stratégies (P* (•),#*(•)) et une famille de distributions de probabilités a posteriori /x*(-/0 tels que : 0; + c(6i) 1. Vft€{ft,ft},p*(ft)= ,^2V,;,Î = 1,2. 2. Vp G P* = {p*(0,), p*(02)}, q*(p) = 6, - p*(ft), / = 1,2. Vp£ P\ 4* = max{O,0, -p}. 3. Vp g />*, M*(ftlp*(ft» = 1, H*(0j\p*(0i)) = 0, / # j = 1,2. Vp i P\ n*(0xlp) = 1 et MWP) = 0. Sous la condition (8.3) et les croyances d'équilibre,aucun des types n'a intérêt à imiter la stratégie de l'autre et aucun ne peut gagner strictement plus en utilisant un autre prix que son prix d'équilibre. 3.c Dans un équilibre mélangeant, les deux types doivent utiliser le même prix (stratégies mélangeantes), sinon la consommateur pourrait en déduire la qualité du bien. Étant donné que le consommateur n'apprend rien sur la qualité du bien avec un tel prix d'équilibre, ses croyances a posteriori qui découlent de l'observation de ce prix seront identiques à ces croyances a priori. M*(ftl/>*) = l/2, î = l,2 Jeux séquentiels avec information incomplète • 147
Les croyances hors-équilibres sont à nouveau arbitraires et donc il existera une infinité d'EBP mélangeant s'il existe un prix p* qui assure le mélange. L'EBP mélangeant que nous allons considérer sera basé sur les croyances hors-équilibres les plus défavorables pour le monopoleur, dans la mesure où tout prix différent de p* sera attribué au type avec la qualité faible. Définition 8.4. Un EBP mélangeant de ce jeu sera donné par un couple de stratégies (/>*(•)»#*(•)) et une famille de distributions de probabilités a posteriori />t*(-/0 tels que : LV0le{0ue2hp*m = P*,i = l,2. 2- q*(p*) = Ei M*(GI/>*)ft ~P\i = 1,2. Vp # p\ q*(p) = max{0, 0, - p). 3. M*(ft|p*) = 1/2, î = 1,2. Vp £ p\ VL*{6xlp) = 1 et n*(e2/p) = 0. Il existe une infinité d'EBP mélangeant de ce type s'il existe un prix p* > 0 qui vérifie à la fois Q [P ){P ~ c(0i)) > 4 de sorte que la qualité faible n'a pas intérêt à dévier de p* et révéler son type et q [p ){p -c(e2)j > de sorte que le type à la qualité élevée n'a pas intérêt à dévier et laisser croire le consommateur qu'il est de type faible (ce qui est plus facilement vérifié). Exercice 8.2 (Milgrom & Roberts (1982) simplifié par Tirole (1988)) Il s'agit d'un modèle à deux périodes et à deux firmes. À la première période, la firme 1 est seule sur le marché et elle a une position de monopole. Elle choisit un prix de monopole p pour cette période. Après avoir observé ce prix.Fentrant potentiel décide d'entrer ou de rester en dehors du marché. S'il décide d'entrer il y a un duopole à la deuxième période, sinon la firme 1 garde sa position de monopole. Quand l'entrant potentiel prend sa décision d'entrée, il ignore les coûts de la firme installée. Cette dernière peut avoir deux types de coûts : elle a des coûts faibles (cL) avec une probabilité x et elle a des coûts élevés (cH) avec une probabilité (1 — jc) (avec cL < cH). Nous pouvons aisément montrer qu'à la première période, si le monopoleur maximise le profit de court terme, nous devons avoir p[n < p". Soit ce profit de court terme Ml(plnl)t avec M{(-) strictement concave en son argument, pour t = L, H. À la seconde période, si l'entrant décide d'entrer il y aura une concurrence en prix et cette concurrence est indépendante du prix de la première période. Nous supposerons de plus que l'entrée n'est vraiment intéressante pour la firme 2 que si la firme installée a des coûts élevés. Si les profits de duopole des deux firmes sont donnés par D\ et D'2i nous devons avoir : D£ > 0 > £>£. Par conséquent, en l'absence d'information incomplète, la firme 2 ne serait entrée que sur le marché d'une firme de type H. Soit 5, le facteur d'actualisation commun. 1. Discutez le rôle stratégique du prix de première période de la firme installée. 2. Donnez la forme extensive de ce jeu en précisant les gains et les ensembles d'information des firmes. • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
3. Définissez un équilibre bayésien parfait séparateur de ce jeu et les conditions qui le soutiennent. 4. Même question pour les EBP mélangeants. 5. Quelles sont les conditions du blocage de l'entrée ? Solution 1. La firme installée voudrait avoir une position de monopole à la seconde période yM\ > DJ, t = L, H). Par conséquent,elle voudrait convaincre l'entrant potentiel qu'elle a des coûts faibles. La seule manière de le faire est d'appliquer un prix de monopole/?1 à la première période. Or comme l'entrant potentiel connaît ses motivations, il ne va pas accepter cette information pour argent comptant. Pour résoudre ce problème, nous devons utiliser le concept d'équilibre bayésien parfait. La relation qui existe entre les coûts unitaires et le prix d'équilibre d'un monopole (voir figure 8.7) est à la base de l'induction recherchée par l'entrant potentiel. Figure 8.7 Maximisation du profit de court terme et le prix de monopole. 2. La forme extensive de ce jeu est représentée à la figure 8.8, page suivante. 3. Équilibres séparateurs Les deux conditions nécessaires pour que l'équilibre révélateur correspondent à la distinction des deux types par le prix d'équilibre : H ne doit pas pouvoir appliquer le prix de L et vice-versa. De plus, les croyances hors équilibre adéquates doivent justifier cet équilibre. Sous ces croyances,les conditions nécessaires sont aussi suffisantes : les prix correspondants sont des prix d'équilibre. Dans un équilibre révélateur, l'observation du prix d'équilibre de H va conduire à l'entrée. Par conséquent à la première période H va maximiser son profit de court terme en appliquant p%. Sinon, il aurait pu améliorer ses gains en appliquant ce prix. Par conséquent son gain sera : Ai?+ 8D? (8.4) Jeux séquentiels avec information incomplète • 149
Entrée Nature Firme 1 Firme 2 Entrée iM"(p)+W," \ tM"(p)+SMA iML(p)+&M,L\ l^(p)^D^ \ Figure 8.8 Arbre du jeu. Soit p[, le prix du type L. En appliquant ce prix le type à coûts élevés peut dissuader l'entrée et il obtient alors : M?(p\) + BM? (8.5) Par conséquent une première condition nécessaire pour ce type d'équilibre est donné par: M» - M» (p[) > 8 (M? - Df) (8.6) De même, le type L maximise son profit en appliquant un prix p\. À l'équilibre il obtient M\ (rf)+ 8M\ S'il dévie en appliquant son prix de monopole, le pire qu'il peut lui arriver est que à ce prix l'entrée ne soit pas bloquée. Dans ce cas il gagne M[ + 8D{ Par conséquent la condition nécessaire pour qu'il applique le prix p\ est : M," - M," (p\) > 8 (M? - £>,") (8.7) 150 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Le prix p\ ne fait partie de l'équilibre que si les croyances a posteriori le soutiennent : fi*(H/p«) = \9ii*(L/pfj = l (8.8) sip t {rf, p[), H*(H/p) = 1, n*(L/p) = 0 (8.9) pour tout prix hors-équilibre l'entrée est certaine. Proposition 8.1. Sous les conditions (8.6) et (8.7), les croyances ai*(-/0 et le prix p* forment un EBP parfaitement révélateur avec : p*(H) = p% et p*(L) = p\. Preuve : Cf. Tirole (1988), p.370. Il est aisé de vérifier qu'aucun type n'a intérêt à dévier de son prix d'équilibre étant données les croyances a posteriori. Tirole montre qu'il existe un continuum de prix d'équilibre p\. Remarquons au passage que si la condition (5) n'est pas vérifiée pourpf = p^, c'est-à-dire si M\ - M\(p\\ < s(M[ - D[\ (8.10) alors la firme de type L doit appliquer un prix plus faible que son prix de monopole pour empêcher l'autre type de l'imiter. Il existe donc un prix-limite au sens de Bain dans ce cas. □ Dans ces équilibres séparateurs l'entrant potentiel connaît parfaitement le type de firme installée auquel il doit faire face sur le marché. L'entrée a lieu exactement dans le même cas qu'en information complète. Néanmoins, le type L peut être amené à sacrifier une partie de ses profits de court terme en appliquant un prix-limite pour signaler son type. Ce phénomène peut conduire à une amélioration du bien-être social par rapport au cas de l'information complète : le bien-être de seconde période n'est pas affectée par l'information asymétrique (puis que l'entrée a lieu dans les mêmes conditions) et le bien-être de première période peut être plus élevé si la firme de type L applique un prix-limite. Par conséquent le prix-limite ne conduit pas nécessairement à une perte de bien-être. Posons : A" = M," - M?(p\\ , AL = M\ - M\[p\\ (8.11) <j>H = 5(M,W - £>,"), 4>L = blhd[ - D[\ (8.12) Les équilibres révélateurs sont alors donnés par les prix p\ tels que : AH^4>H et &L<4>L=*Pie[pï>PÎ] (8-13) Ces conditions peuvent être comparées sur un graphique (voir figure 8.9). 4. Équilibres mélangeants Les équilibres non-révélateurs sont caractérisés par un prix d'équilibre identique pour les deux types. Par conséquent nous devons avoir p*(H) = p*(L) = p* De plus pour les croyances d'équilibre nous devons avoir : fjL*(L/P*) = X, fjL^H/p*^ = \-X Jeux séquentiels avec information incomplète • 151
& oH A 1 P Equilibres révélateurs L f / , , / \ Y / / \A / / S* ^ L r^ H 1 P/ Pm Prn PÎ Figure 8.9 Équilibres révélateurs et prix-limite. le prix d'équilibre ne conduit pas à un affinement des croyances. Dans ces conditions, p* ne peut être un prix d'équilibre que si : xD£ + (l-x)D? <0. (8.14) Sinon au prix d'équilibre l'entrant a un profit espéré positif et il entre. L'entrée n'est pas dissuadée et alors les firmes installées doivent appliquer leur prix de monopole de court terme à la première période et ces prix diffèrent. Donc un équilibre non- révélateur ne peut exister dans ce cas. Sous la condition (8.14), le prix p* dissuade l'entrée. La condition nécessaire pour qu'il soit un prix d'équilibre est qu'aucun type n'ait intérêt à appliquer son prix de monopole. Si toute déviation du prix d'équilibre est interprétée comme venant du type //, c'est-à-dire si H*(H/p) = 1 si p # p* alors nous devons avoir : M\ - M[(p*\ ^ sUff- - D\\ pour le type à coûts faibles et M," - M,"(p*) ^ &(m? - Df) pour le type à coûts élevés. (8.15) (8.16) (8.17) Proposition 8.2. Sous les conditions (8.14), (8.16), (8.17) le prix p* et les croyances M*CA) forment un EBP non-révélateur avec p*(H) = p*(L) = p* Preuve : Le raisonnement est similaire au cas des équilibres révélateurs (cf. Tirole (1988)). □ 152 • LES JEUX NON COOPÉRATIFS AVEC INFORMATION COMPLÈTE
Dans ce type d'équilibre la firme installée manipule son prix de manière à ne pas révéler d'information sur son type. Il y a moins d'entrée que dans le cas avec information symétrique : l'entrée est toujours dissuadée tandis qu'en information symétrique la probabilité d'entrée est (1 — jc) > 0. Par conséquent le type H applique un prix-limite pour dissuader l'entrée. L'effet sur le bien-être est ambigu dans ce cas car le bien-être de la première période est en général amélioré du fait de l'application d'un prix-limite par le type H mais il y a moins d'entrée à la seconde période, ce qui en général diminue le bien-être. 5. Le modèle de Milgrom & Roberts montre donc que le prix-limite peut être effectivement appliqué en présence d'une information incomplète et asymétrique. Mais il n'a pas nécessairement un effet négatif sur le bien-être. Par conséquent, même s'il peut conduire à un blocage de l'entrée, il ne correspond pas à la relation négative que l'on établit d'habitude entre les barrières à l'entrée et le bien-être social. La relation précise entre le prix-limite et le bien-être dépend des conditions particulières de chaque industrie. Avant de condamner une pratique de prix-limite il faut donc procéder à une analyse détaillée de l'industrie que l'on étudie. Cela d'autant plus que les équilibres révélateurs et non-révélateurs conduisent à des conclusions différentes du point de vue normative. Un autre élément plus général apparaît dans ce modèle : il s'agit de la multiplicité des équilibres dans les jeux à information incomplète. En fait pour les stratégies hors du sentier d'équilibre les croyances de l'entrant potentiel sont arbitraires puisque l'on ne peut appliquer la règle de Bayes pour des événements à probabilité nulle. Cela engendre une multiplicité considérable des croyances, d'où la multiplicité des équilibres qui en découlent. Les différents raffinements de l'EBP essayent de réduire cette multiplicité en imposant des restrictions « raisonnables » sur les croyances qui découlent de l'observation d'un événement à probabilité nulle. Jeux séquentiels avec information incomplète • 153
,7 Quatrième partie Jeux évolutionnaires 9. Une approche alternative : équilibres évolutionnaires 157
9. (/ne approche alternative : équilibres évolutionnaires La coordination est-elle l'apanage d'individus nécessairement pourvus d'une rationalité très sophistiquée ? Les approches que nous avons considérées jusqu'à maintenant semblent donner une réponse positive à cette question. En effet, pour sélectionner l'équilibre de coordination, dans l'ensemble très riche des équilibres de Nash, les théoriciens des jeux ont développé des concepts de solutions de plus en plus sophistiqués, basés sur une rationalité de plus en plus forte pour les joueurs. Deux exemples de cette démarche ont apparu dans notre vision relativement réduite de la théorie des jeux : - le passage de l'équilibre de Nash vers l'équilibre parfait en sous-jeux et vers l'équilibre bayésien parfait ; - la vision très complète que les joueurs doivent avoir d'un jeu répété en vue d'atteindre la solution de coopération. Or les expériences sur des jeux avec des sujets humains montrent plutôt que les joueurs réels utilisent des stratégies simples, relativement stables dans le temps et correspondant à des règles de comportement qui possèdent une dimension adaptative importante. Leur comportement correspond alors plus à une rationalité limitée, accompagnée d'un apprentissage guidé par un processus d'essai et erreur ou d'imitation des autres joueurs. Ce type de mécanismes simples est aussi observé depuis longtemps par les biologistes dans les sociétés animales bien connues : il est difficile de soutenir que chaque fourmi soit pourvue d'une rationalité très forte, mais une fourmilière peut néanmoins fonctionner d'une manière harmonieuse et stable dans le temps. Une approche alternative : équilibres évolutionnaires • 157
De même, beaucoup de sociétés de mammifères ont remplacé les combats à mort entre les prétendants au rôle du mâle dominant par une symbolique de la domination et de la soumission qui permet de résoudre ce type de conflit avant que cela débouche sur l'élimination pure de tous les concurrents sauf un. Dans ce cadre tout se passe alors comme si des règles de comportements simples avaient évolué dans le temps, du fait d'un apprentissage par la communauté d'animaux ou, plus globalement, par l'espèce concernée, sous la pression sélective de l'environnement de cette espèce (Maynard-Smith (1987)). Cette observation et la constatation que ce qui compte dans l'évolution est la stabilité des comportements, plutôt que leur conformité avec un critère d'optimalité, ont conduit à l'ouvrage de Maynard-Smith (1982). Et cet ouvrage a donné naissance au champ des jeux évolutionnaires, aujourd'hui très riche. Les jeux évolutionnaires (voir aussi Weibull (1995), pour une exposition plus moderne et détaillée) s'inspirent des mécanismes de l'évolution biologique (la mutation et la sélection) pour étudier les solutions auxquelles peuvent conduire les interactions en l'absence d'une rationalité forte. Ils considèrent alors que le jeu est joué un grand nombre de fois, entre des individus possédant une rationalité limitée et très peu d'information sur le jeu. Ces individus sont tirés de manière aléatoire d'une grande population. Mais cette interprétation pose au moins un problème : les interactions qui caractérisent la dynamique d'évolution se font nécessairement entre les membres d'une population ou entre plusieurs populations et non entre deux individus bien définis. La stabilité dont on parle est la stabilité de certains traits caractéristiques dans chaque population et non celle des stratégies à proprement parler. Par conséquent la transposition de ce type de mécanismes à des jeux entre individus n'est pas immédiate et nécessite beaucoup de soin pour pouvoir en tirer des conclusions sur les résultats des jeux entre individus. s clés étudiés : Ce chapitre est consacré à l'analyse des jeux évolutionnaires : - l'analogie évolutionniste dans l'interprétation des jeux ; - la dynamique des populations ; - la stabilité évolutionnaire ; - la dynamique de réplication et ses propriétés ; - les comportements basés sur la rationalité limitée et l'apprentissage. 158 • JEUX ÉVOLUTIONNAIRES
I. Stratégies, mutations, sélection La théorie de l'évolution s'intéresse à l'évolution des espèces et donc des populations correspondantes. Cette évolution résulte des mutations dans les génomes des individus formant l'espèce et de la sélection des caractéristiques correspondant à ces génomes (les phénotypes) par la pression du milieu dans la reproduction. Les génotypes qui arrivent à se reproduire plus que d'autres s'étendent dans l'espèce (occupant de plus en plus d'individus à chaque génération), tandis que la part des autres se réduit. Dennett (1996) montre que ce mécanisme (algorithme) est très efficace et conduit à des solutions remarquables dans les inventions de la Nature. Quand aucune mutation ne peut détrôner un ensemble de caractéristiques (et donc le génome correspondant), cela conduit à une stabilité dans le processus d'évolution. C'est l'idée de base de la stabilité évolutionnaire que nous allons considérer dans la section suivante. La question qui se pose à ce stade est la suivante : étant donné que l'évolution est celle des populations, comment pouvons-nous en tirer des leçons concernant celle des stratégies des joueurs et leur stabilité ? Rappelons-nous que l'équilibre de Nash est aussi basé sur un concept de stabilité : la stabilité face aux déviations unilatérales. Pour pouvoir utiliser le concept d'évolution, nous devons alors nous intéresser à celle de la population de stratégies, les joueurs n'étant que le support fictif de cette population. Dans les jeux symétriques (quand les joueurs ont le même ensemble de stratégies et les gains sont symétriques), cette transposition est même assez simple à concevoir : il suffit de considérer les rencontres successives d'un couple de stratégies aléatoirement tirées de la population des stratégies. Reconsidérons le dilemme du prisonnier. Comment pourrions-nous étudier les solutions de ce jeu dans une vision évolutionnaire ? Les deux joueurs ont le même ensemble de stratégies : S = {N,D}. Nous pouvons donc imaginer une population de n supports de stratégies, chacun initialement doté de N ou de D de manière aléatoire. Appelons individus ces supports pour simplifier la présentation (on aurait pu tout aussi bien imaginer un bac rempli de boules de deux couleurs). À chaque période deux de ces individus sont aléatoirement tirés de la population et ils jouent au dilemme du prisonnier, tel que nous le connaissons. En fonction des stratégies qu'ils portent, ils obtiennent alors les gains donnés par la matrice de ce jeu. Après avoir observé leur performance (le degré d'adaptation à leur environnement - fitness en biologie) avec les stratégies qu'ils ont actuellement, ils choisissent une nouvelle stratégie et ils sont remis dans la population. On recommence alors avec deux individus nouveaux encore tirés au hasard. La probabilité de survie de chaque stratégie dans la population dépendra alors des performances de cette stratégie, puisque Une approche alternative : équilibres évolutionnaires • 159
les règles simples que les individus utilisent doivent favoriser les stratégies qui ont une performance meilleure. Ces règles simples, associées à la procédure de rencontre que nous considérons, correspondent en fait à un processus dynamique stochastique, en ce qui concerne la distribution des stratégies TV et D dans la population. Nous laissons pour l'instant de côté la spécification de ces règles. La question que nous pouvons déjà poser est la suivante : si ce processus dynamique conduit à une distribution stable des stratégies dans la population des n individus, quelles doivent être les propriétés de cette distribution ? IMAGINE.,. ILV4 QUATGÇ MUIAGD& 0'ANNëe6 U TCftCe N'éTAtT QU'UN H0AÛ& De ftxiefcièBÊ et la pceAUèce aAcrëeie fârAPGARUe UVATEOfr AAIIUAGD5 P'AMNée& .PUI& LAVIB/UAfllNg.lfôPlNO- &Ai)Be&.LeôoiseAUX .lcô AAA/WllFê<2e& BTENFIN,IL Y A UN MILLION D'ANNée&, CALVIN AND HOBBES © 1990Waterson. Reprinted with permission of Universal Press Syndicate. Ail rights reserved © 1992 Presses de la Cité pour l'édition française. Figure 9.1 L'apogée de révolution... I. Stabilité évolutionnaire Avec le processus de rencontre que nous considérons, nous pouvons remarquer que la performance espérée d'une stratégie dépend de la distribution des stratégies dans la population, étant donné que la probabilité d'être tirée pour une stratégie est égale à sa proportion dans la population. Si à un moment donné la proportion de la stratégie N dans la population est a, alors tout individu a la probabilité a d'être confronté à la stratégie N et (1 — a) d'être confronté à la stratégie D. Si cet individu est porteur de la stratégie s = N, D, son utilité espérée est au (s, N) + (1 — a) u (s, D) Une telle situation sera stable si tout individu a plus de chance de survivre en gardant sa stratégie qu'en la changeant (en mutant). Reprenons maintenant le Dilemme du prisonnier dans le tableau 9.1, page ci-contre. Nous avons alors pour les deux types possibles s = N : au (N, N) + (l-a)u (N, D) > au (D, N) + (l-a)u (D, D) 4a- 1 > 4a (9.1) 160 • JEUX ÉVOLUTIONNAIRES
Tableau 9.1 Dilemme du prisonnier Clyde N Bonnie D Clyde N D 3,3 -1,4 4,-1 0,0 s = D : au(D9N) + (l-a)u (D, D) > au (N, N) + (\-a)u (N, D) 4a>4a-l (9.2) On observe que la condition (9.1) ne peut être vérifiée quel que soit a et les individus avec la stratégie N seront tentés de muter vers la stratégie D, tandis que ceux qui jouent la stratégie D ne vont pas changer. Cela nous conduira alors à terme à l'invasion totale de la population par la stratégie D : tout le monde jouera la stratégie D. Par conséquent s{ = D, V/ est une situation stable. C'est l'idée de base du concept de stabilité évolutionnaire de Maynard Smith. Nous pouvons généraliser cette idée en considérant les stratégies mixtes. Imaginons que tous les individus de la population utilisent une stratégie mixte p* e P à un moment donné. Cette situation sera stable si la mutation d'une fraction (petite), e, de la population vers une autre stratégie mixte p ne peut permettre l'invasion de la population par la stratégie mutante/?. p Définition 9.1 *1 |* Une stratégie mixte p* e P est une stratégie évolutionnairement stable sïd b nous avons pour toute stratégie mutante p e P et s petit , h L .{lre)U(p*,p*)+eU(p\p)>a-e)U(p,p*)+eU(p,p) (9.3|j avec [/représentant la fonction d'utilité espérée symétrique des joueurs. On peut facilement montrer qu'une condition nécessaire et suffisante pour que la condition (9.3) soit vérifiée est : U(p*iP*)>U(piP*) (9.4) ou (a) U(p*iP*) = U(p,p*) et (b) U(p*,p)>U(plP) (9.5) Si la condition (9.4) est vérifiée alors la population avec p* ne peut être envahie par les mutants qui ont la caractéristique p. Si c'est la condition (9.5) Une approche alternative : équilibres évolutionnaires • 161
qui est vérifiée, face à p* les mutants font aussi bien que la population initiale mais, face à un autre mutant, ils s'en sortent moins bien (une stratégie plus agressive par exemple qui conduit à des dommages réciproques dans les combats entre mutants). Ces deux conditions correspondent à la définition originale des stratégies évolutionnairement stables par Maynard Smith. La condition (9.4) définit cet équilibre de manière équivalente à un équilibre de Nash strict : la stratégie p* doit être la meilleure réponse à elle-même. Mais la stabilité évolutionnaire est encore plus exigeante : la condition (9.5) demande en plus que p* soit une meilleure réponse que p face à la stratégie mutante p. On a récemment découvert que John Nash donnait déjà cette interprétation dans sa thèse de doctorat non publiée. Si nous reconsidérons le dilemme du prisonnier, la discussion ci-dessus implique que le seul équilibre évolutionnairement stable de ce jeu en stratégies pures est (D, D) car cette distribution ne peut être envahie par des mutants jouant N. Donc dans ce cas la stabilité évolutionnaire correspond à l'équilibre de Nash. Par conséquent tout équilibre évolutionnairement stable est aussi un équilibre de Nash. Mais, du fait de la condition (9.5), tout équilibre de Nash n'est pas évolutionnairement stable contrairement à ce que laisse supposer l'exemple du dilemme du prisonnier. Par exemple, dans le jeu Papier-Ciseaux-Caillou il existe un équilibre de Nash unique et il correspond à la stratégie mixte 1-,-,-J mais cette stratégie n'est pas évolutionnairement stable (voir l'exercice 9.2). Au delà du dilemme du prisonnier, il faut aussi noter qu'aucune stratégie faiblement dominée ne peut être évolutionnairement stable. L'exemple du dilemme du prisonnier montre aussi que la stabilité évolutionnaire n'implique pas nécessairement l'optimalité parétienne puisque le résultat (N, N) n'est pas évolutionnairement stable. L'approche que nous venons d'étudier nous permet d'étudier les équilibres des jeux symétriques en forme normale. Il est possible de l'étendre aux jeux en forme normale finis qui ne sont pas symétriques, en adoptant une approche avec plusieurs populations en interaction, une pour chaque position dans le jeu (voir Weibull (1995), chapitre 5). Si nous avons n positions et donc n populations, chaque individu tiré est apparié avec des individus provenant des n — 1 autres populations. Une conséquence immédiate de cela est qu'une stratégie mutante ne peut être confrontée à elle-même et donc la partie (b) de la condition (9.5) n'est plus pertinente. Tout équilibre de Nash qui n'est pas strict devient alors fragile face aux mutations et seul les équilibres de Nash stricts sont évolutionnairement stables. Nous revenons maintenant sur la question des règles de comportement que nous avons évitée jusqu'à maintenant. 162 • JEUX ÉVOLUTIONNAIRES
III. Règles de comportement et dynamique de réplication Intéressons-nous maintenant plus directement au processus dynamique concernant l'évolution des stratégies dans la population. Comme nous l'avons déjà observé, les processus évolutionnaires comportent deux mécanismes de base : la mutation et la sélection. La stabilité évolutionnaire souligne le rôle des mutations dans la mesure où Ton étudie la stabilité des solutions du jeu face aux mutations dans la population des stratégies. Nous avons pu mener cette étude sans expliciter le mécanisme de sélection en jeu, ni les règles de comportements simples que nos joueurs utilisent. Pour pouvoir étudier la dynamique de sélection, nous allons d'abord nous placer dans un cadre particulier où chaque individu joue une stratégie pure. Cela va nous permettre de faire apparaître une approche qui a été développée au sein de la théorie de l'évolution, pour modéliser la dynamique des populations : la dynamique de réplication. Nous allons ensuite observer que certains types de comportements à rationalité limitée des individus (comme l'imitation) peuvent conduire à une dynamique très similaire au niveau de la population (cette présentation suivra en grande partie Weibull (1998)). A. Dynamique de réplication Considérons donc une large population (finie) composée d'individus qui sont les supports des stratégies pures (une par individu) d'un jeu symétrique à deux joueurs : Sj e S = {s\>... ,sk}. Soit pf(t) > 0 le nombre d'individus qui jouent la stratégie pure st; g S à la date t. La population totale est alors donnée par p{t) = Yli=\ A (0 > 0. L'état de la population associé à cette situation peut être représenté par le vecteur x(t) = (xx (t),..., xk (f )) où jc, (0 est la part de la stratégie pure Sj dans la population au moment t : xt{t) = Pi(t)/p(t). Nous remarquons que l'état de la population, jc(0, est formellement identique à une stratégie mixte du jeu initial à deux joueurs. Le gain espéré d'une stratégie pure st incluse dans une rencontre avec le reste de la population dont l'état est x(t) correspond bien alors à k U(siyx) = Eu(sitx) = 22 w(5'» si)xi (9.6) /=i Pour l'individu jouant la stratégie pure st il n'y a pas de différence en fait entre une rencontre avec un autre individu tiré aléatoirement de la population x et jouer face à un vrai joueur jouant la stratégie mixte x. Une approche alternative : équilibres évolutionnaires • 163
Le gain moyen dans la population, et donc le gain espéré d'un individu participant à une rencontre aléatoire dans la population jc, est donné par k U(x9x) = ^2xiU(siix)=xAxT (9.7) »=i avec A, la matrice des paiements du jeu A = | w(s,, s/). =1 k | et jc7, le transposé de jc. Le gain £/(jc,jc) est équivalent au gain espéré de la stratégie mixte jouant contre elle-même. Nous pouvons représenter la dynamique de la distribution de la population par un système d'équations différentielles homogènes xi=Si(x)xi (9.8) où x = dx/dt et 8j(x) est le taux de croissance de la stratégie pure s, dans la population. Nous avons bien une dynamique de sélection dans la mesure où une stratégie qui n'est pas initialement utilisée restera inutilisée dans la population (car si jc,(0) = 0, i,(0 = 0,W > 0). La spécification de <5,(-) détermine alors la nature de la dynamique de la population. Dans un contexte de jeu, on pourrait par exemple imaginer que ce taux soit positif pour les stratégies pures qui obtiennent un gain supérieur au gain moyen dans la population et qu'il soit négatif pour les stratégies performant moins bien que la moyenne. La spécification la plus connue correspond à celle qui a été développée dans le cadre de la modélisation de la dynamique des populations au sein de la théorie de l'évolution : la dynamique de implication. Cette spécification correspond alors au système dynamique suivant dans notre cadre de jeu évolutionnaire : ^ = [Uist, jc_,) - U(x, x)]xi (9.9) où £/(jc, jc) est le gain espéré de la position de joueur i quand le profil de stratégies jc est joué dans la population (le gain moyen dans la population avec la stratégie jc) et U(sit .*_,) est le gain espéré quand la stratégie pure s, est jouée contre le profil de stratégie jc. Par conséquent, le taux de croissance de chaque stratégie pure dans la population est proportionnel à l'avantage relatif de cette stratégie dans sa population de joueurs. On peut alors se poser deux questions : - Vers quel type de solution peut converger ce processus dynamique ? - Quelles sont les différentes spécifications pour <5,(-) qui peuvent résulter des différents types de comportements avec rationalité limitée ? Pour répondre à la première question, nous allons nous placer dans le cadre des jeux symétriques à deux joueurs. Prenons d'abord un exemple encore plus simple. 164 • JEUX ÉVOLUTIONNAIRES
► Exemple 9.1 Jeux symétriques 2x2: deux joueurs et deux stratégies. Soit I = {1, 2} et S = {sx,s2}. Ces jeux peuvent alors être résumés par leur matrice de gains symétriques A (voir Véquation (9.7)) : VO a2J qui correspond aux gains Ui(sXysx) = ax, U((s2is2) = a2, V/ = 1,2 et Uj(sj,Sj) = 0, V/' ^ / = 1, 2. Nous allons supposer axa2 =£ 0. Nous avons dans ces jeux 2 x 2, x2 = 1 — xx et X\ — —X2. Ces gains impliquent la dynamique de réplication suivante pour la stratégie S\ (et son complément pour s2, bien sûr) X\ ^ \Cl\X\ — a2X2)X\X2 car U(sux) = axxuU(s2ix) = a2x2 U(sXix) — U(x,x) = U(slyx) — [x\U(si,x) + x2U(s2yx)] = (1 -*,)t/(si,*) -x2U(s2ix) = x2U(sux) — x2U(s2, x) xl = [x2U(s\,x) — x2U(s2,x)]x\ x\ = [U(slyx) - U(s2ix)]xxx2 Nous avons plusieurs cas : - axa2 < 0 : la part de la stratégie S\ décline continûment dans le temps si ax < 0 < a2 ou croît continûment dans le temps si ax > 0 > a2. Par conséquent, si la population démarre avec une situation où les deux stratégies existent dans la population, elle tend alors vers la domination de Vunique stratégie évolutionnairement stable : s2 dans le premier cas et sx dans le second. - axa2 > 0 : le taux de croissance de xx change de signe quand axxx = a2x2. Ce changement arrive donc à la stratégie mixte d'équilibre de Nash x\ = a2/(ax + a2). - Supposons que les deux gains soient positifs (aXya2 > 0) : xx > 0 si xx > jc* et xx < 0 si xx < xx*. Si xx démarre en dessous de xx* alors la population converge vers une domination par s2 et si xx démarre au dessus de xx* alors la population sera dominée par sx. Par conséquent, à partir d'un point intérieur (où les deux stratégies pures existent initialement dans la population), la population converge vers l'un des équilibres évolutionnairement stables, les bassins d'attraction des deux équilibres étant séparés par le point jc*. Une approche alternative : équilibres évolutionnaires • 165
- Supposons maintenant que les deux gains soient négatifs (au a2 < 0) : Xi < 0 si x\ > jc* et x\ > 0 si xx < x\. Dans ce cas, la population converge vers jc* à partir de tout point initial intérieur et jc* est l'unique stratégie évolutionnairement stable de ce jeu. Ce petit exemple nous permet donc de montrer la relation qui peut exister entre la dynamique de réplication de la population et les équilibres évolutionnairement stables. Par exemple, un jeu de coordination correspondrait à ax > 0 et a2 > 0. La dynamique de réplication tendrait alors vers l'un des deux équilibres évolutionnairement stables de ce jeu, en fonction de la situation initiale de la population. Ces équilibres sont les deux équilibres de Nash du jeu : tout le monde joue s\ ou tout le monde joue s2. De même, comme la dynamique de réplication n'est pas modifiée par un déplacement des gains (vers le haut ou vers le bas) de manière à garder les préférences locales de joueurs, d'autres jeux peuvent être normalisés de manière à correspondre à ce jeu canonique. Le dilemme du prisonnier N Bonnie D Clyde N D 3,3 -1,4 4,-1 0,0 correspond aux matrices "-C ~o) ""'"(-i o) qu'on peut normaliser localement de manière à avoir la matrice symétrique équivalente -a1 :) car 3 - 4 = -1 et 0 - (-1) = 1. En utilisant le fait que jc2 = 1 - x\, cela nous donne la dynamique de réplication X\ = (—ljCi — (1JC2))JC2JCi = (-*! -(1 -*i))(l ~*l)*l X\ = —(1 — jcj)jci < 0, Vjci > 0 =$>x2>0, Vjc2 > 0. 166 • JEUX ÉVOLUTIONNAIRES
Donc, à partir d'une situation initiale intérieure (jcj > 0, x2 > 0), la population tend vers une domination par la stratégie s2 = D. De manière plus générale, il est possible de montrer qu'en temps continu, la dynamique de réplication élimine de la population les stratégies strictement dominées, si toutes les stratégies pures sont présentes dans la population initiale. Par contre, les stratégies faiblement dominées ne sont pas nécessairement éliminées de la population. Le premier résultat implique que même si l'on ne suppose pas une rationalité des individus, à long terme ils vont jouer comme s'ils étaient rationnels et comme si cette rationalité était connaissance commune. En ce qui concerne les équilibres de Nash, si on les voit comme un état de la population, on peut aussi montrer qu'ils constituent un état stationnaire de la dynamique de réplication. Il existe aussi des états stationnaires qui ne sont pas des équilibres de Nash, mais alors ils sont dynamiquement instables : si l'on perturbe légèrement l'état de la population, elle peut diverger de ces états stationnaires (instabilité Lyapounov). Ainsi, dans ces dynamiques de sélection, les individus se comportent-ils comme s'ils anticipaient cet état de la population et jouaient de manière optimale face à cette anticipation. [KB] : Sections 9.5-9.7. Ces résultats sont très intéressants car ils montrent que la dynamique de réplication peut correspondre au résultat agrégé d'une gamme large de règles de comportements simples pour les individus. D. Règles de comportement Les résultats que nous venons d'étudier concernent la dynamique globale de la population des stratégies quand on ne présuppose pas une rationalité forte des joueurs ou une connaissance approfondie du jeu. Mais, en nous intéressant à la dynamique agrégée, nous avons traité ces comportements de manière implicite, sans préciser leur contenu. Nous allons maintenant revenir à la seconde question que nous avons posée à propos des réplicateurs : quelles sont les différentes spécifications pour 5() qui peuvent résulter des différents types de comportements avec rationalité limitée ? Plusieurs résultats récents des jeux évolutionnaires montrent effectivement que la dynamique de réplication au niveau agrégé peut correspondre à des comportements adaptatifs basés sur un apprentissage au niveau des individus. L'apprentissage par renforcement {reinforcement leaming) ou par imitation fait partie de ce type de comportements. Les modèles basés sur l'apprentissage adaptatif considèrent que chaque individu utilise une stratégie qui est confrontée aux stratégies des autres individus dans la population et, de temps en temps, en fonction ou non de la performance de sa stratégie, l'individu révise sa stratégie. Ce processus dynamique possède Une approche alternative : équilibres évolutionnaires • 167
alors deux dimensions importantes : - le taux de révision (la fréquence de révision) des stratégies par chaque individu et - la probabilité des stratégies d'être adoptées par un individu chaque fois qu'il révise sa stratégie. Ces deux éléments résultent en général de manière endogène (et souvent aléatoire) des comportements spécifiés pour les agents et de l'évolution de l'état de la population et des performances des stratégies. L'apprentissage par renforcement correspond par exemple à la révision, après chaque étape des rencontres, des probabilités d'adoption des stratégies en fonction de la propre performance de la stratégie de l'agent. L'apprentissage par imitation peut prendre différentes formes, la plus simple étant l'imitation de la stratégie d'un individu quelconque dans la population, individu tiré selon une loi uniforme. On pourrait aussi imaginer que la fréquence des révisions soit croissante avec le retard de performance de la stratégie de l'agent par rapport à la performance moyenne de la population. On pourrait tout aussi considérer que l'agent choisit de manière aléatoire un individu à imiter dans la population mais qu'il ne l'imite que si la performance moyenne de l'autre agent (probablement observée avec une marge d'erreur) est supérieure à celle de sa propre stratégie. La dynamique de population découlant de ce type de comportements adaptatifs peut être relativement similaire à la dynamique de réplication. Cela nous conduit à voir l'équilibre de Nash avec d'autres yeux car la rationalité sur laquelle il semble se baser n'a pas nécessairement besoin d'être aussi forte que nous l'avons initialement supposée. Même des comportements avec une rationalité limitée peuvent conduire à long terme et dans un contexte de répétitions (sans lequel l'apprentissage n'est de toute façon pas possible) à des résultats proches de l'équilibre de Nash. La théorie des jeux évolutionnaires apporte donc de nouveaux fondements aux concepts d'équilibre de la théorie des jeux et à leur interprétation. ercices Exercice 9.1 Dans le jeu de coordination suivant A Krunding B Zelefunken A B 3,3 0,0 0,0 1,1 168 • JEUX ÉVOLUTIONNAIRES px
1. Déterminez les stratégies de Nash en stratégies pures et mixtes de ce jeu. 2. Vérifiez si ces équilibres de Nash sont évolutionnairement stables. Solution 1. (A, A) est l'équilibre de Nash Pareto-optimal de ce jeu mais (B, B) est aussi un équilibre de Nash. De plus, dès qu'une firme joue assez souvent B, l'autre aura intérêt à jouer B aussi. Il existe donc un équilibre de Nash symétrique en stratégies mixtes : p* = (^) où/>[*] = !. 2. Les deux équilibres de Nash en stratégies pures sont stricts et donc il ne peut exister de mutant qui peut faire mieux que ces stratégies face à lui-même. Par conséquent, ils sont évolutionnairement stables. Ce n'est pas le cas de l'équilibre en stratégies mixtes. En effet, toute stratégie mixtep est une meilleure réponse à/?*. Par exemple, la stratégie pure A obtient un gain plus fort face à elle-même que p* et donc c'est un mutant qui peut potentiellement envahir une population de p*. Dans ce cas, la partie (b) de la 3 condition (9.5) n'est pas vérifiée : U(p*,A) = - < 3 = U(A, A). Exercice 9.2 Vérifiez que l'équilibre de Nash en stratégies mixtes du jeu de Papier-Ciseaux-Caillou n'est pas évolutionnairement stable (voir les exercices 2.1 et 3.5). Solution Nous avons ici un cas similaire à celui de l'exercice précédent. Ce jeu possède un seul équilibre de Nashp* = I -, -, - I mais cet équilibre n'est pas strict et donc il est fragile par rapport aux mutations. Notamment la stratégie pure Papier n'obtient pas moins contre elle-même, que la stratégie/?* face à elle : U (Papier, Papier) = 1 = U (p*t Papier). Donc, à nouveau, la partie (b) de la condition (9.5) n'est pas vérifiée. Exercice 9.3 Etudiez la dynamique de implication et sa solution à long terme pour les jeux dont les matrices des gains symétriques sont respectivement données par Solution Matrice Ax : 1 • 1 > 0 : le taux de croissance de x\ change de signe quand x\ = x2. Ce changement arrive donc à la stratégie mixte d'équilibre de Nash x* = -. Les deux gains sont positifs. Nous avons alors la dynamique suivante : x\ > 0 si x\ > x* et x\ < 0 si x\ < jc*. Si jci démarre en dessous de jc* alors la population converge vers une domination par $2 et si xi démarre au dessus de ** alors la population sera dominée par s\. Par conséquent, à partir d'un point intérieur (où les deux stratégies pures existent initialement dans la population), la population converge vers l'un des équilibres évolutionnairement stables, les bassins d'attraction des deux équilibres étant séparés par le point x* = -. Une approche alternative : équilibres évolutionnaires • 169
Matrice A2 : (-2) • 5 = 10 < 0 : la part de la stratégie s\ décline continûment dans le temps car — 2 < 0 < 5. Par conséquent, si la population démarre avec une situation où les deux stratégies existent dans la population, elle tend alors vers la domination par l'unique stratégie évolutionnairement stable : s2. 170 • JEUX ÉVOLUTIONNAIRES
ibliographie BlNMORE, K. (1999), Jeux et Théorie Des Jeux, De Boeck Université, Bruxelles. Bulow, J., Geanakoplos, J. & Klemperer, P. (1985), "Multimarket oligopoly: Stratégie substitutes and compléments", Journal of Political Economy 93,488-511. CYERT, R. & DEGROOT, M. (1987), Bayesian Analysis and Uncertainty in Economie Theory, Rowman & Littlefîeld, New Jersey. DENNETT, D.C. (1996), Darwin 's Dangerous Idea, Touchstone Books (Simon and Schuster), New York. DiXIT, A. (1980), "The rôle of investment in entry deterrence", The Economie Journal 90, 95-106. DiXIT, A. (1982), "Récent developments in oligopoly theory", The American Economie Review72, 12-17. DiXIT, A. & NALEBUF, B. (1993), Thinking Strategically: The Compétitive Edge in Business, Politics, and Everyday Life, W.W. Norton & Company, New York. Friedman, J. (1971), "A non-cooperative equilibrium for supergames", Review of Economie Studies 38, 1-12. FUDENBERG, D. & TlROLE, J. (1986a), Dynamic Models of Oligopoly, in A. Jacquemin, ed.r Fundamentals of Pure and Applied Economies, vol. 3, Harwood, New York. FUDENBERG, D. & TlROLE, J. (1991), Game Theory, MIT Press,Cambridge: MA. GlRAUD, G. (2000), La Théorie Des Jeux, Champs Université, Flammarion, Paris. GREMAQ, A. (1988), Dynamique, Information Incomplète, stratégies Industrielles, Economica, Paris. HARSANYI, J. (1967-68), "Games with incomplète information played by bayesian players ", Management science 14, 159-182, 320-334, 486-502. Bibliographie • 171
Kahneman, D. & TVERSKY, A. (1982), "Prospect theory:An analysis of décision under risk ", Econometrica 24, 178-191. KlRMAN, A. & SALMON, M. (1995), Leaming and Rationality in Economies, Blackwell, Oxford. KREPS, D. (1999), Théorie Des Jeux et Modélisation Économique, Dunod, Paris. KREPS, D.M. (1996), Leçons de Théorie Microéconomique, Presses Universitaires de France, Paris. MAYNARD SMITH, J. (1982), Evolution and the Theory of Games, Cambridge University Press, Cambridge. MAYNARD-SMITH, J. (1987), "When learning guides évolution", Nature 329, 761-762. MlLGROM, P. & ROBERTS, J. (1982), "Limit pricing and entry under incomplète information: An equilibrium analysis", Econometrica 50, 443^459. MOULIN, H. (1979), Fondation de la Théorie des Jeux, Herman, Paris. MYERSON, R.B. (1991), Game Theory, Harvard University Press, Cambridge: MA. NELSON, R.R. & WiNTER, S. (1982), An Evolutionary Theory of Economie Change, The Belknap Press of Harvard University, London. OSBORNE, M.J. & RUBINSTEIN, A.(1994), A Course in Game Theory, MIT Press, Cambridge: MA. RUBINSTEIN, A. (1998), Modeling Bounded Rationality, The MIT Press, Cambridge: MA. SAVAGE, L. (1954), The Foundations of Statistics, Wiley & Sons, New York. Selten, R. (1975), "Reexamination of the perfeetness concept for equilibrium points in extensive games", International Journal ofGame Theory 4, 25-55. SIMON, H.A. (1972), Théories of bounded rationality, in R. Radner,C.B.; Radner, éd., "Décision and Organization", North-Holland, Amsterdam, pp. 161-176. SUN-TZU (1972), L'Art de la Guerre, Champs Flammarion, Paris. TIROLE, J. (1988), The Theory of Industrial Organization, The MIT Press, Cambridge, Massachusetts. UMBAUER, G. (1989), Information Incomplète et Qualité des Produits, Thèse de doctorat, Université Louis Pasteur, Strasbourg, France. UMBHAUER, G. (2002), Théorie Des Jeux Appliquée À la Gestion, Éditions ems, Colombelles. VON NEUMAN, J. & MORGENSTERN, O. (1944), Theory of Games and Economie Behavior, Princeton University Press, Second Ed.,Princeton. WEIBULL, J.W. (1995), Evolutionary Game Theory, MIT Press, Cambridge (MA). Weibull, J.W. (1998), "Evolution,rationality and equilibrium in games", European Economie Review 42, 641-649. 172 • INTRODUCTION À LA THÉORIE DES JEUX
A Accord tacite : 48 Actualisation : 87 Apprentissage : 76, 157 - par imitation : 168 - par renforcement : 167 Assurance de dommages : 119, 155 B Backward induction : 61 Barrières à l'entrée : 53 Bayes : 129 Bien-être social : 44 C Cartel : 95 Cheap talk : 48 Communication : 47 Condition d'incitation : 147 Conventions : 47 Coopération : 88 Coordination : 46, 157 Courbe de réaction : 71 Croyances : 128, 140-142 - hors-équilibre : 144 D D'Aspremont, Jacquemin, Gabszewich : 49 ndex Darwin : 9 Dennett, Daniel : 159 Différenciation des biens : 49 Dixit, Avinash : 70 Domination parétienne : 44, 47, 86 Duopole de Cournot : 5, 102 - information incomplète : 123 Dynamique de réplication : 163 E EBP : 142, 144 Efficacité parétienne : 44 Élimination des stratégies : 24 - dominées : 25 - équivalentes : 24 Ensemble - d'information : 6,16 -dejoueurs : 12 - de stratégies : 12 Entrée - accommodation : 74 - dissuasion : 73 EPSJ : 63, 86 -jeux bayésiens : 138 - optimalité parétienne : 69 - paradoxe de la rationalité : 68 - perfection bayésienne : 142 - théorème folk : 92 INDEX • 173
Équilibre(s) - bayésien parfait : 142 - corrélé : 48 -d'unjeu : 23 - de Bertrand : 106 - de Cournot : 103 -deNash:36,71, 159 • bayésien : 126, 130 • conditions d'existence : 43 • en stratégies mixtes : 37 • équivalents : 45 • et meilleures réponses : 40 • interchangeables : 46 • le théorème de Nash : 44 • modèle d'Hotelling : 53 • multiplicité : 45 • non-existence : 43 • optimalité parétienne : 45 • parfait en sous-jeux : 63 • rationalité limitée : 166 • stabilité évolutionnaire : 162 • strict : 36 - mélangeant : 143 - multiples : 23 - multiplicité : 90 - semi-séparateur : 143 - séparateur : 142 Erreur pure : 19 Espérance d'utilité : 41 F Facteur d'actualisation : 87 Fitness : 159 Fonction(s) de gain : 13 Fonction(s) de meilleure réponse 51 - en stratégies mixtes : 40 • représentation graphique : 42 - en stratégies pures : 38 Forme normale réduite : 24 Friedman, James : 93 Fudenberg, Drew : 70, 92 G GG:9 GU:9 H Harsanyi : 122 Hotelling : 49 I Imitation : 157, 167 Incertitude : 7 Induction vers l'amont : 61 Information : 5 - complète : 6, 17 - compléter l'information : 123 - ensemble d'information : 16 - imparfaite : 6, 17 - incomplète : 6, 17, 121 - parfaite : 6, 17 Investissement : 72 J Jeu(x) : 3, 4 -bayésiens : 121, 127 • séquentiels : 137 - coopératifs : 5, 10 - d'échecs : 6 - de coordination : 27 - en forme extensive : 15 - en forme normale : 12 - en information incomplète - évolutionnaires : 159 - horizon fini et défini : 93 - non coopératif : 48 - non coopératifs : 5 - répétés : 85 • finis : 88 • infinis : 88 - séquentiels : 5, 14 - simultanés : 5 - solutions d'un jeu : 23 - stratégiques : 5 - super-jeu : 90 174 • INTRODUCTION A LA THÉORIE DES JEUX
K KB :9 Kreps, David : 9, 141 M Maynard-Smith, John : 158 Menaces - crédibles : 48 • EPSJ : 66 - non-crédibles : 63 Microéconomie : 9 Milgrom, Paul : 148 Mutation : 158 Myopie : 86 N Nash, John : 35 Nelson, Richard : 8 Norme sociale : 86 O Observations imparfaites : 94 Optimum de Pareto : 45 Organisation industrielle : 3 P Point focal : 46 Préférence(s) : 7 - pour le présent : 87 Principe - de Bellman : 62 - de la rationalité individuelle : 48, 62 Prix-limite : 148 Probabilités : 7 - subjectives : 7 Profil de stratégies : 18 - locales : 22 Q Qualité des produits : 98, 144 R Rationalité : 6,7 - individuelle : 91 -limitée: 8, 157, 164 - Principe de rationalité individuelle : 48,62 - séquentielle : 140 Règle de Bayes : 128, 129, 141 Réputation : 98 Rétroduction : 61 Roberts, John : 148 Rosenthal : 69 Rubinstein, Ariel : 8 S s_f- : 24 Satisficing : 8 Sélection : 158 - naturelle : 157 Selten, Reinhard : 14, 62 Simon, Herbert : 8 Sous-jeu : 63 - propre : 63 Stabilité évolutionnaire : 159, 161 Stratégie(s) : 17, 18 - complémentaires : 71 - comportementale : 20 - ensemble de stratégies : 12 - équivalentes : 24 - évolutionnairement stables : 161 - faiblement dominées : 25, 26 - jeux bayésiens : 128 - locale : 20 - locales : 22 - mélangeante : 128, 143 - mixte : 20 - mixtes : 36, 40 - profil de stratégies : 12, 37 - pure : 20, 23 - révélatrice : 142 - séparatrice : 128 - strictement dominées : 25 • dynamique de réplication : 167 - substituables : 71 - Trigger strategy : 104 INDEX • 175
T Théorèmes folk : 86,91,93 Tirole, Jean : 70, 92, 148 U Utilité espérée : 8 V Valeur actualisée : 87 VNM : 7, 128 - utilité : 7 von Neumann, John : 3 von Stackelberg : 70 W Weibul, Jôïgen : 158 176 • INTRODUCTION A LA THÉORIE DES JEUX
55837 - (I) - (1,2) - OSB 80° - LAS - API Imprimerie Nouvelle - JOUVE 45800 Saint-Jean de Braye N° d'Imprimeur : 646090Y Dépôt légal: avril 2011 Dépôt légal de la lre édition : septembre 2003 Imprimé en France
ECOSUP Murât Yildizoglu INTRODUCTION À LA THÉORIE DES JEUX La théorie des jeux concerne tous les domaines de l'économie et du management. Elle sert à analyser les résultats possibles des interactions stratégiques entre les agents. Le problème de deux firmes fixant leur prix sur un marché, celui deux pays désirant coordonner leur politique budgétaire, celui de deux journaux optant pour une couverture résultent tous de l'interdépendance qui existe entre ces choix. La théorie des jeux propose des solutions là où l'analyse économique se révèle insuffisante. Initiation rigoureuse, cet ouvrage présente l'ensemble des concepts de la théorie des jeux : •jeux non coopératifs avec information complète (équilibre de Nash, jeux répétés, jeux de négociation) ; • jeux non coopératifs avec information incomplète (jeux simultanés et jeux séquentiels) ; • jeux évolutionnaires. Chaque chapitre comprend des exercices corrigés, des applications concrètes et un résumé des concepts. Cette 2e édition, entièrement mise à jour, est enrichie d'un nouveau chapitre sur les jeux de négociation. MURAT YILDIZOGLU Professeur de sciences économiques à l'université d'Aix Marseille et membre du laboratoire GREQAM, il a aussi enseigné dans les universités de Strasbourg et de Bordeaux IV, ainsi que dans des écoles doctorales européennes. > Étudiants en sciences économiques > Étudiants en sciences de gestion > Étudiants en MASS > Étudiants des écoles de commerce et d'ingénieurs l 9"782100»558377ll 6916084 ISBN 978-2-10-055837-7