Cours complet · du vocabulaire au théorème central limite

Le hasard
se compte.

Une probabilité n'est pas une intuition : c'est une mesure. Ce cours part de l'objet le plus concret qui soit — les 36 issues d'un lancer de deux dés — et va, sans trou dans le raisonnement, jusqu'aux théorèmes qui expliquent pourquoi le monde aléatoire finit par devenir prévisible. Douze ateliers permettent de manipuler chaque notion, et chaque chapitre se termine par des exercices intégralement corrigés.

Chapitres
11
Ateliers interactifs
12
Démonstrations
22
Exercices corrigés
29
Prérequis
Aucun

Atelier 1 — l'espace des possibles

Les 36 issues du lancer de deux dés

Chaque carré est une issue possible du lancer d'un dé bleu et d'un dé rouge, tous deux équilibrés et discernables. Choisissez deux événements : les carrés se colorent, et toutes les probabilités du chapitre 1 au chapitre 5 se lisent directement en comptant des cases.

A seul B seul A ∩ B ni A ni B

Colonnes : dé bleu. Lignes : dé rouge.

P(A)
—
P(B)
—
P(A ∩ B)
—
P(A ∪ B)
—
P(A | B)
—
P(B | A)
—
Chapitre 01

Univers, issues, événements

Avant de calculer, il faut décrire. Toute la difficulté des probabilités est là : 80 % des erreurs viennent d'un univers mal choisi, pas d'un calcul faux.

1.1 — L'expérience aléatoire

Une expérience aléatoire est une expérience qui, reproduite dans des conditions identiques, peut donner des résultats différents, et dont on connaît l'ensemble des résultats possibles sans pouvoir prédire lequel surviendra.

Définition

Univers. L'ensemble de tous les résultats possibles d'une expérience aléatoire est appelé univers et noté \(\Omega\) (oméga majuscule). Un élément \(\omega \in \Omega\) est une issue (ou éventualité, ou résultat élémentaire).

Événement. Un événement est une partie de l'univers, c'est-à-dire un sous-ensemble \(A \subset \Omega\). On dit que l'événement \(A\) est réalisé si l'issue obtenue \(\omega\) appartient à \(A\).

Pour le lancer de deux dés discernables :

\[\Omega = \{1,2,3,4,5,6\}^2 = \{(i,j)\ :\ 1\le i\le 6,\ 1\le j\le 6\},\qquad \operatorname{card}(\Omega)=36.\]

L'événement « la somme vaut 7 » est le sous-ensemble \(A=\{(1,6),(2,5),(3,4),(4,3),(5,2),(6,1)\}\), qui contient 6 issues — ce sont exactement les 6 cases de la diagonale colorée dans l'atelier ci-dessus.

Erreur classique

Le choix de l'univers n'est pas neutre. Si l'on décide que l'univers du lancer de deux dés est l'ensemble des sommes \(\Omega'=\{2,3,\dots,12\}\), on obtient 11 issues — mais elles ne sont pas équiprobables : obtenir 7 est six fois plus probable qu'obtenir 2. C'est l'erreur commise par d'Alembert au XVIIIe siècle.

Règle de sécurité : choisissez toujours l'univers le plus fin possible, celui où les issues sont symétriques donc équiprobables. Ici : les couples, pas les sommes.

1.2 — Le vocabulaire ensembliste

Les événements sont des ensembles : les opérations logiques du langage courant sont donc des opérations ensemblistes.

Langage courantNotationSignification
« A et B se réalisent »\(A\cap B\)Intersection : les issues qui sont à la fois dans A et dans B
« A ou B se réalise »\(A\cup B\)Réunion : ou inclusif — au moins l'un des deux
« A ne se réalise pas »\(\bar A\) ou \(A^{c}\)Événement contraire : les issues de \(\Omega\) qui ne sont pas dans A
« A implique B »\(A\subset B\)Toute issue de A est dans B
« A et B ne peuvent coexister »\(A\cap B=\varnothing\)Événements incompatibles (ou disjoints)
Événement certain\(\Omega\)Toujours réalisé
Événement impossible\(\varnothing\)Jamais réalisé

On utilisera constamment les lois de De Morgan, qui traduisent la négation d'une phrase :

\[\overline{A\cup B}=\bar A\cap\bar B, \qquad \overline{A\cap B}=\bar A\cup\bar B.\]

En clair : la négation de « au moins un des deux » est « aucun des deux », et la négation de « les deux » est « au moins un des deux manque ». C'est ce passage au contraire qui rend faciles les exercices contenant les mots « au moins un ».

Exemple

Probabilité d'obtenir au moins un six en lançant deux dés. Compter directement demande d'éviter les doubles comptages. Passons au contraire : « aucun six » correspond à \(5\times 5=25\) cases sur 36. Donc

\[P(\text{au moins un six}) = 1-\frac{25}{36}=\frac{11}{36}\approx 0{,}3056.\]

Vérifiez : sélectionnez « au moins un 6 » dans l'atelier — vous compterez 11 cases colorées.

1.3 — Système complet d'événements

Définition

Une famille d'événements \((A_1,\dots,A_n)\) forme un système complet d'événements (ou une partition de \(\Omega\)) si :

  • ils sont deux à deux incompatibles : \(A_i\cap A_j=\varnothing\) dès que \(i\ne j\) ;
  • ils recouvrent tout l'univers : \(A_1\cup A_2\cup\dots\cup A_n=\Omega\) ;
  • (en général on impose de plus \(P(A_i)>0\) pour pouvoir conditionner par eux).

Le plus petit système complet non trivial est \(\{A,\bar A\}\). C'est l'outil qui permettra, au chapitre 4, de découper un problème en cas et d'appliquer la formule des probabilités totales.

Pour aller plus loin — pourquoi parle-t-on de « tribu » ?

Quand \(\Omega\) est infini non dénombrable (par exemple \(\Omega=[0,1]\)), on démontre qu'il est impossible d'attribuer une probabilité à toutes les parties de \(\Omega\) tout en conservant les propriétés attendues (ce résultat s'appuie sur l'axiome du choix ; l'ensemble de Vitali en est le contre-exemple canonique). On ne mesure donc que certaines parties, dites mesurables.

Une tribu (ou \(\sigma\)-algèbre) \(\mathcal{A}\) sur \(\Omega\) est un ensemble de parties de \(\Omega\) tel que : (i) \(\Omega\in\mathcal{A}\) ; (ii) si \(A\in\mathcal{A}\) alors \(\bar A\in\mathcal{A}\) ; (iii) toute réunion dénombrable d'éléments de \(\mathcal{A}\) est dans \(\mathcal{A}\). Le triplet \((\Omega,\mathcal{A},P)\) s'appelle un espace probabilisé.

Lorsque \(\Omega\) est fini ou dénombrable, on prend toujours \(\mathcal{A}=\mathcal{P}(\Omega)\), l'ensemble de toutes les parties : la subtilité disparaît. C'est le cas dans tout ce cours, sauf mention contraire.

Exercices corrigés — chapitre 01

Exercice 1 facile

On lance deux dés équilibrés discernables. Décrire l'univers, puis calculer la probabilité de l'événement \(D\) : « les deux résultats diffèrent d'au moins 3 ».

Voir la correction

L'univers est \(\Omega=\{1,\dots,6\}^2\), de cardinal 36, et l'équiprobabilité est légitime (dés équilibrés, issues symétriques).

On compte les couples \((i,j)\) tels que \(|i-j|\ge 3\), en classant par valeur de l'écart :

  • écart 3 : \((1,4),(2,5),(3,6)\) et les trois couples symétriques, soit 6 issues ;
  • écart 4 : \((1,5),(2,6)\) et leurs symétriques, soit 4 issues ;
  • écart 5 : \((1,6)\) et son symétrique, soit 2 issues.

Ces trois cas sont incompatibles, donc \(\operatorname{card}(D)=6+4+2=12\) et \(P(D)=\dfrac{12}{36}=\dfrac13\).

Exercice 2 facile

Traduire en écriture ensembliste, à partir de trois événements \(A\), \(B\), \(C\) : (a) « au moins un des trois se réalise » ; (b) « exactement un des trois se réalise » ; (c) « aucun des trois ne se réalise » ; (d) « au plus un des trois se réalise ».

Voir la correction

(a) \(A\cup B\cup C\).

(b) \((A\cap\bar B\cap\bar C)\cup(\bar A\cap B\cap\bar C)\cup(\bar A\cap\bar B\cap C)\) : réunion de trois événements incompatibles, ce qui permettra d'additionner leurs probabilités.

(c) \(\bar A\cap\bar B\cap\bar C=\overline{A\cup B\cup C}\) (loi de De Morgan).

(d) « au plus un » = « aucun » ou « exactement un » : c'est la réunion des ensembles de (b) et (c). C'est aussi le contraire de « au moins deux », soit \(\overline{(A\cap B)\cup(A\cap C)\cup(B\cap C)}\).

Exercice 3 intermédiaire

Dans un jeu de 32 cartes, on tire une carte au hasard. Soit \(A\) : « la carte est un cœur » et \(B\) : « la carte est une figure » (valet, dame ou roi). Calculer les cardinaux de \(A\cap B\), \(A\cup B\), \(\bar A\cap B\), puis les probabilités correspondantes.

Voir la correction

Le jeu de 32 cartes comporte 4 couleurs de 8 cartes (7, 8, 9, 10, valet, dame, roi, as).

\(\operatorname{card}(A)=8\) ; \(\operatorname{card}(B)=3\times 4=12\) ; \(A\cap B\) est l'ensemble des trois figures de cœur, donc \(\operatorname{card}(A\cap B)=3\).

Par la formule du crible : \(\operatorname{card}(A\cup B)=8+12-3=17\), d'où \(P(A\cup B)=17/32\approx 0{,}531\).

\(\bar A\cap B\) est l'ensemble des figures qui ne sont pas des cœurs : \(12-3=9\) cartes, soit \(P=9/32\).

Contrôle : \(P(A)+P(B)-P(A\cap B)=\frac8{32}+\frac{12}{32}-\frac3{32}=\frac{17}{32}\) ✓.

Chapitre 02

Les axiomes de Kolmogorov

En 1933, Andreï Kolmogorov ramène toute la théorie à trois exigences. Tout le reste — absolument tout — s'en déduit par démonstration.

Axiomes

Une probabilité sur l'espace \((\Omega,\mathcal{A})\) est une application \(P:\mathcal{A}\to\mathbb{R}\) vérifiant :

  1. Positivité. \(P(A)\ge 0\) pour tout événement \(A\).
  2. Normalisation. \(P(\Omega)=1\).
  3. \(\sigma\)-additivité. Pour toute suite \((A_n)_{n\ge1}\) d'événements deux à deux incompatibles, \[P\!\left(\bigcup_{n\ge1}A_n\right)=\sum_{n\ge1}P(A_n).\]

Remarquez ce que ces axiomes ne disent pas : ils ne disent pas comment attribuer les valeurs. Ils disent seulement à quelles contraintes de cohérence toute attribution doit obéir. La probabilité est une mesure de masse totale 1 : on répartit un kilogramme de matière sur \(\Omega\), et \(P(A)\) est la masse posée sur \(A\).

2.1 — Les conséquences (toutes démontrées)

Propriété 1 — \(P(\varnothing)=0\)

Démonstration. Appliquons l'axiome 3 à la suite \(A_1=\Omega\), puis \(A_n=\varnothing\) pour \(n\ge2\). Ces événements sont bien deux à deux incompatibles et leur réunion vaut \(\Omega\). Donc \(P(\Omega)=P(\Omega)+\sum_{n\ge2}P(\varnothing)\), d'où \(\sum_{n\ge2}P(\varnothing)=0\). Comme tous ces termes sont égaux et positifs (axiome 1), une série de terme constant \(c\ge0\) ne peut converger vers 0 que si \(c=0\). Donc \(P(\varnothing)=0\). ∎

Attention : la réciproque est fausse. Un événement de probabilité nulle n'est pas forcément impossible (voir chapitre 6, cas continu).

Propriété 2 — additivité finie

Si \(A_1,\dots,A_n\) sont deux à deux incompatibles, alors \(P(A_1\cup\dots\cup A_n)=\sum_{k=1}^{n}P(A_k)\).

Démonstration. On complète la famille finie en une suite infinie en posant \(A_k=\varnothing\) pour \(k>n\). La \(\sigma\)-additivité donne le résultat puisque les termes ajoutés sont nuls d'après la propriété 1. ∎

Propriété 3 — probabilité du contraire

\(P(\bar A)=1-P(A)\).

Démonstration. \(A\) et \(\bar A\) sont incompatibles et \(A\cup\bar A=\Omega\). Par additivité finie, \(P(A)+P(\bar A)=P(\Omega)=1\). ∎

Propriété 4 — croissance et encadrement

Si \(A\subset B\), alors \(P(A)\le P(B)\), et de plus \(P(B\setminus A)=P(B)-P(A)\).

Démonstration. On décompose \(B=A\cup(B\setminus A)\), réunion de deux événements incompatibles. Donc \(P(B)=P(A)+P(B\setminus A)\). Comme \(P(B\setminus A)\ge0\) (axiome 1), on obtient \(P(B)\ge P(A)\). ∎

Conséquence. Pour tout \(A\), \(\varnothing\subset A\subset\Omega\) donne \(0\le P(A)\le 1\) : une probabilité ne dépasse jamais 1. Cette borne n'est pas un axiome, c'est un théorème.

Propriété 5 — formule d'inclusion-exclusion (dite « du crible »)

Pour deux événements quelconques, incompatibles ou non :

\[\boxed{\,P(A\cup B)=P(A)+P(B)-P(A\cap B)\,}\]

Démonstration. Décomposons \(A\cup B\) en trois morceaux deux à deux incompatibles : \((A\setminus B)\), \((A\cap B)\), \((B\setminus A)\). L'additivité donne \(P(A\cup B)=P(A\setminus B)+P(A\cap B)+P(B\setminus A)\). Or \(P(A\setminus B)=P(A)-P(A\cap B)\) et \(P(B\setminus A)=P(B)-P(A\cap B)\) par la propriété 4 (car \(A\cap B\subset A\)). En substituant : \(P(A\cup B)=P(A)+P(B)-P(A\cap B)\). ∎

Interprétation. En additionnant \(P(A)\) et \(P(B)\), on compte deux fois la zone commune ; on la retranche une fois. Pour trois événements :

\[P(A\cup B\cup C)=\sum P(A)-\sum P(A\cap B)+P(A\cap B\cap C).\]

↑ Dans l'atelier des dés, la ligne de vérification affiche en permanence le contrôle numérique de la propriété 5, quel que soit le couple d'événements choisi.

2.2 — Le cas de l'équiprobabilité

Théorème

Si \(\Omega\) est fini et si toutes les issues ont la même probabilité (situation d'équiprobabilité), alors pour tout événement \(A\) :

\[P(A)=\frac{\operatorname{card}(A)}{\operatorname{card}(\Omega)}=\frac{\text{nombre de cas favorables}}{\text{nombre de cas possibles}}.\]

Démonstration. Notons \(n=\operatorname{card}(\Omega)\) et \(p\) la valeur commune des \(P(\{\omega\})\). L'additivité appliquée à \(\Omega=\bigcup_{\omega\in\Omega}\{\omega\}\) donne \(1=np\), donc \(p=1/n\). Puis \(P(A)=\sum_{\omega\in A}P(\{\omega\})=\operatorname{card}(A)\cdot\frac1n\). ∎

Erreur classique

Cette formule est un cas particulier, pas la définition d'une probabilité. Elle exige deux conditions : univers fini et équiprobabilité. Elle est fausse pour un dé pipé, pour la durée de vie d'une ampoule, ou pour les sommes de deux dés. Les mots qui autorisent l'équiprobabilité : « équilibré », « non truqué », « au hasard », « indiscernables au toucher ».

2.3 — Que signifie P(A) = 0,3 ?

Les axiomes ne fixent pas l'interprétation. Trois lectures cohabitent, et elles sont toutes légitimes selon le contexte :

Les trois lectures produisent les mêmes calculs. Elles diffèrent sur les questions où l'on ne peut pas répéter l'expérience : « quelle est la probabilité qu'il ait plu à Paris le 3 mars 1789 ? » n'a de sens que dans la lecture bayésienne.

Exercices corrigés — chapitre 02

Exercice 1 facile

On sait que \(P(A)=0{,}6\), \(P(B)=0{,}5\) et \(P(A\cup B)=0{,}8\). Calculer \(P(A\cap B)\), \(P(\bar A\cap\bar B)\) et \(P(A\cap\bar B)\).

Voir la correction

Le crible donne \(P(A\cap B)=P(A)+P(B)-P(A\cup B)=0{,}6+0{,}5-0{,}8=0{,}3\).

Par De Morgan puis passage au contraire : \(P(\bar A\cap\bar B)=P(\overline{A\cup B})=1-0{,}8=0{,}2\).

Enfin \(A\) se décompose en deux morceaux incompatibles \(A=(A\cap B)\cup(A\cap\bar B)\), donc \(P(A\cap\bar B)=0{,}6-0{,}3=0{,}3\).

Contrôle : les quatre cases de la partition valent \(0{,}3+0{,}3+0{,}2+0{,}2=1\) ✓.

Exercice 2 intermédiaire

Démontrer l'inégalité de Bonferroni : pour tous événements \(A\) et \(B\), \(P(A\cap B)\ge P(A)+P(B)-1\).

Voir la correction

D'après la formule du crible, \(P(A\cap B)=P(A)+P(B)-P(A\cup B)\).

Or \(A\cup B\subset\Omega\), donc par croissance \(P(A\cup B)\le 1\), et retrancher un nombre plus petit donne un résultat plus grand :

\[P(A\cap B)=P(A)+P(B)-P(A\cup B)\ \ge\ P(A)+P(B)-1.\ \blacksquare\]

Usage : si deux tests réussissent chacun avec probabilité 0,95, ils réussissent simultanément avec une probabilité d'au moins 0,90, même sans hypothèse d'indépendance.

Exercice 3 difficile

Un dé est pipé de sorte que la probabilité d'obtenir la face \(k\) soit proportionnelle à \(k\). Déterminer la loi, puis calculer la probabilité d'obtenir un résultat pair.

Voir la correction

Par hypothèse \(P(\{k\})=\alpha k\) pour un réel \(\alpha>0\). L'axiome de normalisation impose

\[\sum_{k=1}^{6}\alpha k=\alpha\cdot\frac{6\times7}{2}=21\alpha=1,\qquad\text{donc}\qquad \alpha=\frac1{21}.\]

La loi est donc \(P(\{k\})=k/21\). L'événement « pair » est \(\{2,4,6\}\), réunion d'issues incompatibles :

\[P(\text{pair})=\frac{2+4+6}{21}=\frac{12}{21}=\frac47\approx 0{,}571.\]

Noter que la formule des cas favorables sur cas possibles donnerait \(3/6=0{,}5\) : elle est ici fausse, l'équiprobabilité n'étant pas vérifiée.

Chapitre 03

Dénombrer pour probabiliser

En situation d'équiprobabilité, calculer une probabilité, c'est compter. Quatre formules couvrent l'immense majorité des situations ; le seul travail réel consiste à identifier laquelle s'applique.

3.1 — Le principe multiplicatif

Principe fondamental

Si un choix se décompose en \(k\) étapes successives, la première offrant \(n_1\) possibilités, la deuxième \(n_2\) possibilités quelle que soit l'issue de la première, etc., alors le nombre total de résultats est :

\[n_1\times n_2\times\dots\times n_k.\]

Exemple : un code de carte bancaire à 4 chiffres offre \(10^4=10\,000\) possibilités ; la probabilité d'en deviner un au hasard du premier coup est donc \(10^{-4}\).

3.2 — Les quatre situations de tirage

On tire \(k\) éléments dans un ensemble de \(n\) éléments distincts. Deux questions décident de tout :

  1. L'ordre compte-t-il ? (une main de cartes : non ; un podium : oui)
  2. Peut-on répéter un élément ? (tirage avec remise : oui ; sans remise : non)

Atelier 2 — les quatre comptages

Calculateur de dénombrement

Fixez \(n\) (taille du réservoir) et \(k\) (nombre d'éléments tirés). Les quatre valeurs sont calculées en arithmétique exacte sur entiers, sans arrondi.

SituationNomFormuleValeur
Ordonné, avec répétitionk-listes\(n^k\)—
Ordonné, sans répétitionArrangements\(A_n^k=\dfrac{n!}{(n-k)!}\)—
Non ordonné, sans répétitionCombinaisons\(\dbinom{n}{k}=\dfrac{n!}{k!\,(n-k)!}\)—
Non ordonné, avec répétitionCombinaisons avec répétition\(\dbinom{n+k-1}{k}\)—

Exemple

Loto. Tirer 6 numéros parmi 49, sans remise et sans tenir compte de l'ordre : il y a \(\binom{49}{6}=13\,983\,816\) grilles. Toutes étant équiprobables, la probabilité de gagner avec une grille est

\[P=\frac{1}{13\,983\,816}\approx 7{,}15\times10^{-8}.\]

À raison d'un tirage par semaine, il faudrait en moyenne environ 268 000 ans pour gagner une fois.

3.3 — Propriétés du coefficient binomial

Le coefficient \(\binom{n}{k}\) (« k parmi n ») compte les parties à \(k\) éléments d'un ensemble à \(n\) éléments.

\[\binom{n}{k}=\binom{n}{n-k},\qquad \binom{n}{k}=\binom{n-1}{k-1}+\binom{n-1}{k},\qquad \sum_{k=0}^{n}\binom{n}{k}=2^{n}.\]
Démonstration combinatoire de la relation de Pascal

Fixons un élément particulier \(x\) de l'ensemble à \(n\) éléments. Les parties à \(k\) éléments se répartissent en deux catégories, disjointes et exhaustives :

  • celles qui contiennent \(x\) : il reste à choisir \(k-1\) éléments parmi les \(n-1\) autres, soit \(\binom{n-1}{k-1}\) parties ;
  • celles qui ne contiennent pas \(x\) : il faut choisir \(k\) éléments parmi les \(n-1\) autres, soit \(\binom{n-1}{k}\) parties.

La somme des deux donne le total. ∎ Cette relation est la règle de construction du triangle de Pascal.

Pourquoi \(\sum_k \binom{n}{k}=2^n\) ?

Le membre de gauche compte toutes les parties de l'ensemble, classées selon leur cardinal. Le membre de droite compte les mêmes parties autrement : pour chacun des \(n\) éléments, on décide « dedans » ou « dehors », soit \(2^n\) choix indépendants. Deux comptages du même ensemble donnent le même nombre. ∎ (C'est aussi la formule du binôme de Newton avec \(a=b=1\).)

Exercices corrigés — chapitre 03

Exercice 1 facile

Combien d'anagrammes (mots ayant un sens ou non) peut-on former avec les lettres du mot PROBABILITE ?

Voir la correction

Le mot comporte 11 lettres, avec la lettre B répétée 2 fois et la lettre I répétée 2 fois, les autres étant distinctes.

S'il n'y avait aucune répétition, on aurait \(11!\) permutations. Chaque anagramme est ici compté \(2!\times 2!\) fois (échanges des deux B entre eux, des deux I entre eux). D'où

\[\frac{11!}{2!\,2!}=\frac{39\,916\,800}{4}=9\,979\,200\ \text{anagrammes}.\]

Exercice 2 intermédiaire

Un comité de 5 personnes est tiré au sort parmi 8 femmes et 6 hommes. Quelle est la probabilité qu'il comporte exactement 3 femmes ?

Voir la correction

Le tirage est simultané : ni ordre, ni remise. L'univers est l'ensemble des comités, de cardinal \(\binom{14}{5}=2\,002\), et l'équiprobabilité est légitime (tirage au sort).

Un comité favorable se construit en deux étapes indépendantes de choix : 3 femmes parmi 8, puis 2 hommes parmi 6. Par le principe multiplicatif :

\[\operatorname{card}(A)=\binom83\binom62=56\times15=840,\qquad P(A)=\frac{840}{2\,002}=\frac{60}{143}\approx 0{,}4196.\]

Exercice 3 difficile

On distribue 5 cartes d'un jeu de 52. Calculer la probabilité d'obtenir au moins un as.

Voir la correction

On passe au contraire : « aucun as » signifie que les 5 cartes sont choisies parmi les 48 cartes non-as.

\[P(\text{aucun as})=\frac{\binom{48}{5}}{\binom{52}{5}}=\frac{1\,712\,304}{2\,598\,960}\approx 0{,}6588.\]

Donc \(P(\text{au moins un as})\approx 1-0{,}6588=0{,}3412\).

Erreur à éviter : écrire \(4\times\binom{48}{4}/\binom{52}{5}\) revient à compter deux fois les mains contenant deux as ; on obtiendrait 0,3612, valeur trop grande.

Chapitre 04

Conditionner : quand l'information change tout

Une probabilité n'est jamais absolue : elle dépend de ce que l'on sait. Conditionner, c'est réduire l'univers à l'information disponible — et c'est le point où l'intuition humaine échoue le plus spectaculairement.

Définition

Soit \(B\) un événement tel que \(P(B)>0\). La probabilité conditionnelle de A sachant B est :

\[P(A\mid B)=\frac{P(A\cap B)}{P(B)}.\]

On note parfois \(P_B(A)\). L'application \(A\mapsto P(A\mid B)\) est elle-même une probabilité sur \(\Omega\) : elle vérifie les trois axiomes de Kolmogorov.

Lecture géométrique. Savoir que \(B\) est réalisé revient à décréter que le nouvel univers est \(B\). On ne garde que les cases de \(B\), et on renormalise pour que la masse totale redevienne 1. D'où la division par \(P(B)\). Dans l'atelier des dés, \(P(A\mid B)\) est simplement le nombre de cases bicolores divisé par le nombre total de cases rouges (bicolores comprises).

4.1 — Les trois formules du chapitre

Théorèmes

(a) Probabilités composées. En multipliant la définition par \(P(B)\) :

\[P(A\cap B)=P(B)\,P(A\mid B)=P(A)\,P(B\mid A).\]

Généralisation à \(n\) événements : \(P(A_1\cap\dots\cap A_n)=P(A_1)P(A_2\mid A_1)P(A_3\mid A_1\cap A_2)\cdots\)

(b) Probabilités totales. Si \((B_1,\dots,B_n)\) est un système complet d'événements de probabilités non nulles :

\[P(A)=\sum_{i=1}^{n}P(B_i)\,P(A\mid B_i).\]

(c) Formule de Bayes. Pour \(P(A)>0\) et \(P(B)>0\) :

\[P(B\mid A)=\frac{P(A\mid B)\,P(B)}{P(A)}=\frac{P(A\mid B)P(B)}{\sum_{i}P(A\mid B_i)P(B_i)}.\]
Démonstration de la formule des probabilités totales

Puisque les \(B_i\) recouvrent \(\Omega\), on peut écrire \(A=A\cap\Omega=A\cap\left(\bigcup_i B_i\right)=\bigcup_i (A\cap B_i)\). Les événements \(A\cap B_i\) sont deux à deux incompatibles (car les \(B_i\) le sont). L'additivité donne \(P(A)=\sum_i P(A\cap B_i)\), et la formule des probabilités composées transforme chaque terme en \(P(B_i)P(A\mid B_i)\). ∎

Interprétation : on calcule \(P(A)\) comme une moyenne pondérée des probabilités de \(A\) dans chaque scénario, pondérée par la probabilité de chaque scénario. C'est le principe de l'arbre pondéré : on multiplie le long des branches, on additionne les branches qui aboutissent à A.

Démonstration de la formule de Bayes

La formule des probabilités composées donne deux écritures de la même quantité : \(P(A\cap B)=P(B)P(A\mid B)\) et \(P(A\cap B)=P(A)P(B\mid A)\). En égalant et en divisant par \(P(A)>0\), on obtient \(P(B\mid A)=P(A\mid B)P(B)/P(A)\). Le dénominateur se développe ensuite par la formule des probabilités totales. ∎

Erreur classique — l'inversion des conditionnelles

\(P(A\mid B)\) et \(P(B\mid A)\) sont deux nombres différents, et leur écart peut être colossal.

\(P(\text{a quatre pattes}\mid\text{est un chien})=1\), mais \(P(\text{est un chien}\mid\text{a quatre pattes})\) est petit. Confondre les deux est l'erreur du procureur : « la probabilité que ces traces ADN correspondent à un innocent est de 1 sur un million, donc la probabilité que l'accusé soit innocent est de 1 sur un million » — ce raisonnement est faux, et il a causé des erreurs judiciaires réelles.

Atelier 3 — le piège des faux positifs

Un test positif, et alors ?

Une maladie touche une fraction de la population. Un test de dépistage possède une sensibilité (probabilité d'être positif quand on est malade) et une spécificité (probabilité d'être négatif quand on est sain). Question : si votre test est positif, quelle est la probabilité que vous soyez réellement malade ? Chaque pixel du carré représente une personne sur 10 000.

Vrais positifs Faux positifs Faux négatifs Vrais négatifs
P(malade | positif)
—
P(sain | négatif)
—
Malades sur 10 000
—
Tests positifs sur 10 000
—
Ce qu'il faut retenir

Avec une prévalence de 1 %, une sensibilité de 99 % et une spécificité de 95 %, un test positif ne signifie qu'environ 17 % de risque d'être malade. La raison est purement arithmétique : les non-malades sont si nombreux que leurs 5 % d'erreurs (≈ 495 personnes) écrasent les 99 vrais positifs. Quand la maladie est rare, la plupart des tests positifs sont faux, même avec un excellent test. C'est pourquoi le dépistage de masse d'une maladie rare est délicat, et pourquoi un test positif est presque toujours suivi d'un second test.

Exercices corrigés — chapitre 04

Exercice 1 facile

L'urne \(U_1\) contient 3 boules blanches et 2 noires ; l'urne \(U_2\) contient 1 blanche et 4 noires. On choisit une urne à pile ou face, puis on y tire une boule. (a) Probabilité de tirer une blanche ? (b) La boule tirée est blanche : quelle est la probabilité qu'elle vienne de \(U_1\) ?

Voir la correction

(a) \((U_1,U_2)\) forme un système complet. Formule des probabilités totales :

\[P(B)=\tfrac12\times\tfrac35+\tfrac12\times\tfrac15=\tfrac{3}{10}+\tfrac1{10}=\tfrac{4}{10}=0{,}4.\]

(b) Formule de Bayes :

\[P(U_1\mid B)=\frac{P(U_1)P(B\mid U_1)}{P(B)}=\frac{0{,}3}{0{,}4}=0{,}75.\]

L'observation d'une boule blanche fait passer la croyance en \(U_1\) de 50 % à 75 % : c'est exactement le mécanisme de la mise à jour bayésienne.

Exercice 2 intermédiaire

Une usine produit des pièces sur deux machines : \(A\) fabrique 60 % de la production avec 2 % de défauts, \(B\) fabrique le reste avec 5 % de défauts. Une pièce prise au hasard est défectueuse : quelle est la probabilité qu'elle vienne de \(A\) ?

Voir la correction

Probabilités totales : \(P(D)=0{,}60\times0{,}02+0{,}40\times0{,}05=0{,}012+0{,}020=0{,}032\), soit 3,2 % de défauts.

Bayes : \(P(A\mid D)=\dfrac{0{,}012}{0{,}032}=0{,}375\).

La machine \(A\) produit la majorité des pièces mais seulement 37,5 % des défauts : produire beaucoup et produire mal sont deux choses distinctes, et c'est le produit des deux qui compte.

Exercice 3 difficile

Une urne contient 4 boules rouges et 6 vertes. On tire deux boules successivement sans remise. Quelle est la probabilité que la deuxième boule soit rouge ?

Voir la correction

On conditionne par la couleur de la première boule, qui forme un système complet :

\[P(R_2)=P(R_1)P(R_2\mid R_1)+P(V_1)P(R_2\mid V_1)=\frac4{10}\cdot\frac39+\frac6{10}\cdot\frac49=\frac{12+24}{90}=\frac{36}{90}=0{,}4.\]

On retrouve exactement \(P(R_1)=4/10\). Ce n'est pas un hasard : avant tout tirage, les deux positions jouent des rôles échangeables. Attention, cela ne signifie pas que \(R_1\) et \(R_2\) sont indépendants — ils ne le sont pas, puisque \(P(R_2\mid R_1)=1/3\ne 2/5\).

Chapitre 05

Indépendance

Deux événements sont indépendants quand savoir que l'un s'est produit ne change rien à la probabilité de l'autre. C'est une propriété numérique, pas une intuition physique.

Définition

Deux événements \(A\) et \(B\) sont indépendants si :

\[P(A\cap B)=P(A)\times P(B).\]

De façon équivalente, lorsque \(P(B)>0\) : \(P(A\mid B)=P(A)\).

La première écriture est préférable : elle est symétrique en \(A\) et \(B\), et elle reste valable même si l'un des événements est de probabilité nulle.

Erreur classique — la confusion majeure

Incompatible ≠ indépendant. Ce sont même des notions presque opposées.

Si \(A\) et \(B\) sont incompatibles avec \(P(A)>0\) et \(P(B)>0\), alors \(P(A\cap B)=P(\varnothing)=0\), tandis que \(P(A)P(B)>0\). Ils ne sont donc jamais indépendants : apprendre que \(A\) s'est produit vous apprend, de façon décisive, que \(B\) ne s'est pas produit. Une information maximale, donc une dépendance maximale.

Définition

Indépendance mutuelle. Des événements \(A_1,\dots,A_n\) sont mutuellement indépendants si pour toute sous-famille \(I\subset\{1,\dots,n\}\) :

\[P\!\left(\bigcap_{i\in I}A_i\right)=\prod_{i\in I}P(A_i).\]

Vérifier l'égalité pour les seules paires ne suffit pas.

Contre-exemple de Bernstein — indépendance deux à deux sans indépendance mutuelle

On lance deux pièces équilibrées. \(\Omega=\{PP,PF,FP,FF\}\), équiprobable. Posons :

  • \(A\) : « la première pièce donne pile » ;
  • \(B\) : « la seconde pièce donne pile » ;
  • \(C\) : « les deux pièces donnent le même résultat ».

Chacun a une probabilité \(1/2\). Les intersections deux à deux valent toutes \(1/4=\tfrac12\cdot\tfrac12\) — les événements sont donc deux à deux indépendants. Mais \(A\cap B\cap C=\{PP\}\), de probabilité \(1/4\), alors que \(P(A)P(B)P(C)=1/8\). Ils ne sont pas mutuellement indépendants : connaître \(A\) et \(B\) détermine complètement \(C\). ∎

Ce qu'il faut retenir

L'indépendance se vérifie par le calcul, ou se postule par la modélisation (lancers successifs, tirages avec remise, individus tirés dans une grande population). Ne la supposez jamais implicitement : c'est en multipliant des probabilités d'événements dépendants que l'on obtient les catastrophes statistiques — de l'affaire Sally Clark aux modèles de risque de la crise financière de 2008.

Exercices corrigés — chapitre 05

Exercice 1 facile

Avec deux dés équilibrés, les événements \(A\) : « le dé bleu est pair » et \(B\) : « la somme vaut au moins 10 » sont-ils indépendants ?

Voir la correction

\(P(A)=18/36=1/2\). Pour \(B\), les issues de somme \(\ge 10\) sont \((4,6),(5,5),(5,6),(6,4),(6,5),(6,6)\), soit \(P(B)=6/36=1/6\).

\(A\cap B\) : parmi ces six issues, celles dont le premier dé est pair sont \((4,6),(6,4),(6,5),(6,6)\), donc \(P(A\cap B)=4/36=1/9\).

Or \(P(A)P(B)=\frac12\cdot\frac16=\frac1{12}\ne\frac19\). Les événements sont dépendants : savoir que le dé bleu est pair augmente la probabilité d'une somme élevée.

Exercice 2 intermédiaire

Trois composants de fiabilité 0,9 fonctionnent indépendamment. Calculer la fiabilité du système s'ils sont montés en série (tous nécessaires), puis en parallèle (un seul suffit).

Voir la correction

Série : par indépendance mutuelle, \(P=0{,}9^3=0{,}729\).

Parallèle : on passe au contraire — le système tombe en panne si les trois tombent en panne :

\[P=1-(1-0{,}9)^3=1-0{,}001=0{,}999.\]

La redondance transforme 3 composants médiocres en un système très fiable ; la mise en série fait l'inverse. C'est la raison pour laquelle un système à 100 composants en série de fiabilité 0,99 n'est fiable qu'à \(0{,}99^{100}\approx 37\,\%\).

Exercice 3 difficile

Démontrer que si \(A\) et \(B\) sont indépendants, alors \(\bar A\) et \(\bar B\) le sont aussi.

Voir la correction

Par De Morgan puis passage au contraire et crible :

\[P(\bar A\cap\bar B)=P(\overline{A\cup B})=1-P(A\cup B)=1-P(A)-P(B)+P(A\cap B).\]

L'hypothèse d'indépendance permet de remplacer \(P(A\cap B)\) par \(P(A)P(B)\) :

\[P(\bar A\cap\bar B)=1-P(A)-P(B)+P(A)P(B)=\big(1-P(A)\big)\big(1-P(B)\big)=P(\bar A)P(\bar B).\ \blacksquare\]

Le même argument montre que \(A\) et \(\bar B\) sont indépendants : l'indépendance est stable par passage au contraire.

Chapitre 06

Variables aléatoires, espérance, variance

Passer des événements aux nombres : c'est ce qui permet de faire des moyennes, des sommes, et donc de la statistique.

Définition

Une variable aléatoire réelle est une application \(X:\Omega\to\mathbb{R}\) (mesurable, c'est-à-dire telle que \(\{X\le x\}\) soit un événement pour tout \(x\)).

Ce n'est ni une variable ni un nombre aléatoire : c'est une fonction qui, à chaque issue, associe un nombre. La loi de \(X\) est la donnée des probabilités \(P(X\in E)\) pour les parties \(E\subset\mathbb{R}\).

Exemple : dans le lancer de deux dés, \(S(i,j)=i+j\) est une variable aléatoire. Sa loi se lit dans la grille en comptant les diagonales : \(P(S=7)=6/36\), \(P(S=2)=1/36\).

6.1 — Espérance

Définition

Pour une variable aléatoire discrète prenant les valeurs \(x_1,x_2,\dots\), l'espérance est :

\[E(X)=\sum_{i}x_i\,P(X=x_i),\]

sous réserve de convergence absolue de la série. Dans le cas continu de densité \(f\) : \(E(X)=\int_{\mathbb{R}}x f(x)\,\mathrm{d}x\).

L'espérance est la moyenne pondérée des valeurs, les poids étant les probabilités. Physiquement, c'est le centre de gravité de la distribution de masse. Ce n'est pas la valeur la plus probable, et ce n'est pas nécessairement une valeur atteignable : l'espérance d'un dé vaut 3,5.

Propriétés — linéarité

Pour toutes variables aléatoires \(X,Y\) admettant une espérance et tous réels \(a,b\) :

\[E(aX+b)=aE(X)+b,\qquad \boxed{E(X+Y)=E(X)+E(Y)}\]

La seconde égalité est vraie même si \(X\) et \(Y\) sont dépendantes. C'est l'outil le plus puissant du chapitre.

Application spectaculaire de la linéarité — le problème des chapeaux

\(n\) personnes déposent leur chapeau ; on les redistribue au hasard. Combien de personnes récupèrent le leur en moyenne ?

Le calcul direct de la loi est pénible. Posons \(X_i=1\) si la personne \(i\) récupère son chapeau, \(0\) sinon. Alors \(X=\sum_i X_i\) est le nombre de personnes satisfaites, et \(E(X_i)=P(X_i=1)=1/n\). Les \(X_i\) sont dépendantes, mais la linéarité s'applique quand même :

\[E(X)=\sum_{i=1}^{n}\frac1n=1.\]

En moyenne, exactement une personne récupère son chapeau — quel que soit \(n\). ∎

6.2 — Variance et écart-type

Définition

La variance mesure la dispersion autour de l'espérance :

\[V(X)=E\big[(X-E(X))^2\big]\ \ge 0,\qquad \sigma(X)=\sqrt{V(X)}.\]

L'écart-type \(\sigma\) s'exprime dans la même unité que \(X\), ce qui le rend interprétable.

Formule de König–Huygens (la formule de calcul) \[V(X)=E(X^2)-\big(E(X)\big)^2.\]

Démonstration. Notons \(\mu=E(X)\), un nombre réel fixe. En développant le carré et en utilisant la linéarité :

\[E[(X-\mu)^2]=E[X^2-2\mu X+\mu^2]=E(X^2)-2\mu E(X)+\mu^2=E(X^2)-2\mu^2+\mu^2=E(X^2)-\mu^2.\ \blacksquare\]

Conséquence utile : \(E(X^2)\ge (E(X))^2\), car la variance est positive. C'est un cas particulier de l'inégalité de Jensen.

Propriétés \[V(aX+b)=a^2V(X),\qquad \sigma(aX+b)=|a|\,\sigma(X).\]

Une translation ne change pas la dispersion ; une dilatation la multiplie par \(a^2\) (par \(|a|\) pour l'écart-type).

Et pour une somme ? \(V(X+Y)=V(X)+V(Y)+2\operatorname{Cov}(X,Y)\), où \(\operatorname{Cov}(X,Y)=E(XY)-E(X)E(Y)\). Si \(X\) et \(Y\) sont indépendantes, la covariance est nulle et :

\[V(X+Y)=V(X)+V(Y)\quad\text{(indépendance requise !)}\]
Erreur classique

L'espérance s'additionne toujours ; la variance s'additionne seulement sous indépendance (ou plus faiblement, sous non-corrélation). Et l'écart-type ne s'additionne jamais : \(\sigma(X+Y)=\sqrt{\sigma(X)^2+\sigma(Y)^2}\) dans le cas indépendant. C'est un théorème de Pythagore.

6.3 — Fonction de répartition, cas continu

La fonction de répartition \(F_X(x)=P(X\le x)\) caractérise entièrement la loi. Elle est croissante, continue à droite, de limites 0 en \(-\infty\) et 1 en \(+\infty\).

Une variable est dite à densité (ou continue) s'il existe \(f\ge0\) telle que \(F_X(x)=\int_{-\infty}^{x}f(t)\,\mathrm{d}t\). Alors :

\[P(a\le X\le b)=\int_a^b f(t)\,\mathrm{d}t \quad\text{et}\quad \int_{\mathbb{R}}f=1.\]
Point délicat

Pour une variable à densité, \(P(X=a)=\int_a^a f=0\) pour toute valeur \(a\). Un événement de probabilité nulle n'est donc pas impossible : la variable prend bien une valeur ! De plus, les inégalités strictes et larges donnent le même résultat : \(P(X

Autre point : \(f(x)\) n'est pas une probabilité et peut dépasser 1. C'est une densité : seule son intégrale est une probabilité.

Exercices corrigés — chapitre 06

Exercice 1 facile

On mise 2 €, puis on lance un dé équilibré : on reçoit en euros le résultat du dé s'il vaut 5 ou 6, et rien sinon. Le jeu est-il favorable ?

Voir la correction

Soit \(X\) le gain net. \(X=-2\) avec probabilité 4/6, \(X=3\) avec probabilité 1/6, \(X=4\) avec probabilité 1/6.

\[E(X)=-2\cdot\frac46+3\cdot\frac16+4\cdot\frac16=\frac{-8+3+4}{6}=-\frac16\approx-0{,}17\ \text{€}.\]

Le jeu est défavorable : on perd en moyenne 17 centimes par partie. Sur 1 000 parties, la loi des grands nombres rend la perte quasi certaine (environ 167 €).

Exercice 2 intermédiaire

Soit \(S\) la somme de deux dés équilibrés. Calculer \(E(S)\) et \(V(S)\) de deux façons : par la loi de \(S\), puis par les propriétés de l'espérance et de la variance.

Voir la correction

Méthode rapide. \(S=D_1+D_2\) avec \(D_1,D_2\) indépendants de même loi uniforme sur \(\{1,\dots,6\}\).

Pour un dé : \(E(D)=\frac{1+\dots+6}{6}=3{,}5\) et \(E(D^2)=\frac{1+4+9+16+25+36}{6}=\frac{91}{6}\), donc \(V(D)=\frac{91}{6}-3{,}5^2=\frac{35}{12}\).

Par linéarité, \(E(S)=3{,}5+3{,}5=7\). Par indépendance, \(V(S)=\frac{35}{12}+\frac{35}{12}=\frac{35}{6}\approx5{,}83\), soit \(\sigma\approx 2{,}415\).

Vérification par la loi. \(E(S)=\sum_{k=2}^{12}k\,P(S=k)=\frac{252}{36}=7\) ✓. La méthode par décomposition évite entièrement le calcul de la loi : c'est elle qu'il faut privilégier.

Exercice 3 difficile

Soit \(X\) une variable à valeurs dans \(\{0,1\}\) avec \(P(X=1)=p\). Montrer que \(V(X)=p(1-p)\) et déterminer la valeur de \(p\) qui maximise la variance.

Voir la correction

\(E(X)=0\cdot(1-p)+1\cdot p=p\). Comme \(X^2=X\) (car \(0^2=0\) et \(1^2=1\)), on a aussi \(E(X^2)=p\). D'où, par König–Huygens :

\[V(X)=E(X^2)-E(X)^2=p-p^2=p(1-p).\]

La fonction \(p\mapsto p-p^2\) a pour dérivée \(1-2p\), qui s'annule en \(p=1/2\) en changeant de signe (positive avant, négative après) : c'est un maximum, de valeur \(1/4\).

Interprétation : l'incertitude est maximale pour une pièce équilibrée et nulle pour un événement certain (\(p=0\) ou \(p=1\)). C'est aussi pourquoi un sondage est le plus difficile à trancher lorsque l'opinion est à 50/50.

Chapitre 07

Les lois usuelles

Une poignée de modèles décrit la quasi-totalité des situations concrètes. Les reconnaître, c'est éviter de tout recalculer.

Atelier 4 — explorateur de lois

Voir la loi, ses paramètres, ses moments

Déplacez les paramètres et observez la déformation de la distribution. Les barres représentent \(P(X=k)\) (lois discrètes) ; la courbe représente la densité \(f(x)\) (lois continues). Le trait vertical marque l'espérance, la bande horizontale l'intervalle \([\mu-\sigma,\ \mu+\sigma]\).

Axe vertical : P(X = k) pour les lois discrètes, densité f(x) pour les lois continues. Trait rouge : espérance. Bande claire : intervalle [μ − σ ; μ + σ].

Espérance E(X)
—
Variance V(X)
—
Écart-type σ(X)
—
Support
—

7.1 — Le schéma de Bernoulli et la loi binomiale

Une épreuve de Bernoulli est une expérience à deux issues : succès (probabilité \(p\)) ou échec (probabilité \(1-p\)). On répète \(n\) fois cette épreuve, de façon indépendante et dans les mêmes conditions (donc à \(p\) constant) : c'est un schéma de Bernoulli. La variable \(X\) comptant le nombre de succès suit la loi \(\mathcal{B}(n,p)\).

\[P(X=k)=\binom{n}{k}p^{k}(1-p)^{n-k},\qquad k\in\{0,1,\dots,n\}.\]
D'où vient cette formule ?

Une séquence précise contenant \(k\) succès et \(n-k\) échecs a, par indépendance, la probabilité \(p^k(1-p)^{n-k}\) — la multiplication est licite précisément parce que les épreuves sont indépendantes. Il reste à compter combien de séquences différentes contiennent exactement \(k\) succès : c'est le choix des \(k\) positions des succès parmi \(n\), soit \(\binom nk\). Ces séquences étant deux à deux incompatibles, on additionne leurs probabilités, toutes égales. ∎

Contrôle de cohérence : \(\sum_{k=0}^n\binom nk p^k(1-p)^{n-k}=(p+(1-p))^n=1\) par la formule du binôme de Newton. La loi est bien normalisée.

Condition d'emploi

Un tirage sans remise ne suit pas une loi binomiale (les épreuves ne sont pas indépendantes) mais une loi hypergéométrique. L'approximation binomiale est cependant excellente si l'échantillon représente moins de 10 % de la population : c'est le cas des sondages.

7.2 — Tableau de synthèse

LoiModéliseLoi de probabilité / densitéE(X)V(X)
Bernoulli \(\mathcal{B}(p)\)Une épreuve à deux issues\(P(X=1)=p\)\(p\)\(p(1-p)\)
Binomiale \(\mathcal{B}(n,p)\)Nombre de succès sur \(n\) essais\(\binom nk p^k(1-p)^{n-k}\)\(np\)\(np(1-p)\)
Géométrique \(\mathcal{G}(p)\)Rang du premier succès\((1-p)^{k-1}p\)\(\frac1p\)\(\frac{1-p}{p^2}\)
Poisson \(\mathcal{P}(\lambda)\)Événements rares sur une période\(e^{-\lambda}\frac{\lambda^k}{k!}\)\(\lambda\)\(\lambda\)
Uniforme discrèteTirage équiprobable dans \(\{1..n\}\)\(1/n\)\(\frac{n+1}2\)\(\frac{n^2-1}{12}\)
Uniforme continue \(\mathcal{U}[a,b]\)Instant « au hasard » dans un intervalle\(\frac1{b-a}\) sur \([a,b]\)\(\frac{a+b}2\)\(\frac{(b-a)^2}{12}\)
Exponentielle \(\mathcal{E}(\lambda)\)Durée de vie sans vieillissement\(\lambda e^{-\lambda x}\) sur \([0,\infty[\)\(\frac1\lambda\)\(\frac1{\lambda^2}\)
Hypergéométrique \(\mathcal{H}(N,K,n)\)Tirage sans remise de \(n\) objets\(\dfrac{\binom{K}{k}\binom{N-K}{n-k}}{\binom{N}{n}}\)\(n\frac KN\)\(n\frac KN\left(1-\frac KN\right)\frac{N-n}{N-1}\)
Normale \(\mathcal{N}(\mu,\sigma^2)\)Somme de nombreux petits aléas\(\frac1{\sigma\sqrt{2\pi}}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\)\(\mu\)\(\sigma^2\)
La loi exponentielle est « sans mémoire » — démonstration

Si \(X\sim\mathcal{E}(\lambda)\), alors pour tous \(s,t\ge0\) : \(P(X>s+t\mid X>s)=P(X>t)\).

Preuve. D'abord \(P(X>x)=\int_x^{\infty}\lambda e^{-\lambda u}\mathrm{d}u=e^{-\lambda x}\). Ensuite, comme \(\{X>s+t\}\subset\{X>s\}\) :

\[P(X>s+t\mid X>s)=\frac{P(X>s+t)}{P(X>s)}=\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}}=e^{-\lambda t}=P(X>t).\ \blacksquare\]

Interprétation. Un composant modélisé par cette loi ne vieillit pas : sachant qu'il a déjà duré 5 ans, sa durée de vie restante a la même loi qu'au premier jour. C'est réaliste pour la désintégration radioactive ou les pannes accidentelles, mais faux pour l'usure mécanique ou la mortalité humaine.

Les repères de la loi normale (règle 68 – 95 – 99,7)

Si \(X\sim\mathcal{N}(\mu,\sigma^2)\) :

  • \(P(\mu-\sigma\le X\le\mu+\sigma)\approx 0{,}6827\)
  • \(P(\mu-2\sigma\le X\le\mu+2\sigma)\approx 0{,}9545\)
  • \(P(\mu-3\sigma\le X\le\mu+3\sigma)\approx 0{,}9973\)

Ces valeurs ne dépendent ni de \(\mu\) ni de \(\sigma\), grâce au centrage-réduction : si \(Z=\frac{X-\mu}{\sigma}\), alors \(Z\sim\mathcal{N}(0,1)\), la loi normale centrée réduite. Toutes les lois normales sont donc la même courbe, translatée et dilatée.

7.3 — Tirage sans remise : la loi hypergéométrique

Une urne contient \(N\) objets dont \(K\) « gagnants ». On en tire \(n\) simultanément (donc sans remise). Le nombre \(X\) d'objets gagnants obtenus suit la loi hypergéométrique \(\mathcal{H}(N,K,n)\) :

\[P(X=k)=\frac{\dbinom{K}{k}\dbinom{N-K}{n-k}}{\dbinom{N}{n}},\qquad \max(0,\,n-N+K)\le k\le\min(n,K).\]
D'où vient cette formule, et pourquoi ce n'est pas une binomiale

Démonstration. L'univers est l'ensemble des tirages de \(n\) objets parmi \(N\), tous équiprobables : \(\operatorname{card}(\Omega)=\binom Nn\). Un tirage favorable se construit en deux choix indépendants : \(k\) gagnants parmi les \(K\) disponibles, puis \(n-k\) perdants parmi les \(N-K\) restants. Le principe multiplicatif donne \(\binom Kk\binom{N-K}{n-k}\) cas favorables, d'où la formule. ∎

Comparaison avec la binomiale. Les deux comptent des succès, mais la binomiale suppose la probabilité de succès constante (tirage avec remise), alors qu'ici chaque tirage modifie la composition de l'urne. On retrouve la même espérance \(E(X)=n\frac KN\), mais la variance est réduite par le facteur d'exhaustivité \(\frac{N-n}{N-1}\), toujours \(\le 1\) : retirer les objets déjà tirés diminue le hasard restant. Ce facteur tend vers 1 quand \(N\) devient très grand devant \(n\), et l'on retrouve alors la binomiale — c'est ce qui justifie l'usage de la binomiale dans les sondages.

Dans l'atelier 4, sélectionnez « Hypergéométrique » puis augmentez la taille du tirage : à \(n=N\) la loi devient déterministe (on tire toute l'urne), et la variance s'annule.

7.4 — Deux variables à la fois : covariance et corrélation

Définitions

La covariance mesure la tendance de deux variables à s'écarter de leur moyenne dans le même sens :

\[\operatorname{Cov}(X,Y)=E\big[(X-E X)(Y-E Y)\big]=E(XY)-E(X)E(Y).\]

Le coefficient de corrélation linéaire la normalise pour la rendre sans unité :

\[\rho(X,Y)=\frac{\operatorname{Cov}(X,Y)}{\sigma(X)\,\sigma(Y)}\in[-1,1].\]

\(\rho=\pm1\) si et seulement s'il existe une relation affine exacte \(Y=aX+b\) (avec \(a\) du signe de \(\rho\)).

L'indépendance entraîne \(\operatorname{Cov}(X,Y)=0\). La réciproque est fausse en général : la covariance ne détecte que la partie linéaire de la dépendance.

Atelier 11 — le couple gaussien

Voir la corrélation

2 500 points sont tirés selon un couple gaussien centré réduit de corrélation \(\rho\). L'ellipse contient 95 % de la masse théorique ; la droite rouge est la droite de régression \(y=\rho x\).

ρ théorique
—
Corrélation empirique
—
Covariance empirique
—
Variance expliquée ρ²
—
Erreur classique — corrélation nulle et indépendance

Soit \(X\sim\mathcal{N}(0,1)\) et \(S\) valant \(+1\) ou \(-1\) avec probabilité 1/2, indépendante de \(X\). Posons \(Y=SX\). Alors \(Y\sim\mathcal{N}(0,1)\) également, et

\[\operatorname{Cov}(X,Y)=E(XY)=E(S)\,E(X^2)=0\times 1=0.\]

Pourtant \(X\) et \(Y\) sont très dépendantes : \(|Y|=|X|\) toujours ! Corrélation nulle n'est donc pas indépendance. L'équivalence n'est vraie que dans un cas particulier, mais important : celui d'un couple gaussien, où \(\rho=0\) équivaut à l'indépendance. Ici le couple \((X,Y)\) n'est pas gaussien, bien que chaque marge le soit.

Enfin, corrélation n'est pas causalité : une variable cachée peut causer les deux (voir le paradoxe de Simpson, chapitre 10).

Exercices corrigés — chapitre 07

Exercice 1 facile

Un QCM comporte 20 questions à 4 réponses dont une seule est correcte. Un candidat répond entièrement au hasard. Donner la loi du nombre \(X\) de bonnes réponses, son espérance et son écart-type, puis la probabilité d'obtenir la moyenne (au moins 10 bonnes réponses).

Voir la correction

Les 20 questions constituent un schéma de Bernoulli : épreuves indépendantes, même probabilité de succès \(p=0{,}25\). Donc \(X\sim\mathcal{B}(20\,;\,0{,}25)\).

\(E(X)=np=5\) et \(V(X)=np(1-p)=3{,}75\), soit \(\sigma\approx1{,}94\).

\(P(X\ge10)=\sum_{k=10}^{20}\binom{20}{k}0{,}25^k\,0{,}75^{20-k}\approx 0{,}0139\), soit environ 1,4 %. Obtenir la moyenne au hasard n'est pas impossible, mais reste très improbable ; c'est ce calcul qui justifie les barèmes avec points négatifs.

Exercice 2 intermédiaire

Un standard reçoit en moyenne 3 appels par heure, modélisés par une loi de Poisson. Calculer la probabilité de ne recevoir aucun appel en une heure, puis d'en recevoir au moins deux.

Voir la correction

\(X\sim\mathcal{P}(3)\), donc \(P(X=k)=e^{-3}\dfrac{3^k}{k!}\).

\(P(X=0)=e^{-3}\approx0{,}0498\).

\(P(X\ge2)=1-P(X=0)-P(X=1)=1-e^{-3}-3e^{-3}=1-4e^{-3}\approx0{,}8009\).

Attention : sur une demi-heure, le paramètre devient \(\lambda=1{,}5\) et non 3 — le paramètre est proportionnel à la durée d'observation.

Exercice 3 difficile

La durée de vie \(T\) d'un composant suit une loi exponentielle d'espérance 5 ans. Calculer \(P(T>8)\), puis \(P(T>13\mid T>5)\). Commenter.

Voir la correction

\(E(T)=1/\lambda=5\) donne \(\lambda=0{,}2\), et \(P(T>x)=e^{-0{,}2x}\).

\(P(T>8)=e^{-1{,}6}\approx0{,}2019\).

\(P(T>13\mid T>5)=\dfrac{P(T>13)}{P(T>5)}=\dfrac{e^{-2{,}6}}{e^{-1}}=e^{-1{,}6}\approx0{,}2019\).

Les deux résultats sont identiques : c'est l'absence de mémoire. Un composant ayant déjà tenu 5 ans est, statistiquement, aussi neuf qu'au premier jour. Ce modèle convient aux pannes accidentelles, mais surtout pas à l'usure : pour celle-ci on emploie une loi de Weibull.

Chapitre 08

Les théorèmes limites

Voici le cœur de la théorie : l'imprévisible individuel produit du prévisible collectif. Deux théorèmes expliquent tout le reste — et deux inégalités les rendent quantitatifs.

8.1 — Les inégalités de concentration

Théorèmes

Inégalité de Markov. Si \(X\ge0\) admet une espérance, alors pour tout \(a>0\) :

\[P(X\ge a)\le\frac{E(X)}{a}.\]

Inégalité de Bienaymé–Tchebychev. Si \(X\) admet une variance, alors pour tout \(\varepsilon>0\) :

\[P\big(|X-E(X)|\ge\varepsilon\big)\le\frac{V(X)}{\varepsilon^{2}}.\]
Démonstrations

Markov. Posons \(A=\{X\ge a\}\) et considérons la variable indicatrice \(\mathbf{1}_A\). On a l'inégalité ponctuelle \(X\ge a\,\mathbf{1}_A\) : en effet, sur \(A\), \(X\ge a\) ; hors de \(A\), le membre de droite vaut 0 et \(X\ge0\) par hypothèse. L'espérance étant croissante, \(E(X)\ge a\,E(\mathbf{1}_A)=a\,P(A)\). On divise par \(a>0\). ∎

Bienaymé–Tchebychev. Appliquons Markov à la variable positive \(Y=(X-E(X))^2\) et au seuil \(\varepsilon^2\) : \(P(Y\ge\varepsilon^2)\le E(Y)/\varepsilon^2=V(X)/\varepsilon^2\). Or l'événement \(\{Y\ge\varepsilon^2\}\) est exactement \(\{|X-E(X)|\ge\varepsilon\}\). ∎

Ces bornes sont grossières mais universelles : elles ne supposent rien sur la loi. Exemple : au plus 25 % d'une population peut s'écarter de la moyenne de plus de \(2\sigma\) — quelle que soit la distribution.

8.2 — La loi des grands nombres

Théorème

Soit \((X_n)\) une suite de variables aléatoires indépendantes, de même loi, d'espérance \(\mu\) et de variance \(\sigma^2\) finies. Posons \(\bar X_n=\frac1n\sum_{k=1}^{n}X_k\). Alors pour tout \(\varepsilon>0\) :

\[P\big(|\bar X_n-\mu|\ge\varepsilon\big)\xrightarrow[n\to\infty]{}0 \qquad\text{(loi faible)}.\]

La loi forte affirme davantage : \(\bar X_n\to\mu\) presque sûrement, c'est-à-dire avec probabilité 1.

Démonstration de la loi faible (via Tchebychev)

Par linéarité, \(E(\bar X_n)=\frac1n\sum E(X_k)=\mu\). Par indépendance, \(V(\bar X_n)=\frac1{n^2}\sum V(X_k)=\frac{n\sigma^2}{n^2}=\frac{\sigma^2}{n}\). L'inégalité de Bienaymé–Tchebychev appliquée à \(\bar X_n\) donne :

\[P(|\bar X_n-\mu|\ge\varepsilon)\le\frac{\sigma^2}{n\varepsilon^2}\xrightarrow[n\to\infty]{}0.\ \blacksquare\]

Cette preuve fournit en prime une vitesse : l'écart typique décroît comme \(1/\sqrt n\). Diviser l'incertitude par 2 exige de quadrupler la taille de l'échantillon.

Atelier 5 — la loi des grands nombres

La fréquence converge, l'écart absolu diverge

À gauche : la fréquence de « pile » au fil des lancers, avec l'enveloppe \(0{,}5\pm 1{,}96/(2\sqrt n)\), qui contient environ 95 % des trajectoires. À droite : l'écart en nombre absolu entre les piles obtenus et \(n/2\), comparé à l'écart-type \(\sqrt n/2\). Les deux graphiques racontent deux histoires opposées, et c'est là toute la subtilité du théorème.

Aucune simulation.

Fréquence cumulée → converge vers 0,5

|piles − n/2| → grandit, à l'échelle de √n/2

Erreur classique — le « retour à l'équilibre »

La loi des grands nombres n'affirme pas qu'un excédent de piles sera compensé par un excédent de faces. L'écart absolu \(|N_{\text{pile}}-n/2|\) tend au contraire vers l'infini. Ce qui converge, c'est le quotient par \(n\) : l'écart devient négligeable relativement, non pas parce qu'il diminue, mais parce que \(n\) grandit plus vite que lui. Le passé n'est pas corrigé : il est dilué.

8.3 — Le théorème central limite

Théorème (Lindeberg–Lévy)

Sous les mêmes hypothèses (variables indépendantes, de même loi, \(\sigma^2\) finie et non nulle) :

\[\frac{\bar X_n-\mu}{\sigma/\sqrt n}\ \xrightarrow[n\to\infty]{\mathcal{L}}\ \mathcal{N}(0,1),\]

c'est-à-dire que pour tous réels \(a

Autrement dit : la somme d'un grand nombre de petites contributions aléatoires indépendantes est approximativement gaussienne, quelle que soit la loi de départ. C'est la raison profonde de l'omniprésence de la courbe en cloche — et le fondement des intervalles de confiance et des tests statistiques.

Atelier 6 — le théorème central limite

La cloche apparaît toute seule

On somme \(n\) dés équilibrés et on répète 40 000 fois. Pour \(n=1\), la distribution est plate (uniforme). Augmentez \(n\) : la courbe gaussienne théorique, en trait plein, se superpose à l'histogramme simulé sans qu'on ait rien imposé.

Espérance théorique 3,5 n
—
Écart-type théorique √(35n/12)
—
Moyenne simulée
—
Écart-type simulé
—

8.4 — La planche de Galton

Francis Galton construisit en 1873 une machine qui fabrique une courbe en cloche sous les yeux du spectateur. Chaque bille rencontre une rangée de clous et dévie à gauche ou à droite avec probabilité 1/2, indépendamment à chaque rangée. Le bac d'arrivée est donc le nombre de déviations à droite : une variable \(\mathcal{B}(R\,;\,0{,}5)\) où \(R\) est le nombre de rangées. Le TCL fait le reste.

Atelier 10 — la machine à cloche

Versez des billes, regardez la loi apparaître

Trait rouge : effectifs attendus par la loi binomiale \(\mathcal{B}(R\,;\,0{,}5)\), à nombre de billes égal.

Billes tombées
0
Bac moyen observé
—
Bac moyen théorique R/2
—
Écart maximal à la théorie
—
Ce qu'il faut retenir

La planche de Galton est une démonstration matérielle du théorème central limite : la trajectoire d'une bille est imprévisible, la forme du tas est certaine. Chaque clou n'ajoute qu'un petit aléa indépendant de \(\pm\frac12\) ; leur somme, elle, se range immanquablement sous la cloche. Le hasard individuel ne s'annule pas : il s'organise.

Exercices corrigés — chapitre 08

Exercice 1 intermédiaire

Une variable \(X\) a pour espérance 10 et pour écart-type 2. On observe la moyenne \(\bar X_{100}\) de 100 réalisations indépendantes. Majorer \(P(|\bar X_{100}-10|\ge0{,}5)\) par Bienaymé–Tchebychev, puis l'estimer par le théorème central limite. Comparer.

Voir la correction

Tchebychev. \(V(\bar X_{100})=\sigma^2/n=4/100=0{,}04\). Donc

\[P(|\bar X_{100}-10|\ge0{,}5)\le\frac{0{,}04}{0{,}5^2}=0{,}16.\]

TCL. \(\sigma/\sqrt n=0{,}2\), et \(0{,}5=2{,}5\times0{,}2\). L'écart réduit dépasse 2,5 avec probabilité \(2\big(1-\Phi(2{,}5)\big)\approx 2\times0{,}0062=0{,}0124\).

La borne de Tchebychev (16 %) est 13 fois plus grossière que l'estimation par le TCL (1,24 %). C'est le prix de son universalité : elle ne suppose rien sur la loi, alors que le TCL exploite la forme gaussienne asymptotique.

Exercice 2 intermédiaire

Dans un sondage sur 1 000 personnes, 52 % déclarent voter pour le candidat A. Construire un intervalle de confiance à 95 % pour la proportion réelle \(p\), et conclure sur l'avance annoncée.

Voir la correction

Le nombre de partisans suit \(\mathcal{B}(n,p)\) ; la fréquence observée \(F\) a pour écart-type \(\sqrt{p(1-p)/n}\), majoré par \(1/(2\sqrt n)\) puisque \(p(1-p)\le1/4\).

Le TCL donne l'intervalle \(\left[f-\dfrac{1{,}96}{2\sqrt n}\,;\,f+\dfrac{1{,}96}{2\sqrt n}\right]\) avec \(n=1\,000\), soit une demi-largeur de \(0{,}031\) :

\[IC_{95\%}=[0{,}489\,;\,0{,}551].\]

La valeur 0,50 appartient à l'intervalle : l'avance annoncée n'est pas significative. C'est la lecture correcte de la « marge d'erreur de 3 points » mentionnée dans la presse.

Exercice 3 difficile

Quelle taille d'échantillon faut-il pour estimer une proportion à \(\pm 1\) point près, avec un niveau de confiance de 95 % ?

Voir la correction

On veut \(\dfrac{1{,}96}{2\sqrt n}\le0{,}01\), c'est-à-dire \(\sqrt n\ge\dfrac{1{,}96}{0{,}02}=98\), soit

\[n\ge 98^2=9\,604.\]

Il faut donc environ 9 600 personnes pour gagner un facteur 3 de précision par rapport à un sondage de 1 000. La précision progresse en \(1/\sqrt n\) : diviser l'erreur par 3 coûte 9 fois plus d'enquêtés. Remarquez que la taille de la population n'intervient nulle part.

Chapitre 09

Chaînes de Markov

Jusqu'ici, les répétitions étaient indépendantes. Passons au cas où le présent dépend du passé — mais seulement du passé immédiat. C'est le modèle aléatoire le plus utilisé au monde : météo, files d'attente, génétique, moteurs de recherche, modèles de langage.

9.1 — Définition et matrice de transition

Définition

Une suite de variables aléatoires \((X_n)_{n\ge0}\) à valeurs dans un ensemble fini \(E=\{1,\dots,r\}\) (les états) est une chaîne de Markov homogène si, pour tout \(n\) et tous états \(i,j\) et toute histoire passée compatible :

\[P\big(X_{n+1}=j\mid X_n=i,\ X_{n-1}=i_{n-1},\dots,X_0=i_0\big)=P(X_{n+1}=j\mid X_n=i)=p_{ij}.\]

La première égalité est la propriété de Markov (« le futur ne dépend du passé qu'à travers le présent ») ; la seconde est l'homogénéité (les règles ne changent pas au cours du temps).

La matrice \(P=(p_{ij})\) est la matrice de transition. Elle est stochastique : ses coefficients sont positifs et chaque ligne somme à 1, car depuis l'état \(i\) la chaîne va nécessairement quelque part.

Ce que « sans mémoire » veut dire — et ne veut pas dire

La propriété de Markov n'affirme pas que le passé est sans influence : elle affirme que toute l'information utile du passé est résumée dans l'état courant. Si ce n'est pas le cas, la modélisation n'est pas fausse pour autant : il suffit d'enrichir l'état. Pour une météo dépendant des deux jours précédents, on prend pour état le couple (hier, aujourd'hui), et la propriété de Markov redevient vraie.

9.2 — Faire évoluer une distribution

Notons \(\pi_n=(P(X_n=1),\dots,P(X_n=r))\) la loi de la chaîne à l'instant \(n\), écrite en vecteur ligne.

Théorème \[\pi_{n+1}=\pi_n P,\qquad\text{donc}\qquad \pi_n=\pi_0\,P^{\,n}.\]

De plus (relation de Chapman–Kolmogorov), le coefficient \((i,j)\) de \(P^{\,n}\) est exactement \(P(X_n=j\mid X_0=i)\).

Démonstration

Les événements \(\{X_n=i\}\), pour \(i\in E\), forment un système complet. La formule des probabilités totales donne, pour tout état \(j\) :

\[P(X_{n+1}=j)=\sum_{i\in E}P(X_n=i)\,P(X_{n+1}=j\mid X_n=i)=\sum_{i\in E}\pi_n(i)\,p_{ij},\]

ce qui est précisément la \(j\)-ième coordonnée du produit matriciel \(\pi_nP\). La seconde égalité s'obtient par récurrence immédiate : \(\pi_0P^0=\pi_0\), et si \(\pi_n=\pi_0P^n\) alors \(\pi_{n+1}=\pi_nP=\pi_0P^{n+1}\). ∎

Conséquence pratique : toute la dynamique se calcule par des produits de matrices. C'est ce qui rend ces modèles si commodes numériquement.

9.3 — Le régime stationnaire

Définition et théorème

Une distribution de probabilité \(\pi\) est stationnaire (ou invariante) si \(\pi P=\pi\) : partie de \(\pi\), la chaîne reste distribuée selon \(\pi\) pour toujours.

Théorème ergodique (admis). Si la chaîne est irréductible (tout état est atteignable depuis tout autre) et apériodique (les retours possibles à un état ne sont pas tous multiples d'un même entier \(d\ge2\)), alors :

  • il existe une unique distribution stationnaire \(\pi\) ;
  • \(\pi_n\to\pi\) quelle que soit la distribution initiale \(\pi_0\) : la chaîne oublie son point de départ ;
  • la proportion de temps passée dans l'état \(i\) tend presque sûrement vers \(\pi_i\) — c'est la loi des grands nombres des chaînes de Markov.
Calcul complet du cas à deux états

Prenons \(E=\{1,2\}\) et \(P=\begin{pmatrix}1-a & a\\ b & 1-b\end{pmatrix}\) avec \(a,b\in\ ]0,1[\).

On cherche \(\pi=(\pi_1,\pi_2)\) vérifiant \(\pi P=\pi\) et \(\pi_1+\pi_2=1\). La première coordonnée donne :

\[\pi_1(1-a)+\pi_2 b=\pi_1\ \Longleftrightarrow\ \pi_2 b=\pi_1 a.\]

(La seconde coordonnée fournit la même équation : les deux lignes sont toujours redondantes, c'est la contrainte de normalisation qui ferme le système.) En substituant \(\pi_2=1-\pi_1\) :

\[(1-\pi_1)b=\pi_1 a\ \Longrightarrow\ \pi_1=\frac{b}{a+b},\qquad \pi_2=\frac{a}{a+b}.\ \blacksquare\]

Lecture : l'état 1 est d'autant plus fréquent qu'on en sort peu (\(a\) petit) et qu'on y entre souvent (\(b\) grand). L'équilibre \(\pi_1 a=\pi_2 b\) exprime que le flux sortant de 1 égale le flux entrant : c'est un bilan de conservation, exactement comme en physique.

Application numérique : avec \(a=0{,}1\) et \(b=0{,}2\), on obtient \(\pi=(2/3,\,1/3)\).

Atelier 12 — chaînes de Markov

Une météo à trois états

Réglez les poids relatifs de chaque transition : chaque ligne est automatiquement normalisée pour former une loi de probabilité. Le graphique montre l'évolution de \(\pi_n\) à partir d'un jour beau certain. Les traits pointillés marquent la distribution stationnaire, calculée indépendamment.

Axe horizontal : nombre d'étapes n. Axe vertical : probabilité de chaque état. Traits pointillés : distribution stationnaire.

π stationnaire — Beau
—
π stationnaire — Nuageux
—
π stationnaire — Pluie
—
Fréquences simulées (20 000 jours)
—
Contre-exemple — la périodicité empêche la convergence

Réglez la matrice sur le cycle strict Beau → Nuageux → Pluie → Beau (un seul poids non nul par ligne). La chaîne est irréductible, elle possède bien une unique distribution stationnaire \((1/3,1/3,1/3)\), mais \(\pi_n\) ne converge pas : elle tourne indéfiniment entre trois vecteurs. L'hypothèse d'apériodicité n'est pas décorative. En revanche, la moyenne temporelle converge toujours, elle, vers 1/3 pour chaque état.

9.4 — Trois applications

Exercices corrigés — chapitre 09

Exercice 1 facile

Une machine est en marche ou en panne. Chaque jour, une machine en marche tombe en panne avec probabilité 0,1 ; une machine en panne est réparée avec probabilité 0,4. Écrire la matrice de transition, puis calculer la proportion de temps en marche à long terme.

Voir la correction

Avec l'ordre des états (marche, panne) :

\[P=\begin{pmatrix}0{,}9 & 0{,}1\\ 0{,}4 & 0{,}6\end{pmatrix}.\]

La chaîne est irréductible et apériodique (les coefficients diagonaux sont non nuls). En appliquant la formule du cas à deux états avec \(a=0{,}1\) et \(b=0{,}4\) :

\[\pi_{\text{marche}}=\frac{b}{a+b}=\frac{0{,}4}{0{,}5}=0{,}8,\qquad \pi_{\text{panne}}=0{,}2.\]

La machine est disponible 80 % du temps. Notez qu'améliorer la réparation (augmenter \(b\)) et fiabiliser la machine (diminuer \(a\)) agissent tous deux sur le même rapport : c'est le quotient \(a/b\) qui gouverne l'équilibre.

Exercice 2 intermédiaire

Avec la matrice de l'exercice 1 et une machine en marche au jour 0, calculer la loi au jour 2.

Voir la correction

\(\pi_0=(1,0)\). Alors \(\pi_1=\pi_0P=(0{,}9\,;\,0{,}1)\), puis :

\[\pi_2=\pi_1P=(0{,}9\times0{,}9+0{,}1\times0{,}4\ ;\ 0{,}9\times0{,}1+0{,}1\times0{,}6)=(0{,}85\,;\,0{,}15).\]

La suite \(0{,}9\ ;\ 0{,}85\ ;\ 0{,}835\dots\) décroît vers 0,8 de façon géométrique : on montre que \(\pi_n(\text{marche})-0{,}8=0{,}2\times0{,}5^{\,n}\), la vitesse de convergence étant donnée par la seconde valeur propre \(1-a-b=0{,}5\).

Exercice 3 difficile

Montrer que si une chaîne à deux états vérifie \(a=b=1\), alors elle admet une unique distribution stationnaire mais que \(\pi_n\) ne converge pas. Où l'hypothèse du théorème ergodique est-elle mise en défaut ?

Voir la correction

Ici \(P=\begin{pmatrix}0&1\\1&0\end{pmatrix}\) : la chaîne alterne strictement. La formule donne \(\pi=(1/2,1/2)\), qui vérifie bien \(\pi P=\pi\).

Mais en partant de \(\pi_0=(1,0)\), on obtient \(\pi_1=(0,1)\), \(\pi_2=(1,0)\), etc. : la suite oscille sans limite. La chaîne est irréductible, mais périodique de période 2 — tout retour à un état se fait en un nombre pair d'étapes. L'apériodicité est donc en défaut.

La moyenne de Cesàro \(\frac1n\sum_{k

Chapitre 10

Paradoxes et illusions

Ces exemples ne sont pas des curiosités : ce sont des tests de résistance de votre intuition. Chacun révèle une erreur de raisonnement précise, que vous avez maintenant les moyens de nommer.

9.1 — Le problème de Monty Hall

Trois portes. Derrière l'une, une voiture ; derrière les deux autres, des chèvres. Vous choisissez une porte. Le présentateur, qui sait où est la voiture, ouvre alors une autre porte, révélant toujours une chèvre. Il vous propose de changer d'avis. Faut-il changer ?

Atelier 7 — Monty Hall

Jouez, puis simulez

Choisissez une porte pour commencer.

Vos parties
0
En changeant (simulation)
—
En gardant (simulation)
—
L'explication rigoureuse

Notons \(V_i\) l'événement « la voiture est derrière la porte \(i\) ». Supposons que vous choisissiez la porte 1 et que le présentateur ouvre la porte 3. Les hypothèses indispensables sont : le présentateur connaît l'emplacement, il ouvre toujours une porte non choisie cachant une chèvre, et il choisit uniformément quand il a le choix.

On calcule \(P(O_3\mid V_i)\) où \(O_3\) est « il ouvre la porte 3 » : si la voiture est en 1, il a le choix entre 2 et 3, donc \(P(O_3\mid V_1)=1/2\) ; si elle est en 2, il est forcé d'ouvrir 3, donc \(P(O_3\mid V_2)=1\) ; si elle est en 3, il ne l'ouvrira pas, donc \(P(O_3\mid V_3)=0\). Par Bayes :

\[P(V_1\mid O_3)=\frac{\tfrac12\cdot\tfrac13}{\tfrac12\cdot\tfrac13+1\cdot\tfrac13+0}=\frac{1/6}{1/2}=\frac13,\qquad P(V_2\mid O_3)=\frac{1\cdot\tfrac13}{1/2}=\frac23.\]

Il faut changer : on gagne alors dans 2 cas sur 3. L'intuition échoue parce qu'on croit que l'ouverture d'une porte « rebat les cartes ». En réalité, l'action du présentateur n'apporte aucune information sur votre porte initiale (il aurait ouvert une chèvre de toute façon), mais elle concentre toute la probabilité restante sur la seule autre porte fermée.

Variante décisive : si le présentateur ouvrait une porte au hasard et tombait par chance sur une chèvre, alors \(P(O_3\mid V_1)=P(O_3\mid V_2)=1/2\) et les deux portes restantes seraient à \(1/2\) chacune : changer n'apporterait rien. La réponse dépend du protocole, pas des portes.

9.2 — Le paradoxe des anniversaires

Atelier 8 — anniversaires

Combien faut-il de personnes ?

P(au moins deux dates identiques)
—

On suppose 365 jours équiprobables et des dates indépendantes. On calcule l'événement contraire « toutes les dates sont distinctes » :

\[P(\text{au moins une coïncidence})=1-\frac{365\times364\times\dots\times(365-n+1)}{365^{n}}=1-\frac{A_{365}^{n}}{365^{n}}.\]

Dès \(n=23\), cette probabilité dépasse 50 % ; à \(n=57\), elle dépasse 99 %. L'intuition se trompe parce qu'elle compte les personnes (23) au lieu des paires de personnes : il y a \(\binom{23}{2}=253\) paires, donc 253 occasions de coïncidence.

Nuance importante

La question « quelqu'un partage-t-il votre date ? » est tout autre : elle ne concerne que 22 paires, et sa probabilité vaut \(1-(364/365)^{22}\approx 5{,}9\,\%\). Un énoncé de probabilités doit toujours être lu au mot près.

9.3 — Le paradoxe de Simpson

Deux traitements des calculs rénaux, sur des données réelles (Charig et al., 1986) :

CasTraitement ATraitement B
Petits calculs93 % (81/87)87 % (234/270)
Gros calculs73 % (192/263)69 % (55/80)
Total78 % (273/350)83 % (289/350)

Le traitement A est meilleur sur les petits calculs et meilleur sur les gros calculs, mais moins bon au total. Il n'y a aucune erreur arithmétique : A a été majoritairement administré aux cas graves, dont le taux de succès est structurellement plus bas. La variable « taille du calcul » est une variable confondante.

Ce qu'il faut retenir

Agréger des sous-populations peut inverser une conclusion. Formellement, il n'existe aucune règle générale liant \(P(A\mid B)\) aux \(P(A\mid B\cap C_i)\) sans connaître les poids \(P(C_i\mid B)\). C'est pourquoi la répartition aléatoire des patients (randomisation) est le fondement des essais cliniques : elle équilibre les variables confondantes, connues comme inconnues.

9.4 — Deux illusions à nommer

Exercices corrigés — chapitre 10

Exercice 1 intermédiaire

Variante de Monty Hall à 100 portes : vous choisissez une porte, le présentateur (qui sait tout) ouvre 98 portes cachant des chèvres. Faut-il changer ? Quantifier.

Voir la correction

Votre porte initiale avait une probabilité \(1/100\) de cacher la voiture, et l'ouverture des 98 chèvres était certaine quel que soit votre choix : cette information ne modifie donc pas cette valeur.

La probabilité que la voiture soit ailleurs, \(99/100\), se concentre entièrement sur l'unique porte restante. En changeant, on gagne 99 fois sur 100.

Cette version rend l'intuition immédiate : le présentateur, en éliminant précisément toutes les mauvaises portes sauf une, vous offre l'information dont il dispose. Le cas à 3 portes est exactement le même mécanisme, avec un écart 2/3 contre 1/3 moins spectaculaire.

Exercice 2 difficile

Une famille a deux enfants (garçon ou fille de façon équiprobable et indépendante). (a) Sachant qu'au moins un des deux est une fille, quelle est la probabilité que les deux le soient ? (b) Sachant que l'aînée est une fille, même question. Expliquer la différence.

Voir la correction

L'univers est \(\Omega=\{FF,FG,GF,GG\}\), équiprobable (l'ordre est celui des naissances).

(a) L'information réduit l'univers à \(\{FF,FG,GF\}\), soit 3 issues équiprobables. Donc \(P(FF\mid\text{au moins une fille})=\dfrac{1/4}{3/4}=\dfrac13\).

(b) L'information réduit l'univers à \(\{FF,FG\}\), soit \(P=\dfrac{1/4}{1/2}=\dfrac12\).

Pourquoi cette différence ? « L'aînée est une fille » désigne un enfant précis et ne renseigne que sur lui ; « au moins un » ne désigne personne et élimine seulement l'issue \(GG\), en laissant deux façons d'avoir un garçon contre une seule d'avoir deux filles. Conditionner exige de définir exactement l'événement observé — c'est la leçon commune à Monty Hall, aux faux positifs et à cet exercice.

Chapitre 11

Formulaire et test final

Formulaire
Contraire\(P(\bar A)=1-P(A)\)
Réunion\(P(A\cup B)=P(A)+P(B)-P(A\cap B)\)
Équiprobabilité\(P(A)=\operatorname{card}(A)/\operatorname{card}(\Omega)\)
Conditionnelle\(P(A\mid B)=P(A\cap B)/P(B)\)
Probabilités totales\(P(A)=\sum_i P(B_i)P(A\mid B_i)\)
Bayes\(P(B\mid A)=P(A\mid B)P(B)/P(A)\)
Indépendance\(P(A\cap B)=P(A)P(B)\)
Espérance\(E(X)=\sum_i x_iP(X=x_i)\) ; \(E(X+Y)=E(X)+E(Y)\) toujours
Variance\(V(X)=E(X^2)-E(X)^2\) ; \(V(aX+b)=a^2V(X)\)
Somme indépendante\(V(X+Y)=V(X)+V(Y)\) si \(X\perp Y\)
Binomiale\(P(X=k)=\binom nk p^k(1-p)^{n-k}\) ; \(E=np\) ; \(V=np(1-p)\)
Tchebychev\(P(|X-E(X)|\ge\varepsilon)\le V(X)/\varepsilon^2\)
Théorème central limite\(\dfrac{\bar X_n-\mu}{\sigma/\sqrt n}\xrightarrow{\mathcal{L}}\mathcal{N}(0,1)\)

Atelier 9 — vérification

Neuf questions, neuf pièges

Répondez : la correction s'affiche immédiatement, avec le raisonnement complet.