Probabilités et statistiques · Théorème central limite

Théorème central limite

Faites la moyenne de n tirages indépendants dans une population de variance finie et strictement positive : agrandie n\sqrt{n} fois autour de la moyenne, la distribution de cette moyenne se rapproche d’une courbe normale lorsque n augmente, quelle que soit la forme de la population.

01

Le théorème central limite dans cette visualisation

Soient X1,…,XnX_1, \dots, X_n des tirages indépendants dans une même population (indépendants et identiquement distribués) de moyenne μ\mu et de variance 0<σ2<∞0 < \sigma^2 < \infty, et Xˉ\bar X leur moyenne. Le théorème central limite, sous sa forme de Lindeberg-Lévy, affirme que la moyenne centrée réduite converge en loi vers la loi normale centrée réduite : sa fonction de répartition tend vers Φ\Phi en tout point. De façon informelle, Xˉ≈N(μ,σ2/n)\bar X \approx N(\mu, \sigma^2/n). La page montre comment la forme de la distribution de Xˉ\bar X évolue avec n.

Le théorème
P ⁣(n (Xˉ−μ)σ≤z)→Φ(z)pour tout zP\!\left(\frac{\sqrt{n}\,(\bar X - \mu)}{\sigma} \le z\right) \to \Phi(z) \quad \text{pour tout } z

La couche supérieure est la population. La couche inférieure montre la distribution de la moyenne Xˉ\bar X de nn tirages. Répéter cette opération NN fois donne l’histogramme jaune : il fluctue selon l’échantillonnage et peut être comparé à la courbe théorique. Une graine fixe reproduit les mêmes échantillons. Après agrandissement par √n, l’axe inférieur est Y=μ+n (xˉ−μ)Y = \mu + \sqrt{n}\,(\bar x - \mu) : sa moyenne μ et son écart-type σ sont ceux de la population, ce qui facilite la comparaison des formes.

Les courbes marquées « numérique » sont calculées numériquement ; les autres utilisent des formules exactes de distributions. Le coefficient d’asymétrie mesure le manque de symétrie. L’excès d’aplatissement compare le moment centré réduit d’ordre quatre à celui d’une loi normale, pour laquelle il vaut zéro. Lorsque les moments correspondants de la population existent, la moyenne a pour asymétrie γ/n\gamma/\sqrt{n} et pour excès d’aplatissement κ/n\kappa/n. Aucun de ces deux indicateurs ne garantit à lui seul une bonne approximation normale.

02

À observer

  • Le théorème porte sur la distribution de la moyenne, pas sur les données : la couche supérieure ne change jamais. Son rétrécissement en σ/n\sigma/\sqrt{n} à largeur réelle relève de la loi en √n, un résultat distinct.
  • « n ≥ 30 suffit » est une règle empirique. Pour un événement de probabilité 1 %, la moyenne de 30 essais vaut encore exactement 0 avec une probabilité de 0.9930≈0.7400.99^{30} \approx 0.740, et son asymétrie γ/n\gamma/\sqrt{n} ne descend à 0.2 qu’à n = 2426. Une asymétrie nulle ne suffit pas non plus : la version symétrique (±10, chacun de probabilité 0.5 %) a une asymétrie nulle pour tout n et conserve une forte masse en 0.
  • Les barres d’une loi sur un réseau ont la largeur d’un pas du réseau ; leur aire est donc une probabilité : comparez les formes, pas les hauteurs point par point. La loi de Cauchy n’a ni moyenne ni variance : la moyenne de n tirages suit exactement la loi d’un seul tirage, et le théorème ne s’applique pas.
  • La limite normale remonte à de Moivre (1733, pour la loi binomiale) et à Laplace (1812) ; le nom est dû à Pólya (1920).
03

Commandes

  • Dessiner transforme la couche supérieure en planche à dessin : votre tracé est ramené à une aire de 1 lorsque vous relâchez. La touche rouge rejoue 10 000 moyennes calculées à l’avance ; pendant la lecture, un appui l’arrête, un autre la reprend avec la même graine, et à la fin, elle passe à la graine suivante. Partager conserve la graine, la version de l’algorithme et l’avancement de la lecture.
04

Voir aussi

  • H05Loi normaleÀ venir
  • H18Distribution d’échantillonnageÀ venir
  • H12Loi des grands nombres
  • H16Loi binomialeÀ venir
  • H20Intervalle de confianceÀ venir
  • H26Densité de probabilitéÀ venir

Pour aller plus loin: Wikipédia: Central limit theorem (Anglais); OpenStax, Introductory Statistics 2e, 7 The Central Limit Theorem (Anglais).