Statistiques à deux variables : définitions

Maths Complémentaires · Terminale · cours rédigé et vérifié par Claryo, conforme au Bulletin officiel

Définitions et théorèmes (LaTeX)

Une série statistique à deux variables (ou série double) associe à n individus deux caractères quantitatifs : on obtient n couples (x_i\,;y_i). On les représente dans un repère par un nuage de points, dont on cherche à décrire la forme : y a-t-il une tendance linéaire ?

Définitions de base. - Moyennes : \overline{x}=\dfrac{1}{n}\displaystyle\sum_{i=1}^n x_i et \overline{y}=\dfrac{1}{n}\displaystyle\sum_{i=1}^n y_i. - Point moyen : G(\overline{x}\,;\overline{y}). - Variances : V(x)=\dfrac{1}{n}\sum x_i^2-\overline{x}^{\,2}, idem pour V(y). - Covariance : \mathrm{Cov}(x,y)=\dfrac{1}{n}\sum x_i y_i-\overline{x}\,\overline{y}.

La covariance mesure la liaison entre les deux variables : positive si elles augmentent ensemble, négative sinon.

Formules

  • \overline{x}=\dfrac1n\sum x_i, \overline{y}=\dfrac1n\sum y_i.
  • V(x)=\dfrac1n\sum x_i^2-\overline{x}^{\,2} (König-Huygens).
  • \mathrm{Cov}(x,y)=\dfrac1n\sum x_iy_i-\overline{x}\,\overline{y}.
  • Coefficient directeur (moindres carrés, y en x) : a=\dfrac{\mathrm{Cov}(x,y)}{V(x)}.
  • Ordonnée à l'origine : b=\overline{y}-a\,\overline{x} (la droite passe par G).
  • Coefficient de corrélation : r=\dfrac{\mathrm{Cov}(x,y)}{\sigma_x\,\sigma_y}\in[-1\,;1].

Méthodes type bac

Tracer le nuage et le point moyen : reporter les couples, calculer \overline{x} et \overline{y}, placer G.

Calculer la covariance : deux méthodes équivalentes, soit la formule développée \dfrac1n\sum x_iy_i-\overline x\,\overline y, soit la somme des produits des écarts \dfrac1n\sum(x_i-\overline x)(y_i-\overline y). La calculatrice (mode statistique à deux variables) donne directement ces valeurs.

Interpréter le signe : covariance positive = nuage croissant ; négative = décroissant.

Pièges

  • Confondre \sum x_i^2 (somme des carrés) et (\sum x_i)^2 (carré de la somme).
  • Oublier la division par n dans la covariance ou la variance.
  • Calculer \mathrm{Cov}(x,y) avec \overline x\times\overline y mal placé : c'est bien \dfrac1n\sum x_iy_i MOINS \overline x\,\overline y.
  • Mélanger les rôles de x et y : l'ajustement de y en x utilise V(x) au dénominateur, pas V(y).

Pour l'épreuve

Les statistiques à deux variables introduisent l'idée centrale de corrélation entre deux grandeurs et préparent l'ajustement affine. À l'écrit comme avec la calculatrice (autorisée), il faut savoir entrer une série double et lire les moyennes, variances et covariance directement dans le menu statistique. Le point moyen G est incontournable : toute droite des moindres carrés y passe, ce qui fournit une vérification et permet de retrouver b=\overline y-a\overline x. Soignez la distinction entre la somme des carrés \sum x_i^2 et le carré de la somme (\sum x_i)^2, source d'erreur classique dans le calcul de la variance. Le signe de la covariance s'interprète toujours en termes concrets : les deux variables évoluent dans le même sens (covariance positive) ou en sens contraire (covariance négative), ce que les correcteurs attendent. Gardez enfin à l'esprit que la covariance n'a pas de borne et dépend des unités, alors que le coefficient de corrélation r, lui, est sans unité et compris entre -1 et 1 : c'est donc r, et non la covariance seule, qui mesure la qualité d'une éventuelle liaison linéaire. Cette série double est le socle des chapitres suivants (ajustement affine, ajustement exponentiel, interpolation), il est donc essentiel de maîtriser parfaitement le vocabulaire et les formules de base ici.