Telechargé par HENOVI Komla Alban

cours de statistique descriptive

publicité
Cours de Statistiques Descriptives et Bivariées
Avec applications sur Python et R
GitHub Copilot
12 février 2026
Table des matières
I Statistiques Descriptives de Base (TD 1)
2
1 Mesures de Tendance Centrale
2
2 Mesures de Dispersion
3
3 Forme de la Distribution : Skewness et Kurtosis
4
4 Exercices (Partie 1)
4
II Analyse de Données Univariées (TD 2)
5
5 Analyse d'une Variable Qualitative Nominale
5
6 Analyse d'une Variable Quantitative Continue
5
7 Exercices (Partie 2)
6
III Analyse de Données Bivariées (TD 3)
6
8 Relation entre Deux Variables Quantitatives
6
9 Exercices (Partie 3)
7
A Corrections numériques (Python)
7
1.1
1.2
1.3
2.1
3.1
3.2
8.1
8.2
La Moyenne . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
La Médiane . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Le Mode . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
La Variance et l'Écart-type . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Coecient d'Asymétrie (Skewness) . . . . . . . . . . . . . . . . . . . . . . . . .
Coecient d'Aplatissement (Kurtosis) . . . . . . . . . . . . . . . . . . . . . . .
Corrélation Linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Régression Linéaire Simple . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1
2
3
3
3
4
4
6
7
Introduction
Ce cours a pour objectif de fournir les bases essentielles des statistiques descriptives et de
l'analyse bivariée. Les statistiques sont un outil fondamental dans de nombreux domaines pour
résumer, analyser et interpréter des données. Nous commencerons par les mesures de base pour
une seule variable (analyse univariée) avant d'explorer les relations entre deux variables (analyse
bivariée).
Ce document est structuré en trois parties principales, correspondant aux travaux dirigés :
Statistiques Descriptives de Base : Mesures de tendance centrale, de dispersion, et
de forme.
Analyse de Données Univariées : Étude détaillée des variables selon leur type (qualitatives et quantitatives), avec des applications en R.
Analyse de Données Bivariées : Exploration des relations entre deux variables, avec
des applications en Python.
Chaque section inclura des dénitions, des formules mathématiques, des exemples chirés,
des visualisations et des extraits de code pour une compréhension pratique et approfondie.
Première partie
Statistiques Descriptives de Base (TD 1)
1
Mesures de Tendance Centrale
Les Moyenne de tendance centrale indiquent la valeur "typique" ou centrale d'un ensemble
de données.
1.1 La Moyenne
Dénition 1: Moyenne arithmétique
La Moyenne arithmétique est la somme des valeurs divisée par leur nombre. Elle est
sensible aux valeurs extrêmes.
Formule 1: Moyenne d'un échantillon
Pour un échantillon de n valeurs x1 , x2 , . . . , xn :
n
1X
x̄ =
xi
n i=1
Exemple 1: Calcul de la moyenne des notes
Pour les notes 12, 15, 10, 14, 9, 16, 13, 17, 11, 14 :
x̄ =
12 + 15 + 10 + 14 + 9 + 16 + 13 + 17 + 11 + 14
131
=
= 13.1
10
10
Interprétation : La note moyenne du groupe d'étudiants est de 13.1 sur 20.
2
Calcul numérique : la moyenne arithmétique de la série ci-dessus vaut 13,1. Les calculs
détaillés sont donnés en annexe (corrections Python).
1.2 La Médiane
Dénition 2: Médiane
La Médiane est la valeur qui sépare l'échantillon (préalablement ordonné) en deux parties
égales. Elle n'est pas sensible aux valeurs extrêmes.
Exemple 2: Calcul de la médiane
Notes ordonnées : 9, 10, 11, 12, 13, 14, 14, 15, 16, 17. n = 10 (pair), la médiane est la
moyenne de la 5ème et 6ème valeur.
Me =
13 + 14
= 13.5
2
Interprétation : La moitié des étudiants a une note inférieure ou égale à 13.5, et l'autre
moitié a une note supérieure ou égale.
1.3 Le Mode
Dénition 3: Mode
Le mode est la valeur qui apparaît le plus fréquemment dans un ensemble de données.
Une distribution peut avoir un (unimodale), plusieurs (multimodale) ou aucun mode.
Exemple 3: Calcul du mode
Dans la série de notes, la note 14 apparaît deux fois, plus que toute autre. Le mode est
donc 14.
2
Mesures de Dispersion
Ces mesures quantient l'étalement ou la variabilité des données.
2.1 La Variance et l'Écart-type
Dénition 4: Variance et Écart-type
La Variance (s2 ) mesure la dispersion moyenne au carré autour de la moyenne. L'Écarttype (s), racine carrée de la variance, exprime cette dispersion dans l'unité de mesure
originale des données.
3
Formule 2: Variance et Écart-type d'un échantillon
s2 =
Note : On divise par
n
1 X
(xi − x̄)2
n − 1 i=1
√
;
s=
s2
n − 1 pour un estimateur non biaisé de la variance de la population.
Exemple 4: Calcul de la variance et de l'écart-type
Pour les notes, avec x̄ = 13.1 :
s2 ≈ 6.86 ;
s=
√
6.86 ≈ 2.62
Interprétation : En moyenne, les notes s'écartent d'environ 2.62 points de la moyenne
de 13.1. Un faible écart-type signie que les notes sont regroupées autour de la moyenne,
tandis qu'un écart-type élevé indique une plus grande dispersion.
pour la série des notes, on trouve s2 ≈ 6,86 et s ≈ 2,62. Le script de
vérication est fourni en annexe.
Calcul numérique :
3
Forme de la Distribution : Skewness et Kurtosis
3.1 Coecient d'Asymétrie (Skewness)
Dénition 5: Skewness
Le Skewness mesure le défaut de symétrie d'une distribution.
S > 0 : Asymétrie à droite (queue de distribution étalée vers les valeurs élevées).
S < 0 : Asymétrie à gauche (queue étalée vers les valeurs faibles).
S ≈ 0 : Distribution approximativement symétrique.
3.2 Coecient d'Aplatissement (Kurtosis)
Dénition 6: Kurtosis
Le Kurtosis mesure si une distribution est plus "pointue" ou "aplatie" que la distribution
normale.
K > 3 : Distribution leptokurtique (plus pointue que la normale).
K < 3 : Distribution platykurtique (plus aplatie que la normale).
K = 3 : Distribution mésokurtique (aplatissement normal).
L'excès de Kurtosis (K − 3) est souvent utilisé pour comparer directement à 0.
Calcul numérique : pour la série (5, 7, 8, 10, 12, 14, 18, 19, 20, 22), on obtient S ≈ 0,37 (asymétrie à droite) et K ≈ 1,94 (distribution plus aplatie que la normale). Le script de vérication
gure en annexe.
4
Exercices (Partie 1)
1. Pour la série de valeurs de l'exercice 3 sur le Skewness/Kurtosis, calculez manuellement
la moyenne, la médiane et l'écart-type.
4
2. Si on ajoute la note 20/20 à la série de notes initiale, quel sera l'impact sur la moyenne
et la médiane ? Laquelle de ces deux mesures est la plus robuste ?
Deuxième partie
Analyse de Données Univariées (TD 2)
Note : Les exemples de cette partie seront traités avec le langage R.
5
Analyse d'une Variable Qualitative Nominale
Exemple 5: Navigateurs web
Une enquête sur le navigateur web préféré de 30 étudiants.
on peut compléter le tableau avec fréquences relatives et cumulées
par simple proportionnalité. Les calculs programmatiques sont fournis en annexe.
Tableaux de fréquences :
Distribution des navigateurs web
14
14
Eectif
12
10
8
8
6
5
4
3
2
Chrome
Firefox
Edge
Safari
Navigateur
Figure 1 Diagramme en barres des navigateurs.
6
Analyse d'une Variable Quantitative Continue
Exemple 6: Taille des étudiants
Les tailles (en cm) de 50 étudiants ont été relevées et groupées en classes.
en utilisant les centres de classes, on obtient une moyenne approximative
µ ≈ 174,2 cm. La vérication numérique est en annexe.
Moyenne pondérée :
5
Histogramme des tailles d'étudiants
Eectif
15
10
5
0
[150-160
[160
[ -170
[170
[ -180
[180
[ -190
[190
[ -200[
Taille (cm)
Figure 2 Histogramme représentant la distribution des tailles.
7
Exercices (Partie 2)
1. En utilisant R, créez un diagramme circulaire (pie chart) pour les données des navigateurs
web.
2. Pour l'exercice sur la satisfaction au travail (variable ordinale), quel est le pourcentage
d'employés qui sont au moins "Satisfait" ?
Troisième partie
Analyse de Données Bivariées (TD 3)
Note : Les exemples de cette partie seront traités avec le langage Python.
8
Relation entre Deux Variables Quantitatives
8.1 Corrélation Linéaire
Dénition 7: Corrélation
Le coecient de Corrélation de Pearson (r) mesure la force et la direction d'une relation
linéaire entre deux variables. Il varie de -1 (corrélation négative parfaite) à +1 (corrélation
positive parfaite). Une valeur proche de 0 indique une absence de relation linéaire.
Formule 3: Coecient de corrélation de Pearson
P
(xi − x̄)(yi − ȳ)
r = pP
P
(xi − x̄)2 (yi − ȳ)2
6
8.2 Régression Linéaire Simple
Dénition 8: Régression linéaire
La Régression linéaire modélise la relation entre une variable dépendante (Y ) et une
variable indépendante (X ) par une droite, appelée droite de régression.
Formule 4: Équation de la droite de régression
ŷ = b0 + b1 x
Où ŷ est la valeur prédite de Y , b1 est la pente et b0 est l'ordonnée à l'origine.
Exemple 7: Expérience et Salaire
Analyse de la relation entre les années d'expérience et le salaire.
Résultats numériques : pour les données (x, y) fournies, on obtient r ≈ 0,986 (corrélation
linéaire très forte), une droite de régression ŷ = 3,44x + 18,47, et une prédiction ŷ(12) ≈ 59,7
k¿. Les scripts de calcul sont regroupés en annexe.
9
Exercices (Partie 3)
1. Pour l'exercice 1 (Genre vs Langage), calculez le χ2 pour déterminer si la préférence
pour un langage dépend du genre.
2. En utilisant Python, créez un nuage de points pour les données "Expérience vs Salaire"
et tracez la droite de régression dessus.
A
Corrections numériques (Python)
Les scripts ci-dessous vérient numériquement les résultats des parties abstraites.
Partie 1 : tendances, dispersion, forme
import numpy as np
from scipy.stats import skew, kurtosis
notes = [12, 15, 10, 14, 9, 16, 13, 17, 11, 14]
vals = [5, 7, 8, 10, 12, 14, 18, 19, 20, 22]
mean_notes = np.mean(notes)
var_notes = np.var(notes, ddof=1)
std_notes = np.std(notes, ddof=1)
S = skew(vals)
K = kurtosis(vals, fisher=False)
print(mean_notes, var_notes, std_notes)
print(S, K)
7
Partie 2 : tableaux de fréquences et moyenne pondérée
import numpy as np
effectifs = np.array([14, 8, 5, 3])
freq_rel = effectifs / effectifs.sum()
freq_cum = effectifs.cumsum()
centres = np.array([155, 165, 175, 185, 195])
eff_taille = np.array([5, 12, 18, 10, 5])
moy_taille = np.average(centres, weights=eff_taille)
print(freq_rel, freq_cum)
print(moy_taille)
Partie 3 : corrélation et régression
import pandas as pd
from scipy.stats import linregress
df = pd.DataFrame({
'Experience': [1,2,3,4,5,6,7,8,9,10],
'Salaire':
[22,25,28,30,35,40,42,48,50,55]
})
correlation = df['Experience'].corr(df['Salaire'])
slope, intercept, r_value, p_value, std_err = linregress(df['Experience'], df['Salaire']
print(correlation)
print(slope, intercept)
print(slope*12 + intercept)
8
Téléchargement