Telechargé par Tsovo Sharine

Examen d'Analyse des données - Université de Fianarantsoa

publicité
UNIVERSITE DE FIANARANTSOA
FACULTE DES SCIENCES
MENTION : MATHEMATIQUES ET APPLICATIONS
PARCOURS : MATHEMATIQUE INFORMATIQUES APPLIQUEES AUX
SCIENCES SOCIALES
EXAMEN d’Analyse des données
Rédigé par les membres de groupe :
Nom
Prénom(s)
N° Carte d’étudiant
N° Table
RANDIMBISON
Tovo Herimamonjy
M000525
14
RANDRIAMBOAVONJY Lucien Carlos
M000634
15
RANDRIANASOLO
Jean Luck
M000871
16
TSIRIMANANDRAIBE
Tsilavinarivo Jean Thomas
7982
18
0
SUJET 1 : IMMOBILIER
Exercice 1 : Régression linéaire multiple
On étudie la relation entre le prix d'un bien immobilier (Y, en millions d'Ariary) et deux variables
explicatives : la surface (X1, en m²) et le nombre de pièces (X2), sur un échantillon de 8 observations.
1. Moyennes
X1 : Surface (m²)
X2 : Pièces
Y : Prix (en Millions Ar)
154
6
239
152
5
205
61
6
83
188
6
322
149
4
184
105
4
106
100
3
66
165
6
266
134,25
5,00
183,875
Moyenne
2. Modèle et estimation des paramètres (moindres carrés ordinaires)
Modèle théorique : Y = β0 + β1·X1 + β2·X2 + ε
Paramètre
Estimation
Écart-type
t observé
β0 (constante)
-199,336
15,672
-12,72
β1 (Surface)
1,802
0,0844
21,34
β2 (Pièces)
28,256
2,943
9,60
Équation estimée : Ŷ = -199,336 + 1,802X1 + 28,256X2
Interprétation : toutes choses égales par ailleurs, un m² de surface supplémentaire augmente le prix
d'environ 1,80 M Ar, et une pièce supplémentaire l'augmente d'environ 28,26 M Ar.
1
Figure 1.1 : Nuage de points Prix / Surface et droite de régression simple
3. Coefficient de détermination R²
Indicateur
Valeur
SST
59 442,875
SSE
386,804
SSR
59 056,071
R²
0,9935 (99,35 %)
Interprétation : 99,35 % de la variabilité du prix est expliquée par la surface et le nombre de pièces.
L'ajustement du modèle est excellent.
4. Test de significativité globale (test F), α = 5 %
H0 : β1 = β2 = 0 — H1 : au moins un βi ≠ 0
ddl
ddl résiduel
F calculé
F théorique (5
régression
2
Conclusion
%)
5
381,69
5,79
H0 rejetée :
modèle
significatif
F calculé (381,69) est très largement supérieur à F théorique (5,79) : le modèle est globalement très
significatif au seuil de 5 %.
2
5. Prédiction pour X1 = 136 m², X2 = 4 pièces
Ŷ = -199,336 + 1,802 × 136 + 28,256 × 4 = 158,77 M Ar. Le prix prédit pour ce bien est d'environ
158,77 millions d'Ariary.
Exercice 2 : ANOVA à un facteur
On étudie l'effet du quartier (Analakely, Antsahabe, Ivandry) sur le prix des biens immobiliers (en M
Ar).
1. Moyennes par groupe et moyenne générale
Analakely
Antsahabe
Ivandry
129
138
146
123
137
145
125
134
149
127
137
148
124
136
147
126
132
143
Quartier
Analakely
Antsahabe
Ivandry
Moyenne générale
Moyenne (M Ar)
125,667
135,667
146,333
135,889
2. Hypothèses
● H0 : les prix moyens des trois quartiers sont égaux
● H1 : au moins un prix moyen diffère des autres
3. Sommes des carrés
SST
SSA (factorielle)
SSE (résiduelle)
1 353,778
1 281,778
72,000
3
4. Tableau d'ANOVA
Source de variance
DL
SC
CM
F
Factorielle (Quartier)
2
1 281,778
640,889
133,52
Résiduelle
15
72,000
4,800
Total
17
1 353,778
Figure 1.2 : Prix moyen par quartier
5. Conclusion du test, α = 5 %
F théorique (Fisher, α = 5 %, ddl₁ = 2, ddl₂ = 15) ≈ 3,68. F calculé (133,52) est très largement supérieur
à F théorique : H0 est rejetée.
Conclusion : le quartier a un effet statistiquement très significatif sur le prix au seuil de 5 %. Les prix
moyens augmentent nettement d'Analakely vers Ivandry.
4
Exercice 3 : Analyse en Composantes Principales normée
On étudie 8 biens immobiliers décrits par 5 variables : Surface, Pièces, Prix, Âge, Distance.
Individu
Surface
Pièces
Prix
Âge
Distance
M1
37
54
16
69
39
M2
24
57
7
63
31
M3
34
61
11
53
33
M4
24
48
15
80
37
M5
25
48
7
62
33
M6
32
57
9
62
34
M7
26
56
6
78
35
M8
32
52
18
47
33
1. Moyennes et écarts-types
Variable
Moyenne
Écart-type (N)
Surface
29,25
4,763
Pièces
54,125
4,285
Prix
11,125
4,343
Âge
64,25
10,580
Distance
34,375
2,395
2. Matrice de corrélation R
Surface
Pièces
Prix
Âge
Distance
Surface
1,000
0,433
0,518
-0,450
0,353
Pièces
0,433
1,000
-0,283
-0,299
-0,297
Prix
0,518
-0,283
1,000
-0,229
0,488
Âge
-0,450
-0,299
-0,229
1,000
0,588
Distance
0,353
-0,297
0,488
0,588
1,000
5
3. Pourcentages d'inertie
Composante
Valeur propre
% inertie
% cumulé
CP1
1,9256
38,51 %
38,51 %
CP2
1,9186
38,37 %
76,89 %
CP3
0,9654
19,31 %
96,19 %
CP4
0,1889
3,78 %
99,97 %
CP5
0,0014
0,03 %
100,00 %
Règle de Kaiser (valeur propre > 1) : on retient 2 axes (CP1 et CP2), qui expliquent 76,89 % de
l'inertie totale.
4. Corrélations variables-axes et interprétation
Variable
Corrélation CP1
Corrélation CP2
Surface
-0,209
0,921
Pièces
0,567
0,467
Prix
-0,655
0,584
Âge
-0,512
-0,712
Distance
-0,933
0,058
CP1 est déterminé par la Distance (-0,93) et le Prix (-0,66) : c'est un axe « localisation / valeur »,
opposant les biens proches et chers aux biens éloignés et bon marché.
CP2 est déterminé par la Surface (0,92) et l'Âge (-0,71) : c'est un axe « taille / ancienneté ».
6
6. Coordonnées des individus sur les deux premiers axes
Individu
CP1
CP2
M1
-2,250
1,396
M2
1,879
-0,906
M3
1,297
1,715
M4
-2,125
-1,558
M5
0,463
-1,391
M6
0,602
0,507
M7
0,184
-1,461
M8
-0,050
1,698
Figure 1.3 : Cercle des corrélations, Sujet 1
7
Figure 1.4 : Plan factoriel des individus, Sujet 1
Commentaire : M1 et M4 (biens éloignés et chers) s'opposent à M2 (bien proche et moins cher) sur
CP1. M3 et M8 (grands logements récents) s'opposent à M5 et M7 (petits logements anciens) sur
CP2.
8
SUJET 2 : COMMERCE
Exercice 1 : Régression linéaire multiple
On étudie la relation entre le chiffre d'affaires (Y, en M Ar) et le budget publicité (X1) et le nombre
de vendeurs (X2), sur 10 observations.
1. Moyennes
X1 : Budget pub (en
X2 : Vendeurs
Y : CA (M Ar)
2
13
71
4
12
75
4
4
31
3
12
69
6
4
34
7
11
81
7
11
80
3
5
27
6
5
41
2
4
21
4,4
8,1
53,0
Millions Ar)
Moyenne
2. Modèle et estimation des paramètres
Paramètre
Estimation
Écart-type
t observé
β0 (constante)
-11,193
2,000
-5,60
β1 (Budget pub)
3,998
0,322
12,41
β2 (Vendeurs)
5,753
0,159
36,13
Équation estimée : Ŷ = -11,193 + 3,998·X1 + 5,753·X2
Interprétation : à nombre de vendeurs constant, 1 M Ar de budget publicité supplémentaire
augmente le CA d'environ 4,00 M Ar. À budget constant, un vendeur supplémentaire augmente le
CA d'environ 5,75 M Ar.
9
Figure 2.1 : Nuage de points CA / Budget publicité et droite de régression simple
3. Coefficient de détermination R²
Indicateur
Valeur
SST
5 266,0
SSE
25,005
SSR
5 240,995
R²
0,9953 (99,53 %)
Interprétation : 99,53 % de la variabilité du chiffre d'affaires est expliquée par le budget publicité et
le nombre de vendeurs.
4. Test de significativité globale (test F), α = 5 %
H0 : β1 = β2 = 0 — H1 : au moins un βi ≠ 0
ddl
ddl résiduel
F calculé
F théorique (5
régression
2
Conclusion
%)
7
733,60
4,74
H0 rejetée :
modèle
significatif
10
F calculé (733,60) est très largement supérieur à F théorique (4,74) : le modèle est globalement très
significatif.
5. Prédiction pour X1 = 3, X2 = 8
Ŷ = -11,193 + 3,998 × 3 + 5,753 × 8 = 46,83 M Ar. Le chiffre d'affaires prédit est d'environ 46,83
millions d'Ariary.
Exercice 2 : ANOVA à un facteur
On étudie l'effet de la saison (Été, Hiver, Intersaison) sur le chiffre d'affaires (en M Ar).
1. Moyennes par groupe et moyenne générale
Été
Hiver
Intersaison
31
37
41
30
38
40
31
35
44
31
36
41
32
38
40
30
38
41
Saison
Été
Hiver
Intersaison
Moyenne générale
Moyenne (M Ar)
30,833
37,000
41,167
36,333
2. Hypothèses
● H0 : les CA moyens des trois saisons sont égaux
● H1 : au moins un CA moyen diffère des autres
3. Sommes des carrés
SST
SSA (factorielle)
SSE (résiduelle)
346,000
324,333
21,667
11
4.Tableau d'ANOVA
Source de variance
DL
SC
CM
F
Factorielle (Saison)
2
324,333
162,167
112,27
Résiduelle
15
21,667
1,444
Total
17
346,000
Figure 2.2 : Chiffre d'affaires moyen par saison
5. Conclusion du test, α = 5 %
F théorique (Fisher, α = 5 %, ddl₁ = 2, ddl₂ = 15) ≈ 3,68. F calculé (112,27) est très largement supérieur
à F théorique : H0 est rejetée.
Conclusion : la saison a un effet statistiquement très significatif sur le chiffre d'affaires. Le CA moyen
augmente nettement de l'Été vers l'Intersaison.
12
Exercice 3 : Analyse en Composantes Principales normée
On étudie 8 points de vente décrits par 5 variables : Surface, Vendeurs, CA, Clients, Stock.
Individu
Surface
Vendeurs
CA
Clients
Stock
M1
46
28
65
56
33
M2
41
13
53
60
38
M3
35
28
61
61
34
M4
39
15
50
60
42
M5
33
32
55
61
36
M6
41
16
55
59
41
M7
33
17
51
63
43
M8
35
18
56
62
38
1. Moyennes et écarts-types
Variable
Moyenne
Écart-type (N)
Surface
37,875
4,343
Vendeurs
20,875
6,790
CA
55,750
4,710
Clients
60,250
1,984
Stock
38,125
3,444
13
2. Matrice de corrélation R
Surface
Vendeurs
CA
Clients
Stock
Surface
1,000
-0,153
0,420
-0,925
-0,250
Vendeurs
-0,153
1,000
0,671
-0,211
-0,769
CA
0,420
0,671
1,000
-0,609
-0,884
Clients
-0,925
-0,211
-0,609
1,000
0,471
Stock
-0,250
-0,769
-0,884
0,471
1,000
3. Pourcentages d'inertie
Composante
Valeur propre
% inertie
% cumulé
CP1
3,0994
61,99 %
61,99 %
CP2
1,5783
31,57 %
93,55 %
CP3
0,2226
4,45 %
98,00 %
CP4
0,0971
1,94 %
99,95 %
CP5
0,0027
0,05 %
100,00 %
Règle de Kaiser (valeur propre > 1) : on retient 2 axes (CP1 et CP2), qui expliquent 93,55 % de
l'inertie totale.
4. Corrélations variables-axes et interprétation
Variable
Corrélation CP1
Corrélation CP2
Surface
-0,597
-0,801
Vendeurs
-0,661
0,681
CA
-0,937
0,168
Clients
0,800
0,562
Stock
0,887
-0,360
CP1 oppose CA et Vendeurs (négatifs) à Clients et Stock (positifs) : c'est un axe « performance
commerciale », opposant les magasins à forte vente et fort CA aux magasins à forte fréquentation
mais rotation plus faible.
14
CP2 est déterminé par la Surface (-0,80) et les Vendeurs (0,68) : c'est un axe « taille du point de
vente / effectif ».
5. Coordonnées des individus sur les deux premiers axes
Individu
CP1
CP2
M1
-3,797
-0,892
M2
0,427
-1,212
M3
-1,195
1,652
M4
1,397
-1,176
M5
-0,289
1,928
M6
0,245
-1,390
M7
2,475
0,485
M8
0,738
0,604
Figure 2.3 : Cercle des corrélations
15
Figure 2.4 : Plan factoriel des individus
Commentaire : M1 (fort CA, forte équipe de vente) s'oppose à M7 (beaucoup de clients et de stock,
rentabilité plus faible) sur CP1. M3 et M5 s'opposent à M2, M4 et M6 sur CP2 (taille du point de
vente et effectif commercial).
16
Téléchargement