UNIVERSITE DE FIANARANTSOA FACULTE DES SCIENCES MENTION : MATHEMATIQUES ET APPLICATIONS PARCOURS : MATHEMATIQUE INFORMATIQUES APPLIQUEES AUX SCIENCES SOCIALES EXAMEN d’Analyse des données Rédigé par les membres de groupe : Nom Prénom(s) N° Carte d’étudiant N° Table RANDIMBISON Tovo Herimamonjy M000525 14 RANDRIAMBOAVONJY Lucien Carlos M000634 15 RANDRIANASOLO Jean Luck M000871 16 TSIRIMANANDRAIBE Tsilavinarivo Jean Thomas 7982 18 0 SUJET 1 : IMMOBILIER Exercice 1 : Régression linéaire multiple On étudie la relation entre le prix d'un bien immobilier (Y, en millions d'Ariary) et deux variables explicatives : la surface (X1, en m²) et le nombre de pièces (X2), sur un échantillon de 8 observations. 1. Moyennes X1 : Surface (m²) X2 : Pièces Y : Prix (en Millions Ar) 154 6 239 152 5 205 61 6 83 188 6 322 149 4 184 105 4 106 100 3 66 165 6 266 134,25 5,00 183,875 Moyenne 2. Modèle et estimation des paramètres (moindres carrés ordinaires) Modèle théorique : Y = β0 + β1·X1 + β2·X2 + ε Paramètre Estimation Écart-type t observé β0 (constante) -199,336 15,672 -12,72 β1 (Surface) 1,802 0,0844 21,34 β2 (Pièces) 28,256 2,943 9,60 Équation estimée : Ŷ = -199,336 + 1,802X1 + 28,256X2 Interprétation : toutes choses égales par ailleurs, un m² de surface supplémentaire augmente le prix d'environ 1,80 M Ar, et une pièce supplémentaire l'augmente d'environ 28,26 M Ar. 1 Figure 1.1 : Nuage de points Prix / Surface et droite de régression simple 3. Coefficient de détermination R² Indicateur Valeur SST 59 442,875 SSE 386,804 SSR 59 056,071 R² 0,9935 (99,35 %) Interprétation : 99,35 % de la variabilité du prix est expliquée par la surface et le nombre de pièces. L'ajustement du modèle est excellent. 4. Test de significativité globale (test F), α = 5 % H0 : β1 = β2 = 0 — H1 : au moins un βi ≠ 0 ddl ddl résiduel F calculé F théorique (5 régression 2 Conclusion %) 5 381,69 5,79 H0 rejetée : modèle significatif F calculé (381,69) est très largement supérieur à F théorique (5,79) : le modèle est globalement très significatif au seuil de 5 %. 2 5. Prédiction pour X1 = 136 m², X2 = 4 pièces Ŷ = -199,336 + 1,802 × 136 + 28,256 × 4 = 158,77 M Ar. Le prix prédit pour ce bien est d'environ 158,77 millions d'Ariary. Exercice 2 : ANOVA à un facteur On étudie l'effet du quartier (Analakely, Antsahabe, Ivandry) sur le prix des biens immobiliers (en M Ar). 1. Moyennes par groupe et moyenne générale Analakely Antsahabe Ivandry 129 138 146 123 137 145 125 134 149 127 137 148 124 136 147 126 132 143 Quartier Analakely Antsahabe Ivandry Moyenne générale Moyenne (M Ar) 125,667 135,667 146,333 135,889 2. Hypothèses ● H0 : les prix moyens des trois quartiers sont égaux ● H1 : au moins un prix moyen diffère des autres 3. Sommes des carrés SST SSA (factorielle) SSE (résiduelle) 1 353,778 1 281,778 72,000 3 4. Tableau d'ANOVA Source de variance DL SC CM F Factorielle (Quartier) 2 1 281,778 640,889 133,52 Résiduelle 15 72,000 4,800 Total 17 1 353,778 Figure 1.2 : Prix moyen par quartier 5. Conclusion du test, α = 5 % F théorique (Fisher, α = 5 %, ddl₁ = 2, ddl₂ = 15) ≈ 3,68. F calculé (133,52) est très largement supérieur à F théorique : H0 est rejetée. Conclusion : le quartier a un effet statistiquement très significatif sur le prix au seuil de 5 %. Les prix moyens augmentent nettement d'Analakely vers Ivandry. 4 Exercice 3 : Analyse en Composantes Principales normée On étudie 8 biens immobiliers décrits par 5 variables : Surface, Pièces, Prix, Âge, Distance. Individu Surface Pièces Prix Âge Distance M1 37 54 16 69 39 M2 24 57 7 63 31 M3 34 61 11 53 33 M4 24 48 15 80 37 M5 25 48 7 62 33 M6 32 57 9 62 34 M7 26 56 6 78 35 M8 32 52 18 47 33 1. Moyennes et écarts-types Variable Moyenne Écart-type (N) Surface 29,25 4,763 Pièces 54,125 4,285 Prix 11,125 4,343 Âge 64,25 10,580 Distance 34,375 2,395 2. Matrice de corrélation R Surface Pièces Prix Âge Distance Surface 1,000 0,433 0,518 -0,450 0,353 Pièces 0,433 1,000 -0,283 -0,299 -0,297 Prix 0,518 -0,283 1,000 -0,229 0,488 Âge -0,450 -0,299 -0,229 1,000 0,588 Distance 0,353 -0,297 0,488 0,588 1,000 5 3. Pourcentages d'inertie Composante Valeur propre % inertie % cumulé CP1 1,9256 38,51 % 38,51 % CP2 1,9186 38,37 % 76,89 % CP3 0,9654 19,31 % 96,19 % CP4 0,1889 3,78 % 99,97 % CP5 0,0014 0,03 % 100,00 % Règle de Kaiser (valeur propre > 1) : on retient 2 axes (CP1 et CP2), qui expliquent 76,89 % de l'inertie totale. 4. Corrélations variables-axes et interprétation Variable Corrélation CP1 Corrélation CP2 Surface -0,209 0,921 Pièces 0,567 0,467 Prix -0,655 0,584 Âge -0,512 -0,712 Distance -0,933 0,058 CP1 est déterminé par la Distance (-0,93) et le Prix (-0,66) : c'est un axe « localisation / valeur », opposant les biens proches et chers aux biens éloignés et bon marché. CP2 est déterminé par la Surface (0,92) et l'Âge (-0,71) : c'est un axe « taille / ancienneté ». 6 6. Coordonnées des individus sur les deux premiers axes Individu CP1 CP2 M1 -2,250 1,396 M2 1,879 -0,906 M3 1,297 1,715 M4 -2,125 -1,558 M5 0,463 -1,391 M6 0,602 0,507 M7 0,184 -1,461 M8 -0,050 1,698 Figure 1.3 : Cercle des corrélations, Sujet 1 7 Figure 1.4 : Plan factoriel des individus, Sujet 1 Commentaire : M1 et M4 (biens éloignés et chers) s'opposent à M2 (bien proche et moins cher) sur CP1. M3 et M8 (grands logements récents) s'opposent à M5 et M7 (petits logements anciens) sur CP2. 8 SUJET 2 : COMMERCE Exercice 1 : Régression linéaire multiple On étudie la relation entre le chiffre d'affaires (Y, en M Ar) et le budget publicité (X1) et le nombre de vendeurs (X2), sur 10 observations. 1. Moyennes X1 : Budget pub (en X2 : Vendeurs Y : CA (M Ar) 2 13 71 4 12 75 4 4 31 3 12 69 6 4 34 7 11 81 7 11 80 3 5 27 6 5 41 2 4 21 4,4 8,1 53,0 Millions Ar) Moyenne 2. Modèle et estimation des paramètres Paramètre Estimation Écart-type t observé β0 (constante) -11,193 2,000 -5,60 β1 (Budget pub) 3,998 0,322 12,41 β2 (Vendeurs) 5,753 0,159 36,13 Équation estimée : Ŷ = -11,193 + 3,998·X1 + 5,753·X2 Interprétation : à nombre de vendeurs constant, 1 M Ar de budget publicité supplémentaire augmente le CA d'environ 4,00 M Ar. À budget constant, un vendeur supplémentaire augmente le CA d'environ 5,75 M Ar. 9 Figure 2.1 : Nuage de points CA / Budget publicité et droite de régression simple 3. Coefficient de détermination R² Indicateur Valeur SST 5 266,0 SSE 25,005 SSR 5 240,995 R² 0,9953 (99,53 %) Interprétation : 99,53 % de la variabilité du chiffre d'affaires est expliquée par le budget publicité et le nombre de vendeurs. 4. Test de significativité globale (test F), α = 5 % H0 : β1 = β2 = 0 — H1 : au moins un βi ≠ 0 ddl ddl résiduel F calculé F théorique (5 régression 2 Conclusion %) 7 733,60 4,74 H0 rejetée : modèle significatif 10 F calculé (733,60) est très largement supérieur à F théorique (4,74) : le modèle est globalement très significatif. 5. Prédiction pour X1 = 3, X2 = 8 Ŷ = -11,193 + 3,998 × 3 + 5,753 × 8 = 46,83 M Ar. Le chiffre d'affaires prédit est d'environ 46,83 millions d'Ariary. Exercice 2 : ANOVA à un facteur On étudie l'effet de la saison (Été, Hiver, Intersaison) sur le chiffre d'affaires (en M Ar). 1. Moyennes par groupe et moyenne générale Été Hiver Intersaison 31 37 41 30 38 40 31 35 44 31 36 41 32 38 40 30 38 41 Saison Été Hiver Intersaison Moyenne générale Moyenne (M Ar) 30,833 37,000 41,167 36,333 2. Hypothèses ● H0 : les CA moyens des trois saisons sont égaux ● H1 : au moins un CA moyen diffère des autres 3. Sommes des carrés SST SSA (factorielle) SSE (résiduelle) 346,000 324,333 21,667 11 4.Tableau d'ANOVA Source de variance DL SC CM F Factorielle (Saison) 2 324,333 162,167 112,27 Résiduelle 15 21,667 1,444 Total 17 346,000 Figure 2.2 : Chiffre d'affaires moyen par saison 5. Conclusion du test, α = 5 % F théorique (Fisher, α = 5 %, ddl₁ = 2, ddl₂ = 15) ≈ 3,68. F calculé (112,27) est très largement supérieur à F théorique : H0 est rejetée. Conclusion : la saison a un effet statistiquement très significatif sur le chiffre d'affaires. Le CA moyen augmente nettement de l'Été vers l'Intersaison. 12 Exercice 3 : Analyse en Composantes Principales normée On étudie 8 points de vente décrits par 5 variables : Surface, Vendeurs, CA, Clients, Stock. Individu Surface Vendeurs CA Clients Stock M1 46 28 65 56 33 M2 41 13 53 60 38 M3 35 28 61 61 34 M4 39 15 50 60 42 M5 33 32 55 61 36 M6 41 16 55 59 41 M7 33 17 51 63 43 M8 35 18 56 62 38 1. Moyennes et écarts-types Variable Moyenne Écart-type (N) Surface 37,875 4,343 Vendeurs 20,875 6,790 CA 55,750 4,710 Clients 60,250 1,984 Stock 38,125 3,444 13 2. Matrice de corrélation R Surface Vendeurs CA Clients Stock Surface 1,000 -0,153 0,420 -0,925 -0,250 Vendeurs -0,153 1,000 0,671 -0,211 -0,769 CA 0,420 0,671 1,000 -0,609 -0,884 Clients -0,925 -0,211 -0,609 1,000 0,471 Stock -0,250 -0,769 -0,884 0,471 1,000 3. Pourcentages d'inertie Composante Valeur propre % inertie % cumulé CP1 3,0994 61,99 % 61,99 % CP2 1,5783 31,57 % 93,55 % CP3 0,2226 4,45 % 98,00 % CP4 0,0971 1,94 % 99,95 % CP5 0,0027 0,05 % 100,00 % Règle de Kaiser (valeur propre > 1) : on retient 2 axes (CP1 et CP2), qui expliquent 93,55 % de l'inertie totale. 4. Corrélations variables-axes et interprétation Variable Corrélation CP1 Corrélation CP2 Surface -0,597 -0,801 Vendeurs -0,661 0,681 CA -0,937 0,168 Clients 0,800 0,562 Stock 0,887 -0,360 CP1 oppose CA et Vendeurs (négatifs) à Clients et Stock (positifs) : c'est un axe « performance commerciale », opposant les magasins à forte vente et fort CA aux magasins à forte fréquentation mais rotation plus faible. 14 CP2 est déterminé par la Surface (-0,80) et les Vendeurs (0,68) : c'est un axe « taille du point de vente / effectif ». 5. Coordonnées des individus sur les deux premiers axes Individu CP1 CP2 M1 -3,797 -0,892 M2 0,427 -1,212 M3 -1,195 1,652 M4 1,397 -1,176 M5 -0,289 1,928 M6 0,245 -1,390 M7 2,475 0,485 M8 0,738 0,604 Figure 2.3 : Cercle des corrélations 15 Figure 2.4 : Plan factoriel des individus Commentaire : M1 (fort CA, forte équipe de vente) s'oppose à M7 (beaucoup de clients et de stock, rentabilité plus faible) sur CP1. M3 et M5 s'opposent à M2, M4 et M6 sur CP2 (taille du point de vente et effectif commercial). 16