Estimation et s´election en classification semi-supervis´ee
Vincent Vandewalle
To cite this version:
Vincent Vandewalle. Estimation et s´election en classification semi-supervis´ee. Math´ematiques
[math]. Universit´e des Sciences et Technologie de Lille - Lille I, 2009. Fran¸cais. <tel-00447141>
HAL Id: tel-00447141
https://tel.archives-ouvertes.fr/tel-00447141
Submitted on 14 Jan 2010
HAL is a multi-disciplinary open access
archive for the deposit and dissemination of sci-
entific research documents, whether they are pub-
lished or not. The documents may come from
teaching and research institutions in France or
abroad, or from public or private research centers.
L’archive ouverte pluridisciplinaire HAL, est
destin´ee au d´epˆot et `a la diffusion de documents
scientifiques de niveau recherche, publi´es ou non,
´emanant des ´etablissements d’enseignement et de
recherche fran¸cais ou ´etrangers, des laboratoires
publics ou priv´es.
N˚ORDRE : 40105
Université des Sciences et Technologies Lille 1,
École Doctorale régionale Sciences Pour l’Ingénieur
Lille Nord-de-France
Thèse pour obtenir le grade de Docteur en Sciences de
l’Université Lille 1
présentée par Vincent Vandewalle
le 09 décembre 2009
Discipline : Mathématiques Appliquées
Estimation et sélection en classification
semi-supervisée
Directeurs de Thèse : Christophe Biernacki et Gilles Celeux
Jury :
Directeur Christophe Biernacki Professeur Université de Lille 1
Directeur Gilles Celeux Dir. Recherche INRIA
Rapporteur Didier Chauveau Professeur Université d’Orléans
Rapporteur Jean-Jacques Daudin Professeur AgroParisTech
Président Gérard Govaert Professeur Université de Technologie de Compiègne
tel-00447141, version 1 - 14 Jan 2010
2
tel-00447141, version 1 - 14 Jan 2010
3
Résumé
Le sujet de cette thèse est la classification semi-supervisée qui est considérée d’un
point de vue décisionnel. Nous nous intéressons à la question de choix de modèles dans
ce contexte où les modèles sont estimés en utilisant conjointement des données étiquetées
et des données non étiquetées plus nombreuses. Nous concentrons notre recherche sur les
modèles génératifs où la classification semi-supervisée s’envisage sans difficulté, contraire-
ment au cadre prédictif qui nécessite des hypothèses supplémentaires peu naturelles.
Après avoir dressé un état de l’art de la classification semi-supervisée, nous décrivons
l’estimation des paramètres d’un modèle de classification à l’aide de données étiquetées
et non étiquetées par l’algorithme EM. Nos contributions sur la sélection de modèles font
l’objet des deux chapitres suivants. Au chapitre 3, nous présentons un test statistique où
les données non étiquetées sont utilisées pour mettre à l’épreuve le modèle utilisé. Au
chapitre 4 nous présentons un critère de sélection de modèles AICcond, dérivé du critère
AIC d’un point de vue prédictif. Nous prouvons la convergence asymptotique de ce cri-
tère particulièrement bien adapté au contexte semi-supervisé et ses bonnes performances
pratiques comparé à la validation croisée et à d’autres critères de vraisemblance pénalisée.
Une deuxième partie de la thèse, sans rapport direct avec le contexte semi-supervisé,
présente des modèles multinomiaux pour la classification sur variables qualitatives. Nous
avons conçu ces modèles pour répondre à des limitations des modèles multinomiaux par-
cimonieux proposés dans le logiciel mixmod. À cette occasion, nous proposons un critère
type BIC qui prend en compte de manière spécifique la complexité de ces modèles multi-
nomiaux contraints.
Mots clés : modèles de mélange, estimation par maximum de vraisemblance, don-
nées manquantes, algorithme EM, analyse discriminante, classification semi-supervisée,
modèles parcimonieux, choix de modèle.
tel-00447141, version 1 - 14 Jan 2010
4
tel-00447141, version 1 - 14 Jan 2010
1 / 157 100%
La catégorie de ce document est-elle correcte?
Merci pour votre participation!

Faire une suggestion

Avez-vous trouvé des erreurs dans linterface ou les textes ? Ou savez-vous comment améliorer linterface utilisateur de StudyLib ? Nhésitez pas à envoyer vos suggestions. Cest très important pour nous !