Marie-Anne Sallandre - Université Paris 8
Christophe Parisse - Université Paris Nanterre
LindekIn : Geoffrey Besnard
La question de la lemmatisation — regrouper les variantes d’un signe sous une forme lexicale de référence — reste largement inexplorée pour la LSF. Or sans lemmatisation fiable, les corpus annotés demeurent difficilement exploitables : recherches incohérentes, comparaisons inter-corpus impossibles, outillage computationnel inapplicable.
Cette thèse porte sur le développement d'un cadre de lemmatisation pour la LSF, en s'appuyant sur les modèles internationaux de SignBank (Johnston/Auslan, BSL, DGS, NGT) et sur Lex-LSFB (Meurant, Université de Namur).
Le cadre tient compte des particularités typologiques des langues des signes et de ses types d'unités : les unités lexicales, les unités iconicité (non lexicales, donc peut-être moins facilement lemmatisables), et les unités mixtes. Le cadre classique des ID-gloss peut-il rendre compte convenablement de tous cet types d'unités ?
La méthodologie est participative et multi-sites, impliquant laboratoires de linguistique, communautés sourdes, équipes techniques et institutions de formation.
Mots clés en français :
Langue des signes française (LSF), Linguistique de corpus, Annotation, Logiciel Elan, Segmentation, Lemmatisation, SignBank, Étiquetage, ID-Gloss
Description en anglaise
The issue of lemmatization—grouping the variants of a sign under a reference lexical form—remains largely unexplored for LSF. However, without reliable lemmatization, annotated corpora remain difficult to utilize: searches yield inconsistent results, cross-corpus comparisons are impossible, and computational tools cannot be applied.
This thesis focuses on the development of a lemmatization framework for LSF, drawing on the international models of SignBank (Johnston/Auslan, BSL, DGS, NGT) and Lex-LSFB (Meurant, University of Namur).
The framework takes into account the typological characteristics of sign languages and their types of units: lexical units, highly iconic units (non-lexical, and therefore perhaps less easily lemmatized), and mixed units. Can the traditional ID-gloss framework adequately account for all these types of units? The methodology is participatory and multi-site, involving linguistics laboratories, Deaf communities, technical teams, and educational institutions.
Mots clés en anglaise :
French Sign Language (LSF), Corpus linguistics, Annotation, Logiciel Elan, Segmentation, Lemmatization, SignBank, Labeling, Id-gloss