BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//wp-events-plugin.com//7.4.3//EN
TZID:Europe/Paris
X-WR-TIMEZONE:Europe/Paris
BEGIN:VEVENT
UID:0-146@lisn.upsaclay.fr
DTSTART;TZID=Europe/Paris:20231219T140000
DTEND;TZID=Europe/Paris:20231219T170000
DTSTAMP:20231208T145859Z
URL:https://www.lisn.upsaclay.fr/evenements/modeles-faiblement-supervises-
 pour-la-documentation-automatique-des-langues-2/
SUMMARY:Modèles faiblement supervisés pour la documentation automatique d
 es langues
DESCRIPTION:Jury\nClaire GARDENT\, directrice de recherche au LORIA (CNRS\,
  Université de Lorraine) \;\nAlexis NASR\, professeur au LIS (CNRS\, UTLN
 \, Université Aix Marseille) \;\nRoland KUHN\, Principal Research Officer
  du National Research Council Canada \;\nFrançois PELLEGRINO\, directeur 
 de recherche au DDL – ISH (CNRS\, Université de Lyon 2) \;\nAgata SAVAR
 Y\, professeure au LISN (CNRS\, Université Paris-Saclay) \;\nLaurent BESA
 CIER\, Principal Scientist à Naver Labs Europe et professeur à l’Unive
 rsité Grenoble-Alpes \;\nFrançois YVON\, directeur de thèse\, directeur
  de recherche à l’ISIR (CNRS\, Sorbonne Université).\nMots-clefs\nDocu
 mentation automatique des langues\, Segmentation en mots\, Modèle bayési
 en non paramétrique\, Génération de gloses interlinéaires\, Supervisio
 n faible\, Linguistique de terrain\nRésumé\nFace à la menace d'extincti
 on de la moitié des langues parlées aujourd'hui d'ici la fin du siècle\
 , la documentation des langues est un domaine de la linguistique notamment
  consacré à la collecte\, annotation et archivage de données. Dans ce c
 ontexte\, la documentation automatique des langues vise à outiller les li
 nguistes pour faciliter différentes étapes de la documentation\, à trav
 ers des approches de traitement automatique du langage. Dans le cadre du p
 rojet de documentation automatique CLD2025\, cette thèse s'intéresse pri
 ncipalement à deux tâches : la segmentation en mots\, identifiant les fr
 ontières des mots dans une transcription non segmentée d'une phrase enre
 gistrée\, ainsi que la génération de gloses interlinéaires\, prédisan
 t des annotations linguistiques pour chaque unité de la phrase. Pour la p
 remière\, nous améliorons les performances des modèles bayésiens non p
 aramétriques utilisés jusque là à travers une supervision faible\, en 
 nous appuyant sur des ressources disponibles de manière réaliste lors de
  la documentation\, comme des phrases déjà segmentées ou des lexiques. 
 Comme nous observons toujours une tendance de sur-segmentation dans nos mo
 dèles\, nous introduisons un second niveau de segmentation : les morphèm
 es Nos expériences avec divers types de modèles de segmentation à deux 
 niveaux indiquent une qualité de segmentation sensiblement meilleure \; n
 ous constatons\, par ailleurs\, les limites des approches uniquement stati
 stiques pour différencier les mots des morphèmes. La seconde tâche conc
 erne la génération de gloses\, soit grammaticales\, soit lexicales. Comm
 e ces dernières ne peuvent pas être prédites en se basant seulement sur
  les données d'entraînement\, notre modèle statistique d'étiquetage de
  séquences fait moduler\, pour chaque phrase\, les étiquettes possibles 
 et propose une approche compétitive avec les modèles neuronaux les plus 
 récents.
CATEGORIES:STL
LOCATION:LISN Site Belvédère\, Rue du Belvédère  Campus universitaire b
 ât 507 91405 Orsay\, France
X-APPLE-STRUCTURED-LOCATION;VALUE=URI;X-ADDRESS=Rue du Belvédère  Campus 
 universitaire bât 507 91405 Orsay\, France;X-APPLE-RADIUS=100;X-TITLE=LIS
 N Site Belvédère:geo:0,0
END:VEVENT
BEGIN:VTIMEZONE
TZID:Europe/Paris
X-LIC-LOCATION:Europe/Paris
BEGIN:STANDARD
DTSTART:20231029T020000
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
END:STANDARD
END:VTIMEZONE
END:VCALENDAR