BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//wp-events-plugin.com//7.4.3//EN
TZID:Europe/Paris
X-WR-TIMEZONE:Europe/Paris
BEGIN:VEVENT
UID:0-107@lisn.upsaclay.fr
DTSTART;TZID=Europe/Paris:20230330T140000
DTEND;TZID=Europe/Paris:20230330T170000
DTSTAMP:20230330T093507Z
URL:https://www.lisn.upsaclay.fr/evenements/augmentation-et-generation-de-
 donnees-dapprentissage-en-traitement-automatique-des-langues/
SUMMARY:Augmentation et génération de données d'apprentissage en traitem
 ent automatique des langues
DESCRIPTION:Composition du jury\nChristophe Gravier\, Rapporteur &amp\; Exa
 minateur\, Professeur\, Université Jean MonnetVincent Claveau\,  Rapport
 eur &amp\; Examinateur\, Chargé de recherche\, CNRSFatiha Saïs\,  Exami
 natrice\, Professeure\, Université Paris SaclayBenoît Sagot\, Examinateu
 r\, Directeur de recherche\, INRIALaure Soulier\, Examinatrice\, Maîtress
 e de conférences\, Sorbonne UniversitéSophie Rosset\, Directrice de thè
 se\, Directrice de recherche\, CNRSThomas Lavergne\, co-encadrant\, Maîtr
 e de conférences\, Université Paris-Saclay\nRésumé\n&nbsp\; De plus en
  plus de domaines cherchent à automatiser une partie de leur processus. L
 e traitement automatique des langues contient des méthodes permettant d'e
 xtraire des informations dans des textes. Ces méthodes peuvent utiliser d
 e l'apprentissage automatique. L'apprentissage automatique nécessite des 
 données annotées pour faire de l'extraction d'information de manière op
 timale. L'application de ces méthodes à de nouveaux domaines nécessite 
 d'obtenir des données annotées liée à la tâche. Le problème que nous
  souhaitons résoudre est de proposer et d'étudier des méthodes de gén
 ération pour améliorer les performances de modèles appris à basse quan
 tité de données. Nous explorons différentes méthodes avec et sans appr
 entissage pour générer les données nécessaires à l'apprentissage de m
 odèles d'étiquetage.&nbsp\; La première méthode que nous explorons est
  le remplissage de patrons. Cette méthode de génération de données per
 met de générer des données annotées en combinant des phrases à trous\
 , les patrons\, et des mentions. Nous avons montré que cette méthode per
 met d'améliorer les performances des modèles d'étiquetage à très peti
 te quantité de données. Nous avons aussi étudié la quantité de donné
 es nécessaire pour l'utilisation optimale de cette méthode.&nbsp\; La de
 uxième approche de génération que nous avons testé est l'utilisation d
 e modèles de langue pour la génération couplée à l'utilisation de mé
 thode d'apprentissage semi-supervisé. La méthode d'apprentissage semi-su
 pervisé utilisé est le tri-training et sert à ajouter les étiquettes a
 ux données générées. Le tri-training est testé sur plusieurs méthode
 s de génération utilisant différents modèles de langue pré-entraîné
 s. Nous avons proposé une version du tri-training appelé tri-training g
 énératif\, où la génération n'est pas faite en amont\, mais durant le
  processus de tri-training et profite de celui-ci. Nous avons testé les p
 erformances des modèles entraînés durant le processus de semi-supervisi
 on et des modèles entraîné sur les données produites par celui-ci. Dan
 s la majeure partie des cas\, les données produites permettent d'égaler 
 les performances des modèles entraînés avec la semi-supervision. Cette 
 méthode permet l'amélioration des performances à tous les niveaux de do
 nnées testés vis-à-vis des modèles sans augmentation.&nbsp\; La troisi
 ème piste d'étude vise à combiner certains aspects des approches préc
 édentes. Pour cela\, nous avons testé différentes approches. L'utilisat
 ion de modèles de langues pour faire du remplacement de bouts de phrase 
 à la manière de la méthode de remplissage de patrons fut infructueuse. 
 Nous avons testé l'addition de données générées par différentes mét
 hodes qui ne permet pas de surpasser la meilleure des méthodes. Enfin\, n
 ous avons testé l'application de la méthode de remplissage de patrons su
 r les données générées avec le tri-training qui n'a pas amélioré les
  résultats obtenu avec le tri-training. S'il reste encore beaucoup à ét
 udier\, nous avons cependant mis en évidence des méthodes simples\, comm
 e le remplissage de patrons\, et plus complexe\, comme l'utilisation d'app
 rentissage supervisé avec des phrases générées par un modèle de langu
 e\, permettant d'améliorer les performances de modèles  d'étiquetage gr
 âce à la génération de données annotées.
CATEGORIES:STL,Thèses et HDR
LOCATION:LISN Site Belvédère\, Rue du Belvédère  Campus universitaire b
 ât 507 91405 Orsay\, France
X-APPLE-STRUCTURED-LOCATION;VALUE=URI;X-ADDRESS=Rue du Belvédère  Campus 
 universitaire bât 507 91405 Orsay\, France;X-APPLE-RADIUS=100;X-TITLE=LIS
 N Site Belvédère:geo:0,0
END:VEVENT
BEGIN:VTIMEZONE
TZID:Europe/Paris
X-LIC-LOCATION:Europe/Paris
BEGIN:DAYLIGHT
DTSTART:20230326T030000
TZOFFSETFROM:+0100
TZOFFSETTO:+0200
TZNAME:CEST
END:DAYLIGHT
END:VTIMEZONE
END:VCALENDAR