BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//wp-events-plugin.com//7.4.1//EN
TZID:Europe/Paris
X-WR-TIMEZONE:Europe/Paris
BEGIN:VEVENT
UID:0-226@lisn.upsaclay.fr
DTSTART;TZID=Europe/Paris:20241219T100000
DTEND;TZID=Europe/Paris:20241219T130000
DTSTAMP:20241218T161012Z
URL:https://www.lisn.upsaclay.fr/evenements/traitement-automatique-des-lan
 gues-pour-lanalyse-de-messages-dobservation-astrophysique/
SUMMARY:Traitement Automatique des Langues pour l’analyse de messages d
 ’observation astrophysique
DESCRIPTION:Jury\nBéatrice Daille\, Professeure des universités\,&nbsp\;L
 aboratoire des Sciences du Numérique de Nantes\, Université de Nantes (r
 apporteure)&nbsp\;\;\nVincent Claveau\,&nbsp\;Chargé de recherche\, Direc
 tion générale de l'armement (rapporteur)&nbsp\;\;\nOlivier Ferret\, Dire
 cteur de recherche\, Université Paris-Saclay\, CEA-List (examinateur)&nbs
 p\;\;\nYvonne Becherini\, Professeure des universités\, Université Paris
  Cité\, Astroparticule et Cosmologie\, Data Intelligence Institute of Par
 is (examinatrice).\nRésumé\nCette thèse aborde un défi majeur de l’a
 nalyse de textes non structurés en astrophysique : l’extraction et la s
 ynthèse d’information sur les objets célestes à partir de rapports d
 ’observation astronomique. L’extraction d’information\, sous-domaine
  clé du traitement automatique des langues (TAL)\, vise à transformer de
 s textes bruts en représentations formelles et exploitables\, facilitant 
 ainsi la structuration des connaissances contenues dans ces documents. Par
 mi les tâches classiques de ce domaine figurent la reconnaissance d’ent
 ités nommées\, l’extraction de relations et la résolution de coréfé
 rences.Cependant\, ces tâches reposent sur des modèles d’apprentissage
  statistique qui nécessitent de vastes ensembles de données annotées ma
 nuellement. Dans des domaines spécialisés comme l’astrophysique\, cett
 e exigence est difficile à satisfaire en raison du coût d’annotation p
 ar des experts du domaine. L’émergence des modèles de langue pré-entr
 aînés et génératifs a permis des avancées considérables dans le TAL.
  Toutefois\, ces modèles ne sont pas directement adaptés pour extraire d
 es informations spécifiques aux rapports astronomiques. En effet\, le dom
 aine se caractérise par un vocabulaire et une terminologie spécialisés.
  Par exemple\, les rapports contiennent fréquemment des entités de type 
 numérique et équationnelle\, telles que des coordonnées ou des proprié
 tés physiques avec certaines ambiguïtés entre différents concepts dues
  à la forme de surface. Ce constat a motivé notre première question de 
 recherche : quels concepts astrophysiques doivent être définis pour iden
 tifier les entités nommées pertinentes et quelles relations doivent êtr
 e définies entre ces entités ?\nPour répondre à cette question\, nous 
 avons collaboré avec des astrophysiciens afin d’élaborer un guide d’
 annotation couvrant les entités célestes\, les mentions de coréférence
  et les relations sémantique entre entités. Une contribution majeure de 
 cette thèse est la création d’astroECR\, un corpus astrophysique annot
 é de manière détaillée pour ces trois niveaux d’information.Cependan
 t\, l’annotation manuelle étant coûteuse et fastidieuse\, cela nous a 
 conduit à explorer l’efficacité des méthodes d’augmentation de donn
 ées\, en générant des données artificielles annotées. Nos travaux se 
 sont ensuite concentrés sur la question suivante :quelles méthodes d’a
 ugmentation sont les plus adaptées à des tâches comme l’extraction d
 ’entités nommées et la résolution de coréférences ?Pour répondre\,
  nous avons proposé des méthodes d’augmentation de données simples et
  flexibles\, adaptées aux tâches spécifiques d’extraction d’informa
 tion. Ces méthodes incluent l’introduction de nouvelles mentions d’en
 traînement et la modification du contexte des mentions existantes. Nous l
 es avons appliquées à divers modèles de langue pré-entraînés (BERT\,
  SciBERT\, et astroBERT) et évaluées sur des rapports astronomiques anno
 tés. Les résultats montrent que même des méthodes d’augmentation sim
 ples peuvent permettre d’améliorer les performances des modèles dans d
 es contextes de ressources limitées. Ces avancées offrent des  perspecti
 ves futures pour l’extraction d’information dans des domaines à faibl
 e ressource au-delà de l’astrophysique.
CATEGORIES:STL,Thèses et HDR
END:VEVENT
BEGIN:VTIMEZONE
TZID:Europe/Paris
X-LIC-LOCATION:Europe/Paris
BEGIN:STANDARD
DTSTART:20241027T020000
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
END:STANDARD
END:VTIMEZONE
END:VCALENDAR