BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//wp-events-plugin.com//7.4.3//EN
TZID:Europe/Paris
X-WR-TIMEZONE:Europe/Paris
BEGIN:VEVENT
UID:0-138@lisn.upsaclay.fr
DTSTART;TZID=Europe/Paris:20231108T140000
DTEND;TZID=Europe/Paris:20231108T170000
DTSTAMP:20231019T143130Z
URL:https://www.lisn.upsaclay.fr/evenements/repondre-aux-questions-visuell
 es-a-propos-dentites-nommees/
SUMMARY:Répondre aux questions visuelles à propos d’entités nommées
DESCRIPTION:Thèse dirigée par Olivier Ferret\, chercheur au CEA List\, e
 t co-encadrée par Camille Guinaudeau\, maîtresse de conférences à l'Un
 iversité Paris-Saclay. \nJury\nJosiane Mothe\, professeure à l'Universit
 é Toulouse Jean-Jaurès\nPhilippe Mulhem\, chargé de recherches au CNRS 
 (LIG\, Université Grenoble Alpes)\nMichel Crucianu\, professeur au CEDRIC
 -CNAM\nEwa Kijak\, maîtresse de conférences à l'Université de Rennes\n
 Pierre Zweigenbaum\, directeur de recherche au CNRS (LISN\, Université Pa
 ris-Saclay)\nMots clés : questions visuelles\, recherche d’information 
 multimodale\, apprentissage de représentation\, entités nommées\, pré-
 entraînement\, système de question-réponse\nRésumé\nCette thèse se p
 ositionne à l’intersection de plusieurs domaines de recherche\, le trai
 tement automatique des langues\, la Recherche d’Information (RI) et la v
 ision par ordinateur\, qui se sont unifiés autour des méthodes d’appre
 ntissage de représentation et de pré-entraînement. Dans ce contexte\, n
 ous avons défini et étudié une nouvelle tâche multimodale : répondre 
 aux questions visuelles à propos d’entités nommées (KVQAE) Dans ce ca
 dre\, nous nous sommes particulièrement intéressé aux interactions cros
 s-modales et aux différentes façons de représenter les entités nommée
 s. Nous avons également été attentifs aux données utilisées pour entr
 aîner mais surtout évaluer les systèmes de question-réponse à travers
  différentes métriques. Plus précisément\, nous avons proposé à cet 
 effet un jeu de données\, le premier de KVQAE comprenant divers types d
 ’entités. Nous avons également défini un cadre expérimental pour tra
 iter la KVQAE en deux étapes grâce à une base de connaissances non-stru
 cturée et avons identifié la RI comme principal verrou de la KVQAE\, en 
 particulier pour les questions à propos d’entités non-personnes. Afin 
 d’améliorer l’étape de RI\, nous avons étudié différentes méthod
 es de fusion multimodale\, lesquelles sont pré-entraînées à travers un
 e tâche originale : l’Inverse Cloze Task multimodale. Nous avons trouv
 é que ces modèles exploitaient une interaction cross-modale que nous n
 ’avions pas considéré à l’origine\, et qui permettrait de traiter l
 ’hétérogénéité des représentations visuelles des entités nommées
 . Ces résultats ont été renforcés par une étude du modèle CLIP qui p
 ermet de modéliser cette interaction cross-modale directement. Ces expér
 iences ont été menées tout en restant attentif aux biais présents dans
  le jeu de données ou les métriques d’évaluation\, notamment les biai
 s textuels qui affectent toute tâche multimodale.
CATEGORIES:STL,Thèses et HDR
LOCATION:LISN Site Belvédère\, Rue du Belvédère  Campus universitaire b
 ât 507 91405 Orsay\, France
X-APPLE-STRUCTURED-LOCATION;VALUE=URI;X-ADDRESS=Rue du Belvédère  Campus 
 universitaire bât 507 91405 Orsay\, France;X-APPLE-RADIUS=100;X-TITLE=LIS
 N Site Belvédère:geo:0,0
END:VEVENT
BEGIN:VTIMEZONE
TZID:Europe/Paris
X-LIC-LOCATION:Europe/Paris
BEGIN:STANDARD
DTSTART:20231029T020000
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
END:STANDARD
END:VTIMEZONE
END:VCALENDAR