BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//wp-events-plugin.com//7.4.2//EN
TZID:Europe/Paris
X-WR-TIMEZONE:Europe/Paris
BEGIN:VEVENT
UID:0-370@lisn.upsaclay.fr
DTSTART;TZID=Europe/Paris:20260310T140000
DTEND;TZID=Europe/Paris:20260310T170000
DTSTAMP:20260306T124301Z
URL:https://www.lisn.upsaclay.fr/evenements/petits-modeles-generatifs-en-c
 ontexte-industriel-adaptation-par-prompting-avec-peu-de-donnees/
SUMMARY:Petits modèles génératifs en contexte industriel : Adaptation pa
 r prompting avec peu de données
DESCRIPTION:Mots-clés\nPetits modèles de langue\, Prompting dynamique\, C
 lassification\, Reconnaissance d'entités nommées\, Slot filling\nJury\nF
 rançois Portet – Professeur\, LIG (Rapporteur et examinateur)\nFrédér
 ic Bechet – Professeur\, LIS (Rapporteur et examinateur)\nAgata Savary 
 – Professeure\, LISN/SEME (Examinatrice)\nNathalie Camelin – Maîtress
 e de Conférences\, LIA (Examinatrice)\nBenoît Favre – Professeur\, LIS
  (Examinateur)\nRésumé\nLe traitement automatique des langues (TAL) perm
 et d'automatiser l'analyse de textes pour la classification et l'extractio
 n d'informations. Cependant\, le développement de tels systèmes se heurt
 e à deux verrous majeurs : la rareté de données annotées\, des ressour
 ces de calcul limitées. Cette thèse CIFRE\, réalisée avec la société
  SCIAM\, explore les modèles génératifs de petite taille pour la classi
 fication d'énoncés\, le slot filling et la reconnaissance d'entités nom
 mées\, dans un cadre industriel à faibles annotations.\nNos travaux s'ar
 ticulent autour de quatre axes. Le premier concerne la sélection de modè
 les sans données annotées : une évaluation zero-shot de 72 modèles sur
  15 jeux de classification met en évidence que la taille n'est pas le seu
 l facteur déterminant des performances \; l'architecture et l'instruction
 -tuning jouent aussi un rôle\, permettant à des modèles de 1 à 3B para
 mètres de rivaliser avec ceux dépassant 7B. Le deuxième axe porte sur l
 'optimisation du contexte avec peu d'exemples : une approche de prompting 
 dynamique par recherche d'information (BM25) améliore les performances en
  slot filling jusqu'à 21 points de score F1 par rapport aux sélections p
 ar intention ou aléatoire\, sur quatre jeux de données (ATIS\, SNIPS\, S
 LURP\, MEDIA)\, sans surcoût d'inférence. Le troisième axe analyse l'im
 pact du format de sortie structuré : l'étude de trois formats (Key-Value
 \, JSON\, XML) sur 13 modèles et 7 jeux de données révèle des écarts 
 de 2 à 46 points de F1\, et nous proposons une méthode de sélection aut
 omatique identifiant le format optimal à moindre coût. Enfin\, le quatri
 ème axe expose les risques de contamination des benchmarks et propose des
  méthodes de détection par similarité et extraction\, permettant d'éva
 luer la fiabilité des évaluations.\nCes travaux\, accompagnés de code p
 ublic et de protocoles reproductibles\, établissent des bases méthodolog
 iques pour des systèmes TAL auditables et adaptés aux contraintes indust
 rielles.\nSalle virtuelle : lien d'accès
CATEGORIES:STL,Thèses et HDR
LOCATION:LISN Site Belvédère\, Rue du Belvédère  Campus universitaire b
 ât 507 91405 Orsay\, France
X-APPLE-STRUCTURED-LOCATION;VALUE=URI;X-ADDRESS=Rue du Belvédère  Campus 
 universitaire bât 507 91405 Orsay\, France;X-APPLE-RADIUS=100;X-TITLE=LIS
 N Site Belvédère:geo:0,0
END:VEVENT
BEGIN:VTIMEZONE
TZID:Europe/Paris
X-LIC-LOCATION:Europe/Paris
BEGIN:STANDARD
DTSTART:20251026T020000
TZOFFSETFROM:+0200
TZOFFSETTO:+0100
TZNAME:CET
END:STANDARD
END:VTIMEZONE
END:VCALENDAR