L’équipe SEME (sémantique et extraction d’information) s’intéresse aux problématiques d’accès au sens contenu dans les productions langagières, dans un objectif d’analyse, de compréhension, de modélisation, ou de production. Nous appliquons nos recherches à la modalité écrite, sans restriction sur le support d’origine (texte produit au format électronique, ou provenant d’une transcription de la parole, ou encore d’une reconnaissance optique) et travaillons sur des productions en domaine ouvert ou de spécialité tel que le domaine médical. Nous utilisons des approches aussi bien linguistiques que relevant d’un apprentissage statistique ou neuronal. Précisément sur ce dernier type d’approche, nous nous intéressons au coût environnemental qu’elles génèrent en traitement automatique des langues, tant lors de leur production que lors de leur utilisation.
L’équipe se compose de 10 membres permanents (chercheurs CNRS, enseignants-chercheurs à l’Université Paris-Saclay, à l’ENSIIE, et à l’Université Sorbonne Paris-Nord), 14 doctorants, et 3 post-doctorants ou CDD. Nous entretenons des liens avec les industriels (thèses en contrat CIFRE, projets de recherche) et organisons régulièrement des manifestations scientifiques (conférence TALN, ateliers et workshops scientifiques, etc.).
Zhongjie Li, Rim Abrougui, Guillaume Lechien, Elisabeth Savatier, Benoît Laurent, et al.. Sem-G-RAG, combiner sémantique symbolique à base de graphes et LLM pour le RAG. 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. pp.544-563. ⟨hal-05708371⟩
Aygalic Jara-Mikolajczak, Thomas Lavergne, Christophe Servan, Sophie Rosset. Robustesse des LLM dans les contextes longs, hallucinations et détection sur questions-réponses séquentielles. 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. pp.512-523. ⟨hal-05708368⟩
Eve Sauvage, Cyril Grouin, Julien Tourille. Tous les tokens sont-ils utiles pour les modèles de langues ?. 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. pp.595-609. ⟨hal-05708373⟩
Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, et al.. Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients. LREC 2026 – 15th Language Resources and Evaluation Conference, May 2026, Palma, Spain. pp.194-206, ⟨10.63317/47hsfchk79n6⟩. ⟨hal-05709146⟩
Lounès Kebdi, Lubin Longuépée, Mathilde Aguiar, Pierre Zweigenbaum, Nona Naderi. Impact de l’affinage de modèles génératifs pour l’inférence en langue naturelle appliquée aux essais cliniques : comparaison avec des approches de *few-shot learning. 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. pp.303-321. ⟨hal-05708357⟩
Vincent Claveau, Nicolas Diniz, Juliane Flament, Nihel Kooli, Jose Moreno, et al.. Actes de l’atelier sur l’évaluation des modèles génératifs (LLM) et challenges (EvalLLM 2026). 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. ATALA, 2026. ⟨hal-05708467⟩
Khanh-an C. Quan, Camille Guinaudeau, Shin’Ichi Satoh. Évaluation de la cohérence des modèles vision-langage pour la tâche de question-réponse visuelle. 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. pp.64-74. ⟨hal-05708471⟩
Younes Djemmal, Olutola Oloruntobi Paul, Kim Gerdes. Au-delà des résumés : Apprentissage des représentations d’articles scientifiques à partir de fenêtres de texte intégral. 21e Conférence en Recherche d’Information et Applications (CORIA) 19e Rencontres Jeunes Chercheurs en RI (RJCRI) 33e Conférence sur le Traitement Automatique des Langues Naturelles (TALN) 28e Rencontre des Étudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RÉCITAL), Jun 2026, Nantes, France. pp.31-50. ⟨hal-05708484⟩
You Zuo, Kim Gerdes, Éric de la Clergerie, Benoît Sagot. Sparse Coverage: Semantic Center Representations for Patent Prior-Art Retrieval. CORIA-TALN 2026 – 21e Conférence en Recherche d’Information et Applications (CORIA), Jun 2026, Nantes, France. ⟨hal-05707237⟩
Marc Evrard, Rémi Uro, Nicolas Hervé, Béatrice Mazoyer. French Tweet Corpus for Automatic Stance Detection. Proceedings of the Twelfth International Conference on Language Resources and Evaluation (LREC 2020), ELRA, May 2025, Marseille, France. pp.6317-6322. ⟨hal-05682655⟩
Lorena de la Garza, Julie Halbout, Julie Lascar, Niels Martinez-Guevara, Arturo Curiel, et al.. Extracting Signs from Weakly Aligned Sign Language Corpora: A Study on LSF and LSM. 12th Workshop on the Representation and Processing of Sign Languages: Language in Motion (LREC 2026), May 2026, Palma De MaJorque, Spain. pp.174-183, ⟨10.63317/38kfot52b4dz⟩. ⟨hal-05688151⟩
Lucía Catalán, Kim Gerdes. On the difficulty of producing good linguistic lies. Atelier sur l’Analyse et la Recherche de Textes Scientifiques 2026 (ARTS), Jun 2026, Nantes, France. ⟨hal-05688347⟩
Idrissa Mahamoudou Dicko, Nona Naderi. Synergizing Domain-Specific Masked Language Models and Instruction-Tuned LLMs for Chemical NER. Atelier IAIntelligence Artificielle et santé, Jun 2026, Arras, France. ⟨hal-05679910⟩
Jose Felipe Espinosa Orjuela, Philippe Boula de Mareüil, Marc Evrard. Speech synthesis for Walloon, an under-resourced minority language. 13th edition of the Speech Synthesis Workshop, Aug 2025, Leeuwarden, Netherlands. pp.189-195, ⟨10.21437/SSW.2025-29⟩. ⟨hal-05682647⟩
Benedictus Kent Rachmat, Thomas Gerald, Zheng Zhang, Cyril Grouin. QA Analysis in Medical and Legal Domains: A Survey of Data Augmentation in Low-Resource Settings. ACL 2025 – 63rd Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop), ACL, Jul 2025, Vienna, Austria. pp.1132-1144, ⟨10.18653/v1/2025.acl-srw.89⟩. ⟨hal-05683004⟩
Laura Ascone, Lucie Gianola, Julien Longhi, Laurène Renaut. La linguistique forensique pour l’analyse du discours : anticiper les risques, aider à la décision, répondre aux menaces. Colloque R2DIP, « Les notions de risques, société et sécurité dans les discours institutionnels et politiques », CY Cergy Paris Université, Dec 2017, Cergy, France. ⟨hal-05682141⟩
Théophile Lenoir, Ana Valdivia, Aurélie Bugeau, Anne-Laure Ligozat. Beyond the Energy Efficiency Directive. Observatory on the Environmental Footprint of AIArtificial Intelligence, 2026. ⟨hal-05680820⟩
Iskandar Boucharenc, Eve Sauvage, Thomas Gerald, Julien Tourille, Sabrina Campano, et al.. Using Syntax for the Semantic Representation of Sentences. SLiDE 1st Workshop on Structured Linguistic Data and Evaluation at the 2026 Language Resources and Evaluation Conference (LREC 2026), May 2026, Palma de majorque, Spain. pp.169–179, ⟨10.63317/4gtinxarm3dd⟩. ⟨hal-05669816⟩
Clément Morand, Aurélie Névéol, Anne-Laure Ligozat. The Rising Unsustainability of AIArtificial Intelligence Graphics Cards Production. LIMITS 2026: 12th Workshop on Computing within Limits, Jun 2026, Online, France. ⟨hal-05666542⟩
Kim Gerdes. The Grammar Does the Work: Functional vs. Lexical Dependency Length Minimization Across Universal Dependencies. UDW 2026 – Ninth Workshop on Universal Dependencies, May 2026, Palma De MaJorque, Spain. pp.163-173, ⟨10.63317/4akqrtsv7i65⟩. ⟨hal-05676925⟩
Iskandar Boucharenc, Sahar Ghannay, Christophe Servan, Laure Soulier, Sophie Rosset. Étude de l’adaptation des gros modèles de langues par retour visuel. Journée Visu, GdR IG-RV, Jun 2023, Orsay, France. ⟨hal-05670004⟩
Emmett Strickland, Marc Evrard, Valentina Fedchenko. Transfer Learning for Creole TTS: A Pilot Study on Whether Substrate Phonologies or Lexifier Vocabularies Matter More. Towards Inclusivity and Equality: Language Resources and Technologies for Under-Resourced and Endangered Languages, SIGUL 2026 Joint Workshop with ELE, EURALI, and DCLRL, May 2026, Palma De Majorque, Spain. ⟨10.63317/5d5qjmokuvmc⟩. ⟨hal-05617449⟩
Clémentine Bleuze, Bruno Guillaume, Aurélie Névéol, Karën Fort. Omniprésents et anthropomorphisés : analyse lexico-syntaxique des discours sur les LLM. TALN 2026 – 33e Conférence sur le Traitement Automatique des Langues Naturelles, Jun 2026, Nantes, France. ⟨hal-05670834⟩
Clémentine Bleuze, Karën Fort, Vincent P. Martin, Aurélie Névéol. Grands modèles de langue pour prédire la santé mentale : une revue exploratoire de la documentation des biais et de l’utilité clinique. TALN 2026 – 33e Conférence sur le Traitement Automatique des Langues Naturelles, Jun 2026, Nantes, France. ⟨hal-05670826⟩
Clément Morand, Aurélie Névéol, Rosy Tsopra, Anne-Isabelle Tropeano, Sophie de Chambine, et al.. Prospectively Evaluating the Environmental Impacts of Digital Health Applications : A Case Study and Recommendations. Journal of the American Medical Informatics Association, 2026, ⟨10.1093/jamia/ocag091⟩. ⟨hal-05628404⟩
Thomas Gerald, Sahar Ghannay, Julie Lascar, Paul Lerner, Anne Vilnat. Can Multimodal LLMs Generate Pedagogical Questions?. LREC 2026, May 2026, Palma, Spain. ⟨10.63317/4z4gj3h8jmc7⟩. ⟨hal-05658326⟩
Thierry Hamon. Description of the LISN system for extracting terms. DEfinition and Term Extraction CHallenge 2026 (DETECH 2026), Jun 2026, Zadar, Croatia. ⟨hal-05669893⟩
Marie Schmit, Melvin Selim Atay, Khalid Belhajjame, Ulysse Le Clanche, Emmanuel Coquery, et al.. ShareFAIR-KG, a centralised knowledge base of scientific workflows. JOBIM 2026 – Journées Ouvertes en Biologie, Informatique et Mathématiques, Jun 2026, Strasbourg, France. ⟨hal-05666980⟩
Louis Estève, Marie-Catherine de Marneffe, Nurit Melnik, Agata Savary, Olha Kanishcheva. A survey of diversity quantification in natural language processing: The why, what, where and how. 2026. ⟨hal-05661565⟩