AllSummedUp: un framework open-source pour comparer les metriques d'evaluation de resume
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Herserant, Tanguy, Guigue, Vincent |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SEval-Ex: A Statement-Level Framework for Explainable Summarization Evaluation
par: Herserant, Tanguy, et autres
Publié: (2025)
par: Herserant, Tanguy, et autres
Publié: (2025)
Can open source large language models be used for tumor documentation in Germany? -- An evaluation on urological doctors' notes
par: Lenz, Stefan, et autres
Publié: (2025)
par: Lenz, Stefan, et autres
Publié: (2025)
Large Language Models, scientific knowledge and factuality: A framework to streamline human expert evaluation
par: Wysocka, Magdalena, et autres
Publié: (2023)
par: Wysocka, Magdalena, et autres
Publié: (2023)
AspirinSum: an Aspect-based utility-preserved de-identification Summarization framework
par: Li, Ya-Lun
Publié: (2024)
par: Li, Ya-Lun
Publié: (2024)
adaptNMT: an open-source, language-agnostic development environment for Neural Machine Translation
par: Lankford, Séamus, et autres
Publié: (2024)
par: Lankford, Séamus, et autres
Publié: (2024)
Berta: an open-source, modular tool for AI-enabled clinical documentation
par: Vaid, Samridhi, et autres
Publié: (2026)
par: Vaid, Samridhi, et autres
Publié: (2026)
Closing the gap between open-source and commercial large language models for medical evidence summarization
par: Zhang, Gongbo, et autres
Publié: (2024)
par: Zhang, Gongbo, et autres
Publié: (2024)
Towards Lighter and Robust Evaluation for Retrieval Augmented Generation
par: Ispas, Alex-Razvan, et autres
Publié: (2025)
par: Ispas, Alex-Razvan, et autres
Publié: (2025)
$π$-yalli: un nouveau corpus pour le nahuatl
par: Torres-Moreno, Juan-Manuel, et autres
Publié: (2024)
par: Torres-Moreno, Juan-Manuel, et autres
Publié: (2024)
A word association network methodology for evaluating implicit biases in LLMs compared to humans
par: Abramski, Katherine, et autres
Publié: (2025)
par: Abramski, Katherine, et autres
Publié: (2025)
Diverse And Private Synthetic Datasets Generation for RAG evaluation: A multi-agent framework
par: Driouich, Ilias, et autres
Publié: (2025)
par: Driouich, Ilias, et autres
Publié: (2025)
COGNET-MD, an evaluation framework and dataset for Large Language Model benchmarks in the medical domain
par: Panagoulias, Dimitrios P., et autres
Publié: (2024)
par: Panagoulias, Dimitrios P., et autres
Publié: (2024)
How well do LLMs cite relevant medical references? An evaluation framework and analyses
par: Wu, Kevin, et autres
Publié: (2024)
par: Wu, Kevin, et autres
Publié: (2024)
Align-then-Slide: A complete evaluation framework for Ultra-Long Document-Level Machine Translation
par: Guo, Jiaxin, et autres
Publié: (2025)
par: Guo, Jiaxin, et autres
Publié: (2025)
A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science
par: Yang, Zonglin, et autres
Publié: (2026)
par: Yang, Zonglin, et autres
Publié: (2026)
Memorization Dynamics of Fill-in-the-Middle Pretraining
par: von Arx, Tobias, et autres
Publié: (2026)
par: von Arx, Tobias, et autres
Publié: (2026)
CBEval: A framework for evaluating and interpreting cognitive biases in LLMs
par: Shaikh, Ammar, et autres
Publié: (2024)
par: Shaikh, Ammar, et autres
Publié: (2024)
DiscoSum: Discourse-aware News Summarization
par: Spangher, Alexander, et autres
Publié: (2025)
par: Spangher, Alexander, et autres
Publié: (2025)
MovieSum: An Abstractive Summarization Dataset for Movie Screenplays
par: Saxena, Rohit, et autres
Publié: (2024)
par: Saxena, Rohit, et autres
Publié: (2024)
Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Literal Extraction, Logical Inference, and Hallucination Risks in Long-Context LLMs
par: Ebrahimzadeh, Amirali, et autres
Publié: (2026)
par: Ebrahimzadeh, Amirali, et autres
Publié: (2026)
Comparative analysis of privacy-preserving open-source LLMs regarding extraction of diagnostic information from clinical CMR imaging reports
par: Amirrajab, Sina, et autres
Publié: (2025)
par: Amirrajab, Sina, et autres
Publié: (2025)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
par: Sun, Shengyin, et autres
Publié: (2025)
par: Sun, Shengyin, et autres
Publié: (2025)
ARE: Scaling Up Agent Environments and Evaluations
par: Froger, Romain, et autres
Publié: (2025)
par: Froger, Romain, et autres
Publié: (2025)
On Speeding Up Language Model Evaluation
par: Zhou, Jin Peng, et autres
Publié: (2024)
par: Zhou, Jin Peng, et autres
Publié: (2024)
ZeroSumEval: Scaling LLM Evaluation with Inter-Model Competition
par: Khan, Haidar, et autres
Publié: (2025)
par: Khan, Haidar, et autres
Publié: (2025)
NexusSum: Hierarchical LLM Agents for Long-Form Narrative Summarization
par: Kim, Hyuntak, et autres
Publié: (2025)
par: Kim, Hyuntak, et autres
Publié: (2025)
HeSum: a Novel Dataset for Abstractive Text Summarization in Hebrew
par: Paz-Argaman, Tzuf, et autres
Publié: (2024)
par: Paz-Argaman, Tzuf, et autres
Publié: (2024)
AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization
par: Piya, Fahmida Liza, et autres
Publié: (2026)
par: Piya, Fahmida Liza, et autres
Publié: (2026)
MetaSumPerceiver: Multimodal Multi-Document Evidence Summarization for Fact-Checking
par: Chen, Ting-Chih, et autres
Publié: (2024)
par: Chen, Ting-Chih, et autres
Publié: (2024)
ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition
par: Alyahya, Hisham A., et autres
Publié: (2025)
par: Alyahya, Hisham A., et autres
Publié: (2025)
Reasoning Up the Instruction Ladder for Controllable Language Models
par: Zheng, Zishuo, et autres
Publié: (2025)
par: Zheng, Zishuo, et autres
Publié: (2025)
Re-evaluating Theory of Mind evaluation in large language models
par: Hu, Jennifer, et autres
Publié: (2025)
par: Hu, Jennifer, et autres
Publié: (2025)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
par: Lee, Yuho, et autres
Publié: (2024)
par: Lee, Yuho, et autres
Publié: (2024)
More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detection
par: Sun, Runze, et autres
Publié: (2026)
par: Sun, Runze, et autres
Publié: (2026)
When LLMs Team Up: The Emergence of Collaborative Affective Computing
par: Lai, Wenna, et autres
Publié: (2025)
par: Lai, Wenna, et autres
Publié: (2025)
Contrast Is All You Need
par: Kilic, Burak, et autres
Publié: (2023)
par: Kilic, Burak, et autres
Publié: (2023)
dVoting: Fast Voting for dLLMs
par: Feng, Sicheng, et autres
Publié: (2026)
par: Feng, Sicheng, et autres
Publié: (2026)
Advancing Complex Medical Communication in Arabic with Sporo AraSum: Surpassing Existing Large Language Models
par: Lee, Chanseo, et autres
Publié: (2024)
par: Lee, Chanseo, et autres
Publié: (2024)
On the effectiveness of LLMs for automatic grading of open-ended questions in Spanish
par: Capdehourat, Germán, et autres
Publié: (2025)
par: Capdehourat, Germán, et autres
Publié: (2025)
Look It Up: Analysing Internal Web Search Capabilities of Modern LLMs
par: Kale, Sahil
Publié: (2025)
par: Kale, Sahil
Publié: (2025)
Documents similaires
-
SEval-Ex: A Statement-Level Framework for Explainable Summarization Evaluation
par: Herserant, Tanguy, et autres
Publié: (2025) -
Can open source large language models be used for tumor documentation in Germany? -- An evaluation on urological doctors' notes
par: Lenz, Stefan, et autres
Publié: (2025) -
Large Language Models, scientific knowledge and factuality: A framework to streamline human expert evaluation
par: Wysocka, Magdalena, et autres
Publié: (2023) -
AspirinSum: an Aspect-based utility-preserved de-identification Summarization framework
par: Li, Ya-Lun
Publié: (2024) -
adaptNMT: an open-source, language-agnostic development environment for Neural Machine Translation
par: Lankford, Séamus, et autres
Publié: (2024)