Can We Trust the Performance Evaluation of Uncertainty Estimation Methods in Text Summarization?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Jianfeng, Yang, Runing, Yu, Linlin, Li, Changbin, Jia, Ruoxi, Chen, Feng, Jin, Ming, Lu, Chang-Tien |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncertainty Estimation on Sequential Labeling via Uncertainty Transmission
par: He, Jianfeng, et autres
Publié: (2023)
par: He, Jianfeng, et autres
Publié: (2023)
LLMs Can Plan Only If We Tell Them
par: Sel, Bilgehan, et autres
Publié: (2025)
par: Sel, Bilgehan, et autres
Publié: (2025)
InternalInspector $I^2$: Robust Confidence Estimation in LLMs through Internal States
par: Beigi, Mohammad, et autres
Publié: (2024)
par: Beigi, Mohammad, et autres
Publié: (2024)
Don't Go To Extremes: Revealing the Excessive Sensitivity and Calibration Limitations of LLMs in Implicit Hate Speech Detection
par: Zhang, Min, et autres
Publié: (2024)
par: Zhang, Min, et autres
Publié: (2024)
Can We Trust LLM Detectors?
par: Sandhan, Jivnesh, et autres
Publié: (2026)
par: Sandhan, Jivnesh, et autres
Publié: (2026)
LLM-REVal: Can We Trust LLM Reviewers Yet?
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
DUAL: Diversity and Uncertainty Active Learning for Text Summarization
par: Giouroukis, Petros Stylianos, et autres
Publié: (2025)
par: Giouroukis, Petros Stylianos, et autres
Publié: (2025)
A Comparative Study of Quality Evaluation Methods for Text Summarization
par: Nguyen, Huyen, et autres
Publié: (2024)
par: Nguyen, Huyen, et autres
Publié: (2024)
Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality
par: Wu, Taiqiang, et autres
Publié: (2026)
par: Wu, Taiqiang, et autres
Publié: (2026)
Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?
par: Wang, Leyao, et autres
Publié: (2026)
par: Wang, Leyao, et autres
Publié: (2026)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
par: Yu, Ping, et autres
Publié: (2024)
par: Yu, Ping, et autres
Publié: (2024)
Exploring the Deceptive Power of LLM-Generated Fake News: A Study of Real-World Detection Challenges
par: Sun, Yanshen, et autres
Publié: (2024)
par: Sun, Yanshen, et autres
Publié: (2024)
Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs
par: Xiong, Miao, et autres
Publié: (2023)
par: Xiong, Miao, et autres
Publié: (2023)
Comprehensive Manuscript Assessment with Text Summarization Using 69707 articles
par: Sun, Qichen, et autres
Publié: (2025)
par: Sun, Qichen, et autres
Publié: (2025)
A Systematic Survey of Text Summarization: From Statistical Methods to Large Language Models
par: Zhang, Haopeng, et autres
Publié: (2024)
par: Zhang, Haopeng, et autres
Publié: (2024)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
par: Jain, Sameer, et autres
Publié: (2023)
par: Jain, Sameer, et autres
Publié: (2023)
On the Role of Summary Content Units in Text Summarization Evaluation
par: Nawrath, Marcel, et autres
Publié: (2024)
par: Nawrath, Marcel, et autres
Publié: (2024)
Can We Trust LLMs? Mitigate Overconfidence Bias in LLMs through Knowledge Transfer
par: Yang, Haoyan, et autres
Publié: (2024)
par: Yang, Haoyan, et autres
Publié: (2024)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
par: Liu, Yinhong, et autres
Publié: (2025)
par: Liu, Yinhong, et autres
Publié: (2025)
When Can We Trust LLM Graders? Calibrating Confidence for Automated Assessment
par: Ferrer, Robinson, et autres
Publié: (2026)
par: Ferrer, Robinson, et autres
Publié: (2026)
Enriching and Controlling Global Semantics for Text Summarization
par: Nguyen, Thong, et autres
Publié: (2021)
par: Nguyen, Thong, et autres
Publié: (2021)
When Can We Trust LLMs in Mental Health? Large-Scale Benchmarks for Reliable LLM Evaluation
par: Badawi, Abeer, et autres
Publié: (2025)
par: Badawi, Abeer, et autres
Publié: (2025)
Survey of Query-based Text Summarization
par: Yu, Hang, et autres
Publié: (2022)
par: Yu, Hang, et autres
Publié: (2022)
Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data?
par: Wang, Shaobo, et autres
Publié: (2025)
par: Wang, Shaobo, et autres
Publié: (2025)
Scientific Opinion Summarization: Paper Meta-review Generation Dataset, Methods, and Evaluation
par: Zeng, Qi, et autres
Publié: (2023)
par: Zeng, Qi, et autres
Publié: (2023)
Can We Trust LLMs for Mental Health Screening? Consistency, ASR Robustness, and Evidence Faithfulness
par: Loweimi, Erfan, et autres
Publié: (2026)
par: Loweimi, Erfan, et autres
Publié: (2026)
Adapted Large Language Models Can Outperform Medical Experts in Clinical Text Summarization
par: Van Veen, Dave, et autres
Publié: (2023)
par: Van Veen, Dave, et autres
Publié: (2023)
End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering
par: Dang, Nhi, et autres
Publié: (2026)
par: Dang, Nhi, et autres
Publié: (2026)
Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
par: Prandi, Matteo, et autres
Publié: (2025)
par: Prandi, Matteo, et autres
Publié: (2025)
Text Style Transfer with Parameter-efficient LLM Finetuning and Round-trip Translation
par: Liu, Ruoxi, et autres
Publié: (2026)
par: Liu, Ruoxi, et autres
Publié: (2026)
Can We Predict Performance of Large Models across Vision-Language Tasks?
par: Zhao, Qinyu, et autres
Publié: (2024)
par: Zhao, Qinyu, et autres
Publié: (2024)
Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
par: Hobelsberger, Christian, et autres
Publié: (2025)
par: Hobelsberger, Christian, et autres
Publié: (2025)
Evaluating Small Language Models for News Summarization: Implications and Factors Influencing Performance
par: Xu, Borui, et autres
Publié: (2025)
par: Xu, Borui, et autres
Publié: (2025)
Multi-LLM Text Summarization
par: Fang, Jiangnan, et autres
Publié: (2024)
par: Fang, Jiangnan, et autres
Publié: (2024)
Topic-Controllable Summarization: Topic-Aware Evaluation and Transformer Methods
par: Passali, Tatiana, et autres
Publié: (2022)
par: Passali, Tatiana, et autres
Publié: (2022)
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
par: Zhang, Shiyue, et autres
Publié: (2024)
par: Zhang, Shiyue, et autres
Publié: (2024)
APPLS: Evaluating Evaluation Metrics for Plain Language Summarization
par: Guo, Yue, et autres
Publié: (2023)
par: Guo, Yue, et autres
Publié: (2023)
Can LLMs Infer Personality from Real World Conversations?
par: Zhu, Jianfeng, et autres
Publié: (2025)
par: Zhu, Jianfeng, et autres
Publié: (2025)
Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models
par: Sel, Bilgehan, et autres
Publié: (2023)
par: Sel, Bilgehan, et autres
Publié: (2023)
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
Documents similaires
-
Uncertainty Estimation on Sequential Labeling via Uncertainty Transmission
par: He, Jianfeng, et autres
Publié: (2023) -
LLMs Can Plan Only If We Tell Them
par: Sel, Bilgehan, et autres
Publié: (2025) -
InternalInspector $I^2$: Robust Confidence Estimation in LLMs through Internal States
par: Beigi, Mohammad, et autres
Publié: (2024) -
Don't Go To Extremes: Revealing the Excessive Sensitivity and Calibration Limitations of LLMs in Implicit Hate Speech Detection
par: Zhang, Min, et autres
Publié: (2024) -
Can We Trust LLM Detectors?
par: Sandhan, Jivnesh, et autres
Publié: (2026)