TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Liyan, Shalyminov, Igor, Wong, Amy Wing-mei, Burnsky, Jon, Vincent, Jake W., Yang, Yu'an, Singh, Siffi, Feng, Song, Song, Hwanjun, Su, Hang, Sun, Lijia, Zhang, Yi, Mansour, Saab, McKeown, Kathleen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semi-Supervised Dialogue Abstractive Summarization via High-Quality Pseudolabel Selection
par: He, Jianfeng, et autres
Publié: (2024)
par: He, Jianfeng, et autres
Publié: (2024)
FineSurE: Fine-grained Summarization Evaluation using LLMs
par: Song, Hwanjun, et autres
Publié: (2024)
par: Song, Hwanjun, et autres
Publié: (2024)
Can Your Model Tell a Negation from an Implicature? Unravelling Challenges With Intent Encoders
par: Zhang, Yuwei, et autres
Publié: (2024)
par: Zhang, Yuwei, et autres
Publié: (2024)
MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets
par: Aboutalebi, Hossein, et autres
Publié: (2024)
par: Aboutalebi, Hossein, et autres
Publié: (2024)
Controllable Conversational Theme Detection Track at DSTC 12
par: Shalyminov, Igor, et autres
Publié: (2025)
par: Shalyminov, Igor, et autres
Publié: (2025)
Summarization of Opinionated Political Documents with Varied Perspectives
par: Deas, Nicholas, et autres
Publié: (2024)
par: Deas, Nicholas, et autres
Publié: (2024)
Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation
par: Koupaee, Mahnaz, et autres
Publié: (2025)
par: Koupaee, Mahnaz, et autres
Publié: (2025)
Reranking-based Generation for Unbiased Perspective Summarization
par: Ri, Narutatsu, et autres
Publié: (2025)
par: Ri, Narutatsu, et autres
Publié: (2025)
DFlow: Diverse Dialogue Flow Simulation with Large Language Models
par: Du, Wanyu, et autres
Publié: (2024)
par: Du, Wanyu, et autres
Publié: (2024)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
par: Lee, Yuho, et autres
Publié: (2024)
par: Lee, Yuho, et autres
Publié: (2024)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
par: Liu, Yinhong, et autres
Publié: (2025)
par: Liu, Yinhong, et autres
Publié: (2025)
Reading Subtext: Evaluating Large Language Models on Short Story Summarization with Writers
par: Subbiah, Melanie, et autres
Publié: (2024)
par: Subbiah, Melanie, et autres
Publié: (2024)
Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions
par: Deas, Nicholas, et autres
Publié: (2025)
par: Deas, Nicholas, et autres
Publié: (2025)
CERET: Cost-Effective Extrinsic Refinement for Text Generation
par: Cai, Jason, et autres
Publié: (2024)
par: Cai, Jason, et autres
Publié: (2024)
AdvSumm: Adversarial Training for Bias Mitigation in Text Summarization
par: Gupta, Mukur, et autres
Publié: (2025)
par: Gupta, Mukur, et autres
Publié: (2025)
STORYSUMM: Evaluating Faithfulness in Story Summarization
par: Subbiah, Melanie, et autres
Publié: (2024)
par: Subbiah, Melanie, et autres
Publié: (2024)
Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined Highlights
par: Mao, Shunqi, et autres
Publié: (2024)
par: Mao, Shunqi, et autres
Publié: (2024)
Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines
par: Song, Hwanjun
Publié: (2026)
par: Song, Hwanjun
Publié: (2026)
God's Babies
par: McKeown, John
Publié: (2018)
par: McKeown, John
Publié: (2018)
The Busemann Process and Steep Highways in Directed First Passage Percolation
par: McKeown, Sam
Publié: (2025)
par: McKeown, Sam
Publié: (2025)
Analysis of shape and angular orientation parameters of velocity-dependent dark matter annihilation signals in Galactic Centers for FIRE simulations
par: McKeown, Daniel
Publié: (2025)
par: McKeown, Daniel
Publié: (2025)
Maryland State Board for Higher Education Operating Budget Guideline Development. A Report to the Joint Chairmen of the Senate Budget and Taxation Committee and House Appropriations Committee, 1982 Session.
par: McKeown, Mary
Publié: (1982)
par: McKeown, Mary
Publié: (1982)
Article peer review: Is collegiate cooperation under threat, why and what to do about it?
par: Mick McKeown
Publié: (2024)
par: Mick McKeown
Publié: (2024)
The Meldrewfication of Mick
par: Mick McKeown
Publié: (2024)
par: Mick McKeown
Publié: (2024)
Mining Contextualized Visual Associations from Images for Creativity Understanding
par: Sahu, Ananya, et autres
Publié: (2025)
par: Sahu, Ananya, et autres
Publié: (2025)
Forecasting Conversation Derailments Through Generation
par: Zhang, Yunfan, et autres
Publié: (2025)
par: Zhang, Yunfan, et autres
Publié: (2025)
Exploring Chain-of-Thought Reasoning for Steerable Pluralistic Alignment
par: Zhang, Yunfan, et autres
Publié: (2025)
par: Zhang, Yunfan, et autres
Publié: (2025)
Enhancing Multimodal Affective Analysis with Learned Live Comment Features
par: Deng, Zhaoyuan, et autres
Publié: (2024)
par: Deng, Zhaoyuan, et autres
Publié: (2024)
LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News
par: Zhang, Yunfan, et autres
Publié: (2026)
par: Zhang, Yunfan, et autres
Publié: (2026)
iBERT: Interpretable Embeddings via Sense Decomposition
par: Anand, Vishal, et autres
Publié: (2025)
par: Anand, Vishal, et autres
Publié: (2025)
DYSTIL: Dynamic Strategy Induction with Large Language Models for Reinforcement Learning
par: Wang, Borui, et autres
Publié: (2025)
par: Wang, Borui, et autres
Publié: (2025)
Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems
par: Berman, Shmuel, et autres
Publié: (2024)
par: Berman, Shmuel, et autres
Publié: (2024)
Social Orientation: A New Feature for Dialogue Analysis
par: Morrill, Todd, et autres
Publié: (2024)
par: Morrill, Todd, et autres
Publié: (2024)
Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding
par: Subbiah, Melanie, et autres
Publié: (2025)
par: Subbiah, Melanie, et autres
Publié: (2025)
Fact-Controlled Diagnosis of Hallucinations in Medical Text Summarization
par: BN, Suhas, et autres
Publié: (2025)
par: BN, Suhas, et autres
Publié: (2025)
Logit Reweighting for Topic-Focused Summarization
par: Braun, Joschka, et autres
Publié: (2025)
par: Braun, Joschka, et autres
Publié: (2025)
The food of trout in New South Wales, 1933–1934
par: McKeown, Keith C.
Publié: (1934)
par: McKeown, Keith C.
Publié: (1934)
Catalogue of the Cerambycidae (Coleoptera) of Australia
par: McKeown, Keith C.
Publié: (1947)
par: McKeown, Keith C.
Publié: (1947)
GLEAN: Active Generalized Category Discovery with Diverse LLM Feedback
par: Zou, Henry Peng, et autres
Publié: (2025)
par: Zou, Henry Peng, et autres
Publié: (2025)
TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes
par: Shah, Raj Sanjay, et autres
Publié: (2025)
par: Shah, Raj Sanjay, et autres
Publié: (2025)
Documents similaires
-
Semi-Supervised Dialogue Abstractive Summarization via High-Quality Pseudolabel Selection
par: He, Jianfeng, et autres
Publié: (2024) -
FineSurE: Fine-grained Summarization Evaluation using LLMs
par: Song, Hwanjun, et autres
Publié: (2024) -
Can Your Model Tell a Negation from an Implicature? Unravelling Challenges With Intent Encoders
par: Zhang, Yuwei, et autres
Publié: (2024) -
MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets
par: Aboutalebi, Hossein, et autres
Publié: (2024) -
Controllable Conversational Theme Detection Track at DSTC 12
par: Shalyminov, Igor, et autres
Publié: (2025)