AMRFact: Enhancing Summarization Factuality Evaluation with AMR-Driven Negative Samples Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiu, Haoyi, Huang, Kung-Hsiang, Qu, Jingnong, Peng, Nanyun |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies
par: Qiu, Haoyi, et autres
Publié: (2025)
par: Qiu, Haoyi, et autres
Publié: (2025)
SafeWorld: Geo-Diverse Safety Alignment
par: Yin, Da, et autres
Publié: (2024)
par: Yin, Da, et autres
Publié: (2024)
MMPersuade: A Dataset and Evaluation Framework for Multimodal Persuasion
par: Qiu, Haoyi, et autres
Publié: (2025)
par: Qiu, Haoyi, et autres
Publié: (2025)
Evaluating Cultural and Social Awareness of LLM Web Agents
par: Qiu, Haoyi, et autres
Publié: (2024)
par: Qiu, Haoyi, et autres
Publié: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
par: Qiu, Haoyi, et autres
Publié: (2024)
par: Qiu, Haoyi, et autres
Publié: (2024)
Decoupling Task-Solving and Output Formatting in LLM Generation
par: Deng, Haikang, et autres
Publié: (2025)
par: Deng, Haikang, et autres
Publié: (2025)
REAL Sampling: Boosting Factuality and Diversity of Open-Ended Generation via Asymptotic Entropy
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
par: Chang, Haw-Shiuan, et autres
Publié: (2024)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
MMGR: Multi-Modal Generative Reasoning
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
Brain Score Tracks Shared Properties of Languages: Evidence from Many Natural Languages and Structured Sequences
par: Qu, Jingnong, et autres
Publié: (2026)
par: Qu, Jingnong, et autres
Publié: (2026)
Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document Summarization
par: Zhong, Yang, et autres
Publié: (2025)
par: Zhong, Yang, et autres
Publié: (2025)
mFACE: Multilingual Summarization with Factual Consistency Evaluation
par: Aharoni, Roee, et autres
Publié: (2022)
par: Aharoni, Roee, et autres
Publié: (2022)
Fine-grained and Explainable Factuality Evaluation for Multimodal Summarization
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
Collapse of Dense Retrievers: Short, Early, and Literal Biases Outranking Factual Evidence
par: Fayyaz, Mohsen, et autres
Publié: (2025)
par: Fayyaz, Mohsen, et autres
Publié: (2025)
FactPICO: Factuality Evaluation for Plain Language Summarization of Medical Evidence
par: Joseph, Sebastian Antony, et autres
Publié: (2024)
par: Joseph, Sebastian Antony, et autres
Publié: (2024)
Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles
par: Huang, Kung-Hsiang, et autres
Publié: (2023)
par: Huang, Kung-Hsiang, et autres
Publié: (2023)
SkillVerse : Assessing and Enhancing LLMs with Tree Evaluation
par: Tian, Yufei, et autres
Publié: (2025)
par: Tian, Yufei, et autres
Publié: (2025)
Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning
par: Huang, Kung-Hsiang, et autres
Publié: (2023)
par: Huang, Kung-Hsiang, et autres
Publié: (2023)
ISQA: Informative Factuality Feedback for Scientific Summarization
par: Li, Zekai, et autres
Publié: (2024)
par: Li, Zekai, et autres
Publié: (2024)
Agent-as-Judge for Factual Summarization of Long Narratives
par: Jeong, Yeonseok, et autres
Publié: (2025)
par: Jeong, Yeonseok, et autres
Publié: (2025)
BanglaSummEval: Reference-Free Factual Consistency Evaluation for Bangla Summarization
par: Rafid, Ahmed, et autres
Publié: (2026)
par: Rafid, Ahmed, et autres
Publié: (2026)
HuAMR: A Hungarian AMR Parser and Dataset
par: Barta, Botond, et autres
Publié: (2025)
par: Barta, Botond, et autres
Publié: (2025)
Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk Decoding
par: Soetedjo, Riza Setiawan, et autres
Publié: (2026)
par: Soetedjo, Riza Setiawan, et autres
Publié: (2026)
Evaluating the Factuality of Zero-shot Summarizers Across Varied Domains
par: Ramprasad, Sanjana, et autres
Publié: (2024)
par: Ramprasad, Sanjana, et autres
Publié: (2024)
Evaluation of Finetuned LLMs in AMR Parsing
par: Ho, Shu Han
Publié: (2025)
par: Ho, Shu Han
Publié: (2025)
PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization
par: You, Zhiwen, et autres
Publié: (2025)
par: You, Zhiwen, et autres
Publié: (2025)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
par: Feng, Huawen, et autres
Publié: (2023)
par: Feng, Huawen, et autres
Publié: (2023)
Semantic Bridge: Universal Multi-Hop Question Generation via AMR-Driven Graph Synthesis
par: Chen, Linqing, et autres
Publié: (2025)
par: Chen, Linqing, et autres
Publié: (2025)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
Adaptable Logical Control for Large Language Models
par: Zhang, Honghua, et autres
Publié: (2024)
par: Zhang, Honghua, et autres
Publié: (2024)
Think Carefully and Check Again! Meta-Generation Unlocking LLMs for Low-Resource Cross-Lingual Summarization
par: Li, Zhecheng, et autres
Publié: (2024)
par: Li, Zhecheng, et autres
Publié: (2024)
ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization
par: Bae, Suyoung, et autres
Publié: (2026)
par: Bae, Suyoung, et autres
Publié: (2026)
STAR: Boosting Low-Resource Information Extraction by Structure-to-Text Data Generation with Large Language Models
par: Ma, Mingyu Derek, et autres
Publié: (2023)
par: Ma, Mingyu Derek, et autres
Publié: (2023)
SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits
par: Thorat, Onkar, et autres
Publié: (2024)
par: Thorat, Onkar, et autres
Publié: (2024)
Beyond Factual Accuracy: Evaluating Coverage of Diverse Factual Information in Long-form Text Generation
par: Samarinas, Chris, et autres
Publié: (2025)
par: Samarinas, Chris, et autres
Publié: (2025)
From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models
par: Huang, Kung-Hsiang, et autres
Publié: (2024)
par: Huang, Kung-Hsiang, et autres
Publié: (2024)
Enhancing Argument Summarization: Prioritizing Exhaustiveness in Key Point Generation and Introducing an Automatic Coverage Evaluation Metric
par: Khosravani, Mohammad, et autres
Publié: (2024)
par: Khosravani, Mohammad, et autres
Publié: (2024)
Compressing Long Context for Enhancing RAG with AMR-based Concept Distillation
par: Shi, Kaize, et autres
Publié: (2024)
par: Shi, Kaize, et autres
Publié: (2024)
Detecting Machine-Generated Long-Form Content with Latent-Space Variables
par: Tian, Yufei, et autres
Publié: (2024)
par: Tian, Yufei, et autres
Publié: (2024)
Documents similaires
-
Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies
par: Qiu, Haoyi, et autres
Publié: (2025) -
SafeWorld: Geo-Diverse Safety Alignment
par: Yin, Da, et autres
Publié: (2024) -
MMPersuade: A Dataset and Evaluation Framework for Multimodal Persuasion
par: Qiu, Haoyi, et autres
Publié: (2025) -
Evaluating Cultural and Social Awareness of LLM Web Agents
par: Qiu, Haoyi, et autres
Publié: (2024) -
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
par: Qiu, Haoyi, et autres
Publié: (2024)