Argument Summarization and its Evaluation in the Era of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Altemeyer, Moritz, Eger, Steffen, Daxenberger, Johannes, Chen, Yanran, Altendorf, Tim, Cimiano, Philipp, Schiller, Benjamin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checks
par: Chen, Yanran, et autres
Publié: (2025)
par: Chen, Yanran, et autres
Publié: (2025)
Diversity Over Size: On the Effect of Sample and Topic Sizes for Topic-Dependent Argument Mining Datasets
par: Schiller, Benjamin, et autres
Publié: (2022)
par: Schiller, Benjamin, et autres
Publié: (2022)
PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation
par: Leiter, Christoph, et autres
Publié: (2024)
par: Leiter, Christoph, et autres
Publié: (2024)
Evaluating Large Language Models for Structured Science Summarization in the Open Research Knowledge Graph
par: Nechakhin, Vladyslav, et autres
Publié: (2024)
par: Nechakhin, Vladyslav, et autres
Publié: (2024)
Evaluating Diversity in Automatic Poetry Generation
par: Chen, Yanran, et autres
Publié: (2024)
par: Chen, Yanran, et autres
Publié: (2024)
Cross-lingual Cross-temporal Summarization: Dataset, Models, Evaluation
par: Zhang, Ran, et autres
Publié: (2023)
par: Zhang, Ran, et autres
Publié: (2023)
DeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization?
par: Larionov, Daniil, et autres
Publié: (2025)
par: Larionov, Daniil, et autres
Publié: (2025)
From Argumentation to Deliberation: Perspectivized Stance Vectors for Fine-grained (Dis)agreement Analysis
par: Plenz, Moritz, et autres
Publié: (2025)
par: Plenz, Moritz, et autres
Publié: (2025)
Architectural Sweet Spots for Modeling Human Label Variation by the Example of Argument Quality: It's Best to Relate Perspectives!
par: Heinisch, Philipp, et autres
Publié: (2023)
par: Heinisch, Philipp, et autres
Publié: (2023)
Emotionally Charged, Logically Blurred: AI-driven Emotional Framing Impairs Human Fallacy Detection
par: Chen, Yanran, et autres
Publié: (2025)
par: Chen, Yanran, et autres
Publié: (2025)
ByGPT5: End-to-End Style-conditioned Poetry Generation with Token-free Language Models
par: Belouadi, Jonas, et autres
Publié: (2022)
par: Belouadi, Jonas, et autres
Publié: (2022)
Syntactic Language Change in English and German: Metrics, Parsers, and Convergences
par: Chen, Yanran, et autres
Publié: (2024)
par: Chen, Yanran, et autres
Publié: (2024)
USCORE: An Effective Approach to Fully Unsupervised Evaluation Metrics for Machine Translation
par: Belouadi, Jonas, et autres
Publié: (2022)
par: Belouadi, Jonas, et autres
Publié: (2022)
BatchGEMBA: Token-Efficient Machine Translation Evaluation with Batched Prompting and Prompt Compression
par: Larionov, Daniil, et autres
Publié: (2025)
par: Larionov, Daniil, et autres
Publié: (2025)
PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)
par: Larionov, Daniil, et autres
Publié: (2024)
Pointing out the Shortcomings of Relation Extraction Models with Semantically Motivated Adversarials
par: Nolano, Gennaro, et autres
Publié: (2024)
par: Nolano, Gennaro, et autres
Publié: (2024)
BMX: Boosting Natural Language Generation Metrics with Explainability
par: Leiter, Christoph, et autres
Publié: (2022)
par: Leiter, Christoph, et autres
Publié: (2022)
LLM-based multi-agent poetry generation in non-cooperative environments
par: Zhang, Ran, et autres
Publié: (2024)
par: Zhang, Ran, et autres
Publié: (2024)
LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models
par: Kostikova, Aida, et autres
Publié: (2025)
par: Kostikova, Aida, et autres
Publié: (2025)
How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMs
par: Zhang, Ran, et autres
Publié: (2024)
par: Zhang, Ran, et autres
Publié: (2024)
TRAVELER: A Benchmark for Evaluating Temporal Reasoning across Vague, Implicit and Explicit References
par: Kenneweg, Svenja, et autres
Publié: (2025)
par: Kenneweg, Svenja, et autres
Publié: (2025)
Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
par: Greisinger, Christian, et autres
Publié: (2026)
par: Greisinger, Christian, et autres
Publié: (2026)
Is there really a Citation Age Bias in NLP?
par: Nguyen, Hoa, et autres
Publié: (2024)
par: Nguyen, Hoa, et autres
Publié: (2024)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
par: Zhou, Kevin, et autres
Publié: (2025)
par: Zhou, Kevin, et autres
Publié: (2025)
PAKT: Perspectivized Argumentation Knowledge Graph and Tool for Deliberation Analysis (with Supplementary Materials)
par: Plenz, Moritz, et autres
Publié: (2024)
par: Plenz, Moritz, et autres
Publié: (2024)
The Ecological Fallacy in Annotation: Modelling Human Label Variation goes beyond Sociodemographics
par: Orlikowski, Matthias, et autres
Publié: (2023)
par: Orlikowski, Matthias, et autres
Publié: (2023)
Beyond Demographics: Fine-tuning Large Language Models to Predict Individuals' Subjective Text Perceptions
par: Orlikowski, Matthias, et autres
Publié: (2025)
par: Orlikowski, Matthias, et autres
Publié: (2025)
A Factorized Probabilistic Model of the Semantics of Vague Temporal Adverbials Relative to Different Event Types
par: Kenneweg, Svenja, et autres
Publié: (2025)
par: Kenneweg, Svenja, et autres
Publié: (2025)
Generalization Bias in Large Language Model Summarization of Scientific Research
par: Peters, Uwe, et autres
Publié: (2025)
par: Peters, Uwe, et autres
Publié: (2025)
On Context Utilization in Summarization with Large Language Models
par: Ravaut, Mathieu, et autres
Publié: (2023)
par: Ravaut, Mathieu, et autres
Publié: (2023)
NLLG Quarterly arXiv Report 09/24: What are the most influential current AI Papers?
par: Leiter, Christoph, et autres
Publié: (2024)
par: Leiter, Christoph, et autres
Publié: (2024)
Exploring the Potential of Large Language Models in Computational Argumentation
par: Chen, Guizhen, et autres
Publié: (2023)
par: Chen, Guizhen, et autres
Publié: (2023)
Aspect-Based Opinion Summarization with Argumentation Schemes
par: Zhou, Wendi, et autres
Publié: (2025)
par: Zhou, Wendi, et autres
Publié: (2025)
xCOMET-lite: Bridging the Gap Between Efficiency and Quality in Learned MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)
par: Larionov, Daniil, et autres
Publié: (2024)
AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ
par: Belouadi, Jonas, et autres
Publié: (2023)
par: Belouadi, Jonas, et autres
Publié: (2023)
CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks
par: Leiter, Christoph, et autres
Publié: (2025)
par: Leiter, Christoph, et autres
Publié: (2025)
An Empirical Analysis of Diversity in Argument Summarization
par: van der Meer, Michiel, et autres
Publié: (2024)
par: van der Meer, Michiel, et autres
Publié: (2024)
Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach
par: Ocampo, Nicolás Benjamín, et autres
Publié: (2026)
par: Ocampo, Nicolás Benjamín, et autres
Publié: (2026)
ArgCMV: An Argument Summarization Benchmark for the LLM-era
par: Gurjar, Omkar, et autres
Publié: (2025)
par: Gurjar, Omkar, et autres
Publié: (2025)
Documents similaires
-
Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checks
par: Chen, Yanran, et autres
Publié: (2025) -
Diversity Over Size: On the Effect of Sample and Topic Sizes for Topic-Dependent Argument Mining Datasets
par: Schiller, Benjamin, et autres
Publié: (2022) -
PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation
par: Leiter, Christoph, et autres
Publié: (2024) -
Evaluating Large Language Models for Structured Science Summarization in the Open Research Knowledge Graph
par: Nechakhin, Vladyslav, et autres
Publié: (2024) -
Evaluating Diversity in Automatic Poetry Generation
par: Chen, Yanran, et autres
Publié: (2024)