What Matters to an LLM? Behavioral and Computational Evidences from Summarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yongxin, Wu, Changshun, Mulhem, Philippe, Schwab, Didier, Peyrard, Maxime |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TempPerturb-Eval: On the Joint Effects of Internal Temperature and External Perturbations in RAG Robustness
par: Zhou, Yongxin, et autres
Publié: (2025)
par: Zhou, Yongxin, et autres
Publié: (2025)
What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search
par: Zhang, Xinhao, et autres
Publié: (2026)
par: Zhang, Xinhao, et autres
Publié: (2026)
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
par: Méloux, Maxime, et autres
Publié: (2025)
par: Méloux, Maxime, et autres
Publié: (2025)
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
par: Bhatia, Gagan, et autres
Publié: (2026)
par: Bhatia, Gagan, et autres
Publié: (2026)
Date Fragments: A Hidden Bottleneck of Tokenization for Temporal Reasoning
par: Bhatia, Gagan, et autres
Publié: (2025)
par: Bhatia, Gagan, et autres
Publié: (2025)
Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
par: Méloux, Maxime, et autres
Publié: (2025)
par: Méloux, Maxime, et autres
Publié: (2025)
Agentic AI: The Era of Semantic Decoding
par: Peyrard, Maxime, et autres
Publié: (2024)
par: Peyrard, Maxime, et autres
Publié: (2024)
PSentScore: Evaluating Sentiment Polarity in Dialogue Summarization
par: Zhou, Yongxin, et autres
Publié: (2023)
par: Zhou, Yongxin, et autres
Publié: (2023)
Word Matters: What Influences Domain Adaptation in Summarization?
par: Li, Yinghao, et autres
Publié: (2024)
par: Li, Yinghao, et autres
Publié: (2024)
Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning
par: Geng, Saibo, et autres
Publié: (2023)
par: Geng, Saibo, et autres
Publié: (2023)
Can GPT models Follow Human Summarization Guidelines? A Study for Targeted Communication Goals
par: Zhou, Yongxin, et autres
Publié: (2023)
par: Zhou, Yongxin, et autres
Publié: (2023)
$\texttt{COSMIC}$: Mutual Information for Task-Agnostic Summarization Evaluation
par: Darrin, Maxime, et autres
Publié: (2024)
par: Darrin, Maxime, et autres
Publié: (2024)
Understanding LLM Behavior in Multi-Target Cross-Lingual Summarization
par: Ryu, Sangwon, et autres
Publié: (2026)
par: Ryu, Sangwon, et autres
Publié: (2026)
REFINER: Reasoning Feedback on Intermediate Representations
par: Paul, Debjit, et autres
Publié: (2023)
par: Paul, Debjit, et autres
Publié: (2023)
Analyzing LLM Behavior in Dialogue Summarization: Unveiling Circumstantial Hallucination Trends
par: Ramprasad, Sanjana, et autres
Publié: (2024)
par: Ramprasad, Sanjana, et autres
Publié: (2024)
Reassessing Graph Linearization for Sequence-to-sequence AMR Parsing: On the Advantages and Limitations of Triple-Based Encoding
par: Kang, Jeongwoo, et autres
Publié: (2025)
par: Kang, Jeongwoo, et autres
Publié: (2025)
UMLS-KGI-BERT: Data-Centric Knowledge Integration in Transformers for Biomedical Entity Recognition
par: Mannion, Aidan, et autres
Publié: (2023)
par: Mannion, Aidan, et autres
Publié: (2023)
Should Cross-Lingual AMR Parsing go Meta? An Empirical Assessment of Meta-Learning and Joint Learning AMR Parsing
par: Kang, Jeongwoo, et autres
Publié: (2024)
par: Kang, Jeongwoo, et autres
Publié: (2024)
Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning
par: Wu, Jiawei, et autres
Publié: (2026)
par: Wu, Jiawei, et autres
Publié: (2026)
Multi-LLM Text Summarization
par: Fang, Jiangnan, et autres
Publié: (2024)
par: Fang, Jiangnan, et autres
Publié: (2024)
Efficiency and Effectiveness of LLM-Based Summarization of Evidence in Crowdsourced Fact-Checking
par: Roitero, Kevin, et autres
Publié: (2025)
par: Roitero, Kevin, et autres
Publié: (2025)
SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits
par: Thorat, Onkar, et autres
Publié: (2024)
par: Thorat, Onkar, et autres
Publié: (2024)
What Are They Talking About? A Benchmark of Knowledge-Grounded Discussion Summarization
par: Zhou, Weixiao, et autres
Publié: (2025)
par: Zhou, Weixiao, et autres
Publié: (2025)
GLIMPSE: Pragmatically Informative Multi-Document Summarization for Scholarly Reviews
par: Darrin, Maxime, et autres
Publié: (2024)
par: Darrin, Maxime, et autres
Publié: (2024)
Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage
par: Xie, Kaige, et autres
Publié: (2024)
par: Xie, Kaige, et autres
Publié: (2024)
Query-Focused Extractive Summarization for Sentiment Explanation
par: Moubtahij, Ahmed, et autres
Publié: (2025)
par: Moubtahij, Ahmed, et autres
Publié: (2025)
zip2zip: Inference-Time Adaptive Tokenization via Online Compression
par: Geng, Saibo, et autres
Publié: (2025)
par: Geng, Saibo, et autres
Publié: (2025)
Understanding LLM Reasoning for Abstractive Summarization
par: Yuan, Haohan, et autres
Publié: (2025)
par: Yuan, Haohan, et autres
Publié: (2025)
Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles
par: Huang, Kung-Hsiang, et autres
Publié: (2023)
par: Huang, Kung-Hsiang, et autres
Publié: (2023)
Human Values Matter: Investigating How Misalignment Shapes Collective Behaviors in LLM Agent Communities
par: Zhang, Xiangxu, et autres
Publié: (2026)
par: Zhang, Xiangxu, et autres
Publié: (2026)
Learning from Self Critique and Refinement for Faithful LLM Summarization
par: Hu, Ting-Yao, et autres
Publié: (2025)
par: Hu, Ting-Yao, et autres
Publié: (2025)
Learning to Summarize from LLM-generated Feedback
par: Song, Hwanjun, et autres
Publié: (2024)
par: Song, Hwanjun, et autres
Publié: (2024)
References Matter: Investigating the Impact of Reference Set Variation on Summarization Evaluation
par: Casola, Silvia, et autres
Publié: (2025)
par: Casola, Silvia, et autres
Publié: (2025)
ArgCMV: An Argument Summarization Benchmark for the LLM-era
par: Gurjar, Omkar, et autres
Publié: (2025)
par: Gurjar, Omkar, et autres
Publié: (2025)
Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data
par: Lu, Yuxuan, et autres
Publié: (2025)
par: Lu, Yuxuan, et autres
Publié: (2025)
A Computational Framework for Behavioral Assessment of LLM Therapists
par: Chiu, Yu Ying, et autres
Publié: (2024)
par: Chiu, Yu Ying, et autres
Publié: (2024)
FactPICO: Factuality Evaluation for Plain Language Summarization of Medical Evidence
par: Joseph, Sebastian Antony, et autres
Publié: (2024)
par: Joseph, Sebastian Antony, et autres
Publié: (2024)
Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
par: Wang, Weixuan, et autres
Publié: (2025)
par: Wang, Weixuan, et autres
Publié: (2025)
Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors
par: Walsh, Cole, et autres
Publié: (2026)
par: Walsh, Cole, et autres
Publié: (2026)
Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical Evidence
par: Mo, Kaijie, et autres
Publié: (2026)
par: Mo, Kaijie, et autres
Publié: (2026)
Documents similaires
-
TempPerturb-Eval: On the Joint Effects of Internal Temperature and External Perturbations in RAG Robustness
par: Zhou, Yongxin, et autres
Publié: (2025) -
What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search
par: Zhang, Xinhao, et autres
Publié: (2026) -
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
par: Méloux, Maxime, et autres
Publié: (2025) -
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
par: Bhatia, Gagan, et autres
Publié: (2026) -
Date Fragments: A Hidden Bottleneck of Tokenization for Temporal Reasoning
par: Bhatia, Gagan, et autres
Publié: (2025)