Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dou, Yao, Xu, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating LLMs on Chinese Idiom Translation
par: Yang, Cai, et autres
Publié: (2025)
par: Yang, Cai, et autres
Publié: (2025)
Are Long-LLMs A Necessity For Long-Context Tasks?
par: Qian, Hongjin, et autres
Publié: (2024)
par: Qian, Hongjin, et autres
Publié: (2024)
Finding Blind Spots in Evaluator LLMs with Interpretable Checklists
par: Doddapaneni, Sumanth, et autres
Publié: (2024)
par: Doddapaneni, Sumanth, et autres
Publié: (2024)
Context-Aware Hierarchical Merging for Long Document Summarization
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
Enabling Discriminative Reasoning in LLMs for Legal Judgment Prediction
par: Deng, Chenlong, et autres
Publié: (2024)
par: Deng, Chenlong, et autres
Publié: (2024)
Policies and Evaluation for Online Meeting Summarization
par: Schneider, Felix, et autres
Publié: (2025)
par: Schneider, Felix, et autres
Publié: (2025)
Agent-as-Judge for Factual Summarization of Long Narratives
par: Jeong, Yeonseok, et autres
Publié: (2025)
par: Jeong, Yeonseok, et autres
Publié: (2025)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
par: Jin, Bowen, et autres
Publié: (2024)
par: Jin, Bowen, et autres
Publié: (2024)
Long Context vs. RAG for LLMs: An Evaluation and Revisits
par: Li, Xinze, et autres
Publié: (2024)
par: Li, Xinze, et autres
Publié: (2024)
LegalAgentBench: Evaluating LLM Agents in Legal Domain
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novels
par: Wei, Lingxiao, et autres
Publié: (2024)
par: Wei, Lingxiao, et autres
Publié: (2024)
Evaluating LLMs' Assessment of Mixed-Context Hallucination Through the Lens of Summarization
par: Qi, Siya, et autres
Publié: (2025)
par: Qi, Siya, et autres
Publié: (2025)
Multi-Dimensional Evaluation of Text Summarization with In-Context Learning
par: Jain, Sameer, et autres
Publié: (2023)
par: Jain, Sameer, et autres
Publié: (2023)
Action-Item-Driven Summarization of Long Meeting Transcripts
par: Golia, Logan, et autres
Publié: (2023)
par: Golia, Logan, et autres
Publié: (2023)
PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization
par: Pang, Tsz Fung, et autres
Publié: (2025)
par: Pang, Tsz Fung, et autres
Publié: (2025)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
par: Wu, Yuhao, et autres
Publié: (2024)
par: Wu, Yuhao, et autres
Publié: (2024)
CTkvr: KV Cache Retrieval for Long-Context LLMs via Centroid then Token Indexing
par: Lu, Kuan, et autres
Publié: (2025)
par: Lu, Kuan, et autres
Publié: (2025)
Long-Context Long-Form Question Answering for Legal Domain
par: Kulkarni, Anagha, et autres
Publié: (2026)
par: Kulkarni, Anagha, et autres
Publié: (2026)
Joint Enhancement of Relational Reasoning for Long-Context LLMs
par: Chen, Zhirui, et autres
Publié: (2025)
par: Chen, Zhirui, et autres
Publié: (2025)
Systematic Evaluation of Long-Context LLMs on Financial Concepts
par: Gupta, Lavanya, et autres
Publié: (2024)
par: Gupta, Lavanya, et autres
Publié: (2024)
Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall
par: Qi, Zehan, et autres
Publié: (2024)
par: Qi, Zehan, et autres
Publié: (2024)
Unstructured Evidence Attribution for Long Context Query Focused Summarization
par: Wright, Dustin, et autres
Publié: (2025)
par: Wright, Dustin, et autres
Publié: (2025)
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
par: Wu, Xixi, et autres
Publié: (2025)
par: Wu, Xixi, et autres
Publié: (2025)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
par: Jin, Keyan, et autres
Publié: (2025)
par: Jin, Keyan, et autres
Publié: (2025)
CREAM: Comparison-Based Reference-Free ELO-Ranked Automatic Evaluation for Meeting Summarization
par: Gong, Ziwei, et autres
Publié: (2024)
par: Gong, Ziwei, et autres
Publié: (2024)
CCSBench: Evaluating Compositional Controllability in LLMs for Scientific Document Summarization
par: Ding, Yixi, et autres
Publié: (2024)
par: Ding, Yixi, et autres
Publié: (2024)
StrucSum: Graph-Structured Reasoning for Long Document Extractive Summarization with LLMs
par: Yuan, Haohan, et autres
Publié: (2025)
par: Yuan, Haohan, et autres
Publié: (2025)
Automatic Legal Writing Evaluation of LLMs
par: Pires, Ramon, et autres
Publié: (2025)
par: Pires, Ramon, et autres
Publié: (2025)
Evaluation Ethics of LLMs in Legal Domain
par: Zhang, Ruizhe, et autres
Publié: (2024)
par: Zhang, Ruizhe, et autres
Publié: (2024)
A Comprehensive Survey on Legal Summarization: Challenges and Future Directions
par: Akter, Mousumi, et autres
Publié: (2025)
par: Akter, Mousumi, et autres
Publié: (2025)
RELexED: Retrieval-Enhanced Legal Summarization with Exemplar Diversity
par: Santosh, T. Y. S. S., et autres
Publié: (2025)
par: Santosh, T. Y. S. S., et autres
Publié: (2025)
LexAbSumm: Aspect-based Summarization of Legal Decisions
par: Santosh, T. Y. S. S, et autres
Publié: (2024)
par: Santosh, T. Y. S. S, et autres
Publié: (2024)
RocketEval: Efficient Automated LLM Evaluation via Grading Checklist
par: Wei, Tianjun, et autres
Publié: (2025)
par: Wei, Tianjun, et autres
Publié: (2025)
LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data
par: Yang, Cehao, et autres
Publié: (2025)
par: Yang, Cehao, et autres
Publié: (2025)
Retrieval Meets Reasoning: Dynamic In-Context Editing for Long-Text Understanding
par: Fei, Weizhi, et autres
Publié: (2024)
par: Fei, Weizhi, et autres
Publié: (2024)
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
par: Zhong, Meizhi, et autres
Publié: (2024)
par: Zhong, Meizhi, et autres
Publié: (2024)
Mixture of In-Context Experts Enhance LLMs' Long Context Awareness
par: Lin, Hongzhan, et autres
Publié: (2024)
par: Lin, Hongzhan, et autres
Publié: (2024)
TO-GATE: Clarifying Questions and Summarizing Responses with Trajectory Optimization for Eliciting Human Preference
par: Dou, Yulin, et autres
Publié: (2025)
par: Dou, Yulin, et autres
Publié: (2025)
Korean Canonical Legal Benchmark: Toward Knowledge-Independent Evaluation of LLMs' Legal Reasoning Capabilities
par: Oh, Hongseok, et autres
Publié: (2025)
par: Oh, Hongseok, et autres
Publié: (2025)
UIO-LLMs: Unbiased Incremental Optimization for Long-Context LLMs
par: Li, Wenhao, et autres
Publié: (2024)
par: Li, Wenhao, et autres
Publié: (2024)
Documents similaires
-
Evaluating LLMs on Chinese Idiom Translation
par: Yang, Cai, et autres
Publié: (2025) -
Are Long-LLMs A Necessity For Long-Context Tasks?
par: Qian, Hongjin, et autres
Publié: (2024) -
Finding Blind Spots in Evaluator LLMs with Interpretable Checklists
par: Doddapaneni, Sumanth, et autres
Publié: (2024) -
Context-Aware Hierarchical Merging for Long Document Summarization
par: Ou, Litu, et autres
Publié: (2025) -
Enabling Discriminative Reasoning in LLMs for Legal Judgment Prediction
par: Deng, Chenlong, et autres
Publié: (2024)