LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | yunhan, Li, gengshen, Wu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bilingual Text-to-Motion Generation: A New Benchmark and Baselines
par: Weng, Wanjiang, et autres
Publié: (2026)
par: Weng, Wanjiang, et autres
Publié: (2026)
Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024)
par: Li, Xuchen, et autres
Publié: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)
par: Cheng, Zhili, et autres
Publié: (2025)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
Empowering Prior to Court Legal Analysis: A Transparent and Accessible Dataset for Defensive Statement Classification and Interpretation
par: Spyridis, Yannis, et autres
Publié: (2024)
par: Spyridis, Yannis, et autres
Publié: (2024)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
par: Luo, Yuxuan, et autres
Publié: (2025)
par: Luo, Yuxuan, et autres
Publié: (2025)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
par: Westermann, Hannes, et autres
Publié: (2024)
par: Westermann, Hannes, et autres
Publié: (2024)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
par: Wang, Junyang, et autres
Publié: (2023)
par: Wang, Junyang, et autres
Publié: (2023)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
par: Gao, Xin, et autres
Publié: (2026)
par: Gao, Xin, et autres
Publié: (2026)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
par: Zhou, Shijie, et autres
Publié: (2024)
par: Zhou, Shijie, et autres
Publié: (2024)
Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation
par: Pennec, Galann, et autres
Publié: (2025)
par: Pennec, Galann, et autres
Publié: (2025)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
par: Huang, Han, et autres
Publié: (2024)
par: Huang, Han, et autres
Publié: (2024)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
par: Zhou, Ziwei, et autres
Publié: (2026)
par: Zhou, Ziwei, et autres
Publié: (2026)
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment
par: Agnolucci, Lorenzo, et autres
Publié: (2024)
par: Agnolucci, Lorenzo, et autres
Publié: (2024)
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
par: Cheng, Ming, et autres
Publié: (2025)
par: Cheng, Ming, et autres
Publié: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
par: Xie, Yuxuan, et autres
Publié: (2024)
par: Xie, Yuxuan, et autres
Publié: (2024)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)
par: He, Zheqi, et autres
Publié: (2025)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
par: Zhao, Yi, et autres
Publié: (2026)
par: Zhao, Yi, et autres
Publié: (2026)
UEval: A Benchmark for Unified Multimodal Generation
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
OSCBench: Benchmarking Object State Change in Text-to-Video Generation
par: Han, Xianjing, et autres
Publié: (2026)
par: Han, Xianjing, et autres
Publié: (2026)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
par: Liu, Xuannan, et autres
Publié: (2025)
par: Liu, Xuannan, et autres
Publié: (2025)
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
par: Tu, Rong-Cheng, et autres
Publié: (2024)
par: Tu, Rong-Cheng, et autres
Publié: (2024)
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
par: Zheng, Mingzhe, et autres
Publié: (2025)
par: Zheng, Mingzhe, et autres
Publié: (2025)
Optimizing Prompts for Text-to-Image Generation
par: Hao, Yaru, et autres
Publié: (2022)
par: Hao, Yaru, et autres
Publié: (2022)
Benchmarking and Learning Multi-Dimensional Quality Evaluator for Text-to-3D Generation
par: Zhang, Yujie, et autres
Publié: (2024)
par: Zhang, Yujie, et autres
Publié: (2024)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
Documents similaires
-
Bilingual Text-to-Motion Generation: A New Benchmark and Baselines
par: Weng, Wanjiang, et autres
Publié: (2026) -
Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
par: Zhang, Zicheng, et autres
Publié: (2025) -
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
par: Li, Xuchen, et autres
Publié: (2024) -
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024) -
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)