MuLD: The Multitask Long Document Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Hudson, G Thomas, Moubayed, Noura Al |
|---|---|
| Format: | Preprint |
| Published: |
2022
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Early Detection and Reduction of Memorisation for Domain Adaptation and Instruction Tuning
by: Slack, Dean L., et al.
Published: (2025)
by: Slack, Dean L., et al.
Published: (2025)
RAR-b: Reasoning as Retrieval Benchmark
by: Xiao, Chenghao, et al.
Published: (2024)
by: Xiao, Chenghao, et al.
Published: (2024)
LLMs for LLMs: A Structured Prompting Methodology for Long Legal Documents
by: Klem, Strahinja, et al.
Published: (2025)
by: Klem, Strahinja, et al.
Published: (2025)
Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification
by: Wang, Yang, et al.
Published: (2023)
by: Wang, Yang, et al.
Published: (2023)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
by: Hijazi, Faris, et al.
Published: (2024)
by: Hijazi, Faris, et al.
Published: (2024)
CreoleVal: Multilingual Multitask Benchmarks for Creoles
by: Lent, Heather, et al.
Published: (2023)
by: Lent, Heather, et al.
Published: (2023)
Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA
by: Li, Zhanli, et al.
Published: (2026)
by: Li, Zhanli, et al.
Published: (2026)
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
by: Cui, Hao, et al.
Published: (2025)
by: Cui, Hao, et al.
Published: (2025)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
by: Bai, Yushi, et al.
Published: (2024)
by: Bai, Yushi, et al.
Published: (2024)
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
by: Park, Chanwoo, et al.
Published: (2025)
by: Park, Chanwoo, et al.
Published: (2025)
LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
by: Deng, Chao, et al.
Published: (2024)
by: Deng, Chao, et al.
Published: (2024)
A Benchmark for Long-Form Medical Question Answering
by: Hosseini, Pedram, et al.
Published: (2024)
by: Hosseini, Pedram, et al.
Published: (2024)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
by: Wang, Minzheng, et al.
Published: (2024)
by: Wang, Minzheng, et al.
Published: (2024)
BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism
by: Fajcik, Martin, et al.
Published: (2024)
by: Fajcik, Martin, et al.
Published: (2024)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
by: Jubair, Sheikh, et al.
Published: (2025)
by: Jubair, Sheikh, et al.
Published: (2025)
ROUTE: Robust Multitask Tuning and Collaboration for Text-to-SQL
by: Qin, Yang, et al.
Published: (2024)
by: Qin, Yang, et al.
Published: (2024)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
by: Jan, Essa, et al.
Published: (2024)
by: Jan, Essa, et al.
Published: (2024)
Everything is a Video: Unifying Modalities through Next-Frame Prediction
by: Hudson, G. Thomas, et al.
Published: (2024)
by: Hudson, G. Thomas, et al.
Published: (2024)
Breaking Down Financial News Impact: A Novel AI Approach with Geometric Hypergraphs
by: Harit, Anoushka, et al.
Published: (2024)
by: Harit, Anoushka, et al.
Published: (2024)
MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning
by: Dutta, Aritra, et al.
Published: (2026)
by: Dutta, Aritra, et al.
Published: (2026)
LongGenBench: Long-context Generation Benchmark
by: Liu, Xiang, et al.
Published: (2024)
by: Liu, Xiang, et al.
Published: (2024)
Mitigating Clickbait: An Approach to Spoiler Generation Using Multitask Learning
by: Pal, Sayantan, et al.
Published: (2024)
by: Pal, Sayantan, et al.
Published: (2024)
Efficient Compression of Multitask Multilingual Speech Models
by: Ferraz, Thomas Palmeira
Published: (2024)
by: Ferraz, Thomas Palmeira
Published: (2024)
Automatic Summarization of Long Documents
by: Chhibbar, Naman, et al.
Published: (2024)
by: Chhibbar, Naman, et al.
Published: (2024)
The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic
by: Al-Khalifa, Shahad, et al.
Published: (2024)
by: Al-Khalifa, Shahad, et al.
Published: (2024)
MuTSE: A Human-in-the-Loop Multi-use Text Simplification Evaluator
by: Roscan, Rares-Alexandru, et al.
Published: (2026)
by: Roscan, Rares-Alexandru, et al.
Published: (2026)
MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost
by: Xing, Sen, et al.
Published: (2024)
by: Xing, Sen, et al.
Published: (2024)
CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation
by: Yan, Weixiang, et al.
Published: (2023)
by: Yan, Weixiang, et al.
Published: (2023)
NExtLong: Toward Effective Long-Context Training without Long Documents
by: Gao, Chaochen, et al.
Published: (2025)
by: Gao, Chaochen, et al.
Published: (2025)
Mixture-of-LoRAs: An Efficient Multitask Tuning for Large Language Models
by: Feng, Wenfeng, et al.
Published: (2024)
by: Feng, Wenfeng, et al.
Published: (2024)
Long Input Benchmark for Russian Analysis
by: Churin, Igor, et al.
Published: (2024)
by: Churin, Igor, et al.
Published: (2024)
LD-MoLE: Learnable Dynamic Routing for Mixture of LoRA Experts
by: Zhuang, Yuan, et al.
Published: (2025)
by: Zhuang, Yuan, et al.
Published: (2025)
MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations
by: Scott, Aaron, et al.
Published: (2025)
by: Scott, Aaron, et al.
Published: (2025)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
by: Han, Wenhan, et al.
Published: (2025)
by: Han, Wenhan, et al.
Published: (2025)
MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
by: Huang, Hui, et al.
Published: (2025)
by: Huang, Hui, et al.
Published: (2025)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
by: Ding, Jiayu, et al.
Published: (2025)
by: Ding, Jiayu, et al.
Published: (2025)
BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation
by: Li, Minchong, et al.
Published: (2024)
by: Li, Minchong, et al.
Published: (2024)
MuSeD: A Multimodal Spanish Dataset for Sexism Detection in Social Media Videos
by: De Grazia, Laura, et al.
Published: (2025)
by: De Grazia, Laura, et al.
Published: (2025)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
by: Dong, Kuicai, et al.
Published: (2025)
by: Dong, Kuicai, et al.
Published: (2025)
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
by: Geng, Saibo, et al.
Published: (2025)
by: Geng, Saibo, et al.
Published: (2025)
Similar Items
-
Early Detection and Reduction of Memorisation for Domain Adaptation and Instruction Tuning
by: Slack, Dean L., et al.
Published: (2025) -
RAR-b: Reasoning as Retrieval Benchmark
by: Xiao, Chenghao, et al.
Published: (2024) -
LLMs for LLMs: A Structured Prompting Methodology for Long Legal Documents
by: Klem, Strahinja, et al.
Published: (2025) -
Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification
by: Wang, Yang, et al.
Published: (2023) -
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
by: Hijazi, Faris, et al.
Published: (2024)