LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Ziyang, Wu, Xing, Jia, Junlong, Gao, Chaochen, Fu, Qi, Zhang, Debing, Hu, Songlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
di: Jia, Junlong, et al.
Pubblicazione: (2025)
di: Jia, Junlong, et al.
Pubblicazione: (2025)
NExtLong: Toward Effective Long-Context Training without Long Documents
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
di: Bai, Yushi, et al.
Pubblicazione: (2023)
di: Bai, Yushi, et al.
Pubblicazione: (2023)
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
di: Jia, Junlong, et al.
Pubblicazione: (2025)
di: Jia, Junlong, et al.
Pubblicazione: (2025)
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
di: Gao, Chaochen, et al.
Pubblicazione: (2024)
di: Gao, Chaochen, et al.
Pubblicazione: (2024)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
di: Yang, Wang, et al.
Pubblicazione: (2025)
di: Yang, Wang, et al.
Pubblicazione: (2025)
PolicyLong: Towards On-Policy Context Extension
di: Jia, Junlong, et al.
Pubblicazione: (2026)
di: Jia, Junlong, et al.
Pubblicazione: (2026)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
di: Bai, Yushi, et al.
Pubblicazione: (2024)
di: Bai, Yushi, et al.
Pubblicazione: (2024)
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
di: Chen, Xueyao, et al.
Pubblicazione: (2026)
di: Chen, Xueyao, et al.
Pubblicazione: (2026)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
di: Wu, Yuhao, et al.
Pubblicazione: (2024)
di: Wu, Yuhao, et al.
Pubblicazione: (2024)
ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contexts
di: Noh, Dongwon, et al.
Pubblicazione: (2025)
di: Noh, Dongwon, et al.
Pubblicazione: (2025)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
di: Shen, Yiting, et al.
Pubblicazione: (2026)
di: Shen, Yiting, et al.
Pubblicazione: (2026)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
di: Xu, Weikai, et al.
Pubblicazione: (2025)
di: Xu, Weikai, et al.
Pubblicazione: (2025)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
di: Jubair, Sheikh, et al.
Pubblicazione: (2025)
di: Jubair, Sheikh, et al.
Pubblicazione: (2025)
FeatBench: Towards More Realistic Evaluation of Feature-level Code Generation
di: Chen, Haorui, et al.
Pubblicazione: (2025)
di: Chen, Haorui, et al.
Pubblicazione: (2025)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
di: Yu, Huimu, et al.
Pubblicazione: (2024)
di: Yu, Huimu, et al.
Pubblicazione: (2024)
MileBench: Benchmarking MLLMs in Long Context
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
di: Fang, Shicheng, et al.
Pubblicazione: (2026)
di: Fang, Shicheng, et al.
Pubblicazione: (2026)
LongGenBench: Long-context Generation Benchmark
di: Liu, Xiang, et al.
Pubblicazione: (2024)
di: Liu, Xiang, et al.
Pubblicazione: (2024)
WildLong: Synthesizing Realistic Long-Context Instruction Data at Scale
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
di: Sun, Siqi, et al.
Pubblicazione: (2026)
di: Sun, Siqi, et al.
Pubblicazione: (2026)
SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels
di: Du, Guancheng, et al.
Pubblicazione: (2025)
di: Du, Guancheng, et al.
Pubblicazione: (2025)
$\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens
di: Zhang, Xinrong, et al.
Pubblicazione: (2024)
di: Zhang, Xinrong, et al.
Pubblicazione: (2024)
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
di: Ni, Xuanfan, et al.
Pubblicazione: (2024)
di: Ni, Xuanfan, et al.
Pubblicazione: (2024)
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
di: Ye, Xi, et al.
Pubblicazione: (2025)
di: Ye, Xi, et al.
Pubblicazione: (2025)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
di: Wu, Xixi, et al.
Pubblicazione: (2026)
di: Wu, Xixi, et al.
Pubblicazione: (2026)
LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams
di: Wu, Yongxuan, et al.
Pubblicazione: (2025)
di: Wu, Yongxuan, et al.
Pubblicazione: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
di: Gu, Jia-Chen, et al.
Pubblicazione: (2025)
di: Gu, Jia-Chen, et al.
Pubblicazione: (2025)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
di: Wu, Xiaojun, et al.
Pubblicazione: (2024)
di: Wu, Xiaojun, et al.
Pubblicazione: (2024)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
di: Ling, Zhan, et al.
Pubblicazione: (2025)
di: Ling, Zhan, et al.
Pubblicazione: (2025)
Sell More, Play Less: Benchmarking LLM Realistic Selling Skill
di: Su, Xuanbo, et al.
Pubblicazione: (2026)
di: Su, Xuanbo, et al.
Pubblicazione: (2026)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
di: Tian, Junfeng, et al.
Pubblicazione: (2024)
di: Tian, Junfeng, et al.
Pubblicazione: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
ELITR-Bench: A Meeting Assistant Benchmark for Long-Context Language Models
di: Thonet, Thibaut, et al.
Pubblicazione: (2024)
di: Thonet, Thibaut, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
di: Jia, Junlong, et al.
Pubblicazione: (2025) -
NExtLong: Toward Effective Long-Context Training without Long Documents
di: Gao, Chaochen, et al.
Pubblicazione: (2025) -
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
di: Bai, Yushi, et al.
Pubblicazione: (2023) -
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
di: Gao, Chaochen, et al.
Pubblicazione: (2025) -
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
di: Jia, Junlong, et al.
Pubblicazione: (2025)