LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Yuhao, Hee, Ming Shan, Hu, Zhiqing, Lee, Roy Ka-Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LongGenBench: Long-context Generation Benchmark
por: Liu, Xiang, et al.
Publicado: (2024)
por: Liu, Xiang, et al.
Publicado: (2024)
Shifting Long-Context LLMs Research from Input to Output
por: Wu, Yuhao, et al.
Publicado: (2025)
por: Wu, Yuhao, et al.
Publicado: (2025)
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
por: Wu, Yuhao, et al.
Publicado: (2025)
por: Wu, Yuhao, et al.
Publicado: (2025)
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
por: Wu, Yuhao, et al.
Publicado: (2025)
por: Wu, Yuhao, et al.
Publicado: (2025)
Lost in Stories: Consistency Bugs in Long Story Generation by LLMs
por: Li, Junjie, et al.
Publicado: (2026)
por: Li, Junjie, et al.
Publicado: (2026)
Bridging Modalities: Enhancing Cross-Modality Hate Speech Detection with Few-Shot In-Context Learning
por: Hee, Ming Shan, et al.
Publicado: (2024)
por: Hee, Ming Shan, et al.
Publicado: (2024)
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
por: Bai, Yushi, et al.
Publicado: (2023)
por: Bai, Yushi, et al.
Publicado: (2023)
Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages
por: Hu, Yujia, et al.
Publicado: (2025)
por: Hu, Yujia, et al.
Publicado: (2025)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
por: Chen, Ziyang, et al.
Publicado: (2026)
por: Chen, Ziyang, et al.
Publicado: (2026)
Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions
por: Hee, Ming Shan, et al.
Publicado: (2025)
por: Hee, Ming Shan, et al.
Publicado: (2025)
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
por: Huang, Zhongzhan, et al.
Publicado: (2025)
por: Huang, Zhongzhan, et al.
Publicado: (2025)
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
por: Ni, Xuanfan, et al.
Publicado: (2024)
por: Ni, Xuanfan, et al.
Publicado: (2024)
LCFO: Long Context and Long Form Output Dataset and Benchmarking
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
por: Costa-jussà, Marta R., et al.
Publicado: (2024)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
por: Fang, Shicheng, et al.
Publicado: (2026)
por: Fang, Shicheng, et al.
Publicado: (2026)
ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists
por: Ruan, Jie, et al.
Publicado: (2025)
por: Ruan, Jie, et al.
Publicado: (2025)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall
por: Qi, Zehan, et al.
Publicado: (2024)
por: Qi, Zehan, et al.
Publicado: (2024)
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
por: Ye, Xi, et al.
Publicado: (2025)
por: Ye, Xi, et al.
Publicado: (2025)
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
por: Wang, Lei, et al.
Publicado: (2024)
por: Wang, Lei, et al.
Publicado: (2024)
ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
por: Sun, Siqi, et al.
Publicado: (2026)
por: Sun, Siqi, et al.
Publicado: (2026)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
por: Xiao, Zikai, et al.
Publicado: (2025)
por: Xiao, Zikai, et al.
Publicado: (2025)
Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
Atomic Calibration of LLMs in Long-Form Generations
por: Zhang, Caiqi, et al.
Publicado: (2024)
por: Zhang, Caiqi, et al.
Publicado: (2024)
UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation
por: Yang, Ruihan, et al.
Publicado: (2025)
por: Yang, Ruihan, et al.
Publicado: (2025)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
por: Choi, Nayoung, et al.
Publicado: (2026)
por: Choi, Nayoung, et al.
Publicado: (2026)
Long-Context Long-Form Question Answering for Legal Domain
por: Kulkarni, Anagha, et al.
Publicado: (2026)
por: Kulkarni, Anagha, et al.
Publicado: (2026)
Document Reconstruction Unlocks Scalable Long-Context RLVR
por: Xiao, Yao, et al.
Publicado: (2026)
por: Xiao, Yao, et al.
Publicado: (2026)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
por: Zhang, Hanning, et al.
Publicado: (2025)
por: Zhang, Hanning, et al.
Publicado: (2025)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
por: Chen, Junhao, et al.
Publicado: (2025)
por: Chen, Junhao, et al.
Publicado: (2025)
On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility
por: He, Zhitao, et al.
Publicado: (2026)
por: He, Zhitao, et al.
Publicado: (2026)
Are Long-LLMs A Necessity For Long-Context Tasks?
por: Qian, Hongjin, et al.
Publicado: (2024)
por: Qian, Hongjin, et al.
Publicado: (2024)
LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams
por: Wu, Yongxuan, et al.
Publicado: (2025)
por: Wu, Yongxuan, et al.
Publicado: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
por: Ling, Zhan, et al.
Publicado: (2025)
por: Ling, Zhan, et al.
Publicado: (2025)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
por: Wu, Haoning, et al.
Publicado: (2024)
por: Wu, Haoning, et al.
Publicado: (2024)
NExtLong: Toward Effective Long-Context Training without Long Documents
por: Gao, Chaochen, et al.
Publicado: (2025)
por: Gao, Chaochen, et al.
Publicado: (2025)
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
por: Liu, Xiaoran, et al.
Publicado: (2025)
por: Liu, Xiaoran, et al.
Publicado: (2025)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
por: Wang, Zhaowei, et al.
Publicado: (2025)
por: Wang, Zhaowei, et al.
Publicado: (2025)
LongRecipe: Recipe for Efficient Long Context Generalization in Large Language Models
por: Hu, Zhiyuan, et al.
Publicado: (2024)
por: Hu, Zhiyuan, et al.
Publicado: (2024)
Ejemplares similares
-
LongGenBench: Long-context Generation Benchmark
por: Liu, Xiang, et al.
Publicado: (2024) -
Shifting Long-Context LLMs Research from Input to Output
por: Wu, Yuhao, et al.
Publicado: (2025) -
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
por: Wu, Yuhao, et al.
Publicado: (2025) -
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
por: Wu, Yuhao, et al.
Publicado: (2025) -
Lost in Stories: Consistency Bugs in Long Story Generation by LLMs
por: Li, Junjie, et al.
Publicado: (2026)