MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Yubo, Zang, Yuhang, Chen, Liangyu, Chen, Meiqi, Jiao, Yizhu, Li, Xinze, Lu, Xinyuan, Liu, Ziyu, Ma, Yan, Dong, Xiaoyi, Zhang, Pan, Pan, Liangming, Jiang, Yu-Gang, Wang, Jiaqi, Cao, Yixin, Sun, Aixin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Verifiable Generation: A Benchmark for Knowledge-aware Language Model Attribution
par: Li, Xinze, et autres
Publié: (2023)
par: Li, Xinze, et autres
Publié: (2023)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
par: Wang, Zhaowei, et autres
Publié: (2025)
par: Wang, Zhaowei, et autres
Publié: (2025)
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
par: Li, Xinze, et autres
Publié: (2026)
par: Li, Xinze, et autres
Publié: (2026)
Long Context vs. RAG for LLMs: An Evaluation and Revisits
par: Li, Xinze, et autres
Publié: (2024)
par: Li, Xinze, et autres
Publié: (2024)
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
par: Li, Xinze, et autres
Publié: (2026)
par: Li, Xinze, et autres
Publié: (2026)
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
par: Ma, Yubo, et autres
Publié: (2025)
par: Ma, Yubo, et autres
Publié: (2025)
TART: An Open-Source Tool-Augmented Framework for Explainable Table-based Reasoning
par: Lu, Xinyuan, et autres
Publié: (2024)
par: Lu, Xinyuan, et autres
Publié: (2024)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
par: Ma, Yubo, et autres
Publié: (2024)
par: Ma, Yubo, et autres
Publié: (2024)
Large Language Model Is Not a Good Few-shot Information Extractor, but a Good Reranker for Hard Samples!
par: Ma, Yubo, et autres
Publié: (2023)
par: Ma, Yubo, et autres
Publié: (2023)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
par: Zhang, Beichen, et autres
Publié: (2024)
par: Zhang, Beichen, et autres
Publié: (2024)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
par: Wang, Zehao, et autres
Publié: (2024)
par: Wang, Zehao, et autres
Publié: (2024)
Unified Scene Representation and Reconstruction for 3D Large Language Models
par: Chu, Tao, et autres
Publié: (2024)
par: Chu, Tao, et autres
Publié: (2024)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
par: Sun, Zeyi, et autres
Publié: (2025)
par: Sun, Zeyi, et autres
Publié: (2025)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
par: Qian, Rui, et autres
Publié: (2025)
par: Qian, Rui, et autres
Publié: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Streaming Long Video Understanding with Large Language Models
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
par: Li, Jinsong, et autres
Publié: (2025)
par: Li, Jinsong, et autres
Publié: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
par: Chen, Jianhui, et autres
Publié: (2026)
par: Chen, Jianhui, et autres
Publié: (2026)
AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
par: Zhou, Keyan, et autres
Publié: (2025)
par: Zhou, Keyan, et autres
Publié: (2025)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
par: Li, Jinsong, et autres
Publié: (2026)
par: Li, Jinsong, et autres
Publié: (2026)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
par: Ding, Shuangrui, et autres
Publié: (2024)
par: Ding, Shuangrui, et autres
Publié: (2024)
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
par: Bu, Jiazi, et autres
Publié: (2024)
par: Bu, Jiazi, et autres
Publié: (2024)
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
par: Cao, Yuhang, et autres
Publié: (2024)
par: Cao, Yuhang, et autres
Publié: (2024)
MotionClone: Training-Free Motion Cloning for Controllable Video Generation
par: Ling, Pengyang, et autres
Publié: (2024)
par: Ling, Pengyang, et autres
Publié: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
Visual Agentic Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024)
par: Xing, Long, et autres
Publié: (2024)
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
par: Bu, Jiazi, et autres
Publié: (2025)
par: Bu, Jiazi, et autres
Publié: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models
par: Pan, Liangming, et autres
Publié: (2026)
par: Pan, Liangming, et autres
Publié: (2026)
Documents similaires
-
Towards Verifiable Generation: A Benchmark for Knowledge-aware Language Model Attribution
par: Li, Xinze, et autres
Publié: (2023) -
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
par: Wang, Zhaowei, et autres
Publié: (2025) -
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
par: Li, Xinze, et autres
Publié: (2026) -
Long Context vs. RAG for LLMs: An Evaluation and Revisits
par: Li, Xinze, et autres
Publié: (2024) -
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
par: Li, Xinze, et autres
Publié: (2026)