ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Zichun, Shi, Yuling, Zeng, Wenhao, Hu, Chao, Lin, Haotian, Zhuo, Terry Yue, Chen, Jiawei, Gu, Xiaodong, Ma, Wenping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
di: Chen, Yeheng, et al.
Pubblicazione: (2026)
di: Chen, Yeheng, et al.
Pubblicazione: (2026)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
di: Xu, Zelin, et al.
Pubblicazione: (2026)
di: Xu, Zelin, et al.
Pubblicazione: (2026)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
Robust Preference Alignment via Directional Neighborhood Consensus
di: Mao, Ruochen, et al.
Pubblicazione: (2025)
di: Mao, Ruochen, et al.
Pubblicazione: (2025)
Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
di: Leng, Jixuan, et al.
Pubblicazione: (2025)
di: Leng, Jixuan, et al.
Pubblicazione: (2025)
DARL: Encouraging Diverse Answers for General Reasoning without Verifiers
di: Huang, Chongxuan, et al.
Pubblicazione: (2026)
di: Huang, Chongxuan, et al.
Pubblicazione: (2026)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
di: Deng, Wenhao, et al.
Pubblicazione: (2025)
di: Deng, Wenhao, et al.
Pubblicazione: (2025)
AttentionRAG: Attention-Guided Context Pruning in Retrieval-Augmented Generation
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
Analyzing the Mechanism of Attention Collapse in VGGT from a Dynamics Perspective
di: Li, Huan, et al.
Pubblicazione: (2025)
di: Li, Huan, et al.
Pubblicazione: (2025)
Between Lines of Code: Unraveling the Distinct Patterns of Machine and Human Programmers
di: Shi, Yuling, et al.
Pubblicazione: (2024)
di: Shi, Yuling, et al.
Pubblicazione: (2024)
HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?
di: Peng, Weihan, et al.
Pubblicazione: (2026)
di: Peng, Weihan, et al.
Pubblicazione: (2026)
ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans
di: Sadana, Ananya, et al.
Pubblicazione: (2025)
di: Sadana, Ananya, et al.
Pubblicazione: (2025)
ICE-Score: Instructing Large Language Models to Evaluate Code
di: Zhuo, Terry Yue
Pubblicazione: (2023)
di: Zhuo, Terry Yue
Pubblicazione: (2023)
Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering
di: Shi, Yuling, et al.
Pubblicazione: (2026)
di: Shi, Yuling, et al.
Pubblicazione: (2026)
LLM-KG-Bench 3.0: A Compass for SemanticTechnology Capabilities in the Ocean of LLMs
di: Meyer, Lars-Peter, et al.
Pubblicazione: (2025)
di: Meyer, Lars-Peter, et al.
Pubblicazione: (2025)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
di: Guo, Jiajie, et al.
Pubblicazione: (2025)
di: Guo, Jiajie, et al.
Pubblicazione: (2025)
In Line with Context: Repository-Level Code Generation via Context Inlining
di: Hu, Chao, et al.
Pubblicazione: (2026)
di: Hu, Chao, et al.
Pubblicazione: (2026)
LongCodeZip: Compress Long Context for Code Language Models
di: Shi, Yuling, et al.
Pubblicazione: (2025)
di: Shi, Yuling, et al.
Pubblicazione: (2025)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
di: Liu, Runze, et al.
Pubblicazione: (2025)
di: Liu, Runze, et al.
Pubblicazione: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Tracking the Limits of Knowledge Propagation: How LLMs Fail at Multi-Step Reasoning with Conflicting Knowledge
di: Feng, Yiyang, et al.
Pubblicazione: (2026)
di: Feng, Yiyang, et al.
Pubblicazione: (2026)
Digital Socrates: Evaluating LLMs through Explanation Critiques
di: Gu, Yuling, et al.
Pubblicazione: (2023)
di: Gu, Yuling, et al.
Pubblicazione: (2023)
Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal
di: Zeng, Wenhao, et al.
Pubblicazione: (2025)
di: Zeng, Wenhao, et al.
Pubblicazione: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
Semantic Human Mesh Reconstruction with Textures
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2024)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2024)
Hidden in Plain Sight: Evaluation of the Deception Detection Capabilities of LLMs in Multimodal Settings
di: Miah, Md Messal Monem, et al.
Pubblicazione: (2025)
di: Miah, Md Messal Monem, et al.
Pubblicazione: (2025)
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons Alignment
di: Huang, Chongxuan, et al.
Pubblicazione: (2025)
di: Huang, Chongxuan, et al.
Pubblicazione: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
How Difficulty-Aware Staged Reinforcement Learning Enhances LLMs' Reasoning Capabilities: A Preliminary Experimental Study
di: Ji, Yunjie, et al.
Pubblicazione: (2025)
di: Ji, Yunjie, et al.
Pubblicazione: (2025)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
di: Pournemat, Mobina, et al.
Pubblicazione: (2025)
di: Pournemat, Mobina, et al.
Pubblicazione: (2025)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
di: Zhao, Wenlong, et al.
Pubblicazione: (2024)
di: Zhao, Wenlong, et al.
Pubblicazione: (2024)
Are Your LLMs Capable of Stable Reasoning?
di: Liu, Junnan, et al.
Pubblicazione: (2024)
di: Liu, Junnan, et al.
Pubblicazione: (2024)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems
di: Lin, Jingru, et al.
Pubblicazione: (2025)
di: Lin, Jingru, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025) -
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025) -
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
di: Chen, Yeheng, et al.
Pubblicazione: (2026) -
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
di: Xu, Zelin, et al.
Pubblicazione: (2026) -
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)