OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Seunghee, Bang, Ingyu, Jang, Seokgyu, Kim, Changhyeon, Bae, Sanghwan, Choi, Jihun, Xuan, Richeng, Kim, Taeuk |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning
by: Kim, Seunghee, et al.
Published: (2024)
by: Kim, Seunghee, et al.
Published: (2024)
OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models
by: Kim, Seunghee, et al.
Published: (2026)
by: Kim, Seunghee, et al.
Published: (2026)
Superficial Success vs. Internal Breakdown: An Empirical Study of Generalization in Adaptive Multi-Agent Systems
by: So, Namyoung, et al.
Published: (2026)
by: So, Namyoung, et al.
Published: (2026)
Memorization or Reasoning? Exploring the Idiom Understanding of LLMs
by: Kim, Jisu, et al.
Published: (2025)
by: Kim, Jisu, et al.
Published: (2025)
MAGIC: A Multi-Hop and Graph-Based Benchmark for Inter-Context Conflicts in Retrieval-Augmented Generation
by: Lee, Jungyeon, et al.
Published: (2025)
by: Lee, Jungyeon, et al.
Published: (2025)
Hyper-CL: Conditioning Sentence Representations with Hypernetworks
by: Yoo, Young Hyun, et al.
Published: (2024)
by: Yoo, Young Hyun, et al.
Published: (2024)
Analysis of Multi-Source Language Training in Cross-Lingual Transfer
by: Lim, Seong Hoon, et al.
Published: (2024)
by: Lim, Seong Hoon, et al.
Published: (2024)
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
by: Kim, Yunsoo, et al.
Published: (2025)
by: Kim, Yunsoo, et al.
Published: (2025)
Revealing User Familiarity Bias in Task-Oriented Dialogue via Interactive Evaluation
by: Kim, Takyoung, et al.
Published: (2023)
by: Kim, Takyoung, et al.
Published: (2023)
Two-step Automated Cybercrime Coded Word Detection using Multi-level Representation Learning
by: Kim, Yongyeon, et al.
Published: (2024)
by: Kim, Yongyeon, et al.
Published: (2024)
On the Importance of a Multi-Scale Calibration for Quantization
by: Son, Seungwoo, et al.
Published: (2026)
by: Son, Seungwoo, et al.
Published: (2026)
Think Straight, Stop Smart: Structured Reasoning for Efficient Multi-Hop RAG
by: Bang, Jihwan, et al.
Published: (2025)
by: Bang, Jihwan, et al.
Published: (2025)
Latent Preference Modeling for Cross-Session Personalized Tool Calling
by: Yoon, Yejin, et al.
Published: (2026)
by: Yoon, Yejin, et al.
Published: (2026)
BlendX: Complex Multi-Intent Detection with Blended Patterns
by: Yoon, Yejin, et al.
Published: (2024)
by: Yoon, Yejin, et al.
Published: (2024)
RAISE: Enhancing Scientific Reasoning in LLMs via Step-by-Step Retrieval
by: Oh, Minhae, et al.
Published: (2025)
by: Oh, Minhae, et al.
Published: (2025)
Subgraph-Aware Training of Language Models for Knowledge Graph Completion Using Structure-Aware Contrastive Learning
by: Ko, Youmin, et al.
Published: (2024)
by: Ko, Youmin, et al.
Published: (2024)
CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning
by: Sung, Junyoung, et al.
Published: (2026)
by: Sung, Junyoung, et al.
Published: (2026)
Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning
by: Bae, Sanghwan, et al.
Published: (2025)
by: Bae, Sanghwan, et al.
Published: (2025)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
by: Park, Cheonbok, et al.
Published: (2025)
by: Park, Cheonbok, et al.
Published: (2025)
When to Speak, When to Abstain: Contrastive Decoding with Abstention
by: Kim, Hyuhng Joon, et al.
Published: (2024)
by: Kim, Hyuhng Joon, et al.
Published: (2024)
DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections
by: Park, Jiwon, et al.
Published: (2025)
by: Park, Jiwon, et al.
Published: (2025)
STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
by: Lee, Kyumin, et al.
Published: (2025)
by: Lee, Kyumin, et al.
Published: (2025)
Can David Beat Goliath? On Multi-Hop Reasoning with Resource-Constrained Agents
by: Han, Hojae, et al.
Published: (2026)
by: Han, Hojae, et al.
Published: (2026)
Revisiting the Impact of Pursuing Modularity for Code Generation
by: Kang, Deokyeong, et al.
Published: (2024)
by: Kang, Deokyeong, et al.
Published: (2024)
ADVICE: Answer-Dependent Verbalized Confidence Estimation
by: Seo, Ki Jung, et al.
Published: (2025)
by: Seo, Ki Jung, et al.
Published: (2025)
UniKnow: A Unified Framework for Reliable Language Model Behavior across Parametric and External Knowledge
by: Kim, Youna, et al.
Published: (2025)
by: Kim, Youna, et al.
Published: (2025)
KGMEL: Knowledge Graph-Enhanced Multimodal Entity Linking
by: Kim, Juyeon, et al.
Published: (2025)
by: Kim, Juyeon, et al.
Published: (2025)
Pruning and Distilling Mixture-of-Experts into Dense Language Models
by: Kim, Junhyuck, et al.
Published: (2026)
by: Kim, Junhyuck, et al.
Published: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
by: Kim, Sanghwan, et al.
Published: (2024)
by: Kim, Sanghwan, et al.
Published: (2024)
Pedagogy-R1: Pedagogically-Aligned Reasoning Model with Balanced Educational Benchmark
by: Lee, Unggi, et al.
Published: (2025)
by: Lee, Unggi, et al.
Published: (2025)
Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens
by: Koh, Seunghee, et al.
Published: (2026)
by: Koh, Seunghee, et al.
Published: (2026)
CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning
by: He, Zheqi, et al.
Published: (2024)
by: He, Zheqi, et al.
Published: (2024)
M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation
by: Park, Jonggwon, et al.
Published: (2024)
by: Park, Jonggwon, et al.
Published: (2024)
Unleashing Multi-Hop Reasoning Potential in Large Language Models through Repetition of Misordered Context
by: Yu, Sangwon, et al.
Published: (2024)
by: Yu, Sangwon, et al.
Published: (2024)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
by: Lee, Nahyun, et al.
Published: (2026)
by: Lee, Nahyun, et al.
Published: (2026)
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
by: Kim, Sungnyun, et al.
Published: (2024)
by: Kim, Sungnyun, et al.
Published: (2024)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
by: Kim, Mingyeong, et al.
Published: (2026)
by: Kim, Mingyeong, et al.
Published: (2026)
MP2D: An Automated Topic Shift Dialogue Generation Framework Leveraging Knowledge Graphs
by: Hwang, Yerin, et al.
Published: (2024)
by: Hwang, Yerin, et al.
Published: (2024)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
by: Yang, Qize, et al.
Published: (2025)
by: Yang, Qize, et al.
Published: (2025)
MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries
by: Tang, Yixuan, et al.
Published: (2024)
by: Tang, Yixuan, et al.
Published: (2024)
Similar Items
-
FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning
by: Kim, Seunghee, et al.
Published: (2024) -
OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models
by: Kim, Seunghee, et al.
Published: (2026) -
Superficial Success vs. Internal Breakdown: An Empirical Study of Generalization in Adaptive Multi-Agent Systems
by: So, Namyoung, et al.
Published: (2026) -
Memorization or Reasoning? Exploring the Idiom Understanding of LLMs
by: Kim, Jisu, et al.
Published: (2025) -
MAGIC: A Multi-Hop and Graph-Based Benchmark for Inter-Context Conflicts in Retrieval-Augmented Generation
by: Lee, Jungyeon, et al.
Published: (2025)