CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jingyao, Wang, Jingyun, Tan, Molin, Wang, Haochen, Yan, Cilin, Shi, Likun, Cai, Jiayin, Jiang, Xiaolong, Hu, Yao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
USB-Rec: An Effective Framework for Improving Conversational Recommendation Capability of Large Language Model
di: Wen, Jianyu, et al.
Pubblicazione: (2025)
di: Wen, Jianyu, et al.
Pubblicazione: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
VISA: Reasoning Video Object Segmentation via Large Language Models
di: Yan, Cilin, et al.
Pubblicazione: (2024)
di: Yan, Cilin, et al.
Pubblicazione: (2024)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2025)
di: Yan, Cilin, et al.
Pubblicazione: (2025)
Rethinking the Global Knowledge of CLIP in Training-Free Open-Vocabulary Semantic Segmentation
di: Wang, Jingyun, et al.
Pubblicazione: (2025)
di: Wang, Jingyun, et al.
Pubblicazione: (2025)
Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning
di: Yan, Cilin, et al.
Pubblicazione: (2024)
di: Yan, Cilin, et al.
Pubblicazione: (2024)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026)
di: Shi, Yudi, et al.
Pubblicazione: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning
di: Zhu, Nannan, et al.
Pubblicazione: (2025)
di: Zhu, Nannan, et al.
Pubblicazione: (2025)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
di: Hong, Jack, et al.
Pubblicazione: (2025)
di: Hong, Jack, et al.
Pubblicazione: (2025)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
di: Liu, Yikun, et al.
Pubblicazione: (2024)
di: Liu, Yikun, et al.
Pubblicazione: (2024)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
Preference-Aware Rubric Learning for Personalized Evaluation
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2023)
di: Yan, Cilin, et al.
Pubblicazione: (2023)
SciVid: Cross-Domain Evaluation of Video Models in Scientific Applications
di: Hasson, Yana, et al.
Pubblicazione: (2025)
di: Hasson, Yana, et al.
Pubblicazione: (2025)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
di: Qi, Ji, et al.
Pubblicazione: (2023)
di: Qi, Ji, et al.
Pubblicazione: (2023)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
di: Cui, Shaoyang, et al.
Pubblicazione: (2026)
di: Cui, Shaoyang, et al.
Pubblicazione: (2026)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning
di: Yan, Sikuan, et al.
Pubblicazione: (2026)
di: Yan, Sikuan, et al.
Pubblicazione: (2026)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
di: Li, Hongxiang, et al.
Pubblicazione: (2025)
di: Li, Hongxiang, et al.
Pubblicazione: (2025)
MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
Artificial Intelligence:A Cross-Domain Reasoning Framework for Knowledge Innovation-- Model Composition and Semantic Alignment
di: Xu, Jingyao
Pubblicazione: (2025)
di: Xu, Jingyao
Pubblicazione: (2025)
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
di: Li, Chaoyu, et al.
Pubblicazione: (2024)
di: Li, Chaoyu, et al.
Pubblicazione: (2024)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
di: Zhang, Bob, et al.
Pubblicazione: (2025)
di: Zhang, Bob, et al.
Pubblicazione: (2025)
VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models
di: Tang, Duoxun, et al.
Pubblicazione: (2026)
di: Tang, Duoxun, et al.
Pubblicazione: (2026)
Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy
di: Chen, Haijier, et al.
Pubblicazione: (2025)
di: Chen, Haijier, et al.
Pubblicazione: (2025)
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
di: Yang, Yiming, et al.
Pubblicazione: (2025)
di: Yang, Yiming, et al.
Pubblicazione: (2025)
EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)
MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark
di: Yi, Dongyi, et al.
Pubblicazione: (2025)
di: Yi, Dongyi, et al.
Pubblicazione: (2025)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
di: Ni, Zhenliang, et al.
Pubblicazione: (2025)
di: Ni, Zhenliang, et al.
Pubblicazione: (2025)
Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective
di: Li, Ouxiang, et al.
Pubblicazione: (2024)
di: Li, Ouxiang, et al.
Pubblicazione: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models
di: Guo, Huijie, et al.
Pubblicazione: (2026)
di: Guo, Huijie, et al.
Pubblicazione: (2026)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024)
di: Zeng, Zhongshen, et al.
Pubblicazione: (2024)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
di: Luo, Yulin, et al.
Pubblicazione: (2025)
di: Luo, Yulin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
di: Qiu, Yilun, et al.
Pubblicazione: (2026) -
USB-Rec: An Effective Framework for Improving Conversational Recommendation Capability of Large Language Model
di: Wen, Jianyu, et al.
Pubblicazione: (2025) -
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025) -
VISA: Reasoning Video Object Segmentation via Large Language Models
di: Yan, Cilin, et al.
Pubblicazione: (2024) -
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2025)