Salvato in:
| Autori principali: | Yu, Zhuang, Shen, Lei, Zhao, Jing, Sun, Shiliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.20705 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CountQA: How Well Do MLLMs Count in the Wild?
di: Tamarapalli, Jayant Sravan, et al.
Pubblicazione: (2025)
di: Tamarapalli, Jayant Sravan, et al.
Pubblicazione: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
di: Ou, Siqu, et al.
Pubblicazione: (2026)
di: Ou, Siqu, et al.
Pubblicazione: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)
di: Lin, Junming, et al.
Pubblicazione: (2024)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
di: Zhou, Ting, et al.
Pubblicazione: (2024)
di: Zhou, Ting, et al.
Pubblicazione: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images
di: Liu, Guimeng, et al.
Pubblicazione: (2026)
di: Liu, Guimeng, et al.
Pubblicazione: (2026)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
di: Huang, Zhe, et al.
Pubblicazione: (2025)
di: Huang, Zhe, et al.
Pubblicazione: (2025)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
di: Alansari, Mohamad, et al.
Pubblicazione: (2026)
di: Alansari, Mohamad, et al.
Pubblicazione: (2026)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
di: Cai, Mu, et al.
Pubblicazione: (2024)
di: Cai, Mu, et al.
Pubblicazione: (2024)
ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
What to Do Next? Memorizing skills from Egocentric Instructional Video
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
InstrAct: Towards Action-Centric Understanding in Instructional Videos
di: Yang, Zhuoyi, et al.
Pubblicazione: (2026)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2026)
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
di: Wen, Zimo, et al.
Pubblicazione: (2026)
di: Wen, Zimo, et al.
Pubblicazione: (2026)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
di: Li, Keliang, et al.
Pubblicazione: (2026)
di: Li, Keliang, et al.
Pubblicazione: (2026)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
di: Mao, Jiawei, et al.
Pubblicazione: (2025)
di: Mao, Jiawei, et al.
Pubblicazione: (2025)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
di: Tang, Yolo Y., et al.
Pubblicazione: (2024)
di: Tang, Yolo Y., et al.
Pubblicazione: (2024)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
di: Li, Bin, et al.
Pubblicazione: (2022)
di: Li, Bin, et al.
Pubblicazione: (2022)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
di: Li, Shicheng, et al.
Pubblicazione: (2023)
di: Li, Shicheng, et al.
Pubblicazione: (2023)
Dense Connector for MLLMs
di: Yao, Huanjin, et al.
Pubblicazione: (2024)
di: Yao, Huanjin, et al.
Pubblicazione: (2024)
VCA: Video Curious Agent for Long Video Understanding
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement
di: Yi, Zhihang, et al.
Pubblicazione: (2026)
di: Yi, Zhihang, et al.
Pubblicazione: (2026)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
di: Li, Shicheng, et al.
Pubblicazione: (2025)
di: Li, Shicheng, et al.
Pubblicazione: (2025)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs
di: Che, Chang, et al.
Pubblicazione: (2026)
di: Che, Chang, et al.
Pubblicazione: (2026)
Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives
di: Jiang, Kai, et al.
Pubblicazione: (2025)
di: Jiang, Kai, et al.
Pubblicazione: (2025)
VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks
di: Jang, Lawrence, et al.
Pubblicazione: (2024)
di: Jang, Lawrence, et al.
Pubblicazione: (2024)
SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding
di: Chen, Zhen, et al.
Pubblicazione: (2025)
di: Chen, Zhen, et al.
Pubblicazione: (2025)
One-Step Diffusion for Detail-Rich and Temporally Consistent Video Super-Resolution
di: Sun, Yujing, et al.
Pubblicazione: (2025)
di: Sun, Yujing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CountQA: How Well Do MLLMs Count in the Wild?
di: Tamarapalli, Jayant Sravan, et al.
Pubblicazione: (2025) -
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025) -
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
di: Liu, Xiaolin, et al.
Pubblicazione: (2026) -
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
di: Ou, Siqu, et al.
Pubblicazione: (2026) -
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)