VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Tianxiang, Xia, Sheng, Xu, Yicheng, Wu, Linquan, Zeng, Xiangyu, Wang, Limin, Qiao, Yu, Wang, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RIVER: A Real-Time Interaction Benchmark for Video LLMs
por: Shi, Yansong, et al.
Publicado: (2026)
por: Shi, Yansong, et al.
Publicado: (2026)
Make Your Training Flexible: Towards Deployment-Efficient Video Models
por: Wang, Chenting, et al.
Publicado: (2025)
por: Wang, Chenting, et al.
Publicado: (2025)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
por: Xu, Yicheng, et al.
Publicado: (2025)
por: Xu, Yicheng, et al.
Publicado: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025)
por: Yan, Ziang, et al.
Publicado: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
por: Wang, Yi, et al.
Publicado: (2024)
por: Wang, Yi, et al.
Publicado: (2024)
FreeRet: MLLMs as Training-Free Retrievers
por: Zhu, Yuhan, et al.
Publicado: (2025)
por: Zhu, Yuhan, et al.
Publicado: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
por: Li, Kunchang, et al.
Publicado: (2024)
por: Li, Kunchang, et al.
Publicado: (2024)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
por: Wu, Linquan, et al.
Publicado: (2026)
por: Wu, Linquan, et al.
Publicado: (2026)
FaceSleuth-R: Adaptive Orientation-Aware Attention for Robust Micro-Expression Recognition
por: Wu, Linquan, et al.
Publicado: (2025)
por: Wu, Linquan, et al.
Publicado: (2025)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025)
por: Wu, Size, et al.
Publicado: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale
por: Li, Songze, et al.
Publicado: (2025)
por: Li, Songze, et al.
Publicado: (2025)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
por: Li, Xinhao, et al.
Publicado: (2025)
por: Li, Xinhao, et al.
Publicado: (2025)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
por: Xie, Ming, et al.
Publicado: (2026)
por: Xie, Ming, et al.
Publicado: (2026)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
por: Wang, Yi, et al.
Publicado: (2023)
por: Wang, Yi, et al.
Publicado: (2023)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
por: Li, Kunchang, et al.
Publicado: (2023)
por: Li, Kunchang, et al.
Publicado: (2023)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
por: Peng, Tianhao, et al.
Publicado: (2025)
por: Peng, Tianhao, et al.
Publicado: (2025)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
por: Gong, Kaixiong, et al.
Publicado: (2024)
por: Gong, Kaixiong, et al.
Publicado: (2024)
VideoChat: Chat-Centric Video Understanding
por: Li, KunChang, et al.
Publicado: (2023)
por: Li, KunChang, et al.
Publicado: (2023)
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
por: Wang, Hongyu, et al.
Publicado: (2024)
por: Wang, Hongyu, et al.
Publicado: (2024)
Token Activation Map to Visually Explain Multimodal LLMs
por: Li, Yi, et al.
Publicado: (2025)
por: Li, Yi, et al.
Publicado: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
por: Zhang, Wanpeng, et al.
Publicado: (2025)
por: Zhang, Wanpeng, et al.
Publicado: (2025)
Online Video Understanding: OVBench and VideoChat-Online
por: Huang, Zhenpeng, et al.
Publicado: (2024)
por: Huang, Zhenpeng, et al.
Publicado: (2024)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
por: Zeng, Xiangyu, et al.
Publicado: (2025)
por: Zeng, Xiangyu, et al.
Publicado: (2025)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
por: Hong, Jack, et al.
Publicado: (2025)
por: Hong, Jack, et al.
Publicado: (2025)
CrossRay3D: Geometry and Distribution Guidance for Efficient Multimodal 3D Detection
por: Yang, Huiming, et al.
Publicado: (2025)
por: Yang, Huiming, et al.
Publicado: (2025)
FaceXBench: Evaluating Multimodal LLMs on Face Understanding
por: Narayan, Kartik, et al.
Publicado: (2025)
por: Narayan, Kartik, et al.
Publicado: (2025)
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
por: Wang, Yufei, et al.
Publicado: (2026)
por: Wang, Yufei, et al.
Publicado: (2026)
Customize Your Visual Autoregressive Recipe with Set Autoregressive Modeling
por: Liu, Wenze, et al.
Publicado: (2024)
por: Liu, Wenze, et al.
Publicado: (2024)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
por: Wang, Zhaokai, et al.
Publicado: (2025)
por: Wang, Zhaokai, et al.
Publicado: (2025)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
PDPP: Projected Diffusion for Procedure Planning in Instructional Videos
por: Wang, Hanlin, et al.
Publicado: (2023)
por: Wang, Hanlin, et al.
Publicado: (2023)
Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge
por: Chen, Ruiming, et al.
Publicado: (2025)
por: Chen, Ruiming, et al.
Publicado: (2025)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
por: Zeng, Xiangyu, et al.
Publicado: (2026)
por: Zeng, Xiangyu, et al.
Publicado: (2026)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
por: Cheng, Hanbo, et al.
Publicado: (2026)
por: Cheng, Hanbo, et al.
Publicado: (2026)
Ejemplares similares
-
RIVER: A Real-Time Interaction Benchmark for Video LLMs
por: Shi, Yansong, et al.
Publicado: (2026) -
Make Your Training Flexible: Towards Deployment-Efficient Video Models
por: Wang, Chenting, et al.
Publicado: (2025) -
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
por: Xu, Yicheng, et al.
Publicado: (2025) -
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025) -
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)