How Far Are Video Models from True Multimodal Reasoning?
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Xiaotian, Wei, Jianhui, Wang, Yuan, Tan, Jie, Li, Yichen, Zhang, Yan, Chen, Ziyi, Zhang, Daoan, YU, Dezhi, Xu, Wei, Jiang, Songtao, Liu, Zuozhu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
UniVBench: Towards Unified Evaluation for Video Foundation Models
von: Wei, Jianhui, et al.
Veröffentlicht: (2026)
von: Wei, Jianhui, et al.
Veröffentlicht: (2026)
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
von: Jiang, Songtao, et al.
Veröffentlicht: (2026)
von: Jiang, Songtao, et al.
Veröffentlicht: (2026)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis
von: Wei, Jianhui, et al.
Veröffentlicht: (2025)
von: Wei, Jianhui, et al.
Veröffentlicht: (2025)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
von: Zhang, Daoan, et al.
Veröffentlicht: (2024)
von: Zhang, Daoan, et al.
Veröffentlicht: (2024)
A Versatile Multimodal Agent for Multimedia Content Generation
von: Zhang, Daoan, et al.
Veröffentlicht: (2026)
von: Zhang, Daoan, et al.
Veröffentlicht: (2026)
How Far Are We from Intelligent Visual Deductive Reasoning?
von: Zhang, Yizhe, et al.
Veröffentlicht: (2024)
von: Zhang, Yizhe, et al.
Veröffentlicht: (2024)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
von: Jiang, Songtao, et al.
Veröffentlicht: (2025)
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
von: Chen, Zhe, et al.
Veröffentlicht: (2024)
von: Chen, Zhe, et al.
Veröffentlicht: (2024)
Scaling Video Pretraining for Surgical Foundation Models
von: Lu, Sicheng, et al.
Veröffentlicht: (2026)
von: Lu, Sicheng, et al.
Veröffentlicht: (2026)
CascadeV: An Implementation of Wurstchen Architecture for Video Generation
von: Lin, Wenfeng, et al.
Veröffentlicht: (2025)
von: Lin, Wenfeng, et al.
Veröffentlicht: (2025)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
von: Zhang, Daoan, et al.
Veröffentlicht: (2025)
von: Zhang, Daoan, et al.
Veröffentlicht: (2025)
LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
von: Wang, Shuai, et al.
Veröffentlicht: (2025)
von: Wang, Shuai, et al.
Veröffentlicht: (2025)
MotionChain: Conversational Motion Controllers via Multimodal Prompts
von: Jiang, Biao, et al.
Veröffentlicht: (2024)
von: Jiang, Biao, et al.
Veröffentlicht: (2024)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
DBINDS -- Can Initial Noise from Diffusion Model Inversion Help Reveal AI-Generated Videos?
von: Wu, Yanlin, et al.
Veröffentlicht: (2025)
von: Wu, Yanlin, et al.
Veröffentlicht: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
von: Jiang, Chaoya, et al.
Veröffentlicht: (2025)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2025)
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
von: Zhang, Yiming, et al.
Veröffentlicht: (2026)
von: Zhang, Yiming, et al.
Veröffentlicht: (2026)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
von: Long, Lin, et al.
Veröffentlicht: (2025)
von: Long, Lin, et al.
Veröffentlicht: (2025)
Beyond Modality Collapse: Representations Blending for Multimodal Dataset Distillation
von: Zhang, Xin, et al.
Veröffentlicht: (2025)
von: Zhang, Xin, et al.
Veröffentlicht: (2025)
NightRain: Nighttime Video Deraining via Adaptive-Rain-Removal and Adaptive-Correction
von: Lin, Beibei, et al.
Veröffentlicht: (2024)
von: Lin, Beibei, et al.
Veröffentlicht: (2024)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
Dual Stream Independence Decoupling for True Emotion Recognition under Masked Expressions
von: Wei, Jinsheng, et al.
Veröffentlicht: (2026)
von: Wei, Jinsheng, et al.
Veröffentlicht: (2026)
IDEA-Bench: How Far are Generative Models from Professional Designing?
von: Liang, Chen, et al.
Veröffentlicht: (2024)
von: Liang, Chen, et al.
Veröffentlicht: (2024)
TrueMoE: Dual-Routing Mixture of Discriminative Experts for Synthetic Image Detection
von: Zhang, Laixin, et al.
Veröffentlicht: (2025)
von: Zhang, Laixin, et al.
Veröffentlicht: (2025)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
von: Han, Haonan, et al.
Veröffentlicht: (2026)
von: Han, Haonan, et al.
Veröffentlicht: (2026)
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
Multimodal Alignment and Fusion: A Survey
von: Li, Songtao, et al.
Veröffentlicht: (2024)
von: Li, Songtao, et al.
Veröffentlicht: (2024)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
von: Huang, Yu, et al.
Veröffentlicht: (2025)
von: Huang, Yu, et al.
Veröffentlicht: (2025)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
von: Zhang, Peng, et al.
Veröffentlicht: (2026)
von: Zhang, Peng, et al.
Veröffentlicht: (2026)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
von: Deng, Ziye, et al.
Veröffentlicht: (2025)
von: Deng, Ziye, et al.
Veröffentlicht: (2025)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
von: Liang, Zhengyang, et al.
Veröffentlicht: (2025)
von: Liang, Zhengyang, et al.
Veröffentlicht: (2025)
LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation
von: Jiang, Bo, et al.
Veröffentlicht: (2026)
von: Jiang, Bo, et al.
Veröffentlicht: (2026)
ImageAttributionBench: How Far Are We from Generalizable Attribution?
von: Mou, Tingshu, et al.
Veröffentlicht: (2026)
von: Mou, Tingshu, et al.
Veröffentlicht: (2026)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
von: Li, Yan, et al.
Veröffentlicht: (2026)
von: Li, Yan, et al.
Veröffentlicht: (2026)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2024)
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2024)
LongDPM: Overlap-Aware 4D Reconstruction from Long Monocular Videos
von: Xu, Chenyi, et al.
Veröffentlicht: (2026)
von: Xu, Chenyi, et al.
Veröffentlicht: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
von: Li, Yifei, et al.
Veröffentlicht: (2025)
von: Li, Yifei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
UniVBench: Towards Unified Evaluation for Video Foundation Models
von: Wei, Jianhui, et al.
Veröffentlicht: (2026) -
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
von: Jiang, Songtao, et al.
Veröffentlicht: (2026) -
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
von: Jiang, Songtao, et al.
Veröffentlicht: (2024) -
CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making
von: Jiang, Songtao, et al.
Veröffentlicht: (2025) -
SurgBench: A Unified Large-Scale Benchmark for Surgical Video Analysis
von: Wei, Jianhui, et al.
Veröffentlicht: (2025)