Guardado en:
| Autores principales: | Chen, Boyu, Yue, Zhengrong, Chen, Siran, Wang, Zikang, Liu, Yang, Li, Peng, Wang, Yali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2503.10200 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
por: Chen, Boyu, et al.
Publicado: (2025)
por: Chen, Boyu, et al.
Publicado: (2025)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
por: Wang, Zikang, et al.
Publicado: (2025)
por: Wang, Zikang, et al.
Publicado: (2025)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
por: Chen, Boyu, et al.
Publicado: (2025)
por: Chen, Boyu, et al.
Publicado: (2025)
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
por: Chen, Siran, et al.
Publicado: (2025)
por: Chen, Siran, et al.
Publicado: (2025)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
por: Chen, Boyu, et al.
Publicado: (2024)
por: Chen, Boyu, et al.
Publicado: (2024)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
por: Ding, Yanbo, et al.
Publicado: (2024)
por: Ding, Yanbo, et al.
Publicado: (2024)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2026)
por: Yin, Yufei, et al.
Publicado: (2026)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
Long-Video Audio Synthesis with Multi-Agent Collaboration
por: Zhang, Yehang, et al.
Publicado: (2025)
por: Zhang, Yehang, et al.
Publicado: (2025)
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
por: Yang, Zhongyu, et al.
Publicado: (2026)
por: Yang, Zhongyu, et al.
Publicado: (2026)
EEA: Exploration-Exploitation Agent for Long Video Understanding
por: Yang, Te, et al.
Publicado: (2025)
por: Yang, Te, et al.
Publicado: (2025)
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
por: Chen, Kerui, et al.
Publicado: (2026)
por: Chen, Kerui, et al.
Publicado: (2026)
What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion
por: Yue, Zhengrong, et al.
Publicado: (2026)
por: Yue, Zhengrong, et al.
Publicado: (2026)
Low-Resolution Action Recognition for Tiny Actions Challenge
por: Chen, Boyu, et al.
Publicado: (2022)
por: Chen, Boyu, et al.
Publicado: (2022)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
por: Li, Handong, et al.
Publicado: (2026)
por: Li, Handong, et al.
Publicado: (2026)
Efficient Motion-Aware Video MLLM
por: Zhao, Zijia, et al.
Publicado: (2025)
por: Zhao, Zijia, et al.
Publicado: (2025)
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
por: Wang, Yiheng, et al.
Publicado: (2026)
por: Wang, Yiheng, et al.
Publicado: (2026)
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
por: Tan, Wenhui, et al.
Publicado: (2026)
por: Tan, Wenhui, et al.
Publicado: (2026)
MLLM-Enhanced Face Forgery Detection: A Vision-Language Fusion Solution
por: Peng, Siran, et al.
Publicado: (2025)
por: Peng, Siran, et al.
Publicado: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
por: Zeng, Xiangyu, et al.
Publicado: (2026)
por: Zeng, Xiangyu, et al.
Publicado: (2026)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025)
por: Yan, Ziang, et al.
Publicado: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
por: Li, Kunchang, et al.
Publicado: (2023)
por: Li, Kunchang, et al.
Publicado: (2023)
Communication-Efficient Multi-Agent 3D Detection via Hybrid Collaboration
por: Hu, Yue, et al.
Publicado: (2025)
por: Hu, Yue, et al.
Publicado: (2025)
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
por: Wang, Kaibin, et al.
Publicado: (2025)
por: Wang, Kaibin, et al.
Publicado: (2025)
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding
por: Wang, Zheng, et al.
Publicado: (2026)
por: Wang, Zheng, et al.
Publicado: (2026)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
por: Peng, Taiying, et al.
Publicado: (2025)
por: Peng, Taiying, et al.
Publicado: (2025)
New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration
por: Yang, Xuzheng, et al.
Publicado: (2025)
por: Yang, Xuzheng, et al.
Publicado: (2025)
LongVideoAgent: Multi-Agent Reasoning with Long Videos
por: Liu, Runtao, et al.
Publicado: (2025)
por: Liu, Runtao, et al.
Publicado: (2025)
VCA: Video Curious Agent for Long Video Understanding
por: Yang, Zeyuan, et al.
Publicado: (2024)
por: Yang, Zeyuan, et al.
Publicado: (2024)
Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos
por: Ma, Yue, et al.
Publicado: (2023)
por: Ma, Yue, et al.
Publicado: (2023)
Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Preference Understanding
por: Li, Kun, et al.
Publicado: (2025)
por: Li, Kun, et al.
Publicado: (2025)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
por: Qi, Haozhe, et al.
Publicado: (2026)
por: Qi, Haozhe, et al.
Publicado: (2026)
VideoMamba: State Space Model for Efficient Video Understanding
por: Li, Kunchang, et al.
Publicado: (2024)
por: Li, Kunchang, et al.
Publicado: (2024)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
por: Du, Yifan, et al.
Publicado: (2025)
por: Du, Yifan, et al.
Publicado: (2025)
Ejemplares similares
-
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
por: Chen, Boyu, et al.
Publicado: (2025) -
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
por: Wang, Zikang, et al.
Publicado: (2025) -
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
por: Yue, Zhengrong, et al.
Publicado: (2025) -
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
por: Chen, Boyu, et al.
Publicado: (2025) -
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
por: Chen, Siran, et al.
Publicado: (2025)