Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Kerui, Wang, Jinglu, Zhang, Jianrong, Li, Ming, Lu, Yan, Fan, Hehe |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation
par: Chen, Kerui, et autres
Publié: (2025)
par: Chen, Kerui, et autres
Publié: (2025)
EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
par: Zhang, Jianrong, et autres
Publié: (2024)
par: Zhang, Jianrong, et autres
Publié: (2024)
SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System
par: Xu, Zhiyu, et autres
Publié: (2025)
par: Xu, Zhiyu, et autres
Publié: (2025)
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
par: Wu, Zhiliang, et autres
Publié: (2025)
par: Wu, Zhiliang, et autres
Publié: (2025)
DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection
par: Qi, Hongyuan, et autres
Publié: (2026)
par: Qi, Hongyuan, et autres
Publié: (2026)
DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
par: Zhang, Jianrong, et autres
Publié: (2025)
par: Zhang, Jianrong, et autres
Publié: (2025)
Hand-Centric Motion Refinement for 3D Hand-Object Interaction via Hierarchical Spatial-Temporal Modeling
par: Hao, Yuze, et autres
Publié: (2024)
par: Hao, Yuze, et autres
Publié: (2024)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
par: Chen, Boyu, et autres
Publié: (2025)
par: Chen, Boyu, et autres
Publié: (2025)
Prompt-Aware Controllable Shadow Removal
par: Chen, Kerui, et autres
Publié: (2025)
par: Chen, Kerui, et autres
Publié: (2025)
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
par: Yang, Xiangpeng, et autres
Publié: (2025)
par: Yang, Xiangpeng, et autres
Publié: (2025)
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
par: Chen, Boyu, et autres
Publié: (2025)
par: Chen, Boyu, et autres
Publié: (2025)
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
par: Yang, Xiangpeng, et autres
Publié: (2024)
par: Yang, Xiangpeng, et autres
Publié: (2024)
GS-Marker: Generalizable and Robust Watermarking for 3D Gaussian Splatting
par: Li, Lijiang, et autres
Publié: (2025)
par: Li, Lijiang, et autres
Publié: (2025)
Long-Video Audio Synthesis with Multi-Agent Collaboration
par: Zhang, Yehang, et autres
Publié: (2025)
par: Zhang, Yehang, et autres
Publié: (2025)
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
par: Yu, Xinlei, et autres
Publié: (2025)
par: Yu, Xinlei, et autres
Publié: (2025)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
MMAD: Multi-label Micro-Action Detection in Videos
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO
par: Zhao, Fufangchen, et autres
Publié: (2025)
par: Zhao, Fufangchen, et autres
Publié: (2025)
TV-Dialogue: Crafting Theme-Aware Video Dialogues with Immersive Interaction
par: Wang, Sai, et autres
Publié: (2025)
par: Wang, Sai, et autres
Publié: (2025)
4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping
par: Zhang, Xindan, et autres
Publié: (2026)
par: Zhang, Xindan, et autres
Publié: (2026)
SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
par: Yang, Zhongyu, et autres
Publié: (2026)
par: Yang, Zhongyu, et autres
Publié: (2026)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
InfiniDreamer: Arbitrarily Long Human Motion Generation via Segment Score Distillation
par: Zhuo, Wenjie, et autres
Publié: (2024)
par: Zhuo, Wenjie, et autres
Publié: (2024)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
A Novel Garment Transfer Method Supervised by Distilled Knowledge of Virtual Try-on Model
par: Fang, Naiyu, et autres
Publié: (2024)
par: Fang, Naiyu, et autres
Publié: (2024)
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
par: Fan, Yue, et autres
Publié: (2024)
par: Fan, Yue, et autres
Publié: (2024)
AnimeAgent: Is the Multi-Agent via Image-to-Video models a Good Disney Storytelling Artist?
par: Yan, Hailong, et autres
Publié: (2026)
par: Yan, Hailong, et autres
Publié: (2026)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
par: Chen, Yuxiao, et autres
Publié: (2026)
par: Chen, Yuxiao, et autres
Publié: (2026)
MA-Bench: Towards Fine-grained Micro-Action Understanding
par: Li, Kun, et autres
Publié: (2026)
par: Li, Kun, et autres
Publié: (2026)
UVRM: A Scalable 3D Reconstruction Model from Unposed Videos
par: Kao, Shiu-hong, et autres
Publié: (2025)
par: Kao, Shiu-hong, et autres
Publié: (2025)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
par: Luo, Fuwen, et autres
Publié: (2025)
par: Luo, Fuwen, et autres
Publié: (2025)
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
par: Wang, Yi, et autres
Publié: (2024)
par: Wang, Yi, et autres
Publié: (2024)
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
par: Song, Yiren, et autres
Publié: (2026)
par: Song, Yiren, et autres
Publié: (2026)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation
par: Li, Mingwei, et autres
Publié: (2026)
par: Li, Mingwei, et autres
Publié: (2026)
ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
par: Tan, Chuangchuang, et autres
Publié: (2025)
par: Tan, Chuangchuang, et autres
Publié: (2025)
Documents similaires
-
ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation
par: Chen, Kerui, et autres
Publié: (2025) -
EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
par: Zhang, Jianrong, et autres
Publié: (2024) -
SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System
par: Xu, Zhiyu, et autres
Publié: (2025) -
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
par: Wu, Zhiliang, et autres
Publié: (2025) -
DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection
par: Qi, Hongyuan, et autres
Publié: (2026)