Video-Zero: Self-Evolution Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Ruixu, Ji, Deyi, Zhu, Lanyun, Liu, Xuanyi, Meng, Yuxin, Chu, Ruihang, Yang, Yujiu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
por: Ding, Yang, et al.
Publicado: (2025)
por: Ding, Yang, et al.
Publicado: (2025)
Not Every Patch is Needed: Towards a More Efficient and Effective Backbone for Video-based Person Re-identification
por: Zhu, Lanyun, et al.
Publicado: (2025)
por: Zhu, Lanyun, et al.
Publicado: (2025)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
por: Chen, Yuqing, et al.
Publicado: (2025)
por: Chen, Yuqing, et al.
Publicado: (2025)
POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation
por: Zhu, Lanyun, et al.
Publicado: (2025)
por: Zhu, Lanyun, et al.
Publicado: (2025)
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
por: Liu, Xuanyi, et al.
Publicado: (2026)
por: Liu, Xuanyi, et al.
Publicado: (2026)
LLaFS: When Large Language Models Meet Few-Shot Segmentation
por: Zhu, Lanyun, et al.
Publicado: (2023)
por: Zhu, Lanyun, et al.
Publicado: (2023)
AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
por: Zhu, Lanyun, et al.
Publicado: (2025)
por: Zhu, Lanyun, et al.
Publicado: (2025)
IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
por: Zhu, Lanyun, et al.
Publicado: (2024)
por: Zhu, Lanyun, et al.
Publicado: (2024)
Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
por: Chu, Ruihang, et al.
Publicado: (2025)
por: Chu, Ruihang, et al.
Publicado: (2025)
Discrete Latent Perspective Learning for Segmentation and Detection
por: Ji, Deyi, et al.
Publicado: (2024)
por: Ji, Deyi, et al.
Publicado: (2024)
4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation
por: Zang, Ying, et al.
Publicado: (2026)
por: Zang, Ying, et al.
Publicado: (2026)
Zero-P-to-3: Zero-Shot Partial-View Images to 3D Object
por: Lin, Yuxuan, et al.
Publicado: (2025)
por: Lin, Yuxuan, et al.
Publicado: (2025)
Anomize: Better Open Vocabulary Video Anomaly Detection
por: Li, Fei, et al.
Publicado: (2025)
por: Li, Fei, et al.
Publicado: (2025)
Replace Anyone in Videos
por: Wang, Xiang, et al.
Publicado: (2024)
por: Wang, Xiang, et al.
Publicado: (2024)
StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
Hybrid Mamba for Few-Shot Segmentation
por: Xu, Qianxiong, et al.
Publicado: (2024)
por: Xu, Qianxiong, et al.
Publicado: (2024)
Unlocking the Power of SAM 2 for Few-Shot Segmentation
por: Xu, Qianxiong, et al.
Publicado: (2025)
por: Xu, Qianxiong, et al.
Publicado: (2025)
Velocity-Space 3D Asset Editing
por: Liu, Hao, et al.
Publicado: (2026)
por: Liu, Hao, et al.
Publicado: (2026)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
por: Wu, Yongliang, et al.
Publicado: (2024)
por: Wu, Yongliang, et al.
Publicado: (2024)
CurEvo: Curriculum-Guided Self-Evolution for Video Understanding
por: Zeng, Guiyi, et al.
Publicado: (2026)
por: Zeng, Guiyi, et al.
Publicado: (2026)
DreamVE: Unified Instruction-based Image and Video Editing
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
WaterWave: Bridging Underwater Image Enhancement into Video Streams via Wavelet-based Temporal Consistency Field
por: Zhu, Qi, et al.
Publicado: (2025)
por: Zhu, Qi, et al.
Publicado: (2025)
NVS-Solver: Video Diffusion Model as Zero-Shot Novel View Synthesizer
por: You, Meng, et al.
Publicado: (2024)
por: You, Meng, et al.
Publicado: (2024)
AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance
por: Wang, Zhao, et al.
Publicado: (2025)
por: Wang, Zhao, et al.
Publicado: (2025)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2026)
por: Yin, Yufei, et al.
Publicado: (2026)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
por: Yang, Ruoliu, et al.
Publicado: (2026)
por: Yang, Ruoliu, et al.
Publicado: (2026)
Breaking the Box: Enhancing Remote Sensing Image Segmentation with Freehand Sketches
por: Zang, Ying, et al.
Publicado: (2025)
por: Zang, Ying, et al.
Publicado: (2025)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
por: Chen, Tianrun, et al.
Publicado: (2024)
por: Chen, Tianrun, et al.
Publicado: (2024)
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025)
por: Zhang, Xinchen, et al.
Publicado: (2025)
Sora Generates Videos with Stunning Geometrical Consistency
por: Li, Xuanyi, et al.
Publicado: (2024)
por: Li, Xuanyi, et al.
Publicado: (2024)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
por: Liao, Ruotong, et al.
Publicado: (2024)
por: Liao, Ruotong, et al.
Publicado: (2024)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
por: Wei, Yujie, et al.
Publicado: (2026)
por: Wei, Yujie, et al.
Publicado: (2026)
Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models
por: Cao, Cong, et al.
Publicado: (2026)
por: Cao, Cong, et al.
Publicado: (2026)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
CrossVideo: Self-supervised Cross-modal Contrastive Learning for Point Cloud Video Understanding
por: Liu, Yunze, et al.
Publicado: (2024)
por: Liu, Yunze, et al.
Publicado: (2024)
VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding
por: Zhao, Henghao, et al.
Publicado: (2025)
por: Zhao, Henghao, et al.
Publicado: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
Ejemplares similares
-
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
por: Ding, Yang, et al.
Publicado: (2025) -
Not Every Patch is Needed: Towards a More Efficient and Effective Backbone for Video-based Person Re-identification
por: Zhu, Lanyun, et al.
Publicado: (2025) -
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
por: Chen, Yuqing, et al.
Publicado: (2025) -
POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation
por: Zhu, Lanyun, et al.
Publicado: (2025) -
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
por: Liu, Xuanyi, et al.
Publicado: (2026)