Enregistré dans:
| Auteurs principaux: | Liang, Zhengyang, Shu, Yan, Liu, Xiangrui, Qin, Minghao, Liang, Kaixin, Sebe, Nicu, Liu, Zheng, Liao, Lizi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.23044 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
par: Qin, Minghao, et autres
Publié: (2025)
par: Qin, Minghao, et autres
Publié: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
par: Shu, Yan, et autres
Publié: (2024)
par: Shu, Yan, et autres
Publié: (2024)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
par: Liang, Zhengyang, et autres
Publié: (2025)
par: Liang, Zhengyang, et autres
Publié: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
par: Yang, Zhoufaran, et autres
Publié: (2025)
par: Yang, Zhoufaran, et autres
Publié: (2025)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
par: Li, Jinlong, et autres
Publié: (2026)
par: Li, Jinlong, et autres
Publié: (2026)
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
par: Zuo, Zhi, et autres
Publié: (2025)
par: Zuo, Zhi, et autres
Publié: (2025)
RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism
par: Peruzzo, Elia, et autres
Publié: (2025)
par: Peruzzo, Elia, et autres
Publié: (2025)
MLVU: Benchmarking Multi-task Long Video Understanding
par: Zhou, Junjie, et autres
Publié: (2024)
par: Zhou, Junjie, et autres
Publié: (2024)
Transferable-guided Attention Is All You Need for Video Domain Adaptation
par: Sacilotti, André, et autres
Publié: (2024)
par: Sacilotti, André, et autres
Publié: (2024)
Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
par: Dong, Jiahua, et autres
Publié: (2025)
par: Dong, Jiahua, et autres
Publié: (2025)
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding
par: Li, Jinlong, et autres
Publié: (2025)
par: Li, Jinlong, et autres
Publié: (2025)
H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
Vision+X: A Survey on Multimodal Learning in the Light of Data
par: Zhu, Ye, et autres
Publié: (2022)
par: Zhu, Ye, et autres
Publié: (2022)
Open-World Deepfake Attribution via Confidence-Aware Asymmetric Learning
par: Zheng, Haiyang, et autres
Publié: (2025)
par: Zheng, Haiyang, et autres
Publié: (2025)
Multi-focal Conditioned Latent Diffusion for Person Image Synthesis
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
DVD: Deterministic Video Depth Estimation with Generative Priors
par: Zhang, Hongfei, et autres
Publié: (2026)
par: Zhang, Hongfei, et autres
Publié: (2026)
CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP
par: Xing, Songlong, et autres
Publié: (2025)
par: Xing, Songlong, et autres
Publié: (2025)
VASE: Object-Centric Appearance and Shape Manipulation of Real Videos
par: Peruzzo, Elia, et autres
Publié: (2024)
par: Peruzzo, Elia, et autres
Publié: (2024)
Cues3D: Unleashing the Power of Sole NeRF for Consistent and Unique Instances in Open-Vocabulary 3D Panoptic Segmentation
par: Xue, Feng, et autres
Publié: (2025)
par: Xue, Feng, et autres
Publié: (2025)
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
par: Zhao, Dong, et autres
Publié: (2026)
par: Zhao, Dong, et autres
Publié: (2026)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Generate, Refine, and Encode: Leveraging Synthesized Novel Samples for On-the-Fly Fine-Grained Category Discovery
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
Reverse Personalization
par: Kung, Han-Wei, et autres
Publié: (2025)
par: Kung, Han-Wei, et autres
Publié: (2025)
Asymmetric GANs for Image-to-Image Translation
par: Tang, Hao, et autres
Publié: (2019)
par: Tang, Hao, et autres
Publié: (2019)
AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
Prototypical Hash Encoding for On-the-Fly Fine-Grained Category Discovery
par: Zheng, Haiyang, et autres
Publié: (2024)
par: Zheng, Haiyang, et autres
Publié: (2024)
Generalized Fine-Grained Category Discovery with Multi-Granularity Conceptual Experts
par: Zheng, Haiyang, et autres
Publié: (2025)
par: Zheng, Haiyang, et autres
Publié: (2025)
Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class Discovery
par: Zheng, Haiyang, et autres
Publié: (2024)
par: Zheng, Haiyang, et autres
Publié: (2024)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
par: Song, Yue, et autres
Publié: (2023)
par: Song, Yue, et autres
Publié: (2023)
Beyond the Known: Enhancing Open Set Domain Adaptation with Unknown Exploration
par: Silva, Lucas Fernando Alvarenga e, et autres
Publié: (2024)
par: Silva, Lucas Fernando Alvarenga e, et autres
Publié: (2024)
Task-Aware KV Compression For Cost-Effective Long Video Understanding
par: Qin, Minghao, et autres
Publié: (2025)
par: Qin, Minghao, et autres
Publié: (2025)
Superpowering Open-Vocabulary Object Detectors for X-ray Vision
par: Garcia-Fernandez, Pablo, et autres
Publié: (2025)
par: Garcia-Fernandez, Pablo, et autres
Publié: (2025)
Hierarchical Cross-Attention Network for Virtual Try-On
par: Tang, Hao, et autres
Publié: (2024)
par: Tang, Hao, et autres
Publié: (2024)
Rethinking the Learning Paradigm for Facial Expression Recognition
par: Wang, Weijie, et autres
Publié: (2022)
par: Wang, Weijie, et autres
Publié: (2022)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
par: Yin, Yufei, et autres
Publié: (2025)
par: Yin, Yufei, et autres
Publié: (2025)
Documents similaires
-
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
par: Liu, Xiangrui, et autres
Publié: (2025) -
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
par: Qin, Minghao, et autres
Publié: (2025) -
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025) -
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025) -
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
par: Shu, Yan, et autres
Publié: (2024)