CAST: Modeling Visual State Transitions for Consistent Video Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yanqing, Liu, Yingcheng, Dong, Fanghong, Budianto, Budianto, Xie, Cihang, Jiao, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
par: Liu, Yanqing, et autres
Publié: (2024)
par: Liu, Yanqing, et autres
Publié: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025)
par: Li, Xianhang, et autres
Publié: (2025)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
The effect of processing and storage on Klanceng honey (Tetragonula laeviceps)
par: Budianto
Publié: (2023)
par: Budianto
Publié: (2023)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
par: Lin, Xinying, et autres
Publié: (2026)
par: Lin, Xinying, et autres
Publié: (2026)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
par: Wang, Zeyu, et autres
Publié: (2025)
par: Wang, Zeyu, et autres
Publié: (2025)
VMamba: Visual State Space Model
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
par: Li, Zhuowan, et autres
Publié: (2022)
par: Li, Zhuowan, et autres
Publié: (2022)
CAST: Cross-Attention in Space and Time for Video Action Recognition
par: Lee, Dongho, et autres
Publié: (2023)
par: Lee, Dongho, et autres
Publié: (2023)
CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
par: Li, Qiming, et autres
Publié: (2026)
par: Li, Qiming, et autres
Publié: (2026)
Long Video Understanding with Learnable Retrieval in Video-Language Models
par: Xu, Jiaqi, et autres
Publié: (2023)
par: Xu, Jiaqi, et autres
Publié: (2023)
CAST: Collapse-Aware multi-Scale Topology Fusion for Multimodal Coreset Selection
par: Zhao, Boran, et autres
Publié: (2026)
par: Zhao, Boran, et autres
Publié: (2026)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
StableV2V: Stablizing Shape Consistency in Video-to-Video Editing
par: Liu, Chang, et autres
Publié: (2024)
par: Liu, Chang, et autres
Publié: (2024)
CAST-Phys: Contactless Affective States Through Physiological signals Database
par: Comas, Joaquim, et autres
Publié: (2025)
par: Comas, Joaquim, et autres
Publié: (2025)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Rethinking Video Segmentation with Masked Video Consistency: Did the Model Learn as Intended?
par: Liang, Chen, et autres
Publié: (2024)
par: Liang, Chen, et autres
Publié: (2024)
Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023)
par: Ren, Sucheng, et autres
Publié: (2023)
A Unified and Controllable Framework for Layered Image Generation with Visual Effects
par: Yang, Jinrui, et autres
Publié: (2026)
par: Yang, Jinrui, et autres
Publié: (2026)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control
par: Liu, Lijuan, et autres
Publié: (2025)
par: Liu, Lijuan, et autres
Publié: (2025)
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation
par: Joo, Minseok, et autres
Publié: (2026)
par: Joo, Minseok, et autres
Publié: (2026)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
CAST: Component-Aligned 3D Scene Reconstruction from an RGB Image
par: Yao, Kaixin, et autres
Publié: (2025)
par: Yao, Kaixin, et autres
Publié: (2025)
HiCAST: Highly Customized Arbitrary Style Transfer with Adapter Enhanced Diffusion Models
par: Wang, Hanzhang, et autres
Publié: (2024)
par: Wang, Hanzhang, et autres
Publié: (2024)
Fréchet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos
par: Liu, Jiahe, et autres
Publié: (2024)
par: Liu, Jiahe, et autres
Publié: (2024)
Scaling (Down) CLIP: A Comprehensive Analysis of Data, Architecture, and Training Strategies
par: Li, Zichao, et autres
Publié: (2024)
par: Li, Zichao, et autres
Publié: (2024)
AIR-HLoc: Adaptive Retrieved Images Selection for Efficient Visual Localisation
par: Liu, Changkun, et autres
Publié: (2024)
par: Liu, Changkun, et autres
Publié: (2024)
Text-Video Retrieval with Global-Local Semantic Consistent Learning
par: Zhang, Haonan, et autres
Publié: (2024)
par: Zhang, Haonan, et autres
Publié: (2024)
ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
par: Ren, Weiming, et autres
Publié: (2024)
par: Ren, Weiming, et autres
Publié: (2024)
Temporal-Consistent Video Restoration with Pre-trained Diffusion Models
par: Wang, Hengkang, et autres
Publié: (2025)
par: Wang, Hengkang, et autres
Publié: (2025)
ViLBench: A Suite for Vision-Language Process Reward Modeling
par: Tu, Haoqin, et autres
Publié: (2025)
par: Tu, Haoqin, et autres
Publié: (2025)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
par: Liu, Weijia, et autres
Publié: (2025)
par: Liu, Weijia, et autres
Publié: (2025)
Focusing on what to decode and what to train: SOV Decoding with Specific Target Guided DeNoising and Vision Language Advisor
par: Chen, Junwen, et autres
Publié: (2023)
par: Chen, Junwen, et autres
Publié: (2023)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Generative Image Layer Decomposition with Visual Effects
par: Yang, Jinrui, et autres
Publié: (2024)
par: Yang, Jinrui, et autres
Publié: (2024)
Consistency-Preserving Diverse Video Generation
par: Liu, Xinshuang, et autres
Publié: (2026)
par: Liu, Xinshuang, et autres
Publié: (2026)
Documents similaires
-
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
par: Liu, Yanqing, et autres
Publié: (2024) -
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025) -
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025) -
The effect of processing and storage on Klanceng honey (Tetragonula laeviceps)
par: Budianto
Publié: (2023) -
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
par: Lin, Xinying, et autres
Publié: (2026)