Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Zikun, Xiong, Wentao, Zhou, Li, Li, Xin, He, Zhenyu, Wang, Yaowei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
von: Liu, Xinqi, et al.
Veröffentlicht: (2024)
von: Liu, Xinqi, et al.
Veröffentlicht: (2024)
1st Place Solution for MOSE Track in CVPR 2024 PVUW Workshop: Complex Video Object Segmentation
von: Miao, Deshui, et al.
Veröffentlicht: (2024)
von: Miao, Deshui, et al.
Veröffentlicht: (2024)
Learning Spatial-Semantic Features for Robust Video Object Segmentation
von: Li, Xin, et al.
Veröffentlicht: (2024)
von: Li, Xin, et al.
Veröffentlicht: (2024)
RTracker: Recoverable Tracking via PN Tree Structured Memory
von: Huang, Yuqing, et al.
Veröffentlicht: (2024)
von: Huang, Yuqing, et al.
Veröffentlicht: (2024)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
von: Zhuang, Weijun, et al.
Veröffentlicht: (2026)
von: Zhuang, Weijun, et al.
Veröffentlicht: (2026)
Spatial-Temporal Multi-level Association for Video Object Segmentation
von: Miao, Deshui, et al.
Veröffentlicht: (2024)
von: Miao, Deshui, et al.
Veröffentlicht: (2024)
Prototype Perturbation for Relaxing Alignment Constraints in Backward-Compatible Learning
von: Zhou, Zikun, et al.
Veröffentlicht: (2025)
von: Zhou, Zikun, et al.
Veröffentlicht: (2025)
ZeroBP: Learning Position-Aware Correspondence for Zero-shot 6D Pose Estimation in Bin-Picking
von: Chen, Jianqiu, et al.
Veröffentlicht: (2025)
von: Chen, Jianqiu, et al.
Veröffentlicht: (2025)
Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
von: Zhang, Ruixin, et al.
Veröffentlicht: (2025)
von: Zhang, Ruixin, et al.
Veröffentlicht: (2025)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2025)
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2025)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
von: Choi, Sun-Hyuk, et al.
Veröffentlicht: (2025)
von: Choi, Sun-Hyuk, et al.
Veröffentlicht: (2025)
Deeply-Conditioned Image Compression via Self-Generated Priors
von: Zhao, Zhineng, et al.
Veröffentlicht: (2025)
von: Zhao, Zhineng, et al.
Veröffentlicht: (2025)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
von: Miao, Bo, et al.
Veröffentlicht: (2024)
von: Miao, Bo, et al.
Veröffentlicht: (2024)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2024)
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2024)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
von: Yan, Cilin, et al.
Veröffentlicht: (2025)
von: Yan, Cilin, et al.
Veröffentlicht: (2025)
Video-based Sign Language Recognition without Temporal Segmentation
von: Huang, Jie, et al.
Veröffentlicht: (2018)
von: Huang, Jie, et al.
Veröffentlicht: (2018)
Modality-Decoupled RGB-Thermal Object Detector via Query Fusion
von: Tian, Chao, et al.
Veröffentlicht: (2026)
von: Tian, Chao, et al.
Veröffentlicht: (2026)
BayesTTA: Continual-Temporal Test-Time Adaptation for Vision-Language Models via Gaussian Discriminant Analysis
von: Cui, Shuang, et al.
Veröffentlicht: (2025)
von: Cui, Shuang, et al.
Veröffentlicht: (2025)
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
von: Yu, Li, et al.
Veröffentlicht: (2025)
von: Yu, Li, et al.
Veröffentlicht: (2025)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
von: Yang, Fan, et al.
Veröffentlicht: (2025)
von: Yang, Fan, et al.
Veröffentlicht: (2025)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
von: Lee, Seunghun, et al.
Veröffentlicht: (2025)
von: Lee, Seunghun, et al.
Veröffentlicht: (2025)
Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model
von: Zhou, Li, et al.
Veröffentlicht: (2024)
von: Zhou, Li, et al.
Veröffentlicht: (2024)
Object Segmentation-Assisted Inter Prediction for Versatile Video Coding
von: Li, Zhuoyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhuoyuan, et al.
Veröffentlicht: (2024)
Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptation
von: Huang, Yuqing, et al.
Veröffentlicht: (2026)
von: Huang, Yuqing, et al.
Veröffentlicht: (2026)
Video Object Segmentation with Dynamic Query Modulation
von: Zhou, Hantao, et al.
Veröffentlicht: (2024)
von: Zhou, Hantao, et al.
Veröffentlicht: (2024)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
von: Liu, Yufang, et al.
Veröffentlicht: (2024)
von: Liu, Yufang, et al.
Veröffentlicht: (2024)
Motion-aware Latent Diffusion Models for Video Frame Interpolation
von: Huang, Zhilin, et al.
Veröffentlicht: (2024)
von: Huang, Zhilin, et al.
Veröffentlicht: (2024)
Continual Adaptation: Environment-Conditional Parameter Generation for Object Detection in Dynamic Scenarios
von: Li, Deng, et al.
Veröffentlicht: (2025)
von: Li, Deng, et al.
Veröffentlicht: (2025)
Evolving Prompt Adaptation for Vision-Language Models
von: Zhang, Enming, et al.
Veröffentlicht: (2026)
von: Zhang, Enming, et al.
Veröffentlicht: (2026)
RMem: Restricted Memory Banks Improve Video Object Segmentation
von: Zhou, Junbao, et al.
Veröffentlicht: (2024)
von: Zhou, Junbao, et al.
Veröffentlicht: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
von: Zhou, Wenlve, et al.
Veröffentlicht: (2024)
von: Zhou, Wenlve, et al.
Veröffentlicht: (2024)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
von: Yuan, Yuqian, et al.
Veröffentlicht: (2025)
von: Yuan, Yuqian, et al.
Veröffentlicht: (2025)
Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation
von: Chen, Zhi, et al.
Veröffentlicht: (2025)
von: Chen, Zhi, et al.
Veröffentlicht: (2025)
Category-Aware 3D Object Composition with Disentangled Texture and Shape Multi-view Diffusion
von: Xiong, Zeren, et al.
Veröffentlicht: (2025)
von: Xiong, Zeren, et al.
Veröffentlicht: (2025)
ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes
von: Chen, Jianqiu, et al.
Veröffentlicht: (2023)
von: Chen, Jianqiu, et al.
Veröffentlicht: (2023)
Referring Video Object Segmentation via Language-aligned Track Selection
von: Kim, Seongchan, et al.
Veröffentlicht: (2024)
von: Kim, Seongchan, et al.
Veröffentlicht: (2024)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
von: Sun, Baoli, et al.
Veröffentlicht: (2025)
von: Sun, Baoli, et al.
Veröffentlicht: (2025)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
von: Xu, Huihui, et al.
Veröffentlicht: (2025)
von: Xu, Huihui, et al.
Veröffentlicht: (2025)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
von: Zhang, Li, et al.
Veröffentlicht: (2025)
von: Zhang, Li, et al.
Veröffentlicht: (2025)
EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
von: Yan, Yichen, et al.
Veröffentlicht: (2023)
von: Yan, Yichen, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
von: Liu, Xinqi, et al.
Veröffentlicht: (2024) -
1st Place Solution for MOSE Track in CVPR 2024 PVUW Workshop: Complex Video Object Segmentation
von: Miao, Deshui, et al.
Veröffentlicht: (2024) -
Learning Spatial-Semantic Features for Robust Video Object Segmentation
von: Li, Xin, et al.
Veröffentlicht: (2024) -
RTracker: Recoverable Tracking via PN Tree Structured Memory
von: Huang, Yuqing, et al.
Veröffentlicht: (2024) -
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
von: Zhuang, Weijun, et al.
Veröffentlicht: (2026)