Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ruixin, Fan, Jiaqing, Liao, Yifan, Qiao, Qian, Li, Fanzhang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory
par: Zhu, Zhengtong, et autres
Publié: (2026)
par: Zhu, Zhengtong, et autres
Publié: (2026)
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
par: Zhu, Zixin, et autres
Publié: (2024)
par: Zhu, Zixin, et autres
Publié: (2024)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
par: Peng, Bo, et autres
Publié: (2023)
par: Peng, Bo, et autres
Publié: (2023)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
par: Choi, Sun-Hyuk, et autres
Publié: (2025)
par: Choi, Sun-Hyuk, et autres
Publié: (2025)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025)
par: Lin, Ci-Siang, et autres
Publié: (2025)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
par: Miao, Bo, et autres
Publié: (2024)
par: Miao, Bo, et autres
Publié: (2024)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
par: Zhou, Zikun, et autres
Publié: (2024)
par: Zhou, Zikun, et autres
Publié: (2024)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
par: Lee, Seunghun, et autres
Publié: (2025)
par: Lee, Seunghun, et autres
Publié: (2025)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
par: Shi, Miaojing, et autres
Publié: (2026)
par: Shi, Miaojing, et autres
Publié: (2026)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
par: Yan, Cilin, et autres
Publié: (2025)
par: Yan, Cilin, et autres
Publié: (2025)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation
par: Zhao, Bingrui, et autres
Publié: (2025)
par: Zhao, Bingrui, et autres
Publié: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling
par: Qiu, Haonan, et autres
Publié: (2023)
par: Qiu, Haonan, et autres
Publié: (2023)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
par: Chen, Jinshu, et autres
Publié: (2025)
par: Chen, Jinshu, et autres
Publié: (2025)
Training-Free Robust Interactive Video Object Segmentation
par: Wei, Xiaoli, et autres
Publié: (2024)
par: Wei, Xiaoli, et autres
Publié: (2024)
MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation
par: Rong, Fu, et autres
Publié: (2025)
par: Rong, Fu, et autres
Publié: (2025)
RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation
par: Li, Yonglin, et autres
Publié: (2023)
par: Li, Yonglin, et autres
Publié: (2023)
LoSh: Long-Short Text Joint Prediction Network for Referring Video Object Segmentation
par: Yuan, Linfeng, et autres
Publié: (2023)
par: Yuan, Linfeng, et autres
Publié: (2023)
Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models
par: Hassan, Mariam, et autres
Publié: (2025)
par: Hassan, Mariam, et autres
Publié: (2025)
Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation
par: Zhuge, Yunzhi, et autres
Publié: (2025)
par: Zhuge, Yunzhi, et autres
Publié: (2025)
InterRVOS: Interaction-aware Referring Video Object Segmentation
par: Jin, Woojeong, et autres
Publié: (2025)
par: Jin, Woojeong, et autres
Publié: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
par: Sun, Baoli, et autres
Publié: (2025)
par: Sun, Baoli, et autres
Publié: (2025)
VRMDiff: Text-Guided Video Referring Matting Generation of Diffusion
par: Yang, Lehan, et autres
Publié: (2025)
par: Yang, Lehan, et autres
Publié: (2025)
Mitigating Query Selection Bias in Referring Video Object Segmentation
par: Zhang, Dingwei, et autres
Publié: (2025)
par: Zhang, Dingwei, et autres
Publié: (2025)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
par: Yuan, Yuqian, et autres
Publié: (2024)
par: Yuan, Yuqian, et autres
Publié: (2024)
TALDS-Net: Task-Aware Adaptive Local Descriptors Selection for Few-shot Image Classification
par: Qiao, Qian, et autres
Publié: (2023)
par: Qiao, Qian, et autres
Publié: (2023)
A Simple Task-aware Contrastive Local Descriptor Selection Strategy for Few-shot Learning between inter class and intra class
par: Qiao, Qian, et autres
Publié: (2024)
par: Qiao, Qian, et autres
Publié: (2024)
Tsanet: Temporal and Scale Alignment for Unsupervised Video Object Segmentation
par: Lee, Seunghoon, et autres
Publié: (2023)
par: Lee, Seunghoon, et autres
Publié: (2023)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
par: Xu, Huihui, et autres
Publié: (2025)
par: Xu, Huihui, et autres
Publié: (2025)
Referring Video Object Segmentation via Language-aligned Track Selection
par: Kim, Seongchan, et autres
Publié: (2024)
par: Kim, Seongchan, et autres
Publié: (2024)
Learning Temporally Consistent Video Depth from Video Diffusion Priors
par: Shao, Jiahao, et autres
Publié: (2024)
par: Shao, Jiahao, et autres
Publié: (2024)
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
par: Huang, Shaofei, et autres
Publié: (2024)
par: Huang, Shaofei, et autres
Publié: (2024)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
par: Wang, Zanyi, et autres
Publié: (2025)
par: Wang, Zanyi, et autres
Publié: (2025)
Text-Guided Video Masked Autoencoder
par: Fan, David, et autres
Publié: (2024)
par: Fan, David, et autres
Publié: (2024)
Text-based Talking Video Editing with Cascaded Conditional Diffusion
par: Han, Bo, et autres
Publié: (2024)
par: Han, Bo, et autres
Publié: (2024)
ClickVOS: Click Video Object Segmentation
par: Guo, Pinxue, et autres
Publié: (2024)
par: Guo, Pinxue, et autres
Publié: (2024)
Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction
par: Shen, Yiqing, et autres
Publié: (2025)
par: Shen, Yiqing, et autres
Publié: (2025)
Documents similaires
-
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory
par: Zhu, Zhengtong, et autres
Publié: (2026) -
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
par: Zhu, Zixin, et autres
Publié: (2024) -
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
par: Peng, Bo, et autres
Publié: (2023) -
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
par: Choi, Sun-Hyuk, et autres
Publié: (2025) -
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025)