Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zanyi, Jiang, Dengyang, Li, Liuzhuozheng, Dang, Sizhe, Li, Chengzu, Yang, Harry, Dai, Guang, Wang, Mengmeng, Wang, Jingdong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
by: Wang, Zanyi, et al.
Published: (2026)
by: Wang, Zanyi, et al.
Published: (2026)
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
by: Li, Liuzhuozheng, et al.
Published: (2026)
by: Li, Liuzhuozheng, et al.
Published: (2026)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
by: Jiang, Dengyang, et al.
Published: (2025)
by: Jiang, Dengyang, et al.
Published: (2025)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
by: Jiang, Dengyang, et al.
Published: (2025)
by: Jiang, Dengyang, et al.
Published: (2025)
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
by: Wang, Mengmeng, et al.
Published: (2026)
by: Wang, Mengmeng, et al.
Published: (2026)
Distribution Matching Distillation Meets Reinforcement Learning
by: Jiang, Dengyang, et al.
Published: (2025)
by: Jiang, Dengyang, et al.
Published: (2025)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
by: Li, Fan, et al.
Published: (2025)
by: Li, Fan, et al.
Published: (2025)
RefTon: Reference person shot assist virtual Try-on
by: Li, Liuzhuozheng, et al.
Published: (2025)
by: Li, Liuzhuozheng, et al.
Published: (2025)
FMVP: Masked Flow Matching for Adversarial Video Purification
by: Tang, Duoxun, et al.
Published: (2026)
by: Tang, Duoxun, et al.
Published: (2026)
Low-Biased General Annotated Dataset Generation
by: Jiang, Dengyang, et al.
Published: (2024)
by: Jiang, Dengyang, et al.
Published: (2024)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
by: Li, Chengzu, et al.
Published: (2026)
by: Li, Chengzu, et al.
Published: (2026)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
by: Wang, Mengmeng, et al.
Published: (2024)
by: Wang, Mengmeng, et al.
Published: (2024)
Collaborative Position Reasoning Network for Referring Image Segmentation
by: Cao, Jianjian, et al.
Published: (2024)
by: Cao, Jianjian, et al.
Published: (2024)
FlowCut: Unsupervised Video Instance Segmentation via Temporal Mask Matching
by: Sari, Alp Eren, et al.
Published: (2025)
by: Sari, Alp Eren, et al.
Published: (2025)
RefAlign: Representation Alignment for Reference-to-Video Generation
by: Wang, Lei, et al.
Published: (2026)
by: Wang, Lei, et al.
Published: (2026)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
by: Jia, Chengyou, et al.
Published: (2023)
by: Jia, Chengyou, et al.
Published: (2023)
Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence Matching
by: Liu, Heng, et al.
Published: (2025)
by: Liu, Heng, et al.
Published: (2025)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
by: Liu, Qin, et al.
Published: (2024)
by: Liu, Qin, et al.
Published: (2024)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
by: Dai, Ming, et al.
Published: (2025)
by: Dai, Ming, et al.
Published: (2025)
D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
by: Jiang, Dengyang, et al.
Published: (2026)
by: Jiang, Dengyang, et al.
Published: (2026)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
by: Sun, Baoli, et al.
Published: (2025)
by: Sun, Baoli, et al.
Published: (2025)
DeformStream: Deformation-based Adaptive Volumetric Video Streaming
by: Li, Boyan, et al.
Published: (2024)
by: Li, Boyan, et al.
Published: (2024)
DeVOS: Flow-Guided Deformable Transformer for Video Object Segmentation
by: Fedynyak, Volodymyr, et al.
Published: (2024)
by: Fedynyak, Volodymyr, et al.
Published: (2024)
Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild
by: Wang, Haoran, et al.
Published: (2025)
by: Wang, Haoran, et al.
Published: (2025)
Online Reasoning Video Object Segmentation
by: Liu, Jinyuan, et al.
Published: (2026)
by: Liu, Jinyuan, et al.
Published: (2026)
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
by: Jia, Chengyou, et al.
Published: (2023)
by: Jia, Chengyou, et al.
Published: (2023)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
by: Lin, Ci-Siang, et al.
Published: (2025)
by: Lin, Ci-Siang, et al.
Published: (2025)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
by: Lin, Haonan, et al.
Published: (2024)
by: Lin, Haonan, et al.
Published: (2024)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
by: Deng, Yufan, et al.
Published: (2025)
by: Deng, Yufan, et al.
Published: (2025)
Text-Guided Video Masked Autoencoder
by: Fan, David, et al.
Published: (2024)
by: Fan, David, et al.
Published: (2024)
FluxFlow: Conservative Flow-Matching for Astronomical Image Super-Resolution
by: Liu, Shuhong, et al.
Published: (2026)
by: Liu, Shuhong, et al.
Published: (2026)
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA
by: Wu, Zexi, et al.
Published: (2026)
by: Wu, Zexi, et al.
Published: (2026)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
by: Zhou, Zikun, et al.
Published: (2024)
by: Zhou, Zikun, et al.
Published: (2024)
Deep Understanding of Soccer Match Videos
by: Xu, Shikun, et al.
Published: (2024)
by: Xu, Shikun, et al.
Published: (2024)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
by: Lin, Haonan, et al.
Published: (2024)
by: Lin, Haonan, et al.
Published: (2024)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
by: Wang, Wenxuan, et al.
Published: (2023)
by: Wang, Wenxuan, et al.
Published: (2023)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
by: Xing, Jiazheng, et al.
Published: (2023)
by: Xing, Jiazheng, et al.
Published: (2023)
Pyramidal Flow Matching for Efficient Video Generative Modeling
by: Jin, Yang, et al.
Published: (2024)
by: Jin, Yang, et al.
Published: (2024)
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
by: Shi, Miaojing, et al.
Published: (2026)
by: Shi, Miaojing, et al.
Published: (2026)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
by: Liang, Tianming, et al.
Published: (2025)
by: Liang, Tianming, et al.
Published: (2025)
Similar Items
-
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
by: Wang, Zanyi, et al.
Published: (2026) -
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
by: Li, Liuzhuozheng, et al.
Published: (2026) -
AffordanceSAM: Segment Anything Once More in Affordance Grounding
by: Jiang, Dengyang, et al.
Published: (2025) -
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
by: Jiang, Dengyang, et al.
Published: (2025) -
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
by: Wang, Mengmeng, et al.
Published: (2026)