Referring Video Object Segmentation via Language-aligned Track Selection
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Seongchan, Jin, Woojeong, Lim, Sangbeom, Yoon, Heeji, Choi, Hyunwook, Kim, Seungryong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InterRVOS: Interaction-aware Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2025)
di: Jin, Woojeong, et al.
Pubblicazione: (2025)
Multi-Granularity Video Object Segmentation
di: Lim, Sangbeom, et al.
Pubblicazione: (2024)
di: Lim, Sangbeom, et al.
Pubblicazione: (2024)
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2026)
di: Jin, Woojeong, et al.
Pubblicazione: (2026)
URECA: Unique Region Caption Anything
di: Lim, Sangbeom, et al.
Pubblicazione: (2025)
di: Lim, Sangbeom, et al.
Pubblicazione: (2025)
MATRIX: Mask Track Alignment for Interaction-aware Video Generation
di: Jin, Siyoon, et al.
Pubblicazione: (2025)
di: Jin, Siyoon, et al.
Pubblicazione: (2025)
VideoMaMa: Mask-Guided Video Matting via Generative Prior
di: Lim, Sangbeom, et al.
Pubblicazione: (2026)
di: Lim, Sangbeom, et al.
Pubblicazione: (2026)
S^4M: Boosting Semi-Supervised Instance Segmentation with SAM
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression
di: Yi, Jung, et al.
Pubblicazione: (2025)
di: Yi, Jung, et al.
Pubblicazione: (2025)
PLOT: Pseudo-Labeling via Video Object Tracking for Scalable Monocular 3D Object Detection
di: Lee, Seokyeong, et al.
Pubblicazione: (2025)
di: Lee, Seokyeong, et al.
Pubblicazione: (2025)
Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
di: Kim, Chaehyun, et al.
Pubblicazione: (2025)
di: Kim, Chaehyun, et al.
Pubblicazione: (2025)
Talk3D: High-Fidelity Talking Portrait Synthesis via Personalized 3D Generative Prior
di: Ko, Jaehoon, et al.
Pubblicazione: (2024)
di: Ko, Jaehoon, et al.
Pubblicazione: (2024)
GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting
di: Cho, Kyusun, et al.
Pubblicazione: (2024)
di: Cho, Kyusun, et al.
Pubblicazione: (2024)
ILV: Iterative Latent Volumes for Fast and Accurate Sparse-View CT Reconstruction
di: Lee, Seungryong, et al.
Pubblicazione: (2026)
di: Lee, Seungryong, et al.
Pubblicazione: (2026)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
MV-TAP: Tracking Any Point in Multi-View Videos
di: Koo, Jahyeok, et al.
Pubblicazione: (2025)
di: Koo, Jahyeok, et al.
Pubblicazione: (2025)
High-Quality Unknown Object Instance Segmentation via Quadruple Boundary Error Refinement
di: Back, Seunghyeok, et al.
Pubblicazione: (2023)
di: Back, Seunghyeok, et al.
Pubblicazione: (2023)
Repurposing Video Diffusion Transformers for Robust Point Tracking
di: Son, Soowon, et al.
Pubblicazione: (2025)
di: Son, Soowon, et al.
Pubblicazione: (2025)
TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking
di: Nam, Jisu, et al.
Pubblicazione: (2026)
di: Nam, Jisu, et al.
Pubblicazione: (2026)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
di: Choi, Sun-Hyuk, et al.
Pubblicazione: (2025)
di: Choi, Sun-Hyuk, et al.
Pubblicazione: (2025)
Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation
di: Kim, Jihun, et al.
Pubblicazione: (2026)
di: Kim, Jihun, et al.
Pubblicazione: (2026)
Grounding World Simulation Models in a Real-World Metropolis
di: Seo, Junyoung, et al.
Pubblicazione: (2026)
di: Seo, Junyoung, et al.
Pubblicazione: (2026)
Find First, Track Next: Decoupling Identification and Propagation in Referring Video Object Segmentation
di: Cho, Suhwan, et al.
Pubblicazione: (2025)
di: Cho, Suhwan, et al.
Pubblicazione: (2025)
Moiré Zero: An Efficient and High-Performance Neural Architecture for Moiré Removal
di: Lee, Seungryong, et al.
Pubblicazione: (2025)
di: Lee, Seungryong, et al.
Pubblicazione: (2025)
V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping
di: Lee, Hyunkoo, et al.
Pubblicazione: (2025)
di: Lee, Hyunkoo, et al.
Pubblicazione: (2025)
Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification
di: Kim, Inès Hyeonsu, et al.
Pubblicazione: (2024)
di: Kim, Inès Hyeonsu, et al.
Pubblicazione: (2024)
Mitigating Query Selection Bias in Referring Video Object Segmentation
di: Zhang, Dingwei, et al.
Pubblicazione: (2025)
di: Zhang, Dingwei, et al.
Pubblicazione: (2025)
Dual Prototype Attention for Unsupervised Video Object Segmentation
di: Cho, Suhwan, et al.
Pubblicazione: (2022)
di: Cho, Suhwan, et al.
Pubblicazione: (2022)
Emergent Temporal Correspondences from Video Diffusion Transformers
di: Nam, Jisu, et al.
Pubblicazione: (2025)
di: Nam, Jisu, et al.
Pubblicazione: (2025)
Treating Motion as Option with Output Selection for Unsupervised Video Object Segmentation
di: Cho, Suhwan, et al.
Pubblicazione: (2023)
di: Cho, Suhwan, et al.
Pubblicazione: (2023)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
di: Liang, Tianming, et al.
Pubblicazione: (2025)
di: Liang, Tianming, et al.
Pubblicazione: (2025)
Motion Cues from Image-based Point Tracking for LiDAR Scene Flow Estimation
di: Jang, Youngdong, et al.
Pubblicazione: (2026)
di: Jang, Youngdong, et al.
Pubblicazione: (2026)
Geometry-Aware Score Distillation via 3D Consistent Noising and Gradient Consistency Modeling
di: Kwak, Min-Seop, et al.
Pubblicazione: (2024)
di: Kwak, Min-Seop, et al.
Pubblicazione: (2024)
Exploring Temporally-Aware Features for Point Tracking
di: Kim, Inès Hyeonsu, et al.
Pubblicazione: (2025)
di: Kim, Inès Hyeonsu, et al.
Pubblicazione: (2025)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
di: Xiao, Changcheng, et al.
Pubblicazione: (2024)
di: Xiao, Changcheng, et al.
Pubblicazione: (2024)
TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation
di: Yang, Jini, et al.
Pubblicazione: (2026)
di: Yang, Jini, et al.
Pubblicazione: (2026)
Integrating Query-aware Segmentation and Cross-Attention for Robust VQA
di: Choi, Wonjun, et al.
Pubblicazione: (2024)
di: Choi, Wonjun, et al.
Pubblicazione: (2024)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
di: Miao, Bo, et al.
Pubblicazione: (2024)
di: Miao, Bo, et al.
Pubblicazione: (2024)
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
di: Liu, Haijing, et al.
Pubblicazione: (2025)
di: Liu, Haijing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
InterRVOS: Interaction-aware Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2025) -
Multi-Granularity Video Object Segmentation
di: Lim, Sangbeom, et al.
Pubblicazione: (2024) -
AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
di: Jin, Woojeong, et al.
Pubblicazione: (2026) -
URECA: Unique Region Caption Anything
di: Lim, Sangbeom, et al.
Pubblicazione: (2025) -
MATRIX: Mask Track Alignment for Interaction-aware Video Generation
di: Jin, Siyoon, et al.
Pubblicazione: (2025)