SVAC: Scaling Is All You Need For Referring Video Object Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Li, Gao, Haoxiang, Zhang, Zhihao, Huang, Luoxiao, Zhang, Tao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Positive Label Is All You Need for Multi-Label Classification
by: Yuan, Zhixiang, et al.
Published: (2023)
by: Yuan, Zhixiang, et al.
Published: (2023)
Moving Object Segmentation: All You Need Is SAM (and Flow)
by: Xie, Junyu, et al.
Published: (2024)
by: Xie, Junyu, et al.
Published: (2024)
Ideal Registration? Segmentation is All You Need
by: Chen, Xiang, et al.
Published: (2025)
by: Chen, Xiang, et al.
Published: (2025)
Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluation
by: Zhou, Qiji, et al.
Published: (2025)
by: Zhou, Qiji, et al.
Published: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
by: Liang, Tianming, et al.
Published: (2025)
by: Liang, Tianming, et al.
Published: (2025)
Search is All You Need for Few-shot Anomaly Detection
by: Wang, Qishan, et al.
Published: (2025)
by: Wang, Qishan, et al.
Published: (2025)
Mitigating Query Selection Bias in Referring Video Object Segmentation
by: Zhang, Dingwei, et al.
Published: (2025)
by: Zhang, Dingwei, et al.
Published: (2025)
Emu3: Next-Token Prediction is All You Need
by: Wang, Xinlong, et al.
Published: (2024)
by: Wang, Xinlong, et al.
Published: (2024)
Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
by: Zhang, Ruixin, et al.
Published: (2025)
by: Zhang, Ruixin, et al.
Published: (2025)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
by: Li, Wanyun, et al.
Published: (2024)
by: Li, Wanyun, et al.
Published: (2024)
[MASK] is All You Need
by: Hu, Vincent Tao, et al.
Published: (2024)
by: Hu, Vincent Tao, et al.
Published: (2024)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
by: Yang, Zuopeng, et al.
Published: (2025)
by: Yang, Zuopeng, et al.
Published: (2025)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
by: Miao, Bo, et al.
Published: (2024)
by: Miao, Bo, et al.
Published: (2024)
ClickVOS: Click Video Object Segmentation
by: Guo, Pinxue, et al.
Published: (2024)
by: Guo, Pinxue, et al.
Published: (2024)
Performance is not All You Need: Sustainability Considerations for Algorithms
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
Multiple Object Tracking in Video SAR: A Benchmark and Tracking Baseline
by: Chen, Haoxiang, et al.
Published: (2025)
by: Chen, Haoxiang, et al.
Published: (2025)
Similarity Memory Prior is All You Need for Medical Image Segmentation
by: Tang, Hao, et al.
Published: (2025)
by: Tang, Hao, et al.
Published: (2025)
Fast Wrong-way Cycling Detection in CCTV Videos: Sparse Sampling is All You Need
by: Xu, Jing, et al.
Published: (2024)
by: Xu, Jing, et al.
Published: (2024)
Synchronization is All You Need: Exocentric-to-Egocentric Transfer for Temporal Action Segmentation with Unlabeled Synchronized Video Pairs
by: Quattrocchi, Camillo, et al.
Published: (2023)
by: Quattrocchi, Camillo, et al.
Published: (2023)
RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation
by: Li, Yonglin, et al.
Published: (2023)
by: Li, Yonglin, et al.
Published: (2023)
MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation
by: Rong, Fu, et al.
Published: (2025)
by: Rong, Fu, et al.
Published: (2025)
SMPL Normal Map Is All You Need for Single-view Textured Human Reconstruction
by: Shen, Wenhao, et al.
Published: (2025)
by: Shen, Wenhao, et al.
Published: (2025)
Transferable-guided Attention Is All You Need for Video Domain Adaptation
by: Sacilotti, André, et al.
Published: (2024)
by: Sacilotti, André, et al.
Published: (2024)
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
by: Shi, Miaojing, et al.
Published: (2026)
by: Shi, Miaojing, et al.
Published: (2026)
Unlearnable 3D Point Clouds: Class-wise Transformation Is All You Need
by: Wang, Xianlong, et al.
Published: (2024)
by: Wang, Xianlong, et al.
Published: (2024)
Enpowering Your Pansharpening Models with Generalizability: Unified Distribution is All You Need
by: Cui, Yongchuan, et al.
Published: (2025)
by: Cui, Yongchuan, et al.
Published: (2025)
UW-VOS: A Large-Scale Dataset for Underwater Video Object Segmentation
by: Zhao, Hongshen, et al.
Published: (2026)
by: Zhao, Hongshen, et al.
Published: (2026)
Scoring, Remember, and Reference: Catching Camouflaged Objects in Videos
by: Feng, Yuang, et al.
Published: (2025)
by: Feng, Yuang, et al.
Published: (2025)
Generalize Your Face Forgery Detectors: An Insertable Adaptation Module Is All You Need
by: Si, Xiaotian, et al.
Published: (2024)
by: Si, Xiaotian, et al.
Published: (2024)
Is Discretization Fusion All You Need for Collaborative Perception?
by: Yang, Kang, et al.
Published: (2025)
by: Yang, Kang, et al.
Published: (2025)
Pairwise Comparisons Are All You Need
by: Chahine, Nicolas, et al.
Published: (2024)
by: Chahine, Nicolas, et al.
Published: (2024)
Show Me When and Where: Towards Referring Video Object Segmentation in the Wild
by: Gao, Mingqi, et al.
Published: (2026)
by: Gao, Mingqi, et al.
Published: (2026)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
by: Xiao, Changcheng, et al.
Published: (2024)
by: Xiao, Changcheng, et al.
Published: (2024)
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
by: Liu, Haijing, et al.
Published: (2025)
by: Liu, Haijing, et al.
Published: (2025)
Memory augment is All You Need for image restoration
by: Zhang, Xiao Feng, et al.
Published: (2023)
by: Zhang, Xiao Feng, et al.
Published: (2023)
LightStereo: Channel Boost Is All You Need for Efficient 2D Cost Aggregation
by: Guo, Xianda, et al.
Published: (2024)
by: Guo, Xianda, et al.
Published: (2024)
You Only Need Two Detectors to Achieve Multi-Modal 3D Multi-Object Tracking
by: Wang, Xiyang, et al.
Published: (2023)
by: Wang, Xiyang, et al.
Published: (2023)
InterRVOS: Interaction-aware Referring Video Object Segmentation
by: Jin, Woojeong, et al.
Published: (2025)
by: Jin, Woojeong, et al.
Published: (2025)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
by: Lin, Ci-Siang, et al.
Published: (2025)
by: Lin, Ci-Siang, et al.
Published: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
by: Sun, Baoli, et al.
Published: (2025)
by: Sun, Baoli, et al.
Published: (2025)
Similar Items
-
Positive Label Is All You Need for Multi-Label Classification
by: Yuan, Zhixiang, et al.
Published: (2023) -
Moving Object Segmentation: All You Need Is SAM (and Flow)
by: Xie, Junyu, et al.
Published: (2024) -
Ideal Registration? Segmentation is All You Need
by: Chen, Xiang, et al.
Published: (2025) -
Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluation
by: Zhou, Qiji, et al.
Published: (2025) -
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
by: Liang, Tianming, et al.
Published: (2025)