Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Chen, Wu, Yu, Zhou, Tianfei, Wang, Wenguan, Yang, Zongxin, Wei, Yunchao, Yang, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scalable Video Object Segmentation with Identification Mechanism
par: Yang, Zongxin, et autres
Publié: (2022)
par: Yang, Zongxin, et autres
Publié: (2022)
Nonverbal Interaction Detection
par: Wei, Jianan, et autres
Publié: (2024)
par: Wei, Jianan, et autres
Publié: (2024)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
par: Liang, Chen, et autres
Publié: (2022)
par: Liang, Chen, et autres
Publié: (2022)
IDPro: Flexible Interactive Video Object Segmentation by ID-queried Concurrent Propagation
par: Li, Kexin, et autres
Publié: (2024)
par: Li, Kexin, et autres
Publié: (2024)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
par: Yang, Zongxin, et autres
Publié: (2024)
par: Yang, Zongxin, et autres
Publié: (2024)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025)
par: Lin, Ci-Siang, et autres
Publié: (2025)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
par: Li, Liulei, et autres
Publié: (2024)
par: Li, Liulei, et autres
Publié: (2024)
Learning Human-Object Interaction as Groups
par: Hong, Jiajun, et autres
Publié: (2025)
par: Hong, Jiajun, et autres
Publié: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
On-Road Object Importance Estimation: A New Dataset and A Model with Multi-Fold Top-Down Guidance
par: Nan, Zhixiong, et autres
Publié: (2024)
par: Nan, Zhixiong, et autres
Publié: (2024)
General and Task-Oriented Video Segmentation
par: Chen, Mu, et autres
Publié: (2024)
par: Chen, Mu, et autres
Publié: (2024)
ClawCraneNet: Leveraging Object-level Relation for Text-based Video Segmentation
par: Liang, Chen, et autres
Publié: (2021)
par: Liang, Chen, et autres
Publié: (2021)
Image Segmentation in Foundation Model Era: A Survey
par: Zhou, Tianfei, et autres
Publié: (2024)
par: Zhou, Tianfei, et autres
Publié: (2024)
3D Object Manipulation in a Single Image using Generative Models
par: Zhao, Ruisi, et autres
Publié: (2025)
par: Zhao, Ruisi, et autres
Publié: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
par: Sun, Baoli, et autres
Publié: (2025)
par: Sun, Baoli, et autres
Publié: (2025)
InterRVOS: Interaction-aware Referring Video Object Segmentation
par: Jin, Woojeong, et autres
Publié: (2025)
par: Jin, Woojeong, et autres
Publié: (2025)
Are Image-to-Video Models Good Zero-Shot Image Editors?
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
Clustering Propagation for Universal Medical Image Segmentation
par: Ding, Yuhang, et autres
Publié: (2024)
par: Ding, Yuhang, et autres
Publié: (2024)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
par: Pei, Gensheng, et autres
Publié: (2024)
par: Pei, Gensheng, et autres
Publié: (2024)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
par: Jiang, Haichao, et autres
Publié: (2026)
par: Jiang, Haichao, et autres
Publié: (2026)
TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking
par: Hu, Jiyuan, et autres
Publié: (2026)
par: Hu, Jiyuan, et autres
Publié: (2026)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
par: Chen, Mu, et autres
Publié: (2025)
par: Chen, Mu, et autres
Publié: (2025)
Rethinking Referring Object Removal
par: Xue, Xiangtian, et autres
Publié: (2024)
par: Xue, Xiangtian, et autres
Publié: (2024)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
par: Guo, Pinxue, et autres
Publié: (2024)
par: Guo, Pinxue, et autres
Publié: (2024)
Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token
par: Zhang, Anqi, et autres
Publié: (2026)
par: Zhang, Anqi, et autres
Publié: (2026)
3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation
par: Zhou, Dewei, et autres
Publié: (2024)
par: Zhou, Dewei, et autres
Publié: (2024)
3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details
par: Zhou, Dewei, et autres
Publié: (2026)
par: Zhou, Dewei, et autres
Publié: (2026)
SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human Reconstruction
par: Zhang, Zechuan, et autres
Publié: (2023)
par: Zhang, Zechuan, et autres
Publié: (2023)
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
par: Liu, Haijing, et autres
Publié: (2025)
par: Liu, Haijing, et autres
Publié: (2025)
Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence Matching
par: Liu, Heng, et autres
Publié: (2025)
par: Liu, Heng, et autres
Publié: (2025)
AINet+: Advancing Superpixel Segmentation via Cascaded Association Implantation
par: Wang, Yaxiong, et autres
Publié: (2021)
par: Wang, Yaxiong, et autres
Publié: (2021)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024)
par: Lin, Ci-Siang, et autres
Publié: (2024)
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Noise-Tolerant Hybrid Prototypical Learning with Noisy Web Data
par: Liang, Chao, et autres
Publié: (2025)
par: Liang, Chao, et autres
Publié: (2025)
Show Me When and Where: Towards Referring Video Object Segmentation in the Wild
par: Gao, Mingqi, et autres
Publié: (2026)
par: Gao, Mingqi, et autres
Publié: (2026)
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension
par: Miao, Peihan, et autres
Publié: (2022)
par: Miao, Peihan, et autres
Publié: (2022)
Documents similaires
-
Scalable Video Object Segmentation with Identification Mechanism
par: Yang, Zongxin, et autres
Publié: (2022) -
Nonverbal Interaction Detection
par: Wei, Jianan, et autres
Publié: (2024) -
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
par: Liang, Chen, et autres
Publié: (2022) -
IDPro: Flexible Interactive Video Object Segmentation by ID-queried Concurrent Propagation
par: Li, Kexin, et autres
Publié: (2024) -
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
par: Yang, Zongxin, et autres
Publié: (2024)