GMOS: Grounding Moving Object Segmentation in 3D Space and Time
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Junyu, Han, Tengda, Xie, Weidi, Zisserman, Andrew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Moving Object Segmentation: All You Need Is SAM (and Flow)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
Appearance-Based Refinement for Object-Centric Motion Segmentation
di: Xie, Junyu, et al.
Pubblicazione: (2023)
di: Xie, Junyu, et al.
Pubblicazione: (2023)
Character-Centric Understanding of Animated Movies
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)
di: Gui, Zhongrui, et al.
Pubblicazione: (2025)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
di: Xie, Junyu, et al.
Pubblicazione: (2024)
di: Xie, Junyu, et al.
Pubblicazione: (2024)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025)
di: Xie, Junyu, et al.
Pubblicazione: (2025)
AutoAD III: The Prequel -- Back to the Pixels
di: Han, Tengda, et al.
Pubblicazione: (2024)
di: Han, Tengda, et al.
Pubblicazione: (2024)
Amodal Ground Truth and Completion in the Wild
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
di: Zhan, Guanqi, et al.
Pubblicazione: (2023)
Made to Order: Discovering monotonic temporal changes via self-supervised video ordering
di: Yang, Charig, et al.
Pubblicazione: (2024)
di: Yang, Charig, et al.
Pubblicazione: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
di: Li, Zeqian, et al.
Pubblicazione: (2023)
di: Li, Zeqian, et al.
Pubblicazione: (2023)
CountGD: Multi-Modal Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
It's Just Another Day: Unique Video Captioning by Discriminative Prompting
di: Perrett, Toby, et al.
Pubblicazione: (2024)
di: Perrett, Toby, et al.
Pubblicazione: (2024)
Inferring Dynamic Physical Properties from Video Foundation Models
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
di: Zhan, Guanqi, et al.
Pubblicazione: (2025)
More than a Moment: Towards Coherent Sequences of Audio Descriptions
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025)
di: Khandelwal, Eshika, et al.
Pubblicazione: (2025)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
Seeing without Pixels: Perception from Camera Trajectories
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Aerial Monocular 3D Object Detection
di: Hu, Yue, et al.
Pubblicazione: (2022)
di: Hu, Yue, et al.
Pubblicazione: (2022)
Synchformer: Efficient Synchronization from Sparse Cues
di: Iashin, Vladimir, et al.
Pubblicazione: (2024)
di: Iashin, Vladimir, et al.
Pubblicazione: (2024)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024)
di: Chen, Qirui, et al.
Pubblicazione: (2024)
Chirality in Action: Time-Aware Video Representation Learning by Latent Straightening
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
di: Yan, Yibin, et al.
Pubblicazione: (2024)
di: Yan, Yibin, et al.
Pubblicazione: (2024)
Open-World Object Counting in Videos
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
ROS-SAM: High-Quality Interactive Segmentation for Remote Sensing Moving Object
di: Shan, Zhe, et al.
Pubblicazione: (2025)
di: Shan, Zhe, et al.
Pubblicazione: (2025)
VISA: Reasoning Video Object Segmentation via Large Language Models
di: Yan, Cilin, et al.
Pubblicazione: (2024)
di: Yan, Cilin, et al.
Pubblicazione: (2024)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
Semantics-Guided Moving Object Segmentation with 3D LiDAR
di: Gu, Shuo, et al.
Pubblicazione: (2022)
di: Gu, Shuo, et al.
Pubblicazione: (2022)
GOR-IS: 3D Gaussian Object Removal in the Intrinsic Space
di: Zhao, Yonghao, et al.
Pubblicazione: (2026)
di: Zhao, Yonghao, et al.
Pubblicazione: (2026)
Learning from Streaming Video with Orthogonal Gradients
di: Han, Tengda, et al.
Pubblicazione: (2025)
di: Han, Tengda, et al.
Pubblicazione: (2025)
Personalizing Retrieval using Joint Embeddings or "the Return of Fluffy"
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
di: Korbar, Bruno, et al.
Pubblicazione: (2025)
The Manga Whisperer: Automatically Generating Transcriptions for Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2024)
From Panels to Prose: Generating Literary Narratives from Comics
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
di: Sachdeva, Ragav, et al.
Pubblicazione: (2025)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
DynamicPose: Real-time and Robust 6D Object Pose Tracking for Fast-Moving Cameras and Objects
di: Liang, Tingbang, et al.
Pubblicazione: (2025)
di: Liang, Tingbang, et al.
Pubblicazione: (2025)
Revisiting Multi-Task Visual Representation Learning
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
Real-World Point Tracking with Verifier-Guided Pseudo-Labeling
di: Aydemir, Görkay, et al.
Pubblicazione: (2026)
di: Aydemir, Görkay, et al.
Pubblicazione: (2026)
Count Anything at Any Granularity
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Track-On2: Enhancing Online Point Tracking with Memory
di: Aydemir, Görkay, et al.
Pubblicazione: (2025)
di: Aydemir, Görkay, et al.
Pubblicazione: (2025)
Can Visual Foundation Models Achieve Long-term Point Tracking?
di: Aydemir, Görkay, et al.
Pubblicazione: (2024)
di: Aydemir, Görkay, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Moving Object Segmentation: All You Need Is SAM (and Flow)
di: Xie, Junyu, et al.
Pubblicazione: (2024) -
Appearance-Based Refinement for Object-Centric Motion Segmentation
di: Xie, Junyu, et al.
Pubblicazione: (2023) -
Character-Centric Understanding of Animated Movies
di: Gui, Zhongrui, et al.
Pubblicazione: (2025) -
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
di: Xie, Junyu, et al.
Pubblicazione: (2024) -
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
di: Xie, Junyu, et al.
Pubblicazione: (2025)