Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miao, Bo, Bennamoun, Mohammed, Gao, Yongsheng, Shah, Mubarak, Mian, Ajmal |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Referring Human Pose and Mask Estimation in the Wild
par: Miao, Bo, et autres
Publié: (2024)
par: Miao, Bo, et autres
Publié: (2024)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
par: Choi, Sun-Hyuk, et autres
Publié: (2025)
par: Choi, Sun-Hyuk, et autres
Publié: (2025)
Sparse Points to Dense Clouds: Enhancing 3D Detection with Limited LiDAR Data
par: Kumar, Aakash, et autres
Publié: (2024)
par: Kumar, Aakash, et autres
Publié: (2024)
Latest Object Memory Management for Temporally Consistent Video Instance Segmentation
par: Lee, Seunghun, et autres
Publié: (2025)
par: Lee, Seunghun, et autres
Publié: (2025)
Deepfake Detection with Spatio-Temporal Consistency and Attention
par: Chen, Yunzhuo, et autres
Publié: (2025)
par: Chen, Yunzhuo, et autres
Publié: (2025)
Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction
par: Vice, Jordan, et autres
Publié: (2024)
par: Vice, Jordan, et autres
Publié: (2024)
TimeLogic: A Temporal Logic Benchmark for Video QA
par: Swetha, Sirnam, et autres
Publié: (2025)
par: Swetha, Sirnam, et autres
Publié: (2025)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025)
par: Lin, Ci-Siang, et autres
Publié: (2025)
Text-guided 3D Human Motion Generation with Keyframe-based Parallel Skip Transformer
par: Geng, Zichen, et autres
Publié: (2024)
par: Geng, Zichen, et autres
Publié: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
par: Liu, Weijia, et autres
Publié: (2024)
par: Liu, Weijia, et autres
Publié: (2024)
Retrieving Objects from 3D Scenes with Box-Guided Open-Vocabulary Instance Segmentation
par: Nguyen, Khanh, et autres
Publié: (2025)
par: Nguyen, Khanh, et autres
Publié: (2025)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
par: Lee, Seunghun, et autres
Publié: (2025)
par: Lee, Seunghun, et autres
Publié: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
par: Liu, Weijia, et autres
Publié: (2025)
par: Liu, Weijia, et autres
Publié: (2025)
From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos
par: Gupta, Animesh, et autres
Publié: (2025)
par: Gupta, Animesh, et autres
Publié: (2025)
Occlusion-aware Text-Image-Point Cloud Pretraining for Open-World 3D Object Recognition
par: Nguyen, Khanh, et autres
Publié: (2025)
par: Nguyen, Khanh, et autres
Publié: (2025)
Hybrid Transformer-Mamba Architecture for Weakly Supervised Volumetric Medical Segmentation
par: Lyu, Yiheng, et autres
Publié: (2025)
par: Lyu, Yiheng, et autres
Publié: (2025)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
par: Yan, Cilin, et autres
Publié: (2025)
par: Yan, Cilin, et autres
Publié: (2025)
SDFA: Structure Aware Discriminative Feature Aggregation for Efficient Human Fall Detection in Video
par: Zahan, Sania, et autres
Publié: (2025)
par: Zahan, Sania, et autres
Publié: (2025)
Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model
par: Zhang, Ruixin, et autres
Publié: (2025)
par: Zhang, Ruixin, et autres
Publié: (2025)
Domain-invariant Prototypes for Semantic Segmentation
par: Yang, Zhengeng, et autres
Publié: (2022)
par: Yang, Zhengeng, et autres
Publié: (2022)
DRBD-Mamba for Robust and Efficient Brain Tumor Segmentation with Analytical Insights
par: Ali, Danish, et autres
Publié: (2025)
par: Ali, Danish, et autres
Publié: (2025)
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
par: Li, Kunyang, et autres
Publié: (2026)
par: Li, Kunyang, et autres
Publié: (2026)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
par: Liang, Li, et autres
Publié: (2025)
par: Liang, Li, et autres
Publié: (2025)
D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities
par: Ali, Danish, et autres
Publié: (2026)
par: Ali, Danish, et autres
Publié: (2026)
UIFormer: A Unified Transformer-based Framework for Incremental Few-Shot Object Detection and Instance Segmentation
par: Zhang, Chengyuan, et autres
Publié: (2024)
par: Zhang, Chengyuan, et autres
Publié: (2024)
One-Shot Medical Video Object Segmentation via Temporal Contrastive Memory Networks
par: Chen, Yaxiong, et autres
Publié: (2025)
par: Chen, Yaxiong, et autres
Publié: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
par: Zhou, Zikun, et autres
Publié: (2024)
par: Zhou, Zikun, et autres
Publié: (2024)
BAWSeg: A UAV Multispectral Benchmark for Barley Weed Segmentation
par: Wang, Haitian, et autres
Publié: (2026)
par: Wang, Haitian, et autres
Publié: (2026)
Language Model Guided Interpretable Video Action Reasoning
par: Wang, Ning, et autres
Publié: (2024)
par: Wang, Ning, et autres
Publié: (2024)
Cross-View Open-Vocabulary Object Detection in Aerial Imagery
par: Kini, Jyoti, et autres
Publié: (2025)
par: Kini, Jyoti, et autres
Publié: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
par: Kulkarni, Parth Parag, et autres
Publié: (2026)
par: Kulkarni, Parth Parag, et autres
Publié: (2026)
Show Me When and Where: Towards Referring Video Object Segmentation in the Wild
par: Gao, Mingqi, et autres
Publié: (2026)
par: Gao, Mingqi, et autres
Publié: (2026)
CroBIM-V: Memory-Quality Controlled Remote Sensing Referring Video Object Segmentation
par: Jiang, H., et autres
Publié: (2026)
par: Jiang, H., et autres
Publié: (2026)
Implicit Neural Representation-Based Continuous Single Image Super-Resolution: An Empirical Benchmark
par: Nasir, Tayyab, et autres
Publié: (2026)
par: Nasir, Tayyab, et autres
Publié: (2026)
Temporally Consistent Object Editing in Videos using Extended Attention
par: Zamani, AmirHossein, et autres
Publié: (2024)
par: Zamani, AmirHossein, et autres
Publié: (2024)
Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
par: Hao, Yutong, et autres
Publié: (2025)
par: Hao, Yutong, et autres
Publié: (2025)
InterRVOS: Interaction-aware Referring Video Object Segmentation
par: Jin, Woojeong, et autres
Publié: (2025)
par: Jin, Woojeong, et autres
Publié: (2025)
Documents similaires
-
Referring Human Pose and Mask Estimation in the Wild
par: Miao, Bo, et autres
Publié: (2024) -
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
par: Choi, Sun-Hyuk, et autres
Publié: (2025) -
Sparse Points to Dense Clouds: Enhancing 3D Detection with Limited LiDAR Data
par: Kumar, Aakash, et autres
Publié: (2024) -
Latest Object Memory Management for Temporally Consistent Video Instance Segmentation
par: Lee, Seunghun, et autres
Publié: (2025) -
Deepfake Detection with Spatio-Temporal Consistency and Attention
par: Chen, Yunzhuo, et autres
Publié: (2025)