DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yikang, Zhang, Tao, Ji, Shunping, Yan, Shuicheng, Li, Xiangtai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation
por: Niu, Quanzhu, et al.
Publicado: (2025)
por: Niu, Quanzhu, et al.
Publicado: (2025)
Dense360: Dense Understanding from Omnidirectional Panoramas
por: Zhou, Yikang, et al.
Publicado: (2025)
por: Zhou, Yikang, et al.
Publicado: (2025)
Point Cloud Mamba: Point Cloud Learning via State Space Model
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
por: Zhou, Yikang, et al.
Publicado: (2025)
por: Zhou, Yikang, et al.
Publicado: (2025)
SAM-DAQ: Segment Anything Model with Depth-guided Adaptive Queries for RGB-D Video Salient Object Detection
por: Lin, Jia, et al.
Publicado: (2025)
por: Lin, Jia, et al.
Publicado: (2025)
P2PFormer: A Primitive-to-polygon Method for Regular Building Contour Extraction from Remote Sensing Images
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
por: Niu, Quanzhu, et al.
Publicado: (2025)
por: Niu, Quanzhu, et al.
Publicado: (2025)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
por: Huang, Kuan-Chih, et al.
Publicado: (2024)
por: Huang, Kuan-Chih, et al.
Publicado: (2024)
Explore In-Context Segmentation via Latent Diffusion Models
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
Video Object Segmentation with Dynamic Query Modulation
por: Zhou, Hantao, et al.
Publicado: (2024)
por: Zhou, Hantao, et al.
Publicado: (2024)
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
por: Qian, Rui, et al.
Publicado: (2026)
por: Qian, Rui, et al.
Publicado: (2026)
A Novel Shape Guided Transformer Network for Instance Segmentation in Remote Sensing Images
por: Yu, Dawen, et al.
Publicado: (2024)
por: Yu, Dawen, et al.
Publicado: (2024)
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
por: Wu, Shengqiong, et al.
Publicado: (2024)
por: Wu, Shengqiong, et al.
Publicado: (2024)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
por: Gong, Dengxian, et al.
Publicado: (2026)
por: Gong, Dengxian, et al.
Publicado: (2026)
DGMamba: Domain Generalization via Generalized State Space Model
por: Long, Shaocong, et al.
Publicado: (2024)
por: Long, Shaocong, et al.
Publicado: (2024)
PointDGMamba: Domain Generalization of Point Cloud Classification via Generalized State Space Model
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
DeH4R: A Decoupled and Hybrid Method for Road Network Graph Extraction
por: Gong, Dengxian, et al.
Publicado: (2025)
por: Gong, Dengxian, et al.
Publicado: (2025)
PointDGRWKV: Generalizing RWKV-like Architecture to Unseen Domains for Point Cloud Classification
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
SAMTok: Representing Any Mask with Two Words
por: Zhou, Yikang, et al.
Publicado: (2026)
por: Zhou, Yikang, et al.
Publicado: (2026)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
por: Bai, Jinbin, et al.
Publicado: (2024)
por: Bai, Jinbin, et al.
Publicado: (2024)
DC-SAM: In-Context Segment Anything in Images and Videos via Dual Consistency
por: Qi, Mengshi, et al.
Publicado: (2025)
por: Qi, Mengshi, et al.
Publicado: (2025)
Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation
por: Nadeem, Numair, et al.
Publicado: (2025)
por: Nadeem, Numair, et al.
Publicado: (2025)
SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents
por: Yang, Yu, et al.
Publicado: (2026)
por: Yang, Yu, et al.
Publicado: (2026)
UniVS: Unified and Universal Video Segmentation with Prompts as Queries
por: Li, Minghan, et al.
Publicado: (2024)
por: Li, Minghan, et al.
Publicado: (2024)
Enhancing 3D Object Detection with 2D Detection-Guided Query Anchors
por: Ji, Haoxuanye, et al.
Publicado: (2024)
por: Ji, Haoxuanye, et al.
Publicado: (2024)
EasyInv: Toward Fast and Better DDIM Inversion
por: Zhang, Ziyue, et al.
Publicado: (2024)
por: Zhang, Ziyue, et al.
Publicado: (2024)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
Hierarchical Banzhaf Interaction for General Video-Language Representation Learning
por: Jin, Peng, et al.
Publicado: (2024)
por: Jin, Peng, et al.
Publicado: (2024)
AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation
por: Xu, Ziyi, et al.
Publicado: (2024)
por: Xu, Ziyi, et al.
Publicado: (2024)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
por: Bai, Jinbin, et al.
Publicado: (2024)
por: Bai, Jinbin, et al.
Publicado: (2024)
FarmMind: Reasoning-Query-Driven Dynamic Segmentation for Farmland Remote Sensing Images
por: Wu, Haiyang, et al.
Publicado: (2026)
por: Wu, Haiyang, et al.
Publicado: (2026)
UniVST: A Unified Framework for Training-free Localized Video Style Transfer
por: Song, Quanjian, et al.
Publicado: (2024)
por: Song, Quanjian, et al.
Publicado: (2024)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
por: Xue, Zhucun, et al.
Publicado: (2025)
por: Xue, Zhucun, et al.
Publicado: (2025)
VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
por: Zhang, Yikang, et al.
Publicado: (2025)
por: Zhang, Yikang, et al.
Publicado: (2025)
3D Gaussian Splatting for Large-scale Surface Reconstruction from Aerial Images
por: Wu, YuanZheng, et al.
Publicado: (2024)
por: Wu, YuanZheng, et al.
Publicado: (2024)
VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
Ejemplares similares
-
Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation
por: Niu, Quanzhu, et al.
Publicado: (2025) -
Dense360: Dense Understanding from Omnidirectional Panoramas
por: Zhou, Yikang, et al.
Publicado: (2025) -
Point Cloud Mamba: Point Cloud Learning via State Space Model
por: Zhang, Tao, et al.
Publicado: (2024) -
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024) -
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
por: Zhou, Yikang, et al.
Publicado: (2025)