Multi-Object 3D Grounding with Dynamic Modules and Language-Informed Spatial Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haomeng, Yang, Chiao-An, Yeh, Raymond A. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Auto-Vocabulary 3D Object Detection
par: Zhang, Haomeng, et autres
Publié: (2025)
par: Zhang, Haomeng, et autres
Publié: (2025)
Heatmap Regression without Soft-Argmax for Facial Landmark Detection
par: Yang, Chiao-An, et autres
Publié: (2025)
par: Yang, Chiao-An, et autres
Publié: (2025)
Learning to Obstruct Few-Shot Image Classification over Restricted Classes
par: Zheng, Amber Yijia, et autres
Publié: (2024)
par: Zheng, Amber Yijia, et autres
Publié: (2024)
Toward Long-Tailed Online Anomaly Detection through Class-Agnostic Concepts
par: Yang, Chiao-An, et autres
Publié: (2025)
par: Yang, Chiao-An, et autres
Publié: (2025)
Deep Nets with Subsampling Layers Unwittingly Discard Useful Activations at Test-Time
par: Yang, Chiao-An, et autres
Publié: (2024)
par: Yang, Chiao-An, et autres
Publié: (2024)
Multi-Task Domain Adaptation for Language Grounding with 3D Objects
par: Sun, Penglei, et autres
Publié: (2024)
par: Sun, Penglei, et autres
Publié: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
par: Yang, Chiao-An, et autres
Publié: (2025)
par: Yang, Chiao-An, et autres
Publié: (2025)
3D Small Object Detection with Dynamic Spatial Pruning
par: Xu, Xiuwei, et autres
Publié: (2023)
par: Xu, Xiuwei, et autres
Publié: (2023)
Multi-concept Model Immunization through Differentiable Model Merging
par: Zheng, Amber Yijia, et autres
Publié: (2024)
par: Zheng, Amber Yijia, et autres
Publié: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Cross-Layer Feature Self-Attention Module for Multi-Scale Object Detection
par: Xie, Dingzhou, et autres
Publié: (2025)
par: Xie, Dingzhou, et autres
Publié: (2025)
Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking
par: Zhang, Haonan, et autres
Publié: (2025)
par: Zhang, Haonan, et autres
Publié: (2025)
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
par: Zantout, Nader, et autres
Publié: (2025)
par: Zantout, Nader, et autres
Publié: (2025)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection
par: Zhang, Yifan, et autres
Publié: (2023)
par: Zhang, Yifan, et autres
Publié: (2023)
SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
Radar-Informed 3D Multi-Object Tracking under Adverse Conditions
par: Xu, Bingxue, et autres
Publié: (2026)
par: Xu, Bingxue, et autres
Publié: (2026)
Style3D: Attention-guided Multi-view Style Transfer for 3D Object Generation
par: Song, Bingjie, et autres
Publié: (2024)
par: Song, Bingjie, et autres
Publié: (2024)
From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes
par: Wang, Tianxu, et autres
Publié: (2025)
par: Wang, Tianxu, et autres
Publié: (2025)
LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulation
par: Ji, Haoyu, et autres
Publié: (2026)
par: Ji, Haoyu, et autres
Publié: (2026)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
par: Shaker, Abdelrahman, et autres
Publié: (2024)
par: Shaker, Abdelrahman, et autres
Publié: (2024)
Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention
par: Wu, Shuang, et autres
Publié: (2025)
par: Wu, Shuang, et autres
Publié: (2025)
UniDet-D: A Unified Dynamic Spectral Attention Model for Object Detection under Adverse Weathers
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
WildRefer: 3D Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural Language
par: Lin, Zhenxiang, et autres
Publié: (2023)
par: Lin, Zhenxiang, et autres
Publié: (2023)
OcRFDet: Object-Centric Radiance Fields for Multi-View 3D Object Detection in Autonomous Driving
par: Ji, Mingqian, et autres
Publié: (2025)
par: Ji, Mingqian, et autres
Publié: (2025)
Semantic Consistent Language Gaussian Splatting for Point-Level Open-vocabulary Querying
par: Yin, Hairong, et autres
Publié: (2025)
par: Yin, Hairong, et autres
Publié: (2025)
A Dual-Modulation Framework for RGB-T Crowd Counting via Spatially Modulated Attention and Adaptive Fusion
par: Feng, Yuhong, et autres
Publié: (2025)
par: Feng, Yuhong, et autres
Publié: (2025)
GraphFusion3D: Dynamic Graph Attention Convolution with Adaptive Cross-Modal Transformer for 3D Object Detection
par: Mia, Md Sohag, et autres
Publié: (2025)
par: Mia, Md Sohag, et autres
Publié: (2025)
CLIPSym: Delving into Symmetry Detection with CLIP
par: Yang, Tinghan, et autres
Publié: (2025)
par: Yang, Tinghan, et autres
Publié: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
par: Liang, Huizhi, et autres
Publié: (2026)
par: Liang, Huizhi, et autres
Publié: (2026)
Edge Attention Module for Object Classification
par: Roy, Santanu, et autres
Publié: (2025)
par: Roy, Santanu, et autres
Publié: (2025)
IMMA: Immunizing text-to-image Models against Malicious Adaptation
par: Zheng, Amber Yijia, et autres
Publié: (2023)
par: Zheng, Amber Yijia, et autres
Publié: (2023)
SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
par: Qi, Zekun, et autres
Publié: (2025)
par: Qi, Zekun, et autres
Publié: (2025)
Hierarchical Point Attention for Indoor 3D Object Detection
par: Shu, Manli, et autres
Publié: (2023)
par: Shu, Manli, et autres
Publié: (2023)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026)
par: Xie, Junyu, et autres
Publié: (2026)
PVAFN: Point-Voxel Attention Fusion Network with Multi-Pooling Enhancing for 3D Object Detection
par: Li, Yidi, et autres
Publié: (2024)
par: Li, Yidi, et autres
Publié: (2024)
Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding
par: Dey, Sombit, et autres
Publié: (2024)
par: Dey, Sombit, et autres
Publié: (2024)
SFMNet: Sparse Focal Modulation for 3D Object Detection
par: Shrout, Oren, et autres
Publié: (2025)
par: Shrout, Oren, et autres
Publié: (2025)
Documents similaires
-
Auto-Vocabulary 3D Object Detection
par: Zhang, Haomeng, et autres
Publié: (2025) -
Heatmap Regression without Soft-Argmax for Facial Landmark Detection
par: Yang, Chiao-An, et autres
Publié: (2025) -
Learning to Obstruct Few-Shot Image Classification over Restricted Classes
par: Zheng, Amber Yijia, et autres
Publié: (2024) -
Toward Long-Tailed Online Anomaly Detection through Class-Agnostic Concepts
par: Yang, Chiao-An, et autres
Publié: (2025) -
Deep Nets with Subsampling Layers Unwittingly Discard Useful Activations at Test-Time
par: Yang, Chiao-An, et autres
Publié: (2024)