Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiao, Pengkun, Zhao, Na, Chen, Jingjing, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Domain Expansion and Boundary Growth for Open-Set Single-Source Domain Generalization
par: Jiao, Pengkun, et autres
Publié: (2024)
par: Jiao, Pengkun, et autres
Publié: (2024)
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
par: Jiao, Pengkun, et autres
Publié: (2024)
par: Jiao, Pengkun, et autres
Publié: (2024)
Open Vocabulary Monocular 3D Object Detection
par: Yao, Jin, et autres
Publié: (2024)
par: Yao, Jin, et autres
Publié: (2024)
RT-OVAD: Real-Time Open-Vocabulary Aerial Object Detection via Image-Text Collaboration
par: Wei, Guoting, et autres
Publié: (2024)
par: Wei, Guoting, et autres
Publié: (2024)
Visual Textualization for Image Prompted Object Detection
par: Wu, Yongjian, et autres
Publié: (2025)
par: Wu, Yongjian, et autres
Publié: (2025)
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
par: Chen, Yitong, et autres
Publié: (2024)
par: Chen, Yitong, et autres
Publié: (2024)
Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection
par: Zhao, Youjun, et autres
Publié: (2025)
par: Zhao, Youjun, et autres
Publié: (2025)
Enhancing Open-Vocabulary Object Detection through Multi-Level Fine-Grained Visual-Language Alignment
par: Zhang, Tianyi, et autres
Publié: (2026)
par: Zhang, Tianyi, et autres
Publié: (2026)
V3Det Challenge 2024 on Vast Vocabulary and Open Vocabulary Object Detection: Methods and Results
par: Wang, Jiaqi, et autres
Publié: (2024)
par: Wang, Jiaqi, et autres
Publié: (2024)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
Open-Vocabulary 3D Semantic Segmentation with Text-to-Image Diffusion Models
par: Zhu, Xiaoyu, et autres
Publié: (2024)
par: Zhu, Xiaoyu, et autres
Publié: (2024)
Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes
par: Xiang, Xinhao, et autres
Publié: (2025)
par: Xiang, Xinhao, et autres
Publié: (2025)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
par: Chen, Fangyi, et autres
Publié: (2024)
par: Chen, Fangyi, et autres
Publié: (2024)
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
par: Tang, Ziyao, et autres
Publié: (2026)
par: Tang, Ziyao, et autres
Publié: (2026)
Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
par: Ruis, Frank, et autres
Publié: (2025)
par: Ruis, Frank, et autres
Publié: (2025)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
par: Jiao, Pengkun, et autres
Publié: (2025)
par: Jiao, Pengkun, et autres
Publié: (2025)
Uncertainty Meets Diversity: A Comprehensive Active Learning Framework for Indoor 3D Object Detection
par: Wang, Jiangyi, et autres
Publié: (2025)
par: Wang, Jiangyi, et autres
Publié: (2025)
Taming Self-Training for Open-Vocabulary Object Detection
par: Zhao, Shiyu, et autres
Publié: (2023)
par: Zhao, Shiyu, et autres
Publié: (2023)
Scaling Open-Vocabulary Object Detection
par: Minderer, Matthias, et autres
Publié: (2023)
par: Minderer, Matthias, et autres
Publié: (2023)
OpenNav: Efficient Open Vocabulary 3D Object Detection for Smart Wheelchair Navigation
par: Rahman, Muhammad Rameez ur, et autres
Publié: (2024)
par: Rahman, Muhammad Rameez ur, et autres
Publié: (2024)
Open3DIS: Open-Vocabulary 3D Instance Segmentation with 2D Mask Guidance
par: Nguyen, Phuc D. A., et autres
Publié: (2023)
par: Nguyen, Phuc D. A., et autres
Publié: (2023)
TextField3D: Towards Enhancing Open-Vocabulary 3D Generation with Noisy Text Fields
par: Huang, Tianyu, et autres
Publié: (2023)
par: Huang, Tianyu, et autres
Publié: (2023)
OpenM3D: Open Vocabulary Multi-view Indoor 3D Object Detection without Human Annotations
par: Hsu, Peng-Hao, et autres
Publié: (2025)
par: Hsu, Peng-Hao, et autres
Publié: (2025)
Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection
par: Cao, Weihao, et autres
Publié: (2026)
par: Cao, Weihao, et autres
Publié: (2026)
Exploring Open-Vocabulary Object Recognition in Images using CLIP
par: Chen, Wei Yu, et autres
Publié: (2026)
par: Chen, Wei Yu, et autres
Publié: (2026)
Evaluating the Performance of Open-Vocabulary Object Detection in Low-quality Image
par: Wu, Po-Chih
Publié: (2025)
par: Wu, Po-Chih
Publié: (2025)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
par: Jiao, Siyu, et autres
Publié: (2024)
par: Jiao, Siyu, et autres
Publié: (2024)
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation
par: Luo, Jun, et autres
Publié: (2026)
par: Luo, Jun, et autres
Publié: (2026)
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
par: Yuan, Zhihao, et autres
Publié: (2023)
par: Yuan, Zhihao, et autres
Publié: (2023)
Auto-Vocabulary 3D Object Detection
par: Zhang, Haomeng, et autres
Publié: (2025)
par: Zhang, Haomeng, et autres
Publié: (2025)
Learning to Detect and Segment for Open Vocabulary Object Detection
par: Wang, Tao, et autres
Publié: (2022)
par: Wang, Tao, et autres
Publié: (2022)
Retrieval-Augmented Open-Vocabulary Object Detection
par: Kim, Jooyeon, et autres
Publié: (2024)
par: Kim, Jooyeon, et autres
Publié: (2024)
Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection
par: Kim, Youbin, et autres
Publié: (2026)
par: Kim, Youbin, et autres
Publié: (2026)
Training an Open-Vocabulary Monocular 3D Object Detection Model without 3D Data
par: Huang, Rui, et autres
Publié: (2024)
par: Huang, Rui, et autres
Publié: (2024)
ImOV3D: Learning Open-Vocabulary Point Clouds 3D Object Detection from Only 2D Images
par: Yang, Timing, et autres
Publié: (2024)
par: Yang, Timing, et autres
Publié: (2024)
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
par: Zhang, Yupeng, et autres
Publié: (2025)
par: Zhang, Yupeng, et autres
Publié: (2025)
State and Scene Enhanced Prototypes for Weakly Supervised Open-Vocabulary Object Detection
par: Zhou, Jiaying, et autres
Publié: (2025)
par: Zhou, Jiaying, et autres
Publié: (2025)
Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images
par: Yang, Shuai, et autres
Publié: (2026)
par: Yang, Shuai, et autres
Publié: (2026)
Open-Vocabulary Camouflaged Object Segmentation
par: Pang, Youwei, et autres
Publié: (2023)
par: Pang, Youwei, et autres
Publié: (2023)
OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection
par: Chow, Adrian, et autres
Publié: (2025)
par: Chow, Adrian, et autres
Publié: (2025)
Documents similaires
-
Domain Expansion and Boundary Growth for Open-Set Single-Source Domain Generalization
par: Jiao, Pengkun, et autres
Publié: (2024) -
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
par: Jiao, Pengkun, et autres
Publié: (2024) -
Open Vocabulary Monocular 3D Object Detection
par: Yao, Jin, et autres
Publié: (2024) -
RT-OVAD: Real-Time Open-Vocabulary Aerial Object Detection via Image-Text Collaboration
par: Wei, Guoting, et autres
Publié: (2024) -
Visual Textualization for Image Prompted Object Detection
par: Wu, Yongjian, et autres
Publié: (2025)