Data-Efficient 3D Visual Grounding via Order-Aware Referring
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Tung-Yu, Huang, Sheng-Yu, Wang, Yu-Chiang Frank |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Toward Scene Graph and Layout Guided Complex 3D Scene Generation
von: Huang, Yu-Hsiang, et al.
Veröffentlicht: (2024)
von: Huang, Yu-Hsiang, et al.
Veröffentlicht: (2024)
TPA3D: Triplane Attention for Fast Text-to-3D Generation
von: Wu, Bin-Shih, et al.
Veröffentlicht: (2023)
von: Wu, Bin-Shih, et al.
Veröffentlicht: (2023)
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
von: Huang, Sheng-Yu, et al.
Veröffentlicht: (2026)
von: Huang, Sheng-Yu, et al.
Veröffentlicht: (2026)
3D Gaussian Inpainting with Depth-Guided Cross-View Consistency
von: Huang, Sheng-Yu, et al.
Veröffentlicht: (2025)
von: Huang, Sheng-Yu, et al.
Veröffentlicht: (2025)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2024)
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2024)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2025)
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2025)
Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration
von: Jun-Seong, Kim, et al.
Veröffentlicht: (2025)
von: Jun-Seong, Kim, et al.
Veröffentlicht: (2025)
Multimodal Reference Visual Grounding
von: Lu, Yangxiao, et al.
Veröffentlicht: (2025)
von: Lu, Yangxiao, et al.
Veröffentlicht: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
von: Liang, Tianming, et al.
Veröffentlicht: (2025)
von: Liang, Tianming, et al.
Veröffentlicht: (2025)
An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding
von: Chen, Wei, et al.
Veröffentlicht: (2024)
von: Chen, Wei, et al.
Veröffentlicht: (2024)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
von: Wang, Xinyi, et al.
Veröffentlicht: (2025)
von: Wang, Xinyi, et al.
Veröffentlicht: (2025)
R2SM: Referring and Reasoning for Selective Masks
von: Shih, Yu-Lin, et al.
Veröffentlicht: (2025)
von: Shih, Yu-Lin, et al.
Veröffentlicht: (2025)
Reference-Based 3D-Aware Image Editing with Triplanes
von: Bilecen, Bahri Batuhan, et al.
Veröffentlicht: (2024)
von: Bilecen, Bahri Batuhan, et al.
Veröffentlicht: (2024)
GSNeRF: Generalizable Semantic Neural Radiance Fields with Enhanced 3D Scene Understanding
von: Chou, Zi-Ting, et al.
Veröffentlicht: (2024)
von: Chou, Zi-Ting, et al.
Veröffentlicht: (2024)
Grounded 3D-LLM with Referent Tokens
von: Chen, Yilun, et al.
Veröffentlicht: (2024)
von: Chen, Yilun, et al.
Veröffentlicht: (2024)
MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding
von: Yang, Panquan, et al.
Veröffentlicht: (2025)
von: Yang, Panquan, et al.
Veröffentlicht: (2025)
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
von: Wu, Changli, et al.
Veröffentlicht: (2026)
von: Wu, Changli, et al.
Veröffentlicht: (2026)
RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations
von: Chen, I-Hsiang, et al.
Veröffentlicht: (2026)
von: Chen, I-Hsiang, et al.
Veröffentlicht: (2026)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
von: Chi, Tien-Yu, et al.
Veröffentlicht: (2025)
von: Chi, Tien-Yu, et al.
Veröffentlicht: (2025)
Towards Affordance-Aware Articulation Synthesis for Rigged Objects
von: Yu, Yu-Chu, et al.
Veröffentlicht: (2025)
von: Yu, Yu-Chu, et al.
Veröffentlicht: (2025)
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
von: Zhu, Ziyu, et al.
Veröffentlicht: (2025)
von: Zhu, Ziyu, et al.
Veröffentlicht: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
von: Abdelrahman, Eslam, et al.
Veröffentlicht: (2023)
von: Abdelrahman, Eslam, et al.
Veröffentlicht: (2023)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
von: Hu, Miao, et al.
Veröffentlicht: (2025)
von: Hu, Miao, et al.
Veröffentlicht: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
von: Jiang, Qing, et al.
Veröffentlicht: (2025)
von: Jiang, Qing, et al.
Veröffentlicht: (2025)
A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes
von: Yu, Ting, et al.
Veröffentlicht: (2024)
von: Yu, Ting, et al.
Veröffentlicht: (2024)
LidaRefer: Context-aware Outdoor 3D Visual Grounding for Autonomous Driving
von: Baek, Yeong-Seung, et al.
Veröffentlicht: (2024)
von: Baek, Yeong-Seung, et al.
Veröffentlicht: (2024)
TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References
von: Yu, Jiahong, et al.
Veröffentlicht: (2025)
von: Yu, Jiahong, et al.
Veröffentlicht: (2025)
A Reference-Based 3D Semantic-Aware Framework for Accurate Local Facial Attribute Editing
von: Huang, Yu-Kai, et al.
Veröffentlicht: (2024)
von: Huang, Yu-Kai, et al.
Veröffentlicht: (2024)
Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation
von: Lee, Junha, et al.
Veröffentlicht: (2025)
von: Lee, Junha, et al.
Veröffentlicht: (2025)
SuperNeRF-GAN: A Universal 3D-Consistent Super-Resolution Framework for Efficient and Enhanced 3D-Aware Image Synthesis
von: Zheng, Peng, et al.
Veröffentlicht: (2025)
von: Zheng, Peng, et al.
Veröffentlicht: (2025)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2025)
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2025)
MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding
von: Chang, Chun-Peng, et al.
Veröffentlicht: (2024)
von: Chang, Chun-Peng, et al.
Veröffentlicht: (2024)
I Speak and You Find: Robust 3D Visual Grounding with Noisy and Ambiguous Speech Inputs
von: Qi, Yu, et al.
Veröffentlicht: (2025)
von: Qi, Yu, et al.
Veröffentlicht: (2025)
Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding
von: Yin, Yufei, et al.
Veröffentlicht: (2026)
von: Yin, Yufei, et al.
Veröffentlicht: (2026)
SpatialSplat: Efficient Semantic 3D from Sparse Unposed Images
von: Sheng, Yu, et al.
Veröffentlicht: (2025)
von: Sheng, Yu, et al.
Veröffentlicht: (2025)
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition
von: Huang, Ronggang, et al.
Veröffentlicht: (2025)
von: Huang, Ronggang, et al.
Veröffentlicht: (2025)
Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring
von: Wei, Siyuan, et al.
Veröffentlicht: (2025)
von: Wei, Siyuan, et al.
Veröffentlicht: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
von: Li, Aiden Yiliu, et al.
Veröffentlicht: (2025)
von: Li, Aiden Yiliu, et al.
Veröffentlicht: (2025)
BadVim: Unveiling Backdoor Threats in Visual State Space Model
von: Lee, Cheng-Yi, et al.
Veröffentlicht: (2024)
von: Lee, Cheng-Yi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Toward Scene Graph and Layout Guided Complex 3D Scene Generation
von: Huang, Yu-Hsiang, et al.
Veröffentlicht: (2024) -
TPA3D: Triplane Attention for Fast Text-to-3D Generation
von: Wu, Bin-Shih, et al.
Veröffentlicht: (2023) -
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
von: Huang, Sheng-Yu, et al.
Veröffentlicht: (2026) -
3D Gaussian Inpainting with Depth-Guided Cross-View Consistency
von: Huang, Sheng-Yu, et al.
Veröffentlicht: (2025) -
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
von: Lin, Ci-Siang, et al.
Veröffentlicht: (2024)