AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xinyi, Zhao, Na, Han, Zhiyuan, Guo, Dan, Yang, Xun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Reference Visual Grounding
par: Lu, Yangxiao, et autres
Publié: (2025)
par: Lu, Yangxiao, et autres
Publié: (2025)
Data-Efficient 3D Visual Grounding via Order-Aware Referring
par: Wu, Tung-Yu, et autres
Publié: (2024)
par: Wu, Tung-Yu, et autres
Publié: (2024)
Grounded 3D-LLM with Referent Tokens
par: Chen, Yilun, et autres
Publié: (2024)
par: Chen, Yilun, et autres
Publié: (2024)
MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding
par: Yang, Panquan, et autres
Publié: (2025)
par: Yang, Panquan, et autres
Publié: (2025)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
par: Lv, Weiyi, et autres
Publié: (2025)
par: Lv, Weiyi, et autres
Publié: (2025)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
LidaRefer: Context-aware Outdoor 3D Visual Grounding for Autonomous Driving
par: Baek, Yeong-Seung, et autres
Publié: (2024)
par: Baek, Yeong-Seung, et autres
Publié: (2024)
AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
par: Wang, Xinyi, et autres
Publié: (2025)
par: Wang, Xinyi, et autres
Publié: (2025)
DOGR: Towards Versatile Visual Document Grounding and Referring
par: Zhou, Yinan, et autres
Publié: (2024)
par: Zhou, Yinan, et autres
Publié: (2024)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation
par: Yang, Chen
Publié: (2026)
par: Yang, Chen
Publié: (2026)
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
par: Wu, Changli, et autres
Publié: (2026)
par: Wu, Changli, et autres
Publié: (2026)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
par: He, Ruozhen, et autres
Publié: (2026)
par: He, Ruozhen, et autres
Publié: (2026)
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
par: Liu, Haijing, et autres
Publié: (2025)
par: Liu, Haijing, et autres
Publié: (2025)
Mask Grounding for Referring Image Segmentation
par: Chng, Yong Xien, et autres
Publié: (2023)
par: Chng, Yong Xien, et autres
Publié: (2023)
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding
par: Guo, Hao, et autres
Publié: (2025)
par: Guo, Hao, et autres
Publié: (2025)
Exploring Spatial Language Grounding Through Referring Expressions
par: Tumu, Akshar, et autres
Publié: (2025)
par: Tumu, Akshar, et autres
Publié: (2025)
MediAug: Exploring Visual Augmentation in Medical Imaging
par: Qi, Xuyin, et autres
Publié: (2025)
par: Qi, Xuyin, et autres
Publié: (2025)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
par: Jin, Dian, et autres
Publié: (2025)
par: Jin, Dian, et autres
Publié: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
par: Sun, Baoli, et autres
Publié: (2025)
par: Sun, Baoli, et autres
Publié: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition
par: He, Yuchen, et autres
Publié: (2026)
par: He, Yuchen, et autres
Publié: (2026)
PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation
par: Tan, Wenbin, et autres
Publié: (2026)
par: Tan, Wenbin, et autres
Publié: (2026)
Benefit from Reference: Retrieval-Augmented Cross-modal Point Cloud Completion
par: Hou, Hongye, et autres
Publié: (2025)
par: Hou, Hongye, et autres
Publié: (2025)
Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation
par: Li, Jiachen, et autres
Publié: (2026)
par: Li, Jiachen, et autres
Publié: (2026)
TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References
par: Yu, Jiahong, et autres
Publié: (2025)
par: Yu, Jiahong, et autres
Publié: (2025)
CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction
par: Zhao, Liang, et autres
Publié: (2024)
par: Zhao, Liang, et autres
Publié: (2024)
ReferSplat: Referring Segmentation in 3D Gaussian Splatting
par: He, Shuting, et autres
Publié: (2025)
par: He, Shuting, et autres
Publié: (2025)
Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence Matching
par: Liu, Heng, et autres
Publié: (2025)
par: Liu, Heng, et autres
Publié: (2025)
Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment
par: Li, Yuchen, et autres
Publié: (2026)
par: Li, Yuchen, et autres
Publié: (2026)
RefVSR++: Exploiting Reference Inputs for Reference-based Video Super-resolution
par: Zou, Han, et autres
Publié: (2023)
par: Zou, Han, et autres
Publié: (2023)
TP3M: Transformer-based Pseudo 3D Image Matching with Reference Image
par: Han, Liming, et autres
Publié: (2024)
par: Han, Liming, et autres
Publié: (2024)
3DWG: 3D Weakly Supervised Visual Grounding via Category and Instance-Level Alignment
par: Li, Xiaoqi, et autres
Publié: (2025)
par: Li, Xiaoqi, et autres
Publié: (2025)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
par: Zhou, Enshen, et autres
Publié: (2025)
par: Zhou, Enshen, et autres
Publié: (2025)
AeroReformer: Aerial Referring Transformer for UAV-based Referring Image Segmentation
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
OpenGround: Active Cognition-based Reasoning for Open-World 3D Visual Grounding
par: Huang, Wenyuan, et autres
Publié: (2025)
par: Huang, Wenyuan, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
par: Yuan, Yuqian, et autres
Publié: (2024)
par: Yuan, Yuqian, et autres
Publié: (2024)
Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation
par: Fu, Jingyun, et autres
Publié: (2026)
par: Fu, Jingyun, et autres
Publié: (2026)
Documents similaires
-
Multimodal Reference Visual Grounding
par: Lu, Yangxiao, et autres
Publié: (2025) -
Data-Efficient 3D Visual Grounding via Order-Aware Referring
par: Wu, Tung-Yu, et autres
Publié: (2024) -
Grounded 3D-LLM with Referent Tokens
par: Chen, Yilun, et autres
Publié: (2024) -
MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding
par: Yang, Panquan, et autres
Publié: (2025) -
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
par: Lv, Weiyi, et autres
Publié: (2025)