Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
Fuente:
arXiv
Salvato in:
| Autori principali: | Miyanishi, Taiki, Azuma, Daichi, Kurita, Shuhei, Kawanabe, Motoki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Answerability Fields: Answerable Location Estimation via Diffusion Models
di: Azuma, Daichi, et al.
Pubblicazione: (2024)
di: Azuma, Daichi, et al.
Pubblicazione: (2024)
Map-based Modular Approach for Zero-shot Embodied Question Answering
di: Sakamoto, Koya, et al.
Pubblicazione: (2024)
di: Sakamoto, Koya, et al.
Pubblicazione: (2024)
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
di: Sakamoto, Koya, et al.
Pubblicazione: (2026)
di: Sakamoto, Koya, et al.
Pubblicazione: (2026)
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
di: Yasuki, Shunsuke, et al.
Pubblicazione: (2025)
di: Yasuki, Shunsuke, et al.
Pubblicazione: (2025)
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
di: Lee, Jungdae, et al.
Pubblicazione: (2024)
di: Lee, Jungdae, et al.
Pubblicazione: (2024)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)
Mono3DVG-EnSD: Enhanced Spatial-aware and Dimension-decoupled Text Encoding for Monocular 3D Visual Grounding
di: Li, Yuzhen, et al.
Pubblicazione: (2025)
di: Li, Yuzhen, et al.
Pubblicazione: (2025)
Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation
di: Kogure, Hina, et al.
Pubblicazione: (2026)
di: Kogure, Hina, et al.
Pubblicazione: (2026)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention
di: Xiao, Feng, et al.
Pubblicazione: (2024)
di: Xiao, Feng, et al.
Pubblicazione: (2024)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
di: Wang, Qirui, et al.
Pubblicazione: (2026)
di: Wang, Qirui, et al.
Pubblicazione: (2026)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
di: Hu, Miao, et al.
Pubblicazione: (2025)
di: Hu, Miao, et al.
Pubblicazione: (2025)
COM3D: Leveraging Cross-View Correspondence and Cross-Modal Mining for 3D Retrieval
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
CrossOver: 3D Scene Cross-Modal Alignment
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2025)
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2025)
LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans
di: Huang, Zhening, et al.
Pubblicazione: (2025)
di: Huang, Zhening, et al.
Pubblicazione: (2025)
A Cross-Dataset Study for Text-based 3D Human Motion Retrieval
di: Bensabath, Léore, et al.
Pubblicazione: (2024)
di: Bensabath, Léore, et al.
Pubblicazione: (2024)
Z3D: Zero-Shot 3D Visual Grounding from Images
di: Drozdov, Nikita, et al.
Pubblicazione: (2026)
di: Drozdov, Nikita, et al.
Pubblicazione: (2026)
CSCPR: Cross-Source-Context Indoor RGB-D Place Recognition
di: Liang, Jing, et al.
Pubblicazione: (2024)
di: Liang, Jing, et al.
Pubblicazione: (2024)
3DRealCar: An In-the-wild RGB-D Car Dataset with 360-degree Views
di: Du, Xiaobiao, et al.
Pubblicazione: (2024)
di: Du, Xiaobiao, et al.
Pubblicazione: (2024)
Unified Representation Space for 3D Visual Grounding
di: Zheng, Yinuo, et al.
Pubblicazione: (2025)
di: Zheng, Yinuo, et al.
Pubblicazione: (2025)
ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding
di: Wang, Austin T., et al.
Pubblicazione: (2025)
di: Wang, Austin T., et al.
Pubblicazione: (2025)
Cross-view and Cross-pose Completion for 3D Human Understanding
di: Armando, Matthieu, et al.
Pubblicazione: (2023)
di: Armando, Matthieu, et al.
Pubblicazione: (2023)
UniPose: Unified Cross-modality Pose Prior Propagation towards RGB-D data for Weakly Supervised 3D Human Pose Estimation
di: Zheng, Jinghong, et al.
Pubblicazione: (2025)
di: Zheng, Jinghong, et al.
Pubblicazione: (2025)
Leveraging RGB-D Data with Cross-Modal Context Mining for Glass Surface Detection
di: Lin, Jiaying, et al.
Pubblicazione: (2022)
di: Lin, Jiaying, et al.
Pubblicazione: (2022)
Pre-training with 3D Synthetic Data: Learning 3D Point Cloud Instance Segmentation from 3D Synthetic Scenes
di: Otsuka, Daichi, et al.
Pubblicazione: (2025)
di: Otsuka, Daichi, et al.
Pubblicazione: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding
di: Yao, Lei, et al.
Pubblicazione: (2026)
di: Yao, Lei, et al.
Pubblicazione: (2026)
Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding
di: Yin, Yufei, et al.
Pubblicazione: (2026)
di: Yin, Yufei, et al.
Pubblicazione: (2026)
CT-ScanGaze: A Dataset and Baselines for 3D Volumetric Scanpath Modeling
di: Pham, Trong-Thang, et al.
Pubblicazione: (2025)
di: Pham, Trong-Thang, et al.
Pubblicazione: (2025)
CrossSDF: 3D Reconstruction of Thin Structures From Cross-Sections
di: Walker, Thomas, et al.
Pubblicazione: (2024)
di: Walker, Thomas, et al.
Pubblicazione: (2024)
LiDAR-CS Dataset: LiDAR Point Cloud Dataset with Cross-Sensors for 3D Object Detection
di: Fang, Jin, et al.
Pubblicazione: (2023)
di: Fang, Jin, et al.
Pubblicazione: (2023)
PoseBench3D: A Cross-Dataset Analysis Framework for 3D Human Pose Estimation via Pose Lifting Networks
di: Manzur, Saad, et al.
Pubblicazione: (2025)
di: Manzur, Saad, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Answerability Fields: Answerable Location Estimation via Diffusion Models
di: Azuma, Daichi, et al.
Pubblicazione: (2024) -
Map-based Modular Approach for Zero-shot Embodied Question Answering
di: Sakamoto, Koya, et al.
Pubblicazione: (2024) -
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
di: Sakamoto, Koya, et al.
Pubblicazione: (2026) -
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
di: Yasuki, Shunsuke, et al.
Pubblicazione: (2025) -
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
di: Lee, Jungdae, et al.
Pubblicazione: (2024)