SCA3D: Enhancing Cross-modal 3D Retrieval via 3D Shape and Caption Paired Data Augmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ren, Junlong, Wu, Hao, Xiong, Hui, Wang, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhanced Cross-modal 3D Retrieval via Tri-modal Reconstruction
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
COM3D: Leveraging Cross-View Correspondence and Cross-Modal Mining for 3D Retrieval
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
3D CoCa: Contrastive Learners are 3D Captioners
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
di: Huang, Junming, et al.
Pubblicazione: (2026)
di: Huang, Junming, et al.
Pubblicazione: (2026)
3DBonsai: Structure-Aware Bonsai Modeling Using Conditioned 3D Gaussian Splatting
di: Wu, Hao, et al.
Pubblicazione: (2025)
di: Wu, Hao, et al.
Pubblicazione: (2025)
Unify3D: An Augmented Holistic End-to-end Monocular 3D Human Reconstruction via Anatomy Shaping and Twins Negotiating
di: Yao, Nanjie, et al.
Pubblicazione: (2025)
di: Yao, Nanjie, et al.
Pubblicazione: (2025)
Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
PartRAG: Retrieval-Augmented Part-Level 3D Generation and Editing
di: Li, Peize, et al.
Pubblicazione: (2026)
di: Li, Peize, et al.
Pubblicazione: (2026)
Towards 3D VR-Sketch to 3D Shape Retrieval
di: Luo, Ling, et al.
Pubblicazione: (2022)
di: Luo, Ling, et al.
Pubblicazione: (2022)
Meta-Learning 3D Shape Segmentation Functions
di: Hao, Yu, et al.
Pubblicazione: (2021)
di: Hao, Yu, et al.
Pubblicazione: (2021)
DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention
di: Xiao, Feng, et al.
Pubblicazione: (2024)
di: Xiao, Feng, et al.
Pubblicazione: (2024)
FastAnimate: Towards Learnable Template Construction and Pose Deformation for Fast 3D Human Avatar Animation
di: Shu, Jian, et al.
Pubblicazione: (2025)
di: Shu, Jian, et al.
Pubblicazione: (2025)
CNS-Edit: 3D Shape Editing via Coupled Neural Shape Optimization
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion
di: Wen, Hao, et al.
Pubblicazione: (2024)
di: Wen, Hao, et al.
Pubblicazione: (2024)
WaMo: Wavelet-Enhanced Multi-Frequency Trajectory Analysis for Fine-Grained Text-Motion Retrieval
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
3D Shape Augmentation with Content-Aware Shape Resizing
di: Chen, Mingxiang, et al.
Pubblicazione: (2024)
di: Chen, Mingxiang, et al.
Pubblicazione: (2024)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
di: Ji, Jiayi, et al.
Pubblicazione: (2023)
di: Ji, Jiayi, et al.
Pubblicazione: (2023)
Hierarchical Transformers for Unsupervised 3D Shape Abstraction
di: Vora, Aditya, et al.
Pubblicazione: (2025)
di: Vora, Aditya, et al.
Pubblicazione: (2025)
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes
di: Jin, Bu, et al.
Pubblicazione: (2024)
di: Jin, Bu, et al.
Pubblicazione: (2024)
Hyper3D: Efficient 3D Representation via Hybrid Triplane and Octree Feature for Enhanced 3D Shape Variational Auto-Encoders
di: Guo, Jingyu, et al.
Pubblicazione: (2025)
di: Guo, Jingyu, et al.
Pubblicazione: (2025)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
Indoor 3D Reconstruction with an Unknown Camera-Projector Pair
di: Qi, Zhaoshuai, et al.
Pubblicazione: (2024)
di: Qi, Zhaoshuai, et al.
Pubblicazione: (2024)
Multi-modal 3D Pose and Shape Estimation with Computed Tomography
di: Tu, Mingxiao, et al.
Pubblicazione: (2025)
di: Tu, Mingxiao, et al.
Pubblicazione: (2025)
DDM: A Metric for Comparing 3D Shapes Using Directional Distance Fields
di: Ren, Siyu, et al.
Pubblicazione: (2024)
di: Ren, Siyu, et al.
Pubblicazione: (2024)
View Selection for 3D Captioning via Diffusion Ranking
di: Luo, Tiange, et al.
Pubblicazione: (2024)
di: Luo, Tiange, et al.
Pubblicazione: (2024)
CrossTracker: Robust Multi-modal 3D Multi-Object Tracking via Cross Correction
di: Gu, Lipeng, et al.
Pubblicazione: (2024)
di: Gu, Lipeng, et al.
Pubblicazione: (2024)
3D Shape Tokenization via Latent Flow Matching
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2024)
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2024)
FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder
di: Li, Wei, et al.
Pubblicazione: (2026)
di: Li, Wei, et al.
Pubblicazione: (2026)
CogniMap3D: Cognitive 3D Mapping and Rapid Retrieval
di: Wang, Feiran, et al.
Pubblicazione: (2026)
di: Wang, Feiran, et al.
Pubblicazione: (2026)
From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning
di: Li, Shuangzhi, et al.
Pubblicazione: (2025)
di: Li, Shuangzhi, et al.
Pubblicazione: (2025)
ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail
di: Yeshwanth, Chandan, et al.
Pubblicazione: (2025)
di: Yeshwanth, Chandan, et al.
Pubblicazione: (2025)
RefSAM3D: Adapting SAM with Cross-modal Reference for 3D Medical Image Segmentation
di: Gao, Xiang, et al.
Pubblicazione: (2024)
di: Gao, Xiang, et al.
Pubblicazione: (2024)
XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation
di: Wang, Ziyi, et al.
Pubblicazione: (2024)
di: Wang, Ziyi, et al.
Pubblicazione: (2024)
Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow
di: Ma, Yueen, et al.
Pubblicazione: (2025)
di: Ma, Yueen, et al.
Pubblicazione: (2025)
DiffStyle3D: Consistent 3D Gaussian Stylization via Attention Optimization
di: Yang, Yitong, et al.
Pubblicazione: (2026)
di: Yang, Yitong, et al.
Pubblicazione: (2026)
Change3D: Revisiting Change Detection and Captioning from A Video Modeling Perspective
di: Zhu, Duowang, et al.
Pubblicazione: (2025)
di: Zhu, Duowang, et al.
Pubblicazione: (2025)
Generalizing Single-View 3D Shape Retrieval to Occlusions and Unseen Objects
di: Wu, Qirui, et al.
Pubblicazione: (2023)
di: Wu, Qirui, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Enhanced Cross-modal 3D Retrieval via Tri-modal Reconstruction
di: Ren, Junlong, et al.
Pubblicazione: (2025) -
COM3D: Leveraging Cross-View Correspondence and Cross-Modal Mining for 3D Retrieval
di: Wu, Hao, et al.
Pubblicazione: (2024) -
3D CoCa: Contrastive Learners are 3D Captioners
di: Huang, Ting, et al.
Pubblicazione: (2025) -
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
di: Huang, Junming, et al.
Pubblicazione: (2026) -
3DBonsai: Structure-Aware Bonsai Modeling Using Conditioned 3D Gaussian Splatting
di: Wu, Hao, et al.
Pubblicazione: (2025)