Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Ziyao, Liu, Yingjie, ZhangYangRui, Chen, Mingsong, Tang, Xuan, Wei, Xian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hyperbolic Contrastive Learning for Hierarchical 3D Point Cloud Embedding
par: Liu, Yingjie, et autres
Publié: (2025)
par: Liu, Yingjie, et autres
Publié: (2025)
R2Det: Exploring Relaxed Rotation Equivariance in 2D object detection
par: Wu, Zhiqiang, et autres
Publié: (2024)
par: Wu, Zhiqiang, et autres
Publié: (2024)
3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding
par: Wang, Xiaoye, et autres
Publié: (2025)
par: Wang, Xiaoye, et autres
Publié: (2025)
ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail
par: Yeshwanth, Chandan, et autres
Publié: (2025)
par: Yeshwanth, Chandan, et autres
Publié: (2025)
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
par: Huang, Sheng-Yu, et autres
Publié: (2026)
par: Huang, Sheng-Yu, et autres
Publié: (2026)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
par: Yao, Linli, et autres
Publié: (2026)
par: Yao, Linli, et autres
Publié: (2026)
Leveraging Automatic CAD Annotations for Supervised Learning in 3D Scene Understanding
par: Rao, Yuchen, et autres
Publié: (2025)
par: Rao, Yuchen, et autres
Publié: (2025)
CAGS: Open-Vocabulary 3D Scene Understanding with Context-Aware Gaussian Splatting
par: Sun, Wei, et autres
Publié: (2025)
par: Sun, Wei, et autres
Publié: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
BEV-LLM: Leveraging Multimodal BEV Maps for Scene Captioning in Autonomous Driving
par: Brandstaetter, Felix, et autres
Publié: (2025)
par: Brandstaetter, Felix, et autres
Publié: (2025)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
par: Li, Haoyuan, et autres
Publié: (2025)
par: Li, Haoyuan, et autres
Publié: (2025)
TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes
par: Jin, Bu, et autres
Publié: (2024)
par: Jin, Bu, et autres
Publié: (2024)
Physics-Aware 3D Gaussian Editing for Driving Scene Generation
par: Zhou, Feng, et autres
Publié: (2026)
par: Zhou, Feng, et autres
Publié: (2026)
Bi-directional Contextual Attention for 3D Dense Captioning
par: Kim, Minjung, et autres
Publié: (2024)
par: Kim, Minjung, et autres
Publié: (2024)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving
par: Liu, Pei, et autres
Publié: (2025)
par: Liu, Pei, et autres
Publié: (2025)
TPG-INR: Target Prior-Guided Implicit 3D CT Reconstruction for Enhanced Sparse-view Imaging
par: Cao, Qinglei, et autres
Publié: (2025)
par: Cao, Qinglei, et autres
Publié: (2025)
Attention Mechanism based Cognition-level Scene Understanding
par: Tang, Xuejiao, et autres
Publié: (2022)
par: Tang, Xuejiao, et autres
Publié: (2022)
3D Question Answering for City Scene Understanding
par: Sun, Penglei, et autres
Publié: (2024)
par: Sun, Penglei, et autres
Publié: (2024)
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding
par: Huang, Xiaohu, et autres
Publié: (2025)
par: Huang, Xiaohu, et autres
Publié: (2025)
Leveraging 2D-VLM for Label-Free 3D Segmentation in Large-Scale Outdoor Scene Understanding
par: Nishimura, Toshihiko, et autres
Publié: (2026)
par: Nishimura, Toshihiko, et autres
Publié: (2026)
Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion
par: Xue, Yu, et autres
Publié: (2026)
par: Xue, Yu, et autres
Publié: (2026)
A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes
par: Yu, Ting, et autres
Publié: (2024)
par: Yu, Ting, et autres
Publié: (2024)
A Unified Framework for 3D Scene Understanding
par: Xu, Wei, et autres
Publié: (2024)
par: Xu, Wei, et autres
Publié: (2024)
3D CoCa: Contrastive Learners are 3D Captioners
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding
par: Li, Jinlong, et autres
Publié: (2025)
par: Li, Jinlong, et autres
Publié: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
par: Halacheva, Anna-Maria, et autres
Publié: (2024)
par: Halacheva, Anna-Maria, et autres
Publié: (2024)
Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding
par: Guan, Runwei, et autres
Publié: (2025)
par: Guan, Runwei, et autres
Publié: (2025)
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds
par: Yang, Bin, et autres
Publié: (2026)
par: Yang, Bin, et autres
Publié: (2026)
Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models
par: Wang, Dehui, et autres
Publié: (2026)
par: Wang, Dehui, et autres
Publié: (2026)
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
par: Yu, Hanxun, et autres
Publié: (2025)
par: Yu, Hanxun, et autres
Publié: (2025)
VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes
par: Zhang, Yikang, et autres
Publié: (2025)
par: Zhang, Yikang, et autres
Publié: (2025)
Towards Understanding 3D Vision: the Role of Gaussian Curvature
par: da Silva, Sherlon Almeida, et autres
Publié: (2025)
par: da Silva, Sherlon Almeida, et autres
Publié: (2025)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
par: Yang, Yu-Qi, et autres
Publié: (2024)
par: Yang, Yu-Qi, et autres
Publié: (2024)
SurgCUT3R: Surgical Scene-Aware Continuous Understanding of Temporal 3D Representation
par: Xu, Kaiyuan, et autres
Publié: (2026)
par: Xu, Kaiyuan, et autres
Publié: (2026)
Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering
par: Li, Zechuan, et autres
Publié: (2025)
par: Li, Zechuan, et autres
Publié: (2025)
Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding
par: Shi, Shuyao, et autres
Publié: (2026)
par: Shi, Shuyao, et autres
Publié: (2026)
SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields
par: Li, Qijing, et autres
Publié: (2025)
par: Li, Qijing, et autres
Publié: (2025)
GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding
par: Wang, Xihan, et autres
Publié: (2025)
par: Wang, Xihan, et autres
Publié: (2025)
Documents similaires
-
Hyperbolic Contrastive Learning for Hierarchical 3D Point Cloud Embedding
par: Liu, Yingjie, et autres
Publié: (2025) -
R2Det: Exploring Relaxed Rotation Equivariance in 2D object detection
par: Wu, Zhiqiang, et autres
Publié: (2024) -
3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding
par: Wang, Xiaoye, et autres
Publié: (2025) -
ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail
par: Yeshwanth, Chandan, et autres
Publié: (2025) -
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
par: Huang, Sheng-Yu, et autres
Publié: (2026)