Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Guodong, Liu, Junjie, Zhang, Gaoyang, Wu, Bo, Zhang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
Dynamic Graph Neural Network with Adaptive Features Selection for RGB-D Based Indoor Scene Recognition
di: Liu, Qiong, et al.
Pubblicazione: (2026)
di: Liu, Qiong, et al.
Pubblicazione: (2026)
PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding
di: Wen, Junjie, et al.
Pubblicazione: (2026)
di: Wen, Junjie, et al.
Pubblicazione: (2026)
Efficient Multi-Task Scene Analysis with RGB-D Transformers
di: Fischedick, Söhnke Benedikt, et al.
Pubblicazione: (2023)
di: Fischedick, Söhnke Benedikt, et al.
Pubblicazione: (2023)
Real-Time Glottis Detection Framework via Spatial-decoupled Feature Learning for Nasal Transnasal Intubation
di: Liu, Jinyu, et al.
Pubblicazione: (2026)
di: Liu, Jinyu, et al.
Pubblicazione: (2026)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
HAPNet: Toward Superior RGB-Thermal Scene Parsing via Hybrid, Asymmetric, and Progressive Heterogeneous Feature Fusion
di: Li, Jiahang, et al.
Pubblicazione: (2024)
di: Li, Jiahang, et al.
Pubblicazione: (2024)
MLVU: Benchmarking Multi-task Long Video Understanding
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Delving into Multi-modal Multi-task Foundation Models for Road Scene Understanding: From Learning Paradigm Perspectives
di: Luo, Sheng, et al.
Pubblicazione: (2024)
di: Luo, Sheng, et al.
Pubblicazione: (2024)
BridgeNet: Comprehensive and Effective Feature Interactions via Bridge Feature for Multi-task Dense Predictions
di: Zhang, Jingdong, et al.
Pubblicazione: (2023)
di: Zhang, Jingdong, et al.
Pubblicazione: (2023)
NIS-SLAM: Neural Implicit Semantic RGB-D SLAM for 3D Consistent Scene Understanding
di: Zhai, Hongjia, et al.
Pubblicazione: (2024)
di: Zhai, Hongjia, et al.
Pubblicazione: (2024)
RGB-D Video Object Segmentation via Enhanced Multi-store Feature Memory
di: Xu, Boyue, et al.
Pubblicazione: (2025)
di: Xu, Boyue, et al.
Pubblicazione: (2025)
Elite360M: Efficient 360 Multi-task Learning via Bi-projection Fusion and Cross-task Collaboration
di: Ai, Hao, et al.
Pubblicazione: (2024)
di: Ai, Hao, et al.
Pubblicazione: (2024)
Learning Adaptive Lighting via Channel-Aware Guidance
di: Yang, Qirui, et al.
Pubblicazione: (2024)
di: Yang, Qirui, et al.
Pubblicazione: (2024)
Learning Temporal 3D Semantic Scene Completion via Optical Flow Guidance
di: Wang, Meng, et al.
Pubblicazione: (2025)
di: Wang, Meng, et al.
Pubblicazione: (2025)
FAMNet: Integrating 2D and 3D Features for Micro-expression Recognition via Multi-task Learning and Hierarchical Attention
di: Fu, Liangyu, et al.
Pubblicazione: (2025)
di: Fu, Liangyu, et al.
Pubblicazione: (2025)
Adaptive Visual Scene Understanding: Incremental Scene Graph Generation
di: Khandelwal, Naitik, et al.
Pubblicazione: (2023)
di: Khandelwal, Naitik, et al.
Pubblicazione: (2023)
MAESTRO: Task-Relevant Optimization via Adaptive Feature Enhancement and Suppression for Multi-task 3D Perception
di: Kang, Changwon, et al.
Pubblicazione: (2025)
di: Kang, Changwon, et al.
Pubblicazione: (2025)
3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding
di: Wang, Xiaoye, et al.
Pubblicazione: (2025)
di: Wang, Xiaoye, et al.
Pubblicazione: (2025)
CAST: Component-Aligned 3D Scene Reconstruction from an RGB Image
di: Yao, Kaixin, et al.
Pubblicazione: (2025)
di: Yao, Kaixin, et al.
Pubblicazione: (2025)
RGB-D Indiscernible Object Counting in Underwater Scenes
di: Sun, Guolei, et al.
Pubblicazione: (2023)
di: Sun, Guolei, et al.
Pubblicazione: (2023)
Expressive yet Efficient Feature Expansion with Adaptive Cross-Hadamard Products
di: Zhang, Xuyang, et al.
Pubblicazione: (2025)
di: Zhang, Xuyang, et al.
Pubblicazione: (2025)
Language-Assisted 3D Scene Understanding
di: Wu, Yanmin, et al.
Pubblicazione: (2023)
di: Wu, Yanmin, et al.
Pubblicazione: (2023)
RGB-Phase Speckle: Cross-Scene Stereo 3D Reconstruction via Wrapped Pre-Normalization
di: Yang, Kai, et al.
Pubblicazione: (2025)
di: Yang, Kai, et al.
Pubblicazione: (2025)
RGB-Sonar Tracking Benchmark and Spatial Cross-Attention Transformer Tracker
di: Li, Yunfeng, et al.
Pubblicazione: (2024)
di: Li, Yunfeng, et al.
Pubblicazione: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
AVS-Net: Point Sampling with Adaptive Voxel Size for 3D Scene Understanding
di: Yang, Hongcheng, et al.
Pubblicazione: (2024)
di: Yang, Hongcheng, et al.
Pubblicazione: (2024)
SceneLinker: Compositional 3D Scene Generation via Semantic Scene Graph from RGB Sequences
di: Kim, Seok-Young, et al.
Pubblicazione: (2026)
di: Kim, Seok-Young, et al.
Pubblicazione: (2026)
DoGFlow: Self-Supervised LiDAR Scene Flow via Cross-Modal Doppler Guidance
di: Khoche, Ajinkya, et al.
Pubblicazione: (2025)
di: Khoche, Ajinkya, et al.
Pubblicazione: (2025)
Multiple Prior Representation Learning for Self-Supervised Monocular Depth Estimation via Hybrid Transformer
di: Sun, Guodong, et al.
Pubblicazione: (2024)
di: Sun, Guodong, et al.
Pubblicazione: (2024)
Dissecting RGB-D Learning for Improved Multi-modal Fusion
di: Chen, Hao, et al.
Pubblicazione: (2023)
di: Chen, Hao, et al.
Pubblicazione: (2023)
Improving Viewpoint Consistency in 3D Generation via Structure Feature and CLIP Guidance
di: Zhang, Qing, et al.
Pubblicazione: (2024)
di: Zhang, Qing, et al.
Pubblicazione: (2024)
Universal 3D Shape Matching via Coarse-to-Fine Language Guidance
di: Xiao, Qinfeng, et al.
Pubblicazione: (2026)
di: Xiao, Qinfeng, et al.
Pubblicazione: (2026)
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
di: Deng, Tianchen, et al.
Pubblicazione: (2025)
di: Deng, Tianchen, et al.
Pubblicazione: (2025)
SceneReVis: A Self-Reflective Vision-Grounded Framework for 3D Indoor Scene Synthesis via Multi-turn RL
di: Zhao, Yang, et al.
Pubblicazione: (2026)
di: Zhao, Yang, et al.
Pubblicazione: (2026)
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?
di: Sun, Lingchen, et al.
Pubblicazione: (2026)
di: Sun, Lingchen, et al.
Pubblicazione: (2026)
LocalDyGS: Multi-view Global Dynamic Scene Modeling via Adaptive Local Implicit Feature Decoupling
di: Wu, Jiahao, et al.
Pubblicazione: (2025)
di: Wu, Jiahao, et al.
Pubblicazione: (2025)
EAGLE: Efficient Adaptive Geometry-based Learning in Cross-view Understanding
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2024)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2024)
3D Question Answering for City Scene Understanding
di: Sun, Penglei, et al.
Pubblicazione: (2024)
di: Sun, Penglei, et al.
Pubblicazione: (2024)
Towards Balanced RGB-TSDF Fusion for Consistent Semantic Scene Completion by 3D RGB Feature Completion and a Classwise Entropy Loss Function
di: Ding, Laiyan, et al.
Pubblicazione: (2024)
di: Ding, Laiyan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation
di: Li, Bohan, et al.
Pubblicazione: (2024) -
Dynamic Graph Neural Network with Adaptive Features Selection for RGB-D Based Indoor Scene Recognition
di: Liu, Qiong, et al.
Pubblicazione: (2026) -
PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding
di: Wen, Junjie, et al.
Pubblicazione: (2026) -
Efficient Multi-Task Scene Analysis with RGB-D Transformers
di: Fischedick, Söhnke Benedikt, et al.
Pubblicazione: (2023) -
Real-Time Glottis Detection Framework via Spatial-decoupled Feature Learning for Nasal Transnasal Intubation
di: Liu, Jinyu, et al.
Pubblicazione: (2026)