SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Ye, Guanting, Zhao, Qiyan, Yu, Wenhao, Yuan, Liangyu, Li, Mingkai, Zhang, Xiaofeng, Ji, Jianmin, Zhang, Yanyong, Jiang, Qing, Yuen, Ka-Veng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning
por: Ye, Guanting, et al.
Publicado: (2026)
por: Ye, Guanting, et al.
Publicado: (2026)
Bayesian Online Joint Identification on Axle Positions, Axle Loads, and Bridge Structural Parameters Using Evolving Virtual Axle Configurations Without Axle Detector
por: Hou-Zuo Guo, et al.
Publicado: (2026)
por: Hou-Zuo Guo, et al.
Publicado: (2026)
Transmissibility Physics‐Guided Deep Learning Network for Seismic Response Prediction Under Limited Domain Knowledge, Sparse Measurements, and Unknown Excitations
por: Yuntai Zhang, et al.
Publicado: (2026)
por: Yuntai Zhang, et al.
Publicado: (2026)
CELLmap: Enhancing LiDAR SLAM through Elastic and Lightweight Spherical Map Representation
por: Duan, Yifan, et al.
Publicado: (2024)
por: Duan, Yifan, et al.
Publicado: (2024)
OA-DET3D: Embedding Object Awareness as a General Plug-in for Multi-Camera 3D Object Detection
por: Chu, Xiaomeng, et al.
Publicado: (2023)
por: Chu, Xiaomeng, et al.
Publicado: (2023)
MHRC: Closed-loop Decentralized Multi-Heterogeneous Robot Collaboration with Large Language Models
por: Yu, Wenhao, et al.
Publicado: (2024)
por: Yu, Wenhao, et al.
Publicado: (2024)
MrRoPE: Mixed-radix Rotary Position Embedding
por: Tian, Qingyuan, et al.
Publicado: (2026)
por: Tian, Qingyuan, et al.
Publicado: (2026)
Navigating Uncertainties in Machine Learning for Structural Dynamics: A Comprehensive Survey of Probabilistic and Non-Probabilistic Approaches in Forward and Inverse Problems
por: Yan, Wang-Ji, et al.
Publicado: (2024)
por: Yan, Wang-Ji, et al.
Publicado: (2024)
SpatialSplat: Efficient Semantic 3D from Sparse Unposed Images
por: Sheng, Yu, et al.
Publicado: (2025)
por: Sheng, Yu, et al.
Publicado: (2025)
LDP: A Local Diffusion Planner for Efficient Robot Navigation and Collision Avoidance
por: Yu, Wenhao, et al.
Publicado: (2024)
por: Yu, Wenhao, et al.
Publicado: (2024)
Spherical Spatial Autoregressive Model for Spherically Embedded Spatial Data
por: Xu, Jiazhen, et al.
Publicado: (2026)
por: Xu, Jiazhen, et al.
Publicado: (2026)
FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception
por: Ahuja, Rahul, et al.
Publicado: (2026)
por: Ahuja, Rahul, et al.
Publicado: (2026)
Embedding Compression via Spherical Coordinates
por: Xiao, Han
Publicado: (2026)
por: Xiao, Han
Publicado: (2026)
STDArm: Transferring Visuomotor Policies From Static Data Training to Dynamic Robot Manipulation
por: Duan, Yifan, et al.
Publicado: (2025)
por: Duan, Yifan, et al.
Publicado: (2025)
Bayesian Learning in Structural Dynamics: A Comprehensive Review and Emerging Trends
por: Yan, Wang-Ji, et al.
Publicado: (2025)
por: Yan, Wang-Ji, et al.
Publicado: (2025)
Perception Helps Planning: Facilitating Multi-Stage Lane-Level Integration via Double-Edge Structures
por: You, Guoliang, et al.
Publicado: (2024)
por: You, Guoliang, et al.
Publicado: (2024)
DoPE: Denoising Rotary Position Embedding
por: Xiong, Jing, et al.
Publicado: (2025)
por: Xiong, Jing, et al.
Publicado: (2025)
OCC-VO: Dense Mapping via 3D Occupancy-Based Visual Odometry for Autonomous Driving
por: Li, Heng, et al.
Publicado: (2023)
por: Li, Heng, et al.
Publicado: (2023)
CLMASP: Coupling Large Language Models with Answer Set Programming for Robotic Task Planning
por: Lin, Xinrui, et al.
Publicado: (2024)
por: Lin, Xinrui, et al.
Publicado: (2024)
MM-Gaussian: 3D Gaussian-based Multi-modal Fusion for Localization and Reconstruction in Unbounded Scenes
por: Wu, Chenyang, et al.
Publicado: (2024)
por: Wu, Chenyang, et al.
Publicado: (2024)
On quadratic Novikov algebras
por: Dong, Xiaofeng, et al.
Publicado: (2025)
por: Dong, Xiaofeng, et al.
Publicado: (2025)
Learning Surgical Robotic Manipulation with 3D Spatial Priors
por: Sheng, Yu, et al.
Publicado: (2026)
por: Sheng, Yu, et al.
Publicado: (2026)
Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving
por: Wang, Shumin, et al.
Publicado: (2025)
por: Wang, Shumin, et al.
Publicado: (2025)
CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks
por: Wang, Beibei, et al.
Publicado: (2024)
por: Wang, Beibei, et al.
Publicado: (2024)
CRoPE: Efficient Parametrization of Rotary Positional Embedding
por: Lou, Beicheng, et al.
Publicado: (2026)
por: Lou, Beicheng, et al.
Publicado: (2026)
Defending LVLMs Against Vision Attacks through Partial-Perception Supervision
por: Zhou, Qi, et al.
Publicado: (2024)
por: Zhou, Qi, et al.
Publicado: (2024)
CalibFormer: A Transformer-based Automatic LiDAR-Camera Calibration Network
por: Xiao, Yuxuan, et al.
Publicado: (2023)
por: Xiao, Yuxuan, et al.
Publicado: (2023)
Rendering-Enhanced Automatic Image-to-Point Cloud Registration for Roadside Scenes
por: Sheng, Yu, et al.
Publicado: (2024)
por: Sheng, Yu, et al.
Publicado: (2024)
CAFE-AD: Cross-Scenario Adaptive Feature Enhancement for Trajectory Planning in Autonomous Driving
por: Zhang, Junrui, et al.
Publicado: (2025)
por: Zhang, Junrui, et al.
Publicado: (2025)
Do LVLMs Know What They Know? A Systematic Study of Knowledge Boundary Perception in LVLMs
por: Ding, Zhikai, et al.
Publicado: (2025)
por: Ding, Zhikai, et al.
Publicado: (2025)
LFP: Efficient and Accurate End-to-End Lane-Level Planning via Camera-LiDAR Fusion
por: You, Guoliang, et al.
Publicado: (2024)
por: You, Guoliang, et al.
Publicado: (2024)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
por: Wei, Xilin, et al.
Publicado: (2025)
por: Wei, Xilin, et al.
Publicado: (2025)
Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
por: Zhang, Jie, et al.
Publicado: (2024)
por: Zhang, Jie, et al.
Publicado: (2024)
UrgenGo: Urgency-Aware Transparent GPU Kernel Launching for Autonomous Driving
por: Zhu, Hanqi, et al.
Publicado: (2025)
por: Zhu, Hanqi, et al.
Publicado: (2025)
Map++: Towards User-Participatory Visual SLAM Systems with Efficient Map Expansion and Sharing
por: Zhang, Xinran, et al.
Publicado: (2024)
por: Zhang, Xinran, et al.
Publicado: (2024)
Remember Me: Bridging the Long-Range Gap in LVLMs with Three-Step Inference-Only Decay Resilience Strategies
por: Gao, Peng, et al.
Publicado: (2025)
por: Gao, Peng, et al.
Publicado: (2025)
URoPE: Universal Relative Position Embedding across Geometric Spaces
por: Xie, Yichen, et al.
Publicado: (2026)
por: Xie, Yichen, et al.
Publicado: (2026)
VRoPE: Rotary Position Embedding for Video Large Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
Ejemplares similares
-
C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning
por: Ye, Guanting, et al.
Publicado: (2026) -
Bayesian Online Joint Identification on Axle Positions, Axle Loads, and Bridge Structural Parameters Using Evolving Virtual Axle Configurations Without Axle Detector
por: Hou-Zuo Guo, et al.
Publicado: (2026) -
Transmissibility Physics‐Guided Deep Learning Network for Seismic Response Prediction Under Limited Domain Knowledge, Sparse Measurements, and Unknown Excitations
por: Yuntai Zhang, et al.
Publicado: (2026) -
CELLmap: Enhancing LiDAR SLAM through Elastic and Lightweight Spherical Map Representation
por: Duan, Yifan, et al.
Publicado: (2024) -
OA-DET3D: Embedding Object Awareness as a General Plug-in for Multi-Camera 3D Object Detection
por: Chu, Xiaomeng, et al.
Publicado: (2023)