pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Zhanpeng, Zhang, Ce, Yong, Silong, Dai, Cunxi, Wang, Qianwei, Ran, Haoxi, Shi, Guanya, Sycara, Katia, Xie, Yaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GL-NeRF: Gauss-Laguerre Quadrature Enables Training-Free NeRF Acceleration
par: Yong, Silong, et autres
Publié: (2024)
par: Yong, Silong, et autres
Publié: (2024)
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
par: Zhang, Ce, et autres
Publié: (2024)
par: Zhang, Ce, et autres
Publié: (2024)
Instant4D: 4D Gaussian Splatting in Minutes
par: Luo, Zhanpeng, et autres
Publié: (2025)
par: Luo, Zhanpeng, et autres
Publié: (2025)
Dual Prototype Evolving for Test-Time Generalization of Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2024)
par: Zhang, Ce, et autres
Publié: (2024)
Unifying Deep Predicate Invention with Pre-trained Foundation Models
par: Wang, Qianwei, et autres
Publié: (2025)
par: Wang, Qianwei, et autres
Publié: (2025)
Sigma: Siamese Mamba Network for Multi-Modal Semantic Segmentation
par: Wan, Zifu, et autres
Publié: (2024)
par: Wan, Zifu, et autres
Publié: (2024)
Spectral-Aware Global Fusion for RGB-Thermal Semantic Segmentation
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
HiKER-SGG: Hierarchical Knowledge Enhanced Robust Scene Graph Generation
par: Zhang, Ce, et autres
Publié: (2024)
par: Zhang, Ce, et autres
Publié: (2024)
Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory
par: Zhang, Ce, et autres
Publié: (2026)
par: Zhang, Ce, et autres
Publié: (2026)
Aug3D: Augmenting large scale outdoor datasets for Generalizable Novel View Synthesis
par: Rauniyar, Aditya, et autres
Publié: (2025)
par: Rauniyar, Aditya, et autres
Publié: (2025)
Jailbreaking Frontier Foundation Models Through Intention Deception
par: Wang, Xinhe, et autres
Publié: (2026)
par: Wang, Xinhe, et autres
Publié: (2026)
ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language Models
par: Wan, Zifu, et autres
Publié: (2025)
par: Wan, Zifu, et autres
Publié: (2025)
OMG: Opacity Matters in Material Modeling with Gaussian Splatting
par: Yong, Silong, et autres
Publié: (2025)
par: Yong, Silong, et autres
Publié: (2025)
ShapeGrasp: Zero-Shot Task-Oriented Grasping with Large Language Models through Geometric Decomposition
par: Li, Samuel, et autres
Publié: (2024)
par: Li, Samuel, et autres
Publié: (2024)
InstructPart: Task-Oriented Part Segmentation with Instruction Reasoning
par: Wan, Zifu, et autres
Publié: (2025)
par: Wan, Zifu, et autres
Publié: (2025)
Modeling Latent Partner Strategies for Adaptive Zero-Shot Human-Agent Collaboration
par: Li, Benjamin, et autres
Publié: (2025)
par: Li, Benjamin, et autres
Publié: (2025)
Generalizable Dense Reward for Long-Horizon Robotic Tasks
par: Yong, Silong, et autres
Publié: (2026)
par: Yong, Silong, et autres
Publié: (2026)
Theory of Mind Guided Strategy Adaptation for Zero-Shot Coordination
par: Ni, Andrew, et autres
Publié: (2026)
par: Ni, Andrew, et autres
Publié: (2026)
SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning
par: Chunhachatrachai, Pawat, et autres
Publié: (2026)
par: Chunhachatrachai, Pawat, et autres
Publié: (2026)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
par: Jin, Zhao, et autres
Publié: (2025)
par: Jin, Zhao, et autres
Publié: (2025)
B3C: A Minimalist Approach to Offline Multi-Agent Reinforcement Learning
par: Kim, Woojun, et autres
Publié: (2025)
par: Kim, Woojun, et autres
Publié: (2025)
Fair Cooperation in Mixed-Motive Games via Conflict-Aware Gradient Adjustment
par: Kim, Woojun, et autres
Publié: (2025)
par: Kim, Woojun, et autres
Publié: (2025)
Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration
par: Yue, Lu, et autres
Publié: (2026)
par: Yue, Lu, et autres
Publié: (2026)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
par: Zhang, Jiwen, et autres
Publié: (2026)
par: Zhang, Jiwen, et autres
Publié: (2026)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
par: Liao, Zhenyi, et autres
Publié: (2025)
par: Liao, Zhenyi, et autres
Publié: (2025)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
par: Taguchi, Shun, et autres
Publié: (2025)
par: Taguchi, Shun, et autres
Publié: (2025)
SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound
par: Dagli, Rishit, et autres
Publié: (2024)
par: Dagli, Rishit, et autres
Publié: (2024)
GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning
par: Lu, Yiren, et autres
Publié: (2026)
par: Lu, Yiren, et autres
Publié: (2026)
SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation
par: Zhang, Jiwen, et autres
Publié: (2026)
par: Zhang, Jiwen, et autres
Publié: (2026)
HiMemFormer: Hierarchical Memory-Aware Transformer for Multi-Agent Action Anticipation
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
par: Ma, Wufei, et autres
Publié: (2025)
par: Ma, Wufei, et autres
Publié: (2025)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
par: Liu, Chenghao, et autres
Publié: (2025)
par: Liu, Chenghao, et autres
Publié: (2025)
ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment
par: Dong, Mingyu, et autres
Publié: (2026)
par: Dong, Mingyu, et autres
Publié: (2026)
Direct Numerical Layout Generation for 3D Indoor Scene Synthesis via Spatial Reasoning
par: Ran, Xingjian, et autres
Publié: (2025)
par: Ran, Xingjian, et autres
Publié: (2025)
BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised Reinforcement Learning
par: Li, Yitang, et autres
Publié: (2025)
par: Li, Yitang, et autres
Publié: (2025)
Multi-Robot Navigation in Social Mini-Games: Definitions, Taxonomy, and Algorithms
par: Chandra, Rohan, et autres
Publié: (2025)
par: Chandra, Rohan, et autres
Publié: (2025)
Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
Reinforcement Learning with Physics-Informed Symbolic Program Priors for Zero-Shot Wireless Indoor Navigation
par: Li, Tao, et autres
Publié: (2025)
par: Li, Tao, et autres
Publié: (2025)
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
par: Burghouts, Gertjan, et autres
Publié: (2024)
par: Burghouts, Gertjan, et autres
Publié: (2024)
Reconfigurable Robot Control Using Flexible Coupling Mechanisms
par: Yi, Sha, et autres
Publié: (2023)
par: Yi, Sha, et autres
Publié: (2023)
Documents similaires
-
GL-NeRF: Gauss-Laguerre Quadrature Enables Training-Free NeRF Acceleration
par: Yong, Silong, et autres
Publié: (2024) -
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
par: Zhang, Ce, et autres
Publié: (2024) -
Instant4D: 4D Gaussian Splatting in Minutes
par: Luo, Zhanpeng, et autres
Publié: (2025) -
Dual Prototype Evolving for Test-Time Generalization of Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2024) -
Unifying Deep Predicate Invention with Pre-trained Foundation Models
par: Wang, Qianwei, et autres
Publié: (2025)