Exploring Spatial Intelligence from a Generative Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Muzhi, Jiang, Shunyao, Zheng, Huanyi, Luo, Zekai, Zhong, Hao, Li, Anzhou, Wang, Kaijun, Rong, Jintao, Liu, Yang, Chen, Hao, Lin, Tao, Shen, Chunhua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation
par: Zhu, Muzhi, et autres
Publié: (2024)
par: Zhu, Muzhi, et autres
Publié: (2024)
Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
par: Luo, Zekai, et autres
Publié: (2025)
par: Luo, Zekai, et autres
Publié: (2025)
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
par: Lin, Zekai, et autres
Publié: (2026)
par: Lin, Zekai, et autres
Publié: (2026)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
par: Zhao, Canyu, et autres
Publié: (2025)
par: Zhao, Canyu, et autres
Publié: (2025)
SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories
par: Zhu, Muzhi, et autres
Publié: (2025)
par: Zhu, Muzhi, et autres
Publié: (2025)
Generative Active Learning for Long-tailed Instance Segmentation
par: Zhu, Muzhi, et autres
Publié: (2024)
par: Zhu, Muzhi, et autres
Publié: (2024)
Matcher: Segment Anything with One Shot Using All-Purpose Feature Matching
par: Liu, Yang, et autres
Publié: (2023)
par: Liu, Yang, et autres
Publié: (2023)
DiverGen: Improving Instance Segmentation by Learning Wider Data Distribution with More Diverse Generative Data
par: Fan, Chengxiang, et autres
Publié: (2024)
par: Fan, Chengxiang, et autres
Publié: (2024)
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
par: Zhong, Hao, et autres
Publié: (2025)
par: Zhong, Hao, et autres
Publié: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
par: Jia, Yiduo, et autres
Publié: (2026)
par: Jia, Yiduo, et autres
Publié: (2026)
A Simple Image Segmentation Framework via In-Context Examples
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
par: Li, Liyang, et autres
Publié: (2026)
par: Li, Liyang, et autres
Publié: (2026)
Unlocking the Power of Critical Factors for 3D Visual Geometry Estimation
par: Xu, Guangkai, et autres
Publié: (2026)
par: Xu, Guangkai, et autres
Publié: (2026)
NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces
par: Huang, Zheng, et autres
Publié: (2025)
par: Huang, Zheng, et autres
Publié: (2025)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
par: Zhu, Muzhi, et autres
Publié: (2025)
par: Zhu, Muzhi, et autres
Publié: (2025)
Bridge Thinking and Acting: Unleashing Physical Potential of VLM with Generalizable Action Expert
par: Liu, Mingyu, et autres
Publié: (2025)
par: Liu, Mingyu, et autres
Publié: (2025)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
par: Bian, Jinyue, et autres
Publié: (2025)
par: Bian, Jinyue, et autres
Publié: (2025)
HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
par: Chen, Cong, et autres
Publié: (2025)
par: Chen, Cong, et autres
Publié: (2025)
Unified Open-World Segmentation with Multi-Modal Prompts
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Training-Free Motion Customization for Distilled Video Generators with Adaptive Test-Time Distillation
par: Rong, Jintao, et autres
Publié: (2025)
par: Rong, Jintao, et autres
Publié: (2025)
ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tasks
par: Wang, Kaijun, et autres
Publié: (2025)
par: Wang, Kaijun, et autres
Publié: (2025)
GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
par: Chen, Cong, et autres
Publié: (2025)
par: Chen, Cong, et autres
Publié: (2025)
Index-Aligned Query Distillation for Transformer-based Incremental Object Detection
par: Ma, Mingxiao, et autres
Publié: (2025)
par: Ma, Mingxiao, et autres
Publié: (2025)
FreeCompose: Generic Zero-Shot Image Composition with Diffusion Prior
par: Chen, Zhekai, et autres
Publié: (2024)
par: Chen, Zhekai, et autres
Publié: (2024)
Thinking with Novel Views: A Systematic Analysis of Generative-Augmented Spatial Intelligence
par: Zhang, Yanbing, et autres
Publié: (2026)
par: Zhang, Yanbing, et autres
Publié: (2026)
Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
par: Wu, Guanlin, et autres
Publié: (2025)
par: Wu, Guanlin, et autres
Publié: (2025)
Exploring Kernel Transformations for Implicit Neural Representations
par: Zheng, Sheng, et autres
Publié: (2025)
par: Zheng, Sheng, et autres
Publié: (2025)
Diffusion Models are Efficient Data Generators for Human Mesh Recovery
par: Ge, Yongtao, et autres
Publié: (2024)
par: Ge, Yongtao, et autres
Publié: (2024)
SurfaceSplat: Connecting Surface Reconstruction and Gaussian Splatting
par: Gao, Zihui, et autres
Publié: (2025)
par: Gao, Zihui, et autres
Publié: (2025)
FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept Composition
par: Ding, Ganggui, et autres
Publié: (2024)
par: Ding, Ganggui, et autres
Publié: (2024)
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
par: Mao, Fangyuan, et autres
Publié: (2025)
par: Mao, Fangyuan, et autres
Publié: (2025)
STAG4D: Spatial-Temporal Anchored Generative 4D Gaussians
par: Zeng, Yifei, et autres
Publié: (2024)
par: Zeng, Yifei, et autres
Publié: (2024)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
par: Zhan, Shaoxiong, et autres
Publié: (2026)
par: Zhan, Shaoxiong, et autres
Publié: (2026)
Framer: Interactive Frame Interpolation
par: Wang, Wen, et autres
Publié: (2024)
par: Wang, Wen, et autres
Publié: (2024)
REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation
par: Xue, Xizhe, et autres
Publié: (2024)
par: Xue, Xizhe, et autres
Publié: (2024)
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
par: Gao, Yuanyuan, et autres
Publié: (2026)
par: Gao, Yuanyuan, et autres
Publié: (2026)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
par: Sun, Jintao, et autres
Publié: (2024)
par: Sun, Jintao, et autres
Publié: (2024)
Superior and Pragmatic Talking Face Generation with Teacher-Student Framework
par: Liang, Chao, et autres
Publié: (2024)
par: Liang, Chao, et autres
Publié: (2024)
Object-aware Inversion and Reassembly for Image Editing
par: Yang, Zhen, et autres
Publié: (2023)
par: Yang, Zhen, et autres
Publié: (2023)
RGM: A Robust Generalizable Matching Model
par: Zhang, Songyan, et autres
Publié: (2023)
par: Zhang, Songyan, et autres
Publié: (2023)
Documents similaires
-
Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation
par: Zhu, Muzhi, et autres
Publié: (2024) -
Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality
par: Luo, Zekai, et autres
Publié: (2025) -
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
par: Lin, Zekai, et autres
Publié: (2026) -
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
par: Zhao, Canyu, et autres
Publié: (2025) -
SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories
par: Zhu, Muzhi, et autres
Publié: (2025)