Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jingdong, Wang, Yizhou, Tu, Zhengzhong, Li, Xin, Wang, Wenping, Zhan, Xiaohang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Thinking in 360°: Humanoid Visual Search in the Wild
par: Yu, Heyang, et autres
Publié: (2025)
par: Yu, Heyang, et autres
Publié: (2025)
MTPano: Multi-Task Panoramic Scene Understanding via Label-Free Integration of Dense Prediction Priors
par: Zhang, Jingdong, et autres
Publié: (2026)
par: Zhang, Jingdong, et autres
Publié: (2026)
RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation
par: Guan, Cheng, et autres
Publié: (2026)
par: Guan, Cheng, et autres
Publié: (2026)
Multi-Task Label Discovery via Hierarchical Task Tokens for Partially Annotated Dense Predictions
par: Zhang, Jingdong, et autres
Publié: (2024)
par: Zhang, Jingdong, et autres
Publié: (2024)
SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction
par: Zhong, Haoyi, et autres
Publié: (2025)
par: Zhong, Haoyi, et autres
Publié: (2025)
Visually-grounded Humanoid Agents
par: Ye, Hang, et autres
Publié: (2026)
par: Ye, Hang, et autres
Publié: (2026)
Gimbal360: Differentiable Auto-Leveling for Canonicalized $360^\circ$ Panoramic Image Completion
par: Lu, Yuqin, et autres
Publié: (2026)
par: Lu, Yuqin, et autres
Publié: (2026)
UniSER: A Foundation Model for Unified Soft Effects Removal
par: Zhang, Jingdong, et autres
Publié: (2025)
par: Zhang, Jingdong, et autres
Publié: (2025)
3R-GS: Best Practice in Optimizing Camera Poses Along with 3DGS
par: Huang, Zhisheng, et autres
Publié: (2025)
par: Huang, Zhisheng, et autres
Publié: (2025)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
par: Wang, Changpeng, et autres
Publié: (2026)
par: Wang, Changpeng, et autres
Publié: (2026)
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
par: Huang, Yanjia, et autres
Publié: (2025)
par: Huang, Yanjia, et autres
Publié: (2025)
Splatter-360: Generalizable 360$^{\circ}$ Gaussian Splatting for Wide-baseline Panoramic Images
par: Chen, Zheng, et autres
Publié: (2024)
par: Chen, Zheng, et autres
Publié: (2024)
Imagine360: Immersive 360 Video Generation from Perspective Anchor
par: Tan, Jing, et autres
Publié: (2024)
par: Tan, Jing, et autres
Publié: (2024)
Depth Anything in $360^\circ$: Towards Scale Invariance in the Wild
par: Jiang, Hualie, et autres
Publié: (2025)
par: Jiang, Hualie, et autres
Publié: (2025)
ScanGAN360: A Generative Model of Realistic Scanpaths for 360$^{\circ}$ Images
par: Martin, Daniel, et autres
Publié: (2021)
par: Martin, Daniel, et autres
Publié: (2021)
360$^\circ$ High-Resolution Depth Estimation via Uncertainty-aware Structural Knowledge Transfer
par: Cao, Zidong, et autres
Publié: (2023)
par: Cao, Zidong, et autres
Publié: (2023)
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
par: Chen, Xinyu, et autres
Publié: (2025)
par: Chen, Xinyu, et autres
Publié: (2025)
SDGE: Stereo Guided Depth Estimation for 360$^\circ$ Camera Sets
par: Xu, Jialei, et autres
Publié: (2024)
par: Xu, Jialei, et autres
Publié: (2024)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
par: Chen, Mingrui, et autres
Publié: (2026)
par: Chen, Mingrui, et autres
Publié: (2026)
HeadsUp! High-Fidelity Portrait Image Super-Resolution
par: Li, Renjie, et autres
Publié: (2025)
par: Li, Renjie, et autres
Publié: (2025)
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
par: Xia, Shao-Jun, et autres
Publié: (2025)
par: Xia, Shao-Jun, et autres
Publié: (2025)
FullCircle: Effortless 3D Reconstruction from Casual 360$^\circ$ Captures
par: Foroutan, Yalda, et autres
Publié: (2026)
par: Foroutan, Yalda, et autres
Publié: (2026)
LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering
par: Zhan, Xiaohang, et autres
Publié: (2025)
par: Zhan, Xiaohang, et autres
Publié: (2025)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
par: Yang, Qian, et autres
Publié: (2026)
par: Yang, Qian, et autres
Publié: (2026)
RobotPan: A 360$^\circ$ Surround-View Robotic Vision System for Embodied Perception
par: Ma, Jiahao, et autres
Publié: (2026)
par: Ma, Jiahao, et autres
Publié: (2026)
SPGen: Spherical Projection as Consistent and Flexible Representation for Single Image 3D Shape Generation
par: Zhang, Jingdong, et autres
Publié: (2025)
par: Zhang, Jingdong, et autres
Publié: (2025)
Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration
par: Ding, Pengxiang, et autres
Publié: (2025)
par: Ding, Pengxiang, et autres
Publié: (2025)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
par: Li, Xuchen, et autres
Publié: (2026)
par: Li, Xuchen, et autres
Publié: (2026)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
par: Li, Yian, et autres
Publié: (2026)
par: Li, Yian, et autres
Publié: (2026)
ViFu: Multiple 360$^\circ$ Objects Reconstruction with Clean Background via Visible Part Fusion
par: Xu, Tianhan, et autres
Publié: (2024)
par: Xu, Tianhan, et autres
Publié: (2024)
Pyramidal Patchification Flow for Visual Generation
par: Li, Hui, et autres
Publié: (2025)
par: Li, Hui, et autres
Publié: (2025)
Guiding Visual Autoregressive Models through Spectrum Weakening
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Physically Aware 360$^\circ$ View Generation from a Single Image using Disentangled Scene Embeddings
par: KV, Karthikeya, et autres
Publié: (2025)
par: KV, Karthikeya, et autres
Publié: (2025)
Exploring Effective Factors for Improving Visual In-Context Learning
par: Sun, Yanpeng, et autres
Publié: (2023)
par: Sun, Yanpeng, et autres
Publié: (2023)
Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors
par: Chen, Jiahe, et autres
Publié: (2026)
par: Chen, Jiahe, et autres
Publié: (2026)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
par: Xing, Shuo, et autres
Publié: (2025)
par: Xing, Shuo, et autres
Publié: (2025)
Thyme: Think Beyond Images
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
360DVO: Deep Visual Odometry for Monocular 360-Degree Camera
par: Guo, Xiaopeng, et autres
Publié: (2026)
par: Guo, Xiaopeng, et autres
Publié: (2026)
360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model
par: Wang, Qian, et autres
Publié: (2024)
par: Wang, Qian, et autres
Publié: (2024)
Documents similaires
-
Thinking in 360°: Humanoid Visual Search in the Wild
par: Yu, Heyang, et autres
Publié: (2025) -
MTPano: Multi-Task Panoramic Scene Understanding via Label-Free Integration of Dense Prediction Priors
par: Zhang, Jingdong, et autres
Publié: (2026) -
RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation
par: Guan, Cheng, et autres
Publié: (2026) -
Multi-Task Label Discovery via Hierarchical Task Tokens for Partially Annotated Dense Predictions
par: Zhang, Jingdong, et autres
Publié: (2024) -
SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction
par: Zhong, Haoyi, et autres
Publié: (2025)