Thinking in 360°: Humanoid Visual Search in the Wild
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Heyang, Han, Yinan, Zhang, Xiangyu, Yin, Baiqiao, Chang, Bowen, Han, Xiangyu, Liu, Xinhao, Zhang, Jing, Pavone, Marco, Feng, Chen, Xie, Saining, Li, Yiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search
por: Zhang, Jingdong, et al.
Publicado: (2026)
por: Zhang, Jingdong, et al.
Publicado: (2026)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025)
por: Yan, Ziang, et al.
Publicado: (2025)
Adversarial Exploitation of Data Diversity Improves Visual Localization
por: Li, Sihang, et al.
Publicado: (2024)
por: Li, Sihang, et al.
Publicado: (2024)
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
por: Yang, Jihan, et al.
Publicado: (2024)
por: Yang, Jihan, et al.
Publicado: (2024)
From Web to Pixels: Bringing Agentic Search into Visual Perception
por: Yang, Bokang, et al.
Publicado: (2026)
por: Yang, Bokang, et al.
Publicado: (2026)
Extrapolated Urban View Synthesis Benchmark
por: Han, Xiangyu, et al.
Publicado: (2024)
por: Han, Xiangyu, et al.
Publicado: (2024)
MindCube: Spatial Mental Modeling from Limited Views
por: Wang, Qineng, et al.
Publicado: (2025)
por: Wang, Qineng, et al.
Publicado: (2025)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
por: Zhang, Zhixin, et al.
Publicado: (2024)
por: Zhang, Zhixin, et al.
Publicado: (2024)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
por: Fan, Kaixuan, et al.
Publicado: (2025)
por: Fan, Kaixuan, et al.
Publicado: (2025)
What Makes for Text to 360-degree Panorama Generation with Stable Diffusion?
por: Ni, Jinhong, et al.
Publicado: (2025)
por: Ni, Jinhong, et al.
Publicado: (2025)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
por: Li, Xinhao, et al.
Publicado: (2025)
por: Li, Xinhao, et al.
Publicado: (2025)
Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
por: Yu, Sihyun, et al.
Publicado: (2024)
por: Yu, Sihyun, et al.
Publicado: (2024)
Boosting Adversarial Training via Fisher-Rao Norm-based Regularization
por: Yin, Xiangyu, et al.
Publicado: (2024)
por: Yin, Xiangyu, et al.
Publicado: (2024)
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
por: Zhang, Yiming, et al.
Publicado: (2026)
por: Zhang, Yiming, et al.
Publicado: (2026)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
por: Hao, Haoran, et al.
Publicado: (2025)
por: Hao, Haoran, et al.
Publicado: (2025)
Robust Neural Rendering in the Wild with Asymmetric Dual 3D Gaussian Splatting
por: Li, Chengqi, et al.
Publicado: (2025)
por: Li, Chengqi, et al.
Publicado: (2025)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
por: Liu, Xiangyu, et al.
Publicado: (2026)
por: Liu, Xiangyu, et al.
Publicado: (2026)
WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering
por: Han, Yuxuan, et al.
Publicado: (2025)
por: Han, Yuxuan, et al.
Publicado: (2025)
Institutional Design, Outside Director Effectiveness, and Stock Price Crash Risk: Evidence from Japan's 2015 Hybrid Board Reform*
por: Baiqiao Yin
Publicado: (2026)
por: Baiqiao Yin
Publicado: (2026)
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
WildOS: Open-Vocabulary Object Search in the Wild
por: Shah, Hardik, et al.
Publicado: (2026)
por: Shah, Hardik, et al.
Publicado: (2026)
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
por: Chen, Jiacheng, et al.
Publicado: (2025)
por: Chen, Jiacheng, et al.
Publicado: (2025)
Small Object Tracking in LiDAR Point Cloud: Learning the Target-awareness Prototype and Fine-grained Search Region
por: Tian, Shengjing, et al.
Publicado: (2024)
por: Tian, Shengjing, et al.
Publicado: (2024)
Self-Supervised Visual Preference Alignment
por: Zhu, Ke, et al.
Publicado: (2024)
por: Zhu, Ke, et al.
Publicado: (2024)
360 in the Wild: Dataset for Depth Prediction and View Synthesis
por: Park, Kibaek, et al.
Publicado: (2024)
por: Park, Kibaek, et al.
Publicado: (2024)
Falcon: Fractional Alternating Cut with Overcoming Minima in Unsupervised Segmentation
por: Zhang, Xiao, et al.
Publicado: (2025)
por: Zhang, Xiao, et al.
Publicado: (2025)
VisualMimic: Visual Humanoid Loco-Manipulation via Motion Tracking and Generation
por: Yin, Shaofeng, et al.
Publicado: (2025)
por: Yin, Shaofeng, et al.
Publicado: (2025)
Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration
por: Ding, Pengxiang, et al.
Publicado: (2025)
por: Ding, Pengxiang, et al.
Publicado: (2025)
Depth Anything in $360^\circ$: Towards Scale Invariance in the Wild
por: Jiang, Hualie, et al.
Publicado: (2025)
por: Jiang, Hualie, et al.
Publicado: (2025)
CUBE360: Learning Cubic Field Representation for Monocular 360 Depth Estimation for Virtual Reality
por: Chang, Wenjie, et al.
Publicado: (2024)
por: Chang, Wenjie, et al.
Publicado: (2024)
Structure Over Scale: Learning Visual Reasoning from Pedagogical Video
por: Galoaa, Bishoy, et al.
Publicado: (2026)
por: Galoaa, Bishoy, et al.
Publicado: (2026)
Towards Visual Query Segmentation in the Wild
por: Fan, Bing, et al.
Publicado: (2026)
por: Fan, Bing, et al.
Publicado: (2026)
Renormalization Group Guided Tensor Network Structure Search
por: Wang, Maolin, et al.
Publicado: (2025)
por: Wang, Maolin, et al.
Publicado: (2025)
Duoduo CLIP: Efficient 3D Understanding with Multi-View Images
por: Lee, Han-Hung, et al.
Publicado: (2024)
por: Lee, Han-Hung, et al.
Publicado: (2024)
MVBoost: Boost 3D Reconstruction with Multi-View Refinement
por: Liu, Xiangyu, et al.
Publicado: (2024)
por: Liu, Xiangyu, et al.
Publicado: (2024)
Spike-NVPT: Learning Robust Visual Prompts via Bio-Inspired Temporal Filtering and Discretization
por: Zhan, Qiugang, et al.
Publicado: (2026)
por: Zhan, Qiugang, et al.
Publicado: (2026)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
por: Hao, Haoran, et al.
Publicado: (2024)
por: Hao, Haoran, et al.
Publicado: (2024)
Controllable Shape Modeling with Neural Generalized Cylinder
por: Zhu, Xiangyu, et al.
Publicado: (2024)
por: Zhu, Xiangyu, et al.
Publicado: (2024)
Visual Imitation Enables Contextual Humanoid Control
por: Allshire, Arthur, et al.
Publicado: (2025)
por: Allshire, Arthur, et al.
Publicado: (2025)
Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics
por: Wang, Hai, et al.
Publicado: (2026)
por: Wang, Hai, et al.
Publicado: (2026)
Ejemplares similares
-
Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search
por: Zhang, Jingdong, et al.
Publicado: (2026) -
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025) -
Adversarial Exploitation of Data Diversity Improves Visual Localization
por: Li, Sihang, et al.
Publicado: (2024) -
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
por: Yang, Jihan, et al.
Publicado: (2024) -
From Web to Pixels: Bringing Agentic Search into Visual Perception
por: Yang, Bokang, et al.
Publicado: (2026)