Saved in:
| Main Authors: | Liu, Yuanyuan, Mei, Haiyang, Zhan, Dongyang, Zhao, Jiayue, Zhou, Dongsheng, Dong, Bo, Yang, Xin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2512.09215 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
by: Saxena, Pranav, et al.
Published: (2025)
by: Saxena, Pranav, et al.
Published: (2025)
SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
by: Sun, Xuefei, et al.
Published: (2026)
by: Sun, Xuefei, et al.
Published: (2026)
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
by: Yuan, Zhihao, et al.
Published: (2023)
by: Yuan, Zhihao, et al.
Published: (2023)
A Zero-shot Learning Method Based on Large Language Models for Multi-modal Knowledge Graph Embedding
by: Liu, Bingchen, et al.
Published: (2025)
by: Liu, Bingchen, et al.
Published: (2025)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
by: Jin, Zhao, et al.
Published: (2025)
by: Jin, Zhao, et al.
Published: (2025)
Zero-shot Graph Reasoning via Retrieval Augmented Framework with LLMs
by: Li, Hanqing, et al.
Published: (2025)
by: Li, Hanqing, et al.
Published: (2025)
Zero-shot Vision-Language Reranking for Cross-View Geolocalization
by: Erzurumlu, Yunus Talha, et al.
Published: (2026)
by: Erzurumlu, Yunus Talha, et al.
Published: (2026)
LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding
by: Xiao, Feng, et al.
Published: (2025)
by: Xiao, Feng, et al.
Published: (2025)
SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation
by: Yin, Hang, et al.
Published: (2024)
by: Yin, Hang, et al.
Published: (2024)
VIPER Strike: Defeating Visual Reasoning CAPTCHAs via Structured Vision-Language Inference
by: Qi, Minfeng, et al.
Published: (2026)
by: Qi, Minfeng, et al.
Published: (2026)
GITA: Graph to Visual and Textual Integration for Vision-Language Graph Reasoning
by: Wei, Yanbin, et al.
Published: (2024)
by: Wei, Yanbin, et al.
Published: (2024)
AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding
by: Yao, Runmao, et al.
Published: (2026)
by: Yao, Runmao, et al.
Published: (2026)
Zero-Shot 3D Visual Grounding from Vision-Language Models
by: Li, Rong, et al.
Published: (2025)
by: Li, Rong, et al.
Published: (2025)
Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models
by: Bharadwaj, Sagar, et al.
Published: (2026)
by: Bharadwaj, Sagar, et al.
Published: (2026)
Interpretable Zero-shot Referring Expression Comprehension with Query-driven Scene Graphs
by: Wu, Yike, et al.
Published: (2026)
by: Wu, Yike, et al.
Published: (2026)
VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning
by: Madhavaram, Vivek, et al.
Published: (2026)
by: Madhavaram, Vivek, et al.
Published: (2026)
Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations
by: Yuan, Zhihao, et al.
Published: (2025)
by: Yuan, Zhihao, et al.
Published: (2025)
Zero-shot Object Navigation with Vision-Language Models Reasoning
by: Wen, Congcong, et al.
Published: (2024)
by: Wen, Congcong, et al.
Published: (2024)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
by: Gholami, Mohsen, et al.
Published: (2025)
by: Gholami, Mohsen, et al.
Published: (2025)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
by: Liao, Liwei, et al.
Published: (2025)
by: Liao, Liwei, et al.
Published: (2025)
SceneGraphLoc: Cross-Modal Coarse Visual Localization on 3D Scene Graphs
by: Miao, Yang, et al.
Published: (2024)
by: Miao, Yang, et al.
Published: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
by: Wang, Chuhan, et al.
Published: (2026)
by: Wang, Chuhan, et al.
Published: (2026)
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
by: Zhou, Zijian, et al.
Published: (2023)
by: Zhou, Zijian, et al.
Published: (2023)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
by: Zhang, Jiwen, et al.
Published: (2026)
by: Zhang, Jiwen, et al.
Published: (2026)
Neuro-Symbolic Scene Graph Reasoning for Explainable Vision
by: Revista, Zen, et al.
Published: (2025)
by: Revista, Zen, et al.
Published: (2025)
Video Motion Graphs
by: Liu, Haiyang, et al.
Published: (2025)
by: Liu, Haiyang, et al.
Published: (2025)
Zero-shot Cross-lingual NER via Mitigating Language Difference: An Entity-aligned Translation Perspective
by: Zhang, Zhihao, et al.
Published: (2025)
by: Zhang, Zhihao, et al.
Published: (2025)
Controllable 3D Outdoor Scene Generation via Scene Graphs
by: Liu, Yuheng, et al.
Published: (2025)
by: Liu, Yuheng, et al.
Published: (2025)
ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes
by: Chen, Jianqiu, et al.
Published: (2023)
by: Chen, Jianqiu, et al.
Published: (2023)
Less is More: One-shot Subgraph Reasoning on Large-scale Knowledge Graphs
by: Zhou, Zhanke, et al.
Published: (2024)
by: Zhou, Zhanke, et al.
Published: (2024)
GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving
by: Schmidt, Fabian, et al.
Published: (2025)
by: Schmidt, Fabian, et al.
Published: (2025)
FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding
by: Zhan, Chenlu, et al.
Published: (2025)
by: Zhan, Chenlu, et al.
Published: (2025)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
by: Lin, Jiawen, et al.
Published: (2025)
by: Lin, Jiawen, et al.
Published: (2025)
3D Scene Graph Guided Vision-Language Pre-training
by: Liu, Hao, et al.
Published: (2024)
by: Liu, Hao, et al.
Published: (2024)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
by: Tao, Qian, et al.
Published: (2025)
by: Tao, Qian, et al.
Published: (2025)
Supplementing Missing Visions via Dialog for Scene Graph Generations
by: Zhao, Zhenghao, et al.
Published: (2022)
by: Zhao, Zhenghao, et al.
Published: (2022)
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
by: Makarov, Vladislav, et al.
Published: (2026)
by: Makarov, Vladislav, et al.
Published: (2026)
GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning
by: Miao, Deshui, et al.
Published: (2026)
by: Miao, Deshui, et al.
Published: (2026)
FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph
by: Zhou, Xiaolin, et al.
Published: (2025)
by: Zhou, Xiaolin, et al.
Published: (2025)
Spectral GNN via Two-dimensional (2-D) Graph Convolution
by: Li, Guoming, et al.
Published: (2024)
by: Li, Guoming, et al.
Published: (2024)
Similar Items
-
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
by: Saxena, Pranav, et al.
Published: (2025) -
SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
by: Sun, Xuefei, et al.
Published: (2026) -
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
by: Yuan, Zhihao, et al.
Published: (2023) -
A Zero-shot Learning Method Based on Large Language Models for Multi-modal Knowledge Graph Embedding
by: Liu, Bingchen, et al.
Published: (2025) -
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
by: Jin, Zhao, et al.
Published: (2025)