Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Zhihao, Jiang, Shuyi, Feng, Chun-Mei, Zhang, Yaolun, Cui, Shuguang, Li, Zhen, Zhao, Na |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
par: Yuan, Zhihao, et autres
Publié: (2023)
par: Yuan, Zhihao, et autres
Publié: (2023)
Empowering Large Language Models with 3D Situation Awareness
par: Yuan, Zhihao, et autres
Publié: (2025)
par: Yuan, Zhihao, et autres
Publié: (2025)
R2G: Reasoning to Ground in 3D Scenes
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
GaussianBlock: Building Part-Aware Compositional and Editable 3D Scene by Primitives and Gaussians
par: Jiang, Shuyi, et autres
Publié: (2024)
par: Jiang, Shuyi, et autres
Publié: (2024)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
par: Liu, Yuanyuan, et autres
Publié: (2025)
par: Liu, Yuanyuan, et autres
Publié: (2025)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2025)
par: Linghu, Xiongkun, et autres
Publié: (2025)
Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground Scenes
par: Jiang, Lihan, et autres
Publié: (2024)
par: Jiang, Lihan, et autres
Publié: (2024)
Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs
par: Zhong, Yingji, et autres
Publié: (2025)
par: Zhong, Yingji, et autres
Publié: (2025)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
par: Lyu, Ruiyuan, et autres
Publié: (2024)
par: Lyu, Ruiyuan, et autres
Publié: (2024)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
par: Huang, Haifeng, et autres
Publié: (2023)
par: Huang, Haifeng, et autres
Publié: (2023)
Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale
par: Wei, Dongxu, et autres
Publié: (2026)
par: Wei, Dongxu, et autres
Publié: (2026)
RelTopo: Multi-Level Relational Modeling for Driving Scene Topology Reasoning
par: Luo, Yueru, et autres
Publié: (2025)
par: Luo, Yueru, et autres
Publié: (2025)
LSVG: Language-Guided Scene Graphs with 2D-Assisted Multi-Modal Encoding for 3D Visual Grounding
par: Xiao, Feng, et autres
Publié: (2025)
par: Xiao, Feng, et autres
Publié: (2025)
LLplace: The 3D Indoor Scene Layout Generation and Editing via Large Language Model
par: Yang, Yixuan, et autres
Publié: (2024)
par: Yang, Yixuan, et autres
Publié: (2024)
Multimodal 3D Reasoning Segmentation with Complex Scenes
par: Jiang, Xueying, et autres
Publié: (2024)
par: Jiang, Xueying, et autres
Publié: (2024)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
SceneTeller: Language-to-3D Scene Generation
par: Öcal, Başak Melis, et autres
Publié: (2024)
par: Öcal, Başak Melis, et autres
Publié: (2024)
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
par: Wang, Qirui, et autres
Publié: (2026)
par: Wang, Qirui, et autres
Publié: (2026)
SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes
par: Maillard, Léopold, et autres
Publié: (2026)
par: Maillard, Léopold, et autres
Publié: (2026)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
par: Hu, Miao, et autres
Publié: (2025)
par: Hu, Miao, et autres
Publié: (2025)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
par: Jia, Baoxiong, et autres
Publié: (2024)
par: Jia, Baoxiong, et autres
Publié: (2024)
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding
par: Ost, Julian, et autres
Publié: (2025)
par: Ost, Julian, et autres
Publié: (2025)
R3DS: Reality-linked 3D Scenes for Panoramic Scene Understanding
par: Wu, Qirui, et autres
Publié: (2024)
par: Wu, Qirui, et autres
Publié: (2024)
SceneGlue: Scene-Aware Transformer for Feature Matching without Scene-Level Annotation
par: Du, Songlin, et autres
Publié: (2026)
par: Du, Songlin, et autres
Publié: (2026)
Instance Tracking in 3D Scenes from Egocentric Videos
par: Zhao, Yunhan, et autres
Publié: (2023)
par: Zhao, Yunhan, et autres
Publié: (2023)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
par: Dong, Wenqi, et autres
Publié: (2025)
par: Dong, Wenqi, et autres
Publié: (2025)
3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation
par: Lee, JoungBin, et autres
Publié: (2025)
par: Lee, JoungBin, et autres
Publié: (2025)
Timeliness-Fidelity Tradeoff in 3D Scene Representations
par: Xu, Xiangmin, et autres
Publié: (2024)
par: Xu, Xiangmin, et autres
Publié: (2024)
Enhancing Generalizability of Representation Learning for Data-Efficient 3D Scene Understanding
par: Wang, Yunsong, et autres
Publié: (2024)
par: Wang, Yunsong, et autres
Publié: (2024)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
par: Wang, Hanyang, et autres
Publié: (2025)
par: Wang, Hanyang, et autres
Publié: (2025)
DV-3DLane: End-to-end Multi-modal 3D Lane Detection with Dual-view Representation
par: Luo, Yueru, et autres
Publié: (2024)
par: Luo, Yueru, et autres
Publié: (2024)
Towards Flexible 3D Perception: Object-Centric Occupancy Completion Augments 3D Object Detection
par: Zheng, Chaoda, et autres
Publié: (2024)
par: Zheng, Chaoda, et autres
Publié: (2024)
MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding
par: Chang, Chun-Peng, et autres
Publié: (2024)
par: Chang, Chun-Peng, et autres
Publié: (2024)
PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation
par: Chen, Weixing, et autres
Publié: (2026)
par: Chen, Weixing, et autres
Publié: (2026)
ArtiWorld: LLM-Driven Articulation of 3D Objects in Scenes
par: Yang, Yixuan, et autres
Publié: (2025)
par: Yang, Yixuan, et autres
Publié: (2025)
SceneGPT: A Language Model for 3D Scene Understanding
par: Chandhok, Shivam
Publié: (2024)
par: Chandhok, Shivam
Publié: (2024)
VastGaussian: Vast 3D Gaussians for Large Scene Reconstruction
par: Lin, Jiaqi, et autres
Publié: (2024)
par: Lin, Jiaqi, et autres
Publié: (2024)
A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes
par: Li, Di, et autres
Publié: (2026)
par: Li, Di, et autres
Publié: (2026)
Documents similaires
-
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
par: Yuan, Zhihao, et autres
Publié: (2023) -
Empowering Large Language Models with 3D Situation Awareness
par: Yuan, Zhihao, et autres
Publié: (2025) -
R2G: Reasoning to Ground in 3D Scenes
par: Li, Yixuan, et autres
Publié: (2024) -
GaussianBlock: Building Part-Aware Compositional and Editable 3D Scene by Primitives and Gaussians
par: Jiang, Shuyi, et autres
Publié: (2024) -
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
par: Liu, Yuanyuan, et autres
Publié: (2025)