Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ling, Lu, Lin, Chen-Hsuan, Lin, Tsung-Yi, Ding, Yifan, Zeng, Yu, Sheng, Yichen, Ge, Yunhao, Liu, Ming-Yu, Bera, Aniket, Li, Zhaoshuo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
par: Ling, Lu, et autres
Publié: (2025)
par: Ling, Lu, et autres
Publié: (2025)
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
par: Gu, Zeqi, et autres
Publié: (2025)
par: Gu, Zeqi, et autres
Publié: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
par: Xia, Hongchi, et autres
Publié: (2026)
par: Xia, Hongchi, et autres
Publié: (2026)
Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation
par: Ge, Yunhao, et autres
Publié: (2024)
par: Ge, Yunhao, et autres
Publié: (2024)
Efficient Part-level 3D Object Generation via Dual Volume Packing
par: Tang, Jiaxiang, et autres
Publié: (2025)
par: Tang, Jiaxiang, et autres
Publié: (2025)
Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
par: Lin, Yu-Hsuan
Publié: (2025)
par: Lin, Yu-Hsuan
Publié: (2025)
FlashSLAM: Accelerated RGB-D SLAM for Real-Time 3D Scene Reconstruction with Gaussian Splatting
par: Pham, Phu, et autres
Publié: (2024)
par: Pham, Phu, et autres
Publié: (2024)
DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision
par: Ling, Lu, et autres
Publié: (2023)
par: Ling, Lu, et autres
Publié: (2023)
Edify 3D: Scalable High-Quality 3D Asset Generation
par: NVIDIA, et autres
Publié: (2024)
par: NVIDIA, et autres
Publié: (2024)
A Progressive Framework of Vision-language Knowledge Distillation and Alignment for Multilingual Scene
par: Zhang, Wenbo, et autres
Publié: (2024)
par: Zhang, Wenbo, et autres
Publié: (2024)
HCVR Scene Generation: High Compatibility Virtual Reality Environment Generation for Extended Redirected Walking
par: Zhang, Yiran, et autres
Publié: (2026)
par: Zhang, Yiran, et autres
Publié: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts
par: Fang, Shuangkang, et autres
Publié: (2024)
par: Fang, Shuangkang, et autres
Publié: (2024)
VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models
par: Kulshrestha, Manav, et autres
Publié: (2025)
par: Kulshrestha, Manav, et autres
Publié: (2025)
Placing Human Animations into 3D Scenes by Learning Interaction- and Geometry-Driven Keyframes
par: Mullen Jr, James F., et autres
Publié: (2022)
par: Mullen Jr, James F., et autres
Publié: (2022)
CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
par: Xiong, Chen, et autres
Publié: (2025)
par: Xiong, Chen, et autres
Publié: (2025)
Handle-based Mesh Deformation Guided By Vision Language Model
par: Sun, Xingpeng, et autres
Publié: (2025)
par: Sun, Xingpeng, et autres
Publié: (2025)
Dynamic Camera Poses and Where to Find Them
par: Rockwell, Chris, et autres
Publié: (2025)
par: Rockwell, Chris, et autres
Publié: (2025)
Meshtron: High-Fidelity, Artist-Like 3D Mesh Generation at Scale
par: Hao, Zekun, et autres
Publié: (2024)
par: Hao, Zekun, et autres
Publié: (2024)
IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
par: Liu, Parker, et autres
Publié: (2025)
par: Liu, Parker, et autres
Publié: (2025)
Precision‐Targeted Injection Laryngoplasty and Longitudinal Biomaterial Effects Evaluation Using High‐resolution Ultrasonography in a Rat Model
par: Wen‐Hsuan Tseng, et autres
Publié: (2024)
par: Wen‐Hsuan Tseng, et autres
Publié: (2024)
Retention Score: Quantifying Jailbreak Risks for Vision Language Models
par: Li, Zaitang, et autres
Publié: (2024)
par: Li, Zaitang, et autres
Publié: (2024)
Ranking-aware adapter for text-driven image ordering with CLIP
par: Yu, Wei-Hsiang, et autres
Publié: (2024)
par: Yu, Wei-Hsiang, et autres
Publié: (2024)
Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation
par: Daiya, Divyanshu, et autres
Publié: (2026)
par: Daiya, Divyanshu, et autres
Publié: (2026)
Optimizing Crowd-Aware Multi-Agent Path Finding through Local Communication with Graph Neural Networks
par: Pham, Phu, et autres
Publié: (2023)
par: Pham, Phu, et autres
Publié: (2023)
CoCo4D: Comprehensive and Complex 4D Scene Generation
par: Zhou, Junwei, et autres
Publié: (2025)
par: Zhou, Junwei, et autres
Publié: (2025)
COLLAGE: Collaborative Human-Agent Interaction Generation using Hierarchical Latent Diffusion and Language Models
par: Daiya, Divyanshu, et autres
Publié: (2024)
par: Daiya, Divyanshu, et autres
Publié: (2024)
AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment
par: Zhu, Hanwei, et autres
Publié: (2025)
par: Zhu, Hanwei, et autres
Publié: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
Hydra: An Agentic Reasoning Approach for Enhancing Adversarial Robustness and Mitigating Hallucinations in Vision-Language Models
par: Chung-En, et autres
Publié: (2025)
par: Chung-En, et autres
Publié: (2025)
Syn3DTxt: Embedding 3D Cues for Scene Text Generation
par: Hsiung, Li-Syun, et autres
Publié: (2025)
par: Hsiung, Li-Syun, et autres
Publié: (2025)
VillanDiffusion: A Unified Backdoor Attack Framework for Diffusion Models
par: Chou, Sheng-Yen, et autres
Publié: (2023)
par: Chou, Sheng-Yen, et autres
Publié: (2023)
Brain Mechanisms of Fear Reduction Underlying Habituation to Pain in Humans
par: Yi‐Hsuan Lin, et autres
Publié: (2025)
par: Yi‐Hsuan Lin, et autres
Publié: (2025)
A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes
par: Yu, Ting, et autres
Publié: (2024)
par: Yu, Ting, et autres
Publié: (2024)
Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation
par: Zheng, Wanrong, et autres
Publié: (2026)
par: Zheng, Wanrong, et autres
Publié: (2026)
DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes
par: Liu, Jinxiu, et autres
Publié: (2024)
par: Liu, Jinxiu, et autres
Publié: (2024)
Lestidiops sphyraenopsis Hubbs 1916
par: Ho, Hsuan-Ching, et autres
Publié: (2024)
par: Ho, Hsuan-Ching, et autres
Publié: (2024)
A new barracudina (Aulopiformes, Paralepididae, ) from Somalia, with additional records of from the Caribbean Sea.
par: Ho, Hsuan-Ching, et autres
Publié: (2025)
par: Ho, Hsuan-Ching, et autres
Publié: (2025)
Documents similaires
-
I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
par: Ling, Lu, et autres
Publié: (2025) -
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
par: Gu, Zeqi, et autres
Publié: (2025) -
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025) -
SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
par: Xia, Hongchi, et autres
Publié: (2026) -
Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation
par: Ge, Yunhao, et autres
Publié: (2024)