Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Shengli, Zheng, Minghang, Zheng, Feng, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
di: Zheng, Sixiao, et al.
Pubblicazione: (2024)
di: Zheng, Sixiao, et al.
Pubblicazione: (2024)
Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation
di: Cao, Pu, et al.
Pubblicazione: (2023)
di: Cao, Pu, et al.
Pubblicazione: (2023)
Programmable-Room: Interactive Textured 3D Room Meshes Generation Empowered by Large Language Models
di: Kim, Jihyun, et al.
Pubblicazione: (2025)
di: Kim, Jihyun, et al.
Pubblicazione: (2025)
ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)
HCNQA: Enhancing 3D VQA with Hierarchical Concentration Narrowing Supervision
di: Zhou, Shengli, et al.
Pubblicazione: (2025)
di: Zhou, Shengli, et al.
Pubblicazione: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
Exploring Category-level Articulated Object Pose Tracking on SE(3) Manifolds
di: Meng, Xianhui, et al.
Pubblicazione: (2025)
di: Meng, Xianhui, et al.
Pubblicazione: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
ReCorD: Reasoning and Correcting Diffusion for HOI Generation
di: Jiang-Lin, Jian-Yu, et al.
Pubblicazione: (2024)
di: Jiang-Lin, Jian-Yu, et al.
Pubblicazione: (2024)
VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation
di: Zheng, Sixiao, et al.
Pubblicazione: (2025)
di: Zheng, Sixiao, et al.
Pubblicazione: (2025)
CountingFruit: Language-Guided 3D Fruit Counting with Semantic Gaussian Splatting
di: Li, Fengze, et al.
Pubblicazione: (2025)
di: Li, Fengze, et al.
Pubblicazione: (2025)
LEAF-Mamba: Local Emphatic and Adaptive Fusion State Space Model for RGB-D Salient Object Detection
di: Wu, Lanhu, et al.
Pubblicazione: (2025)
di: Wu, Lanhu, et al.
Pubblicazione: (2025)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
di: Yang, Dejie, et al.
Pubblicazione: (2024)
di: Yang, Dejie, et al.
Pubblicazione: (2024)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
InteractMove: Text-Controlled Human-Object Interaction Generation in 3D Scenes with Movable Objects
di: Cai, Xinhao, et al.
Pubblicazione: (2025)
di: Cai, Xinhao, et al.
Pubblicazione: (2025)
DeformTrace: A Deformable State Space Model with Relay Tokens for Temporal Forgery Localization
di: Zhu, Xiaodong, et al.
Pubblicazione: (2026)
di: Zhu, Xiaodong, et al.
Pubblicazione: (2026)
Cross Modification Attention Based Deliberation Model for Image Captioning
di: Lian, Zheng, et al.
Pubblicazione: (2021)
di: Lian, Zheng, et al.
Pubblicazione: (2021)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
di: Liu, Che, et al.
Pubblicazione: (2026)
di: Liu, Che, et al.
Pubblicazione: (2026)
Ges3ViG: Incorporating Pointing Gestures into Language-Based 3D Visual Grounding for Embodied Reference Understanding
di: Mane, Atharv Mahesh, et al.
Pubblicazione: (2025)
di: Mane, Atharv Mahesh, et al.
Pubblicazione: (2025)
Can Large Language Models Grasp Event Signals? Exploring Pure Zero-Shot Event-based Recognition
di: Yu, Zongyou, et al.
Pubblicazione: (2024)
di: Yu, Zongyou, et al.
Pubblicazione: (2024)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2022)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2022)
X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2023)
di: Ran, Lingmin, et al.
Pubblicazione: (2023)
Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
di: Mao, Yuxin, et al.
Pubblicazione: (2025)
di: Mao, Yuxin, et al.
Pubblicazione: (2025)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation
di: Lu, Shuo, et al.
Pubblicazione: (2026)
di: Lu, Shuo, et al.
Pubblicazione: (2026)
POINTS: Improving Your Vision-language Model with Affordable Strategies
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
di: Liu, Renyang, et al.
Pubblicazione: (2024)
di: Liu, Renyang, et al.
Pubblicazione: (2024)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
Factorized Learning for Temporally Grounded Video-Language Models
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
di: Zeng, Wenzheng, et al.
Pubblicazione: (2025)
HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
di: Zhou, Chuhao, et al.
Pubblicazione: (2025)
di: Zhou, Chuhao, et al.
Pubblicazione: (2025)
Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
di: Zheng, Shuhong, et al.
Pubblicazione: (2026)
di: Zheng, Shuhong, et al.
Pubblicazione: (2026)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability
di: Li, Chengzhi, et al.
Pubblicazione: (2025)
di: Li, Chengzhi, et al.
Pubblicazione: (2025)
Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
di: Yu, Lijun, et al.
Pubblicazione: (2023)
di: Yu, Lijun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
di: Zheng, Sixiao, et al.
Pubblicazione: (2024) -
Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation
di: Cao, Pu, et al.
Pubblicazione: (2023) -
Programmable-Room: Interactive Textured 3D Room Meshes Generation Empowered by Large Language Models
di: Kim, Jihyun, et al.
Pubblicazione: (2025) -
ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024) -
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)