Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chongyu, Huang, Ting, Sun, Chunyu, Ning, Xinyu, Wang, Di, Tang, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PromptTea: Let Prompts Tell TeaCache the Optimal Threshold
par: Huang, Zishen, et autres
Publié: (2025)
par: Huang, Zishen, et autres
Publié: (2025)
Efficiently Expanding Receptive Fields: Local Split Attention and Parallel Aggregation for Enhanced Large-scale Point Cloud Semantic Segmentation
par: Wang, Haodong, et autres
Publié: (2024)
par: Wang, Haodong, et autres
Publié: (2024)
Context Unrolling in Omni Models
par: Yang, Ceyuan, et autres
Publié: (2026)
par: Yang, Ceyuan, et autres
Publié: (2026)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
OpenUrban3D: Annotation-Free Open-Vocabulary Semantic Segmentation of Large-Scale Urban Point Clouds
par: Wang, Chongyu, et autres
Publié: (2025)
par: Wang, Chongyu, et autres
Publié: (2025)
DSPFusion: Image Fusion via Degradation and Semantic Dual-Prior Guidance
par: Tang, Linfeng, et autres
Publié: (2025)
par: Tang, Linfeng, et autres
Publié: (2025)
Straightforward Layer-wise Pruning for More Efficient Visual Adaptation
par: Han, Ruizi, et autres
Publié: (2024)
par: Han, Ruizi, et autres
Publié: (2024)
Multimodal Industrial Anomaly Detection via Geometric Prior
par: Li, Min, et autres
Publié: (2026)
par: Li, Min, et autres
Publié: (2026)
Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation
par: Xu, Chongyang, et autres
Publié: (2026)
par: Xu, Chongyang, et autres
Publié: (2026)
Efficient Portrait Matte Creation With Layer Diffusion and Connectivity Priors
par: Lu, Zhiyuan, et autres
Publié: (2025)
par: Lu, Zhiyuan, et autres
Publié: (2025)
Geometric Prior Based Deep Human Point Cloud Geometry Compression
par: Wu, Xinju, et autres
Publié: (2023)
par: Wu, Xinju, et autres
Publié: (2023)
TELA: Text to Layer-wise 3D Clothed Human Generation
par: Dong, Junting, et autres
Publié: (2024)
par: Dong, Junting, et autres
Publié: (2024)
Segmentation-guided Layer-wise Image Vectorization with Gradient Fills
par: Zhou, Hengyu, et autres
Publié: (2024)
par: Zhou, Hengyu, et autres
Publié: (2024)
Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain
par: Wang, YuAn, et autres
Publié: (2025)
par: Wang, YuAn, et autres
Publié: (2025)
PGAHum: Prior-Guided Geometry and Appearance Learning for High-Fidelity Animatable Human Reconstruction
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025)
par: Shi, Cheng, et autres
Publié: (2025)
Learning to Synergize Semantic and Geometric Priors for Limited-Data Wheat Disease Segmentation
par: Wang, Shijie, et autres
Publié: (2026)
par: Wang, Shijie, et autres
Publié: (2026)
Advancing the Understanding of Fine-Grained 3D Forest Structures using Digital Cousins and Simulation-to-Reality: Methods and Datasets
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
par: Shi, Liangtao, et autres
Publié: (2025)
par: Shi, Liangtao, et autres
Publié: (2025)
Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
par: Zang, Chuanqi, et autres
Publié: (2024)
par: Zang, Chuanqi, et autres
Publié: (2024)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
par: Liu, Juntao, et autres
Publié: (2025)
par: Liu, Juntao, et autres
Publié: (2025)
Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception
par: Nan, Xinyu, et autres
Publié: (2026)
par: Nan, Xinyu, et autres
Publié: (2026)
AHAP: Reconstructing Arbitrary Humans from Arbitrary Perspectives with Geometric Priors
par: Qiao, Xiaozhen, et autres
Publié: (2026)
par: Qiao, Xiaozhen, et autres
Publié: (2026)
Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
par: Chen, Ruidong, et autres
Publié: (2026)
par: Chen, Ruidong, et autres
Publié: (2026)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
par: Guo, Jiajie, et autres
Publié: (2025)
par: Guo, Jiajie, et autres
Publié: (2025)
Sparse Gain Radio Map Reconstruction With Geometry Priors and Uncertainty-Guided Measurement Selection
par: Zeng, Zhihan, et autres
Publié: (2026)
par: Zeng, Zhihan, et autres
Publié: (2026)
LISA: A Layer-wise Integration and Suppression Approach for Hallucination Mitigation in Multimodal Large Language Models
par: Guo, Zhihui, et autres
Publié: (2025)
par: Guo, Zhihui, et autres
Publié: (2025)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
par: Li, Jinyuan, et autres
Publié: (2024)
par: Li, Jinyuan, et autres
Publié: (2024)
Dragging with Geometry: From Pixels to Geometry-Guided Image Editing
par: Pu, Xinyu, et autres
Publié: (2025)
par: Pu, Xinyu, et autres
Publié: (2025)
LARV: Data-Free Layer-wise Adaptive Rescaling Veneer for Model Merging
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
par: Chen, Mingrui, et autres
Publié: (2025)
par: Chen, Mingrui, et autres
Publié: (2025)
ELSA: Exploiting Layer-wise N:M Sparsity for Vision Transformer Acceleration
par: Huang, Ning-Chi, et autres
Publié: (2024)
par: Huang, Ning-Chi, et autres
Publié: (2024)
VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
par: Tang, Jimin, et autres
Publié: (2026)
par: Tang, Jimin, et autres
Publié: (2026)
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
par: Tong, Bingkui, et autres
Publié: (2025)
par: Tong, Bingkui, et autres
Publié: (2025)
RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation
par: Guan, Cheng, et autres
Publié: (2026)
par: Guan, Cheng, et autres
Publié: (2026)
Unrolled Decomposed Unpaired Learning for Controllable Low-Light Video Enhancement
par: Zhu, Lingyu, et autres
Publié: (2024)
par: Zhu, Lingyu, et autres
Publié: (2024)
UrbanCraft: Urban View Extrapolation via Hierarchical Sem-Geometric Priors
par: Wang, Tianhang, et autres
Publié: (2025)
par: Wang, Tianhang, et autres
Publié: (2025)
Geometry Meets Light: Leveraging Geometric Priors for Universal Photometric Stereo under Limited Multi-Illumination Cues
par: Tam, King-Man, et autres
Publié: (2025)
par: Tam, King-Man, et autres
Publié: (2025)
Advancing Structured Priors for Sparse-Voxel Surface Reconstruction
par: Chi, Ting-Hsun, et autres
Publié: (2026)
par: Chi, Ting-Hsun, et autres
Publié: (2026)
Documents similaires
-
PromptTea: Let Prompts Tell TeaCache the Optimal Threshold
par: Huang, Zishen, et autres
Publié: (2025) -
Efficiently Expanding Receptive Fields: Local Split Attention and Parallel Aggregation for Enhanced Large-scale Point Cloud Semantic Segmentation
par: Wang, Haodong, et autres
Publié: (2024) -
Context Unrolling in Omni Models
par: Yang, Ceyuan, et autres
Publié: (2026) -
Slow Perception: Let's Perceive Geometric Figures Step-by-step
par: Wei, Haoran, et autres
Publié: (2024) -
OpenUrban3D: Annotation-Free Open-Vocabulary Semantic Segmentation of Large-Scale Urban Point Clouds
par: Wang, Chongyu, et autres
Publié: (2025)