Enregistré dans:
| Auteurs principaux: | Bai, Weimin, Li, Yubo, Luo, Weijian, Lai, Zeqiang, Wang, Yequan, Chen, Wenzheng, Sun, He |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.14271 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
Dive3D: Diverse Distillation-based Text-to-3D Generation via Score Implicit Matching
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
Integrating Amortized Inference with Diffusion Models for Learning Clean Distribution from Corrupted Images
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations
par: Bai, Weimin, et autres
Publié: (2024)
par: Bai, Weimin, et autres
Publié: (2024)
Blind Inversion using Latent Diffusion Priors
par: Bai, Weimin, et autres
Publié: (2024)
par: Bai, Weimin, et autres
Publié: (2024)
Unbiased Diffusion Variational Inversion via Principled Posterior Matching
par: Bai, Weimin, et autres
Publié: (2026)
par: Bai, Weimin, et autres
Publié: (2026)
Uni-Instruct: One-step Diffusion Model through Unified Diffusion Divergence Instruction
par: Wang, Yifei, et autres
Publié: (2025)
par: Wang, Yifei, et autres
Publié: (2025)
Learning Diffusion Model from Noisy Measurement using Principled Expectation-Maximization Method
par: Bai, Weimin, et autres
Publié: (2024)
par: Bai, Weimin, et autres
Publié: (2024)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
par: Ma, Weijian, et autres
Publié: (2026)
par: Ma, Weijian, et autres
Publié: (2026)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024)
par: Wu, Jiannan, et autres
Publié: (2024)
Dia-LLaMA: Towards Large Language Model-driven CT Report Generation
par: Chen, Zhixuan, et autres
Publié: (2024)
par: Chen, Zhixuan, et autres
Publié: (2024)
InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
Continual Learning with Vision-Language Models via Semantic-Geometry Preservation
par: He, Chiyuan, et autres
Publié: (2026)
par: He, Chiyuan, et autres
Publié: (2026)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
par: Zhao, Ruosen, et autres
Publié: (2025)
par: Zhao, Ruosen, et autres
Publié: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
par: Xu, Guowei, et autres
Publié: (2024)
par: Xu, Guowei, et autres
Publié: (2024)
3D-GPT: Procedural 3D Modeling with Large Language Models
par: Sun, Chunyi, et autres
Publié: (2023)
par: Sun, Chunyi, et autres
Publié: (2023)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
par: Qi, Jianing, et autres
Publié: (2025)
par: Qi, Jianing, et autres
Publié: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models
par: Monon, Mashrafi, et autres
Publié: (2026)
par: Monon, Mashrafi, et autres
Publié: (2026)
Unaligned RGB Guided Hyperspectral Image Super-Resolution with Spatial-Spectral Concordance
par: Zhang, Yingkai, et autres
Publié: (2025)
par: Zhang, Yingkai, et autres
Publié: (2025)
Large Language Model with Region-guided Referring and Grounding for CT Report Generation
par: Chen, Zhixuan, et autres
Publié: (2024)
par: Chen, Zhixuan, et autres
Publié: (2024)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
par: Liang, Huizhi, et autres
Publié: (2026)
par: Liang, Huizhi, et autres
Publié: (2026)
Spatial-aware Vision Language Model for Autonomous Driving
par: Wei, Weijie, et autres
Publié: (2025)
par: Wei, Weijie, et autres
Publié: (2025)
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
par: Liu, Yifan, et autres
Publié: (2025)
par: Liu, Yifan, et autres
Publié: (2025)
Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks
par: Xie, Peng, et autres
Publié: (2024)
par: Xie, Peng, et autres
Publié: (2024)
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
par: Jiang, Jerry, et autres
Publié: (2026)
par: Jiang, Jerry, et autres
Publié: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
par: Wang, Xiaoyan, et autres
Publié: (2025)
par: Wang, Xiaoyan, et autres
Publié: (2025)
Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation
par: Zhong, Zhiyuan, et autres
Publié: (2025)
par: Zhong, Zhiyuan, et autres
Publié: (2025)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
par: Zhang, Jian, et autres
Publié: (2026)
par: Zhang, Jian, et autres
Publié: (2026)
CAD-Llama: Leveraging Large Language Models for Computer-Aided Design Parametric 3D Model Generation
par: Li, Jiahao, et autres
Publié: (2025)
par: Li, Jiahao, et autres
Publié: (2025)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
par: Shen, Qirui, et autres
Publié: (2026)
par: Shen, Qirui, et autres
Publié: (2026)
CitySeg: A 3D Open Vocabulary Semantic Segmentation Foundation Model in City-scale Scenarios
par: Xu, Jialei, et autres
Publié: (2025)
par: Xu, Jialei, et autres
Publié: (2025)
Diff-Instruct++: Training One-step Text-to-image Generator Model to Align with Human Preferences
par: Luo, Weijian
Publié: (2024)
par: Luo, Weijian
Publié: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
Backdooring Vision-Language Models with Out-Of-Distribution Data
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
LATTICE: Democratize High-Fidelity 3D Generation at Scale
par: Lai, Zeqiang, et autres
Publié: (2025)
par: Lai, Zeqiang, et autres
Publié: (2025)
TrojVLM: Backdoor Attack Against Vision Language Models
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
par: Wu, Xianfeng, et autres
Publié: (2025)
par: Wu, Xianfeng, et autres
Publié: (2025)
An Empirical Study Into What Matters for Calibrating Vision-Language Models
par: Tu, Weijie, et autres
Publié: (2024)
par: Tu, Weijie, et autres
Publié: (2024)
Documents similaires
-
Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
par: Bai, Weimin, et autres
Publié: (2025) -
Dive3D: Diverse Distillation-based Text-to-3D Generation via Score Implicit Matching
par: Bai, Weimin, et autres
Publié: (2025) -
Integrating Amortized Inference with Diffusion Models for Learning Clean Distribution from Corrupted Images
par: Wang, Yifei, et autres
Publié: (2024) -
An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations
par: Bai, Weimin, et autres
Publié: (2024) -
Blind Inversion using Latent Diffusion Priors
par: Bai, Weimin, et autres
Publié: (2024)