DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Xinrui, Liu, Kai, Zhang, Ziqing, Li, Jianze, Li, Anqi, Zhang, Yulun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
por: Qin, Guangshuo, et al.
Publicado: (2026)
por: Qin, Guangshuo, et al.
Publicado: (2026)
SceneLLM: Implicit Language Reasoning in LLM for Dynamic Scene Graph Generation
por: Zhang, Hang, et al.
Publicado: (2024)
por: Zhang, Hang, et al.
Publicado: (2024)
Dog-IQA: Standard-guided Zero-shot MLLM for Mix-grained Image Quality Assessment
por: Liu, Kai, et al.
Publicado: (2024)
por: Liu, Kai, et al.
Publicado: (2024)
BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning
por: Ke, Jingyang, et al.
Publicado: (2026)
por: Ke, Jingyang, et al.
Publicado: (2026)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
por: Hu, Yuanze, et al.
Publicado: (2025)
por: Hu, Yuanze, et al.
Publicado: (2025)
Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT
por: Asfour, Alaa, et al.
Publicado: (2026)
por: Asfour, Alaa, et al.
Publicado: (2026)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
por: Cao, Yue, et al.
Publicado: (2024)
por: Cao, Yue, et al.
Publicado: (2024)
CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers
por: Liu, Kai, et al.
Publicado: (2025)
por: Liu, Kai, et al.
Publicado: (2025)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
por: Zhang, Yuelin, et al.
Publicado: (2026)
por: Zhang, Yuelin, et al.
Publicado: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
por: Tian, Kexin, et al.
Publicado: (2025)
por: Tian, Kexin, et al.
Publicado: (2025)
DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation
por: Wang, Zirui, et al.
Publicado: (2025)
por: Wang, Zirui, et al.
Publicado: (2025)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
por: Li, Nanxi, et al.
Publicado: (2026)
por: Li, Nanxi, et al.
Publicado: (2026)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
por: Zhang, Jiwen, et al.
Publicado: (2026)
por: Zhang, Jiwen, et al.
Publicado: (2026)
Evolving Prompt Adaptation for Vision-Language Models
por: Zhang, Enming, et al.
Publicado: (2026)
por: Zhang, Enming, et al.
Publicado: (2026)
MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation
por: Chen, Zini, et al.
Publicado: (2026)
por: Chen, Zini, et al.
Publicado: (2026)
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
por: Zhang, Congzhi, et al.
Publicado: (2025)
por: Zhang, Congzhi, et al.
Publicado: (2025)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
por: Liu, Hanqing, et al.
Publicado: (2026)
por: Liu, Hanqing, et al.
Publicado: (2026)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
por: Hao, Haihong, et al.
Publicado: (2026)
por: Hao, Haihong, et al.
Publicado: (2026)
Diffusion Models in Low-Level Vision: A Survey
por: He, Chunming, et al.
Publicado: (2024)
por: He, Chunming, et al.
Publicado: (2024)
SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data
por: Ogezi, Michael, et al.
Publicado: (2025)
por: Ogezi, Michael, et al.
Publicado: (2025)
A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
por: Liang, Yuhan, et al.
Publicado: (2024)
por: Liang, Yuhan, et al.
Publicado: (2024)
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
por: Zhang, Yunzhi, et al.
Publicado: (2024)
por: Zhang, Yunzhi, et al.
Publicado: (2024)
Improve Vision Language Model Chain-of-thought Reasoning
por: Zhang, Ruohong, et al.
Publicado: (2024)
por: Zhang, Ruohong, et al.
Publicado: (2024)
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
por: Gu, Zheyuan, et al.
Publicado: (2026)
por: Gu, Zheyuan, et al.
Publicado: (2026)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
por: Li, Zhiyuan, et al.
Publicado: (2024)
por: Li, Zhiyuan, et al.
Publicado: (2024)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
por: Wang, Chaoyang, et al.
Publicado: (2026)
por: Wang, Chaoyang, et al.
Publicado: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
por: Zhang, Zhifang, et al.
Publicado: (2024)
por: Zhang, Zhifang, et al.
Publicado: (2024)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
por: Zhang, Gengyuan, et al.
Publicado: (2023)
por: Zhang, Gengyuan, et al.
Publicado: (2023)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
por: Zhang, Yizhen, et al.
Publicado: (2025)
por: Zhang, Yizhen, et al.
Publicado: (2025)
MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based Decoders
por: Lin, Baijiong, et al.
Publicado: (2024)
por: Lin, Baijiong, et al.
Publicado: (2024)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
por: Wang, Jiayu, et al.
Publicado: (2024)
por: Wang, Jiayu, et al.
Publicado: (2024)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
por: Zhao, Ruosen, et al.
Publicado: (2025)
por: Zhao, Ruosen, et al.
Publicado: (2025)
FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
por: Yu, Bo, et al.
Publicado: (2026)
por: Yu, Bo, et al.
Publicado: (2026)
SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
por: Shi, Yukai, et al.
Publicado: (2025)
por: Shi, Yukai, et al.
Publicado: (2025)
Evaluating Large and Lightweight Vision Models for Irregular Component Segmentation in E-Waste Disassembly
por: Zhang, Xinyao, et al.
Publicado: (2026)
por: Zhang, Xinyao, et al.
Publicado: (2026)
Ejemplares similares
-
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
por: Qin, Guangshuo, et al.
Publicado: (2026) -
SceneLLM: Implicit Language Reasoning in LLM for Dynamic Scene Graph Generation
por: Zhang, Hang, et al.
Publicado: (2024) -
Dog-IQA: Standard-guided Zero-shot MLLM for Mix-grained Image Quality Assessment
por: Liu, Kai, et al.
Publicado: (2024) -
BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning
por: Ke, Jingyang, et al.
Publicado: (2026) -
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
por: Zhang, Weichen, et al.
Publicado: (2025)