Situational Awareness Matters in 3D Vision Language Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Man, Yunze, Gui, Liang-Yan, Wang, Yu-Xiong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
di: Man, Yunze, et al.
Pubblicazione: (2024)
di: Man, Yunze, et al.
Pubblicazione: (2024)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
di: Pang, Ziqi, et al.
Pubblicazione: (2023)
di: Pang, Ziqi, et al.
Pubblicazione: (2023)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
di: Zhou, Andy, et al.
Pubblicazione: (2023)
di: Zhou, Andy, et al.
Pubblicazione: (2023)
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
di: Man, Yunze, et al.
Pubblicazione: (2023)
di: Man, Yunze, et al.
Pubblicazione: (2023)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
di: Huang, Chi-Pin, et al.
Pubblicazione: (2026)
di: Huang, Chi-Pin, et al.
Pubblicazione: (2026)
How Culturally Aware are Vision-Language Models?
di: Burda-Lassen, Olena, et al.
Pubblicazione: (2024)
di: Burda-Lassen, Olena, et al.
Pubblicazione: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
di: Bae, Jiyun, et al.
Pubblicazione: (2025)
di: Bae, Jiyun, et al.
Pubblicazione: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
di: Zhou, Yucheng, et al.
Pubblicazione: (2025)
di: Zhou, Yucheng, et al.
Pubblicazione: (2025)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
di: Yang, Senqiao, et al.
Pubblicazione: (2024)
di: Yang, Senqiao, et al.
Pubblicazione: (2024)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
di: Lian, Shijie, et al.
Pubblicazione: (2025)
di: Lian, Shijie, et al.
Pubblicazione: (2025)
MouSi: Poly-Visual-Expert Vision-Language Models
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
di: Fan, Xiaoran, et al.
Pubblicazione: (2024)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
Language-Image Models with 3D Understanding
di: Cho, Jang Hyun, et al.
Pubblicazione: (2024)
di: Cho, Jang Hyun, et al.
Pubblicazione: (2024)
MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models
di: Fan, Xiaoran, et al.
Pubblicazione: (2026)
di: Fan, Xiaoran, et al.
Pubblicazione: (2026)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Voila-A: Aligning Vision-Language Models with User's Gaze Attention
di: Yan, Kun, et al.
Pubblicazione: (2023)
di: Yan, Kun, et al.
Pubblicazione: (2023)
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
di: Fu, Shuai, et al.
Pubblicazione: (2024)
di: Fu, Shuai, et al.
Pubblicazione: (2024)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
di: Wu, Junfei, et al.
Pubblicazione: (2024)
di: Wu, Junfei, et al.
Pubblicazione: (2024)
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
di: Kang, Haoqiang, et al.
Pubblicazione: (2025)
di: Kang, Haoqiang, et al.
Pubblicazione: (2025)
Differentiable Prompt Learning for Vision Language Models
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
di: Kim, Soo Yong, et al.
Pubblicazione: (2025)
di: Kim, Soo Yong, et al.
Pubblicazione: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
di: Wu, Junjie, et al.
Pubblicazione: (2024)
di: Wu, Junjie, et al.
Pubblicazione: (2024)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
di: Li, YuQian, et al.
Pubblicazione: (2025)
di: Li, YuQian, et al.
Pubblicazione: (2025)
MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors
di: Tang, Yuan, et al.
Pubblicazione: (2024)
di: Tang, Yuan, et al.
Pubblicazione: (2024)
PaintScene4D: Consistent 4D Scene Generation from Text Prompts
di: Gupta, Vinayak, et al.
Pubblicazione: (2024)
di: Gupta, Vinayak, et al.
Pubblicazione: (2024)
HASSOD: Hierarchical Adaptive Self-Supervised Object Detection
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
di: Chen, Junying, et al.
Pubblicazione: (2024)
di: Chen, Junying, et al.
Pubblicazione: (2024)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
di: Fei, Junjie, et al.
Pubblicazione: (2026)
di: Fei, Junjie, et al.
Pubblicazione: (2026)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
di: Man, Yunze, et al.
Pubblicazione: (2024) -
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
di: Pang, Ziqi, et al.
Pubblicazione: (2023) -
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
di: Zhou, Andy, et al.
Pubblicazione: (2023) -
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
di: Man, Yunze, et al.
Pubblicazione: (2023) -
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)