VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Qiucheng, Zhao, Handong, Saxon, Michael, Bui, Trung, Wang, William Yang, Zhang, Yang, Chang, Shiyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes
par: Yao, Guanyu, et autres
Publié: (2025)
par: Yao, Guanyu, et autres
Publié: (2025)
VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
par: Wu, Qiucheng, et autres
Publié: (2025)
par: Wu, Qiucheng, et autres
Publié: (2025)
A Hierarchical Probabilistic Framework for Incremental Knowledge Tracing in Classroom Settings
par: Gao, Xinyi, et autres
Publié: (2025)
par: Gao, Xinyi, et autres
Publié: (2025)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
par: Sharma, Aditya, et autres
Publié: (2024)
par: Sharma, Aditya, et autres
Publié: (2024)
THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models
par: Pu, Xiao, et autres
Publié: (2025)
par: Pu, Xiao, et autres
Publié: (2025)
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
par: Wu, Qiucheng, et autres
Publié: (2026)
par: Wu, Qiucheng, et autres
Publié: (2026)
Valuable Hallucinations: Realizable Non-realistic Propositions
par: Chen, Qiucheng, et autres
Publié: (2025)
par: Chen, Qiucheng, et autres
Publié: (2025)
Augment before You Try: Knowledge-Enhanced Table Question Answering via Table Expansion
par: Liu, Yujian, et autres
Publié: (2024)
par: Liu, Yujian, et autres
Publié: (2024)
Benchmarks as Microscopes: A Call for Model Metrology
par: Saxon, Michael, et autres
Publié: (2024)
par: Saxon, Michael, et autres
Publié: (2024)
Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
par: Wang, Xinyi, et autres
Publié: (2023)
par: Wang, Xinyi, et autres
Publié: (2023)
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
par: Qiao, Yuxuan, et autres
Publié: (2024)
par: Qiao, Yuxuan, et autres
Publié: (2024)
Do You Know About My Nation? Investigating Multilingual Language Models' Cultural Literacy Through Factual Knowledge
par: Tanwar, Eshaan, et autres
Publié: (2025)
par: Tanwar, Eshaan, et autres
Publié: (2025)
CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
par: Yu, Ping, et autres
Publié: (2025)
par: Yu, Ping, et autres
Publié: (2025)
Lost in Translation? Translation Errors and Challenges for Fair Assessment of Text-to-Image Models on Multilingual Concepts
par: Saxon, Michael, et autres
Publié: (2024)
par: Saxon, Michael, et autres
Publié: (2024)
Code-enabled language models can outperform reasoning models on diverse tasks
par: Zhang, Cedegao E., et autres
Publié: (2025)
par: Zhang, Cedegao E., et autres
Publié: (2025)
Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)
par: Saxon, Michael, et autres
Publié: (2024)
par: Saxon, Michael, et autres
Publié: (2024)
DynaSaur: Large Language Agents Beyond Predefined Actions
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
par: Li, Shuo, et autres
Publié: (2024)
par: Li, Shuo, et autres
Publié: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
Fictitious Synthetic Data Can Improve LLM Factuality via Prerequisite Learning
par: Liu, Yujian, et autres
Publié: (2024)
par: Liu, Yujian, et autres
Publié: (2024)
Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective
par: Liu, Yujian, et autres
Publié: (2024)
par: Liu, Yujian, et autres
Publié: (2024)
A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation
par: Hou, Bairu, et autres
Publié: (2024)
par: Hou, Bairu, et autres
Publié: (2024)
QuestBench: Can LLMs ask the right question to acquire information in reasoning tasks?
par: Li, Belinda Z., et autres
Publié: (2025)
par: Li, Belinda Z., et autres
Publié: (2025)
Superhuman performance of a large language model on the reasoning tasks of a physician
par: Brodeur, Peter G., et autres
Publié: (2024)
par: Brodeur, Peter G., et autres
Publié: (2024)
Language models show human-like content effects on reasoning tasks
par: Dasgupta, Ishita, et autres
Publié: (2022)
par: Dasgupta, Ishita, et autres
Publié: (2022)
Evidence from counterfactual tasks supports emergent analogical reasoning in large language models
par: Webb, Taylor, et autres
Publié: (2024)
par: Webb, Taylor, et autres
Publié: (2024)
Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs
par: Yan, Yuming, et autres
Publié: (2026)
par: Yan, Yuming, et autres
Publié: (2026)
AKEW: Assessing Knowledge Editing in the Wild
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
Online-PVLM: Advancing Personalized VLMs with Online Concept Learning
par: Bai, Huiyu, et autres
Publié: (2025)
par: Bai, Huiyu, et autres
Publié: (2025)
Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling
par: Trung, Bui The, et autres
Publié: (2026)
par: Trung, Bui The, et autres
Publié: (2026)
Distributional reasoning in LLMs: Parallel reasoning processes in multi-hop reasoning
par: Shalev, Yuval, et autres
Publié: (2024)
par: Shalev, Yuval, et autres
Publié: (2024)
The Eloquence team submission for task 1 of MLC-SLM challenge
par: Concina, Lorenzo, et autres
Publié: (2025)
par: Concina, Lorenzo, et autres
Publié: (2025)
Discovering Low-rank Subspaces for Language-agnostic Multilingual Representations
par: Xie, Zhihui, et autres
Publié: (2024)
par: Xie, Zhihui, et autres
Publié: (2024)
CORG: Generating Answers from Complex, Interrelated Contexts
par: Lee, Hyunji, et autres
Publié: (2025)
par: Lee, Hyunji, et autres
Publié: (2025)
ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model
par: Lan, Wuyang, et autres
Publié: (2025)
par: Lan, Wuyang, et autres
Publié: (2025)
Can reasoning models comprehend mathematical problems in Chinese ancient texts? An empirical study based on data from Suanjing Shishu
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Aviary: training language agents on challenging scientific tasks
par: Narayanan, Siddharth, et autres
Publié: (2024)
par: Narayanan, Siddharth, et autres
Publié: (2024)
How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
par: Liu, Yujian, et autres
Publié: (2026)
par: Liu, Yujian, et autres
Publié: (2026)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
par: Lu, Yuxing, et autres
Publié: (2025)
par: Lu, Yuxing, et autres
Publié: (2025)
Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs
par: Zhu, Mengdan, et autres
Publié: (2026)
par: Zhu, Mengdan, et autres
Publié: (2026)
Documents similaires
-
Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes
par: Yao, Guanyu, et autres
Publié: (2025) -
VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
par: Wu, Qiucheng, et autres
Publié: (2025) -
A Hierarchical Probabilistic Framework for Incremental Knowledge Tracing in Classroom Settings
par: Gao, Xinyi, et autres
Publié: (2025) -
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
par: Sharma, Aditya, et autres
Publié: (2024) -
THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models
par: Pu, Xiao, et autres
Publié: (2025)