Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yucheng, Rao, Zhi, Wan, Jun, Shen, Jianbing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
di: Zhou, Yucheng, et al.
Pubblicazione: (2025)
di: Zhou, Yucheng, et al.
Pubblicazione: (2025)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
di: Yang, Hongji, et al.
Pubblicazione: (2025)
di: Yang, Hongji, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation
di: Rao, Zhi, et al.
Pubblicazione: (2025)
di: Rao, Zhi, et al.
Pubblicazione: (2025)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
di: Yang, Hongji, et al.
Pubblicazione: (2026)
di: Yang, Hongji, et al.
Pubblicazione: (2026)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
di: Yang, Xu, et al.
Pubblicazione: (2023)
di: Yang, Xu, et al.
Pubblicazione: (2023)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
di: Sun, Min Woo, et al.
Pubblicazione: (2025)
di: Sun, Min Woo, et al.
Pubblicazione: (2025)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
di: Xu, Yige, et al.
Pubblicazione: (2026)
di: Xu, Yige, et al.
Pubblicazione: (2026)
Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity Masks
di: Song, Lingran, et al.
Pubblicazione: (2025)
di: Song, Lingran, et al.
Pubblicazione: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2023)
di: Hu, Yushi, et al.
Pubblicazione: (2023)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Multi-Frame Vision-Language Model for Long-form Reasoning in Driver Behavior Analysis
di: Takato, Hiroshi, et al.
Pubblicazione: (2024)
di: Takato, Hiroshi, et al.
Pubblicazione: (2024)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023)
di: You, Haoxuan, et al.
Pubblicazione: (2023)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
di: Zeng, Yu, et al.
Pubblicazione: (2026)
di: Zeng, Yu, et al.
Pubblicazione: (2026)
Instruction-Following Evaluation of Large Vision-Language Models
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
Intriguing Properties of Large Language and Vision Models
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
Internalized Reasoning for Long-Context Visual Document Understanding
di: Veselka, Austin
Pubblicazione: (2026)
di: Veselka, Austin
Pubblicazione: (2026)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
Detecting Offensive Memes with Social Biases in Singapore Context Using Multimodal Large Language Models
di: Yuxuan, Cao, et al.
Pubblicazione: (2025)
di: Yuxuan, Cao, et al.
Pubblicazione: (2025)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
di: Liu, Zikang, et al.
Pubblicazione: (2025)
di: Liu, Zikang, et al.
Pubblicazione: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
di: Li, Bin, et al.
Pubblicazione: (2025)
di: Li, Bin, et al.
Pubblicazione: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024) -
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
di: Zhou, Yucheng, et al.
Pubblicazione: (2025) -
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
di: Yang, Hongji, et al.
Pubblicazione: (2025) -
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024) -
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)