Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Juntian, cheng, Chuanqi, Liu, Yuhan, Liu, Wei, Luan, Jian, Yan, Rui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
di: Wang, Yubo, et al.
Pubblicazione: (2026)
di: Wang, Yubo, et al.
Pubblicazione: (2026)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis
di: Cheng, Chuanqi, et al.
Pubblicazione: (2024)
di: Cheng, Chuanqi, et al.
Pubblicazione: (2024)
Beyond Static Testbeds: An Interaction-Centric Agent Simulation Platform for Dynamic Recommender Systems
di: Jin, Song, et al.
Pubblicazione: (2025)
di: Jin, Song, et al.
Pubblicazione: (2025)
Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation
di: Cheng, Chuanqi, et al.
Pubblicazione: (2025)
di: Cheng, Chuanqi, et al.
Pubblicazione: (2025)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
di: Chen, Yanjun, et al.
Pubblicazione: (2025)
di: Chen, Yanjun, et al.
Pubblicazione: (2025)
Referencing Where to Focus: Improving VisualGrounding with Referential Query
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
di: Dai, Haocheng, et al.
Pubblicazione: (2024)
di: Dai, Haocheng, et al.
Pubblicazione: (2024)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
di: Bachu, Saketh, et al.
Pubblicazione: (2024)
di: Bachu, Saketh, et al.
Pubblicazione: (2024)
A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
di: Liang, Yuhan, et al.
Pubblicazione: (2024)
di: Liang, Yuhan, et al.
Pubblicazione: (2024)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
Chatting with Images for Introspective Visual Thinking
di: Wu, Junfei, et al.
Pubblicazione: (2026)
di: Wu, Junfei, et al.
Pubblicazione: (2026)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2024)
di: Hu, Yushi, et al.
Pubblicazione: (2024)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
di: Jiang, Songtao, et al.
Pubblicazione: (2025)
di: Jiang, Songtao, et al.
Pubblicazione: (2025)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
di: Wei, Canshi
Pubblicazione: (2024)
di: Wei, Canshi
Pubblicazione: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
di: Li, Mukai, et al.
Pubblicazione: (2024)
di: Li, Mukai, et al.
Pubblicazione: (2024)
Vision-centric Token Compression in Large Language Model
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
Retrieving Counterfactuals Improves Visual In-Context Learning
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
di: Zhang, Juntian, et al.
Pubblicazione: (2025) -
Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
di: Wang, Yubo, et al.
Pubblicazione: (2026) -
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
di: Fu, Xingyu, et al.
Pubblicazione: (2025) -
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
di: Wei, Yanbin, et al.
Pubblicazione: (2026) -
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)