SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lim, Gyubeum, Koo, Yemo, Madisetti, Vijay Krishna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024)
di: Liu, Zheng, et al.
Pubblicazione: (2024)
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
di: Lokesh, K, et al.
Pubblicazione: (2026)
di: Lokesh, K, et al.
Pubblicazione: (2026)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
di: Sheta, Hala, et al.
Pubblicazione: (2025)
di: Sheta, Hala, et al.
Pubblicazione: (2025)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
di: Liu, Shujun, et al.
Pubblicazione: (2025)
di: Liu, Shujun, et al.
Pubblicazione: (2025)
Navigation with VLM framework: Towards Going to Any Language
di: Yin, Zecheng, et al.
Pubblicazione: (2024)
di: Yin, Zecheng, et al.
Pubblicazione: (2024)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
di: Fan, Zhiwen, et al.
Pubblicazione: (2025)
di: Fan, Zhiwen, et al.
Pubblicazione: (2025)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
di: Cai, Hengxing, et al.
Pubblicazione: (2025)
di: Cai, Hengxing, et al.
Pubblicazione: (2025)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
di: Shen, Haozhan, et al.
Pubblicazione: (2025)
di: Shen, Haozhan, et al.
Pubblicazione: (2025)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models
di: Li, Bozhou, et al.
Pubblicazione: (2025)
di: Li, Bozhou, et al.
Pubblicazione: (2025)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
di: Kim, Dain, et al.
Pubblicazione: (2026)
di: Kim, Dain, et al.
Pubblicazione: (2026)
Medical Context Distorts Decisions in Clinical Vision Language Models
di: Restrepo, David, et al.
Pubblicazione: (2026)
di: Restrepo, David, et al.
Pubblicazione: (2026)
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder
di: Cho, Seunghyuk, et al.
Pubblicazione: (2025)
di: Cho, Seunghyuk, et al.
Pubblicazione: (2025)
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
di: Niu, Junbo, et al.
Pubblicazione: (2025)
di: Niu, Junbo, et al.
Pubblicazione: (2025)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
di: Sun, Min Woo, et al.
Pubblicazione: (2025)
di: Sun, Min Woo, et al.
Pubblicazione: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
di: Hong, Haodong, et al.
Pubblicazione: (2024)
di: Hong, Haodong, et al.
Pubblicazione: (2024)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
di: Qu, Kevin, et al.
Pubblicazione: (2026)
di: Qu, Kevin, et al.
Pubblicazione: (2026)
CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
di: Hennara, Khalil, et al.
Pubblicazione: (2025)
di: Hennara, Khalil, et al.
Pubblicazione: (2025)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
di: Liu, Shudong, et al.
Pubblicazione: (2025)
di: Liu, Shudong, et al.
Pubblicazione: (2025)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
di: Tian, Yu, et al.
Pubblicazione: (2024)
di: Tian, Yu, et al.
Pubblicazione: (2024)
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
di: Deng, Guifeng, et al.
Pubblicazione: (2026)
di: Deng, Guifeng, et al.
Pubblicazione: (2026)
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
di: Wang, Zhiqiang, et al.
Pubblicazione: (2025)
di: Wang, Zhiqiang, et al.
Pubblicazione: (2025)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
The Hard Positive Truth about Vision-Language Compositionality
di: Kamath, Amita, et al.
Pubblicazione: (2024)
di: Kamath, Amita, et al.
Pubblicazione: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2026)
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2026)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
di: Son, Jaemin, et al.
Pubblicazione: (2025)
di: Son, Jaemin, et al.
Pubblicazione: (2025)
NAVCON: A Cognitively Inspired and Linguistically Grounded Corpus for Vision and Language Navigation
di: Wanchoo, Karan, et al.
Pubblicazione: (2024)
di: Wanchoo, Karan, et al.
Pubblicazione: (2024)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2023)
di: Hu, Yushi, et al.
Pubblicazione: (2023)
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
di: Hu, Zhe, et al.
Pubblicazione: (2025)
di: Hu, Zhe, et al.
Pubblicazione: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
di: Li, Baiqi, et al.
Pubblicazione: (2024)
di: Li, Baiqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024) -
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
di: Lokesh, K, et al.
Pubblicazione: (2026) -
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
di: Sheta, Hala, et al.
Pubblicazione: (2025) -
OViP: Online Vision-Language Preference Learning for VLM Hallucination
di: Liu, Shujun, et al.
Pubblicazione: (2025) -
Navigation with VLM framework: Towards Going to Any Language
di: Yin, Zecheng, et al.
Pubblicazione: (2024)