SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lim, Gyubeum, Koo, Yemo, Madisetti, Vijay Krishna |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
por: Liu, Zheng, et al.
Publicado: (2024)
por: Liu, Zheng, et al.
Publicado: (2024)
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
por: Lokesh, K, et al.
Publicado: (2026)
por: Lokesh, K, et al.
Publicado: (2026)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
por: Sheta, Hala, et al.
Publicado: (2025)
por: Sheta, Hala, et al.
Publicado: (2025)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
por: Liu, Shujun, et al.
Publicado: (2025)
por: Liu, Shujun, et al.
Publicado: (2025)
Navigation with VLM framework: Towards Going to Any Language
por: Yin, Zecheng, et al.
Publicado: (2024)
por: Yin, Zecheng, et al.
Publicado: (2024)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
por: Fan, Zhiwen, et al.
Publicado: (2025)
por: Fan, Zhiwen, et al.
Publicado: (2025)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
por: Cai, Hengxing, et al.
Publicado: (2025)
por: Cai, Hengxing, et al.
Publicado: (2025)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
por: Shen, Haozhan, et al.
Publicado: (2025)
por: Shen, Haozhan, et al.
Publicado: (2025)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models
por: Li, Bozhou, et al.
Publicado: (2025)
por: Li, Bozhou, et al.
Publicado: (2025)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
por: Kim, Dain, et al.
Publicado: (2026)
por: Kim, Dain, et al.
Publicado: (2026)
Medical Context Distorts Decisions in Clinical Vision Language Models
por: Restrepo, David, et al.
Publicado: (2026)
por: Restrepo, David, et al.
Publicado: (2026)
ColPali: Efficient Document Retrieval with Vision Language Models
por: Faysse, Manuel, et al.
Publicado: (2024)
por: Faysse, Manuel, et al.
Publicado: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder
por: Cho, Seunghyuk, et al.
Publicado: (2025)
por: Cho, Seunghyuk, et al.
Publicado: (2025)
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
por: Niu, Junbo, et al.
Publicado: (2025)
por: Niu, Junbo, et al.
Publicado: (2025)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
por: Sun, Min Woo, et al.
Publicado: (2025)
por: Sun, Min Woo, et al.
Publicado: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
por: Jiang, Ziyan, et al.
Publicado: (2024)
por: Jiang, Ziyan, et al.
Publicado: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
por: Chen, Boyuan, et al.
Publicado: (2024)
por: Chen, Boyuan, et al.
Publicado: (2024)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
por: Qu, Kevin, et al.
Publicado: (2026)
por: Qu, Kevin, et al.
Publicado: (2026)
CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts
por: Nikandrou, Malvina, et al.
Publicado: (2024)
por: Nikandrou, Malvina, et al.
Publicado: (2024)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
por: Wang, Zhaowei, et al.
Publicado: (2025)
por: Wang, Zhaowei, et al.
Publicado: (2025)
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
por: Hennara, Khalil, et al.
Publicado: (2025)
por: Hennara, Khalil, et al.
Publicado: (2025)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
por: Agrawal, Aakriti, et al.
Publicado: (2025)
por: Agrawal, Aakriti, et al.
Publicado: (2025)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
por: Liu, Shudong, et al.
Publicado: (2025)
por: Liu, Shudong, et al.
Publicado: (2025)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
por: Tian, Yu, et al.
Publicado: (2024)
por: Tian, Yu, et al.
Publicado: (2024)
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
por: Deng, Guifeng, et al.
Publicado: (2026)
por: Deng, Guifeng, et al.
Publicado: (2026)
ViLBench: A Suite for Vision-Language Process Reward Modeling
por: Tu, Haoqin, et al.
Publicado: (2025)
por: Tu, Haoqin, et al.
Publicado: (2025)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
por: Wang, Zhiqiang, et al.
Publicado: (2025)
por: Wang, Zhiqiang, et al.
Publicado: (2025)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
por: Zhou, Keyan, et al.
Publicado: (2025)
por: Zhou, Keyan, et al.
Publicado: (2025)
The Hard Positive Truth about Vision-Language Compositionality
por: Kamath, Amita, et al.
Publicado: (2024)
por: Kamath, Amita, et al.
Publicado: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
por: Lim, Qi Zhi, et al.
Publicado: (2025)
por: Lim, Qi Zhi, et al.
Publicado: (2025)
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
por: Sarkar, Sayan Deb, et al.
Publicado: (2026)
por: Sarkar, Sayan Deb, et al.
Publicado: (2026)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
por: Son, Jaemin, et al.
Publicado: (2025)
por: Son, Jaemin, et al.
Publicado: (2025)
NAVCON: A Cognitively Inspired and Linguistically Grounded Corpus for Vision and Language Navigation
por: Wanchoo, Karan, et al.
Publicado: (2024)
por: Wanchoo, Karan, et al.
Publicado: (2024)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
por: Hu, Yushi, et al.
Publicado: (2023)
por: Hu, Yushi, et al.
Publicado: (2023)
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
por: Hu, Zhe, et al.
Publicado: (2025)
por: Hu, Zhe, et al.
Publicado: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Ejemplares similares
-
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
por: Liu, Zheng, et al.
Publicado: (2024) -
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
por: Lokesh, K, et al.
Publicado: (2026) -
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
por: Sheta, Hala, et al.
Publicado: (2025) -
OViP: Online Vision-Language Preference Learning for VLM Hallucination
por: Liu, Shujun, et al.
Publicado: (2025) -
Navigation with VLM framework: Towards Going to Any Language
por: Yin, Zecheng, et al.
Publicado: (2024)