Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yunkai, Li, Linda, Cui, Yingxin, Ruan, Xiyuan, Zheng, Zeyu, Chen, Kezhen, Zhang, Yi, Yang, Diji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
por: Yu, Haorui, et al.
Publicado: (2026)
por: Yu, Haorui, et al.
Publicado: (2026)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
por: Lu, Jiaying, et al.
Publicado: (2023)
por: Lu, Jiaying, et al.
Publicado: (2023)
EvoVLA: Self-Evolving Vision-Language-Action Model
por: Liu, Zeting, et al.
Publicado: (2025)
por: Liu, Zeting, et al.
Publicado: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
por: Ye, Angen, et al.
Publicado: (2025)
por: Ye, Angen, et al.
Publicado: (2025)
Dynamic Execution Commitment of Vision-Language-Action Models
por: Chen, Feng, et al.
Publicado: (2026)
por: Chen, Feng, et al.
Publicado: (2026)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
por: Thapa, Rahul, et al.
Publicado: (2024)
por: Thapa, Rahul, et al.
Publicado: (2024)
Classroom Final Exam: An Instructor-Tested Reasoning Benchmark
por: Gao, Chongyang, et al.
Publicado: (2026)
por: Gao, Chongyang, et al.
Publicado: (2026)
GenIR: Generative Visual Feedback for Mental Image Retrieval
por: Yang, Diji, et al.
Publicado: (2025)
por: Yang, Diji, et al.
Publicado: (2025)
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
por: Bao, Wenxuan, et al.
Publicado: (2026)
por: Bao, Wenxuan, et al.
Publicado: (2026)
Diffusion As Self-Distillation: End-to-End Latent Diffusion In One Model
por: Wang, Xiyuan, et al.
Publicado: (2025)
por: Wang, Xiyuan, et al.
Publicado: (2025)
HCCM: Hierarchical Cross-Granularity Contrastive and Matching Learning for Natural Language-Guided Drones
por: Ruan, Hao, et al.
Publicado: (2025)
por: Ruan, Hao, et al.
Publicado: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
por: Qian, Zhaofang, et al.
Publicado: (2025)
por: Qian, Zhaofang, et al.
Publicado: (2025)
ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models
por: Lai, Yingxin, et al.
Publicado: (2026)
por: Lai, Yingxin, et al.
Publicado: (2026)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
por: Ren, Yufan, et al.
Publicado: (2025)
por: Ren, Yufan, et al.
Publicado: (2025)
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)
por: Yin, Xiangyu, et al.
Publicado: (2025)
Hybrid Primal Sketch: Combining Analogy, Qualitative Representations, and Computer Vision for Scene Understanding
por: Forbus, Kenneth D., et al.
Publicado: (2024)
por: Forbus, Kenneth D., et al.
Publicado: (2024)
Cascade Prompt Learning for Vision-Language Model Adaptation
por: Wu, Ge, et al.
Publicado: (2024)
por: Wu, Ge, et al.
Publicado: (2024)
Image Fusion via Vision-Language Model
por: Zhao, Zixiang, et al.
Publicado: (2024)
por: Zhao, Zixiang, et al.
Publicado: (2024)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
por: Zhou, Yuchen, et al.
Publicado: (2025)
por: Zhou, Yuchen, et al.
Publicado: (2025)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
por: Li, Zheng, et al.
Publicado: (2024)
por: Li, Zheng, et al.
Publicado: (2024)
MePT: Multi-Representation Guided Prompt Tuning for Vision-Language Model
por: Wang, Xinyang, et al.
Publicado: (2024)
por: Wang, Xinyang, et al.
Publicado: (2024)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
Conceptual Codebook Learning for Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
por: Cao, Sihan, et al.
Publicado: (2026)
por: Cao, Sihan, et al.
Publicado: (2026)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
por: Zhang, Ruiyang, et al.
Publicado: (2024)
por: Zhang, Ruiyang, et al.
Publicado: (2024)
In-Context-Learning-Assisted Quality Assessment Vision-Language Models for Metal Additive Manufacturing
por: Zheng, Qiaojie, et al.
Publicado: (2025)
por: Zheng, Qiaojie, et al.
Publicado: (2025)
Concept-Guided Prompt Learning for Generalization in Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
por: Ma, Guoqing, et al.
Publicado: (2026)
por: Ma, Guoqing, et al.
Publicado: (2026)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)
por: Yin, Xiangyu, et al.
Publicado: (2025)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
por: Huang, Ting, et al.
Publicado: (2025)
por: Huang, Ting, et al.
Publicado: (2025)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
por: Pan, Yu, et al.
Publicado: (2026)
por: Pan, Yu, et al.
Publicado: (2026)
Towards Self-Refinement of Vision-Language Models with Triangular Consistency
por: Deng, Yunlong, et al.
Publicado: (2025)
por: Deng, Yunlong, et al.
Publicado: (2025)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
por: Liu, Zheng, et al.
Publicado: (2025)
por: Liu, Zheng, et al.
Publicado: (2025)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
por: Zhang, Jinrui, et al.
Publicado: (2024)
por: Zhang, Jinrui, et al.
Publicado: (2024)
MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models
por: Zhao, Shiji, et al.
Publicado: (2025)
por: Zhao, Shiji, et al.
Publicado: (2025)
Iterated Learning Improves Compositionality in Large Vision-Language Models
por: Zheng, Chenhao, et al.
Publicado: (2024)
por: Zheng, Chenhao, et al.
Publicado: (2024)
Assessing and Learning Alignment of Unimodal Vision and Language Models
por: Zhang, Le, et al.
Publicado: (2024)
por: Zhang, Le, et al.
Publicado: (2024)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
por: Ruan, Jiacheng, et al.
Publicado: (2025)
por: Ruan, Jiacheng, et al.
Publicado: (2025)
Feature Projection Learning for Better Vision-Language Reasoning
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation
por: Yang, Yunkai, et al.
Publicado: (2025)
por: Yang, Yunkai, et al.
Publicado: (2025)
Ejemplares similares
-
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
por: Yu, Haorui, et al.
Publicado: (2026) -
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
por: Lu, Jiaying, et al.
Publicado: (2023) -
EvoVLA: Self-Evolving Vision-Language-Action Model
por: Liu, Zeting, et al.
Publicado: (2025) -
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
por: Ye, Angen, et al.
Publicado: (2025) -
Dynamic Execution Commitment of Vision-Language-Action Models
por: Chen, Feng, et al.
Publicado: (2026)