Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Heng, Yu, Ao, Kang, Li, Fan, Yuchen, Fan, Yutao, Song, Xiufeng, Geng, Hejia, Qin, Yiran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
di: Hou, Yuchen, et al.
Pubblicazione: (2026)
di: Hou, Yuchen, et al.
Pubblicazione: (2026)
Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning
di: Zhou, Heng, et al.
Pubblicazione: (2026)
di: Zhou, Heng, et al.
Pubblicazione: (2026)
Towards Transferable Attacks Against Vision-LLMs in Autonomous Driving with Typography
di: Chung, Nhat, et al.
Pubblicazione: (2024)
di: Chung, Nhat, et al.
Pubblicazione: (2024)
VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning
di: Kang, Li, et al.
Pubblicazione: (2025)
di: Kang, Li, et al.
Pubblicazione: (2025)
Capability $\neq$ Interpretability: Human Interpretability of Vision Foundation Models
di: Colin, Julien, et al.
Pubblicazione: (2026)
di: Colin, Julien, et al.
Pubblicazione: (2026)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
Learning Spatial Decay for Vision Transformers
di: Mao, Yuxin, et al.
Pubblicazione: (2025)
di: Mao, Yuxin, et al.
Pubblicazione: (2025)
Kinetic Typography Diffusion Model
di: Park, Seonmi, et al.
Pubblicazione: (2024)
di: Park, Seonmi, et al.
Pubblicazione: (2024)
CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment
di: Kang, Li, et al.
Pubblicazione: (2026)
di: Kang, Li, et al.
Pubblicazione: (2026)
HoSNN: Adversarially-Robust Homeostatic Spiking Neural Networks with Adaptive Firing Thresholds
di: Geng, Hejia, et al.
Pubblicazione: (2023)
di: Geng, Hejia, et al.
Pubblicazione: (2023)
WordCon: Word-level Typography Control in Scene Text Rendering
di: Shi, Wenda, et al.
Pubblicazione: (2025)
di: Shi, Wenda, et al.
Pubblicazione: (2025)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
di: Li, Yuliang, et al.
Pubblicazione: (2026)
di: Li, Yuliang, et al.
Pubblicazione: (2026)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
di: Yang, Fan, et al.
Pubblicazione: (2025)
di: Yang, Fan, et al.
Pubblicazione: (2025)
State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading
di: Hu, Yuanze, et al.
Pubblicazione: (2026)
di: Hu, Yuanze, et al.
Pubblicazione: (2026)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
di: Guo, Xiao, et al.
Pubblicazione: (2025)
di: Guo, Xiao, et al.
Pubblicazione: (2025)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
DiveUp: Learning Feature Upsampling from Diverse Vision Foundation Models
di: Liu, Xiaoqiong, et al.
Pubblicazione: (2026)
di: Liu, Xiaoqiong, et al.
Pubblicazione: (2026)
FonTS: Text Rendering with Typography and Style Controls
di: Shi, Wenda, et al.
Pubblicazione: (2024)
di: Shi, Wenda, et al.
Pubblicazione: (2024)
Dynamic Typography: Bringing Text to Life via Video Diffusion Prior
di: Liu, Zichen, et al.
Pubblicazione: (2024)
di: Liu, Zichen, et al.
Pubblicazione: (2024)
Can Graphs Help Vision SSMs See Better?
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
FontCLIP: A Semantic Typography Visual-Language Model for Multilingual Font Applications
di: Tatsukawa, Yuki, et al.
Pubblicazione: (2024)
di: Tatsukawa, Yuki, et al.
Pubblicazione: (2024)
ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation
di: Qin, Yiran, et al.
Pubblicazione: (2026)
di: Qin, Yiran, et al.
Pubblicazione: (2026)
Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models
di: Panchal, Utsav, et al.
Pubblicazione: (2025)
di: Panchal, Utsav, et al.
Pubblicazione: (2025)
LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge
di: Zhou, Heng, et al.
Pubblicazione: (2025)
di: Zhou, Heng, et al.
Pubblicazione: (2025)
RoboFactory: Exploring Embodied Agent Collaboration with Compositional Constraints
di: Qin, Yiran, et al.
Pubblicazione: (2025)
di: Qin, Yiran, et al.
Pubblicazione: (2025)
Vision-Language Models Can't See the Obvious
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
WordCraft: Interactive Artistic Typography with Attention Awareness and Noise Blending
di: Wang, Zhe, et al.
Pubblicazione: (2025)
di: Wang, Zhe, et al.
Pubblicazione: (2025)
Typography-Based Monocular Distance Estimation Framework for Vehicle Safety Systems
di: Reddy, Manognya Lokesh, et al.
Pubblicazione: (2026)
di: Reddy, Manognya Lokesh, et al.
Pubblicazione: (2026)
Classification Done Right for Vision-Language Pre-Training
di: Huang, Zilong, et al.
Pubblicazione: (2024)
di: Huang, Zilong, et al.
Pubblicazione: (2024)
PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography
di: Liu, Junle, et al.
Pubblicazione: (2026)
di: Liu, Junle, et al.
Pubblicazione: (2026)
Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
di: Ma, Fan, et al.
Pubblicazione: (2023)
di: Ma, Fan, et al.
Pubblicazione: (2023)
VitaGlyph: Vitalizing Artistic Typography with Flexible Dual-branch Diffusion Models
di: Feng, Kailai, et al.
Pubblicazione: (2024)
di: Feng, Kailai, et al.
Pubblicazione: (2024)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
di: Feng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Feng, Zhiyuan, et al.
Pubblicazione: (2025)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
OracleFusion: Assisting the Decipherment of Oracle Bone Script with Structurally Constrained Semantic Typography
di: Li, Caoshuo, et al.
Pubblicazione: (2025)
di: Li, Caoshuo, et al.
Pubblicazione: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
di: Zhao, Kai, et al.
Pubblicazione: (2025)
di: Zhao, Kai, et al.
Pubblicazione: (2025)
Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models
di: Li, Aaron Branson Cigres, et al.
Pubblicazione: (2026)
di: Li, Aaron Branson Cigres, et al.
Pubblicazione: (2026)
Reconstructing Close Human Interactions from Multiple Views
di: Shuai, Qing, et al.
Pubblicazione: (2024)
di: Shuai, Qing, et al.
Pubblicazione: (2024)
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
di: Peng, Wujian, et al.
Pubblicazione: (2023)
di: Peng, Wujian, et al.
Pubblicazione: (2023)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
di: Talon, Davide, et al.
Pubblicazione: (2025)
di: Talon, Davide, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
di: Hou, Yuchen, et al.
Pubblicazione: (2026) -
Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning
di: Zhou, Heng, et al.
Pubblicazione: (2026) -
Towards Transferable Attacks Against Vision-LLMs in Autonomous Driving with Typography
di: Chung, Nhat, et al.
Pubblicazione: (2024) -
VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning
di: Kang, Li, et al.
Pubblicazione: (2025) -
Capability $\neq$ Interpretability: Human Interpretability of Vision Foundation Models
di: Colin, Julien, et al.
Pubblicazione: (2026)