Can Visual Encoder Learn to See Arrows?
Fuente:
arXiv
Salvato in:
| Autori principali: | Terashita, Naoyuki, Tozaki, Yusuke, Omote, Hideaki, Nguyen, Congkha, Nakamoto, Ryosuke, Koreeda, Yuta, Ozaki, Hiroaki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models
di: Tozaki, Yusuke, et al.
Pubblicazione: (2026)
di: Tozaki, Yusuke, et al.
Pubblicazione: (2026)
One RL to See Them All: Visual Triple Unified Reinforcement Learning
di: Ma, Yan, et al.
Pubblicazione: (2025)
di: Ma, Yan, et al.
Pubblicazione: (2025)
See the Text: From Tokenization to Visual Reading
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
di: Hayashi, Kazuki, et al.
Pubblicazione: (2025)
di: Hayashi, Kazuki, et al.
Pubblicazione: (2025)
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)
Seeing the Arrow of Time in Large Multimodal Models
di: Xue, Zihui, et al.
Pubblicazione: (2025)
di: Xue, Zihui, et al.
Pubblicazione: (2025)
Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs
di: Han, Peitao, et al.
Pubblicazione: (2026)
di: Han, Peitao, et al.
Pubblicazione: (2026)
Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2024)
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2024)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
di: Shi, Chufan, et al.
Pubblicazione: (2026)
di: Shi, Chufan, et al.
Pubblicazione: (2026)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
di: Guo, Pinxue, et al.
Pubblicazione: (2025)
di: Guo, Pinxue, et al.
Pubblicazione: (2025)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
See, Think, Learn: A Self-Taught Multimodal Reasoner
di: Sharma, Sourabh, et al.
Pubblicazione: (2025)
di: Sharma, Sourabh, et al.
Pubblicazione: (2025)
Unifying Specialized Visual Encoders for Video Language Models
di: Chung, Jihoon, et al.
Pubblicazione: (2025)
di: Chung, Jihoon, et al.
Pubblicazione: (2025)
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
di: Xiao, Xin, et al.
Pubblicazione: (2024)
di: Xiao, Xin, et al.
Pubblicazione: (2024)
Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
di: Nguyen, Ngoc Son, et al.
Pubblicazione: (2024)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
di: Ozaki, Shintaro, et al.
Pubblicazione: (2025)
di: Ozaki, Shintaro, et al.
Pubblicazione: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
di: Yashima, Daichi, et al.
Pubblicazione: (2024)
di: Yashima, Daichi, et al.
Pubblicazione: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
di: Satar, Burak, et al.
Pubblicazione: (2025)
di: Satar, Burak, et al.
Pubblicazione: (2025)
Are Bigger Encoders Always Better in Vision Large Models?
di: Li, Bozhou, et al.
Pubblicazione: (2024)
di: Li, Bozhou, et al.
Pubblicazione: (2024)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
di: Yu, Seonghoon, et al.
Pubblicazione: (2026)
di: Yu, Seonghoon, et al.
Pubblicazione: (2026)
ArrowGEV: Grounding Events in Video via Learning the Arrow of Time
di: Yu, Fangxu, et al.
Pubblicazione: (2026)
di: Yu, Fangxu, et al.
Pubblicazione: (2026)
Seeing Straight: Document Orientation Detection for Efficient OCR
di: Goswami, Suranjan, et al.
Pubblicazione: (2025)
di: Goswami, Suranjan, et al.
Pubblicazione: (2025)
ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder
di: Cho, Seunghyuk, et al.
Pubblicazione: (2025)
di: Cho, Seunghyuk, et al.
Pubblicazione: (2025)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
di: Nguyen, Cong-Duy, et al.
Pubblicazione: (2025)
di: Nguyen, Cong-Duy, et al.
Pubblicazione: (2025)
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
di: Nguyen, Nghia Hieu, et al.
Pubblicazione: (2024)
di: Nguyen, Nghia Hieu, et al.
Pubblicazione: (2024)
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
di: Chen, Kai, et al.
Pubblicazione: (2024)
di: Chen, Kai, et al.
Pubblicazione: (2024)
See It All: Contextualized Late Aggregation for 3D Dense Captioning
di: Kim, Minjung, et al.
Pubblicazione: (2024)
di: Kim, Minjung, et al.
Pubblicazione: (2024)
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2025)
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2025)
SeeGULL Multilingual: a Dataset of Geo-Culturally Situated Stereotypes
di: Bhutani, Mukul, et al.
Pubblicazione: (2024)
di: Bhutani, Mukul, et al.
Pubblicazione: (2024)
AI Sees Your Location, But With A Bias Toward The Wealthy World
di: Huang, Jingyuan, et al.
Pubblicazione: (2025)
di: Huang, Jingyuan, et al.
Pubblicazione: (2025)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
di: Lin, Bin, et al.
Pubblicazione: (2025)
di: Lin, Bin, et al.
Pubblicazione: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models
di: Tozaki, Yusuke, et al.
Pubblicazione: (2026) -
One RL to See Them All: Visual Triple Unified Reinforcement Learning
di: Ma, Yan, et al.
Pubblicazione: (2025) -
See the Text: From Tokenization to Visual Reading
di: Xing, Ling, et al.
Pubblicazione: (2025) -
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
di: Hayashi, Kazuki, et al.
Pubblicazione: (2025) -
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
di: Omasa, Takamitsu, et al.
Pubblicazione: (2025)