VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Balakrishnan, Ravikumar, Phute, Mansi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models
di: Phute, Mansi, et al.
Pubblicazione: (2025)
di: Phute, Mansi, et al.
Pubblicazione: (2025)
VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
di: Taioli, Francesco, et al.
Pubblicazione: (2026)
di: Taioli, Francesco, et al.
Pubblicazione: (2026)
VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
di: Shen, Yucheng, et al.
Pubblicazione: (2026)
di: Shen, Yucheng, et al.
Pubblicazione: (2026)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
di: Zhang, Yuanhong, et al.
Pubblicazione: (2026)
di: Zhang, Yuanhong, et al.
Pubblicazione: (2026)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
di: Yin, Jianghao, et al.
Pubblicazione: (2026)
di: Yin, Jianghao, et al.
Pubblicazione: (2026)
Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models
di: Zou, Zhengtao, et al.
Pubblicazione: (2025)
di: Zou, Zhengtao, et al.
Pubblicazione: (2025)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
di: Li, Zhuowei, et al.
Pubblicazione: (2025)
di: Li, Zhuowei, et al.
Pubblicazione: (2025)
Language Models Can Explain Visual Features via Steering
di: Ferrando, Javier, et al.
Pubblicazione: (2026)
di: Ferrando, Javier, et al.
Pubblicazione: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
di: Kim, Sohee, et al.
Pubblicazione: (2025)
di: Kim, Sohee, et al.
Pubblicazione: (2025)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)
di: Yang, Xikai, et al.
Pubblicazione: (2025)
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
di: Yang, Jiaxi, et al.
Pubblicazione: (2026)
di: Yang, Jiaxi, et al.
Pubblicazione: (2026)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
di: Wu, Sihao, et al.
Pubblicazione: (2025)
di: Wu, Sihao, et al.
Pubblicazione: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
di: Che, Liwei, et al.
Pubblicazione: (2026)
di: Che, Liwei, et al.
Pubblicazione: (2026)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
Robustness of Vision Language Models Against Split-Image Harmful Input Attacks
di: Rashid, Md Rafi Ur, et al.
Pubblicazione: (2026)
di: Rashid, Md Rafi Ur, et al.
Pubblicazione: (2026)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
di: Yu, Mingyu, et al.
Pubblicazione: (2026)
di: Yu, Mingyu, et al.
Pubblicazione: (2026)
Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering
di: Jana, Soumyadeep, et al.
Pubblicazione: (2026)
di: Jana, Soumyadeep, et al.
Pubblicazione: (2026)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
A Large Vision-Language Model based Environment Perception System for Visually Impaired People
di: Chen, Zezhou, et al.
Pubblicazione: (2025)
di: Chen, Zezhou, et al.
Pubblicazione: (2025)
Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models
di: Wang, Dongdong, et al.
Pubblicazione: (2026)
di: Wang, Dongdong, et al.
Pubblicazione: (2026)
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
di: Sarowar, Md Selim, et al.
Pubblicazione: (2025)
di: Sarowar, Md Selim, et al.
Pubblicazione: (2025)
Learning to Steer: Input-dependent Steering for Multimodal LLMs
di: Parekh, Jayneel, et al.
Pubblicazione: (2025)
di: Parekh, Jayneel, et al.
Pubblicazione: (2025)
Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2026)
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2026)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
di: Jeon, Hyunsik, et al.
Pubblicazione: (2025)
di: Jeon, Hyunsik, et al.
Pubblicazione: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
di: Zheng, Qi, et al.
Pubblicazione: (2026)
di: Zheng, Qi, et al.
Pubblicazione: (2026)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
di: Zhao, Jianfei, et al.
Pubblicazione: (2025)
di: Zhao, Jianfei, et al.
Pubblicazione: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024)
di: Yan, Siming, et al.
Pubblicazione: (2024)
Skill-Conditioned Visual Geolocation for Vision-Language Models
di: Yang, Chenjie, et al.
Pubblicazione: (2026)
di: Yang, Chenjie, et al.
Pubblicazione: (2026)
Generative Visual Communication in the Era of Vision-Language Models
di: Vinker, Yael
Pubblicazione: (2024)
di: Vinker, Yael
Pubblicazione: (2024)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
di: Li, Jianjian, et al.
Pubblicazione: (2025)
di: Li, Jianjian, et al.
Pubblicazione: (2025)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
di: Kang, Seil, et al.
Pubblicazione: (2025)
di: Kang, Seil, et al.
Pubblicazione: (2025)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
Decoding Vision Transformers: the Diffusion Steering Lens
di: Takatsuki, Ryota, et al.
Pubblicazione: (2025)
di: Takatsuki, Ryota, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models
di: Phute, Mansi, et al.
Pubblicazione: (2025) -
VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
di: Taioli, Francesco, et al.
Pubblicazione: (2026) -
VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
di: Shen, Yucheng, et al.
Pubblicazione: (2026) -
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
di: Zhang, Yuanhong, et al.
Pubblicazione: (2026) -
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
di: Yin, Jianghao, et al.
Pubblicazione: (2026)