Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shah, Arya, Tripathi, Vaibhav, Singh, Mayank, Silpasuwanchai, Chaklam |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
Barriers in Integrating Medical Visual Question Answering into Radiology Workflows: A Scoping Review and Clinicians' Insights
par: Mishra, Deepali, et autres
Publié: (2025)
par: Mishra, Deepali, et autres
Publié: (2025)
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
par: Shah, Arya, et autres
Publié: (2025)
par: Shah, Arya, et autres
Publié: (2025)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
par: Tang, Ziyao, et autres
Publié: (2026)
par: Tang, Ziyao, et autres
Publié: (2026)
From Overload to Convergence: Supporting Multi-Issue Human-AI Negotiation with Bayesian Visualization
par: Parmar, Mehul, et autres
Publié: (2026)
par: Parmar, Mehul, et autres
Publié: (2026)
Learn "No" to Say "Yes" Better: Improving Vision-Language Models via Negations
par: Singh, Jaisidh, et autres
Publié: (2024)
par: Singh, Jaisidh, et autres
Publié: (2024)
Benchmarking Gaslighting Negation Attacks Against Reasoning Models
par: Zhu, Bin, et autres
Publié: (2025)
par: Zhu, Bin, et autres
Publié: (2025)
Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge Alignment
par: Ishmam, Alvi Md, et autres
Publié: (2024)
par: Ishmam, Alvi Md, et autres
Publié: (2024)
BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
par: Narnaware, Vishal, et autres
Publié: (2025)
par: Narnaware, Vishal, et autres
Publié: (2025)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
V3LMA: Visual 3D-enhanced Language Model for Autonomous Driving
par: Lübberstedt, Jannik, et autres
Publié: (2025)
par: Lübberstedt, Jannik, et autres
Publié: (2025)
Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation
par: Bose, Sarosij, et autres
Publié: (2025)
par: Bose, Sarosij, et autres
Publié: (2025)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
par: Kapuriya, Janak, et autres
Publié: (2025)
par: Kapuriya, Janak, et autres
Publié: (2025)
Improved Alignment of Modalities in Large Vision Language Models
par: Jangra, Kartik, et autres
Publié: (2025)
par: Jangra, Kartik, et autres
Publié: (2025)
MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment
par: Zhang, Ruicheng, et autres
Publié: (2025)
par: Zhang, Ruicheng, et autres
Publié: (2025)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024)
par: Ge, Junqi, et autres
Publié: (2024)
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
par: Jiao, Pengkun, et autres
Publié: (2025)
par: Jiao, Pengkun, et autres
Publié: (2025)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
par: Shen, Xiaoqian, et autres
Publié: (2023)
par: Shen, Xiaoqian, et autres
Publié: (2023)
Locality Alignment Improves Vision-Language Models
par: Covert, Ian, et autres
Publié: (2024)
par: Covert, Ian, et autres
Publié: (2024)
Exploring the Zero-Shot Capabilities of Vision-Language Models for Improving Gaze Following
par: Gupta, Anshul, et autres
Publié: (2024)
par: Gupta, Anshul, et autres
Publié: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
par: Pan, Yu, et autres
Publié: (2026)
par: Pan, Yu, et autres
Publié: (2026)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
par: Unmesh, Asim, et autres
Publié: (2026)
par: Unmesh, Asim, et autres
Publié: (2026)
Geometry of the Visual Cortex with Applications to Image Inpainting and Enhancement
par: Ballerin, Francesco, et autres
Publié: (2023)
par: Ballerin, Francesco, et autres
Publié: (2023)
Enhancing Model Performance: Another Approach to Vision-Language Instruction Tuning
par: Vedanshu, et autres
Publié: (2024)
par: Vedanshu, et autres
Publié: (2024)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
par: Lalai, Harsh Nishant, et autres
Publié: (2026)
par: Lalai, Harsh Nishant, et autres
Publié: (2026)
Privacy-Shielded Image Compression: Defending Against Exploitation from Vision-Language Pretrained Models
par: Shen, Xuelin, et autres
Publié: (2025)
par: Shen, Xuelin, et autres
Publié: (2025)
Enhancing Vision-Language Model with Unmasked Token Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Assessing and Learning Alignment of Unimodal Vision and Language Models
par: Zhang, Le, et autres
Publié: (2024)
par: Zhang, Le, et autres
Publié: (2024)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
par: Li, Zhaoxu, et autres
Publié: (2025)
par: Li, Zhaoxu, et autres
Publié: (2025)
V2C-Long: Longitudinal Cortex Reconstruction with Spatiotemporal Correspondence
par: Bongratz, Fabian, et autres
Publié: (2024)
par: Bongratz, Fabian, et autres
Publié: (2024)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
par: Cheng, Jintao, et autres
Publié: (2026)
par: Cheng, Jintao, et autres
Publié: (2026)
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
par: Pani, Anupam, et autres
Publié: (2026)
par: Pani, Anupam, et autres
Publié: (2026)
Detecting Text Manipulation in Images using Vision Language Models
par: Vidit, Vidit, et autres
Publié: (2025)
par: Vidit, Vidit, et autres
Publié: (2025)
Attention! Your Vision Language Model Could Be Maliciously Manipulated
par: Wang, Xiaosen, et autres
Publié: (2025)
par: Wang, Xiaosen, et autres
Publié: (2025)
Visual Representation Alignment for Multimodal Large Language Models
par: Yoon, Heeji, et autres
Publié: (2025)
par: Yoon, Heeji, et autres
Publié: (2025)
Modeling Rapid Contextual Learning in the Visual Cortex with Fast-Weight Deep Autoencoder Networks
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024)
par: Dong, Yuhao, et autres
Publié: (2024)
Documents similaires
-
SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters
par: Shah, Arya, et autres
Publié: (2026) -
Barriers in Integrating Medical Visual Question Answering into Radiology Workflows: A Scoping Review and Clinicians' Insights
par: Mishra, Deepali, et autres
Publié: (2025) -
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
par: Shah, Arya, et autres
Publié: (2025) -
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
par: Shah, Arya, et autres
Publié: (2026) -
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
par: Tang, Ziyao, et autres
Publié: (2026)