Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiao, Qingxin, Zhao, Peilin, Zhao, Yangyang, Dang, Lingwei, Wu, Qingyao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation
por: Zhang, Lilin, et al.
Publicado: (2026)
por: Zhang, Lilin, et al.
Publicado: (2026)
Video Anomaly Detection with Semantics-Aware Information Bottleneck
por: Li, Juntong, et al.
Publicado: (2025)
por: Li, Juntong, et al.
Publicado: (2025)
Long-Tailed Object Detection Pre-training: Dynamic Rebalancing Contrastive Learning with Dual Reconstruction
por: Duan, Chen-Long, et al.
Publicado: (2024)
por: Duan, Chen-Long, et al.
Publicado: (2024)
Long-Tail Learning with Rebalanced Contrastive Loss
por: De Alvis, Charika, et al.
Publicado: (2023)
por: De Alvis, Charika, et al.
Publicado: (2023)
ABC Easy as 123: A Blind Counter for Exemplar-Free Multi-Class Class-agnostic Counting
por: Hobley, Michael A., et al.
Publicado: (2023)
por: Hobley, Michael A., et al.
Publicado: (2023)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
por: Ma, Huan, et al.
Publicado: (2024)
por: Ma, Huan, et al.
Publicado: (2024)
Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack
por: Gu, Chenhe, et al.
Publicado: (2025)
por: Gu, Chenhe, et al.
Publicado: (2025)
Hessian Surgery: Class-Targeted Post-Hoc Rebalancing via Hessian Spike Perturbation
por: Vigna, Hugo, et al.
Publicado: (2026)
por: Vigna, Hugo, et al.
Publicado: (2026)
Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities
por: Wu, Jialin, et al.
Publicado: (2025)
por: Wu, Jialin, et al.
Publicado: (2025)
It's a (Blind) Match! Towards Vision-Language Correspondence without Parallel Data
por: Schnaus, Dominik, et al.
Publicado: (2025)
por: Schnaus, Dominik, et al.
Publicado: (2025)
Vision Transformer-based Adversarial Domain Adaptation
por: Li, Yahan, et al.
Publicado: (2024)
por: Li, Yahan, et al.
Publicado: (2024)
Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
por: Naharas, Nilay, et al.
Publicado: (2025)
por: Naharas, Nilay, et al.
Publicado: (2025)
Transferable Adversarial Attacks on Black-Box Vision-Language Models
por: Hu, Kai, et al.
Publicado: (2025)
por: Hu, Kai, et al.
Publicado: (2025)
Vision Language Models are Biased
por: Vo, An, et al.
Publicado: (2025)
por: Vo, An, et al.
Publicado: (2025)
Self-Bootstrapping for Versatile Test-Time Adaptation
por: Niu, Shuaicheng, et al.
Publicado: (2025)
por: Niu, Shuaicheng, et al.
Publicado: (2025)
Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
por: Xu, Haochuan, et al.
Publicado: (2025)
por: Xu, Haochuan, et al.
Publicado: (2025)
Large-Scale Riemannian Meta-Optimization via Subspace Adaptation
por: Yu, Peilin, et al.
Publicado: (2025)
por: Yu, Peilin, et al.
Publicado: (2025)
Attack Anything: Blind DNNs via Universal Background Adversarial Attack
por: Lian, Jiawei, et al.
Publicado: (2024)
por: Lian, Jiawei, et al.
Publicado: (2024)
Mitigating Accuracy-Robustness Trade-off via Balanced Multi-Teacher Adversarial Distillation
por: Zhao, Shiji, et al.
Publicado: (2023)
por: Zhao, Shiji, et al.
Publicado: (2023)
WriteViT: Handwritten Text Generation with Vision Transformer
por: Nam, Dang Hoai, et al.
Publicado: (2025)
por: Nam, Dang Hoai, et al.
Publicado: (2025)
Evaluating the Adversarial Robustness of Detection Transformers
por: Nazeri, Amirhossein, et al.
Publicado: (2024)
por: Nazeri, Amirhossein, et al.
Publicado: (2024)
A Survey of Vision Transformers in Autonomous Driving: Current Trends and Future Directions
por: Lai-Dang, Quoc-Vinh
Publicado: (2024)
por: Lai-Dang, Quoc-Vinh
Publicado: (2024)
Towards Fair Class-wise Robustness: Class Optimal Distribution Adversarial Training
por: Zhi, Hongxin, et al.
Publicado: (2025)
por: Zhi, Hongxin, et al.
Publicado: (2025)
Commonsense for Zero-Shot Natural Language Video Localization
por: Holla, Meghana, et al.
Publicado: (2023)
por: Holla, Meghana, et al.
Publicado: (2023)
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
por: Guo, Zirun, et al.
Publicado: (2024)
por: Guo, Zirun, et al.
Publicado: (2024)
SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios
por: Dang, Lingwei, et al.
Publicado: (2025)
por: Dang, Lingwei, et al.
Publicado: (2025)
Continual Learning with Vision-Language Models via Semantic-Geometry Preservation
por: He, Chiyuan, et al.
Publicado: (2026)
por: He, Chiyuan, et al.
Publicado: (2026)
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
por: Li, Zhenyang, et al.
Publicado: (2024)
por: Li, Zhenyang, et al.
Publicado: (2024)
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
por: Bao, Wenxuan, et al.
Publicado: (2026)
por: Bao, Wenxuan, et al.
Publicado: (2026)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
por: Han, Xu, et al.
Publicado: (2024)
por: Han, Xu, et al.
Publicado: (2024)
Improving Adversarial Robust Fairness via Anti-Bias Soft Label Distillation
por: Zhao, Shiji, et al.
Publicado: (2023)
por: Zhao, Shiji, et al.
Publicado: (2023)
PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain Generalization
por: Chen, Zining, et al.
Publicado: (2024)
por: Chen, Zining, et al.
Publicado: (2024)
One-Step Diffusion Distillation via Deep Equilibrium Models
por: Geng, Zhengyang, et al.
Publicado: (2023)
por: Geng, Zhengyang, et al.
Publicado: (2023)
Boosting Adversarial Transferability via Ensemble Non-Attention
por: Zou, Yipeng, et al.
Publicado: (2025)
por: Zou, Yipeng, et al.
Publicado: (2025)
Ultrasound Vision-Language Alignment via Contrastive Learning
por: Lyu, Zhuoyang, et al.
Publicado: (2026)
por: Lyu, Zhuoyang, et al.
Publicado: (2026)
TRIX- Trading Adversarial Fairness via Mixed Adversarial Training
por: Medi, Tejaswini, et al.
Publicado: (2025)
por: Medi, Tejaswini, et al.
Publicado: (2025)
MirrorCheck: Efficient Adversarial Defense for Vision-Language Models
por: Fares, Samar, et al.
Publicado: (2024)
por: Fares, Samar, et al.
Publicado: (2024)
PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
por: Meng, Ziqiao, et al.
Publicado: (2025)
por: Meng, Ziqiao, et al.
Publicado: (2025)
SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis
por: Dang, Lingwei, et al.
Publicado: (2025)
por: Dang, Lingwei, et al.
Publicado: (2025)
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
por: Choi, Suhwan, et al.
Publicado: (2024)
por: Choi, Suhwan, et al.
Publicado: (2024)
Ejemplares similares
-
Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation
por: Zhang, Lilin, et al.
Publicado: (2026) -
Video Anomaly Detection with Semantics-Aware Information Bottleneck
por: Li, Juntong, et al.
Publicado: (2025) -
Long-Tailed Object Detection Pre-training: Dynamic Rebalancing Contrastive Learning with Dual Reconstruction
por: Duan, Chen-Long, et al.
Publicado: (2024) -
Long-Tail Learning with Rebalanced Contrastive Loss
por: De Alvis, Charika, et al.
Publicado: (2023) -
ABC Easy as 123: A Blind Counter for Exemplar-Free Multi-Class Class-agnostic Counting
por: Hobley, Michael A., et al.
Publicado: (2023)