Low-Pass Filtering Improves Behavioral Alignment of Vision Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wolff, Max, Klein, Thomas, Rusak, Evgenia, Wichmann, Felix, Brendel, Wieland |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scale Alone Does not Improve Mechanistic Interpretability in Vision Models
por: Zimmermann, Roland S., et al.
Publicado: (2023)
por: Zimmermann, Roland S., et al.
Publicado: (2023)
Effective pruning of web-scale datasets based on complexity of concept clusters
por: Abbas, Amro, et al.
Publicado: (2024)
por: Abbas, Amro, et al.
Publicado: (2024)
Does CLIP's Generalization Performance Mainly Stem from High Train-Test Similarity?
por: Mayilvahanan, Prasanna, et al.
Publicado: (2023)
por: Mayilvahanan, Prasanna, et al.
Publicado: (2023)
InfoNCE: Identifying the Gap Between Theory and Practice
por: Rusak, Evgenia, et al.
Publicado: (2024)
por: Rusak, Evgenia, et al.
Publicado: (2024)
In Search of Forgotten Domain Generalization
por: Mayilvahanan, Prasanna, et al.
Publicado: (2024)
por: Mayilvahanan, Prasanna, et al.
Publicado: (2024)
LAION-C: An Out-of-Distribution Benchmark for Web-Scale Vision Models
por: Li, Fanfei, et al.
Publicado: (2025)
por: Li, Fanfei, et al.
Publicado: (2025)
MentisOculi: Revealing the Limits of Reasoning with Mental Imagery
por: Zeller, Jana, et al.
Publicado: (2026)
por: Zeller, Jana, et al.
Publicado: (2026)
Exploring the Low-Pass Filtering Behavior in Image Super-Resolution
por: Deng, Haoyu, et al.
Publicado: (2024)
por: Deng, Haoyu, et al.
Publicado: (2024)
How Aligned are Different Alignment Metrics?
por: Ahlert, Jannis, et al.
Publicado: (2024)
por: Ahlert, Jannis, et al.
Publicado: (2024)
Generation is Required for Data-Efficient Perception
por: Brady, Jack, et al.
Publicado: (2025)
por: Brady, Jack, et al.
Publicado: (2025)
Revisiting 3D Reconstruction Kernels as Low-Pass Filters
por: Zhang, Shengjun, et al.
Publicado: (2026)
por: Zhang, Shengjun, et al.
Publicado: (2026)
Locality Alignment Improves Vision-Language Models
por: Covert, Ian, et al.
Publicado: (2024)
por: Covert, Ian, et al.
Publicado: (2024)
Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
por: Choi, June Suk, et al.
Publicado: (2025)
por: Choi, June Suk, et al.
Publicado: (2025)
Interaction Asymmetry: A General Principle for Learning Composable Abstractions
por: Brady, Jack, et al.
Publicado: (2024)
por: Brady, Jack, et al.
Publicado: (2024)
Improving Concept Alignment in Vision-Language Concept Bottleneck Models
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2024)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2024)
Text-Pass Filter: An Efficient Scene Text Detector
por: Yang, Chuang, et al.
Publicado: (2026)
por: Yang, Chuang, et al.
Publicado: (2026)
On the Global Photometric Alignment for Low-Level Vision
por: Li, Mingjia, et al.
Publicado: (2026)
por: Li, Mingjia, et al.
Publicado: (2026)
MVTOP: Multi-View Transformer-based Object Pose-Estimation
por: Ranftl, Lukas, et al.
Publicado: (2025)
por: Ranftl, Lukas, et al.
Publicado: (2025)
Improved Alignment of Modalities in Large Vision Language Models
por: Jangra, Kartik, et al.
Publicado: (2025)
por: Jangra, Kartik, et al.
Publicado: (2025)
Synth-Align: Improving Trustworthiness in Vision-Language Model with Synthetic Preference Data Alignment
por: Wijaya, Robert, et al.
Publicado: (2024)
por: Wijaya, Robert, et al.
Publicado: (2024)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
ARoFace: Alignment Robustness to Improve Low-Quality Face Recognition
por: Saadabadi, Mohammad Saeed Ebrahimi, et al.
Publicado: (2024)
por: Saadabadi, Mohammad Saeed Ebrahimi, et al.
Publicado: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
por: Watawana, Hasindri, et al.
Publicado: (2024)
por: Watawana, Hasindri, et al.
Publicado: (2024)
Don't trust your eyes: on the (un)reliability of feature visualizations
por: Geirhos, Robert, et al.
Publicado: (2023)
por: Geirhos, Robert, et al.
Publicado: (2023)
Enhancing Vision-Language Model with Unmasked Token Alignment
por: Liu, Jihao, et al.
Publicado: (2024)
por: Liu, Jihao, et al.
Publicado: (2024)
Assessing and Learning Alignment of Unimodal Vision and Language Models
por: Zhang, Le, et al.
Publicado: (2024)
por: Zhang, Le, et al.
Publicado: (2024)
Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge Alignment
por: Ishmam, Alvi Md, et al.
Publicado: (2024)
por: Ishmam, Alvi Md, et al.
Publicado: (2024)
Speed-up of Vision Transformer Models by Attention-aware Token Filtering
por: Naruko, Takahiro, et al.
Publicado: (2025)
por: Naruko, Takahiro, et al.
Publicado: (2025)
T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability
por: Khosla, Savya, et al.
Publicado: (2026)
por: Khosla, Savya, et al.
Publicado: (2026)
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
por: Ling, Zijian, et al.
Publicado: (2025)
por: Ling, Zijian, et al.
Publicado: (2025)
VGGSounder: Audio-Visual Evaluations for Foundation Models
por: Zverev, Daniil, et al.
Publicado: (2025)
por: Zverev, Daniil, et al.
Publicado: (2025)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
por: Tong, Baoshun, et al.
Publicado: (2024)
por: Tong, Baoshun, et al.
Publicado: (2024)
HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models
por: Lin, Yangguang, et al.
Publicado: (2026)
por: Lin, Yangguang, et al.
Publicado: (2026)
Beyond Kalman Filters: Deep Learning-Based Filters for Improved Object Tracking
por: Adžemović, Momir, et al.
Publicado: (2024)
por: Adžemović, Momir, et al.
Publicado: (2024)
Normalize Filters! Classical Wisdom for Deep Vision
por: Perez, Gustavo, et al.
Publicado: (2025)
por: Perez, Gustavo, et al.
Publicado: (2025)
Hallucination Filtering in Radiology Vision-Language Models Using Discrete Semantic Entropy
por: Wienholt, Patrick, et al.
Publicado: (2025)
por: Wienholt, Patrick, et al.
Publicado: (2025)
See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment
por: Azeez, Mohammad Anas, et al.
Publicado: (2026)
por: Azeez, Mohammad Anas, et al.
Publicado: (2026)
Linear Alignment of Vision-language Models for Image Captioning
por: Paischer, Fabian, et al.
Publicado: (2023)
por: Paischer, Fabian, et al.
Publicado: (2023)
Latent Denoising Improves Visual Alignment in Large Multimodal Models
por: Parikh, Dhruv, et al.
Publicado: (2026)
por: Parikh, Dhruv, et al.
Publicado: (2026)
Ejemplares similares
-
Scale Alone Does not Improve Mechanistic Interpretability in Vision Models
por: Zimmermann, Roland S., et al.
Publicado: (2023) -
Effective pruning of web-scale datasets based on complexity of concept clusters
por: Abbas, Amro, et al.
Publicado: (2024) -
Does CLIP's Generalization Performance Mainly Stem from High Train-Test Similarity?
por: Mayilvahanan, Prasanna, et al.
Publicado: (2023) -
InfoNCE: Identifying the Gap Between Theory and Practice
por: Rusak, Evgenia, et al.
Publicado: (2024) -
In Search of Forgotten Domain Generalization
por: Mayilvahanan, Prasanna, et al.
Publicado: (2024)