Unlocking Noise-Resistant Vision: Key Architectural Secrets for Robust Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Bum Jun, Kawano, Makoto, Iwasawa, Yusuke, Matsuo, Yutaka |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
QuadNorm: Resolution-Robust Normalization for Neural Operators
by: Kim, Bum Jun, et al.
Published: (2026)
by: Kim, Bum Jun, et al.
Published: (2026)
WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling
by: Oshima, Yuta, et al.
Published: (2025)
by: Oshima, Yuta, et al.
Published: (2025)
Residual Koopman Spectral Profiling for Predicting and Preventing Transformer Training Instability
by: Kim, Bum Jun, et al.
Published: (2026)
by: Kim, Bum Jun, et al.
Published: (2026)
Configuring Data Augmentations to Reduce Variance Shift in Positional Embedding of Vision Transformers
by: Kim, Bum Jun, et al.
Published: (2024)
by: Kim, Bum Jun, et al.
Published: (2024)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
by: Chen, Huanran, et al.
Published: (2024)
by: Chen, Huanran, et al.
Published: (2024)
Realtime Data-Efficient Portrait Stylization Based On Geometric Alignment
by: Wang, Xinrui, et al.
Published: (2022)
by: Wang, Xinrui, et al.
Published: (2022)
Stochastic Subsampling With Average Pooling
by: Kim, Bum Jun, et al.
Published: (2024)
by: Kim, Bum Jun, et al.
Published: (2024)
Foundation Models Secretly Understand Neural Network Weights: Enhancing Hypernetwork Architectures with Foundation Models
by: Gu, Jeffrey, et al.
Published: (2025)
by: Gu, Jeffrey, et al.
Published: (2025)
ColorizeDiffusion v2: Enhancing Reference-based Sketch Colorization Through Separating Utilities
by: Yan, Dingkun, et al.
Published: (2025)
by: Yan, Dingkun, et al.
Published: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
by: Zhang, Mingyuan, et al.
Published: (2025)
by: Zhang, Mingyuan, et al.
Published: (2025)
The Disappearance of Timestep Embedding in Modern Time-Dependent Neural Networks
by: Kim, Bum Jun, et al.
Published: (2024)
by: Kim, Bum Jun, et al.
Published: (2024)
Frequency-Calibrated Membership Inference Attacks on Medical Image Diffusion Models
by: Zhao, Xinkai, et al.
Published: (2025)
by: Zhao, Xinkai, et al.
Published: (2025)
NLPrompt: Noise-Label Prompt Learning for Vision-Language Models
by: Pan, Bikang, et al.
Published: (2024)
by: Pan, Bikang, et al.
Published: (2024)
Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis
by: Cheng, Anzhe, et al.
Published: (2025)
by: Cheng, Anzhe, et al.
Published: (2025)
Noise-Tolerant Few-Shot Unsupervised Adapter for Vision-Language Models
by: Ali, Eman, et al.
Published: (2023)
by: Ali, Eman, et al.
Published: (2023)
Freeplane: Unlocking Free Lunch in Triplane-Based Sparse-View Reconstruction Models
by: Sun, Wenqiang, et al.
Published: (2024)
by: Sun, Wenqiang, et al.
Published: (2024)
Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization
by: Wang, Siqi, et al.
Published: (2025)
by: Wang, Siqi, et al.
Published: (2025)
Improving Diffusion-Based Image Editing Faithfulness via Guidance and Scheduling
by: Cho, Hansam, et al.
Published: (2025)
by: Cho, Hansam, et al.
Published: (2025)
CLIP-like Model as a Foundational Density Ratio Estimator
by: Uchiyama, Fumiya, et al.
Published: (2025)
by: Uchiyama, Fumiya, et al.
Published: (2025)
MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation
by: Oshima, Yuta, et al.
Published: (2025)
by: Oshima, Yuta, et al.
Published: (2025)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
by: Tsuchiya, Fumihiko, et al.
Published: (2026)
by: Tsuchiya, Fumihiko, et al.
Published: (2026)
A Manifold Representation of the Key in Vision Transformers
by: Meng, Li, et al.
Published: (2024)
by: Meng, Li, et al.
Published: (2024)
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
SATA: Spatial Autocorrelation Token Analysis for Enhancing the Robustness of Vision Transformers
by: Nikzad, Nick, et al.
Published: (2024)
by: Nikzad, Nick, et al.
Published: (2024)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
by: Yu, Xinlei, et al.
Published: (2025)
by: Yu, Xinlei, et al.
Published: (2025)
Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator
by: Zheng, Kaiwen, et al.
Published: (2025)
by: Zheng, Kaiwen, et al.
Published: (2025)
Stable Diffusion Models are Secretly Good at Visual In-Context Learning
by: Oorloff, Trevine, et al.
Published: (2025)
by: Oorloff, Trevine, et al.
Published: (2025)
Vision-Language Models Unlock Task-Centric Latent Actions
by: Nikulin, Alexander, et al.
Published: (2026)
by: Nikulin, Alexander, et al.
Published: (2026)
Understanding Domain Generalization: A Noise Robustness Perspective
by: Qiao, Rui, et al.
Published: (2024)
by: Qiao, Rui, et al.
Published: (2024)
Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models
by: Hou, Kuinan, et al.
Published: (2025)
by: Hou, Kuinan, et al.
Published: (2025)
Leave No Observation Behind: Real-time Correction for VLA Action Chunks
by: Sendai, Kohei, et al.
Published: (2025)
by: Sendai, Kohei, et al.
Published: (2025)
Revisiting Semi-supervised Adversarial Robustness via Noise-aware Online Robust Distillation
by: Wu, Tsung-Han, et al.
Published: (2024)
by: Wu, Tsung-Han, et al.
Published: (2024)
DASViT: Differentiable Architecture Search for Vision Transformer
by: Wu, Pengjin, et al.
Published: (2025)
by: Wu, Pengjin, et al.
Published: (2025)
FREE: Fast and Robust Vision Language Models with Early Exits
by: Bajpai, Divya Jyoti, et al.
Published: (2025)
by: Bajpai, Divya Jyoti, et al.
Published: (2025)
Towards Adversarial Robustness of Model-Level Mixture-of-Experts Architectures for Semantic Segmentation
by: Pavlitska, Svetlana, et al.
Published: (2024)
by: Pavlitska, Svetlana, et al.
Published: (2024)
SSR: An Efficient and Robust Framework for Learning with Unknown Label Noise
by: Feng, Chen, et al.
Published: (2021)
by: Feng, Chen, et al.
Published: (2021)
Image Referenced Sketch Colorization Based on Animation Creation Workflow
by: Yan, Dingkun, et al.
Published: (2025)
by: Yan, Dingkun, et al.
Published: (2025)
Foundation Model-oriented Robustness: Robust Image Model Evaluation with Pretrained Models
by: Zhang, Peiyan, et al.
Published: (2023)
by: Zhang, Peiyan, et al.
Published: (2023)
Language Models Do Hard Arithmetic Tasks Easily and Hardly Do Easy Arithmetic Tasks
by: Gambardella, Andrew, et al.
Published: (2024)
by: Gambardella, Andrew, et al.
Published: (2024)
Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models
by: Han, Xu, et al.
Published: (2024)
by: Han, Xu, et al.
Published: (2024)
Similar Items
-
QuadNorm: Resolution-Robust Normalization for Neural Operators
by: Kim, Bum Jun, et al.
Published: (2026) -
WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling
by: Oshima, Yuta, et al.
Published: (2025) -
Residual Koopman Spectral Profiling for Predicting and Preventing Transformer Training Instability
by: Kim, Bum Jun, et al.
Published: (2026) -
Configuring Data Augmentations to Reduce Variance Shift in Positional Embedding of Vision Transformers
by: Kim, Bum Jun, et al.
Published: (2024) -
Your Diffusion Model is Secretly a Certifiably Robust Classifier
by: Chen, Huanran, et al.
Published: (2024)