Towards flexible perception with visual memory
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Geirhos, Robert, Jaini, Priyank, Stone, Austin, Medapati, Sourabh, Yi, Xi, Toderici, George, Ogale, Abhijit, Shlens, Jonathon |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Visual Composition through Improved Semantic Guidance
par: Stone, Austin, et autres
Publié: (2024)
par: Stone, Austin, et autres
Publié: (2024)
Intriguing properties of generative classifiers
par: Jaini, Priyank, et autres
Publié: (2023)
par: Jaini, Priyank, et autres
Publié: (2023)
Do generative video models understand physical principles?
par: Motamed, Saman, et autres
Publié: (2025)
par: Motamed, Saman, et autres
Publié: (2025)
Video models are zero-shot learners and reasoners
par: Wiedemer, Thaddäus, et autres
Publié: (2025)
par: Wiedemer, Thaddäus, et autres
Publié: (2025)
Don't trust your eyes: on the (un)reliability of feature visualizations
par: Geirhos, Robert, et autres
Publié: (2023)
par: Geirhos, Robert, et autres
Publié: (2023)
How Aligned are Different Alignment Metrics?
par: Ahlert, Jannis, et autres
Publié: (2024)
par: Ahlert, Jannis, et autres
Publié: (2024)
Decoupling Semantic Similarity from Spatial Alignment for Neural Networks
par: Wald, Tassilo, et autres
Publié: (2024)
par: Wald, Tassilo, et autres
Publié: (2024)
AI-Generated Video Detection via Perceptual Straightening
par: Internò, Christian, et autres
Publié: (2025)
par: Internò, Christian, et autres
Publié: (2025)
Vision Transformer attention alignment with human visual perception in aesthetic object evaluation
par: Carrasco, Miguel, et autres
Publié: (2025)
par: Carrasco, Miguel, et autres
Publié: (2025)
High-Fidelity Image Compression with Score-based Generative Models
par: Hoogeboom, Emiel, et autres
Publié: (2023)
par: Hoogeboom, Emiel, et autres
Publié: (2023)
Can We Talk Models Into Seeing the World Differently?
par: Gavrikov, Paul, et autres
Publié: (2024)
par: Gavrikov, Paul, et autres
Publié: (2024)
DANCE: Dynamic 3D CNN Pruning: Joint Frame, Channel, and Feature Adaptation for Energy Efficiency on the Edge
par: Mejri, Mohamed, et autres
Publié: (2026)
par: Mejri, Mohamed, et autres
Publié: (2026)
Better Rigs, Not Bigger Networks: A Body Model Ablation for Gaussian Avatars
par: Austin, Derek
Publié: (2026)
par: Austin, Derek
Publié: (2026)
K-U-KAN: Koopman-Enhanced U-KAN for 3D Dental Reconstruction from a Single Panoramic X-ray Radiograph
par: Parida, Bikram Keshari, et autres
Publié: (2026)
par: Parida, Bikram Keshari, et autres
Publié: (2026)
LAION-C: An Out-of-Distribution Benchmark for Web-Scale Vision Models
par: Li, Fanfei, et autres
Publié: (2025)
par: Li, Fanfei, et autres
Publié: (2025)
Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!
par: Chung, Jiwan, et autres
Publié: (2024)
par: Chung, Jiwan, et autres
Publié: (2024)
Colors See Colors Ignore: Clothes Changing ReID with Color Disentanglement
par: Pathak, Priyank, et autres
Publié: (2025)
par: Pathak, Priyank, et autres
Publié: (2025)
Coarse Attribute Prediction with Task Agnostic Distillation for Real World Clothes Changing ReID
par: Pathak, Priyank, et autres
Publié: (2025)
par: Pathak, Priyank, et autres
Publié: (2025)
M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
ArtFace: Towards Historical Portrait Face Identification via Model Adaptation
par: Poh, Francois, et autres
Publié: (2025)
par: Poh, Francois, et autres
Publié: (2025)
Audio-visual Event Localization on Portrait Mode Short Videos
par: Liu, Wuyang, et autres
Publié: (2025)
par: Liu, Wuyang, et autres
Publié: (2025)
Adversarial Robustness of Vision in Open Foundation Models
par: Fox, Jonathon, et autres
Publié: (2025)
par: Fox, Jonathon, et autres
Publié: (2025)
Towards LLM-Powered Ambient Sensor Based Multi-Person Human Activity Recognition
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Vision-Language Models display a strong gender bias
par: Konavoor, Aiswarya, et autres
Publié: (2025)
par: Konavoor, Aiswarya, et autres
Publié: (2025)
Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space
par: Chandra, Aashish, et autres
Publié: (2026)
par: Chandra, Aashish, et autres
Publié: (2026)
From Pixels to Predicates Structuring urban perception with scene graphs
par: Liu, Yunlong, et autres
Publié: (2025)
par: Liu, Yunlong, et autres
Publié: (2025)
Semantic Smoothing via Novel View Synthesis for Robust SAR Image Classification
par: Brignac, Daniel, et autres
Publié: (2026)
par: Brignac, Daniel, et autres
Publié: (2026)
From Redaction to Restoration: Deep Learning for Medical Image Anonymization and Reconstruction
par: Kline, Adrienne, et autres
Publié: (2026)
par: Kline, Adrienne, et autres
Publié: (2026)
An archaeological Catalog Collection Method Based on Large Vision-Language Models
par: Pang, Honglin, et autres
Publié: (2024)
par: Pang, Honglin, et autres
Publié: (2024)
Artemis: Towards Referential Understanding in Complex Videos
par: Qiu, Jihao, et autres
Publié: (2024)
par: Qiu, Jihao, et autres
Publié: (2024)
AnyPattern: Towards In-context Image Copy Detection
par: Wang, Wenhao, et autres
Publié: (2024)
par: Wang, Wenhao, et autres
Publié: (2024)
CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation
par: Sharma, Sonali, et autres
Publié: (2026)
par: Sharma, Sonali, et autres
Publié: (2026)
Towards Cross-Scale Attention and Surface Supervision for Fractured Bone Segmentation in CT
par: Zhou, Yu, et autres
Publié: (2024)
par: Zhou, Yu, et autres
Publié: (2024)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
par: Wang, Changpeng, et autres
Publié: (2026)
par: Wang, Changpeng, et autres
Publié: (2026)
Internalized Reasoning for Long-Context Visual Document Understanding
par: Veselka, Austin
Publié: (2026)
par: Veselka, Austin
Publié: (2026)
How to Train Your Long-Context Visual Document Model
par: Veselka, Austin
Publié: (2026)
par: Veselka, Austin
Publié: (2026)
Content Bias in Deep Learning Image Age Approximation: A new Approach Towards better Explainability
par: Jöchl, Robert, et autres
Publié: (2023)
par: Jöchl, Robert, et autres
Publié: (2023)
Implicit Visual Bias Mitigation by Posterior Estimate Sharpening of a Bayesian Neural Network
par: Stone, Rebecca S, et autres
Publié: (2023)
par: Stone, Rebecca S, et autres
Publié: (2023)
Quantifying the human visual exposome with vision language models
par: Rominger, Christian, et autres
Publié: (2026)
par: Rominger, Christian, et autres
Publié: (2026)
Hybrid guided variational autoencoder for visual place recognition
par: Wang, Ni, et autres
Publié: (2026)
par: Wang, Ni, et autres
Publié: (2026)
Documents similaires
-
Learning Visual Composition through Improved Semantic Guidance
par: Stone, Austin, et autres
Publié: (2024) -
Intriguing properties of generative classifiers
par: Jaini, Priyank, et autres
Publié: (2023) -
Do generative video models understand physical principles?
par: Motamed, Saman, et autres
Publié: (2025) -
Video models are zero-shot learners and reasoners
par: Wiedemer, Thaddäus, et autres
Publié: (2025) -
Don't trust your eyes: on the (un)reliability of feature visualizations
par: Geirhos, Robert, et autres
Publié: (2023)