Foundation Visual Encoders Are Secretly Few-Shot Anomaly Detectors
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhai, Guangyao, Zhou, Yue, Deng, Xinyan, Heckler, Lars, Navab, Nassir, Busam, Benjamin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion
por: Zhai, Guangyao, et al.
Publicado: (2024)
por: Zhai, Guangyao, et al.
Publicado: (2024)
Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis
por: Chen, Tingxuan, et al.
Publicado: (2025)
por: Chen, Tingxuan, et al.
Publicado: (2025)
PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks
por: Elskhawy, Abdelrahman, et al.
Publicado: (2025)
por: Elskhawy, Abdelrahman, et al.
Publicado: (2025)
UltraAD: Fine-Grained Ultrasound Anomaly Classification via Few-Shot CLIP Adaptation
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
From Linear Probing to Joint-Weighted Token Hierarchy: A Foundation Model Bridging Global and Cellular Representations in Biomarker Detection
por: Liu, Jingsong, et al.
Publicado: (2025)
por: Liu, Jingsong, et al.
Publicado: (2025)
MS-CLR: Multi-Skeleton Contrastive Learning for Human Action Recognition
por: Kiray, Mert, et al.
Publicado: (2025)
por: Kiray, Mert, et al.
Publicado: (2025)
Few-Shot Anomaly-Driven Generation for Anomaly Classification and Segmentation
por: Gui, Guan, et al.
Publicado: (2025)
por: Gui, Guan, et al.
Publicado: (2025)
CommonScenes: Generating Commonsense 3D Indoor Scenes with Scene Graph Diffusion
por: Zhai, Guangyao, et al.
Publicado: (2023)
por: Zhai, Guangyao, et al.
Publicado: (2023)
DeepAf: One-Shot Spatiospectral Auto-Focus Model for Digital Pathology
por: Yeganeh, Yousef, et al.
Publicado: (2025)
por: Yeganeh, Yousef, et al.
Publicado: (2025)
PromptVFX: Text-Driven Fields for Open-World 3D Gaussian Animation
por: Kiray, Mert, et al.
Publicado: (2025)
por: Kiray, Mert, et al.
Publicado: (2025)
Decoupling Template Bias in CLIP: Harnessing Empty Prompts for Enhanced Few-Shot Learning
por: Zhang, Zhenyu, et al.
Publicado: (2025)
por: Zhang, Zhenyu, et al.
Publicado: (2025)
SG-Bot: Object Rearrangement via Coarse-to-Fine Robotic Imagination on Scene Graphs
por: Zhai, Guangyao, et al.
Publicado: (2023)
por: Zhai, Guangyao, et al.
Publicado: (2023)
VideoPrism: A Foundational Visual Encoder for Video Understanding
por: Zhao, Long, et al.
Publicado: (2024)
por: Zhao, Long, et al.
Publicado: (2024)
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition
por: Yuan, Kun, et al.
Publicado: (2024)
por: Yuan, Kun, et al.
Publicado: (2024)
CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition
por: Stilz, Florian, et al.
Publicado: (2026)
por: Stilz, Florian, et al.
Publicado: (2026)
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
por: Yuan, Kun, et al.
Publicado: (2024)
por: Yuan, Kun, et al.
Publicado: (2024)
Patch-wise Auto-Encoder for Visual Anomaly Detection
por: Cui, Yajie, et al.
Publicado: (2023)
por: Cui, Yajie, et al.
Publicado: (2023)
AnomalySD: Few-Shot Multi-Class Anomaly Detection with Stable Diffusion Model
por: Yan, Zhenyu, et al.
Publicado: (2024)
por: Yan, Zhenyu, et al.
Publicado: (2024)
EfficientAD: Accurate Visual Anomaly Detection at Millisecond-Level Latencies
por: Batzner, Kilian, et al.
Publicado: (2023)
por: Batzner, Kilian, et al.
Publicado: (2023)
SecondPose: SE(3)-Consistent Dual-Stream Feature Fusion for Category-Level Pose Estimation
por: Chen, Yamei, et al.
Publicado: (2023)
por: Chen, Yamei, et al.
Publicado: (2023)
Shape Completion and Real-Time Visualization in Robotic Ultrasound Spine Acquisitions
por: Gafencu, Miruna-Alexandra, et al.
Publicado: (2025)
por: Gafencu, Miruna-Alexandra, et al.
Publicado: (2025)
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
Object Pose Transformer: Unifying Unseen Object Pose Estimation
por: Li, Weihang, et al.
Publicado: (2026)
por: Li, Weihang, et al.
Publicado: (2026)
ProtoFlow: Interpretable and Robust Surgical Workflow Modeling with Learned Dynamic Scene Graph Prototypes
por: Holm, Felix, et al.
Publicado: (2025)
por: Holm, Felix, et al.
Publicado: (2025)
Speckle2Self: Self-Supervised Ultrasound Speckle Reduction Without Clean Data
por: Li, Xuesong, et al.
Publicado: (2025)
por: Li, Xuesong, et al.
Publicado: (2025)
SANGRIA: Surgical Video Scene Graph Optimization for Surgical Workflow Prediction
por: Köksal, Çağhan, et al.
Publicado: (2024)
por: Köksal, Çağhan, et al.
Publicado: (2024)
Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming
por: Zhou, Yue, et al.
Publicado: (2026)
por: Zhou, Yue, et al.
Publicado: (2026)
Adapter Naturally Serves as Decoupler for Cross-Domain Few-Shot Semantic Segmentation
por: Tong, Jintao, et al.
Publicado: (2025)
por: Tong, Jintao, et al.
Publicado: (2025)
CAT-SG: A Large Dynamic Scene Graph Dataset for Fine-Grained Understanding of Cataract Surgery
por: Holm, Felix, et al.
Publicado: (2025)
por: Holm, Felix, et al.
Publicado: (2025)
MeLIAD: Interpretable Few-Shot Anomaly Detection with Metric Learning and Entropy-based Scoring
por: Cholopoulou, Eirini, et al.
Publicado: (2024)
por: Cholopoulou, Eirini, et al.
Publicado: (2024)
Robotic Ultrasound Makes CBCT Alive
por: Li, Feng, et al.
Publicado: (2026)
por: Li, Feng, et al.
Publicado: (2026)
Compositional Few-Shot Class-Incremental Learning
por: Zou, Yixiong, et al.
Publicado: (2024)
por: Zou, Yixiong, et al.
Publicado: (2024)
RaDialog: A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance
por: Pellegrini, Chantal, et al.
Publicado: (2023)
por: Pellegrini, Chantal, et al.
Publicado: (2023)
Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection
por: Lee, Yujin, et al.
Publicado: (2024)
por: Lee, Yujin, et al.
Publicado: (2024)
Transductive Zero-Shot and Few-Shot CLIP
por: Martin, Ségolène, et al.
Publicado: (2024)
por: Martin, Ségolène, et al.
Publicado: (2024)
Visual Language Models as Zero-Shot Deepfake Detectors
por: Pirogov, Viacheslav
Publicado: (2025)
por: Pirogov, Viacheslav
Publicado: (2025)
Measuring Prediction Uncertainty in Neural Cellular Automata
por: Sadafi, Ario, et al.
Publicado: (2026)
por: Sadafi, Ario, et al.
Publicado: (2026)
MAGIC: Few-Shot Mask-Guided Anomaly Inpainting with Prompt Perturbation, Spatially Adaptive Guidance, and Context Awareness
por: Choi, JaeHyuck, et al.
Publicado: (2025)
por: Choi, JaeHyuck, et al.
Publicado: (2025)
Advancing Surgical VQA with Scene Graph Knowledge
por: Yuan, Kun, et al.
Publicado: (2023)
por: Yuan, Kun, et al.
Publicado: (2023)
Unlocking Tuning-Free Few-Shot Adaptability in Visual Foundation Models by Recycling Pre-Tuned LoRAs
por: Hu, Zixuan, et al.
Publicado: (2024)
por: Hu, Zixuan, et al.
Publicado: (2024)
Ejemplares similares
-
EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion
por: Zhai, Guangyao, et al.
Publicado: (2024) -
Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis
por: Chen, Tingxuan, et al.
Publicado: (2025) -
PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks
por: Elskhawy, Abdelrahman, et al.
Publicado: (2025) -
UltraAD: Fine-Grained Ultrasound Anomaly Classification via Few-Shot CLIP Adaptation
por: Zhou, Yue, et al.
Publicado: (2025) -
From Linear Probing to Joint-Weighted Token Hierarchy: A Foundation Model Bridging Global and Cellular Representations in Biomarker Detection
por: Liu, Jingsong, et al.
Publicado: (2025)