AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Liao, Jingyi, Su, Yongyi, Tu, Rong-Cheng, Jin, Zhao, Sun, Wenhao, Li, Yiting, Tao, Dacheng, Xu, Xun, Yang, Xulei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Robust Distribution Alignment for Industrial Anomaly Detection under Distribution Shift
by: Liao, Jingyi, et al.
Published: (2025)
by: Liao, Jingyi, et al.
Published: (2025)
Diffusion Model-Based Video Editing: A Survey
by: Sun, Wenhao, et al.
Published: (2024)
by: Sun, Wenhao, et al.
Published: (2024)
COFT-AD: COntrastive Fine-Tuning for Few-Shot Anomaly Detection
by: Liao, Jingyi, et al.
Published: (2024)
by: Liao, Jingyi, et al.
Published: (2024)
AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration
by: Sun, Wenhao, et al.
Published: (2024)
by: Sun, Wenhao, et al.
Published: (2024)
Multi-View Industrial Anomaly Detection with Epipolar Constrained Cross-View Fusion
by: Liu, Yifan, et al.
Published: (2025)
by: Liu, Yifan, et al.
Published: (2025)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
by: Jin, Zhao, et al.
Published: (2025)
by: Jin, Zhao, et al.
Published: (2025)
SODA: Out-of-Distribution Detection in Domain-Shifted Point Clouds via Neighborhood Propagation
by: Goodge, Adam, et al.
Published: (2025)
by: Goodge, Adam, et al.
Published: (2025)
SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing
by: Tu, Rong-Cheng, et al.
Published: (2024)
by: Tu, Rong-Cheng, et al.
Published: (2024)
MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval
by: Tu, Rong-Cheng, et al.
Published: (2025)
by: Tu, Rong-Cheng, et al.
Published: (2025)
VORTA: Efficient Video Diffusion via Routing Sparse Attention
by: Sun, Wenhao, et al.
Published: (2025)
by: Sun, Wenhao, et al.
Published: (2025)
SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models
by: Sun, Wenhao, et al.
Published: (2026)
by: Sun, Wenhao, et al.
Published: (2026)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
by: Tu, Rong-Cheng, et al.
Published: (2025)
by: Tu, Rong-Cheng, et al.
Published: (2025)
Skeleton2Stage: Reward-Guided Fine-Tuning for Physically Plausible Dance Generation
by: Jia, Jidong, et al.
Published: (2026)
by: Jia, Jidong, et al.
Published: (2026)
Exploring Human-in-the-Loop Test-Time Adaptation by Synergizing Active Learning and Model Selection
by: Li, Yushu, et al.
Published: (2024)
by: Li, Yushu, et al.
Published: (2024)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
by: Jin, Weiyang, et al.
Published: (2025)
by: Jin, Weiyang, et al.
Published: (2025)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
by: Zhao, Shifang, et al.
Published: (2025)
by: Zhao, Shifang, et al.
Published: (2025)
ToCoAD: Two-Stage Contrastive Learning for Industrial Anomaly Detection
by: Liang, Yun, et al.
Published: (2024)
by: Liang, Yun, et al.
Published: (2024)
Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
by: Miao, Yuchun, et al.
Published: (2025)
by: Miao, Yuchun, et al.
Published: (2025)
Confidence as a Reward: Transforming LLMs into Reward Models
by: Du, He, et al.
Published: (2025)
by: Du, He, et al.
Published: (2025)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
by: Wang, Yeyuan, et al.
Published: (2025)
by: Wang, Yeyuan, et al.
Published: (2025)
AD-DINOv3: Enhancing DINOv3 for Zero-Shot Anomaly Detection with Anomaly-Aware Calibration
by: Yuan, Jingyi, et al.
Published: (2025)
by: Yuan, Jingyi, et al.
Published: (2025)
Intra-Trajectory Consistency for Reward Modeling
by: Zhou, Chaoyang, et al.
Published: (2025)
by: Zhou, Chaoyang, et al.
Published: (2025)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
by: Long, Jianzhi, et al.
Published: (2025)
by: Long, Jianzhi, et al.
Published: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
by: Zhang, Jingyi, et al.
Published: (2025)
by: Zhang, Jingyi, et al.
Published: (2025)
Learning Feature Inversion for Multi-class Anomaly Detection under General-purpose COCO-AD Benchmark
by: Zhang, Jiangning, et al.
Published: (2024)
by: Zhang, Jiangning, et al.
Published: (2024)
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
by: Weng, Tengjin, et al.
Published: (2026)
by: Weng, Tengjin, et al.
Published: (2026)
On the Adversarial Risk of Test Time Adaptation: An Investigation into Realistic Test-Time Data Poisoning
by: Su, Yongyi, et al.
Published: (2024)
by: Su, Yongyi, et al.
Published: (2024)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
by: Batra, Hunar, et al.
Published: (2025)
by: Batra, Hunar, et al.
Published: (2025)
MCL-AD: Multimodal Collaboration Learning for Zero-Shot 3D Anomaly Detection
by: Li, Gang, et al.
Published: (2025)
by: Li, Gang, et al.
Published: (2025)
Towards Real-World Test-Time Adaptation: Tri-Net Self-Training with Balanced Normalization
by: Su, Yongyi, et al.
Published: (2023)
by: Su, Yongyi, et al.
Published: (2023)
UltraAD: Fine-Grained Ultrasound Anomaly Classification via Few-Shot CLIP Adaptation
by: Zhou, Yue, et al.
Published: (2025)
by: Zhou, Yue, et al.
Published: (2025)
TeZO: Empowering the Low-Rankness on the Temporal Dimension in the Zeroth-Order Optimization for Fine-tuning LLMs
by: Sun, Yan, et al.
Published: (2025)
by: Sun, Yan, et al.
Published: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
by: Miao, Yuchun, et al.
Published: (2024)
by: Miao, Yuchun, et al.
Published: (2024)
AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection
by: Zhang, Junru, et al.
Published: (2026)
by: Zhang, Junru, et al.
Published: (2026)
Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward
by: An, Hao, et al.
Published: (2025)
by: An, Hao, et al.
Published: (2025)
Boosting Fine-Grained Visual Anomaly Detection with Coarse-Knowledge-Aware Adversarial Learning
by: Fang, Qingqing, et al.
Published: (2024)
by: Fang, Qingqing, et al.
Published: (2024)
Fine-Grained Zero-Shot Learning: Advances, Challenges, and Prospects
by: Guo, Jingcai, et al.
Published: (2024)
by: Guo, Jingcai, et al.
Published: (2024)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
by: Jin, Jing, et al.
Published: (2026)
by: Jin, Jing, et al.
Published: (2026)
Dissolving Is Amplifying: Towards Fine-Grained Anomaly Detection
by: Shi, Jian, et al.
Published: (2023)
by: Shi, Jian, et al.
Published: (2023)
Similar Items
-
Robust Distribution Alignment for Industrial Anomaly Detection under Distribution Shift
by: Liao, Jingyi, et al.
Published: (2025) -
Diffusion Model-Based Video Editing: A Survey
by: Sun, Wenhao, et al.
Published: (2024) -
COFT-AD: COntrastive Fine-Tuning for Few-Shot Anomaly Detection
by: Liao, Jingyi, et al.
Published: (2024) -
AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration
by: Sun, Wenhao, et al.
Published: (2024) -
Multi-View Industrial Anomaly Detection with Epipolar Constrained Cross-View Fusion
by: Liu, Yifan, et al.
Published: (2025)