Promptable Anomaly Segmentation with SAM Through Self-Perception Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Hui-Yue, Chen, Hui, Wang, Ao, Chen, Kai, Lin, Zijia, Tang, Yongliang, Gao, Pengcheng, Quan, Yuming, Han, Jungong, Ding, Guiguang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RepViT-SAM: Towards Real-Time Segmenting Anything
par: Wang, Ao, et autres
Publié: (2023)
par: Wang, Ao, et autres
Publié: (2023)
LSNet: See Large, Focus Small
par: Wang, Ao, et autres
Publié: (2025)
par: Wang, Ao, et autres
Publié: (2025)
RepViT: Revisiting Mobile CNN From ViT Perspective
par: Wang, Ao, et autres
Publié: (2023)
par: Wang, Ao, et autres
Publié: (2023)
Context Enhancement with Reconstruction as Sequence for Unified Unsupervised Anomaly Detection
par: Yang, Hui-Yue, et autres
Publié: (2024)
par: Yang, Hui-Yue, et autres
Publié: (2024)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
par: Wang, Ao, et autres
Publié: (2023)
par: Wang, Ao, et autres
Publié: (2023)
[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
YOLOE: Real-Time Seeing Anything
par: Wang, Ao, et autres
Publié: (2025)
par: Wang, Ao, et autres
Publié: (2025)
YOLOv10: Real-Time End-to-End Object Detection
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual Persistence
par: Lyu, Mengyao, et autres
Publié: (2024)
par: Lyu, Mengyao, et autres
Publié: (2024)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
YOLO-UniOW: Efficient Universal Open-World Object Detection
par: Liu, Lihao, et autres
Publié: (2024)
par: Liu, Lihao, et autres
Publié: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
par: Hao, Tianxiang, et autres
Publié: (2023)
par: Hao, Tianxiang, et autres
Publié: (2023)
Tracking and Segmenting Anything in Any Modality
par: Zhang, Tianlu, et autres
Publié: (2025)
par: Zhang, Tianlu, et autres
Publié: (2025)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task Adaptation
par: Xiong, Yizhe, et autres
Publié: (2024)
par: Xiong, Yizhe, et autres
Publié: (2024)
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
par: Xiong, Yizhe, et autres
Publié: (2025)
par: Xiong, Yizhe, et autres
Publié: (2025)
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
par: Xiong, Yizhe, et autres
Publié: (2025)
par: Xiong, Yizhe, et autres
Publié: (2025)
Temporal-spatial Adaptation of Promptable SAM Enhance Accuracy and Generalizability of cine CMR Segmentation
par: Chen, Zhennong, et autres
Publié: (2024)
par: Chen, Zhennong, et autres
Publié: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
par: Lyu, Mengyao, et autres
Publié: (2025)
par: Lyu, Mengyao, et autres
Publié: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
par: Liang, Yiwen, et autres
Publié: (2025)
par: Liang, Yiwen, et autres
Publié: (2025)
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
par: Lian, Haoran, et autres
Publié: (2024)
par: Lian, Haoran, et autres
Publié: (2024)
Temporal Scaling Law for Large Language Models
par: Xiong, Yizhe, et autres
Publié: (2024)
par: Xiong, Yizhe, et autres
Publié: (2024)
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
One-Dimensional Adapter to Rule Them All: Concepts, Diffusion Models and Erasing Applications
par: Lyu, Mengyao, et autres
Publié: (2023)
par: Lyu, Mengyao, et autres
Publié: (2023)
ProMISe: Promptable Medical Image Segmentation using SAM
par: Wang, Jinfeng, et autres
Publié: (2024)
par: Wang, Jinfeng, et autres
Publié: (2024)
UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation
par: Liu, Haofeng, et autres
Publié: (2026)
par: Liu, Haofeng, et autres
Publié: (2026)
ClipSAM: CLIP and SAM Collaboration for Zero-Shot Anomaly Segmentation
par: Li, Shengze, et autres
Publié: (2024)
par: Li, Shengze, et autres
Publié: (2024)
MV-SAM: Multi-view Promptable Segmentation using Pointmap Guidance
par: Jeong, Yoonwoo, et autres
Publié: (2026)
par: Jeong, Yoonwoo, et autres
Publié: (2026)
Point-SAM: Promptable 3D Segmentation Model for Point Clouds
par: Zhou, Yuchen, et autres
Publié: (2024)
par: Zhou, Yuchen, et autres
Publié: (2024)
CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation
par: Jalilian, Shayan, et autres
Publié: (2026)
par: Jalilian, Shayan, et autres
Publié: (2026)
PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data
par: Zhu, Zhe, et autres
Publié: (2025)
par: Zhu, Zhe, et autres
Publié: (2025)
MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models
par: Su, Zhenpeng, et autres
Publié: (2023)
par: Su, Zhenpeng, et autres
Publié: (2023)
LBPE: Long-token-first Tokenization to Improve Large Language Models
par: Lian, Haoran, et autres
Publié: (2024)
par: Lian, Haoran, et autres
Publié: (2024)
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
par: Lv, Minxuan, et autres
Publié: (2025)
par: Lv, Minxuan, et autres
Publié: (2025)
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
par: Pan, Leiyu, et autres
Publié: (2025)
par: Pan, Leiyu, et autres
Publié: (2025)
SAM-Body4D: Training-Free 4D Human Body Mesh Recovery from Videos
par: Gao, Mingqi, et autres
Publié: (2025)
par: Gao, Mingqi, et autres
Publié: (2025)
Re-Prompting SAM 3 via Object Retrieval: 3rd of the 5th PVUW MOSE Track
par: Gao, Mingqi, et autres
Publié: (2026)
par: Gao, Mingqi, et autres
Publié: (2026)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
par: Guo, Ziyu, et autres
Publié: (2024)
par: Guo, Ziyu, et autres
Publié: (2024)
Documents similaires
-
RepViT-SAM: Towards Real-Time Segmenting Anything
par: Wang, Ao, et autres
Publié: (2023) -
LSNet: See Large, Focus Small
par: Wang, Ao, et autres
Publié: (2025) -
RepViT: Revisiting Mobile CNN From ViT Perspective
par: Wang, Ao, et autres
Publié: (2023) -
Context Enhancement with Reconstruction as Sequence for Unified Unsupervised Anomaly Detection
par: Yang, Hui-Yue, et autres
Publié: (2024) -
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
par: Wang, Ao, et autres
Publié: (2023)