SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zeng, Chengxi, Jiang, Yuxuan, Gao, Ge, Wang, Shuai, Danier, Duolikun, Zhu, Bin, Rudinac, Stevan, Bull, David, Zhang, Fan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EfficientSAM3: Progressive Hierarchical Distillation for Video Concept Segmentation from SAM1, 2, and 3
von: Zeng, Chengxi, et al.
Veröffentlicht: (2025)
von: Zeng, Chengxi, et al.
Veröffentlicht: (2025)
Enhancing Deformable Convolution based Video Frame Interpolation with Coarse-to-fine 3D CNN
von: Danier, Duolikun, et al.
Veröffentlicht: (2022)
von: Danier, Duolikun, et al.
Veröffentlicht: (2022)
BVI-VFI: A Video Quality Database for Video Frame Interpolation
von: Danier, Duolikun, et al.
Veröffentlicht: (2022)
von: Danier, Duolikun, et al.
Veröffentlicht: (2022)
ST-MFNet: A Spatio-Temporal Multi-Flow Network for Frame Interpolation
von: Danier, Duolikun, et al.
Veröffentlicht: (2021)
von: Danier, Duolikun, et al.
Veröffentlicht: (2021)
LDMVFI: Video Frame Interpolation with Latent Diffusion Models
von: Danier, Duolikun, et al.
Veröffentlicht: (2023)
von: Danier, Duolikun, et al.
Veröffentlicht: (2023)
A Subjective Quality Study for Video Frame Interpolation
von: Danier, Duolikun, et al.
Veröffentlicht: (2022)
von: Danier, Duolikun, et al.
Veröffentlicht: (2022)
RankDVQA: Deep VQA based on Ranking-inspired Hybrid Training
von: Feng, Chen, et al.
Veröffentlicht: (2022)
von: Feng, Chen, et al.
Veröffentlicht: (2022)
GFix: Perceptually Enhanced Gaussian Splatting Video Compression
von: Teng, Siyue, et al.
Veröffentlicht: (2025)
von: Teng, Siyue, et al.
Veröffentlicht: (2025)
Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
von: Zeng, Chengxi, et al.
Veröffentlicht: (2025)
von: Zeng, Chengxi, et al.
Veröffentlicht: (2025)
EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model
von: Zhang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Zhang, Yuxuan, et al.
Veröffentlicht: (2024)
MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors
von: Du, Zhipeng, et al.
Veröffentlicht: (2025)
von: Du, Zhipeng, et al.
Veröffentlicht: (2025)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
von: Huang, Jia-Hong, et al.
Veröffentlicht: (2024)
von: Huang, Jia-Hong, et al.
Veröffentlicht: (2024)
TextSAM-EUS: Text Prompt Learning for SAM to Accurately Segment Pancreatic Tumor in Endoscopic Ultrasound
von: Spiegler, Pascal, et al.
Veröffentlicht: (2025)
von: Spiegler, Pascal, et al.
Veröffentlicht: (2025)
SAM-PTx: Text-Guided Fine-Tuning of SAM with Parameter-Efficient, Parallel-Text Adapters
von: Jalilian, Shayan, et al.
Veröffentlicht: (2025)
von: Jalilian, Shayan, et al.
Veröffentlicht: (2025)
MVAD: A Multiple Visual Artifact Detector for Video Streaming
von: Feng, Chen, et al.
Veröffentlicht: (2024)
von: Feng, Chen, et al.
Veröffentlicht: (2024)
BVI-Artefact: An Artefact Detection Benchmark Dataset for Streamed Videos
von: Feng, Chen, et al.
Veröffentlicht: (2023)
von: Feng, Chen, et al.
Veröffentlicht: (2023)
Lite-SAM Is Actually What You Need for Segment Everything
von: Fu, Jianhai, et al.
Veröffentlicht: (2024)
von: Fu, Jianhai, et al.
Veröffentlicht: (2024)
Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
von: Zhou, Yun, et al.
Veröffentlicht: (2025)
von: Zhou, Yun, et al.
Veröffentlicht: (2025)
SAM Fewshot Finetuning for Anatomical Segmentation in Medical Images
von: Xie, Weiyi, et al.
Veröffentlicht: (2024)
von: Xie, Weiyi, et al.
Veröffentlicht: (2024)
CS3: Cascade SAM for Sperm Segmentation
von: Shi, Yi, et al.
Veröffentlicht: (2024)
von: Shi, Yi, et al.
Veröffentlicht: (2024)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
von: Ye, Maoyuan, et al.
Veröffentlicht: (2024)
von: Ye, Maoyuan, et al.
Veröffentlicht: (2024)
RefSAM3D: Adapting SAM with Cross-modal Reference for 3D Medical Image Segmentation
von: Gao, Xiang, et al.
Veröffentlicht: (2024)
von: Gao, Xiang, et al.
Veröffentlicht: (2024)
SAM & SAM 2 in 3D Slicer: SegmentWithSAM Extension for Annotating Medical Images
von: Yildiz, Zafer, et al.
Veröffentlicht: (2024)
von: Yildiz, Zafer, et al.
Veröffentlicht: (2024)
3DTeethSAM: Taming SAM2 for 3D Teeth Segmentation
von: Lu, Zhiguo, et al.
Veröffentlicht: (2025)
von: Lu, Zhiguo, et al.
Veröffentlicht: (2025)
RMT-BVQA: Recurrent Memory Transformer-based Blind Video Quality Assessment for Enhanced Video Content
von: Peng, Tianhao, et al.
Veröffentlicht: (2024)
von: Peng, Tianhao, et al.
Veröffentlicht: (2024)
Full-reference Video Quality Assessment for User Generated Content Transcoding
von: Qi, Zihao, et al.
Veröffentlicht: (2023)
von: Qi, Zihao, et al.
Veröffentlicht: (2023)
Enhancing HDR Video Compression through CNN-based Effective Bit Depth Adaptation
von: Feng, Chen, et al.
Veröffentlicht: (2022)
von: Feng, Chen, et al.
Veröffentlicht: (2022)
RankDVQA-mini: Knowledge Distillation-Driven Deep Video Quality Assessment
von: Feng, Chen, et al.
Veröffentlicht: (2023)
von: Feng, Chen, et al.
Veröffentlicht: (2023)
View-Consistent Diffusion Representations for 3D-Consistent Video Generation
von: Danier, Duolikun, et al.
Veröffentlicht: (2025)
von: Danier, Duolikun, et al.
Veröffentlicht: (2025)
AutoProSAM: Automated Prompting SAM for 3D Multi-Organ Segmentation
von: Li, Chengyin, et al.
Veröffentlicht: (2023)
von: Li, Chengyin, et al.
Veröffentlicht: (2023)
TP-DRSeg: Improving Diabetic Retinopathy Lesion Segmentation with Explicit Text-Prompts Assisted SAM
von: Li, Wenxue, et al.
Veröffentlicht: (2024)
von: Li, Wenxue, et al.
Veröffentlicht: (2024)
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
von: Zhang, Xike, et al.
Veröffentlicht: (2026)
von: Zhang, Xike, et al.
Veröffentlicht: (2026)
A Novel Evaluation Framework for Image2Text Generation
von: Huang, Jia-Hong, et al.
Veröffentlicht: (2024)
von: Huang, Jia-Hong, et al.
Veröffentlicht: (2024)
Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation
von: Zhang, Weiming, et al.
Veröffentlicht: (2026)
von: Zhang, Weiming, et al.
Veröffentlicht: (2026)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
von: Zhu, Hongyi, et al.
Veröffentlicht: (2024)
von: Zhu, Hongyi, et al.
Veröffentlicht: (2024)
SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation
von: Cuttano, Claudia, et al.
Veröffentlicht: (2024)
von: Cuttano, Claudia, et al.
Veröffentlicht: (2024)
SAM 3: Segment Anything with Concepts
von: Carion, Nicolas, et al.
Veröffentlicht: (2025)
von: Carion, Nicolas, et al.
Veröffentlicht: (2025)
PG-SAM: Prior-Guided SAM with Medical for Multi-organ Segmentation
von: Zhong, Yiheng, et al.
Veröffentlicht: (2025)
von: Zhong, Yiheng, et al.
Veröffentlicht: (2025)
SAM3-DMS: Decoupled Memory Selection for Multi-target Video Segmentation of SAM3
von: Shen, Ruiqi, et al.
Veröffentlicht: (2026)
von: Shen, Ruiqi, et al.
Veröffentlicht: (2026)
Comparing SAM 2 and SAM 3 for Zero-Shot Segmentation of 3D Medical Data
von: Chakrabarty, Satrajit, et al.
Veröffentlicht: (2025)
von: Chakrabarty, Satrajit, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
EfficientSAM3: Progressive Hierarchical Distillation for Video Concept Segmentation from SAM1, 2, and 3
von: Zeng, Chengxi, et al.
Veröffentlicht: (2025) -
Enhancing Deformable Convolution based Video Frame Interpolation with Coarse-to-fine 3D CNN
von: Danier, Duolikun, et al.
Veröffentlicht: (2022) -
BVI-VFI: A Video Quality Database for Video Frame Interpolation
von: Danier, Duolikun, et al.
Veröffentlicht: (2022) -
ST-MFNet: A Spatio-Temporal Multi-Flow Network for Frame Interpolation
von: Danier, Duolikun, et al.
Veröffentlicht: (2021) -
LDMVFI: Video Frame Interpolation with Latent Diffusion Models
von: Danier, Duolikun, et al.
Veröffentlicht: (2023)