Segment and Caption Anything
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Xiaoke, Wang, Jianfeng, Tang, Yansong, Zhang, Zheng, Hu, Han, Lu, Jiwen, Wang, Lijuan, Liu, Zicheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
di: Zhu, Deyi, et al.
Pubblicazione: (2026)
di: Zhu, Deyi, et al.
Pubblicazione: (2026)
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
di: Bai, Sule, et al.
Pubblicazione: (2024)
di: Bai, Sule, et al.
Pubblicazione: (2024)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
di: Lin, Weifeng, et al.
Pubblicazione: (2025)
di: Lin, Weifeng, et al.
Pubblicazione: (2025)
SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
Learning to Prompt Segment Anything Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation
di: Lu, Guanxing, et al.
Pubblicazione: (2024)
di: Lu, Guanxing, et al.
Pubblicazione: (2024)
Towards Accurate Post-training Quantization for Diffusion Models
di: Wang, Changyuan, et al.
Pubblicazione: (2023)
di: Wang, Changyuan, et al.
Pubblicazione: (2023)
Q-VLM: Post-training Quantization for Large Vision-Language Models
di: Wang, Changyuan, et al.
Pubblicazione: (2024)
di: Wang, Changyuan, et al.
Pubblicazione: (2024)
PolSAM: Polarimetric Scattering Mechanism Informed Segment Anything Model
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
Bring Metric Functions into Diffusion Models
di: An, Jie, et al.
Pubblicazione: (2024)
di: An, Jie, et al.
Pubblicazione: (2024)
MergeSAM: Unsupervised change detection of remote sensing images based on the Segment Anything Model
di: Hu, Meiqi, et al.
Pubblicazione: (2025)
di: Hu, Meiqi, et al.
Pubblicazione: (2025)
Register Anything: Estimating "Corresponding Prompts" for Segment Anything Model
di: Huang, Shiqi, et al.
Pubblicazione: (2025)
di: Huang, Shiqi, et al.
Pubblicazione: (2025)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
di: Dong, Jiajun, et al.
Pubblicazione: (2025)
di: Dong, Jiajun, et al.
Pubblicazione: (2025)
GoodSAM++: Bridging Domain and Capacity Gaps via Segment Anything Model for Panoramic Semantic Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
VoCo-LLaMA: Towards Vision Compression with Large Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
Pseudo Depth Meets Gaussian: A Feed-forward RGB SLAM Baseline
di: Zhao, Linqing, et al.
Pubblicazione: (2025)
di: Zhao, Linqing, et al.
Pubblicazione: (2025)
TinySAM: Pushing the Envelope for Efficient Segment Anything Model
di: Shu, Han, et al.
Pubblicazione: (2023)
di: Shu, Han, et al.
Pubblicazione: (2023)
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
di: Zhang, Shiyi, et al.
Pubblicazione: (2024)
di: Zhang, Shiyi, et al.
Pubblicazione: (2024)
Narrative Action Evaluation with Prompt-Guided Multimodal Interaction
di: Zhang, Shiyi, et al.
Pubblicazione: (2024)
di: Zhang, Shiyi, et al.
Pubblicazione: (2024)
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
di: Yao, Jingfeng, et al.
Pubblicazione: (2023)
di: Yao, Jingfeng, et al.
Pubblicazione: (2023)
GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation
di: Zhang, Chubin, et al.
Pubblicazione: (2024)
di: Zhang, Chubin, et al.
Pubblicazione: (2024)
GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
SAM Meets UAP: Attacking Segment Anything Model With Universal Adversarial Perturbation
di: Han, Dongshen, et al.
Pubblicazione: (2023)
di: Han, Dongshen, et al.
Pubblicazione: (2023)
I-MedSAM: Implicit Medical Image Segmentation with Segment Anything
di: Wei, Xiaobao, et al.
Pubblicazione: (2023)
di: Wei, Xiaobao, et al.
Pubblicazione: (2023)
Continual Learning for Segment Anything Model Adaptation
di: Yang, Jinglong, et al.
Pubblicazione: (2024)
di: Yang, Jinglong, et al.
Pubblicazione: (2024)
Causal Prompt Calibration Guided Segment Anything Model for Open-Vocabulary Multi-Entity Segmentation
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
di: Wang, Jingyao, et al.
Pubblicazione: (2025)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
Universal Segmentation at Arbitrary Granularity with Language Instruction
di: Liu, Yong, et al.
Pubblicazione: (2023)
di: Liu, Yong, et al.
Pubblicazione: (2023)
SANeRF-HQ: Segment Anything for NeRF in High Quality
di: Liu, Yichen, et al.
Pubblicazione: (2023)
di: Liu, Yichen, et al.
Pubblicazione: (2023)
RemoteSAM: Towards Segment Anything for Earth Observation
di: Yao, Liang, et al.
Pubblicazione: (2025)
di: Yao, Liang, et al.
Pubblicazione: (2025)
Fully Aligned Network for Referring Image Segmentation
di: Liu, Yong, et al.
Pubblicazione: (2024)
di: Liu, Yong, et al.
Pubblicazione: (2024)
Matching Anything by Segmenting Anything
di: Li, Siyuan, et al.
Pubblicazione: (2024)
di: Li, Siyuan, et al.
Pubblicazione: (2024)
FlowIE: Efficient Image Enhancement via Rectified Flow
di: Zhu, Yixuan, et al.
Pubblicazione: (2024)
di: Zhu, Yixuan, et al.
Pubblicazione: (2024)
DPMesh: Exploiting Diffusion Prior for Occluded Human Mesh Recovery
di: Zhu, Yixuan, et al.
Pubblicazione: (2024)
di: Zhu, Yixuan, et al.
Pubblicazione: (2024)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Open-Vocabulary Segmentation with Semantic-Assisted Calibration
di: Liu, Yong, et al.
Pubblicazione: (2023)
di: Liu, Yong, et al.
Pubblicazione: (2023)
OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic Segmentation
di: Zhong, Ding, et al.
Pubblicazione: (2025)
di: Zhong, Ding, et al.
Pubblicazione: (2025)
CaptionQA: Is Your Caption as Useful as the Image Itself?
di: Yang, Shijia, et al.
Pubblicazione: (2025)
di: Yang, Shijia, et al.
Pubblicazione: (2025)
Segment Anything with Multiple Modalities
di: Xiao, Aoran, et al.
Pubblicazione: (2024)
di: Xiao, Aoran, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
di: Zhu, Deyi, et al.
Pubblicazione: (2026) -
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
di: Bai, Sule, et al.
Pubblicazione: (2024) -
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
di: Lin, Weifeng, et al.
Pubblicazione: (2025) -
SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes
di: Wang, Yuji, et al.
Pubblicazione: (2025) -
Learning to Prompt Segment Anything Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)