Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAM
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Pingping, Yan, Tianyu, Liu, Yang, Lu, Huchuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MAS-SAM: Segment Any Marine Animal with Aggregated Features
por: Yan, Tianyu, et al.
Publicado: (2024)
por: Yan, Tianyu, et al.
Publicado: (2024)
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
por: Gao, Shixuan, et al.
Publicado: (2024)
por: Gao, Shixuan, et al.
Publicado: (2024)
HFP-SAM: Hierarchical Frequency Prompted SAM for Efficient Marine Animal Segmentation
por: Zhang, Pingping, et al.
Publicado: (2026)
por: Zhang, Pingping, et al.
Publicado: (2026)
MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt
por: Wang, Yuhao, et al.
Publicado: (2024)
por: Wang, Yuhao, et al.
Publicado: (2024)
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
por: Wang, Yingquan, et al.
Publicado: (2024)
por: Wang, Yingquan, et al.
Publicado: (2024)
IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
por: Yang, Danni, et al.
Publicado: (2024)
por: Yang, Danni, et al.
Publicado: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
por: Zhu, Yixin, et al.
Publicado: (2026)
por: Zhu, Yixin, et al.
Publicado: (2026)
Towards Open-Vocabulary Remote Sensing Image Semantic Segmentation
por: Ye, Chengyang, et al.
Publicado: (2024)
por: Ye, Chengyang, et al.
Publicado: (2024)
TurboVSR: Fantastic Video Upscalers and Where to Find Them
por: Wang, Zhongdao, et al.
Publicado: (2025)
por: Wang, Zhongdao, et al.
Publicado: (2025)
Fantastic Biases (What are They) and Where to Find Them
por: Barriere, Valentin
Publicado: (2024)
por: Barriere, Valentin
Publicado: (2024)
Tracking and Segmenting Anything in Any Modality
por: Zhang, Tianlu, et al.
Publicado: (2025)
por: Zhang, Tianlu, et al.
Publicado: (2025)
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification
por: Liu, Yangyang, et al.
Publicado: (2025)
por: Liu, Yangyang, et al.
Publicado: (2025)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
por: Ding, Yiming, et al.
Publicado: (2026)
por: Ding, Yiming, et al.
Publicado: (2026)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
por: Diao, Haiwen, et al.
Publicado: (2023)
por: Diao, Haiwen, et al.
Publicado: (2023)
KAN-SAM: Kolmogorov-Arnold Network Guided Segment Anything Model for RGB-T Salient Object Detection
por: Li, Xingyuan, et al.
Publicado: (2025)
por: Li, Xingyuan, et al.
Publicado: (2025)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
Unveiling Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
SAFIRE: Segment Any Forged Image Region
por: Kwon, Myung-Joon, et al.
Publicado: (2024)
por: Kwon, Myung-Joon, et al.
Publicado: (2024)
Test-time adaptation for image compression with distribution regularization
por: Chen, Kecheng, et al.
Publicado: (2024)
por: Chen, Kecheng, et al.
Publicado: (2024)
Fantastic Gains and Where to Find Them: On the Existence and Prospect of General Knowledge Transfer between Any Pretrained Model
por: Roth, Karsten, et al.
Publicado: (2023)
por: Roth, Karsten, et al.
Publicado: (2023)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction
por: Li, Po-han, et al.
Publicado: (2024)
por: Li, Po-han, et al.
Publicado: (2024)
Calibration & Reconstruction: Deep Integrated Language for Referring Image Segmentation
por: Yan, Yichen, et al.
Publicado: (2024)
por: Yan, Yichen, et al.
Publicado: (2024)
MTFusion: Reconstructing Any 3D Object from Single Image Using Multi-word Textual Inversion
por: Liu, Yu, et al.
Publicado: (2024)
por: Liu, Yu, et al.
Publicado: (2024)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
por: Lu, Zhenyu, et al.
Publicado: (2025)
por: Lu, Zhenyu, et al.
Publicado: (2025)
Gorgeous: Create Your Desired Character Facial Makeup from Any Ideas
por: Sii, Jia Wei, et al.
Publicado: (2024)
por: Sii, Jia Wei, et al.
Publicado: (2024)
Fantastic Targets for Concept Erasure in Diffusion Models and Where To Find Them
por: Bui, Anh, et al.
Publicado: (2025)
por: Bui, Anh, et al.
Publicado: (2025)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
por: Ku, Max, et al.
Publicado: (2024)
por: Ku, Max, et al.
Publicado: (2024)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
por: Wang, Shaoguang, et al.
Publicado: (2026)
por: Wang, Shaoguang, et al.
Publicado: (2026)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
Find the Cliffhanger: Multi-Modal Trailerness in Soap Operas
por: Bretti, Carlo, et al.
Publicado: (2024)
por: Bretti, Carlo, et al.
Publicado: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
Hypergraph Tversky-Aware Domain Incremental Learning for Brain Tumor Segmentation with Missing Modalities
por: Wang, Junze, et al.
Publicado: (2025)
por: Wang, Junze, et al.
Publicado: (2025)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
por: Song, Shezheng, et al.
Publicado: (2026)
por: Song, Shezheng, et al.
Publicado: (2026)
Ejemplares similares
-
MAS-SAM: Segment Any Marine Animal with Aggregated Features
por: Yan, Tianyu, et al.
Publicado: (2024) -
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
por: Gao, Shixuan, et al.
Publicado: (2024) -
HFP-SAM: Hierarchical Frequency Prompted SAM for Efficient Marine Animal Segmentation
por: Zhang, Pingping, et al.
Publicado: (2026) -
MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt
por: Wang, Yuhao, et al.
Publicado: (2024) -
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
por: Wang, Yingquan, et al.
Publicado: (2024)