Image Segmentation in Foundation Model Era: A Survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Tianfei, Xia, Wang, Zhang, Fei, Chang, Boyu, Wang, Wenguan, Yuan, Ye, Konukoglu, Ender, Cremers, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Vision Foundation Models Enhance Domain Generalization in Medical Image Segmentation?
par: Cekmeceli, Kerem, et autres
Publié: (2024)
par: Cekmeceli, Kerem, et autres
Publié: (2024)
Semi-Supervised Few-Shot Adaptation of Vision-Language Models
par: Silva-Rodríguez, Julio, et autres
Publié: (2026)
par: Silva-Rodríguez, Julio, et autres
Publié: (2026)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
par: Liang, Chen, et autres
Publié: (2022)
par: Liang, Chen, et autres
Publié: (2022)
Trustworthy Endoscopic Super-Resolution
par: Silva-Rodríguez, Julio, et autres
Publié: (2026)
par: Silva-Rodríguez, Julio, et autres
Publié: (2026)
Nonverbal Interaction Detection
par: Wei, Jianan, et autres
Publié: (2024)
par: Wei, Jianan, et autres
Publié: (2024)
Anomaly Detection by Clustering DINO Embeddings using a Dirichlet Process Mixture
par: Schulthess, Nico, et autres
Publié: (2025)
par: Schulthess, Nico, et autres
Publié: (2025)
Rethinking Cross-modal Interaction from a Top-down Perspective for Referring Video Object Segmentation
par: Liang, Chen, et autres
Publié: (2021)
par: Liang, Chen, et autres
Publié: (2021)
VoxCor: Training-Free Volumetric Features for Multimodal Voxel Correspondence
par: Tombak, Guney, et autres
Publié: (2026)
par: Tombak, Guney, et autres
Publié: (2026)
A Single-Parameter Factor-Graph Image Prior
par: Wang, Tianyang, et autres
Publié: (2026)
par: Wang, Tianyang, et autres
Publié: (2026)
Spatial Autoregressive Modeling of DINOv3 Embeddings for Unsupervised Anomaly Detection
par: Erdil, Ertunc, et autres
Publié: (2026)
par: Erdil, Ertunc, et autres
Publié: (2026)
Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model
par: An, Zhaochong, et autres
Publié: (2025)
par: An, Zhaochong, et autres
Publié: (2025)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
par: Chang, Boyu, et autres
Publié: (2026)
par: Chang, Boyu, et autres
Publié: (2026)
Implicit-Zoo: A Large-Scale Dataset of Neural Implicit Functions for 2D Images and 3D Scenes
par: Ma, Qi, et autres
Publié: (2024)
par: Ma, Qi, et autres
Publié: (2024)
MedVSR: Medical Video Super-Resolution with Cross State-Space Propagation
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
CamSAM2: Segment Anything Accurately in Camouflaged Videos
par: Zhou, Yuli, et autres
Publié: (2025)
par: Zhou, Yuli, et autres
Publié: (2025)
Clustering Propagation for Universal Medical Image Segmentation
par: Ding, Yuhang, et autres
Publié: (2024)
par: Ding, Yuhang, et autres
Publié: (2024)
Learning to segment anatomy and lesions from disparately labeled sources in brain MRI
par: Himmetoglu, Meva, et autres
Publié: (2025)
par: Himmetoglu, Meva, et autres
Publié: (2025)
A Survey of World Models for Autonomous Driving
par: Feng, Tuo, et autres
Publié: (2025)
par: Feng, Tuo, et autres
Publié: (2025)
When SAM2 Meets Video Camouflaged Object Segmentation: A Comprehensive Evaluation and Adaptation
par: Zhou, Yuli, et autres
Publié: (2024)
par: Zhou, Yuli, et autres
Publié: (2024)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Visual Knowledge in the Big Model Era: Retrospect and Prospect
par: Wang, Wenguan, et autres
Publié: (2024)
par: Wang, Wenguan, et autres
Publié: (2024)
Diffusion-Based Semantic Segmentation of Lumbar Spine MRI Scans of Lower Back Pain Patients
par: Monzon, Maria, et autres
Publié: (2024)
par: Monzon, Maria, et autres
Publié: (2024)
Generalizable Single-Source Cross-modality Medical Image Segmentation via Invariant Causal Mechanisms
par: Chen, Boqi, et autres
Publié: (2024)
par: Chen, Boqi, et autres
Publié: (2024)
LFMamba: Light Field Image Super-Resolution with State Space Model
par: xia, Wang, et autres
Publié: (2024)
par: xia, Wang, et autres
Publié: (2024)
Multimodality Helps Few-shot 3D Point Cloud Semantic Segmentation
par: An, Zhaochong, et autres
Publié: (2024)
par: An, Zhaochong, et autres
Publié: (2024)
SemiSAM+: Rethinking Semi-Supervised Medical Image Segmentation in the Era of Foundation Models
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
A Survey on Data Augmentation in Large Model Era
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Towards Data-and Knowledge-Driven Artificial Intelligence: A Survey on Neuro-Symbolic Computing
par: Wang, Wenguan, et autres
Publié: (2022)
par: Wang, Wenguan, et autres
Publié: (2022)
Foundation Models for Biomedical Image Segmentation: A Survey
par: Lee, Ho Hin, et autres
Publié: (2024)
par: Lee, Ho Hin, et autres
Publié: (2024)
SatSynth: Augmenting Image-Mask Pairs through Diffusion Models for Aerial Semantic Segmentation
par: Toker, Aysim, et autres
Publié: (2024)
par: Toker, Aysim, et autres
Publié: (2024)
TRASE: Tracking-free 4D Segmentation and Editing
par: Li, Yun-Jin, et autres
Publié: (2024)
par: Li, Yun-Jin, et autres
Publié: (2024)
Image-to-Image Matching via Foundation Models: A New Perspective for Open-Vocabulary Semantic Segmentation
par: Wang, Yuan, et autres
Publié: (2024)
par: Wang, Yuan, et autres
Publié: (2024)
A Survey on 3D Gaussian Splatting
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models
par: Hu, Yixuan, et autres
Publié: (2025)
par: Hu, Yixuan, et autres
Publié: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
SparseAlign: A Fully Sparse Framework for Cooperative Object Detection
par: Yuan, Yunshuang, et autres
Publié: (2025)
par: Yuan, Yunshuang, et autres
Publié: (2025)
MedSeqFT: Sequential Fine-tuning Foundation Models for 3D Medical Image Segmentation
par: Ye, Yiwen, et autres
Publié: (2025)
par: Ye, Yiwen, et autres
Publié: (2025)
Neural Clustering based Visual Representation Learning
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
par: Li, Liulei, et autres
Publié: (2024)
par: Li, Liulei, et autres
Publié: (2024)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
Documents similaires
-
Do Vision Foundation Models Enhance Domain Generalization in Medical Image Segmentation?
par: Cekmeceli, Kerem, et autres
Publié: (2024) -
Semi-Supervised Few-Shot Adaptation of Vision-Language Models
par: Silva-Rodríguez, Julio, et autres
Publié: (2026) -
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
par: Liang, Chen, et autres
Publié: (2022) -
Trustworthy Endoscopic Super-Resolution
par: Silva-Rodríguez, Julio, et autres
Publié: (2026) -
Nonverbal Interaction Detection
par: Wei, Jianan, et autres
Publié: (2024)