LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yan, Xinyu, Sun, Meijun, Ji, Ge-Peng, Khan, Fahad Shahbaz, Khan, Salman, Fan, Deng-Ping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mask Factory: Towards High-quality Synthetic Data Generation for Dichotomous Image Segmentation
por: Qian, Haotian, et al.
Publicado: (2024)
por: Qian, Haotian, et al.
Publicado: (2024)
Language Guided Domain Generalized Medical Image Segmentation
por: Kunhimon, Shahina, et al.
Publicado: (2024)
por: Kunhimon, Shahina, et al.
Publicado: (2024)
Effectiveness Assessment of Recent Large Vision-Language Models
por: Jiang, Yao, et al.
Publicado: (2024)
por: Jiang, Yao, et al.
Publicado: (2024)
Frontiers in Intelligent Colonoscopy
por: Ji, Ge-Peng, et al.
Publicado: (2024)
por: Ji, Ge-Peng, et al.
Publicado: (2024)
FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching
por: Sargsyan, Andranik, et al.
Publicado: (2026)
por: Sargsyan, Andranik, et al.
Publicado: (2026)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
por: Kunhimon, Shahina, et al.
Publicado: (2023)
por: Kunhimon, Shahina, et al.
Publicado: (2023)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
por: Dharmasiri, Amaya, et al.
Publicado: (2024)
por: Dharmasiri, Amaya, et al.
Publicado: (2024)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
por: Chen, Shiming, et al.
Publicado: (2025)
por: Chen, Shiming, et al.
Publicado: (2025)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
por: Maaz, Muhammad, et al.
Publicado: (2025)
por: Maaz, Muhammad, et al.
Publicado: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
por: Maaz, Muhammad, et al.
Publicado: (2023)
por: Maaz, Muhammad, et al.
Publicado: (2023)
Bilateral Reference for High-Resolution Dichotomous Image Segmentation
por: Zheng, Peng, et al.
Publicado: (2024)
por: Zheng, Peng, et al.
Publicado: (2024)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
por: Shaker, Abdelrahman, et al.
Publicado: (2022)
por: Shaker, Abdelrahman, et al.
Publicado: (2022)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
por: Khattak, Muhammad Uzair, et al.
Publicado: (2024)
por: Khattak, Muhammad Uzair, et al.
Publicado: (2024)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
por: Demidov, Dmitry, et al.
Publicado: (2025)
por: Demidov, Dmitry, et al.
Publicado: (2025)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
por: Chen, Shiming, et al.
Publicado: (2025)
por: Chen, Shiming, et al.
Publicado: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
por: Chen, Shiming, et al.
Publicado: (2024)
por: Chen, Shiming, et al.
Publicado: (2024)
Deep Learning in Concealed Dense Prediction
por: Zhao, Pancheng, et al.
Publicado: (2025)
por: Zhao, Pancheng, et al.
Publicado: (2025)
Enhancing Novel Object Detection via Cooperative Foundational Models
por: Bharadwaj, Rohit, et al.
Publicado: (2023)
por: Bharadwaj, Rohit, et al.
Publicado: (2023)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
por: Mahmood, Ahmad, et al.
Publicado: (2024)
por: Mahmood, Ahmad, et al.
Publicado: (2024)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
por: Bharadwaj, Rohit, et al.
Publicado: (2024)
por: Bharadwaj, Rohit, et al.
Publicado: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
iSeg: An Iterative Refinement-based Framework for Training-free Segmentation
por: Sun, Lin, et al.
Publicado: (2024)
por: Sun, Lin, et al.
Publicado: (2024)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
por: Kumar, Komal, et al.
Publicado: (2025)
por: Kumar, Komal, et al.
Publicado: (2025)
Towards Evaluating the Robustness of Visual State Space Models
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
por: Li, Yuhao, et al.
Publicado: (2025)
por: Li, Yuhao, et al.
Publicado: (2025)
AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and Modulation
por: Cui, Yuning, et al.
Publicado: (2024)
por: Cui, Yuning, et al.
Publicado: (2024)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
por: Gani, Hanan, et al.
Publicado: (2024)
por: Gani, Hanan, et al.
Publicado: (2024)
Discriminative Image Generation with Diffusion Models for Zero-Shot Learning
por: Fu, Dingjie, et al.
Publicado: (2024)
por: Fu, Dingjie, et al.
Publicado: (2024)
GroupMamba: Efficient Group-Based Visual State Space Model
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
por: Shaker, Abdelrahman, et al.
Publicado: (2024)
RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion
por: Nguyen, Thao, et al.
Publicado: (2025)
por: Nguyen, Thao, et al.
Publicado: (2025)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
por: Malik, Hashmat Shadab, et al.
Publicado: (2025)
por: Malik, Hashmat Shadab, et al.
Publicado: (2025)
On Evaluating Adversarial Robustness of Volumetric Medical Segmentation Models
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
por: Dong, Jiahua, et al.
Publicado: (2025)
por: Dong, Jiahua, et al.
Publicado: (2025)
Dynamic Pre-training: Towards Efficient and Scalable All-in-One Image Restoration
por: Dudhane, Akshay, et al.
Publicado: (2024)
por: Dudhane, Akshay, et al.
Publicado: (2024)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
por: Maaz, Muhammad, et al.
Publicado: (2024)
por: Maaz, Muhammad, et al.
Publicado: (2024)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
por: Malik, Hashmat Shadab, et al.
Publicado: (2025)
por: Malik, Hashmat Shadab, et al.
Publicado: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
por: Deria, Ankan, et al.
Publicado: (2026)
por: Deria, Ankan, et al.
Publicado: (2026)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
Dual Hyperspectral Mamba for Efficient Spectral Compressive Imaging
por: Dong, Jiahua, et al.
Publicado: (2024)
por: Dong, Jiahua, et al.
Publicado: (2024)
Ejemplares similares
-
Mask Factory: Towards High-quality Synthetic Data Generation for Dichotomous Image Segmentation
por: Qian, Haotian, et al.
Publicado: (2024) -
Language Guided Domain Generalized Medical Image Segmentation
por: Kunhimon, Shahina, et al.
Publicado: (2024) -
Effectiveness Assessment of Recent Large Vision-Language Models
por: Jiang, Yao, et al.
Publicado: (2024) -
Frontiers in Intelligent Colonoscopy
por: Ji, Ge-Peng, et al.
Publicado: (2024) -
FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching
por: Sargsyan, Andranik, et al.
Publicado: (2026)