Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yan, Siyuan, Luo, Cheng, Yu, Zhen, Ge, Zongyuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment
von: Yan, Siyuan, et al.
Veröffentlicht: (2025)
von: Yan, Siyuan, et al.
Veröffentlicht: (2025)
Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model
von: Sun, Jiajun, et al.
Veröffentlicht: (2025)
von: Sun, Jiajun, et al.
Veröffentlicht: (2025)
ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
von: Cheng, Luo, et al.
Veröffentlicht: (2025)
von: Cheng, Luo, et al.
Veröffentlicht: (2025)
Multi-Aspect Knowledge-Enhanced Medical Vision-Language Pretraining with Multi-Agent Data Generation
von: Li, Xieji, et al.
Veröffentlicht: (2025)
von: Li, Xieji, et al.
Veröffentlicht: (2025)
Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology
von: Yan, Siyuan, et al.
Veröffentlicht: (2025)
von: Yan, Siyuan, et al.
Veröffentlicht: (2025)
RoomPlanner: Explicit Layout Planner for Easier LLM-Driven 3D Room Generation
von: Sun, Wenzhuo, et al.
Veröffentlicht: (2025)
von: Sun, Wenzhuo, et al.
Veröffentlicht: (2025)
Enhancing Fundus Image-based Glaucoma Screening via Dynamic Global-Local Feature Integration
von: Zhou, Yuzhuo, et al.
Veröffentlicht: (2025)
von: Zhou, Yuzhuo, et al.
Veröffentlicht: (2025)
HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding
von: Xia, Peng, et al.
Veröffentlicht: (2023)
von: Xia, Peng, et al.
Veröffentlicht: (2023)
Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
von: Feng, Wei, et al.
Veröffentlicht: (2025)
von: Feng, Wei, et al.
Veröffentlicht: (2025)
Delving into Out-of-Distribution Detection with Medical Vision-Language Models
von: Ju, Lie, et al.
Veröffentlicht: (2025)
von: Ju, Lie, et al.
Veröffentlicht: (2025)
LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation
von: Li, Pengzhi, et al.
Veröffentlicht: (2025)
von: Li, Pengzhi, et al.
Veröffentlicht: (2025)
Diffusion Model Driven Test-Time Image Adaptation for Robust Skin Lesion Classification
von: Hu, Ming, et al.
Veröffentlicht: (2024)
von: Hu, Ming, et al.
Veröffentlicht: (2024)
SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces
von: Wu, Guande, et al.
Veröffentlicht: (2025)
von: Wu, Guande, et al.
Veröffentlicht: (2025)
WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification
von: Jiang, Yiwen, et al.
Veröffentlicht: (2025)
von: Jiang, Yiwen, et al.
Veröffentlicht: (2025)
Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition
von: Ilyas, Talha, et al.
Veröffentlicht: (2026)
von: Ilyas, Talha, et al.
Veröffentlicht: (2026)
AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models
von: Rao, Zhifeng, et al.
Veröffentlicht: (2026)
von: Rao, Zhifeng, et al.
Veröffentlicht: (2026)
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
von: Li, Jiangyang, et al.
Veröffentlicht: (2026)
von: Li, Jiangyang, et al.
Veröffentlicht: (2026)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
von: Chung, Sangyun, et al.
Veröffentlicht: (2024)
von: Chung, Sangyun, et al.
Veröffentlicht: (2024)
MOVIS: Enhancing Multi-Object Novel View Synthesis for Indoor Scenes
von: Lu, Ruijie, et al.
Veröffentlicht: (2024)
von: Lu, Ruijie, et al.
Veröffentlicht: (2024)
ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models
von: Li, Jiahao, et al.
Veröffentlicht: (2025)
von: Li, Jiahao, et al.
Veröffentlicht: (2025)
Disease-informed Adaptation of Vision-Language Models
von: Zhang, Jiajin, et al.
Veröffentlicht: (2024)
von: Zhang, Jiajin, et al.
Veröffentlicht: (2024)
ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections
von: Diko, Anxhelo, et al.
Veröffentlicht: (2024)
von: Diko, Anxhelo, et al.
Veröffentlicht: (2024)
GANeXt: A Fully ConvNeXt-Enhanced Generative Adversarial Network for MRI- and CBCT-to-CT Synthesis
von: Mei, Siyuan, et al.
Veröffentlicht: (2025)
von: Mei, Siyuan, et al.
Veröffentlicht: (2025)
Prompt-driven Latent Domain Generalization for Medical Image Classification
von: Yan, Siyuan, et al.
Veröffentlicht: (2024)
von: Yan, Siyuan, et al.
Veröffentlicht: (2024)
Enhancing Image Generation Fidelity via Progressive Prompts
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
von: Xiong, Zhen, et al.
Veröffentlicht: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making
von: Liu, Yize, et al.
Veröffentlicht: (2026)
von: Liu, Yize, et al.
Veröffentlicht: (2026)
ChatGarment: Garment Estimation, Generation and Editing via Large Language Models
von: Bian, Siyuan, et al.
Veröffentlicht: (2024)
von: Bian, Siyuan, et al.
Veröffentlicht: (2024)
Attention! Your Vision Language Model Could Be Maliciously Manipulated
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025)
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025)
ColonAdapter: Geometry Estimation Through Foundation Model Adaptation for Colonoscopy
von: Jiang, Zhiyi, et al.
Veröffentlicht: (2025)
von: Jiang, Zhiyi, et al.
Veröffentlicht: (2025)
Enhancing Transformer-Based Vision Models: Addressing Feature Map Anomalies Through Novel Optimization Strategies
von: Mamtani, Sumit
Veröffentlicht: (2025)
von: Mamtani, Sumit
Veröffentlicht: (2025)
Universal Semi-Supervised Learning for Medical Image Classification
von: Ju, Lie, et al.
Veröffentlicht: (2023)
von: Ju, Lie, et al.
Veröffentlicht: (2023)
Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
von: Pham, Chau, et al.
Veröffentlicht: (2024)
von: Pham, Chau, et al.
Veröffentlicht: (2024)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
von: Deng, Huilin, et al.
Veröffentlicht: (2025)
von: Deng, Huilin, et al.
Veröffentlicht: (2025)
Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques
von: Huang, Weijian, et al.
Veröffentlicht: (2024)
von: Huang, Weijian, et al.
Veröffentlicht: (2024)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
von: Zhan, Yu-Wei, et al.
Veröffentlicht: (2023)
von: Zhan, Yu-Wei, et al.
Veröffentlicht: (2023)
Diversity-Driven View Subset Selection for Indoor Novel View Synthesis
von: Wang, Zehao, et al.
Veröffentlicht: (2024)
von: Wang, Zehao, et al.
Veröffentlicht: (2024)
GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery
von: Solanki, Bhupendra, et al.
Veröffentlicht: (2024)
von: Solanki, Bhupendra, et al.
Veröffentlicht: (2024)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
von: Cheng, Cheng, et al.
Veröffentlicht: (2023)
von: Cheng, Cheng, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment
von: Yan, Siyuan, et al.
Veröffentlicht: (2025) -
Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model
von: Sun, Jiajun, et al.
Veröffentlicht: (2025) -
ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
von: Cheng, Luo, et al.
Veröffentlicht: (2025) -
Multi-Aspect Knowledge-Enhanced Medical Vision-Language Pretraining with Multi-Agent Data Generation
von: Li, Xieji, et al.
Veröffentlicht: (2025) -
Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology
von: Yan, Siyuan, et al.
Veröffentlicht: (2025)