Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Xiwen, Zhu, Wenhui, Qiu, Peijie, Wang, Hao, Li, Huayu, Wu, Haiyu, Sotiras, Aristeidis, Wang, Yalin, Razi, Abolfazl |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
by: Zhu, Wenhui, et al.
Published: (2024)
by: Zhu, Wenhui, et al.
Published: (2024)
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
by: Zhu, Wenhui, et al.
Published: (2024)
by: Zhu, Wenhui, et al.
Published: (2024)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
How Effective Can Dropout Be in Multiple Instance Learning ?
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance Learning
by: Chen, Xiwen, et al.
Published: (2024)
by: Chen, Xiwen, et al.
Published: (2024)
Sequence Complementor: Complementing Transformers For Time Series Forecasting with Learnable Sequences
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
Multimodal Variational Autoencoder: a Barycentric View
by: Qiu, Peijie, et al.
Published: (2024)
by: Qiu, Peijie, et al.
Published: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
FIC-TSC: Learning Time Series Classification with Fisher Information Constraint
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
by: Chen, Yanxi, et al.
Published: (2025)
by: Chen, Yanxi, et al.
Published: (2025)
OT-DETECTOR: Delving into Optimal Transport for Zero-shot Out-of-Distribution Detection
by: Liu, Yu, et al.
Published: (2025)
by: Liu, Yu, et al.
Published: (2025)
SC-MIL: Sparsely Coded Multiple Instance Learning for Whole Slide Image Classification
by: Qiu, Peijie, et al.
Published: (2023)
by: Qiu, Peijie, et al.
Published: (2023)
Imaging Signal Recovery Using Neural Network Priors Under Uncertain Forward Model Parameters
by: Chen, Xiwen, et al.
Published: (2024)
by: Chen, Xiwen, et al.
Published: (2024)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
by: Chen, Xiwen, et al.
Published: (2026)
by: Chen, Xiwen, et al.
Published: (2026)
PDL: Regularizing Multiple Instance Learning with Progressive Dropout Layers
by: Zhu, Wenhui, et al.
Published: (2023)
by: Zhu, Wenhui, et al.
Published: (2023)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
Shorter Is Different: Characterizing the Dynamics of Short-Form Video Platforms
by: Chen, Zhilong, et al.
Published: (2024)
by: Chen, Zhilong, et al.
Published: (2024)
Fine-grained Image Retrieval via Dual-Vision Adaptation
by: Jiang, Xin, et al.
Published: (2025)
by: Jiang, Xin, et al.
Published: (2025)
Regularizing Subspace Redundancy of Low-Rank Adaptation
by: Zhu, Yue, et al.
Published: (2025)
by: Zhu, Yue, et al.
Published: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
by: Zhao, Shuai, et al.
Published: (2023)
by: Zhao, Shuai, et al.
Published: (2023)
Serial Low-rank Adaptation of Vision Transformer
by: Zhong, Houqiang, et al.
Published: (2025)
by: Zhong, Houqiang, et al.
Published: (2025)
Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignment
by: Zhang, Tong, et al.
Published: (2025)
by: Zhang, Tong, et al.
Published: (2025)
Coordinated 2D-3D Visualization of Volumetric Medical Data in XR with Multimodal Interactions
by: Liu, Qixuan, et al.
Published: (2025)
by: Liu, Qixuan, et al.
Published: (2025)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
by: Mao, Junzhu, et al.
Published: (2025)
by: Mao, Junzhu, et al.
Published: (2025)
RBAD: A Dataset and Benchmark for Retinal Vessels Branching Angle Detection
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
EntroAD: Structural Entropy-Guided Prompt Adaptation for Zero-Shot Anomaly Detection
by: Zhao, Xinyu, et al.
Published: (2026)
by: Zhao, Xinyu, et al.
Published: (2026)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
by: Wang, Yabing, et al.
Published: (2023)
by: Wang, Yabing, et al.
Published: (2023)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
by: Gao, Jiayi, et al.
Published: (2025)
by: Gao, Jiayi, et al.
Published: (2025)
A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis
by: Wang, Jiahe, et al.
Published: (2026)
by: Wang, Jiahe, et al.
Published: (2026)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
by: Zhong, Yaoyao, et al.
Published: (2023)
by: Zhong, Yaoyao, et al.
Published: (2023)
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
by: Lu, Jialang, et al.
Published: (2025)
by: Lu, Jialang, et al.
Published: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
by: Zhang, Bo, et al.
Published: (2024)
by: Zhang, Bo, et al.
Published: (2024)
See or Guess: Counterfactually Regularized Image Captioning
by: Cao, Qian, et al.
Published: (2024)
by: Cao, Qian, et al.
Published: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
by: Zhu, Xingyu, et al.
Published: (2024)
by: Zhu, Xingyu, et al.
Published: (2024)
SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm
by: Jin, Jiandong, et al.
Published: (2023)
by: Jin, Jiandong, et al.
Published: (2023)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
by: Zhang, Pingping, et al.
Published: (2024)
by: Zhang, Pingping, et al.
Published: (2024)
Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding
by: Wu, Zichen, et al.
Published: (2024)
by: Wu, Zichen, et al.
Published: (2024)
Promisedland: An XR Narrative Attraction Integrating Diorama-to-Virtual Workflow and Elemental Storytelling
by: Wang, Xianghan, et al.
Published: (2025)
by: Wang, Xianghan, et al.
Published: (2025)
Similar Items
-
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
by: Zhu, Wenhui, et al.
Published: (2024) -
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
by: Zhu, Wenhui, et al.
Published: (2024) -
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
by: Chen, Xiwen, et al.
Published: (2025) -
How Effective Can Dropout Be in Multiple Instance Learning ?
by: Zhu, Wenhui, et al.
Published: (2025) -
TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance Learning
by: Chen, Xiwen, et al.
Published: (2024)