LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Ci-Siang, Chen, Min-Hung, Sheng, Yu-Yang, Wang, Yu-Chiang Frank |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024)
par: Lin, Ci-Siang, et autres
Publié: (2024)
Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024)
par: Lin, Ci-Siang, et autres
Publié: (2024)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025)
par: Lin, Ci-Siang, et autres
Publié: (2025)
Data-Efficient 3D Visual Grounding via Order-Aware Referring
par: Wu, Tung-Yu, et autres
Publié: (2024)
par: Wu, Tung-Yu, et autres
Publié: (2024)
Continual Personalization for Diffusion Models
par: Liao, Yu-Chien, et autres
Publié: (2025)
par: Liao, Yu-Chien, et autres
Publié: (2025)
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
par: Chiu, Hsu-kuang, et autres
Publié: (2025)
par: Chiu, Hsu-kuang, et autres
Publié: (2025)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
par: Zhang, Xingxuan, et autres
Publié: (2024)
par: Zhang, Xingxuan, et autres
Publié: (2024)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
par: Chi, Tien-Yu, et autres
Publié: (2025)
par: Chi, Tien-Yu, et autres
Publié: (2025)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
par: Huang, Chi-Pin, et autres
Publié: (2025)
par: Huang, Chi-Pin, et autres
Publié: (2025)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
par: Liu, Shih-Wen, et autres
Publié: (2025)
par: Liu, Shih-Wen, et autres
Publié: (2025)
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
par: Neuhaus, Yannic, et autres
Publié: (2026)
par: Neuhaus, Yannic, et autres
Publié: (2026)
Improving Visual Storytelling with Multimodal Large Language Models
par: Lin, Xiaochuan, et autres
Publié: (2024)
par: Lin, Xiaochuan, et autres
Publié: (2024)
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
par: Xu, Haoran, et autres
Publié: (2026)
par: Xu, Haoran, et autres
Publié: (2026)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
par: Deng, Huilin, et autres
Publié: (2024)
par: Deng, Huilin, et autres
Publié: (2024)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
par: Sun, Yiming, et autres
Publié: (2024)
par: Sun, Yiming, et autres
Publié: (2024)
VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models
par: Cheng, Ying, et autres
Publié: (2025)
par: Cheng, Ying, et autres
Publié: (2025)
OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models
par: Lin, Ling, et autres
Publié: (2026)
par: Lin, Ling, et autres
Publié: (2026)
Out-of-Distribution Detection with Positive and Negative Prompt Supervision Using Large Language Models
par: He, Zhixia, et autres
Publié: (2025)
par: He, Zhixia, et autres
Publié: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
par: Yan, Ziang, et autres
Publié: (2024)
par: Yan, Ziang, et autres
Publié: (2024)
Introducing Visual Perception Token into Multimodal Large Language Model
par: Yu, Runpeng, et autres
Publié: (2025)
par: Yu, Runpeng, et autres
Publié: (2025)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
par: Huang, Chi-Pin, et autres
Publié: (2025)
par: Huang, Chi-Pin, et autres
Publié: (2025)
Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks
par: Wang, Lehan, et autres
Publié: (2024)
par: Wang, Lehan, et autres
Publié: (2024)
DoRA: Weight-Decomposed Low-Rank Adaptation
par: Liu, Shih-Yang, et autres
Publié: (2024)
par: Liu, Shih-Yang, et autres
Publié: (2024)
Task-Adapter: Task-specific Adaptation of Image Models for Few-shot Action Recognition
par: Cao, Congqi, et autres
Publié: (2024)
par: Cao, Congqi, et autres
Publié: (2024)
Window Token Concatenation for Efficient Visual Large Language Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding
par: Wu, Chang-Hsun, et autres
Publié: (2025)
par: Wu, Chang-Hsun, et autres
Publié: (2025)
Adaptive Label Smoothing for Out-of-Distribution Detection
par: Xu, Mingle, et autres
Publié: (2024)
par: Xu, Mingle, et autres
Publié: (2024)
Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection
par: Lee, Pei-Kang, et autres
Publié: (2025)
par: Lee, Pei-Kang, et autres
Publié: (2025)
Heavy Labels Out! Dataset Distillation with Label Space Lightening
par: Yu, Ruonan, et autres
Publié: (2024)
par: Yu, Ruonan, et autres
Publié: (2024)
MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching
par: Wu, Yen-Siang, et autres
Publié: (2025)
par: Wu, Yen-Siang, et autres
Publié: (2025)
Safety of Multimodal Large Language Models on Images and Texts
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
Ranked from Within: Ranking Large Multimodal Models Without Labels
par: Tu, Weijie, et autres
Publié: (2024)
par: Tu, Weijie, et autres
Publié: (2024)
InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
par: Wang, Haomin, et autres
Publié: (2025)
par: Wang, Haomin, et autres
Publié: (2025)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
par: Zhang, Jiaxin, et autres
Publié: (2024)
par: Zhang, Jiaxin, et autres
Publié: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
par: Huang, Chi-Pin, et autres
Publié: (2026)
par: Huang, Chi-Pin, et autres
Publié: (2026)
Documents similaires
-
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024) -
Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024) -
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2025) -
Data-Efficient 3D Visual Grounding via Order-Aware Referring
par: Wu, Tung-Yu, et autres
Publié: (2024) -
Continual Personalization for Diffusion Models
par: Liao, Yu-Chien, et autres
Publié: (2025)