Enregistré dans:
| Auteurs principaux: | Suharitdamrong, Wish, Alex, Tony, Awais, Muhammad, Ahmed, Sara |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.03314 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025)
par: Alex, Tony, et autres
Publié: (2025)
Domain Adaptation Without the Compute Burden for Efficient Whole Slide Image Analysis
par: Marikkar, Umar, et autres
Publié: (2026)
par: Marikkar, Umar, et autres
Publié: (2026)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
par: Wu, Jialin, et autres
Publié: (2023)
par: Wu, Jialin, et autres
Publié: (2023)
Expressive and Generalizable Low-rank Adaptation for Large Models via Slow Cascaded Learning
par: Li, Siwei, et autres
Publié: (2024)
par: Li, Siwei, et autres
Publié: (2024)
CoLA: Collaborative Low-Rank Adaptation
par: Zhou, Yiyun, et autres
Publié: (2025)
par: Zhou, Yiyun, et autres
Publié: (2025)
CoLA: Conditional Dropout and Language-driven Robust Dual-modal Salient Object Detection
par: Hao, Shuang, et autres
Publié: (2024)
par: Hao, Shuang, et autres
Publié: (2024)
DeLoRA: Decoupling Angles and Strength in Low-rank Adaptation
par: Bini, Massimo, et autres
Publié: (2025)
par: Bini, Massimo, et autres
Publié: (2025)
Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence
par: Yang, Yibo, et autres
Publié: (2025)
par: Yang, Yibo, et autres
Publié: (2025)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
par: Zhang, Yanghai, et autres
Publié: (2024)
par: Zhang, Yanghai, et autres
Publié: (2024)
Low-Rank Adaptation with Task-Relevant Feature Enhancement for Fine-tuning Language Models
par: Li, Changqun, et autres
Publié: (2024)
par: Li, Changqun, et autres
Publié: (2024)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
par: Ebrahimi, Sayna, et autres
Publié: (2024)
par: Ebrahimi, Sayna, et autres
Publié: (2024)
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024)
par: Luo, Grace, et autres
Publié: (2024)
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
par: Asgarov, Ali, et autres
Publié: (2024)
par: Asgarov, Ali, et autres
Publié: (2024)
Shared and Private Information Learning in Multimodal Sentiment Analysis with Deep Modal Alignment and Self-supervised Multi-Task Learning
par: Lai, Songning, et autres
Publié: (2023)
par: Lai, Songning, et autres
Publié: (2023)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
par: Fan, Yingqi, et autres
Publié: (2025)
par: Fan, Yingqi, et autres
Publié: (2025)
CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning
par: Mandalika, Sriram
Publié: (2026)
par: Mandalika, Sriram
Publié: (2026)
Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data
par: Zhang, Yuhui, et autres
Publié: (2024)
par: Zhang, Yuhui, et autres
Publié: (2024)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
par: Zhu, Zhihao, et autres
Publié: (2026)
par: Zhu, Zhihao, et autres
Publié: (2026)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
MoExtend: Tuning New Experts for Modality and Task Extension
par: Zhong, Shanshan, et autres
Publié: (2024)
par: Zhong, Shanshan, et autres
Publié: (2024)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
par: Wang, Yanan, et autres
Publié: (2025)
par: Wang, Yanan, et autres
Publié: (2025)
One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion
par: Cheng, Chunyang, et autres
Publié: (2025)
par: Cheng, Chunyang, et autres
Publié: (2025)
Efficient Stitchable Task Adaptation
par: He, Haoyu, et autres
Publié: (2023)
par: He, Haoyu, et autres
Publié: (2023)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
par: Wang, Yabing, et autres
Publié: (2024)
par: Wang, Yabing, et autres
Publié: (2024)
MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding
par: Zhong, Ziqi, et autres
Publié: (2025)
par: Zhong, Ziqi, et autres
Publié: (2025)
Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space
par: Verma, Gaurav, et autres
Publié: (2024)
par: Verma, Gaurav, et autres
Publié: (2024)
DoRA: Weight-Decomposed Low-Rank Adaptation
par: Liu, Shih-Yang, et autres
Publié: (2024)
par: Liu, Shih-Yang, et autres
Publié: (2024)
TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptation
par: Miao, Daiye, et autres
Publié: (2025)
par: Miao, Daiye, et autres
Publié: (2025)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
par: Cahyawijaya, Samuel, et autres
Publié: (2026)
par: Cahyawijaya, Samuel, et autres
Publié: (2026)
Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media
par: Nguyen, Thi Huyen, et autres
Publié: (2026)
par: Nguyen, Thi Huyen, et autres
Publié: (2026)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Cross-Modal Retrieval for Motion and Text via DropTriple Loss
par: Yan, Sheng, et autres
Publié: (2023)
par: Yan, Sheng, et autres
Publié: (2023)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory
par: Uebayashi, Shunki, et autres
Publié: (2026)
par: Uebayashi, Shunki, et autres
Publié: (2026)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
par: Gigant, Théo, et autres
Publié: (2025)
par: Gigant, Théo, et autres
Publié: (2025)
Co-AttenDWG: Co-Attentive Dimension-Wise Gating and Expert Fusion for Multi-Modal Offensive Content Detection
par: Hossain, Md. Mithun, et autres
Publié: (2025)
par: Hossain, Md. Mithun, et autres
Publié: (2025)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
par: Wu, Te-Lin, et autres
Publié: (2021)
par: Wu, Te-Lin, et autres
Publié: (2021)
Documents similaires
-
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025) -
Domain Adaptation Without the Compute Burden for Efficient Whole Slide Image Analysis
par: Marikkar, Umar, et autres
Publié: (2026) -
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
par: Wu, Jialin, et autres
Publié: (2023) -
Expressive and Generalizable Low-rank Adaptation for Large Models via Slow Cascaded Learning
par: Li, Siwei, et autres
Publié: (2024) -
CoLA: Collaborative Low-Rank Adaptation
par: Zhou, Yiyun, et autres
Publié: (2025)