Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Zirun, Jin, Tao, Chen, Jingyuan, Zhao, Zhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
di: Guo, Zirun, et al.
Pubblicazione: (2024)
di: Guo, Zirun, et al.
Pubblicazione: (2024)
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
LLM-I: LLMs are Naturally Interleaved Multimodal Creators
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
di: Hong, Minjie, et al.
Pubblicazione: (2025)
di: Hong, Minjie, et al.
Pubblicazione: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
di: Chen, Peiyuan, et al.
Pubblicazione: (2024)
di: Chen, Peiyuan, et al.
Pubblicazione: (2024)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
Efficient Prompting for Continual Adaptation to Missing Modalities
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning
di: Tang, Jun-Tao, et al.
Pubblicazione: (2026)
di: Tang, Jun-Tao, et al.
Pubblicazione: (2026)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
LLM as a Complementary Optimizer to Gradient Descent: A Case Study in Prompt Tuning
di: Guo, Zixian, et al.
Pubblicazione: (2024)
di: Guo, Zixian, et al.
Pubblicazione: (2024)
LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning
di: Kowsher, Md, et al.
Pubblicazione: (2026)
di: Kowsher, Md, et al.
Pubblicazione: (2026)
Controlling Multimodal LLMs via Reward-guided Decoding
di: Mañas, Oscar, et al.
Pubblicazione: (2025)
di: Mañas, Oscar, et al.
Pubblicazione: (2025)
Text Role Classification in Scientific Charts Using Multimodal Transformers
di: Kim, Hye Jin, et al.
Pubblicazione: (2024)
di: Kim, Hye Jin, et al.
Pubblicazione: (2024)
Hyperbolic Multimodal Representation Learning for Biological Taxonomies
di: Gong, ZeMing, et al.
Pubblicazione: (2025)
di: Gong, ZeMing, et al.
Pubblicazione: (2025)
The Double Dilemma in Multi-Task Radiology Report Generation: A Gradient Dynamics Analysis and Solution
di: Zhang, Erjian, et al.
Pubblicazione: (2026)
di: Zhang, Erjian, et al.
Pubblicazione: (2026)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
di: Joshi, Siddharth, et al.
Pubblicazione: (2025)
di: Joshi, Siddharth, et al.
Pubblicazione: (2025)
Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale
di: Zou, Yicheng, et al.
Pubblicazione: (2026)
di: Zou, Yicheng, et al.
Pubblicazione: (2026)
DreamLLM: Synergistic Multimodal Comprehension and Creation
di: Dong, Runpei, et al.
Pubblicazione: (2023)
di: Dong, Runpei, et al.
Pubblicazione: (2023)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
Intern-S1: A Scientific Multimodal Foundation Model
di: Bai, Lei, et al.
Pubblicazione: (2025)
di: Bai, Lei, et al.
Pubblicazione: (2025)
Improving Multimodal Large Language Models Using Continual Learning
di: Srivastava, Shikhar, et al.
Pubblicazione: (2024)
di: Srivastava, Shikhar, et al.
Pubblicazione: (2024)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
Efficient Domain Adaptation of Multimodal Embeddings using Constrastive Learning
di: Margaritis, Georgios, et al.
Pubblicazione: (2025)
di: Margaritis, Georgios, et al.
Pubblicazione: (2025)
CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image Collections
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2024)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2024)
BEEM: Boosting Performance of Early Exit DNNs using Multi-Exit Classifiers as Experts
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2025)
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
di: Arazi, Alan, et al.
Pubblicazione: (2026)
di: Arazi, Alan, et al.
Pubblicazione: (2026)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
di: Chen, Xiuwei, et al.
Pubblicazione: (2025)
di: Chen, Xiuwei, et al.
Pubblicazione: (2025)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
Lumos : Empowering Multimodal LLMs with Scene Text Recognition
di: Shenoy, Ashish, et al.
Pubblicazione: (2024)
di: Shenoy, Ashish, et al.
Pubblicazione: (2024)
Gradient descent with generalized Newton's method
di: Bu, Zhiqi, et al.
Pubblicazione: (2024)
di: Bu, Zhiqi, et al.
Pubblicazione: (2024)
Balancing Multimodal Domain Generalization via Gradient Modulation and Projection
di: Li, Hongzhao, et al.
Pubblicazione: (2026)
di: Li, Hongzhao, et al.
Pubblicazione: (2026)
MuJo: Multimodal Joint Feature Space Learning for Human Activity Recognition
di: Fritsch, Stefan Gerd, et al.
Pubblicazione: (2024)
di: Fritsch, Stefan Gerd, et al.
Pubblicazione: (2024)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
di: Chen, Shuang, et al.
Pubblicazione: (2025)
di: Chen, Shuang, et al.
Pubblicazione: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
Modality-Aware SAM: Sharpness-Aware-Minimization Driven Gradient Modulation for Harmonized Multimodal Learning
di: Nowdeh, Hossein R., et al.
Pubblicazione: (2025)
di: Nowdeh, Hossein R., et al.
Pubblicazione: (2025)
DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
di: Zhou, Yu, et al.
Pubblicazione: (2025)
di: Zhou, Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
di: Guo, Zirun, et al.
Pubblicazione: (2024) -
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
di: Guo, Zirun, et al.
Pubblicazione: (2025) -
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
di: Guo, Zirun, et al.
Pubblicazione: (2024) -
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
di: Guo, Zirun, et al.
Pubblicazione: (2025) -
LLM-I: LLMs are Naturally Interleaved Multimodal Creators
di: Guo, Zirun, et al.
Pubblicazione: (2025)