Harmony: A Unified Framework for Modality Incremental Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Song, Yaguang, Yang, Xiaoshan, Jiang, Dongmei, Wang, Yaowei, Xu, Changsheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Pilot: Building the Federated Multimodal Instruction Tuning Framework
by: Xiong, Baochen, et al.
Published: (2025)
by: Xiong, Baochen, et al.
Published: (2025)
A Step Toward Federated Pretraining of Multimodal Large Language Models
by: Xiong, Baochen, et al.
Published: (2026)
by: Xiong, Baochen, et al.
Published: (2026)
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
by: Shen, Meng, et al.
Published: (2024)
by: Shen, Meng, et al.
Published: (2024)
HeLo: Heterogeneous Multi-Modal Fusion with Label Correlation for Emotion Distribution Learning
by: Zheng, Chuhang, et al.
Published: (2025)
by: Zheng, Chuhang, et al.
Published: (2025)
Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback
by: Yang, Yiyuan, et al.
Published: (2025)
by: Yang, Yiyuan, et al.
Published: (2025)
FISHER: A Foundation Model for Multi-Modal Industrial Signal Comprehensive Representation
by: Fan, Pingyi, et al.
Published: (2025)
by: Fan, Pingyi, et al.
Published: (2025)
Adaptive Prototype Knowledge Transfer for Federated Learning with Mixed Modalities and Heterogeneous Tasks
by: Gai, Keke, et al.
Published: (2025)
by: Gai, Keke, et al.
Published: (2025)
A Unified Evaluation Framework for Multi-Annotator Tendency Learning
by: Zhang, Liyun, et al.
Published: (2025)
by: Zhang, Liyun, et al.
Published: (2025)
OmniMER: Auxiliary-Enhanced LLM Adaptation for Indonesian Multimodal Emotion Recognition
by: Yan, Xueming, et al.
Published: (2025)
by: Yan, Xueming, et al.
Published: (2025)
Unveiling Covert Toxicity in Multimodal Data via Toxicity Association Graphs: A Graph-Based Metric and Interpretable Detection Framework
by: Wu, Guanzong, et al.
Published: (2026)
by: Wu, Guanzong, et al.
Published: (2026)
From Discord to Harmony: Decomposed Consonance-based Training for Improved Audio Chord Estimation
by: Poltronieri, Andrea, et al.
Published: (2025)
by: Poltronieri, Andrea, et al.
Published: (2025)
From Linguistic Giants to Sensory Maestros: A Survey on Cross-Modal Reasoning with Large Language Models
by: Qian, Shengsheng, et al.
Published: (2024)
by: Qian, Shengsheng, et al.
Published: (2024)
A review on Machine Learning based User-Centric Multimedia Streaming Techniques
by: Ghosh, Monalisa, et al.
Published: (2024)
by: Ghosh, Monalisa, et al.
Published: (2024)
MixEval-X: Any-to-Any Evaluations from Real-World Data Mixtures
by: Ni, Jinjie, et al.
Published: (2024)
by: Ni, Jinjie, et al.
Published: (2024)
EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning
by: Kim, Jongsuk, et al.
Published: (2024)
by: Kim, Jongsuk, et al.
Published: (2024)
Contrastive Regularization over LoRA for Multimodal Biomedical Image Incremental Learning
by: Zhang, Haojie, et al.
Published: (2025)
by: Zhang, Haojie, et al.
Published: (2025)
ReconBoost: Boosting Can Achieve Modality Reconcilement
by: Hua, Cong, et al.
Published: (2024)
by: Hua, Cong, et al.
Published: (2024)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
by: Yan, Qianqi, et al.
Published: (2026)
by: Yan, Qianqi, et al.
Published: (2026)
A Multimodal Single-Branch Embedding Network for Recommendation in Cold-Start and Missing Modality Scenarios
by: Ganhör, Christian, et al.
Published: (2024)
by: Ganhör, Christian, et al.
Published: (2024)
InfoMAE: Pair-Efficient Cross-Modal Alignment for Multimodal Time-Series Sensing Signals
by: Kimura, Tomoyoshi, et al.
Published: (2025)
by: Kimura, Tomoyoshi, et al.
Published: (2025)
Detecting Multimedia Generated by Large AI Models: A Survey
by: Lin, Li, et al.
Published: (2024)
by: Lin, Li, et al.
Published: (2024)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
by: Wang, Qingni, et al.
Published: (2024)
by: Wang, Qingni, et al.
Published: (2024)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
by: Wang, Bing, et al.
Published: (2026)
by: Wang, Bing, et al.
Published: (2026)
LayerT2V: A Unified Multi-Layer Video Generation Framework
by: Li, Guangzhao, et al.
Published: (2025)
by: Li, Guangzhao, et al.
Published: (2025)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
by: Chen, Yang, et al.
Published: (2024)
by: Chen, Yang, et al.
Published: (2024)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
by: Li, Liupeng, et al.
Published: (2026)
by: Li, Liupeng, et al.
Published: (2026)
SABR: A Stable Adaptive Bitrate Framework Using Behavior Cloning Pretraining and Reinforcement Learning Fine-Tuning
by: Luo, Pengcheng, et al.
Published: (2025)
by: Luo, Pengcheng, et al.
Published: (2025)
GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning
by: Verma, Abhigya, et al.
Published: (2025)
by: Verma, Abhigya, et al.
Published: (2025)
Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models
by: Wang, Chen, et al.
Published: (2025)
by: Wang, Chen, et al.
Published: (2025)
ChatDiet: Empowering Personalized Nutrition-Oriented Food Recommender Chatbots through an LLM-Augmented Framework
by: Yang, Zhongqi, et al.
Published: (2024)
by: Yang, Zhongqi, et al.
Published: (2024)
Identifying Multi-modal Knowledge Neurons in Pretrained Transformers via Two-stage Filtering
by: Sato, Yugen, et al.
Published: (2025)
by: Sato, Yugen, et al.
Published: (2025)
AI-Integrated Decision Support System for Real-Time Market Growth Forecasting and Multi-Source Content Diffusion Analytics
by: Yin, Ziqing, et al.
Published: (2025)
by: Yin, Ziqing, et al.
Published: (2025)
Comparing Contrastive and Triplet Loss: Variance Analysis and Optimization Behavior
by: Zeng, Donghuo
Published: (2025)
by: Zeng, Donghuo
Published: (2025)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
by: Zhang, Yao, et al.
Published: (2025)
by: Zhang, Yao, et al.
Published: (2025)
Predicting Outcomes in Video Games with Long Short Term Memory Networks
by: Chulajata, Kittimate, et al.
Published: (2024)
by: Chulajata, Kittimate, et al.
Published: (2024)
BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation
by: Yoon, Hee Suk, et al.
Published: (2024)
by: Yoon, Hee Suk, et al.
Published: (2024)
Multi-Modal Multi-Task Federated Foundation Models for Next-Generation Extended Reality Systems: Towards Privacy-Preserving Distributed Intelligence in AR/VR/MR
by: Nadimi, Fardis, et al.
Published: (2025)
by: Nadimi, Fardis, et al.
Published: (2025)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
by: Wang, Zhouxia, et al.
Published: (2023)
by: Wang, Zhouxia, et al.
Published: (2023)
Unified Hallucination Detection for Multimodal Large Language Models
by: Chen, Xiang, et al.
Published: (2024)
by: Chen, Xiang, et al.
Published: (2024)
Similar Items
-
Pilot: Building the Federated Multimodal Instruction Tuning Framework
by: Xiong, Baochen, et al.
Published: (2025) -
A Step Toward Federated Pretraining of Multimodal Large Language Models
by: Xiong, Baochen, et al.
Published: (2026) -
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
by: Shen, Meng, et al.
Published: (2024) -
HeLo: Heterogeneous Multi-Modal Fusion with Label Correlation for Emotion Distribution Learning
by: Zheng, Chuhang, et al.
Published: (2025) -
Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback
by: Yang, Yiyuan, et al.
Published: (2025)