Pilot: Building the Federated Multimodal Instruction Tuning Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiong, Baochen, Yang, Xiaoshan, Song, Yaguang, Wang, Yaowei, Xu, Changsheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Step Toward Federated Pretraining of Multimodal Large Language Models
par: Xiong, Baochen, et autres
Publié: (2026)
par: Xiong, Baochen, et autres
Publié: (2026)
PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging
par: Shao, Zibo, et autres
Publié: (2026)
par: Shao, Zibo, et autres
Publié: (2026)
Harmony: A Unified Framework for Modality Incremental Learning
par: Song, Yaguang, et autres
Publié: (2025)
par: Song, Yaguang, et autres
Publié: (2025)
Libra: Building Decoupled Vision System on Large Language Models
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
par: Hu, Tao, et autres
Publié: (2026)
par: Hu, Tao, et autres
Publié: (2026)
Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning
par: Safaei, Bardia, et autres
Publié: (2025)
par: Safaei, Bardia, et autres
Publié: (2025)
Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
par: Wang, Chenguang, et autres
Publié: (2024)
par: Wang, Chenguang, et autres
Publié: (2024)
Reconstructive Visual Instruction Tuning
par: Wang, Haochen, et autres
Publié: (2024)
par: Wang, Haochen, et autres
Publié: (2024)
Parrot: Multilingual Visual Instruction Tuning
par: Sun, Hai-Long, et autres
Publié: (2024)
par: Sun, Hai-Long, et autres
Publié: (2024)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
Learning to Instruct for Visual Instruction Tuning
par: Zhou, Zhihan, et autres
Publié: (2025)
par: Zhou, Zhihan, et autres
Publié: (2025)
Modality-Collaborative Low-Rank Decomposers for Few-Shot Video Domain Adaptation
par: Wanyan, Yuyang, et autres
Publié: (2025)
par: Wanyan, Yuyang, et autres
Publié: (2025)
DiPrompT: Disentangled Prompt Tuning for Multiple Latent Domain Generalization in Federated Learning
par: Bai, Sikai, et autres
Publié: (2024)
par: Bai, Sikai, et autres
Publié: (2024)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
par: Li, Liupeng, et autres
Publié: (2026)
par: Li, Liupeng, et autres
Publié: (2026)
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)
par: Liu, Haotian, et autres
Publié: (2023)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
par: Ai, Jiaxin, et autres
Publié: (2025)
par: Ai, Jiaxin, et autres
Publié: (2025)
GIST: Targeted Data Selection for Instruction Tuning via Coupled Optimization Geometry
par: Min, Guanghui, et autres
Publié: (2026)
par: Min, Guanghui, et autres
Publié: (2026)
Federated Document Visual Question Answering: A Pilot Study
par: Nguyen, Khanh, et autres
Publié: (2024)
par: Nguyen, Khanh, et autres
Publié: (2024)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
par: Cao, Shengcao, et autres
Publié: (2024)
par: Cao, Shengcao, et autres
Publié: (2024)
A Composable Multimodal Framework for cine CMR-Text-Driven Prediction of Heart Failure Outcomes
par: Chen, Jianzhou, et autres
Publié: (2025)
par: Chen, Jianzhou, et autres
Publié: (2025)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
par: Yang, Jingcheng, et autres
Publié: (2026)
par: Yang, Jingcheng, et autres
Publié: (2026)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2024)
par: Xiao, Linhui, et autres
Publié: (2024)
Invariant Representation Guided Multimodal Sentiment Decoding with Sequential Variation Regularization
par: Xu, Guoyang, et autres
Publié: (2024)
par: Xu, Guoyang, et autres
Publié: (2024)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
par: Lyu, Mengyao, et autres
Publié: (2025)
par: Lyu, Mengyao, et autres
Publié: (2025)
Adversarial Semantic and Label Perturbation Attack for Pedestrian Attribute Recognition
par: Kong, Weizhe, et autres
Publié: (2025)
par: Kong, Weizhe, et autres
Publié: (2025)
Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning
par: Wang, Qian-Wei, et autres
Publié: (2026)
par: Wang, Qian-Wei, et autres
Publié: (2026)
Parameter-Efficient Quantized Mixture-of-Experts Meets Vision-Language Instruction Tuning for Semiconductor Electron Micrograph Analysis
par: Srinivas, Sakhinana Sagar, et autres
Publié: (2024)
par: Srinivas, Sakhinana Sagar, et autres
Publié: (2024)
Foundational Model for Electron Micrograph Analysis: Instruction-Tuning Small-Scale Language-and-Vision Assistant for Enterprise Adoption
par: Srinivas, Sakhinana Sagar, et autres
Publié: (2024)
par: Srinivas, Sakhinana Sagar, et autres
Publié: (2024)
FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation
par: Tan, Min, et autres
Publié: (2026)
par: Tan, Min, et autres
Publié: (2026)
QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
par: Dai, Wei, et autres
Publié: (2025)
par: Dai, Wei, et autres
Publié: (2025)
Distilled Prompt Learning for Incomplete Multimodal Survival Prediction
par: Xu, Yingxue, et autres
Publié: (2025)
par: Xu, Yingxue, et autres
Publié: (2025)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
par: Sun, Shenghuan, et autres
Publié: (2024)
par: Sun, Shenghuan, et autres
Publié: (2024)
Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models
par: Ryan, Yuriel, et autres
Publié: (2026)
par: Ryan, Yuriel, et autres
Publié: (2026)
Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models
par: Song, Fei, et autres
Publié: (2025)
par: Song, Fei, et autres
Publié: (2025)
Cloud-based Federated Learning Framework for MRI Segmentation
par: Prajapati, Rukesh, et autres
Publié: (2024)
par: Prajapati, Rukesh, et autres
Publié: (2024)
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
Frugal Federated Learning for Violence Detection: A Comparison of LoRA-Tuned VLMs and Personalized CNNs
par: Thuau, Sébastien, et autres
Publié: (2025)
par: Thuau, Sébastien, et autres
Publié: (2025)
Documents similaires
-
A Step Toward Federated Pretraining of Multimodal Large Language Models
par: Xiong, Baochen, et autres
Publié: (2026) -
PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging
par: Shao, Zibo, et autres
Publié: (2026) -
Harmony: A Unified Framework for Modality Incremental Learning
par: Song, Yaguang, et autres
Publié: (2025) -
Libra: Building Decoupled Vision System on Large Language Models
par: Xu, Yifan, et autres
Publié: (2024) -
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
par: Hu, Tao, et autres
Publié: (2026)