MoMA: Multimodal LLM Adapter for Fast Personalized Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Kunpeng, Zhu, Yizhe, Liu, Bingchen, Yan, Qing, Elgammal, Ahmed, Yang, Xiao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Creative Image Generation with Diffusion Models
par: Song, Kunpeng, et autres
Publié: (2026)
par: Song, Kunpeng, et autres
Publié: (2026)
MoMA: Momentum Contrastive Learning with Multi-head Attention-based Knowledge Distillation for Histopathology Image Analysis
par: Vuong, Trinh Thi Le, et autres
Publié: (2023)
par: Vuong, Trinh Thi Le, et autres
Publié: (2023)
Modality Agnostic Efficient Long Range Encoder
par: Parag, Toufiq, et autres
Publié: (2025)
par: Parag, Toufiq, et autres
Publié: (2025)
CAT: Contrastive Adapter Training for Personalized Image Generation
par: Park, Jae Wan, et autres
Publié: (2024)
par: Park, Jae Wan, et autres
Publié: (2024)
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
par: Duan, Lunhao, et autres
Publié: (2024)
par: Duan, Lunhao, et autres
Publié: (2024)
Task-Customized Mixture of Adapters for General Image Fusion
par: Zhu, Pengfei, et autres
Publié: (2024)
par: Zhu, Pengfei, et autres
Publié: (2024)
What If We Recaption Billions of Web Images with LLaMA-3?
par: Li, Xianhang, et autres
Publié: (2024)
par: Li, Xianhang, et autres
Publié: (2024)
Llama Learns to Direct: DirectorLLM for Human-Centric Video Generation
par: Song, Kunpeng, et autres
Publié: (2024)
par: Song, Kunpeng, et autres
Publié: (2024)
Feature Aligning Few shot Learning Method Using Local Descriptors Weighted Rules
par: Yan, Bingchen
Publié: (2024)
par: Yan, Bingchen
Publié: (2024)
UniCrossAdapter: Multimodal Adaptation of CLIP for Radiology Report Generation
par: Chen, Yaxiong, et autres
Publié: (2025)
par: Chen, Yaxiong, et autres
Publié: (2025)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
par: Wang, Yuhan, et autres
Publié: (2025)
par: Wang, Yuhan, et autres
Publié: (2025)
Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter
par: Zhong, Weizhi, et autres
Publié: (2025)
par: Zhong, Weizhi, et autres
Publié: (2025)
DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
par: Wang, Zhizhong, et autres
Publié: (2025)
par: Wang, Zhizhong, et autres
Publié: (2025)
SplatPose+: Real-time Image-Based Pose-Agnostic 3D Anomaly Detection
par: Liu, Yizhe, et autres
Publié: (2024)
par: Liu, Yizhe, et autres
Publié: (2024)
DM-Adapter: Domain-Aware Mixture-of-Adapters for Text-Based Person Retrieval
par: Liu, Yating, et autres
Publié: (2025)
par: Liu, Yating, et autres
Publié: (2025)
Oasis: One Image is All You Need for Multimodal Instruction Data Synthesis
par: Zhang, Letian, et autres
Publié: (2025)
par: Zhang, Letian, et autres
Publié: (2025)
Local Descriptors Weighted Adaptive Threshold Filtering For Few-Shot Learning
par: Yan, Bingchen
Publié: (2024)
par: Yan, Bingchen
Publié: (2024)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
par: Guo, Xun, et autres
Publié: (2023)
par: Guo, Xun, et autres
Publié: (2023)
LossAgent: Towards Any Optimization Objectives for Image Processing with LLM Agents
par: Li, Bingchen, et autres
Publié: (2024)
par: Li, Bingchen, et autres
Publié: (2024)
Generative Active Learning for Image Synthesis Personalization
par: Zhang, Xulu, et autres
Publié: (2024)
par: Zhang, Xulu, et autres
Publié: (2024)
Federated Client-tailored Adapter for Medical Image Segmentation
par: Hu, Guyue, et autres
Publié: (2025)
par: Hu, Guyue, et autres
Publié: (2025)
Inv-Adapter: ID Customization Generation via Image Inversion and Lightweight Adapter
par: Xing, Peng, et autres
Publié: (2024)
par: Xing, Peng, et autres
Publié: (2024)
Fast Personalized Text-to-Image Syntheses With Attention Injection
par: Zhang, Yuxuan, et autres
Publié: (2024)
par: Zhang, Yuxuan, et autres
Publié: (2024)
MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning
par: Zhang, Qizhe, et autres
Publié: (2023)
par: Zhang, Qizhe, et autres
Publié: (2023)
LDCA: Local Descriptors with Contextual Augmentation for Few-Shot Learning
par: Wang, Maofa, et autres
Publié: (2024)
par: Wang, Maofa, et autres
Publié: (2024)
Common Diffusion Noise Schedules and Sample Steps are Flawed
par: Lin, Shanchuan, et autres
Publié: (2023)
par: Lin, Shanchuan, et autres
Publié: (2023)
MV-Adapter: Multi-view Consistent Image Generation Made Easy
par: Huang, Zehuan, et autres
Publié: (2024)
par: Huang, Zehuan, et autres
Publié: (2024)
Generalized Category Discovery under the Long-Tailed Distribution
par: Zhao, Bingchen, et autres
Publié: (2025)
par: Zhao, Bingchen, et autres
Publié: (2025)
Motion-Adapter: A Diffusion Model Adapter for Text-to-Motion Generation of Compound Actions
par: Jiang, Yue, et autres
Publié: (2026)
par: Jiang, Yue, et autres
Publié: (2026)
HierRelTriple: Guiding Indoor Layout Generation with Hierarchical Relationship Triplet Losses
par: Sun, Kaifan, et autres
Publié: (2025)
par: Sun, Kaifan, et autres
Publié: (2025)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
par: Jin, Xiaojie, et autres
Publié: (2023)
par: Jin, Xiaojie, et autres
Publié: (2023)
Interpretable Text-Guided Image Clustering via Iterative Search
par: Zhao, Bingchen, et autres
Publié: (2025)
par: Zhao, Bingchen, et autres
Publié: (2025)
Removing Averaging: Personalized Lip-Sync Driven Characters Based on Identity Adapter
par: Zhu, Yanyu, et autres
Publié: (2025)
par: Zhu, Yanyu, et autres
Publié: (2025)
Frequency Adapter with SAM for Generalized Medical Image Segmentation
par: Bui, Phuoc-Nguyen, et autres
Publié: (2026)
par: Bui, Phuoc-Nguyen, et autres
Publié: (2026)
REEF: Relevance-Aware and Efficient LLM Adapter for Video Understanding
par: Reza, Sakib, et autres
Publié: (2025)
par: Reza, Sakib, et autres
Publié: (2025)
InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation
par: Xiao, Jinqi, et autres
Publié: (2025)
par: Xiao, Jinqi, et autres
Publié: (2025)
EVCtrl: Efficient Control Adapter for Visual Generation
par: Yang, Zixiang, et autres
Publié: (2025)
par: Yang, Zixiang, et autres
Publié: (2025)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
par: Song, Yuxin, et autres
Publié: (2025)
par: Song, Yuxin, et autres
Publié: (2025)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision
par: Chen, Jiacheng, et autres
Publié: (2026)
par: Chen, Jiacheng, et autres
Publié: (2026)
Documents similaires
-
Creative Image Generation with Diffusion Models
par: Song, Kunpeng, et autres
Publié: (2026) -
MoMA: Momentum Contrastive Learning with Multi-head Attention-based Knowledge Distillation for Histopathology Image Analysis
par: Vuong, Trinh Thi Le, et autres
Publié: (2023) -
Modality Agnostic Efficient Long Range Encoder
par: Parag, Toufiq, et autres
Publié: (2025) -
CAT: Contrastive Adapter Training for Personalized Image Generation
par: Park, Jae Wan, et autres
Publié: (2024) -
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
par: Duan, Lunhao, et autres
Publié: (2024)