LLMGA: Multimodal Large Language Model based Generation Assistant
Fuente:
arXiv
Guardado en:
| Autores principales: | Xia, Bin, Wang, Shiyin, Tao, Yingfan, Wang, Yitong, Jia, Jiaya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
por: Huang, Zhengchao, et al.
Publicado: (2024)
por: Huang, Zhengchao, et al.
Publicado: (2024)
DreamOmni2: Multimodal Instruction-based Editing and Generation
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
DreamOmni: Unified Image Generation and Editing
por: Xia, Bin, et al.
Publicado: (2024)
por: Xia, Bin, et al.
Publicado: (2024)
LLMRA: Multi-modal Large Language Model based Restoration Assistant
por: Jin, Xiaoyu, et al.
Publicado: (2024)
por: Jin, Xiaoyu, et al.
Publicado: (2024)
DreamOmni3: Scribble-based Editing and Generation
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
DreamVE: Unified Instruction-based Image and Video Editing
por: Xia, Bin, et al.
Publicado: (2025)
por: Xia, Bin, et al.
Publicado: (2025)
Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations
por: Shen, Tiancheng, et al.
Publicado: (2024)
por: Shen, Tiancheng, et al.
Publicado: (2024)
Attention Head Purification: A New Perspective to Harness CLIP for Domain Generalization
por: Wang, Yingfan, et al.
Publicado: (2024)
por: Wang, Yingfan, et al.
Publicado: (2024)
OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
por: Gong, Yuan, et al.
Publicado: (2025)
por: Gong, Yuan, et al.
Publicado: (2025)
LogoSticker: Inserting Logos into Diffusion Models for Customized Generation
por: Zhu, Mingkang, et al.
Publicado: (2024)
por: Zhu, Mingkang, et al.
Publicado: (2024)
LISA: Reasoning Segmentation via Large Language Model
por: Lai, Xin, et al.
Publicado: (2023)
por: Lai, Xin, et al.
Publicado: (2023)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
por: Zhang, Yuechen, et al.
Publicado: (2025)
por: Zhang, Yuechen, et al.
Publicado: (2025)
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
por: Yang, Senqiao, et al.
Publicado: (2023)
por: Yang, Senqiao, et al.
Publicado: (2023)
Training-Free Efficient Video Generation via Dynamic Token Carving
por: Zhang, Yuechen, et al.
Publicado: (2025)
por: Zhang, Yuechen, et al.
Publicado: (2025)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
por: Wu, Mengyang, et al.
Publicado: (2024)
por: Wu, Mengyang, et al.
Publicado: (2024)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
por: Liu, Yikun, et al.
Publicado: (2024)
por: Liu, Yikun, et al.
Publicado: (2024)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
TalkFashion: Intelligent Virtual Try-On Assistant Based on Multimodal Large Language Model
por: Hu, Yujie, et al.
Publicado: (2025)
por: Hu, Yujie, et al.
Publicado: (2025)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Unified Language-driven Zero-shot Domain Adaptation
por: Yang, Senqiao, et al.
Publicado: (2024)
por: Yang, Senqiao, et al.
Publicado: (2024)
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
por: Mou, Zhun, et al.
Publicado: (2025)
por: Mou, Zhun, et al.
Publicado: (2025)
GSVA: Generalized Segmentation via Multimodal Large Language Models
por: Xia, Zhuofan, et al.
Publicado: (2023)
por: Xia, Zhuofan, et al.
Publicado: (2023)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
por: Huang, Jiehui, et al.
Publicado: (2025)
por: Huang, Jiehui, et al.
Publicado: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
por: Lu, Shiyin, et al.
Publicado: (2024)
por: Lu, Shiyin, et al.
Publicado: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
por: Wang, Liqiong, et al.
Publicado: (2024)
por: Wang, Liqiong, et al.
Publicado: (2024)
Semantic Alignment for Multimodal Large Language Models
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
por: Tan, Chuangchuang, et al.
Publicado: (2025)
por: Tan, Chuangchuang, et al.
Publicado: (2025)
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
por: Qu, Tianyuan, et al.
Publicado: (2025)
por: Qu, Tianyuan, et al.
Publicado: (2025)
Measuring Epistemic Humility in Multimodal Large Language Models
por: Tong, Bingkui, et al.
Publicado: (2025)
por: Tong, Bingkui, et al.
Publicado: (2025)
Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation
por: Li, Haoqing, et al.
Publicado: (2025)
por: Li, Haoqing, et al.
Publicado: (2025)
VLPose: Bridging the Domain Gap in Pose Estimation with Language-Vision Tuning
por: Li, Jingyao, et al.
Publicado: (2024)
por: Li, Jingyao, et al.
Publicado: (2024)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
por: Zhang, Guosheng, et al.
Publicado: (2025)
por: Zhang, Guosheng, et al.
Publicado: (2025)
Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models
por: Wang, Xuesong, et al.
Publicado: (2026)
por: Wang, Xuesong, et al.
Publicado: (2026)
ControlNeXt: Powerful and Efficient Control for Image and Video Generation
por: Peng, Bohao, et al.
Publicado: (2024)
por: Peng, Bohao, et al.
Publicado: (2024)
AgriDoctor: A Multimodal Intelligent Assistant for Agriculture
por: Zhang, Mingqing, et al.
Publicado: (2025)
por: Zhang, Mingqing, et al.
Publicado: (2025)
Modular Customization of Diffusion Models via Blockwise-Parameterized Low-Rank Adaptation
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
DreamLight: Towards Harmonious and Consistent Image Relighting
por: Liu, Yong, et al.
Publicado: (2025)
por: Liu, Yong, et al.
Publicado: (2025)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
ByteEdit: Boost, Comply and Accelerate Generative Image Editing
por: Ren, Yuxi, et al.
Publicado: (2024)
por: Ren, Yuxi, et al.
Publicado: (2024)
Ejemplares similares
-
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
por: Huang, Zhengchao, et al.
Publicado: (2024) -
DreamOmni2: Multimodal Instruction-based Editing and Generation
por: Xia, Bin, et al.
Publicado: (2025) -
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
por: Chu, Meng, et al.
Publicado: (2025) -
DreamOmni: Unified Image Generation and Editing
por: Xia, Bin, et al.
Publicado: (2024) -
LLMRA: Multi-modal Large Language Model based Restoration Assistant
por: Jin, Xiaoyu, et al.
Publicado: (2024)