LLMRA: Multi-modal Large Language Model based Restoration Assistant
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Xiaoyu, Shi, Yuan, Xia, Bin, Yang, Wenming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiffStereo: High-Frequency Aware Diffusion Model for Stereo Image Restoration
par: Cao, Huiyun, et autres
Publié: (2025)
par: Cao, Huiyun, et autres
Publié: (2025)
VmambaIR: Visual State Space Model for Image Restoration
par: Shi, Yuan, et autres
Publié: (2024)
par: Shi, Yuan, et autres
Publié: (2024)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
par: Huang, Zhengchao, et autres
Publié: (2024)
par: Huang, Zhengchao, et autres
Publié: (2024)
LLMGA: Multimodal Large Language Model based Generation Assistant
par: Xia, Bin, et autres
Publié: (2023)
par: Xia, Bin, et autres
Publié: (2023)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
par: Yin, Yuehao, et autres
Publié: (2023)
par: Yin, Yuehao, et autres
Publié: (2023)
Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
Multi-Weather Image Restoration via Histogram-Based Transformer Feature Enhancement
par: Wen, Yang, et autres
Publié: (2024)
par: Wen, Yang, et autres
Publié: (2024)
DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models
par: Xia, Renqiu, et autres
Publié: (2024)
par: Xia, Renqiu, et autres
Publié: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
par: Yang, Yuqi, et autres
Publié: (2024)
par: Yang, Yuqi, et autres
Publié: (2024)
Alignment is All You Need: A Training-free Augmentation Strategy for Pose-guided Video Generation
par: Jin, Xiaoyu, et autres
Publié: (2024)
par: Jin, Xiaoyu, et autres
Publié: (2024)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
par: Jiang, Dongsheng, et autres
Publié: (2023)
par: Jiang, Dongsheng, et autres
Publié: (2023)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
par: Wang, Yeyuan, et autres
Publié: (2024)
par: Wang, Yeyuan, et autres
Publié: (2024)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
Supervise-assisted Multi-modality Fusion Diffusion Model for PET Restoration
par: Zhang, Yingkai, et autres
Publié: (2026)
par: Zhang, Yingkai, et autres
Publié: (2026)
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
par: Li, Deng, et autres
Publié: (2024)
par: Li, Deng, et autres
Publié: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
par: Peng, Zelin, et autres
Publié: (2025)
par: Peng, Zelin, et autres
Publié: (2025)
Point Cloud as a Foreign Language for Multi-modal Large Language Model
par: Paul, Sneha, et autres
Publié: (2026)
par: Paul, Sneha, et autres
Publié: (2026)
ReFIR: Grounding Large Restoration Models with Retrieval Augmentation
par: Guo, Hang, et autres
Publié: (2024)
par: Guo, Hang, et autres
Publié: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
par: Wei, Cong, et autres
Publié: (2024)
par: Wei, Cong, et autres
Publié: (2024)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
par: Wang, Haicheng, et autres
Publié: (2025)
par: Wang, Haicheng, et autres
Publié: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
par: Jeon, Byungwoo, et autres
Publié: (2026)
par: Jeon, Byungwoo, et autres
Publié: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
par: Chen, Haokun, et autres
Publié: (2025)
par: Chen, Haokun, et autres
Publié: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
par: Liao, Wenhui, et autres
Publié: (2024)
par: Liao, Wenhui, et autres
Publié: (2024)
Distilling Multi-modal Large Language Models for Autonomous Driving
par: Hegde, Deepti, et autres
Publié: (2025)
par: Hegde, Deepti, et autres
Publié: (2025)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
par: Wu, Junfeng, et autres
Publié: (2024)
par: Wu, Junfeng, et autres
Publié: (2024)
Emergent Morphing Attack Detection in Open Multi-modal Large Language Models
par: Ivanovska, Marija, et autres
Publié: (2026)
par: Ivanovska, Marija, et autres
Publié: (2026)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
par: Li, Zeqian, et autres
Publié: (2025)
par: Li, Zeqian, et autres
Publié: (2025)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
par: Liao, Pan, et autres
Publié: (2026)
par: Liao, Pan, et autres
Publié: (2026)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
par: Lu, Weiheng, et autres
Publié: (2024)
par: Lu, Weiheng, et autres
Publié: (2024)
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
par: Liu, Yuqi, et autres
Publié: (2025)
par: Liu, Yuqi, et autres
Publié: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
par: Xu, Weiye, et autres
Publié: (2025)
par: Xu, Weiye, et autres
Publié: (2025)
UAE: Universal Anatomical Embedding on Multi-modality Medical Images
par: Bai, Xiaoyu, et autres
Publié: (2023)
par: Bai, Xiaoyu, et autres
Publié: (2023)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
par: Li, Shaokai, et autres
Publié: (2024)
par: Li, Shaokai, et autres
Publié: (2024)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
par: Ding, Peng, et autres
Publié: (2024)
par: Ding, Peng, et autres
Publié: (2024)
Documents similaires
-
DiffStereo: High-Frequency Aware Diffusion Model for Stereo Image Restoration
par: Cao, Huiyun, et autres
Publié: (2025) -
VmambaIR: Visual State Space Model for Image Restoration
par: Shi, Yuan, et autres
Publié: (2024) -
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
par: Huang, Zhengchao, et autres
Publié: (2024) -
LLMGA: Multimodal Large Language Model based Generation Assistant
par: Xia, Bin, et autres
Publié: (2023) -
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
par: Yin, Yuehao, et autres
Publié: (2023)