LLMRA: Multi-modal Large Language Model based Restoration Assistant
Fuente:
arXiv
Guardado en:
| Autores principales: | Jin, Xiaoyu, Shi, Yuan, Xia, Bin, Yang, Wenming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiffStereo: High-Frequency Aware Diffusion Model for Stereo Image Restoration
por: Cao, Huiyun, et al.
Publicado: (2025)
por: Cao, Huiyun, et al.
Publicado: (2025)
VmambaIR: Visual State Space Model for Image Restoration
por: Shi, Yuan, et al.
Publicado: (2024)
por: Shi, Yuan, et al.
Publicado: (2024)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
por: Huang, Zhengchao, et al.
Publicado: (2024)
por: Huang, Zhengchao, et al.
Publicado: (2024)
LLMGA: Multimodal Large Language Model based Generation Assistant
por: Xia, Bin, et al.
Publicado: (2023)
por: Xia, Bin, et al.
Publicado: (2023)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
por: Yin, Yuehao, et al.
Publicado: (2023)
por: Yin, Yuehao, et al.
Publicado: (2023)
Adapting Multi-modal Large Language Model to Concept Drift From Pre-training Onwards
por: Yang, Xiaoyu, et al.
Publicado: (2024)
por: Yang, Xiaoyu, et al.
Publicado: (2024)
Multi-Weather Image Restoration via Histogram-Based Transformer Feature Enhancement
por: Wen, Yang, et al.
Publicado: (2024)
por: Wen, Yang, et al.
Publicado: (2024)
DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models
por: Xia, Renqiu, et al.
Publicado: (2024)
por: Xia, Renqiu, et al.
Publicado: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
Alignment is All You Need: A Training-free Augmentation Strategy for Pose-guided Video Generation
por: Jin, Xiaoyu, et al.
Publicado: (2024)
por: Jin, Xiaoyu, et al.
Publicado: (2024)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
por: Jiang, Dongsheng, et al.
Publicado: (2023)
por: Jiang, Dongsheng, et al.
Publicado: (2023)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
por: Wang, Yeyuan, et al.
Publicado: (2024)
por: Wang, Yeyuan, et al.
Publicado: (2024)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
Supervise-assisted Multi-modality Fusion Diffusion Model for PET Restoration
por: Zhang, Yingkai, et al.
Publicado: (2026)
por: Zhang, Yingkai, et al.
Publicado: (2026)
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
por: Li, Deng, et al.
Publicado: (2024)
por: Li, Deng, et al.
Publicado: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
por: Peng, Zelin, et al.
Publicado: (2025)
por: Peng, Zelin, et al.
Publicado: (2025)
Point Cloud as a Foreign Language for Multi-modal Large Language Model
por: Paul, Sneha, et al.
Publicado: (2026)
por: Paul, Sneha, et al.
Publicado: (2026)
ReFIR: Grounding Large Restoration Models with Retrieval Augmentation
por: Guo, Hang, et al.
Publicado: (2024)
por: Guo, Hang, et al.
Publicado: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
por: Wei, Cong, et al.
Publicado: (2024)
por: Wei, Cong, et al.
Publicado: (2024)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
por: Basu, Samyadeep, et al.
Publicado: (2024)
por: Basu, Samyadeep, et al.
Publicado: (2024)
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
por: Wang, Haicheng, et al.
Publicado: (2025)
por: Wang, Haicheng, et al.
Publicado: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
por: Jeon, Byungwoo, et al.
Publicado: (2026)
por: Jeon, Byungwoo, et al.
Publicado: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
por: Chen, Haokun, et al.
Publicado: (2025)
por: Chen, Haokun, et al.
Publicado: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
por: Liao, Wenhui, et al.
Publicado: (2024)
por: Liao, Wenhui, et al.
Publicado: (2024)
Distilling Multi-modal Large Language Models for Autonomous Driving
por: Hegde, Deepti, et al.
Publicado: (2025)
por: Hegde, Deepti, et al.
Publicado: (2025)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
por: Wu, Junfeng, et al.
Publicado: (2024)
por: Wu, Junfeng, et al.
Publicado: (2024)
Emergent Morphing Attack Detection in Open Multi-modal Large Language Models
por: Ivanovska, Marija, et al.
Publicado: (2026)
por: Ivanovska, Marija, et al.
Publicado: (2026)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
por: Liao, Pan, et al.
Publicado: (2026)
por: Liao, Pan, et al.
Publicado: (2026)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
UAE: Universal Anatomical Embedding on Multi-modality Medical Images
por: Bai, Xiaoyu, et al.
Publicado: (2023)
por: Bai, Xiaoyu, et al.
Publicado: (2023)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
por: Li, Shaokai, et al.
Publicado: (2024)
por: Li, Shaokai, et al.
Publicado: (2024)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
por: Ding, Peng, et al.
Publicado: (2024)
por: Ding, Peng, et al.
Publicado: (2024)
Ejemplares similares
-
DiffStereo: High-Frequency Aware Diffusion Model for Stereo Image Restoration
por: Cao, Huiyun, et al.
Publicado: (2025) -
VmambaIR: Visual State Space Model for Image Restoration
por: Shi, Yuan, et al.
Publicado: (2024) -
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
por: Huang, Zhengchao, et al.
Publicado: (2024) -
LLMGA: Multimodal Large Language Model based Generation Assistant
por: Xia, Bin, et al.
Publicado: (2023) -
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
por: Yin, Yuehao, et al.
Publicado: (2023)