Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation
Fuente:
arXiv
Salvato in:
| Autore principale: | KV, Karthikeya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Physically Aware 360$^\circ$ View Generation from a Single Image using Disentangled Scene Embeddings
di: KV, Karthikeya, et al.
Pubblicazione: (2025)
di: KV, Karthikeya, et al.
Pubblicazione: (2025)
AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment
di: Karthikeya, KV, et al.
Pubblicazione: (2026)
di: Karthikeya, KV, et al.
Pubblicazione: (2026)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
di: Stan, Gabriela Ben Melech, et al.
Pubblicazione: (2024)
di: Stan, Gabriela Ben Melech, et al.
Pubblicazione: (2024)
LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation
di: Li, Zhenshi, et al.
Pubblicazione: (2024)
di: Li, Zhenshi, et al.
Pubblicazione: (2024)
Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data
di: Li, Haoxin, et al.
Pubblicazione: (2025)
di: Li, Haoxin, et al.
Pubblicazione: (2025)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
di: Li, Xu, et al.
Pubblicazione: (2025)
di: Li, Xu, et al.
Pubblicazione: (2025)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
Ultra-High-Resolution Image Synthesis with Pyramid Diffusion Model
di: Yang, Jiajie
Pubblicazione: (2024)
di: Yang, Jiajie
Pubblicazione: (2024)
FlexAttention for Efficient High-Resolution Vision-Language Models
di: Li, Junyan, et al.
Pubblicazione: (2024)
di: Li, Junyan, et al.
Pubblicazione: (2024)
Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models
di: Shukla, Nitish, et al.
Pubblicazione: (2026)
di: Shukla, Nitish, et al.
Pubblicazione: (2026)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
di: Huang, Runhui, et al.
Pubblicazione: (2024)
di: Huang, Runhui, et al.
Pubblicazione: (2024)
Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks
di: Wang, Lehan, et al.
Pubblicazione: (2024)
di: Wang, Lehan, et al.
Pubblicazione: (2024)
Multimodal Large Language Models as Image Classifiers
di: Kisel, Nikita, et al.
Pubblicazione: (2026)
di: Kisel, Nikita, et al.
Pubblicazione: (2026)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
di: Deng, Yihe, et al.
Pubblicazione: (2024)
di: Deng, Yihe, et al.
Pubblicazione: (2024)
MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models
di: Tiwary, Piyush, et al.
Pubblicazione: (2026)
di: Tiwary, Piyush, et al.
Pubblicazione: (2026)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation
di: Li, Pengzhi, et al.
Pubblicazione: (2025)
di: Li, Pengzhi, et al.
Pubblicazione: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
di: Wang, Yunnan, et al.
Pubblicazione: (2025)
di: Wang, Yunnan, et al.
Pubblicazione: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
di: Zheng, Kaipeng, et al.
Pubblicazione: (2023)
di: Zheng, Kaipeng, et al.
Pubblicazione: (2023)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis
di: Han, Jian, et al.
Pubblicazione: (2024)
di: Han, Jian, et al.
Pubblicazione: (2024)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
Large Language Models for Multimodal Deformable Image Registration
di: Ma, Mingrui, et al.
Pubblicazione: (2024)
di: Ma, Mingrui, et al.
Pubblicazione: (2024)
Safety of Multimodal Large Language Models on Images and Texts
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
di: Qin, Zhenyue, et al.
Pubblicazione: (2024)
di: Qin, Zhenyue, et al.
Pubblicazione: (2024)
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
di: Wang, Weizhi, et al.
Pubblicazione: (2024)
di: Wang, Weizhi, et al.
Pubblicazione: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis
di: Zhang, Jinjin, et al.
Pubblicazione: (2026)
di: Zhang, Jinjin, et al.
Pubblicazione: (2026)
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
di: Esser, Patrick, et al.
Pubblicazione: (2024)
di: Esser, Patrick, et al.
Pubblicazione: (2024)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Physically Aware 360$^\circ$ View Generation from a Single Image using Disentangled Scene Embeddings
di: KV, Karthikeya, et al.
Pubblicazione: (2025) -
AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment
di: Karthikeya, KV, et al.
Pubblicazione: (2026) -
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025) -
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025) -
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)