Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | KV, Karthikeya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Physically Aware 360$^\circ$ View Generation from a Single Image using Disentangled Scene Embeddings
par: KV, Karthikeya, et autres
Publié: (2025)
par: KV, Karthikeya, et autres
Publié: (2025)
AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment
par: Karthikeya, KV, et autres
Publié: (2026)
par: Karthikeya, KV, et autres
Publié: (2026)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
par: Zhang, Siyu, et autres
Publié: (2025)
par: Zhang, Siyu, et autres
Publié: (2025)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
par: Zhang, Guosheng, et autres
Publié: (2025)
par: Zhang, Guosheng, et autres
Publié: (2025)
LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
par: Stan, Gabriela Ben Melech, et autres
Publié: (2024)
par: Stan, Gabriela Ben Melech, et autres
Publié: (2024)
LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation
par: Li, Zhenshi, et autres
Publié: (2024)
par: Li, Zhenshi, et autres
Publié: (2024)
Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation
par: Zhang, Jinjin, et autres
Publié: (2025)
par: Zhang, Jinjin, et autres
Publié: (2025)
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
par: Wang, Wenbin, et autres
Publié: (2024)
par: Wang, Wenbin, et autres
Publié: (2024)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
par: Agrawal, Aakriti, et autres
Publié: (2025)
par: Agrawal, Aakriti, et autres
Publié: (2025)
Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data
par: Li, Haoxin, et autres
Publié: (2025)
par: Li, Haoxin, et autres
Publié: (2025)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
par: Imran, Muhammad, et autres
Publié: (2025)
par: Imran, Muhammad, et autres
Publié: (2025)
Ultra-High-Resolution Image Synthesis with Pyramid Diffusion Model
par: Yang, Jiajie
Publié: (2024)
par: Yang, Jiajie
Publié: (2024)
FlexAttention for Efficient High-Resolution Vision-Language Models
par: Li, Junyan, et autres
Publié: (2024)
par: Li, Junyan, et autres
Publié: (2024)
Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models
par: Shukla, Nitish, et autres
Publié: (2026)
par: Shukla, Nitish, et autres
Publié: (2026)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
par: Huang, Runhui, et autres
Publié: (2024)
par: Huang, Runhui, et autres
Publié: (2024)
Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks
par: Wang, Lehan, et autres
Publié: (2024)
par: Wang, Lehan, et autres
Publié: (2024)
Multimodal Large Language Models as Image Classifiers
par: Kisel, Nikita, et autres
Publié: (2026)
par: Kisel, Nikita, et autres
Publié: (2026)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
par: Deng, Yihe, et autres
Publié: (2024)
par: Deng, Yihe, et autres
Publié: (2024)
MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models
par: Tiwary, Piyush, et autres
Publié: (2026)
par: Tiwary, Piyush, et autres
Publié: (2026)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation
par: Li, Pengzhi, et autres
Publié: (2025)
par: Li, Pengzhi, et autres
Publié: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
par: Wang, Yunnan, et autres
Publié: (2025)
par: Wang, Yunnan, et autres
Publié: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
par: Zheng, Kaipeng, et autres
Publié: (2023)
par: Zheng, Kaipeng, et autres
Publié: (2023)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2024)
par: Luo, Gen, et autres
Publié: (2024)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis
par: Han, Jian, et autres
Publié: (2024)
par: Han, Jian, et autres
Publié: (2024)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
par: Jiao, Qirui, et autres
Publié: (2024)
par: Jiao, Qirui, et autres
Publié: (2024)
Large Language Models for Multimodal Deformable Image Registration
par: Ma, Mingrui, et autres
Publié: (2024)
par: Ma, Mingrui, et autres
Publié: (2024)
Safety of Multimodal Large Language Models on Images and Texts
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
par: Qin, Zhenyue, et autres
Publié: (2024)
par: Qin, Zhenyue, et autres
Publié: (2024)
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
par: Wang, Weizhi, et autres
Publié: (2024)
par: Wang, Weizhi, et autres
Publié: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
par: Zhu, Hongyi, et autres
Publié: (2024)
par: Zhu, Hongyi, et autres
Publié: (2024)
Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis
par: Zhang, Jinjin, et autres
Publié: (2026)
par: Zhang, Jinjin, et autres
Publié: (2026)
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
par: Esser, Patrick, et autres
Publié: (2024)
par: Esser, Patrick, et autres
Publié: (2024)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
par: Zhan, Yufei, et autres
Publié: (2024)
par: Zhan, Yufei, et autres
Publié: (2024)
Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models
par: Zhang, Jinjin, et autres
Publié: (2025)
par: Zhang, Jinjin, et autres
Publié: (2025)
Documents similaires
-
Physically Aware 360$^\circ$ View Generation from a Single Image using Disentangled Scene Embeddings
par: KV, Karthikeya, et autres
Publié: (2025) -
AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment
par: Karthikeya, KV, et autres
Publié: (2026) -
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
par: Chen, Liangyu, et autres
Publié: (2025) -
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
par: Zhang, Siyu, et autres
Publié: (2025) -
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
par: Zhang, Guosheng, et autres
Publié: (2025)