Demystifying the Visual Quality Paradox in Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xing, Shuo, Guo, Lanqing, Hua, Hongyuan, Lee, Seoyoung, Li, Peiran, Wang, Yufei, Wang, Zhangyang, Tu, Zhengzhong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CIPHER: Culvert Inspection through Pairwise Frame Selection and High-Efficiency Reconstruction
von: Lee, Seoyoung, et al.
Veröffentlicht: (2026)
von: Lee, Seoyoung, et al.
Veröffentlicht: (2026)
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
von: Xing, Shuo, et al.
Veröffentlicht: (2024)
von: Xing, Shuo, et al.
Veröffentlicht: (2024)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
von: Xing, Shuo, et al.
Veröffentlicht: (2024)
von: Xing, Shuo, et al.
Veröffentlicht: (2024)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
von: Qian, Chengxuan, et al.
Veröffentlicht: (2025)
von: Qian, Chengxuan, et al.
Veröffentlicht: (2025)
Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
von: Xing, Shuo, et al.
Veröffentlicht: (2025)
von: Xing, Shuo, et al.
Veröffentlicht: (2025)
Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors
von: Guo, Lanqing, et al.
Veröffentlicht: (2025)
von: Guo, Lanqing, et al.
Veröffentlicht: (2025)
Can Large Vision Language Models Read Maps Like a Human?
von: Xing, Shuo, et al.
Veröffentlicht: (2025)
von: Xing, Shuo, et al.
Veröffentlicht: (2025)
Let the Abyss Stare Back Adaptive Falsification for Autonomous Scientific Discovery
von: Li, Peiran, et al.
Veröffentlicht: (2026)
von: Li, Peiran, et al.
Veröffentlicht: (2026)
Oscillation Inversion: Understand the structure of Large Flow Model through the Lens of Inversion Method
von: Zheng, Yan, et al.
Veröffentlicht: (2024)
von: Zheng, Yan, et al.
Veröffentlicht: (2024)
Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization
von: Xing, Shuo, et al.
Veröffentlicht: (2025)
von: Xing, Shuo, et al.
Veröffentlicht: (2025)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
von: Wang, Yufei, et al.
Veröffentlicht: (2025)
von: Wang, Yufei, et al.
Veröffentlicht: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
von: Zhu, Tinghui, et al.
Veröffentlicht: (2024)
von: Zhu, Tinghui, et al.
Veröffentlicht: (2024)
Seeing Where to Deploy: Metric RGB-Based Traversability Analysis for Aerial-to-Ground Hidden Space Inspection
von: Lee, Seoyoung, et al.
Veröffentlicht: (2026)
von: Lee, Seoyoung, et al.
Veröffentlicht: (2026)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2026)
Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models
von: Ren, Qin, et al.
Veröffentlicht: (2025)
von: Ren, Qin, et al.
Veröffentlicht: (2025)
Controlling Your Image via Simplified Vector Graphics
von: Guo, Lanqing, et al.
Veröffentlicht: (2026)
von: Guo, Lanqing, et al.
Veröffentlicht: (2026)
Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search
von: Zhang, Jingdong, et al.
Veröffentlicht: (2026)
von: Zhang, Jingdong, et al.
Veröffentlicht: (2026)
Expressive Gaussian Human Avatars from Monocular RGB Video
von: Hu, Hezhen, et al.
Veröffentlicht: (2024)
von: Hu, Hezhen, et al.
Veröffentlicht: (2024)
FMBench: Benchmarking Fairness in Multimodal Large Language Models on Medical Tasks
von: Wu, Peiran, et al.
Veröffentlicht: (2024)
von: Wu, Peiran, et al.
Veröffentlicht: (2024)
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
VQualA 2025 Challenge on Visual Quality Comparison for Large Multimodal Models: Methods and Results
von: Zhu, Hanwei, et al.
Veröffentlicht: (2025)
von: Zhu, Hanwei, et al.
Veröffentlicht: (2025)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
von: Lee, Jusung, et al.
Veröffentlicht: (2024)
von: Lee, Jusung, et al.
Veröffentlicht: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
von: Zheng, Shurong, et al.
Veröffentlicht: (2026)
von: Zheng, Shurong, et al.
Veröffentlicht: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image
von: Hu, Hezhen, et al.
Veröffentlicht: (2026)
von: Hu, Hezhen, et al.
Veröffentlicht: (2026)
GuideSR: Rethinking Guidance for One-Step High-Fidelity Diffusion-Based Super-Resolution
von: Arora, Aditya, et al.
Veröffentlicht: (2025)
von: Arora, Aditya, et al.
Veröffentlicht: (2025)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
HeadsUp! High-Fidelity Portrait Image Super-Resolution
von: Li, Renjie, et al.
Veröffentlicht: (2025)
von: Li, Renjie, et al.
Veröffentlicht: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
von: He, Zhentao, et al.
Veröffentlicht: (2025)
von: He, Zhentao, et al.
Veröffentlicht: (2025)
Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
von: Wang, Pengfei, et al.
Veröffentlicht: (2025)
von: Wang, Pengfei, et al.
Veröffentlicht: (2025)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
von: Chen, Jian, et al.
Veröffentlicht: (2025)
von: Chen, Jian, et al.
Veröffentlicht: (2025)
T2T-VICL: Unlocking the Boundaries of Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
von: Xia, Shao-Jun, et al.
Veröffentlicht: (2025)
von: Xia, Shao-Jun, et al.
Veröffentlicht: (2025)
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
von: Pan, Qingtao, et al.
Veröffentlicht: (2026)
von: Pan, Qingtao, et al.
Veröffentlicht: (2026)
Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning
von: Zhang, Zhifang, et al.
Veröffentlicht: (2024)
von: Zhang, Zhifang, et al.
Veröffentlicht: (2024)
Introducing Visual Perception Token into Multimodal Large Language Model
von: Yu, Runpeng, et al.
Veröffentlicht: (2025)
von: Yu, Runpeng, et al.
Veröffentlicht: (2025)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
von: Guo, Yuchen, et al.
Veröffentlicht: (2026)
von: Guo, Yuchen, et al.
Veröffentlicht: (2026)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
von: Majeedi, Abrar, et al.
Veröffentlicht: (2026)
von: Majeedi, Abrar, et al.
Veröffentlicht: (2026)
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
Visual Representation Alignment for Multimodal Large Language Models
von: Yoon, Heeji, et al.
Veröffentlicht: (2025)
von: Yoon, Heeji, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CIPHER: Culvert Inspection through Pairwise Frame Selection and High-Efficiency Reconstruction
von: Lee, Seoyoung, et al.
Veröffentlicht: (2026) -
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
von: Xing, Shuo, et al.
Veröffentlicht: (2024) -
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
von: Xing, Shuo, et al.
Veröffentlicht: (2024) -
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
von: Qian, Chengxuan, et al.
Veröffentlicht: (2025) -
Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
von: Xing, Shuo, et al.
Veröffentlicht: (2025)