Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Ruixiang, Chen, Changwen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On Semiotic-Grounded Interpretive Evaluation of Generative Art
par: Jiang, Ruixiang, et autres
Publié: (2026)
par: Jiang, Ruixiang, et autres
Publié: (2026)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025)
par: Lai, Zhengzhao, et autres
Publié: (2025)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Can Large Language Models Grasp Event Signals? Exploring Pure Zero-Shot Event-based Recognition
par: Yu, Zongyou, et autres
Publié: (2024)
par: Yu, Zongyou, et autres
Publié: (2024)
LLMs Meet Multimodal Generation and Editing: A Survey
par: He, Yingqing, et autres
Publié: (2024)
par: He, Yingqing, et autres
Publié: (2024)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023)
par: Cheng, Siyuan, et autres
Publié: (2023)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
par: Zhao, Ruixiang, et autres
Publié: (2024)
par: Zhao, Ruixiang, et autres
Publié: (2024)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
par: Jiang, Ruixiang, et autres
Publié: (2024)
par: Jiang, Ruixiang, et autres
Publié: (2024)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
par: Satar, Burak, et autres
Publié: (2025)
par: Satar, Burak, et autres
Publié: (2025)
PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents
par: Wang, Junjie, et autres
Publié: (2024)
par: Wang, Junjie, et autres
Publié: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
par: Wang, Xidong, et autres
Publié: (2024)
par: Wang, Xidong, et autres
Publié: (2024)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
par: Wang, Zihang, et autres
Publié: (2026)
par: Wang, Zihang, et autres
Publié: (2026)
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding
par: Ku, Max, et autres
Publié: (2025)
par: Ku, Max, et autres
Publié: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
NVLM: Open Frontier-Class Multimodal LLMs
par: Dai, Wenliang, et autres
Publié: (2024)
par: Dai, Wenliang, et autres
Publié: (2024)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
par: Chen, Junying, et autres
Publié: (2025)
par: Chen, Junying, et autres
Publié: (2025)
Veagle: Advancements in Multimodal Representation Learning
par: Chawla, Rajat, et autres
Publié: (2024)
par: Chawla, Rajat, et autres
Publié: (2024)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
Recurrence Meets Transformers for Universal Multimodal Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
The Revolution of Multimodal Large Language Models: A Survey
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
par: Mo, Wentao, et autres
Publié: (2026)
par: Mo, Wentao, et autres
Publié: (2026)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
par: Bucciarelli, Davide, et autres
Publié: (2024)
par: Bucciarelli, Davide, et autres
Publié: (2024)
Zero-Shot Visual Deepfake Detection: Can AI Predict and Prevent Fake Content Before It's Created?
par: Sar, Ayan, et autres
Publié: (2025)
par: Sar, Ayan, et autres
Publié: (2025)
VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations
par: Galarnyk, Michael, et autres
Publié: (2025)
par: Galarnyk, Michael, et autres
Publié: (2025)
How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model
par: Song, Shezheng, et autres
Publié: (2023)
par: Song, Shezheng, et autres
Publié: (2023)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models
par: Mattioli, Gabriele, et autres
Publié: (2026)
par: Mattioli, Gabriele, et autres
Publié: (2026)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
par: Bai, Tianyi, et autres
Publié: (2024)
par: Bai, Tianyi, et autres
Publié: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
par: Baraldi, Lorenzo, et autres
Publié: (2025)
par: Baraldi, Lorenzo, et autres
Publié: (2025)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
Documents similaires
-
On Semiotic-Grounded Interpretive Evaluation of Generative Art
par: Jiang, Ruixiang, et autres
Publié: (2026) -
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
par: Wang, Wenxuan, et autres
Publié: (2025) -
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025) -
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024) -
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
par: Zhang, Jun, et autres
Publié: (2025)