A Thousand Words or An Image: Studying the Influence of Persona Modality in Multimodal LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Broomfield, Julius, Sharma, Kartik, Kumar, Srijan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space
di: Verma, Gaurav, et al.
Pubblicazione: (2024)
di: Verma, Gaurav, et al.
Pubblicazione: (2024)
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026)
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026)
Using Images to Find Context-Independent Word Representations in Vector Space
di: Kumar, Harsh
Pubblicazione: (2024)
di: Kumar, Harsh
Pubblicazione: (2024)
WordVIS: A Color Worth A Thousand Words
di: Khan, Umar, et al.
Pubblicazione: (2024)
di: Khan, Umar, et al.
Pubblicazione: (2024)
Beyond Words: Multimodal LLM Knows When to Speak
di: Liao, Zikai, et al.
Pubblicazione: (2025)
di: Liao, Zikai, et al.
Pubblicazione: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
Are a Thousand Words Better Than a Single Picture? Beyond Images -- A Framework for Multi-Modal Knowledge Graph Dataset Enrichment
di: Zhang, Pengyu, et al.
Pubblicazione: (2026)
di: Zhang, Pengyu, et al.
Pubblicazione: (2026)
Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
di: Sarto, Sara, et al.
Pubblicazione: (2025)
di: Sarto, Sara, et al.
Pubblicazione: (2025)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework
di: Li, Feiran, et al.
Pubblicazione: (2025)
di: Li, Feiran, et al.
Pubblicazione: (2025)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
di: Leng, Jixuan, et al.
Pubblicazione: (2025)
di: Leng, Jixuan, et al.
Pubblicazione: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
di: Yu, Zhuoran, et al.
Pubblicazione: (2025)
di: Yu, Zhuoran, et al.
Pubblicazione: (2025)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
di: Zhang, Huixuan, et al.
Pubblicazione: (2023)
di: Zhang, Huixuan, et al.
Pubblicazione: (2023)
Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
di: Padhi, Trilok, et al.
Pubblicazione: (2025)
di: Padhi, Trilok, et al.
Pubblicazione: (2025)
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2023)
di: Li, Yunxin, et al.
Pubblicazione: (2023)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
di: Dreyer, Florian, et al.
Pubblicazione: (2025)
di: Dreyer, Florian, et al.
Pubblicazione: (2025)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
di: Zhu, Zhihao, et al.
Pubblicazione: (2026)
di: Zhu, Zhihao, et al.
Pubblicazione: (2026)
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
di: Khayatan, Pegah, et al.
Pubblicazione: (2025)
di: Khayatan, Pegah, et al.
Pubblicazione: (2025)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
di: Cai, Zhenyang, et al.
Pubblicazione: (2024)
di: Cai, Zhenyang, et al.
Pubblicazione: (2024)
The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models
di: Paruchuri, Akshay, et al.
Pubblicazione: (2026)
di: Paruchuri, Akshay, et al.
Pubblicazione: (2026)
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
di: Saxena, Rohit, et al.
Pubblicazione: (2025)
di: Saxena, Rohit, et al.
Pubblicazione: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
di: Zhao, Xiangyu, et al.
Pubblicazione: (2023)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2023)
Multi-Modal Language Models as Text-to-Image Model Evaluators
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
di: Chiu, Bo-Cheng, et al.
Pubblicazione: (2025)
di: Chiu, Bo-Cheng, et al.
Pubblicazione: (2025)
MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding
di: Zhong, Ziqi, et al.
Pubblicazione: (2025)
di: Zhong, Ziqi, et al.
Pubblicazione: (2025)
MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
di: Chen, Haonan, et al.
Pubblicazione: (2025)
di: Chen, Haonan, et al.
Pubblicazione: (2025)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
di: Caffagni, Davide, et al.
Pubblicazione: (2025)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
di: Song, Tingyu, et al.
Pubblicazione: (2025)
di: Song, Tingyu, et al.
Pubblicazione: (2025)
Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring
di: Onsu, Murat Arda, et al.
Pubblicazione: (2025)
di: Onsu, Murat Arda, et al.
Pubblicazione: (2025)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
di: Patil, Vaidehi, et al.
Pubblicazione: (2025)
di: Patil, Vaidehi, et al.
Pubblicazione: (2025)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
di: Yu, Jiazuo, et al.
Pubblicazione: (2024)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
di: Kou, Siqi, et al.
Pubblicazione: (2024)
di: Kou, Siqi, et al.
Pubblicazione: (2024)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space
di: Verma, Gaurav, et al.
Pubblicazione: (2024) -
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
di: Jung, Jaeyoon, et al.
Pubblicazione: (2026) -
Using Images to Find Context-Independent Word Representations in Vector Space
di: Kumar, Harsh
Pubblicazione: (2024) -
WordVIS: A Color Worth A Thousand Words
di: Khan, Umar, et al.
Pubblicazione: (2024) -
Beyond Words: Multimodal LLM Knows When to Speak
di: Liao, Zikai, et al.
Pubblicazione: (2025)