ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Villegas, Danae Sánchez, Ziegler, Ingo, Elliott, Desmond |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
Evaluating Numerical Reasoning in Text-to-Image Models
di: Kajić, Ivana, et al.
Pubblicazione: (2024)
di: Kajić, Ivana, et al.
Pubblicazione: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
di: Arazi, Alan, et al.
Pubblicazione: (2026)
di: Arazi, Alan, et al.
Pubblicazione: (2026)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
FairCoT: Enhancing Fairness in Text-to-Image Generation via Chain of Thought Reasoning with Multimodal Large Language Models
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2024)
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
di: Lei, Jiayi, et al.
Pubblicazione: (2025)
di: Lei, Jiayi, et al.
Pubblicazione: (2025)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
Interleaving Reasoning for Better Text-to-Image Generation
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
di: Qin, Yulei, et al.
Pubblicazione: (2025)
di: Qin, Yulei, et al.
Pubblicazione: (2025)
BiasConnect: Investigating Bias Interactions in Text-to-Image Models
di: Shukla, Pushkar, et al.
Pubblicazione: (2025)
di: Shukla, Pushkar, et al.
Pubblicazione: (2025)
LaVy: Vietnamese Multimodal Large Language Model
di: Tran, Chi, et al.
Pubblicazione: (2024)
di: Tran, Chi, et al.
Pubblicazione: (2024)
Preference Adaptive and Sequential Text-to-Image Generation
di: Nabati, Ofir, et al.
Pubblicazione: (2024)
di: Nabati, Ofir, et al.
Pubblicazione: (2024)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
di: Yariv, Guy, et al.
Pubblicazione: (2024)
di: Yariv, Guy, et al.
Pubblicazione: (2024)
FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
di: Fu, Zihao, et al.
Pubblicazione: (2025)
di: Fu, Zihao, et al.
Pubblicazione: (2025)
Improving Multimodal Large Language Models Using Continual Learning
di: Srivastava, Shikhar, et al.
Pubblicazione: (2024)
di: Srivastava, Shikhar, et al.
Pubblicazione: (2024)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
di: Qian, Yusu, et al.
Pubblicazione: (2025)
di: Qian, Yusu, et al.
Pubblicazione: (2025)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Ethical-Lens: Curbing Malicious Usages of Open-Source Text-to-Image Models
di: Cai, Yuzhu, et al.
Pubblicazione: (2024)
di: Cai, Yuzhu, et al.
Pubblicazione: (2024)
ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion Models
di: Patel, Maitreya, et al.
Pubblicazione: (2023)
di: Patel, Maitreya, et al.
Pubblicazione: (2023)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
di: Ye, Qinghao, et al.
Pubblicazione: (2023)
Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models
di: Xu, Xiao, et al.
Pubblicazione: (2024)
di: Xu, Xiao, et al.
Pubblicazione: (2024)
PALP: Prompt Aligned Personalization of Text-to-Image Models
di: Arar, Moab, et al.
Pubblicazione: (2024)
di: Arar, Moab, et al.
Pubblicazione: (2024)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
di: Su, Hung-Ting, et al.
Pubblicazione: (2024)
di: Su, Hung-Ting, et al.
Pubblicazione: (2024)
Alt-Text with Context: Improving Accessibility for Images on Twitter
di: Srivatsan, Nikita, et al.
Pubblicazione: (2023)
di: Srivatsan, Nikita, et al.
Pubblicazione: (2023)
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Efficient Test-Time Scaling for Small Vision-Language Models
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026) -
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
di: Wang, Jinyin, et al.
Pubblicazione: (2024) -
Evaluating Numerical Reasoning in Text-to-Image Models
di: Kajić, Ivana, et al.
Pubblicazione: (2024) -
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
di: Xu, Qinwu, et al.
Pubblicazione: (2026) -
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
di: Wang, Xiyao, et al.
Pubblicazione: (2024)