Enregistré dans:
| Auteurs principaux: | Dreyer, Florian, Kolos, Ekaterina, Matiash, Daria |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2503.01064 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026)
par: Chen, Ziyu, et autres
Publié: (2026)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Generative Universal Verifier as Multimodal Meta-Reasoner
par: Zhang, Xinchen, et autres
Publié: (2025)
par: Zhang, Xinchen, et autres
Publié: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
par: Jiang, Ruixiang, et autres
Publié: (2025)
par: Jiang, Ruixiang, et autres
Publié: (2025)
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
par: Chiu, Bo-Cheng, et autres
Publié: (2025)
par: Chiu, Bo-Cheng, et autres
Publié: (2025)
Cross-modal Information Flow in Multimodal Large Language Models
par: Zhang, Zhi, et autres
Publié: (2024)
par: Zhang, Zhi, et autres
Publié: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
par: Zhang, Leixin, et autres
Publié: (2024)
par: Zhang, Leixin, et autres
Publié: (2024)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
par: Zhao, Xiangyu, et autres
Publié: (2023)
par: Zhao, Xiangyu, et autres
Publié: (2023)
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
par: Fu, Xingyu, et autres
Publié: (2025)
par: Fu, Xingyu, et autres
Publié: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding
par: Li, Zekun, et autres
Publié: (2024)
par: Li, Zekun, et autres
Publié: (2024)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
par: Li, Yunxin, et autres
Publié: (2023)
par: Li, Yunxin, et autres
Publié: (2023)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
par: Leng, Jixuan, et autres
Publié: (2025)
par: Leng, Jixuan, et autres
Publié: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
Multimodal Fact-Level Attribution for Verifiable Reasoning
par: Wan, David, et autres
Publié: (2026)
par: Wan, David, et autres
Publié: (2026)
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
par: Khayatan, Pegah, et autres
Publié: (2025)
par: Khayatan, Pegah, et autres
Publié: (2025)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks
par: Papi, Sara, et autres
Publié: (2025)
par: Papi, Sara, et autres
Publié: (2025)
LLMs Meet Multimodal Generation and Editing: A Survey
par: He, Yingqing, et autres
Publié: (2024)
par: He, Yingqing, et autres
Publié: (2024)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
par: Cai, Zhenyang, et autres
Publié: (2024)
par: Cai, Zhenyang, et autres
Publié: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
par: Cai, Zhenyang, et autres
Publié: (2025)
par: Cai, Zhenyang, et autres
Publié: (2025)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
par: Liao, Huanxuan, et autres
Publié: (2026)
par: Liao, Huanxuan, et autres
Publié: (2026)
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
par: Wang, Yuqing, et autres
Publié: (2023)
par: Wang, Yuqing, et autres
Publié: (2023)
MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research
par: Burgess, James, et autres
Publié: (2025)
par: Burgess, James, et autres
Publié: (2025)
Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
par: Sarto, Sara, et autres
Publié: (2025)
par: Sarto, Sara, et autres
Publié: (2025)
Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring
par: Onsu, Murat Arda, et autres
Publié: (2025)
par: Onsu, Murat Arda, et autres
Publié: (2025)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
par: Patil, Vaidehi, et autres
Publié: (2025)
par: Patil, Vaidehi, et autres
Publié: (2025)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
par: Zhang, Jiarui, et autres
Publié: (2024)
par: Zhang, Jiarui, et autres
Publié: (2024)
Documents similaires
-
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026) -
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024) -
Generative Universal Verifier as Multimodal Meta-Reasoner
par: Zhang, Xinchen, et autres
Publié: (2025) -
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
par: Jiang, Ruixiang, et autres
Publié: (2025) -
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
par: Chiu, Bo-Cheng, et autres
Publié: (2025)