Guardado en:
| Autores principales: | Dreyer, Florian, Kolos, Ekaterina, Matiash, Daria |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2503.01064 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SciMDR: Advancing Scientific Multimodal Document Reasoning
por: Chen, Ziyu, et al.
Publicado: (2026)
por: Chen, Ziyu, et al.
Publicado: (2026)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
por: Kil, Jihyung, et al.
Publicado: (2024)
por: Kil, Jihyung, et al.
Publicado: (2024)
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025)
por: Zhang, Xinchen, et al.
Publicado: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
por: Jiang, Ruixiang, et al.
Publicado: (2025)
por: Jiang, Ruixiang, et al.
Publicado: (2025)
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
por: Chiu, Bo-Cheng, et al.
Publicado: (2025)
por: Chiu, Bo-Cheng, et al.
Publicado: (2025)
Cross-modal Information Flow in Multimodal Large Language Models
por: Zhang, Zhi, et al.
Publicado: (2024)
por: Zhang, Zhi, et al.
Publicado: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
por: Zhang, Leixin, et al.
Publicado: (2024)
por: Zhang, Leixin, et al.
Publicado: (2024)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
por: Zhou, Shijie, et al.
Publicado: (2025)
por: Zhou, Shijie, et al.
Publicado: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
por: Zhao, Xiangyu, et al.
Publicado: (2023)
por: Zhao, Xiangyu, et al.
Publicado: (2023)
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
por: Saxena, Rohit, et al.
Publicado: (2025)
por: Saxena, Rohit, et al.
Publicado: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
por: Pramanick, Shraman, et al.
Publicado: (2024)
por: Pramanick, Shraman, et al.
Publicado: (2024)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
por: Song, Tingyu, et al.
Publicado: (2025)
por: Song, Tingyu, et al.
Publicado: (2025)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
por: Yu, Shoubin, et al.
Publicado: (2025)
por: Yu, Shoubin, et al.
Publicado: (2025)
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
por: Fu, Xingyu, et al.
Publicado: (2025)
por: Fu, Xingyu, et al.
Publicado: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
por: Yu, Zhuoran, et al.
Publicado: (2025)
por: Yu, Zhuoran, et al.
Publicado: (2025)
MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding
por: Li, Zekun, et al.
Publicado: (2024)
por: Li, Zekun, et al.
Publicado: (2024)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
por: Hsu, Ting-Yao E., et al.
Publicado: (2025)
por: Hsu, Ting-Yao E., et al.
Publicado: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
por: Li, Yunxin, et al.
Publicado: (2023)
por: Li, Yunxin, et al.
Publicado: (2023)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
por: Leng, Jixuan, et al.
Publicado: (2025)
por: Leng, Jixuan, et al.
Publicado: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
por: Caffagni, Davide, et al.
Publicado: (2024)
por: Caffagni, Davide, et al.
Publicado: (2024)
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
Multimodal Fact-Level Attribution for Verifiable Reasoning
por: Wan, David, et al.
Publicado: (2026)
por: Wan, David, et al.
Publicado: (2026)
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
por: Khayatan, Pegah, et al.
Publicado: (2025)
por: Khayatan, Pegah, et al.
Publicado: (2025)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks
por: Papi, Sara, et al.
Publicado: (2025)
por: Papi, Sara, et al.
Publicado: (2025)
LLMs Meet Multimodal Generation and Editing: A Survey
por: He, Yingqing, et al.
Publicado: (2024)
por: He, Yingqing, et al.
Publicado: (2024)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
por: Cai, Zhenyang, et al.
Publicado: (2024)
por: Cai, Zhenyang, et al.
Publicado: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
por: Cai, Zhenyang, et al.
Publicado: (2025)
por: Cai, Zhenyang, et al.
Publicado: (2025)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
por: Liao, Huanxuan, et al.
Publicado: (2026)
por: Liao, Huanxuan, et al.
Publicado: (2026)
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
por: Saxena, Rohit, et al.
Publicado: (2025)
por: Saxena, Rohit, et al.
Publicado: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
por: Batra, Hunar, et al.
Publicado: (2025)
por: Batra, Hunar, et al.
Publicado: (2025)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
por: Jiang, Yulun, et al.
Publicado: (2025)
por: Jiang, Yulun, et al.
Publicado: (2025)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
por: Ashraf, Tajamul, et al.
Publicado: (2025)
por: Ashraf, Tajamul, et al.
Publicado: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research
por: Burgess, James, et al.
Publicado: (2025)
por: Burgess, James, et al.
Publicado: (2025)
Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
por: Sarto, Sara, et al.
Publicado: (2025)
por: Sarto, Sara, et al.
Publicado: (2025)
Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring
por: Onsu, Murat Arda, et al.
Publicado: (2025)
por: Onsu, Murat Arda, et al.
Publicado: (2025)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
por: Patil, Vaidehi, et al.
Publicado: (2025)
por: Patil, Vaidehi, et al.
Publicado: (2025)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
por: Zhang, Jiarui, et al.
Publicado: (2024)
por: Zhang, Jiarui, et al.
Publicado: (2024)
Ejemplares similares
-
SciMDR: Advancing Scientific Multimodal Document Reasoning
por: Chen, Ziyu, et al.
Publicado: (2026) -
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
por: Kil, Jihyung, et al.
Publicado: (2024) -
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025) -
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
por: Jiang, Ruixiang, et al.
Publicado: (2025) -
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
por: Chiu, Bo-Cheng, et al.
Publicado: (2025)