MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chakrabarty, Sayak, Pal, Souradip |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
por: Xu, Mingjun, et al.
Publicado: (2025)
por: Xu, Mingjun, et al.
Publicado: (2025)
PixRec: Leveraging Visual Context for Next-Item Prediction in Sequential Recommendation
por: Chakrabarty, Sayak, et al.
Publicado: (2026)
por: Chakrabarty, Sayak, et al.
Publicado: (2026)
MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets
por: Wei, Lai, et al.
Publicado: (2023)
por: Wei, Lai, et al.
Publicado: (2023)
PRA-PoE: Robust Multimodal Alzheimer's Diagnosis with Arbitrary Missing Modalities
por: Yang, Guangqian, et al.
Publicado: (2026)
por: Yang, Guangqian, et al.
Publicado: (2026)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
por: Li, Zejun, et al.
Publicado: (2024)
por: Li, Zejun, et al.
Publicado: (2024)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
por: Padhi, Trilok, et al.
Publicado: (2025)
por: Padhi, Trilok, et al.
Publicado: (2025)
Multi-Modal Language Models as Text-to-Image Model Evaluators
por: Chen, Jiahui, et al.
Publicado: (2025)
por: Chen, Jiahui, et al.
Publicado: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
por: He, Zheqi, et al.
Publicado: (2025)
por: He, Zheqi, et al.
Publicado: (2025)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
por: Zong, Yi, et al.
Publicado: (2024)
por: Zong, Yi, et al.
Publicado: (2024)
Core Knowledge Deficits in Multi-Modal Language Models
por: Li, Yijiang, et al.
Publicado: (2024)
por: Li, Yijiang, et al.
Publicado: (2024)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
por: Zhu, Zhihao, et al.
Publicado: (2026)
por: Zhu, Zhihao, et al.
Publicado: (2026)
xGen-MM (BLIP-3): A Family of Open Large Multimodal Models
por: Xue, Le, et al.
Publicado: (2024)
por: Xue, Le, et al.
Publicado: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
por: Huang, Chengyue, et al.
Publicado: (2025)
por: Huang, Chengyue, et al.
Publicado: (2025)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
por: Zhong, Yiwu, et al.
Publicado: (2024)
por: Zhong, Yiwu, et al.
Publicado: (2024)
MM-Diff: High-Fidelity Image Personalization via Multi-Modal Condition Integration
por: Wei, Zhichao, et al.
Publicado: (2024)
por: Wei, Zhichao, et al.
Publicado: (2024)
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
por: Zhao, Haozhe, et al.
Publicado: (2023)
por: Zhao, Haozhe, et al.
Publicado: (2023)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
por: Zhao, Bingchen, et al.
Publicado: (2024)
por: Zhao, Bingchen, et al.
Publicado: (2024)
Revisiting Multi-Modal LLM Evaluation
por: Lu, Jian, et al.
Publicado: (2024)
por: Lu, Jian, et al.
Publicado: (2024)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2024)
por: Yu, Weihao, et al.
Publicado: (2024)
From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation
por: Chen, Zhen, et al.
Publicado: (2025)
por: Chen, Zhen, et al.
Publicado: (2025)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
por: Li, Shilong, et al.
Publicado: (2025)
por: Li, Shilong, et al.
Publicado: (2025)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
por: Huang, Wenjun, et al.
Publicado: (2024)
por: Huang, Wenjun, et al.
Publicado: (2024)
PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
por: Ananthram, Amith, et al.
Publicado: (2025)
por: Ananthram, Amith, et al.
Publicado: (2025)
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
por: Wang, Jiaze, et al.
Publicado: (2024)
por: Wang, Jiaze, et al.
Publicado: (2024)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
por: Zhou, Ziwei, et al.
Publicado: (2025)
por: Zhou, Ziwei, et al.
Publicado: (2025)
Understanding Figurative Meaning through Explainable Visual Entailment
por: Saakyan, Arkadiy, et al.
Publicado: (2024)
por: Saakyan, Arkadiy, et al.
Publicado: (2024)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
por: Chen, Yi-Chia, et al.
Publicado: (2024)
por: Chen, Yi-Chia, et al.
Publicado: (2024)
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
por: Li, Mukai, et al.
Publicado: (2024)
por: Li, Mukai, et al.
Publicado: (2024)
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
por: Lee, Sua, et al.
Publicado: (2026)
por: Lee, Sua, et al.
Publicado: (2026)
APLe: Token-Wise Adaptive for Multi-Modal Prompt Learning
por: Cao, Guiming, et al.
Publicado: (2024)
por: Cao, Guiming, et al.
Publicado: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2023)
por: Yu, Weihao, et al.
Publicado: (2023)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)
por: Yan, Bei, et al.
Publicado: (2024)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
por: Yu, Jiazuo, et al.
Publicado: (2024)
por: Yu, Jiazuo, et al.
Publicado: (2024)
What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration
por: Qin, Libo, et al.
Publicado: (2024)
por: Qin, Libo, et al.
Publicado: (2024)
Dermacen Analytica: A Novel Methodology Integrating Multi-Modal Large Language Models with Machine Learning in tele-dermatology
por: Panagoulias, Dimitrios P., et al.
Publicado: (2024)
por: Panagoulias, Dimitrios P., et al.
Publicado: (2024)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
por: Zhang, Yuhui, et al.
Publicado: (2025)
por: Zhang, Yuhui, et al.
Publicado: (2025)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
por: Wei, Lai, et al.
Publicado: (2025)
por: Wei, Lai, et al.
Publicado: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
Ejemplares similares
-
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
por: Xu, Mingjun, et al.
Publicado: (2025) -
PixRec: Leveraging Visual Context for Next-Item Prediction in Sequential Recommendation
por: Chakrabarty, Sayak, et al.
Publicado: (2026) -
MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets
por: Wei, Lai, et al.
Publicado: (2023) -
PRA-PoE: Robust Multimodal Alzheimer's Diagnosis with Arbitrary Missing Modalities
por: Yang, Guangqian, et al.
Publicado: (2026) -
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
por: Li, Zejun, et al.
Publicado: (2024)