Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Luo, Wenjie, Li, Ruocheng, Zhu, Shanshan, Perry, Julian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning
von: Perry, Julian, et al.
Veröffentlicht: (2025)
von: Perry, Julian, et al.
Veröffentlicht: (2025)
MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models
von: Cohen, Vanya, et al.
Veröffentlicht: (2025)
von: Cohen, Vanya, et al.
Veröffentlicht: (2025)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
von: Moll, Johannes, et al.
Veröffentlicht: (2025)
von: Moll, Johannes, et al.
Veröffentlicht: (2025)
Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
von: Tanji, Naoto, et al.
Veröffentlicht: (2025)
von: Tanji, Naoto, et al.
Veröffentlicht: (2025)
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)
MSA at ImageCLEF 2025 Multimodal Reasoning: Multilingual Multimodal Reasoning With Ensemble Vision Language Models
von: Ahmed, Seif, et al.
Veröffentlicht: (2025)
von: Ahmed, Seif, et al.
Veröffentlicht: (2025)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models
von: Torres-Camps, Aleix, et al.
Veröffentlicht: (2026)
von: Torres-Camps, Aleix, et al.
Veröffentlicht: (2026)
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
von: Xu, Qiancheng, et al.
Veröffentlicht: (2024)
von: Xu, Qiancheng, et al.
Veröffentlicht: (2024)
Hypothesis Search: Inductive Reasoning with Language Models
von: Wang, Ruocheng, et al.
Veröffentlicht: (2023)
von: Wang, Ruocheng, et al.
Veröffentlicht: (2023)
Weak Supervision Dynamic KL-Weighted Diffusion Models Guided by Large Language Models
von: Perry, Julian, et al.
Veröffentlicht: (2025)
von: Perry, Julian, et al.
Veröffentlicht: (2025)
Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification
von: Li, Yanxi, et al.
Veröffentlicht: (2025)
von: Li, Yanxi, et al.
Veröffentlicht: (2025)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models
von: Bharthulwar, Sid, et al.
Veröffentlicht: (2025)
von: Bharthulwar, Sid, et al.
Veröffentlicht: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
von: Ding, Yi, et al.
Veröffentlicht: (2025)
von: Ding, Yi, et al.
Veröffentlicht: (2025)
Conformal Language Model Reasoning with Coherent Factuality
von: Rubin-Toles, Maxon, et al.
Veröffentlicht: (2025)
von: Rubin-Toles, Maxon, et al.
Veröffentlicht: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
von: Jia, Boyu, et al.
Veröffentlicht: (2025)
von: Jia, Boyu, et al.
Veröffentlicht: (2025)
SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself
von: Gao, Jun, et al.
Veröffentlicht: (2024)
von: Gao, Jun, et al.
Veröffentlicht: (2024)
RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answering
von: He, Bolei, et al.
Veröffentlicht: (2025)
von: He, Bolei, et al.
Veröffentlicht: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
von: Li, Zhu, et al.
Veröffentlicht: (2025)
von: Li, Zhu, et al.
Veröffentlicht: (2025)
ReBeCA: Unveiling Interpretable Behavior Hierarchy behind the Iterative Self-Reflection of Language Models with Causal Analysis
von: Yan, Tianqiang, et al.
Veröffentlicht: (2026)
von: Yan, Tianqiang, et al.
Veröffentlicht: (2026)
Self-Critique Guided Iterative Reasoning for Multi-hop Question Answering
von: Chu, Zheng, et al.
Veröffentlicht: (2025)
von: Chu, Zheng, et al.
Veröffentlicht: (2025)
IterAlign: Iterative Constitutional Alignment of Large Language Models
von: Chen, Xiusi, et al.
Veröffentlicht: (2024)
von: Chen, Xiusi, et al.
Veröffentlicht: (2024)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2024)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2024)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey
von: Shou, Yuntao, et al.
Veröffentlicht: (2025)
von: Shou, Yuntao, et al.
Veröffentlicht: (2025)
Semantic Self-Consistency: Enhancing Language Model Reasoning via Semantic Weighting
von: Knappe, Tim, et al.
Veröffentlicht: (2024)
von: Knappe, Tim, et al.
Veröffentlicht: (2024)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
von: Qu, Xiaoye, et al.
Veröffentlicht: (2025)
von: Qu, Xiaoye, et al.
Veröffentlicht: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning
von: Wang, Weiqi, et al.
Veröffentlicht: (2024)
von: Wang, Weiqi, et al.
Veröffentlicht: (2024)
Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
von: Yao, Jiashu, et al.
Veröffentlicht: (2025)
von: Yao, Jiashu, et al.
Veröffentlicht: (2025)
Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search
von: Sun, Haoran, et al.
Veröffentlicht: (2025)
von: Sun, Haoran, et al.
Veröffentlicht: (2025)
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
von: Shi, Zhengliang, et al.
Veröffentlicht: (2025)
von: Shi, Zhengliang, et al.
Veröffentlicht: (2025)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
von: Li, Moxin, et al.
Veröffentlicht: (2024)
von: Li, Moxin, et al.
Veröffentlicht: (2024)
HydraRAG: Structured Cross-Source Enhanced Large Language Model Reasoning
von: Tan, Xingyu, et al.
Veröffentlicht: (2025)
von: Tan, Xingyu, et al.
Veröffentlicht: (2025)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
von: Ashraf, Tajamul, et al.
Veröffentlicht: (2025)
von: Ashraf, Tajamul, et al.
Veröffentlicht: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
von: Liu, Daixian, et al.
Veröffentlicht: (2026)
von: Liu, Daixian, et al.
Veröffentlicht: (2026)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
von: Cheng, Xianfu, et al.
Veröffentlicht: (2025)
von: Cheng, Xianfu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning
von: Perry, Julian, et al.
Veröffentlicht: (2025) -
MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models
von: Cohen, Vanya, et al.
Veröffentlicht: (2025) -
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
von: Moll, Johannes, et al.
Veröffentlicht: (2025) -
Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
von: Tanji, Naoto, et al.
Veröffentlicht: (2025) -
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)