Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Jingjing, Ma, Chao, Song, Xurui, Zhang, Hanwang, Luo, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
par: Sinha, Sanchit, et autres
Publié: (2026)
par: Sinha, Sanchit, et autres
Publié: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
par: Zhao, Kesen, et autres
Publié: (2025)
par: Zhao, Kesen, et autres
Publié: (2025)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
par: Zhang, Honglu, et autres
Publié: (2025)
par: Zhang, Honglu, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
par: Wang, Yaoting, et autres
Publié: (2025)
par: Wang, Yaoting, et autres
Publié: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
par: Zhang, Jialiang, et autres
Publié: (2026)
par: Zhang, Jialiang, et autres
Publié: (2026)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
par: Li, Xiping, et autres
Publié: (2025)
par: Li, Xiping, et autres
Publié: (2025)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
par: Qi, Mengshi, et autres
Publié: (2025)
par: Qi, Mengshi, et autres
Publié: (2025)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
par: Pham, Tan-Hanh, et autres
Publié: (2025)
par: Pham, Tan-Hanh, et autres
Publié: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026)
par: Ma, Ji, et autres
Publié: (2026)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
par: Yu, Yongsheng, et autres
Publié: (2024)
par: Yu, Yongsheng, et autres
Publié: (2024)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
par: Li, Sijing, et autres
Publié: (2026)
par: Li, Sijing, et autres
Publié: (2026)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
par: Xu, Qinwu, et autres
Publié: (2026)
par: Xu, Qinwu, et autres
Publié: (2026)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
par: Zhao, Kesen, et autres
Publié: (2026)
par: Zhao, Kesen, et autres
Publié: (2026)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
par: Zhang, Daoan, et autres
Publié: (2024)
par: Zhang, Daoan, et autres
Publié: (2024)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
par: Lv, Weijiang, et autres
Publié: (2026)
par: Lv, Weijiang, et autres
Publié: (2026)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
par: Li, Zijian, et autres
Publié: (2025)
par: Li, Zijian, et autres
Publié: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)
par: Peng, Yi, et autres
Publié: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
par: Ma, Qihang, et autres
Publié: (2025)
par: Ma, Qihang, et autres
Publié: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
par: Gu, Jiawei, et autres
Publié: (2025)
par: Gu, Jiawei, et autres
Publié: (2025)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
par: Yuan, Shengming, et autres
Publié: (2025)
par: Yuan, Shengming, et autres
Publié: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
par: Luo, Jingnan, et autres
Publié: (2026)
par: Luo, Jingnan, et autres
Publié: (2026)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing
par: Koksal, Aybora, et autres
Publié: (2025)
par: Koksal, Aybora, et autres
Publié: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
par: Zhou, Qiji, et autres
Publié: (2024)
par: Zhou, Qiji, et autres
Publié: (2024)
CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
SkinCaRe: A Multimodal Dermatology Dataset Annotated with Medical Caption and Chain-of-Thought Reasoning
par: Shen, Yuhao, et autres
Publié: (2024)
par: Shen, Yuhao, et autres
Publié: (2024)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
par: Jiang, Qing, et autres
Publié: (2025)
par: Jiang, Qing, et autres
Publié: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
par: Jiang, Chaoya, et autres
Publié: (2025)
par: Jiang, Chaoya, et autres
Publié: (2025)
Documents similaires
-
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025) -
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
par: Sinha, Sanchit, et autres
Publié: (2026) -
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
par: Zhao, Kesen, et autres
Publié: (2025) -
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
par: Zhang, Honglu, et autres
Publié: (2025) -
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)