Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Jingjing, Ma, Chao, Song, Xurui, Zhang, Hanwang, Luo, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2026)
por: Sinha, Sanchit, et al.
Publicado: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
por: Zhao, Kesen, et al.
Publicado: (2025)
por: Zhao, Kesen, et al.
Publicado: (2025)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
por: Zhang, Honglu, et al.
Publicado: (2025)
por: Zhang, Honglu, et al.
Publicado: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
por: Wang, Yaoting, et al.
Publicado: (2025)
por: Wang, Yaoting, et al.
Publicado: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
por: Zuo, Jing, et al.
Publicado: (2026)
por: Zuo, Jing, et al.
Publicado: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
por: Li, Xiping, et al.
Publicado: (2025)
por: Li, Xiping, et al.
Publicado: (2025)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
por: Qi, Mengshi, et al.
Publicado: (2025)
por: Qi, Mengshi, et al.
Publicado: (2025)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
por: Pham, Tan-Hanh, et al.
Publicado: (2025)
por: Pham, Tan-Hanh, et al.
Publicado: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
por: Ma, Ji, et al.
Publicado: (2026)
por: Ma, Ji, et al.
Publicado: (2026)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
por: Yu, Yongsheng, et al.
Publicado: (2024)
por: Yu, Yongsheng, et al.
Publicado: (2024)
TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
por: Li, Sijing, et al.
Publicado: (2026)
por: Li, Sijing, et al.
Publicado: (2026)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
por: Xu, Qinwu, et al.
Publicado: (2026)
por: Xu, Qinwu, et al.
Publicado: (2026)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
por: Zhao, Kesen, et al.
Publicado: (2026)
por: Zhao, Kesen, et al.
Publicado: (2026)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
por: Zhang, Daoan, et al.
Publicado: (2024)
por: Zhang, Daoan, et al.
Publicado: (2024)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
por: Lv, Weijiang, et al.
Publicado: (2026)
por: Lv, Weijiang, et al.
Publicado: (2026)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
por: Li, Zijian, et al.
Publicado: (2025)
por: Li, Zijian, et al.
Publicado: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
por: Peng, Yi, et al.
Publicado: (2025)
por: Peng, Yi, et al.
Publicado: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
por: Liu, Zuyan, et al.
Publicado: (2024)
por: Liu, Zuyan, et al.
Publicado: (2024)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
por: Ma, Qihang, et al.
Publicado: (2025)
por: Ma, Qihang, et al.
Publicado: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
por: Gu, Jiawei, et al.
Publicado: (2025)
por: Gu, Jiawei, et al.
Publicado: (2025)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
por: Yuan, Shengming, et al.
Publicado: (2025)
por: Yuan, Shengming, et al.
Publicado: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
por: Qin, Luozheng, et al.
Publicado: (2025)
por: Qin, Luozheng, et al.
Publicado: (2025)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
por: Luo, Jingnan, et al.
Publicado: (2026)
por: Luo, Jingnan, et al.
Publicado: (2026)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing
por: Koksal, Aybora, et al.
Publicado: (2025)
por: Koksal, Aybora, et al.
Publicado: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
por: Wen, Junjie, et al.
Publicado: (2025)
por: Wen, Junjie, et al.
Publicado: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024)
por: Zhou, Qiji, et al.
Publicado: (2024)
CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
SkinCaRe: A Multimodal Dermatology Dataset Annotated with Medical Caption and Chain-of-Thought Reasoning
por: Shen, Yuhao, et al.
Publicado: (2024)
por: Shen, Yuhao, et al.
Publicado: (2024)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
por: Jiang, Chaoya, et al.
Publicado: (2025)
por: Jiang, Chaoya, et al.
Publicado: (2025)
Ejemplares similares
-
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
por: Jiang, Jingjing, et al.
Publicado: (2025) -
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2026) -
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
por: Zhao, Kesen, et al.
Publicado: (2025) -
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
por: Zhang, Honglu, et al.
Publicado: (2025) -
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)