Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Hulingxiao, Geng, Zijun, Peng, Yuxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
por: He, Hulingxiao, et al.
Publicado: (2025)
por: He, Hulingxiao, et al.
Publicado: (2025)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
por: He, Hulingxiao, et al.
Publicado: (2026)
por: He, Hulingxiao, et al.
Publicado: (2026)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
por: Lu, Yi, et al.
Publicado: (2025)
por: Lu, Yi, et al.
Publicado: (2025)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
por: Kancheti, Sai Srinivas, et al.
Publicado: (2026)
por: Kancheti, Sai Srinivas, et al.
Publicado: (2026)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
por: Wu, Linquan, et al.
Publicado: (2026)
por: Wu, Linquan, et al.
Publicado: (2026)
Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
por: Lu, Wenting, et al.
Publicado: (2026)
por: Lu, Wenting, et al.
Publicado: (2026)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
por: Baby, Britty, et al.
Publicado: (2025)
por: Baby, Britty, et al.
Publicado: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
por: Jiang, Chaoya, et al.
Publicado: (2025)
por: Jiang, Chaoya, et al.
Publicado: (2025)
SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition
por: Yang, Jingxiao, et al.
Publicado: (2026)
por: Yang, Jingxiao, et al.
Publicado: (2026)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
por: Xiong, Yuqi, et al.
Publicado: (2026)
por: Xiong, Yuqi, et al.
Publicado: (2026)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
por: Pang, Cong, et al.
Publicado: (2025)
por: Pang, Cong, et al.
Publicado: (2025)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
por: Han, Songhao, et al.
Publicado: (2024)
por: Han, Songhao, et al.
Publicado: (2024)
Fine-Grained Representation for Lane Topology Reasoning
por: Xu, Guoqing, et al.
Publicado: (2025)
por: Xu, Guoqing, et al.
Publicado: (2025)
Saccadic Vision for Fine-Grained Visual Classification
por: Schmidt, Johann, et al.
Publicado: (2025)
por: Schmidt, Johann, et al.
Publicado: (2025)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
por: Ding, Hao, et al.
Publicado: (2026)
por: Ding, Hao, et al.
Publicado: (2026)
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
por: Zhang, Zhenguo, et al.
Publicado: (2025)
por: Zhang, Zhenguo, et al.
Publicado: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
por: Shen, Yuxiang, et al.
Publicado: (2026)
por: Shen, Yuxiang, et al.
Publicado: (2026)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
por: Feng, Sicheng, et al.
Publicado: (2025)
por: Feng, Sicheng, et al.
Publicado: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
por: Chen, Lei, et al.
Publicado: (2025)
por: Chen, Lei, et al.
Publicado: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
por: Guo, Guangfu, et al.
Publicado: (2026)
por: Guo, Guangfu, et al.
Publicado: (2026)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
por: Wu, Xueqing, et al.
Publicado: (2024)
por: Wu, Xueqing, et al.
Publicado: (2024)
A Review on Coarse to Fine-Grained Animal Action Recognition
por: Zia, Ali, et al.
Publicado: (2025)
por: Zia, Ali, et al.
Publicado: (2025)
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
FG-CLIP: Fine-Grained Visual and Textual Alignment
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
por: Pan, Hongkun, et al.
Publicado: (2026)
por: Pan, Hongkun, et al.
Publicado: (2026)
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
por: Chowdhury, Arpita, et al.
Publicado: (2025)
por: Chowdhury, Arpita, et al.
Publicado: (2025)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
por: Zeng, Zhen, et al.
Publicado: (2024)
por: Zeng, Zhen, et al.
Publicado: (2024)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
por: Jain, Riddhi, et al.
Publicado: (2025)
por: Jain, Riddhi, et al.
Publicado: (2025)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
por: Tian, Shulin, et al.
Publicado: (2025)
por: Tian, Shulin, et al.
Publicado: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
por: Zhang, Zhengxuan, et al.
Publicado: (2025)
por: Zhang, Zhengxuan, et al.
Publicado: (2025)
Robust Domain Generalization for Multi-modal Object Recognition
por: Qiao, Yuxin, et al.
Publicado: (2024)
por: Qiao, Yuxin, et al.
Publicado: (2024)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
por: Yi, Shixin, et al.
Publicado: (2025)
por: Yi, Shixin, et al.
Publicado: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
por: Liu, Yaohua, et al.
Publicado: (2025)
por: Liu, Yaohua, et al.
Publicado: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
por: Yan, Siming, et al.
Publicado: (2024)
por: Yan, Siming, et al.
Publicado: (2024)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
por: Gong, Haozhen, et al.
Publicado: (2025)
por: Gong, Haozhen, et al.
Publicado: (2025)
Ejemplares similares
-
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
por: He, Hulingxiao, et al.
Publicado: (2025) -
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
por: He, Hulingxiao, et al.
Publicado: (2026) -
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
por: Lu, Yi, et al.
Publicado: (2025) -
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
por: Kancheti, Sai Srinivas, et al.
Publicado: (2026) -
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
por: Wu, Linquan, et al.
Publicado: (2026)