TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Kan, Zhehan, Liu, Yanlin, Yin, Kun, Jiang, Xinghua, Li, Xin, Cao, Haoyu, Liu, Yinsong, Jiang, Deqiang, Sun, Xing, Liao, Qingmin, Yang, Wenming |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CATCH: Complementary Adaptive Token-level Contrastive Decoding to Mitigate Hallucinations in LVLMs
by: Kan, Zhehan, et al.
Published: (2024)
by: Kan, Zhehan, et al.
Published: (2024)
HRVDA: High-Resolution Visual Document Assistant
by: Liu, Chaohu, et al.
Published: (2024)
by: Liu, Chaohu, et al.
Published: (2024)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
DREAM: Document Reconstruction via End-to-end Autoregressive Model
by: Li, Xin, et al.
Published: (2025)
by: Li, Xin, et al.
Published: (2025)
DiffVein: A Unified Diffusion Network for Finger Vein Segmentation and Authentication
by: Liu, Yanjun, et al.
Published: (2024)
by: Liu, Yanjun, et al.
Published: (2024)
TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learning
by: Shandilya, Shivam, et al.
Published: (2024)
by: Shandilya, Shivam, et al.
Published: (2024)
UP-Person: Unified Parameter-Efficient Transfer Learning for Text-based Person Retrieval
by: Liu, Yating, et al.
Published: (2025)
by: Liu, Yating, et al.
Published: (2025)
Pose Magic: Efficient and Temporally Consistent Human Pose Estimation with a Hybrid Mamba-GCN Network
by: Zhang, Xinyi, et al.
Published: (2024)
by: Zhang, Xinyi, et al.
Published: (2024)
Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
by: Wang, Chaoyang, et al.
Published: (2025)
by: Wang, Chaoyang, et al.
Published: (2025)
Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models
by: Huang, Minbin, et al.
Published: (2025)
by: Huang, Minbin, et al.
Published: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
by: Li, Hengjia, et al.
Published: (2026)
by: Li, Hengjia, et al.
Published: (2026)
ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning
by: Hou, Bairu, et al.
Published: (2025)
by: Hou, Bairu, et al.
Published: (2025)
TACO: General Acrobatic Flight Control via Target-and-Command-Oriented Reinforcement Learning
by: Yin, Zikang, et al.
Published: (2025)
by: Yin, Zikang, et al.
Published: (2025)
Zero-Shot CFC: Fast Real-World Image Denoising based on Cross-Frequency Consistency
by: Jiang, Yanlin, et al.
Published: (2025)
by: Jiang, Yanlin, et al.
Published: (2025)
Answer First, Reason Later: Aligning Search Relevance via Mode-Balanced Reinforcement Learning
by: Zhang, Shijie, et al.
Published: (2026)
by: Zhang, Shijie, et al.
Published: (2026)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
by: Zhang, Xue, et al.
Published: (2025)
by: Zhang, Xue, et al.
Published: (2025)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
by: Cao, Jie, et al.
Published: (2026)
by: Cao, Jie, et al.
Published: (2026)
OccGaussian: 3D Gaussian Splatting for Occluded Human Rendering
by: Ye, Jingrui, et al.
Published: (2024)
by: Ye, Jingrui, et al.
Published: (2024)
R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
by: Zhang, Zirui, et al.
Published: (2026)
by: Zhang, Zirui, et al.
Published: (2026)
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
by: Jing, Liu, et al.
Published: (2025)
by: Jing, Liu, et al.
Published: (2025)
DM-Adapter: Domain-Aware Mixture-of-Adapters for Text-Based Person Retrieval
by: Liu, Yating, et al.
Published: (2025)
by: Liu, Yating, et al.
Published: (2025)
CLIP-based Synergistic Knowledge Transfer for Text-based Person Retrieval
by: Liu, Yating, et al.
Published: (2023)
by: Liu, Yating, et al.
Published: (2023)
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning
by: Zheng, Ruijie, et al.
Published: (2023)
by: Zheng, Ruijie, et al.
Published: (2023)
InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
by: Yan, Yuchen, et al.
Published: (2026)
by: Yan, Yuchen, et al.
Published: (2026)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
by: Li, Yi, et al.
Published: (2026)
by: Li, Yi, et al.
Published: (2026)
ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
by: Bian, Tingcheng, et al.
Published: (2026)
by: Bian, Tingcheng, et al.
Published: (2026)
Strategic Learning with Asymmetric Rationality
by: Liu, Qingmin, et al.
Published: (2025)
by: Liu, Qingmin, et al.
Published: (2025)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
by: Gao, Shujian, et al.
Published: (2026)
by: Gao, Shujian, et al.
Published: (2026)
SmoothSync: Dual-Stream Diffusion Transformers for Jitter-Robust Beat-Synchronized Gesture Generation from Quantized Audio
by: Jiang, Yujiao, et al.
Published: (2026)
by: Jiang, Yujiao, et al.
Published: (2026)
LLM-Empowered State Representation for Reinforcement Learning
by: Wang, Boyuan, et al.
Published: (2024)
by: Wang, Boyuan, et al.
Published: (2024)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
by: Zhang, Haoji, et al.
Published: (2025)
by: Zhang, Haoji, et al.
Published: (2025)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
by: Wei, Wenda, et al.
Published: (2025)
by: Wei, Wenda, et al.
Published: (2025)
Exploring the System 1 Thinking Capability of Large Reasoning Models
by: Zhang, Wenyuan, et al.
Published: (2025)
by: Zhang, Wenyuan, et al.
Published: (2025)
TACO: Tackling Over-correction in Federated Learning with Tailored Adaptive Correction
by: Liu, Weijie, et al.
Published: (2025)
by: Liu, Weijie, et al.
Published: (2025)
Theoretical Analysis of Measure Consistency Regularization for Partially Observed Data
by: Wang, Yinsong, et al.
Published: (2026)
by: Wang, Yinsong, et al.
Published: (2026)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
by: Liao, Yi, et al.
Published: (2025)
by: Liao, Yi, et al.
Published: (2025)
Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
by: Yin, Kun, et al.
Published: (2026)
by: Yin, Kun, et al.
Published: (2026)
How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality
by: Tu, Minzhu, et al.
Published: (2026)
by: Tu, Minzhu, et al.
Published: (2026)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
by: Wang, Yunxiao, et al.
Published: (2025)
by: Wang, Yunxiao, et al.
Published: (2025)
Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models
by: Wang, Changyue, et al.
Published: (2025)
by: Wang, Changyue, et al.
Published: (2025)
Similar Items
-
CATCH: Complementary Adaptive Token-level Contrastive Decoding to Mitigate Hallucinations in LVLMs
by: Kan, Zhehan, et al.
Published: (2024) -
HRVDA: High-Resolution Visual Document Assistant
by: Liu, Chaohu, et al.
Published: (2024) -
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024) -
DREAM: Document Reconstruction via End-to-end Autoregressive Model
by: Li, Xin, et al.
Published: (2025) -
DiffVein: A Unified Diffusion Network for Finger Vein Segmentation and Authentication
by: Liu, Yanjun, et al.
Published: (2024)