ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Xiaoshu, Zhou, Sihang, Liang, Ke, Zhou, Taichun, Liu, Xinwang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
von: Chen, Xinyan, et al.
Veröffentlicht: (2025)
von: Chen, Xinyan, et al.
Veröffentlicht: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
von: Liu, Juntao, et al.
Veröffentlicht: (2025)
von: Liu, Juntao, et al.
Veröffentlicht: (2025)
Distilling Reasoning Ability from Large Language Models with Adaptive Thinking
von: Chen, Xiaoshu, et al.
Veröffentlicht: (2024)
von: Chen, Xiaoshu, et al.
Veröffentlicht: (2024)
Efficient Reasoning via Thought Compression for Language Segmentation
von: Zhou, Qing, et al.
Veröffentlicht: (2026)
von: Zhou, Qing, et al.
Veröffentlicht: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
von: Qiao, Bingtian, et al.
Veröffentlicht: (2026)
von: Qiao, Bingtian, et al.
Veröffentlicht: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
von: Shao, Hao, et al.
Veröffentlicht: (2024)
von: Shao, Hao, et al.
Veröffentlicht: (2024)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025)
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
von: Zhou, Qiji, et al.
Veröffentlicht: (2024)
von: Zhou, Qiji, et al.
Veröffentlicht: (2024)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
von: Dong, Yuhao, et al.
Veröffentlicht: (2024)
von: Dong, Yuhao, et al.
Veröffentlicht: (2024)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
von: Zhong, Zhide, et al.
Veröffentlicht: (2026)
von: Zhong, Zhide, et al.
Veröffentlicht: (2026)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
von: Dai, Xuanlang, et al.
Veröffentlicht: (2026)
von: Dai, Xuanlang, et al.
Veröffentlicht: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
von: Jiang, Jingjing, et al.
Veröffentlicht: (2025)
von: Jiang, Jingjing, et al.
Veröffentlicht: (2025)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
von: Zeng, Sen, et al.
Veröffentlicht: (2026)
von: Zeng, Sen, et al.
Veröffentlicht: (2026)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
von: Shi, Weikang, et al.
Veröffentlicht: (2025)
von: Shi, Weikang, et al.
Veröffentlicht: (2025)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
von: Shao, Kele, et al.
Veröffentlicht: (2025)
von: Shao, Kele, et al.
Veröffentlicht: (2025)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
von: Jiao, Qirui, et al.
Veröffentlicht: (2024)
von: Jiao, Qirui, et al.
Veröffentlicht: (2024)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
von: Zhang, Honglu, et al.
Veröffentlicht: (2025)
von: Zhang, Honglu, et al.
Veröffentlicht: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
von: Lu, Hongyu, et al.
Veröffentlicht: (2026)
von: Lu, Hongyu, et al.
Veröffentlicht: (2026)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
von: Li, Lingxiao, et al.
Veröffentlicht: (2025)
von: Li, Lingxiao, et al.
Veröffentlicht: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
von: Abdelrahman, Eslam, et al.
Veröffentlicht: (2023)
von: Abdelrahman, Eslam, et al.
Veröffentlicht: (2023)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
von: Lu, Zhenyu, et al.
Veröffentlicht: (2025)
von: Lu, Zhenyu, et al.
Veröffentlicht: (2025)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
von: Tong, Bo, et al.
Veröffentlicht: (2024)
von: Tong, Bo, et al.
Veröffentlicht: (2024)
Window Token Concatenation for Efficient Visual Large Language Models
von: Li, Yifan, et al.
Veröffentlicht: (2025)
von: Li, Yifan, et al.
Veröffentlicht: (2025)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
von: Lim, Byeonggeuk, et al.
Veröffentlicht: (2026)
von: Lim, Byeonggeuk, et al.
Veröffentlicht: (2026)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
von: Yi, Shixin, et al.
Veröffentlicht: (2025)
von: Yi, Shixin, et al.
Veröffentlicht: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
von: Li, Xiping, et al.
Veröffentlicht: (2025)
von: Li, Xiping, et al.
Veröffentlicht: (2025)
SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark
von: Wang, Gui, et al.
Veröffentlicht: (2026)
von: Wang, Gui, et al.
Veröffentlicht: (2026)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
von: Peng, Tianfan, et al.
Veröffentlicht: (2025)
von: Peng, Tianfan, et al.
Veröffentlicht: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
von: Sinha, Sanchit, et al.
Veröffentlicht: (2026)
von: Sinha, Sanchit, et al.
Veröffentlicht: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
von: Chen, Xinyan, et al.
Veröffentlicht: (2025) -
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
von: Liu, Juntao, et al.
Veröffentlicht: (2025) -
Distilling Reasoning Ability from Large Language Models with Adaptive Thinking
von: Chen, Xiaoshu, et al.
Veröffentlicht: (2024) -
Efficient Reasoning via Thought Compression for Language Segmentation
von: Zhou, Qing, et al.
Veröffentlicht: (2026) -
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)