CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yanan, Vizcarra, Julio, Li, Zhi, Niu, Hao, Kurokawa, Mori |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Top-down Activity Representation Learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024)
par: Wang, Yanan, et autres
Publié: (2024)
Multi-object event graph representation learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024)
par: Wang, Yanan, et autres
Publié: (2024)
VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool
par: Wang, Yan, et autres
Publié: (2024)
par: Wang, Yan, et autres
Publié: (2024)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)
par: Cheng, Zihui, et autres
Publié: (2025)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
par: Zhang, Yuanhan, et autres
Publié: (2024)
par: Zhang, Yuanhan, et autres
Publié: (2024)
Pseudo Anomalies Are All You Need: Diffusion-Based Generation for Weakly-Supervised Video Anomaly Detection
par: Hashimoto, Satoshi, et autres
Publié: (2025)
par: Hashimoto, Satoshi, et autres
Publié: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
par: Dai, Xuanlang, et autres
Publié: (2026)
par: Dai, Xuanlang, et autres
Publié: (2026)
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025)
par: Zhong, Yiwu, et autres
Publié: (2025)
Expert Pyramid Tuning: Efficient Parameter Fine-Tuning for Expertise-Driven Task Allocation
par: Zhang, Jia-Chen, et autres
Publié: (2026)
par: Zhang, Jia-Chen, et autres
Publié: (2026)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)
par: Peng, Yi, et autres
Publié: (2025)
MoExtend: Tuning New Experts for Modality and Task Extension
par: Zhong, Shanshan, et autres
Publié: (2024)
par: Zhong, Shanshan, et autres
Publié: (2024)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
InstructPart: Task-Oriented Part Segmentation with Instruction Reasoning
par: Wan, Zifu, et autres
Publié: (2025)
par: Wan, Zifu, et autres
Publié: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
par: Zhang, Yongheng, et autres
Publié: (2025)
par: Zhang, Yongheng, et autres
Publié: (2025)
ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
par: Chen, Qiguang, et autres
Publié: (2024)
par: Chen, Qiguang, et autres
Publié: (2024)
CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
par: Qi, Yu, et autres
Publié: (2025)
par: Qi, Yu, et autres
Publié: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
par: Gao, Timin, et autres
Publié: (2024)
par: Gao, Timin, et autres
Publié: (2024)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
par: Zhang, Shuyi, et autres
Publié: (2025)
par: Zhang, Shuyi, et autres
Publié: (2025)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
par: Luo, Chuwei, et autres
Publié: (2024)
par: Luo, Chuwei, et autres
Publié: (2024)
Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings
par: Rose, Daniel, et autres
Publié: (2023)
par: Rose, Daniel, et autres
Publié: (2023)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
par: Du, Yifan, et autres
Publié: (2023)
par: Du, Yifan, et autres
Publié: (2023)
CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
par: Suharitdamrong, Wish, et autres
Publié: (2026)
par: Suharitdamrong, Wish, et autres
Publié: (2026)
MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language Models
par: Cheng, Zebang, et autres
Publié: (2024)
par: Cheng, Zebang, et autres
Publié: (2024)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
par: Chen, Yanjun, et autres
Publié: (2025)
par: Chen, Yanjun, et autres
Publié: (2025)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
par: Qi, Yukun, et autres
Publié: (2025)
par: Qi, Yukun, et autres
Publié: (2025)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
par: Sun, Linzhuang, et autres
Publié: (2025)
par: Sun, Linzhuang, et autres
Publié: (2025)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
par: Guo, Jarvis, et autres
Publié: (2024)
par: Guo, Jarvis, et autres
Publié: (2024)
Overview of the NLPCC 2025 Shared Task 4: Multi-modal, Multilingual, and Multi-hop Medical Instructional Video Question Answering Challenge
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
par: Gu, Zeqi, et autres
Publié: (2025)
par: Gu, Zeqi, et autres
Publié: (2025)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
par: Fu, Xingyu, et autres
Publié: (2025)
par: Fu, Xingyu, et autres
Publié: (2025)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
par: Hu, Yushi, et autres
Publié: (2024)
par: Hu, Yushi, et autres
Publié: (2024)
Less is More: High-value Data Selection for Visual Instruction Tuning
par: Liu, Zikang, et autres
Publié: (2024)
par: Liu, Zikang, et autres
Publié: (2024)
Documents similaires
-
Top-down Activity Representation Learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024) -
Multi-object event graph representation learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024) -
VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool
par: Wang, Yan, et autres
Publié: (2024) -
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024) -
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)