Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Yudi, Di, Shangzhe, Chen, Qirui, Xie, Weidi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
par: Chen, Qirui, et autres
Publié: (2024)
par: Chen, Qirui, et autres
Publié: (2024)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
par: Shi, Yudi, et autres
Publié: (2026)
par: Shi, Yudi, et autres
Publié: (2026)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Learning Streaming Video Representation via Multitask Training
par: Yan, Yibin, et autres
Publié: (2025)
par: Yan, Yibin, et autres
Publié: (2025)
Revisiting Multi-Task Visual Representation Learning
par: Di, Shangzhe, et autres
Publié: (2026)
par: Di, Shangzhe, et autres
Publié: (2026)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
par: Li, Zeqian, et autres
Publié: (2025)
par: Li, Zeqian, et autres
Publié: (2025)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
par: Ge, Mingji, et autres
Publié: (2026)
par: Ge, Mingji, et autres
Publié: (2026)
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
par: Yan, Yibin, et autres
Publié: (2026)
par: Yan, Yibin, et autres
Publié: (2026)
Multi-Sentence Grounding for Long-term Instructional Video
par: Li, Zeqian, et autres
Publié: (2023)
par: Li, Zeqian, et autres
Publié: (2023)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
Object-centric Video Question Answering with Visual Grounding and Referring
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning
par: Chen, Haodong, et autres
Publié: (2025)
par: Chen, Haodong, et autres
Publié: (2025)
VISA: Reasoning Video Object Segmentation via Large Language Models
par: Yan, Cilin, et autres
Publié: (2024)
par: Yan, Cilin, et autres
Publié: (2024)
X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning
par: Pulakurthi, Prasanna Reddy, et autres
Publié: (2025)
par: Pulakurthi, Prasanna Reddy, et autres
Publié: (2025)
Track-On2: Enhancing Online Point Tracking with Memory
par: Aydemir, Görkay, et autres
Publié: (2025)
par: Aydemir, Görkay, et autres
Publié: (2025)
VISD: Enhancing Video Reasoning via Structured Self-Distillation
par: Lin, Hao, et autres
Publié: (2026)
par: Lin, Hao, et autres
Publié: (2026)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
par: Yan, Yibin, et autres
Publié: (2024)
par: Yan, Yibin, et autres
Publié: (2024)
Farm3D: Learning Articulated 3D Animals by Distilling 2D Diffusion
par: Jakab, Tomas, et autres
Publié: (2023)
par: Jakab, Tomas, et autres
Publié: (2023)
VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought
par: Zhang, Xuanyu, et autres
Publié: (2026)
par: Zhang, Xuanyu, et autres
Publié: (2026)
Appearance-Based Refinement for Object-Centric Motion Segmentation
par: Xie, Junyu, et autres
Publié: (2023)
par: Xie, Junyu, et autres
Publié: (2023)
Process-of-Thought Reasoning for Videos
par: Zhang, Jusheng, et autres
Publié: (2026)
par: Zhang, Jusheng, et autres
Publié: (2026)
PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought
par: Chen, Chaoqi, et autres
Publié: (2026)
par: Chen, Chaoqi, et autres
Publié: (2026)
Retrieval-Augmented Egocentric Video Captioning
par: Xu, Jilan, et autres
Publié: (2024)
par: Xu, Jilan, et autres
Publié: (2024)
Towards Universal Soccer Video Understanding
par: Rao, Jiayuan, et autres
Publié: (2024)
par: Rao, Jiayuan, et autres
Publié: (2024)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
par: Wen, Junwei, et autres
Publié: (2026)
par: Wen, Junwei, et autres
Publié: (2026)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
par: Feng, Chengjian, et autres
Publié: (2024)
par: Feng, Chengjian, et autres
Publié: (2024)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
Inferring Dynamic Physical Properties from Video Foundation Models
par: Zhan, Guanqi, et autres
Publié: (2025)
par: Zhan, Guanqi, et autres
Publié: (2025)
Multi-Agent System for Comprehensive Soccer Understanding
par: Rao, Jiayuan, et autres
Publié: (2025)
par: Rao, Jiayuan, et autres
Publié: (2025)
Can Visual Foundation Models Achieve Long-term Point Tracking?
par: Aydemir, Görkay, et autres
Publié: (2024)
par: Aydemir, Görkay, et autres
Publié: (2024)
Real-World Point Tracking with Verifier-Guided Pseudo-Labeling
par: Aydemir, Görkay, et autres
Publié: (2026)
par: Aydemir, Görkay, et autres
Publié: (2026)
Count Anything at Any Granularity
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
par: Di, Shangzhe, et autres
Publié: (2025)
par: Di, Shangzhe, et autres
Publié: (2025)
Made to Order: Discovering monotonic temporal changes via self-supervised video ordering
par: Yang, Charig, et autres
Publié: (2024)
par: Yang, Charig, et autres
Publié: (2024)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
par: Kao, Shiu-hong, et autres
Publié: (2025)
par: Kao, Shiu-hong, et autres
Publié: (2025)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
par: Xu, Jilan, et autres
Publié: (2025)
par: Xu, Jilan, et autres
Publié: (2025)
Moving Object Segmentation: All You Need Is SAM (and Flow)
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
par: Xie, Junyu, et autres
Publié: (2026)
par: Xie, Junyu, et autres
Publié: (2026)
PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval
par: Serussi, Gabriele, et autres
Publié: (2026)
par: Serussi, Gabriele, et autres
Publié: (2026)
Documents similaires
-
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
par: Chen, Qirui, et autres
Publié: (2024) -
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
par: Shi, Yudi, et autres
Publié: (2026) -
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023) -
Learning Streaming Video Representation via Multitask Training
par: Yan, Yibin, et autres
Publié: (2025) -
Revisiting Multi-Task Visual Representation Learning
par: Di, Shangzhe, et autres
Publié: (2026)