VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Hongbo, Ding, Jiayu, Xie, Siyi, Luo, Guibo, Li, Ge |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
di: Ou, Siqu, et al.
Pubblicazione: (2025)
di: Ou, Siqu, et al.
Pubblicazione: (2025)
Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
VISD: Enhancing Video Reasoning via Structured Self-Distillation
di: Lin, Hao, et al.
Pubblicazione: (2026)
di: Lin, Hao, et al.
Pubblicazione: (2026)
Training-Free Semantic Video Composition via Pre-trained Diffusion Model
di: Guo, Jiaqi, et al.
Pubblicazione: (2024)
di: Guo, Jiaqi, et al.
Pubblicazione: (2024)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
di: Guo, Haiyang, et al.
Pubblicazione: (2026)
di: Guo, Haiyang, et al.
Pubblicazione: (2026)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
di: Ge, Mingji, et al.
Pubblicazione: (2026)
di: Ge, Mingji, et al.
Pubblicazione: (2026)
Mitigating Perception Bias: A Training-Free Approach to Enhance LMM for Image Quality Assessment
di: Chen, Baoliang, et al.
Pubblicazione: (2024)
di: Chen, Baoliang, et al.
Pubblicazione: (2024)
Training-Free Efficient Video Generation via Dynamic Token Carving
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
VORTA: Efficient Video Diffusion via Routing Sparse Attention
di: Sun, Wenhao, et al.
Pubblicazione: (2025)
di: Sun, Wenhao, et al.
Pubblicazione: (2025)
FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction
di: Chen, Fangda, et al.
Pubblicazione: (2026)
di: Chen, Fangda, et al.
Pubblicazione: (2026)
Unfolding Videos Dynamics via Taylor Expansion
di: Chen, Siyi, et al.
Pubblicazione: (2024)
di: Chen, Siyi, et al.
Pubblicazione: (2024)
VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool
di: Wang, Yan, et al.
Pubblicazione: (2024)
di: Wang, Yan, et al.
Pubblicazione: (2024)
DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation
di: Li, Guandong, et al.
Pubblicazione: (2025)
di: Li, Guandong, et al.
Pubblicazione: (2025)
Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering
di: Luo, Jiayi, et al.
Pubblicazione: (2026)
di: Luo, Jiayi, et al.
Pubblicazione: (2026)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
di: Shi, Yudi, et al.
Pubblicazione: (2024)
di: Shi, Yudi, et al.
Pubblicazione: (2024)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026)
di: Wen, Junwei, et al.
Pubblicazione: (2026)
AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation
di: Ge, Jiannan, et al.
Pubblicazione: (2024)
di: Ge, Jiannan, et al.
Pubblicazione: (2024)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
di: Huo, Yu, et al.
Pubblicazione: (2026)
di: Huo, Yu, et al.
Pubblicazione: (2026)
Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine
di: Wu, Yuan, et al.
Pubblicazione: (2026)
di: Wu, Yuan, et al.
Pubblicazione: (2026)
DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving
di: Wang, Tianqi, et al.
Pubblicazione: (2024)
di: Wang, Tianqi, et al.
Pubblicazione: (2024)
MedDiff-FT: Data-Efficient Diffusion Model Fine-tuning with Structural Guidance for Controllable Medical Image Synthesis
di: Xie, Jianhao, et al.
Pubblicazione: (2025)
di: Xie, Jianhao, et al.
Pubblicazione: (2025)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
Training-Free Semantic Segmentation via LLM-Supervision
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
MCoT-RE: Multi-Faceted Chain-of-Thought and Re-Ranking for Training-Free Zero-Shot Composed Image Retrieval
di: Park, Jeong-Woo, et al.
Pubblicazione: (2025)
di: Park, Jeong-Woo, et al.
Pubblicazione: (2025)
X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning
di: Pulakurthi, Prasanna Reddy, et al.
Pubblicazione: (2025)
di: Pulakurthi, Prasanna Reddy, et al.
Pubblicazione: (2025)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Reinforcing Structured Chain-of-Thought for Video Understanding
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
SlideChain: Semantic Provenance for Lecture Understanding via Blockchain Registration
di: Manik, Md Motaleb Hossen, et al.
Pubblicazione: (2025)
di: Manik, Md Motaleb Hossen, et al.
Pubblicazione: (2025)
VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
di: Kao, Shiu-hong, et al.
Pubblicazione: (2025)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
di: Li, Yuhao, et al.
Pubblicazione: (2025)
di: Li, Yuhao, et al.
Pubblicazione: (2025)
Chain of Event-Centric Causal Thought for Physically Plausible Video Generation
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering
di: Cai, Jianfeng, et al.
Pubblicazione: (2025)
di: Cai, Jianfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs
di: Jin, Hongbo, et al.
Pubblicazione: (2026) -
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
di: Shen, Leqi, et al.
Pubblicazione: (2025) -
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
di: Ou, Siqu, et al.
Pubblicazione: (2025) -
Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
di: Li, Jiaqi, et al.
Pubblicazione: (2026) -
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
di: Jin, Hongbo, et al.
Pubblicazione: (2025)