COLT: Enhancing Video Large Language Models with Continual Tool Usage
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Yuyang, Cao, Meng, Shi, Xinyuan, Liang, Xiaondan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2026)
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2026)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
von: Kim, Junwan, et al.
Veröffentlicht: (2026)
von: Kim, Junwan, et al.
Veröffentlicht: (2026)
MLLM-CL: Continual Learning for Multimodal Large Language Models
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025)
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding
von: Liu, Xiao, et al.
Veröffentlicht: (2026)
von: Liu, Xiao, et al.
Veröffentlicht: (2026)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis
von: Liang, Kaidi, et al.
Veröffentlicht: (2025)
von: Liang, Kaidi, et al.
Veröffentlicht: (2025)
From Evaluation to Defense: Advancing Safety in Video Large Language Models
von: Sun, Yiwei, et al.
Veröffentlicht: (2025)
von: Sun, Yiwei, et al.
Veröffentlicht: (2025)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
von: Wang, Haibo, et al.
Veröffentlicht: (2025)
von: Wang, Haibo, et al.
Veröffentlicht: (2025)
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
von: Cao, Tri, et al.
Veröffentlicht: (2026)
von: Cao, Tri, et al.
Veröffentlicht: (2026)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
von: Kondratyuk, Dan, et al.
Veröffentlicht: (2023)
von: Kondratyuk, Dan, et al.
Veröffentlicht: (2023)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
von: Tao, Zhou, et al.
Veröffentlicht: (2025)
von: Tao, Zhou, et al.
Veröffentlicht: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
von: Gao, Zhi, et al.
Veröffentlicht: (2024)
von: Gao, Zhi, et al.
Veröffentlicht: (2024)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
Object-Shot Enhanced Grounding Network for Egocentric Video
von: Feng, Yisen, et al.
Veröffentlicht: (2025)
von: Feng, Yisen, et al.
Veröffentlicht: (2025)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
von: Zeng, Zhen, et al.
Veröffentlicht: (2024)
von: Zeng, Zhen, et al.
Veröffentlicht: (2024)
HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting
von: Lee, Jeongeun, et al.
Veröffentlicht: (2025)
von: Lee, Jeongeun, et al.
Veröffentlicht: (2025)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
von: Liu, Chaohu, et al.
Veröffentlicht: (2025)
von: Liu, Chaohu, et al.
Veröffentlicht: (2025)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
von: Luo, Bingjun, et al.
Veröffentlicht: (2026)
von: Luo, Bingjun, et al.
Veröffentlicht: (2026)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
von: Fei, Jiajun, et al.
Veröffentlicht: (2024)
von: Fei, Jiajun, et al.
Veröffentlicht: (2024)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
von: Shi, Yang, et al.
Veröffentlicht: (2025)
von: Shi, Yang, et al.
Veröffentlicht: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
DeVAn: Dense Video Annotation for Video-Language Models
von: Liu, Tingkai, et al.
Veröffentlicht: (2023)
von: Liu, Tingkai, et al.
Veröffentlicht: (2023)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
Toward Cognitive Supersensing in Multimodal Large Language Model
von: Li, Boyi, et al.
Veröffentlicht: (2026)
von: Li, Boyi, et al.
Veröffentlicht: (2026)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
von: Li, Shicheng, et al.
Veröffentlicht: (2025)
von: Li, Shicheng, et al.
Veröffentlicht: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
Review of Hallucination Understanding in Large Language and Vision Models
von: Ho, Zhengyi, et al.
Veröffentlicht: (2025)
von: Ho, Zhengyi, et al.
Veröffentlicht: (2025)
DIFFUMA: High-Fidelity Spatio-Temporal Video Prediction via Dual-Path Mamba and Diffusion Enhancement
von: Xie, Xinyu, et al.
Veröffentlicht: (2025)
von: Xie, Xinyu, et al.
Veröffentlicht: (2025)
TOOLCAD: Exploring Tool-Using Large Language Models in Text-to-CAD Generation with Reinforcement Learning
von: Gong, Yifei, et al.
Veröffentlicht: (2026)
von: Gong, Yifei, et al.
Veröffentlicht: (2026)
Valley: Video Assistant with Large Language model Enhanced abilitY
von: Luo, Ruipu, et al.
Veröffentlicht: (2023)
von: Luo, Ruipu, et al.
Veröffentlicht: (2023)
Is Your Video Language Model a Reliable Judge?
von: Liu, Ming, et al.
Veröffentlicht: (2025)
von: Liu, Ming, et al.
Veröffentlicht: (2025)
AVA: Towards Agentic Video Analytics with Vision Language Models
von: Yan, Yuxuan, et al.
Veröffentlicht: (2025)
von: Yan, Yuxuan, et al.
Veröffentlicht: (2025)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models
von: Xing, Wenbin, et al.
Veröffentlicht: (2026)
von: Xing, Wenbin, et al.
Veröffentlicht: (2026)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
von: Zhang, Zefan, et al.
Veröffentlicht: (2026)
von: Zhang, Zefan, et al.
Veröffentlicht: (2026)
HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
von: Wang, Guankun, et al.
Veröffentlicht: (2025)
von: Wang, Guankun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2026) -
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
von: Kim, Junwan, et al.
Veröffentlicht: (2026) -
MLLM-CL: Continual Learning for Multimodal Large Language Models
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025) -
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025) -
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding
von: Liu, Xiao, et al.
Veröffentlicht: (2026)