VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Yaoyao, Qi, Mengshi, Wang, Rui, Qiu, Yuhan, Zhang, Yang, Ma, Huadong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MultiIoT: Benchmarking Machine Learning for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2023)
di: Mo, Shentong, et al.
Pubblicazione: (2023)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
di: Zhan, Wengyi, et al.
Pubblicazione: (2025)
POINTS1.5: Building a Vision-Language Model towards Real World Applications
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
G3R: Generating Rich and Fine-grained mmWave Radar Data from 2D Videos for Generalized Gesture Recognition
di: Deng, Kaikai, et al.
Pubblicazione: (2024)
di: Deng, Kaikai, et al.
Pubblicazione: (2024)
MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights
di: Yang, Jasmine, et al.
Pubblicazione: (2026)
di: Yang, Jasmine, et al.
Pubblicazione: (2026)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs
di: Li, Jinmin, et al.
Pubblicazione: (2024)
di: Li, Jinmin, et al.
Pubblicazione: (2024)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
di: Tang, Guowei, et al.
Pubblicazione: (2026)
di: Tang, Guowei, et al.
Pubblicazione: (2026)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
Advanced Learning-Based Inter Prediction for Future Video Coding
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
FCMBench-Video: Benchmarking Document Video Intelligence
di: Cui, Runze, et al.
Pubblicazione: (2026)
di: Cui, Runze, et al.
Pubblicazione: (2026)
A Preprocessing Framework for Video Machine Vision under Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Hybrid Local-Global Context Learning for Neural Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2024)
di: Zhai, Yongqi, et al.
Pubblicazione: (2024)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
IoT-LM: Large Multisensory Language Models for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
A Perspective on Deep Vision Performance with Standard Image and Video Codecs
di: Reich, Christoph, et al.
Pubblicazione: (2024)
di: Reich, Christoph, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Question-Aware Evidence Ledgers for Video Relational Reasoning
di: Ou, Yilin, et al.
Pubblicazione: (2026)
di: Ou, Yilin, et al.
Pubblicazione: (2026)
FMNV: A Dataset of Media-Published News Videos for Fake News Detection
di: Wang, Yihao, et al.
Pubblicazione: (2025)
di: Wang, Yihao, et al.
Pubblicazione: (2025)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
di: Zhang, Long, et al.
Pubblicazione: (2025)
di: Zhang, Long, et al.
Pubblicazione: (2025)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
di: Chen, Lizhi, et al.
Pubblicazione: (2025)
di: Chen, Lizhi, et al.
Pubblicazione: (2025)
Learning Group Interactions and Semantic Intentions for Multi-Object Trajectory Prediction
di: Qi, Mengshi, et al.
Pubblicazione: (2024)
di: Qi, Mengshi, et al.
Pubblicazione: (2024)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
di: An, Wenbin, et al.
Pubblicazione: (2025)
di: An, Wenbin, et al.
Pubblicazione: (2025)
Region-Constraint In-Context Generation for Instructional Video Editing
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
di: Stamatakis, Markos, et al.
Pubblicazione: (2025)
di: Stamatakis, Markos, et al.
Pubblicazione: (2025)
TAVGBench: Benchmarking Text to Audible-Video Generation
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
T$^\text{3}$SVFND: Towards an Evolving Fake News Detector for Emergencies with Test-time Training on Short Video Platforms
di: Zhang, Liyuan, et al.
Pubblicazione: (2025)
di: Zhang, Liyuan, et al.
Pubblicazione: (2025)
L-LBVC: Long-Term Motion Estimation and Prediction for Learned Bi-Directional Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2025)
di: Zhai, Yongqi, et al.
Pubblicazione: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2025)
Learning Video Context as Interleaved Multimodal Sequences
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Human Motion Video Generation: A Survey
di: Xue, Haiwei, et al.
Pubblicazione: (2025)
di: Xue, Haiwei, et al.
Pubblicazione: (2025)
DS-NeRV: Implicit Neural Video Representation with Decomposed Static and Dynamic Codes
di: Yan, Hao, et al.
Pubblicazione: (2024)
di: Yan, Hao, et al.
Pubblicazione: (2024)
Serial Low-rank Adaptation of Vision Transformer
di: Zhong, Houqiang, et al.
Pubblicazione: (2025)
di: Zhong, Houqiang, et al.
Pubblicazione: (2025)
Multi-Stage Contrastive Regression for Action Quality Assessment
di: An, Qi, et al.
Pubblicazione: (2024)
di: An, Qi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MultiIoT: Benchmarking Machine Learning for the Internet of Things
di: Mo, Shentong, et al.
Pubblicazione: (2023) -
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
di: Zhan, Wengyi, et al.
Pubblicazione: (2025) -
POINTS1.5: Building a Vision-Language Model towards Real World Applications
di: Liu, Yuan, et al.
Pubblicazione: (2024) -
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024) -
G3R: Generating Rich and Fine-grained mmWave Radar Data from 2D Videos for Generalized Gesture Recognition
di: Deng, Kaikai, et al.
Pubblicazione: (2024)