Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Xinkui, Wang, Zuxin, Zhang, Yifan, Cheng, Guanjie, Xu, Yueshen, Deng, Shuiguang, Liu, Chang, Wang, Naibo, Yin, Jianwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
por: Zhang, Yifan, et al.
Publicado: (2025)
por: Zhang, Yifan, et al.
Publicado: (2025)
A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
Completion by Comprehension: Guiding Code Generation with Multi-Granularity Understanding
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
por: Li, Ziying, et al.
Publicado: (2025)
por: Li, Ziying, et al.
Publicado: (2025)
SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant
por: Zhang, Yifan, et al.
Publicado: (2026)
por: Zhang, Yifan, et al.
Publicado: (2026)
SatFusion: A Unified Framework for Enhancing Remote Sensing Images via Multi-Frame and Multi-Source Images Fusion
por: Tong, Yufei, et al.
Publicado: (2025)
por: Tong, Yufei, et al.
Publicado: (2025)
Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
TRAIL: Joint Inference and Refinement of Knowledge Graphs with Large Language Models
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
Is Collaboration Worth It? A Decision-Oriented Survey in Multi-Agent Systems
por: Cheng, Guanjie, et al.
Publicado: (2026)
por: Cheng, Guanjie, et al.
Publicado: (2026)
AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
ProMAS: Proactive Error Forecasting for Multi-Agent Systems Using Markov Transition Dynamics
por: Zhao, Xinkui, et al.
Publicado: (2026)
por: Zhao, Xinkui, et al.
Publicado: (2026)
TenonOS: A Self-Generating LibOS-on-LibOS Framework for Time-Critical Embedded Operating Systems
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
CADRef: Robust Out-of-Distribution Detection via Class-Aware Decoupled Relative Feature Leveraging
por: Ling, Zhiwei, et al.
Publicado: (2025)
por: Ling, Zhiwei, et al.
Publicado: (2025)
GRAB-ANNS: High-Throughput Indexing and Hybrid Search via GPU-Native Bucketing
por: Zhao, Xinkui, et al.
Publicado: (2026)
por: Zhao, Xinkui, et al.
Publicado: (2026)
Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression
por: Zhong, Jianping, et al.
Publicado: (2026)
por: Zhong, Jianping, et al.
Publicado: (2026)
StackPilot: Autonomous Function Agents for Scalable and Environment-Free Code Execution
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
DyC-STG: Dynamic Causal Spatio-Temporal Graph Network for Real-time Data Credibility Analysis in IoT
por: Cheng, Guanjie, et al.
Publicado: (2025)
por: Cheng, Guanjie, et al.
Publicado: (2025)
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
por: Hu, Pengfei, et al.
Publicado: (2025)
por: Hu, Pengfei, et al.
Publicado: (2025)
Pseudo-labeling with Keyword Refining for Few-Supervised Video Captioning
por: Li, Ping, et al.
Publicado: (2024)
por: Li, Ping, et al.
Publicado: (2024)
Data-Free Federated Class Incremental Learning with Diffusion-Based Generative Memory
por: Wang, Naibo, et al.
Publicado: (2024)
por: Wang, Naibo, et al.
Publicado: (2024)
Revisiting Vulnerability Patch Localization: An Empirical Study and LLM-Based Solution
por: Xu, Haoran, et al.
Publicado: (2025)
por: Xu, Haoran, et al.
Publicado: (2025)
VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree
por: Li, Wenlong, et al.
Publicado: (2025)
por: Li, Wenlong, et al.
Publicado: (2025)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
por: Amoroso, Roberto, et al.
Publicado: (2024)
por: Amoroso, Roberto, et al.
Publicado: (2024)
Quality-Aware Robust Multi-View Clustering for Heterogeneous Observation Noise
por: Wu, Peihan, et al.
Publicado: (2026)
por: Wu, Peihan, et al.
Publicado: (2026)
Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation
por: Chen, Yuzhuo, et al.
Publicado: (2026)
por: Chen, Yuzhuo, et al.
Publicado: (2026)
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
por: Yang, Min, et al.
Publicado: (2024)
por: Yang, Min, et al.
Publicado: (2024)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
por: Li, Chenglin, et al.
Publicado: (2025)
por: Li, Chenglin, et al.
Publicado: (2025)
GRACE: Graph-Guided Repository-Aware Code Completion through Hierarchical Code Fusion
por: Wang, Xingliang, et al.
Publicado: (2025)
por: Wang, Xingliang, et al.
Publicado: (2025)
V-CORE: Temporally Consistent Video Understanding for Video-LLM
por: Kang, Zhengjian, et al.
Publicado: (2026)
por: Kang, Zhengjian, et al.
Publicado: (2026)
Temporal Residual Guided Diffusion Framework for Event-Driven Video Reconstruction
por: Zhu, Lin, et al.
Publicado: (2024)
por: Zhu, Lin, et al.
Publicado: (2024)
VIDEOP2R: Video Understanding from Perception to Reasoning
por: Jiang, Yifan, et al.
Publicado: (2025)
por: Jiang, Yifan, et al.
Publicado: (2025)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
por: Liao, Ruotong, et al.
Publicado: (2024)
por: Liao, Ruotong, et al.
Publicado: (2024)
One-Shot Sequential Federated Learning for Non-IID Data by Enhancing Local Model Diversity
por: Wang, Naibo, et al.
Publicado: (2024)
por: Wang, Naibo, et al.
Publicado: (2024)
TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training
por: Cheng, Guanjie, et al.
Publicado: (2026)
por: Cheng, Guanjie, et al.
Publicado: (2026)
BPI: A Novel Efficient and Reliable Search Structure for Hybrid Storage Blockchain
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding
por: Zhao, Henghao, et al.
Publicado: (2025)
por: Zhao, Henghao, et al.
Publicado: (2025)
Integrating Artificial Intelligence into Operating Systems: A Survey on Techniques, Applications, and Future Directions
por: Zhang, Yifan, et al.
Publicado: (2024)
por: Zhang, Yifan, et al.
Publicado: (2024)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
por: Zhang, Jinglei, et al.
Publicado: (2025)
por: Zhang, Jinglei, et al.
Publicado: (2025)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
Ejemplares similares
-
LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
por: Zhang, Yifan, et al.
Publicado: (2025) -
A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition
por: Zhao, Xinkui, et al.
Publicado: (2025) -
Completion by Comprehension: Guiding Code Generation with Multi-Granularity Understanding
por: Zhao, Xinkui, et al.
Publicado: (2025) -
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
por: Li, Ziying, et al.
Publicado: (2025) -
SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant
por: Zhang, Yifan, et al.
Publicado: (2026)