OVG-HQ: Online Video Grounding with Hybrid-modal Queries
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Runhao, Mao, Jiaqi, Lai, Minghao, Phan, Minh Hieu, Dong, Yanjie, Wang, Wei, Chen, Qi, Hu, Xiping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models
por: Peng, Ying, et al.
Publicado: (2025)
por: Peng, Ying, et al.
Publicado: (2025)
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
por: Wu, Biao, et al.
Publicado: (2024)
por: Wu, Biao, et al.
Publicado: (2024)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
por: Zhang, Jingrui, et al.
Publicado: (2026)
por: Zhang, Jingrui, et al.
Publicado: (2026)
Temporal Action Detection Model Compression by Progressive Block Drop
por: Chen, Xiaoyong, et al.
Publicado: (2025)
por: Chen, Xiaoyong, et al.
Publicado: (2025)
Emotion Recognition from Skeleton Data: A Comprehensive Survey
por: Lu, Haifeng, et al.
Publicado: (2025)
por: Lu, Haifeng, et al.
Publicado: (2025)
ZOTTA: Test-Time Adaptation with Gradient-Free Zeroth-Order Optimization
por: Zhang, Ronghao, et al.
Publicado: (2026)
por: Zhang, Ronghao, et al.
Publicado: (2026)
Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation
por: Zeng, Runhao, et al.
Publicado: (2025)
por: Zeng, Runhao, et al.
Publicado: (2025)
Learning to Generate Gradients for Test-Time Adaptation via Test-Time Training Layers
por: Deng, Qi, et al.
Publicado: (2024)
por: Deng, Qi, et al.
Publicado: (2024)
Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning
por: Zeng, Runhao, et al.
Publicado: (2024)
por: Zeng, Runhao, et al.
Publicado: (2024)
Towards Stable Cross-Domain Depression Recognition under Missing Modalities
por: Chen, Jiuyi, et al.
Publicado: (2025)
por: Chen, Jiuyi, et al.
Publicado: (2025)
Improving the Robustness of 3D Human Pose Estimation: A Benchmark and Learning from Noisy Input
por: Hoang, Trung-Hieu, et al.
Publicado: (2023)
por: Hoang, Trung-Hieu, et al.
Publicado: (2023)
Towards Long Video Understanding via Fine-detailed Video Story Generation
por: You, Zeng, et al.
Publicado: (2024)
por: You, Zeng, et al.
Publicado: (2024)
TC-PDM: Temporally Consistent Patch Diffusion Models for Infrared-to-Visible Video Translation
por: Doan, Anh-Dzung, et al.
Publicado: (2024)
por: Doan, Anh-Dzung, et al.
Publicado: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
por: Li, Zhaowei, et al.
Publicado: (2024)
por: Li, Zhaowei, et al.
Publicado: (2024)
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
por: Tan, Chaolei, et al.
Publicado: (2024)
por: Tan, Chaolei, et al.
Publicado: (2024)
Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations
por: Nguyen, Tuan Dung, et al.
Publicado: (2026)
por: Nguyen, Tuan Dung, et al.
Publicado: (2026)
Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
por: Nguyen, Dung, et al.
Publicado: (2025)
por: Nguyen, Dung, et al.
Publicado: (2025)
Interpreting Chest X-rays Like a Radiologist: A Benchmark with Clinical Reasoning
por: Guan, Jinquan, et al.
Publicado: (2025)
por: Guan, Jinquan, et al.
Publicado: (2025)
MoChat: Joints-Grouped Spatio-Temporal Grounding LLM for Multi-Turn Motion Comprehension and Description
por: Mo, Jiawei, et al.
Publicado: (2024)
por: Mo, Jiawei, et al.
Publicado: (2024)
CIT: Rethinking Class-incremental Semantic Segmentation with a Class Independent Transformation
por: Ge, Jinchao, et al.
Publicado: (2024)
por: Ge, Jinchao, et al.
Publicado: (2024)
Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding
por: Moon, WonJun, et al.
Publicado: (2023)
por: Moon, WonJun, et al.
Publicado: (2023)
Looking in the mirror: A faithful counterfactual explanation method for interpreting deep image classification models
por: Chowdhury, Townim Faisal, et al.
Publicado: (2025)
por: Chowdhury, Townim Faisal, et al.
Publicado: (2025)
Online Video Understanding: OVBench and VideoChat-Online
por: Huang, Zhenpeng, et al.
Publicado: (2024)
por: Huang, Zhenpeng, et al.
Publicado: (2024)
ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance
por: Park, Hyojin, et al.
Publicado: (2026)
por: Park, Hyojin, et al.
Publicado: (2026)
DGRNet: Disagreement-Guided Refinement for Uncertainty-Aware Brain Tumor Segmentation
por: Mohammadi, Bahram, et al.
Publicado: (2026)
por: Mohammadi, Bahram, et al.
Publicado: (2026)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
por: Fan, Rong, et al.
Publicado: (2026)
por: Fan, Rong, et al.
Publicado: (2026)
Training-free Online Video Step Grounding
por: Zanella, Luca, et al.
Publicado: (2025)
por: Zanella, Luca, et al.
Publicado: (2025)
Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training Framework
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding
por: Huy, Ta Duc, et al.
Publicado: (2025)
por: Huy, Ta Duc, et al.
Publicado: (2025)
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition
por: Xu, Zhengyi, et al.
Publicado: (2026)
por: Xu, Zhengyi, et al.
Publicado: (2026)
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
por: Liu, Wenxuan, et al.
Publicado: (2024)
por: Liu, Wenxuan, et al.
Publicado: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
Structural Attention: Rethinking Transformer for Unpaired Medical Image Synthesis
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
por: Phan, Vu Minh Hieu, et al.
Publicado: (2024)
OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding
por: Nguyen, Hieu, et al.
Publicado: (2025)
por: Nguyen, Hieu, et al.
Publicado: (2025)
OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery
por: Zhao, Yiwen, et al.
Publicado: (2026)
por: Zhao, Yiwen, et al.
Publicado: (2026)
Enhancing Quality for VVC Compressed Videos with Omniscient Quality Enhancement Model
por: HoangVan, Xiem, et al.
Publicado: (2025)
por: HoangVan, Xiem, et al.
Publicado: (2025)
HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model
por: Vo, Khoa, et al.
Publicado: (2024)
por: Vo, Khoa, et al.
Publicado: (2024)
Ejemplares similares
-
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries
por: Zhang, Zhen, et al.
Publicado: (2026) -
Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models
por: Zhang, Zhen, et al.
Publicado: (2026) -
Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models
por: Peng, Ying, et al.
Publicado: (2025) -
MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training
por: Wu, Biao, et al.
Publicado: (2024) -
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
por: Zhang, Jingrui, et al.
Publicado: (2026)