Does SpatioTemporal information benefit Two video summarization benchmarks?
Fuente:
arXiv
Salvato in:
| Autori principali: | Ganesh, Aashutosh, Popa, Mirela, Odijk, Daan, Tintarev, Nava |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Find the Cliffhanger: Multi-Modal Trailerness in Soap Operas
di: Bretti, Carlo, et al.
Pubblicazione: (2024)
di: Bretti, Carlo, et al.
Pubblicazione: (2024)
A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2025)
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
AsyReC: A Multimodal Graph-based Framework for Spatio-Temporal Asymmetric Dyadic Relationship Classification
di: Tang, Wang, et al.
Pubblicazione: (2025)
di: Tang, Wang, et al.
Pubblicazione: (2025)
Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
Consistent and Invariant Generalization Learning for Short-video Misinformation Detection
di: Guo, Hanghui, et al.
Pubblicazione: (2025)
di: Guo, Hanghui, et al.
Pubblicazione: (2025)
Reviewing Intelligent Cinematography: AI research for camera-based video production
di: Azzarelli, Adrian, et al.
Pubblicazione: (2024)
di: Azzarelli, Adrian, et al.
Pubblicazione: (2024)
Leveraging multimodal explanatory annotations for video interpretation with Modality Specific Dataset
di: Ancarani, Elisa, et al.
Pubblicazione: (2025)
di: Ancarani, Elisa, et al.
Pubblicazione: (2025)
Subjective evaluation of UHD video coded using VVC with LCEVC and ML-VVC
di: Ramzan, Naeem, et al.
Pubblicazione: (2026)
di: Ramzan, Naeem, et al.
Pubblicazione: (2026)
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
di: Li, Deng, et al.
Pubblicazione: (2024)
di: Li, Deng, et al.
Pubblicazione: (2024)
Spatial-Temporal Human-Object Interaction Detection
di: Sun, Xu, et al.
Pubblicazione: (2025)
di: Sun, Xu, et al.
Pubblicazione: (2025)
Boosting Temporal Sentence Grounding via Causal Inference
di: Tang, Kefan, et al.
Pubblicazione: (2025)
di: Tang, Kefan, et al.
Pubblicazione: (2025)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
di: Song, Shezheng, et al.
Pubblicazione: (2026)
di: Song, Shezheng, et al.
Pubblicazione: (2026)
Transformer-based Video Saliency Prediction with High Temporal Dimension Decoding
di: Moradi, Morteza, et al.
Pubblicazione: (2024)
di: Moradi, Morteza, et al.
Pubblicazione: (2024)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
di: Xie, Liping, et al.
Pubblicazione: (2025)
di: Xie, Liping, et al.
Pubblicazione: (2025)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
di: Wang, Xinghan, et al.
Pubblicazione: (2024)
di: Wang, Xinghan, et al.
Pubblicazione: (2024)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Exposure Completing for Temporally Consistent Neural High Dynamic Range Video Rendering
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
di: Li, Dong, et al.
Pubblicazione: (2025)
di: Li, Dong, et al.
Pubblicazione: (2025)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
di: Zhu, Sa, et al.
Pubblicazione: (2026)
di: Zhu, Sa, et al.
Pubblicazione: (2026)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Audio-visual training for improved grounding in video-text LLMs
di: Sagare, Shivprasad, et al.
Pubblicazione: (2024)
di: Sagare, Shivprasad, et al.
Pubblicazione: (2024)
Context-aware TFL: A Universal Context-aware Contrastive Learning Framework for Temporal Forgery Localization
di: Yin, Qilin, et al.
Pubblicazione: (2025)
di: Yin, Qilin, et al.
Pubblicazione: (2025)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
di: Liu, Ke, et al.
Pubblicazione: (2025)
di: Liu, Ke, et al.
Pubblicazione: (2025)
TMFNet: Two-Stream Multi-Channels Fusion Networks for Color Image Operation Chain Detection
di: Niu, Yakun, et al.
Pubblicazione: (2024)
di: Niu, Yakun, et al.
Pubblicazione: (2024)
4D Gaussian Splatting with Scale-aware Residual Field and Adaptive Optimization for Real-time Rendering of Temporally Complex Dynamic Scenes
di: Yan, Jinbo, et al.
Pubblicazione: (2024)
di: Yan, Jinbo, et al.
Pubblicazione: (2024)
Learning Long-Range Action Representation by Two-Stream Mamba Pyramid Network for Figure Skating Assessment
di: Wang, Fengshun, et al.
Pubblicazione: (2025)
di: Wang, Fengshun, et al.
Pubblicazione: (2025)
Gear-NeRF: Free-Viewpoint Rendering and Tracking with Motion-aware Spatio-Temporal Sampling
di: Liu, Xinhang, et al.
Pubblicazione: (2024)
di: Liu, Xinhang, et al.
Pubblicazione: (2024)
SpatioTemporal Difference Network for Video Depth Super-Resolution
di: Wang, Zhengxue, et al.
Pubblicazione: (2025)
di: Wang, Zhengxue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Find the Cliffhanger: Multi-Modal Trailerness in Soap Operas
di: Bretti, Carlo, et al.
Pubblicazione: (2024) -
A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2025) -
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025) -
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026) -
AsyReC: A Multimodal Graph-based Framework for Spatio-Temporal Asymmetric Dyadic Relationship Classification
di: Tang, Wang, et al.
Pubblicazione: (2025)