Transformer-based Video Saliency Prediction with High Temporal Dimension Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Moradi, Morteza, Palazzo, Simone, Spampinato, Concetto |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SalFoM: Dynamic Saliency Prediction with Video Foundation Models
di: Moradi, Morteza, et al.
Pubblicazione: (2024)
di: Moradi, Morteza, et al.
Pubblicazione: (2024)
Global-Local Feature Decoding with Adapter-Guided SAMv2 for Salient Object Detection
di: Moradi, Morteza, et al.
Pubblicazione: (2026)
di: Moradi, Morteza, et al.
Pubblicazione: (2026)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
Brain-Grasp: Graph-based Saliency Priors for Improved fMRI-based Visual Brain Decoding
di: Moradi, Mohammad, et al.
Pubblicazione: (2026)
di: Moradi, Mohammad, et al.
Pubblicazione: (2026)
AIM 2024 Challenge on Video Saliency Prediction: Methods and Results
di: Moskalenko, Andrey, et al.
Pubblicazione: (2024)
di: Moskalenko, Andrey, et al.
Pubblicazione: (2024)
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
di: Li, Jie, et al.
Pubblicazione: (2023)
di: Li, Jie, et al.
Pubblicazione: (2023)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Using Saliency and Cropping to Improve Video Memorability
di: Mudgal, Vaibhav, et al.
Pubblicazione: (2023)
di: Mudgal, Vaibhav, et al.
Pubblicazione: (2023)
MatFuse: Controllable Material Generation with Diffusion Models
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2023)
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2023)
Exposure Completing for Temporally Consistent Neural High Dynamic Range Video Rendering
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
Sphere-GAN: a GAN-based Approach for Saliency Estimation in 360° Videos
di: Wahba, Mahmoud Z. A., et al.
Pubblicazione: (2025)
di: Wahba, Mahmoud Z. A., et al.
Pubblicazione: (2025)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
di: Taghipour, Ashkan, et al.
Pubblicazione: (2026)
di: Taghipour, Ashkan, et al.
Pubblicazione: (2026)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
High-Quality Live Video Streaming via Transcoding Time Prediction and Preset Selection
di: Shahre-Babak, Zahra Nabizadeh, et al.
Pubblicazione: (2023)
di: Shahre-Babak, Zahra Nabizadeh, et al.
Pubblicazione: (2023)
Diffexplainer: Towards Cross-modal Global Explanations with Diffusion Models
di: Pennisi, Matteo, et al.
Pubblicazione: (2024)
di: Pennisi, Matteo, et al.
Pubblicazione: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
di: Zheng, Zihao, et al.
Pubblicazione: (2026)
SOSControl: Enhancing Human Motion Generation through Saliency-Aware Symbolic Orientation and Timing Control
di: Au, Ho Yin, et al.
Pubblicazione: (2025)
di: Au, Ho Yin, et al.
Pubblicazione: (2025)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion
di: Zheng, Guoquan, et al.
Pubblicazione: (2026)
di: Zheng, Guoquan, et al.
Pubblicazione: (2026)
Context Guided Transformer Entropy Modeling for Video Compression
di: Tong, Junlong, et al.
Pubblicazione: (2025)
di: Tong, Junlong, et al.
Pubblicazione: (2025)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
di: Chen, Zhikai, et al.
Pubblicazione: (2024)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
di: Li, Dong, et al.
Pubblicazione: (2025)
di: Li, Dong, et al.
Pubblicazione: (2025)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
VideoMem: Constructing, Analyzing, Predicting Short-term and Long-term Video Memorability
di: Cohendet, Romain, et al.
Pubblicazione: (2018)
di: Cohendet, Romain, et al.
Pubblicazione: (2018)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
A Multimodal Transformer for Live Streaming Highlight Prediction
di: Deng, Jiaxin, et al.
Pubblicazione: (2024)
di: Deng, Jiaxin, et al.
Pubblicazione: (2024)
Advanced Learning-Based Inter Prediction for Future Video Coding
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
di: Zhao, Yanchen, et al.
Pubblicazione: (2024)
Representing Long Volumetric Video with Temporal Gaussian Hierarchy
di: Xu, Zhen, et al.
Pubblicazione: (2024)
di: Xu, Zhen, et al.
Pubblicazione: (2024)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
di: Wang, Xiang, et al.
Pubblicazione: (2025)
di: Wang, Xiang, et al.
Pubblicazione: (2025)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
di: Zhang, Zhihao, et al.
Pubblicazione: (2023)
di: Zhang, Zhihao, et al.
Pubblicazione: (2023)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
di: Yao, Ting, et al.
Pubblicazione: (2024)
di: Yao, Ting, et al.
Pubblicazione: (2024)
Rate-aware Compression for NeRF-based Volumetric Video
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyu, et al.
Pubblicazione: (2024)
L-LBVC: Long-Term Motion Estimation and Prediction for Learned Bi-Directional Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2025)
di: Zhai, Yongqi, et al.
Pubblicazione: (2025)
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
di: Liu, Lingyu, et al.
Pubblicazione: (2026)
Selective Attention-based Modulation for Continual Learning
di: Bellitto, Giovanni, et al.
Pubblicazione: (2024)
di: Bellitto, Giovanni, et al.
Pubblicazione: (2024)
Reversing the Damage: A QP-Aware Transformer-Diffusion Approach for 8K Video Restoration under Codec Compression
di: Dehaghi, Ali Mollaahmadi, et al.
Pubblicazione: (2024)
di: Dehaghi, Ali Mollaahmadi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SalFoM: Dynamic Saliency Prediction with Video Foundation Models
di: Moradi, Morteza, et al.
Pubblicazione: (2024) -
Global-Local Feature Decoding with Adapter-Guided SAMv2 for Salient Object Detection
di: Moradi, Morteza, et al.
Pubblicazione: (2026) -
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025) -
Brain-Grasp: Graph-based Saliency Priors for Improved fMRI-based Visual Brain Decoding
di: Moradi, Mohammad, et al.
Pubblicazione: (2026) -
AIM 2024 Challenge on Video Saliency Prediction: Methods and Results
di: Moskalenko, Andrey, et al.
Pubblicazione: (2024)