DiffSal: Joint Audio and Video Learning for Diffusion Saliency Prediction
Fuente:
arXiv
Saved in:
| Main Authors: | Xiong, Junwen, Zhang, Peng, You, Tao, Li, Chuanyue, Huang, Wei, Zha, Yufei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2025)
by: Yu, Li, et al.
Published: (2025)
SalFoM: Dynamic Saliency Prediction with Video Foundation Models
by: Moradi, Morteza, et al.
Published: (2024)
by: Moradi, Morteza, et al.
Published: (2024)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2024)
by: Yu, Li, et al.
Published: (2024)
DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction
by: Hooshanfar, Kiana, et al.
Published: (2025)
by: Hooshanfar, Kiana, et al.
Published: (2025)
Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360-Degree Videos
by: Cokelek, Mert, et al.
Published: (2025)
by: Cokelek, Mert, et al.
Published: (2025)
SalFAU-Net: Saliency Fusion Attention U-Net for Salient Object Detection
by: Mulat, Kassaw Abraham, et al.
Published: (2024)
by: Mulat, Kassaw Abraham, et al.
Published: (2024)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
by: Tang, Yolo Yunlong, et al.
Published: (2024)
by: Tang, Yolo Yunlong, et al.
Published: (2024)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
by: Wang, Kai, et al.
Published: (2024)
by: Wang, Kai, et al.
Published: (2024)
Implicit Counterfactual Learning for Audio-Visual Segmentation
by: Zha, Mingfeng, et al.
Published: (2025)
by: Zha, Mingfeng, et al.
Published: (2025)
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
by: Tu, Shuyuan, et al.
Published: (2026)
by: Tu, Shuyuan, et al.
Published: (2026)
Data Augmentation via Latent Diffusion for Saliency Prediction
by: Aydemir, Bahar, et al.
Published: (2024)
by: Aydemir, Bahar, et al.
Published: (2024)
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
by: Huang, Xiaohu, et al.
Published: (2025)
by: Huang, Xiaohu, et al.
Published: (2025)
JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
by: Wu, Yuhui, et al.
Published: (2023)
by: Wu, Yuhui, et al.
Published: (2023)
SecDiff: Diffusion-Aided Secure Deep Joint Source-Channel Coding Against Adversarial Attacks
by: Zhao, Changyuan, et al.
Published: (2025)
by: Zhao, Changyuan, et al.
Published: (2025)
ViSAGE @ NTIRE 2026 Challenge on Video Saliency Prediction
by: Wang, Kun, et al.
Published: (2026)
by: Wang, Kun, et al.
Published: (2026)
SalM$^{2}$: An Extremely Lightweight Saliency Mamba Model for Real-Time Cognitive Awareness of Driver Attention
by: Zhao, Chunyu, et al.
Published: (2025)
by: Zhao, Chunyu, et al.
Published: (2025)
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
by: Zhang, Guohui, et al.
Published: (2026)
by: Zhang, Guohui, et al.
Published: (2026)
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
by: Hogue, Steven, et al.
Published: (2024)
by: Hogue, Steven, et al.
Published: (2024)
ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
by: Ye, Jianping, et al.
Published: (2026)
by: Ye, Jianping, et al.
Published: (2026)
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
by: Ma, Bingqi, et al.
Published: (2026)
by: Ma, Bingqi, et al.
Published: (2026)
DiffKD-DCIS: Predicting Upgrade of Ductal Carcinoma In Situ with Diffusion Augmentation and Knowledge Distillation
by: Li, Tao, et al.
Published: (2026)
by: Li, Tao, et al.
Published: (2026)
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
by: Li, Jie, et al.
Published: (2023)
by: Li, Jie, et al.
Published: (2023)
UP-Diff: Latent Diffusion Model for Remote Sensing Urban Prediction
by: Wang, Zeyu, et al.
Published: (2024)
by: Wang, Zeyu, et al.
Published: (2024)
JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion
by: Chen, Anthony, et al.
Published: (2026)
by: Chen, Anthony, et al.
Published: (2026)
Diffusion Models for Joint Audio-Video Generation
by: La Torre, Alejandro Paredes
Published: (2026)
by: La Torre, Alejandro Paredes
Published: (2026)
HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
by: Chen, Jiahui, et al.
Published: (2026)
by: Chen, Jiahui, et al.
Published: (2026)
Saliency Guided Optimization of Diffusion Latents
by: Wang, Xiwen, et al.
Published: (2024)
by: Wang, Xiwen, et al.
Published: (2024)
DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation
by: Xiong, Tianyu, et al.
Published: (2025)
by: Xiong, Tianyu, et al.
Published: (2025)
StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation
by: Li, Haodong, et al.
Published: (2025)
by: Li, Haodong, et al.
Published: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
by: Li, Wenrui, et al.
Published: (2024)
by: Li, Wenrui, et al.
Published: (2024)
SyncVP: Joint Diffusion for Synchronous Multi-Modal Video Prediction
by: Pallotta, Enrico, et al.
Published: (2025)
by: Pallotta, Enrico, et al.
Published: (2025)
Meta-SurDiff: Classification Diffusion Model Optimized by Meta Learning is Reliable for Online Surgical Phase Recognition
by: Li, Yufei, et al.
Published: (2025)
by: Li, Yufei, et al.
Published: (2025)
SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image Synthesis
by: Gao, Huan-ang, et al.
Published: (2024)
by: Gao, Huan-ang, et al.
Published: (2024)
DiffAD: A Unified Diffusion Modeling Approach for Autonomous Driving
by: Wang, Tao, et al.
Published: (2025)
by: Wang, Tao, et al.
Published: (2025)
BIAS: A Biologically Inspired Algorithm for Video Saliency Detection
by: Zhang, Zhao-ji, et al.
Published: (2026)
by: Zhang, Zhao-ji, et al.
Published: (2026)
RSHazeDiff: A Unified Fourier-aware Diffusion Model for Remote Sensing Image Dehazing
by: Xiong, Jiamei, et al.
Published: (2024)
by: Xiong, Jiamei, et al.
Published: (2024)
DiffMVR: Diffusion-based Automated Multi-Guidance Video Restoration
by: Zhang, Zheyan, et al.
Published: (2024)
by: Zhang, Zheyan, et al.
Published: (2024)
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
by: Choi, Seung hee, et al.
Published: (2026)
by: Choi, Seung hee, et al.
Published: (2026)
Diff-Tracker: Text-to-Image Diffusion Models are Unsupervised Trackers
by: Zhang, Zhengbo, et al.
Published: (2024)
by: Zhang, Zhengbo, et al.
Published: (2024)
Diff-IP2D: Diffusion-Based Hand-Object Interaction Prediction on Egocentric Videos
by: Ma, Junyi, et al.
Published: (2024)
by: Ma, Junyi, et al.
Published: (2024)
Similar Items
-
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2025) -
SalFoM: Dynamic Saliency Prediction with Video Foundation Models
by: Moradi, Morteza, et al.
Published: (2024) -
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2024) -
DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction
by: Hooshanfar, Kiana, et al.
Published: (2025) -
Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360-Degree Videos
by: Cokelek, Mert, et al.
Published: (2025)