AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Haji-Ali, Moayed, Menapace, Willi, Siarohin, Aliaksandr, Skorokhodov, Ivan, Canberk, Alper, Lee, Kwot Sin, Ordonez, Vicente, Tulyakov, Sergey |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Taming Data and Transformers for Audio Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
Improving Progressive Generation with Decomposable Flow Matching
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025)
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
di: Chen, Yu, et al.
Pubblicazione: (2025)
di: Chen, Yu, et al.
Pubblicazione: (2025)
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation
di: Zhu, Qiushi, et al.
Pubblicazione: (2024)
di: Zhu, Qiushi, et al.
Pubblicazione: (2024)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
Video-to-Audio Generation with Fine-grained Temporal Semantics
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
Prediction of Spotify Chart Success Using Audio and Streaming Features
di: Cabansag, Ian Jacob, et al.
Pubblicazione: (2025)
di: Cabansag, Ian Jacob, et al.
Pubblicazione: (2025)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
di: Rouard, Simon, et al.
Pubblicazione: (2024)
di: Rouard, Simon, et al.
Pubblicazione: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)
di: Tal, Or, et al.
Pubblicazione: (2024)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
di: Liu, Wuyang, et al.
Pubblicazione: (2023)
di: Liu, Wuyang, et al.
Pubblicazione: (2023)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
di: Xin, Yifei, et al.
Pubblicazione: (2023)
di: Xin, Yifei, et al.
Pubblicazione: (2023)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
A Noval Feature via Color Quantisation for Fake Audio Detection
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
di: Xiao, Zhenyuan, et al.
Pubblicazione: (2024)
di: Xiao, Zhenyuan, et al.
Pubblicazione: (2024)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Temporally Aligned Audio for Video with Autoregression
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
di: Dehaghania, Parinaz Binandeh, et al.
Pubblicazione: (2026)
di: Dehaghania, Parinaz Binandeh, et al.
Pubblicazione: (2026)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
di: Wu, Yusong, et al.
Pubblicazione: (2022)
di: Wu, Yusong, et al.
Pubblicazione: (2022)
Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement
di: Ye, Zhe, et al.
Pubblicazione: (2026)
di: Ye, Zhe, et al.
Pubblicazione: (2026)
Generalizable Audio Deepfake Detection via Hierarchical Structure Learning and Feature Whitening in Poincaré sphere
di: Yang, Mingru, et al.
Pubblicazione: (2025)
di: Yang, Mingru, et al.
Pubblicazione: (2025)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
PoolingVQ: A VQVAE Variant for Reducing Audio Redundancy and Boosting Multi-Modal Fusion in Music Emotion Analysis
di: Zou, Dinghao, et al.
Pubblicazione: (2025)
di: Zou, Dinghao, et al.
Pubblicazione: (2025)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
di: Wu, Wenxuan, et al.
Pubblicazione: (2024)
di: Wu, Wenxuan, et al.
Pubblicazione: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
OMAR-RQ: Open Music Audio Representation Model Trained with Multi-Feature Masked Token Prediction
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2025)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
SIGNL: A Label-Efficient Audio Deepfake Detection System via Spectral-Temporal Graph Non-Contrastive Learning
di: Febrinanto, Falih Gozi, et al.
Pubblicazione: (2025)
di: Febrinanto, Falih Gozi, et al.
Pubblicazione: (2025)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Taming Data and Transformers for Audio Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024) -
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024) -
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024) -
Improving Progressive Generation with Decomposable Flow Matching
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025) -
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
di: Chen, Yu, et al.
Pubblicazione: (2025)