SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Dellali, Amir, Lanzendörfer, Luca A., Grötschla, Florian, Wattenhofer, Roger |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
High-Fidelity Music Vocoder using Neural Audio Codecs
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
di: Ungersböck, Michael, et al.
Pubblicazione: (2025)
di: Ungersböck, Michael, et al.
Pubblicazione: (2025)
Benchmarking Diarization Models
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Benchmarking Music Generation Models and Metrics via Human Preference Studies
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
Bias beyond Borders: Global Inequalities in AI-Generated Music
di: Solak, Ahmet, et al.
Pubblicazione: (2025)
di: Solak, Ahmet, et al.
Pubblicazione: (2025)
Parametric Neural Amp Modeling with Active Learning
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
SNAC: Multi-Scale Neural Audio Codec
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
Source Separation for A Cappella Music
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Evaluating Objective Speech Quality Metrics for Neural Audio Codecs
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Adapting Neural Audio Codecs to EEG
di: Kastrati, Ard, et al.
Pubblicazione: (2025)
di: Kastrati, Ard, et al.
Pubblicazione: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
MaskBeat: Loopable Drum Beat Generation
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Inductive Transfer Learning for Graph-Based Recommenders
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
Parametric Neural Amp Modeling with Active Learning
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
EuroSpeech: A Multilingual Speech Corpus
di: Pfisterer, Samuel, et al.
Pubblicazione: (2025)
di: Pfisterer, Samuel, et al.
Pubblicazione: (2025)
SALSA: Speedy ASR-LLM Synchronous Aggregation
di: Mittal, Ashish, et al.
Pubblicazione: (2024)
di: Mittal, Ashish, et al.
Pubblicazione: (2024)
Benchmarking Positional Encodings for GNNs and Graph Transformers
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Next Level Message-Passing with Hierarchical Support Graphs
di: Vonessen, Carlos, et al.
Pubblicazione: (2024)
di: Vonessen, Carlos, et al.
Pubblicazione: (2024)
ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
di: Jin, Weifei, et al.
Pubblicazione: (2025)
di: Jin, Weifei, et al.
Pubblicazione: (2025)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
di: Xiao, Yixuan, et al.
Pubblicazione: (2026)
di: Xiao, Yixuan, et al.
Pubblicazione: (2026)
Training-Free Multimodal Guidance for Video to Audio Generation
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
AEye: A Visualization Tool for Image Datasets
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Alignment-Aware Decoding
di: Berdoz, Frédéric, et al.
Pubblicazione: (2025)
di: Berdoz, Frédéric, et al.
Pubblicazione: (2025)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
di: Ishii, Masato, et al.
Pubblicazione: (2025)
di: Ishii, Masato, et al.
Pubblicazione: (2025)
Benchmarking GNNs Using Lightning Network Data
di: Feichtinger, Rainer, et al.
Pubblicazione: (2024)
di: Feichtinger, Rainer, et al.
Pubblicazione: (2024)
CoRe-GD: A Hierarchical Framework for Scalable Graph Visualization with GNNs
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Flood and Echo Net: Algorithmically Aligned GNNs that Generalize
di: Mathys, Joël, et al.
Pubblicazione: (2023)
di: Mathys, Joël, et al.
Pubblicazione: (2023)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
Improving Out-of-Domain Audio Deepfake Detection via Layer Selection and Fusion of SSL-Based Countermeasures
di: Serrano, Pierre, et al.
Pubblicazione: (2025)
di: Serrano, Pierre, et al.
Pubblicazione: (2025)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
PUZZLES: A Benchmark for Neural Algorithmic Reasoning
di: Estermann, Benjamin, et al.
Pubblicazione: (2024)
di: Estermann, Benjamin, et al.
Pubblicazione: (2024)
WorldSpeech: A Multilingual Speech Corpus from Around the World
di: Asonitis, Antonis, et al.
Pubblicazione: (2026)
di: Asonitis, Antonis, et al.
Pubblicazione: (2026)
ADNAC: Audio Denoiser using Neural Audio Codec
di: Jimon, Daniel, et al.
Pubblicazione: (2025)
di: Jimon, Daniel, et al.
Pubblicazione: (2025)
Targeted Augmented Data for Audio Deepfake Detection
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
Structured-Noise Masked Modeling for Video, Audio and Beyond
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
Documenti analoghi
-
High-Fidelity Music Vocoder using Neural Audio Codecs
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025) -
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025) -
SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
di: Ungersböck, Michael, et al.
Pubblicazione: (2025) -
Benchmarking Diarization Models
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025) -
Benchmarking Music Generation Models and Metrics via Human Preference Studies
di: Grötschla, Florian, et al.
Pubblicazione: (2025)