Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Vosoughi, Ali, Emmanouilidou, Dimitra, Gamper, Hannes |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Sound Replace Vision in LLaVA With Token Substitution?
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Towards Multilingual Audio-Visual Question Answering
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
di: Wu, Junyan, et al.
Pubblicazione: (2024)
di: Wu, Junyan, et al.
Pubblicazione: (2024)
Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis
di: Salehi, Pegah, et al.
Pubblicazione: (2024)
di: Salehi, Pegah, et al.
Pubblicazione: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Non-Verbal Vocalisations and their Challenges: Emotion, Privacy, Sparseness, and Real Life
di: Batliner, Anton, et al.
Pubblicazione: (2025)
di: Batliner, Anton, et al.
Pubblicazione: (2025)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
ChordSync: Conformer-Based Alignment of Chord Annotations to Music Audio
di: Poltronieri, Andrea, et al.
Pubblicazione: (2024)
di: Poltronieri, Andrea, et al.
Pubblicazione: (2024)
Avengers Assemble: Amalgamation of Non-Semantic Features for Depression Detection
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
Are Music Foundation Models Better at Singing Voice Deepfake Detection? Far-Better Fuse them with Speech Foundation Models
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Towards Pre-training an Effective Respiratory Audio Foundation Model
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
MATER: Multi-level Acoustic and Textual Emotion Representation for Interpretable Speech Emotion Recognition
di: Jon, Hyo Jin, et al.
Pubblicazione: (2025)
di: Jon, Hyo Jin, et al.
Pubblicazione: (2025)
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
Faked Speech Detection with Zero Prior Knowledge
di: Ajmi, Sahar Al, et al.
Pubblicazione: (2022)
di: Ajmi, Sahar Al, et al.
Pubblicazione: (2022)
AI-based Drone Assisted Human Rescue in Disaster Environments: Challenges and Opportunities
di: Papyan, Narek, et al.
Pubblicazione: (2024)
di: Papyan, Narek, et al.
Pubblicazione: (2024)
A Speech Enhancement Method Using Fast Fourier Transform and Convolutional Autoencoder
di: Kow, Pu-Yun, et al.
Pubblicazione: (2025)
di: Kow, Pu-Yun, et al.
Pubblicazione: (2025)
Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
di: Cheripally, Sowmya
Pubblicazione: (2024)
di: Cheripally, Sowmya
Pubblicazione: (2024)
Recent Advances and Challenges in Deep Audio-Visual Correlation Learning
di: Vilaça, Luís, et al.
Pubblicazione: (2022)
di: Vilaça, Luís, et al.
Pubblicazione: (2022)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
di: Melechovsky, Jan, et al.
Pubblicazione: (2025)
di: Melechovsky, Jan, et al.
Pubblicazione: (2025)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
PolyGlotFake: A Novel Multilingual and Multimodal DeepFake Dataset
di: Hou, Yang, et al.
Pubblicazione: (2024)
di: Hou, Yang, et al.
Pubblicazione: (2024)
Learning Robust Spatial Representations from Binaural Audio through Feature Distillation
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
di: Bovbjerg, Holger Severin, et al.
Pubblicazione: (2025)
FakeSound: Deepfake General Audio Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
di: Xie, Zeyu, et al.
Pubblicazione: (2025)
Monaural Multi-Speaker Speech Separation Using Efficient Transformer Model
di: Rijal, S., et al.
Pubblicazione: (2023)
di: Rijal, S., et al.
Pubblicazione: (2023)
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Can Sound Replace Vision in LLaVA With Token Substitution?
di: Vosoughi, Ali, et al.
Pubblicazione: (2025) -
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024) -
Towards Multilingual Audio-Visual Question Answering
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024) -
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024) -
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
di: Li, Yuanchao, et al.
Pubblicazione: (2024)