LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haomin, Qi, Kristin, Yang, Shuxin, Chen, Zihao, Ding, Chaofan, Di, Xinhan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025)
par: Liang, Yunming, et autres
Publié: (2025)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
par: Di, Xinhan, et autres
Publié: (2024)
par: Di, Xinhan, et autres
Publié: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024)
par: Chen, Zihao, et autres
Publié: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
par: Selvaraj, Nithish Muthuchamy, et autres
Publié: (2023)
par: Selvaraj, Nithish Muthuchamy, et autres
Publié: (2023)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
par: Tsai, Fang-Duo, et autres
Publié: (2024)
par: Tsai, Fang-Duo, et autres
Publié: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
DQLoRA: A Lightweight Domain-Aware Denoising ASR via Adapter-guided Distillation
par: Yang, Yiru
Publié: (2025)
par: Yang, Yiru
Publié: (2025)
Lightweight Implicit Neural Network for Binaural Audio Synthesis
par: Lu, Xikun, et autres
Publié: (2025)
par: Lu, Xikun, et autres
Publié: (2025)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
par: Ahn, Sunghwan, et autres
Publié: (2024)
par: Ahn, Sunghwan, et autres
Publié: (2024)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
LS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor Extraction
par: Liang, Di, et autres
Publié: (2024)
par: Liang, Di, et autres
Publié: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
par: Chan, Nolan, et autres
Publié: (2026)
par: Chan, Nolan, et autres
Publié: (2026)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
par: Xiong, Chenxu, et autres
Publié: (2024)
par: Xiong, Chenxu, et autres
Publié: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
Lightweight Resolution-Aware Audio Deepfake Detection via Cross-Scale Attention and Consistency Learning
par: Shahriar, K. A.
Publié: (2026)
par: Shahriar, K. A.
Publié: (2026)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
par: Shimada, Kazuki, et autres
Publié: (2024)
par: Shimada, Kazuki, et autres
Publié: (2024)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
par: Yang, Ningyuan, et autres
Publié: (2026)
par: Yang, Ningyuan, et autres
Publié: (2026)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
par: Dinkel, Heinrich, et autres
Publié: (2025)
par: Dinkel, Heinrich, et autres
Publié: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
Generalized Fake Audio Detection via Deep Stable Learning
par: Wang, Zhiyong, et autres
Publié: (2024)
par: Wang, Zhiyong, et autres
Publié: (2024)
Documents similaires
-
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025) -
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025) -
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024) -
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025) -
Enhance Generation Quality of Flow Matching V2A Model via Multi-Step CoT-Like Guidance and Combined Preference Optimization
par: Zhang, Haomin, et autres
Publié: (2025)