MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tao, Ye, Wu, Wen, Zhang, Chao, Wu, Mengyue, Wang, Shuai, Xu, Xuenan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
par: Xu, Xuenan, et autres
Publié: (2025)
par: Xu, Xuenan, et autres
Publié: (2025)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025)
par: Zheng, Zihao, et autres
Publié: (2025)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
par: Zhang, Yaoyun, et autres
Publié: (2024)
par: Zhang, Yaoyun, et autres
Publié: (2024)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Towards Weakly Supervised Text-to-Audio Grounding
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
par: Xie, Zeyu, et autres
Publié: (2023)
par: Xie, Zeyu, et autres
Publié: (2023)
Can Audio Large Language Models Verify Speaker Identity?
par: Ren, Yiming, et autres
Publié: (2025)
par: Ren, Yiming, et autres
Publié: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
par: Sun, Luoyi, et autres
Publié: (2023)
par: Sun, Luoyi, et autres
Publié: (2023)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
par: Xu, Xuenan, et autres
Publié: (2023)
par: Xu, Xuenan, et autres
Publié: (2023)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
Enhancing Audio Generation Diversity with Visual Information
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing
par: Xu, Xuenan, et autres
Publié: (2026)
par: Xu, Xuenan, et autres
Publié: (2026)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)
par: Xie, Zeyu, et autres
Publié: (2026)
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
par: Mei, Jiahao, et autres
Publié: (2026)
par: Mei, Jiahao, et autres
Publié: (2026)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
LARA-Gen: Enabling Continuous Emotion Control for Music Generation Models via Latent Affective Representation Alignment
par: Mei, Jiahao, et autres
Publié: (2025)
par: Mei, Jiahao, et autres
Publié: (2025)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
par: Li, Baihan, et autres
Publié: (2024)
par: Li, Baihan, et autres
Publié: (2024)
Unified Pathological Speech Analysis with Prompt Tuning
par: Yang, Fei, et autres
Publié: (2024)
par: Yang, Fei, et autres
Publié: (2024)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
par: Liu, Haohe, et autres
Publié: (2024)
par: Liu, Haohe, et autres
Publié: (2024)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
par: Chen, William, et autres
Publié: (2026)
par: Chen, William, et autres
Publié: (2026)
When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
Unified Audio Event Detection
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
par: Li, Hongyi, et autres
Publié: (2025)
par: Li, Hongyi, et autres
Publié: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
AudioToolAgent: An Agentic Framework for Audio-Language Models
par: Wijngaard, Gijs, et autres
Publié: (2025)
par: Wijngaard, Gijs, et autres
Publié: (2025)
Guiding Audio Editing with Audio Language Model
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
par: Bensaid, Reda, et autres
Publié: (2026)
par: Bensaid, Reda, et autres
Publié: (2026)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
par: Xie, Yuankun, et autres
Publié: (2026)
par: Xie, Yuankun, et autres
Publié: (2026)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
par: Yang, Dongchao, et autres
Publié: (2025)
par: Yang, Dongchao, et autres
Publié: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
par: Zhang, Linhao, et autres
Publié: (2026)
par: Zhang, Linhao, et autres
Publié: (2026)
Documents similaires
-
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
par: Xu, Xuenan, et autres
Publié: (2025) -
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025) -
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024) -
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
par: Zhang, Yaoyun, et autres
Publié: (2024) -
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)