Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jun, Zeng, Xijuan, Qiang, Chunyu, Chen, Ruilong, Wang, Shiyao, Wang, Le, Zhou, Wangjing, Cai, Pengfei, Zhao, Jiahui, Li, Nan, Li, Zihan, Liang, Yuzhe, Wang, Xiaopeng, Zheng, Haorui, Wen, Ming, Yin, Kang, Wang, Yiran, Deng, Feng, Dong, Liang, Zhang, Chen, Zhang, Di, Gai, Kun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
InstructAudio: Unified speech and music generation with natural language instruction
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Kling-Omni Technical Report
di: Kling Team, et al.
Pubblicazione: (2025)
di: Kling Team, et al.
Pubblicazione: (2025)
DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance
di: Yin, Kang, et al.
Pubblicazione: (2025)
di: Yin, Kang, et al.
Pubblicazione: (2025)
KlingAvatar 2.0 Technical Report
di: Kling Team, et al.
Pubblicazione: (2025)
di: Kling Team, et al.
Pubblicazione: (2025)
Kling-MotionControl Technical Report
di: Kling Team, et al.
Pubblicazione: (2026)
di: Kling Team, et al.
Pubblicazione: (2026)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Copper homeostasis and cuproptosis‐related genes: Therapeutic perspectives in non‐alcoholic fatty liver disease
di: Wangjing Tan, et al.
Pubblicazione: (2024)
di: Wangjing Tan, et al.
Pubblicazione: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
Towards Flow-Matching-based TTS without Classifier-Free Guidance
di: Liang, Yuzhe, et al.
Pubblicazione: (2025)
di: Liang, Yuzhe, et al.
Pubblicazione: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
Featured Cover: Cover Image, Volume 25, Issue 4
di: Yushuan Wang, et al.
Pubblicazione: (2026)
di: Yushuan Wang, et al.
Pubblicazione: (2026)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
di: Wang, Junnuo
Pubblicazione: (2025)
di: Wang, Junnuo
Pubblicazione: (2025)
FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
di: Li, Mengtian, et al.
Pubblicazione: (2026)
di: Li, Mengtian, et al.
Pubblicazione: (2026)
Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
di: Ding, Yikang, et al.
Pubblicazione: (2025)
di: Ding, Yikang, et al.
Pubblicazione: (2025)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
di: Chan, Nolan, et al.
Pubblicazione: (2026)
di: Chan, Nolan, et al.
Pubblicazione: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)
di: Li, Xiquan, et al.
Pubblicazione: (2025)
Constraints from Fermi observations of Long Gamma-Ray Bursts on cosmological parameters
di: Wang, Huifeng, et al.
Pubblicazione: (2024)
di: Wang, Huifeng, et al.
Pubblicazione: (2024)
Assessing Logical Puzzle Solving in Large Language Models: Insights from a Minesweeper Case Study
di: Li, Yinghao, et al.
Pubblicazione: (2023)
di: Li, Yinghao, et al.
Pubblicazione: (2023)
RPRA-ADD: Forgery Trace Enhancement-Driven Audio Deepfake Detection
di: Fu, Ruibo, et al.
Pubblicazione: (2025)
di: Fu, Ruibo, et al.
Pubblicazione: (2025)
M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
di: Wang, Xiaopeng, et al.
Pubblicazione: (2025)
di: Wang, Xiaopeng, et al.
Pubblicazione: (2025)
Constraining the emergent dark energy models with observational data at intermediate redshift
di: Wang, GuangZhen, et al.
Pubblicazione: (2024)
di: Wang, GuangZhen, et al.
Pubblicazione: (2024)
Soft Pumps: Catalysts for Advancing Fluid‐Driven Soft Robots
di: Yuzhe Wang, et al.
Pubblicazione: (2024)
di: Yuzhe Wang, et al.
Pubblicazione: (2024)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
Chemical Exchange Between Silica Networks and Liquid Metals for All‐Inorganic, Sintering‐Free and Highly Conductive Inks
di: Bo Tian, et al.
Pubblicazione: (2025)
di: Bo Tian, et al.
Pubblicazione: (2025)
Study of Liquid‐Cooled Fuel Cell Stack Uniformity considering Global and Local Characteristics under Air Starvation Conditions
di: Wanteng Wang, et al.
Pubblicazione: (2024)
di: Wanteng Wang, et al.
Pubblicazione: (2024)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
Scaling Image and Video Generation via Test-Time Evolutionary Search
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
di: Chen, Meng, et al.
Pubblicazione: (2026)
di: Chen, Meng, et al.
Pubblicazione: (2026)
Learning to Detect and Segment for Open Vocabulary Object Detection
di: Wang, Tao, et al.
Pubblicazione: (2022)
di: Wang, Tao, et al.
Pubblicazione: (2022)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
Unleashing the Native Recommendation Potential: LLM-Based Generative Recommendation via Structured Term Identifiers
di: Zhang, Zhiyang, et al.
Pubblicazione: (2026)
di: Zhang, Zhiyang, et al.
Pubblicazione: (2026)
A Versatile Nanozyme‐Based NADH Circulating Oxidation Reactor for Tumor Therapy through Triple Cellular Metabolism Disruption
di: Ke Liang, et al.
Pubblicazione: (2024)
di: Ke Liang, et al.
Pubblicazione: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026) -
InstructAudio: Unified speech and music generation with natural language instruction
di: Qiang, Chunyu, et al.
Pubblicazione: (2025) -
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025) -
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024) -
Kling-Omni Technical Report
di: Kling Team, et al.
Pubblicazione: (2025)