Latent Fourier Transform
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Mason, Huang, Cheng-Zhi Anna |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025)
par: Sun, Jiahui, et autres
Publié: (2025)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
par: Chen, Yen-Shan, et autres
Publié: (2026)
par: Chen, Yen-Shan, et autres
Publié: (2026)
Composer Vector: Style-steering Symbolic Music Generation in a Latent Space
par: Jiang, Xunyi, et autres
Publié: (2026)
par: Jiang, Xunyi, et autres
Publié: (2026)
Provable Speech Attributes Conversion via Latent Independence
par: Svirsky, Jonathan, et autres
Publié: (2025)
par: Svirsky, Jonathan, et autres
Publié: (2025)
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
par: Zhang, Bowen, et autres
Publié: (2026)
par: Zhang, Bowen, et autres
Publié: (2026)
Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
par: Quelennec, Aurian, et autres
Publié: (2025)
par: Quelennec, Aurian, et autres
Publié: (2025)
Adaptive Accompaniment with ReaLchords
par: Wu, Yusong, et autres
Publié: (2025)
par: Wu, Yusong, et autres
Publié: (2025)
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
par: Quelennec, Aurian, et autres
Publié: (2025)
par: Quelennec, Aurian, et autres
Publié: (2025)
Efficient and Fast Generative-Based Singing Voice Separation using a Latent Diffusion Model
par: Plaja-Roglans, Genís, et autres
Publié: (2025)
par: Plaja-Roglans, Genís, et autres
Publié: (2025)
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
par: Liu, Yisu, et autres
Publié: (2025)
par: Liu, Yisu, et autres
Publié: (2025)
Emovectors: assessing emotional content in jazz improvisations for creativity evaluation
par: Jordanous, Anna
Publié: (2025)
par: Jordanous, Anna
Publié: (2025)
Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP
par: Karchkhadze, Tornike, et autres
Publié: (2026)
par: Karchkhadze, Tornike, et autres
Publié: (2026)
DRASP: A Dual-Resolution Attentive Statistics Pooling Framework for Automatic MOS Prediction
par: Yang, Cheng-Yeh, et autres
Publié: (2025)
par: Yang, Cheng-Yeh, et autres
Publié: (2025)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
par: Cao, Tianyu, et autres
Publié: (2026)
par: Cao, Tianyu, et autres
Publié: (2026)
AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
par: Xie, Yuankun, et autres
Publié: (2026)
par: Xie, Yuankun, et autres
Publié: (2026)
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
State Space Models for Bioacoustics: A Comparative Evaluation with Transformers
par: Tang, Chengyu, et autres
Publié: (2025)
par: Tang, Chengyu, et autres
Publié: (2025)
Domain-Agnostic Causal-Aware Audio Transformer for Infant Cry Classification
par: Owino, Geofrey, et autres
Publié: (2025)
par: Owino, Geofrey, et autres
Publié: (2025)
'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
par: Nagashima, Chihiro, et autres
Publié: (2025)
par: Nagashima, Chihiro, et autres
Publié: (2025)
SyncSpeech: Efficient and Low-Latency Text-to-Speech based on Temporal Masked Transformer
par: Sheng, Zhengyan, et autres
Publié: (2025)
par: Sheng, Zhengyan, et autres
Publié: (2025)
Emotion Detection in Speech Using Lightweight and Transformer-Based Models: A Comparative and Ablation Study
par: Onyekwelu-Udoka, Lucky, et autres
Publié: (2025)
par: Onyekwelu-Udoka, Lucky, et autres
Publié: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
par: Guo, Xiaoxuan, et autres
Publié: (2026)
par: Guo, Xiaoxuan, et autres
Publié: (2026)
Music Style Transfer With Diffusion Model
par: Huang, Hong, et autres
Publié: (2024)
par: Huang, Hong, et autres
Publié: (2024)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
par: Huang, Pu, et autres
Publié: (2025)
par: Huang, Pu, et autres
Publié: (2025)
Fusion Segment Transformer: Bi-Directional Attention Guided Fusion Network for AI-Generated Music Detection
par: Kim, Yumin, et autres
Publié: (2026)
par: Kim, Yumin, et autres
Publié: (2026)
MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates
par: Huang, Zikang, et autres
Publié: (2026)
par: Huang, Zikang, et autres
Publié: (2026)
Low-Resource Guidance for Controllable Latent Audio Diffusion
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
WildSpoof Challenge Evaluation Plan
par: Wu, Yihan, et autres
Publié: (2025)
par: Wu, Yihan, et autres
Publié: (2025)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
par: Xie, Yuankun, et autres
Publié: (2025)
par: Xie, Yuankun, et autres
Publié: (2025)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
par: Xie, Yuankun, et autres
Publié: (2025)
par: Xie, Yuankun, et autres
Publié: (2025)
Generating Moving 3D Soundscapes with Latent Diffusion Models
par: Templin, Christian, et autres
Publié: (2025)
par: Templin, Christian, et autres
Publié: (2025)
Hierarchical Generative Modeling of Melodic Vocal Contours in Hindustani Classical Music
par: Shikarpur, Nithya, et autres
Publié: (2024)
par: Shikarpur, Nithya, et autres
Publié: (2024)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
par: Xie, Yuankun, et autres
Publié: (2026)
par: Xie, Yuankun, et autres
Publié: (2026)
SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Eliminating stability hallucinations in llm-based tts models via attention guidance
par: Wang, ShiMing, et autres
Publié: (2025)
par: Wang, ShiMing, et autres
Publié: (2025)
SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction
par: Agrawal, Saurabh, et autres
Publié: (2025)
par: Agrawal, Saurabh, et autres
Publié: (2025)
MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
par: Yang, Xiaoran, et autres
Publié: (2025)
par: Yang, Xiaoran, et autres
Publié: (2025)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
par: Gao, Liting, et autres
Publié: (2025)
par: Gao, Liting, et autres
Publié: (2025)
Documents similaires
-
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025) -
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
par: Chen, Yen-Shan, et autres
Publié: (2026) -
Composer Vector: Style-steering Symbolic Music Generation in a Latent Space
par: Jiang, Xunyi, et autres
Publié: (2026) -
Provable Speech Attributes Conversion via Latent Independence
par: Svirsky, Jonathan, et autres
Publié: (2025) -
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
par: Zhang, Bowen, et autres
Publié: (2026)