Enregistré dans:
| Auteurs principaux: | Jung, Chaeyoung, Ki, Hojoon, Kim, Ji-Hoon, Kim, Junmo, Chung, Joon Son |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2506.03020 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Probing Cross-modal Information Hubs in Audio-Visual LLMs
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
FxSearcher: gradient-free text-driven audio transformation
par: Ki, Hojoon, et autres
Publié: (2025)
par: Ki, Hojoon, et autres
Publié: (2025)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
par: Kim, Youkyum, et autres
Publié: (2024)
par: Kim, Youkyum, et autres
Publié: (2024)
TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
par: Kim, Jongsuk, et autres
Publié: (2025)
par: Kim, Jongsuk, et autres
Publié: (2025)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis
par: Nguyen, Tan Dat, et autres
Publié: (2026)
par: Nguyen, Tan Dat, et autres
Publié: (2026)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
SEED: Speaker Embedding Enhancement Diffusion Model
par: Nam, KiHyun, et autres
Publié: (2025)
par: Nam, KiHyun, et autres
Publié: (2025)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
Cinematic Audio Source Separation Using Visual Cues
par: Zhang, Kang, et autres
Publié: (2026)
par: Zhang, Kang, et autres
Publié: (2026)
SCORE: Scaling audio generation using Standardized COmposite REwards
par: Jung, Jaemin, et autres
Publié: (2025)
par: Jung, Jaemin, et autres
Publié: (2025)
VoxSim: A perceptual voice similarity dataset
par: Ahn, Junseok, et autres
Publié: (2024)
par: Ahn, Junseok, et autres
Publié: (2024)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
par: Kim, Jongsuk, et autres
Publié: (2024)
par: Kim, Jongsuk, et autres
Publié: (2024)
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
par: Nguyen, Tan Dat, et autres
Publié: (2025)
par: Nguyen, Tan Dat, et autres
Publié: (2025)
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
par: Kim, Sungnyun, et autres
Publié: (2025)
par: Kim, Sungnyun, et autres
Publié: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
MATE: Matryoshka Audio-Text Embeddings for Open-Vocabulary Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2026)
par: Jung, Youngmoon, et autres
Publié: (2026)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
par: Rho, Kyeongha, et autres
Publié: (2025)
par: Rho, Kyeongha, et autres
Publié: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
par: Nam, KiHyun, et autres
Publié: (2024)
par: Nam, KiHyun, et autres
Publié: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024)
par: Choi, Jeongsoo, et autres
Publié: (2024)
Adapting a Text-to-Audio Model for Room Impulse Response Generation
par: Kim, Kirak, et autres
Publié: (2026)
par: Kim, Kirak, et autres
Publié: (2026)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
par: Kim, Ji-Hoon, et autres
Publié: (2024)
par: Kim, Ji-Hoon, et autres
Publié: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
par: Nam, KiHyun, et autres
Publié: (2025)
par: Nam, KiHyun, et autres
Publié: (2025)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
par: Nam, KiHyun, et autres
Publié: (2026)
par: Nam, KiHyun, et autres
Publié: (2026)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
par: Kim, Jaehun, et autres
Publié: (2025)
par: Kim, Jaehun, et autres
Publié: (2025)
Relational Proxy Loss for Audio-Text based Keyword Spotting
par: Jung, Youngmoon, et autres
Publié: (2024)
par: Jung, Youngmoon, et autres
Publié: (2024)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
par: Chung, HaeChun
Publié: (2025)
par: Chung, HaeChun
Publié: (2025)
Documents similaires
-
Probing Cross-modal Information Hubs in Audio-Visual LLMs
par: Jung, Jihoo, et autres
Publié: (2026) -
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024) -
FxSearcher: gradient-free text-driven audio transformation
par: Ki, Hojoon, et autres
Publié: (2025) -
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025) -
Bridging the Gap between Audio and Text using Parallel-attention for User-defined Keyword Spotting
par: Kim, Youkyum, et autres
Publié: (2024)