AttentionStitch: How Attention Solves the Speech Editing Problem
Fuente:
arXiv
Salvato in:
| Autori principali: | Alexos, Antonios, Baldi, Pierre |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models
di: Zheng, Haolong, et al.
Pubblicazione: (2025)
di: Zheng, Haolong, et al.
Pubblicazione: (2025)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
di: Weck, Benno, et al.
Pubblicazione: (2024)
di: Weck, Benno, et al.
Pubblicazione: (2024)
WavChat: A Survey of Spoken Dialogue Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
di: Xie, Tianxin, et al.
Pubblicazione: (2024)
di: Xie, Tianxin, et al.
Pubblicazione: (2024)
LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement
di: Jain, Arnav, et al.
Pubblicazione: (2024)
di: Jain, Arnav, et al.
Pubblicazione: (2024)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
di: Ning, Jinzhong, et al.
Pubblicazione: (2025)
di: Ning, Jinzhong, et al.
Pubblicazione: (2025)
Double Mixture: Towards Continual Event Detection from Speech
di: Kang, Jingqi, et al.
Pubblicazione: (2024)
di: Kang, Jingqi, et al.
Pubblicazione: (2024)
Multimodal Speech Enhancement Using Burst Propagation
di: Raza, Mohsin, et al.
Pubblicazione: (2022)
di: Raza, Mohsin, et al.
Pubblicazione: (2022)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
di: Wang, Wupeng, et al.
Pubblicazione: (2024)
di: Wang, Wupeng, et al.
Pubblicazione: (2024)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
Multimodal Emotion Coupling via Speech-to-Facial and Bodily Gestures in Dyadic Interaction
di: Herbuela, Von Ralph Dane Marquez, et al.
Pubblicazione: (2025)
di: Herbuela, Von Ralph Dane Marquez, et al.
Pubblicazione: (2025)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
IML-Spikeformer: Input-aware Multi-Level Spiking Transformer for Speech Processing
di: Song, Zeyang, et al.
Pubblicazione: (2025)
di: Song, Zeyang, et al.
Pubblicazione: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
di: He, Jiajun, et al.
Pubblicazione: (2024)
di: He, Jiajun, et al.
Pubblicazione: (2024)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Music Genre Classification: Ensemble Learning with Subcomponents-level Attention
di: Liu, Yichen, et al.
Pubblicazione: (2024)
di: Liu, Yichen, et al.
Pubblicazione: (2024)
A Recurrent Neural Network Approach to the Answering Machine Detection Problem
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience
di: Chang, Andrew, et al.
Pubblicazione: (2025)
di: Chang, Andrew, et al.
Pubblicazione: (2025)
ComposerX: Multi-Agent Symbolic Music Composition with LLMs
di: Deng, Qixin, et al.
Pubblicazione: (2024)
di: Deng, Qixin, et al.
Pubblicazione: (2024)
ChatMusician: Understanding and Generating Music Intrinsically with LLM
di: Yuan, Ruibin, et al.
Pubblicazione: (2024)
di: Yuan, Ruibin, et al.
Pubblicazione: (2024)
Exploring Adapter Design Tradeoffs for Low Resource Music Generation
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
Kimi-Audio Technical Report
di: KimiTeam, et al.
Pubblicazione: (2025)
di: KimiTeam, et al.
Pubblicazione: (2025)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
di: Xie, Zhifei, et al.
Pubblicazione: (2025)
di: Xie, Zhifei, et al.
Pubblicazione: (2025)
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion Prior
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2025)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2025)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
di: Zhang, Hezhao, et al.
Pubblicazione: (2026)
di: Zhang, Hezhao, et al.
Pubblicazione: (2026)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
di: Liu, Jing, et al.
Pubblicazione: (2023)
di: Liu, Jing, et al.
Pubblicazione: (2023)
Fitting Different Interactive Information: Joint Classification of Emotion and Intention
di: Li, Xinger, et al.
Pubblicazione: (2025)
di: Li, Xinger, et al.
Pubblicazione: (2025)
SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models
di: Dua, Karan, et al.
Pubblicazione: (2025)
di: Dua, Karan, et al.
Pubblicazione: (2025)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
di: Huang, Lian, et al.
Pubblicazione: (2024)
di: Huang, Lian, et al.
Pubblicazione: (2024)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
di: Lv, Yishan, et al.
Pubblicazione: (2026)
di: Lv, Yishan, et al.
Pubblicazione: (2026)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025) -
TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models
di: Zheng, Haolong, et al.
Pubblicazione: (2025) -
Bimodal Connection Attention Fusion for Speech Emotion Recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025) -
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
di: Guan, Yiwen, et al.
Pubblicazione: (2025) -
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2024)