CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Ning, Jinzhong, Tulajiang, Paerhati, Le, Yingying, Zhang, Yijia, Sun, Yuanyuan, Lin, Hongfei, Liu, Haifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
di: Qian, Zhiwen, et al.
Pubblicazione: (2025)
di: Qian, Zhiwen, et al.
Pubblicazione: (2025)
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
Target Speech Diarization with Multimodal Prompts
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
di: Cui, Yang, et al.
Pubblicazione: (2025)
di: Cui, Yang, et al.
Pubblicazione: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
di: Lu, Wenhuan, et al.
Pubblicazione: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Conformer-based Ultrasound-to-Speech Conversion
di: Ibrahimov, Ibrahim, et al.
Pubblicazione: (2025)
di: Ibrahimov, Ibrahim, et al.
Pubblicazione: (2025)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
di: Lin, Jinwei
Pubblicazione: (2024)
di: Lin, Jinwei
Pubblicazione: (2024)
Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?
di: Kumar, Lokesh, et al.
Pubblicazione: (2026)
di: Kumar, Lokesh, et al.
Pubblicazione: (2026)
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
di: Zhou, Dongliang, et al.
Pubblicazione: (2025)
di: Zhou, Dongliang, et al.
Pubblicazione: (2025)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
Listening Between the Lines: Synthetic Speech Detection Disregarding Verbal Content
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
di: Guo, Zixin, et al.
Pubblicazione: (2024)
di: Guo, Zixin, et al.
Pubblicazione: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2023)
di: Pan, Yu, et al.
Pubblicazione: (2023)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
di: Zang, Yongyi, et al.
Pubblicazione: (2024)
di: Zang, Yongyi, et al.
Pubblicazione: (2024)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
di: Lou, Haowei, et al.
Pubblicazione: (2024)
di: Lou, Haowei, et al.
Pubblicazione: (2024)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
di: Mu, Zhaoxi, et al.
Pubblicazione: (2024)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2024)
Recent Advances in Discrete Speech Tokens: A Review
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement
di: Jain, Arnav, et al.
Pubblicazione: (2024)
di: Jain, Arnav, et al.
Pubblicazione: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
di: Li, Jizhen, et al.
Pubblicazione: (2024)
di: Li, Jizhen, et al.
Pubblicazione: (2024)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
di: Cheripally, Sowmya
Pubblicazione: (2024)
di: Cheripally, Sowmya
Pubblicazione: (2024)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
di: Bhagtani, Kratika, et al.
Pubblicazione: (2024)
di: Bhagtani, Kratika, et al.
Pubblicazione: (2024)
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
di: Chen, Guangke, et al.
Pubblicazione: (2025)
di: Chen, Guangke, et al.
Pubblicazione: (2025)
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
di: Min, Anna, et al.
Pubblicazione: (2025)
di: Min, Anna, et al.
Pubblicazione: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
di: Gong, Jingyao
Pubblicazione: (2026)
di: Gong, Jingyao
Pubblicazione: (2026)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
Speak the Art: A Direct Speech to Image Generation Framework
di: Saeed, Mariam, et al.
Pubblicazione: (2025)
di: Saeed, Mariam, et al.
Pubblicazione: (2025)
A Survey on Speech Deepfake Detection
di: Li, Menglu, et al.
Pubblicazione: (2024)
di: Li, Menglu, et al.
Pubblicazione: (2024)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
di: Wang, Anna, et al.
Pubblicazione: (2024)
di: Wang, Anna, et al.
Pubblicazione: (2024)
Documenti analoghi
-
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025) -
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
di: Qian, Zhiwen, et al.
Pubblicazione: (2025) -
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023) -
Target Speech Diarization with Multimodal Prompts
di: Jiang, Yidi, et al.
Pubblicazione: (2024) -
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
di: Cui, Yang, et al.
Pubblicazione: (2025)