Streaming Sequence Transduction through Dynamic Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Weiting, Chen, Yunmo, Chen, Tongfei, Qin, Guanghui, Xu, Haoran, Zhang, Heidi C., Van Durme, Benjamin, Koehn, Philipp |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpecTokenizer: A Lightweight Streaming Codec in the Compressed Spectrum Domain
par: Wan, Zixiang, et autres
Publié: (2025)
par: Wan, Zixiang, et autres
Publié: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023)
par: Ning, Ziqian, et autres
Publié: (2023)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
Neural-Enhanced Dynamic Range Compression Inversion: A Hybrid Approach for Restoring Audio Dynamics
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025)
par: Chen, Wenxi, et autres
Publié: (2025)
Zero-Shot Text-to-Speech from Continuous Text Streams
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding
par: Zhou, Haoran, et autres
Publié: (2025)
par: Zhou, Haoran, et autres
Publié: (2025)
Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
par: Tan, Weiting, et autres
Publié: (2025)
par: Tan, Weiting, et autres
Publié: (2025)
Dynamic Range Compression and Its Effect on Music Genre Classification
par: Madsen III, Arlyn Reese
Publié: (2024)
par: Madsen III, Arlyn Reese
Publié: (2024)
DiffAnon: Diffusion-based Prosody Control for Voice Anonymization
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
par: Ulgen, Ismail Rasim, et autres
Publié: (2026)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
StreamAAD: Decoding Spatial Auditory Attention with a Streaming Architecture
par: Qiu, Zelin, et autres
Publié: (2024)
par: Qiu, Zelin, et autres
Publié: (2024)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
par: Chen, Peikun, et autres
Publié: (2024)
par: Chen, Peikun, et autres
Publié: (2024)
Rate-Aware Learned Speech Compression
par: Xu, Jun, et autres
Publié: (2025)
par: Xu, Jun, et autres
Publié: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
par: Chen, Zhiyong, et autres
Publié: (2024)
par: Chen, Zhiyong, et autres
Publié: (2024)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
par: Wu, Weijie, et autres
Publié: (2025)
par: Wu, Weijie, et autres
Publié: (2025)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
par: Chen, Wenxi, et autres
Publié: (2024)
par: Chen, Wenxi, et autres
Publié: (2024)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
par: Wang, Hankun, et autres
Publié: (2025)
par: Wang, Hankun, et autres
Publié: (2025)
Personalized Voice Synthesis through Human-in-the-Loop Coordinate Descent
par: Tian, Yusheng, et autres
Publié: (2024)
par: Tian, Yusheng, et autres
Publié: (2024)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
par: Guo, Dake, et autres
Publié: (2025)
par: Guo, Dake, et autres
Publié: (2025)
SSR: Alignment-Aware Modality Connector for Speech Language Models
par: Tan, Weiting, et autres
Publié: (2024)
par: Tan, Weiting, et autres
Publié: (2024)
FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection
par: Wang, Chengyou, et autres
Publié: (2026)
par: Wang, Chengyou, et autres
Publié: (2026)
Enhancing Automatic Chord Recognition through LLM Chain-of-Thought Reasoning
par: Chang, Chih-Cheng, et autres
Publié: (2025)
par: Chang, Chih-Cheng, et autres
Publié: (2025)
Sparsely Shared LoRA on Whisper for Child Speech Recognition
par: Liu, Wei, et autres
Publié: (2023)
par: Liu, Wei, et autres
Publié: (2023)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
par: Wang, Haoran, et autres
Publié: (2025)
par: Wang, Haoran, et autres
Publié: (2025)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
par: Tao, Dehua, et autres
Publié: (2024)
par: Tao, Dehua, et autres
Publié: (2024)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
par: Zhang, Hanlin, et autres
Publié: (2026)
par: Zhang, Hanlin, et autres
Publié: (2026)
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
par: Chen, Yu, et autres
Publié: (2025)
par: Chen, Yu, et autres
Publié: (2025)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization
par: Ho, Luong, et autres
Publié: (2025)
par: Ho, Luong, et autres
Publié: (2025)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Robust Lossy Audio Compression Identification
par: Koops, Hendrik Vincent, et autres
Publié: (2024)
par: Koops, Hendrik Vincent, et autres
Publié: (2024)
Prediction of Spotify Chart Success Using Audio and Streaming Features
par: Cabansag, Ian Jacob, et autres
Publié: (2025)
par: Cabansag, Ian Jacob, et autres
Publié: (2025)
Documents similaires
-
SpecTokenizer: A Lightweight Streaming Codec in the Compressed Spectrum Domain
par: Wan, Zixiang, et autres
Publié: (2025) -
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024) -
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023) -
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025) -
Neural-Enhanced Dynamic Range Compression Inversion: A Hybrid Approach for Restoring Audio Dynamics
par: Sun, Haoran, et autres
Publié: (2024)