Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Della Libera, Luca, Subakan, Cem, Ravanelli, Mirco |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
par: Della Libera, Luca, et autres
Publié: (2026)
par: Della Libera, Luca, et autres
Publié: (2026)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Focal Modulation Networks for Interpretable Sound Classification
par: Della Libera, Luca, et autres
Publié: (2024)
par: Della Libera, Luca, et autres
Publié: (2024)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
par: Mancini, Eleonora, et autres
Publié: (2024)
par: Mancini, Eleonora, et autres
Publié: (2024)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026)
par: Li, Jingyi, et autres
Publié: (2026)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
par: Mancini, Eleonora, et autres
Publié: (2024)
par: Mancini, Eleonora, et autres
Publié: (2024)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
Audio Editing with Non-Rigid Text Prompts
par: Paissan, Francesco, et autres
Publié: (2023)
par: Paissan, Francesco, et autres
Publié: (2023)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
Dynamic HumTrans: Humming Transcription Using CNNs and Dynamic Programming
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Resource-Efficient Separation Transformer
par: Della Libera, Luca, et autres
Publié: (2022)
par: Della Libera, Luca, et autres
Publié: (2022)
Virtual Consistency for Audio Editing
par: Cervera, Matthieu, et autres
Publié: (2025)
par: Cervera, Matthieu, et autres
Publié: (2025)
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
par: Jeong, Jihoon, et autres
Publié: (2026)
par: Jeong, Jihoon, et autres
Publié: (2026)
Toward Faithful Explanations in Acoustic Anomaly Detection
par: Elrashid, Maab, et autres
Publié: (2026)
par: Elrashid, Maab, et autres
Publié: (2026)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?
par: Öncel, Fırat, et autres
Publié: (2024)
par: Öncel, Fırat, et autres
Publié: (2024)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
par: Zampierin, Luca, et autres
Publié: (2024)
par: Zampierin, Luca, et autres
Publié: (2024)
Scaling Speech Tokenizers with Diffusion Autoencoders
par: Wang, Yuancheng, et autres
Publié: (2026)
par: Wang, Yuancheng, et autres
Publié: (2026)
Causal Prosody Mediation for Text-to-Speech:Counterfactual Training of Duration, Pitch, and Energy in FastSpeech2
par: Mohanty, Suvendu Sekhar
Publié: (2026)
par: Mohanty, Suvendu Sekhar
Publié: (2026)
Split and Conquer Partial Deepfake Speech
par: Rimon, Inbal, et autres
Publié: (2026)
par: Rimon, Inbal, et autres
Publié: (2026)
Sample-Efficient Diffusion for Text-To-Speech Synthesis
par: Lovelace, Justin, et autres
Publié: (2024)
par: Lovelace, Justin, et autres
Publié: (2024)
Investigating Faithfulness in Large Audio Language Models
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Flowing Straighter with Conditional Flow Matching for Accurate Speech Enhancement
par: Cross, Mattias, et autres
Publié: (2025)
par: Cross, Mattias, et autres
Publié: (2025)
JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention
par: Ioannides, Georgios, et autres
Publié: (2025)
par: Ioannides, Georgios, et autres
Publié: (2025)
Structured-Noise Masked Modeling for Video, Audio and Beyond
par: Bhowmik, Aritra, et autres
Publié: (2025)
par: Bhowmik, Aritra, et autres
Publié: (2025)
NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations
par: Liao, Huan, et autres
Publié: (2025)
par: Liao, Huan, et autres
Publié: (2025)
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
par: Wang, Mingxuan, et autres
Publié: (2025)
par: Wang, Mingxuan, et autres
Publié: (2025)
DFKI-Speech System for WildSpoof Challenge: A robust framework for SASV In-the-Wild
par: Das, Arnab, et autres
Publié: (2026)
par: Das, Arnab, et autres
Publié: (2026)
Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features
par: Saurav, Kumar
Publié: (2026)
par: Saurav, Kumar
Publié: (2026)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
MARS: Sound Generation via Multi-Channel Autoregression on Spectrograms
par: Ristori, Eleonora, et autres
Publié: (2025)
par: Ristori, Eleonora, et autres
Publié: (2025)
Beyond saliency: enhancing explanation of speech emotion recognition with expert-referenced acoustic cues
par: Nasr, Seham, et autres
Publié: (2025)
par: Nasr, Seham, et autres
Publié: (2025)
SafeSpeech: Robust and Universal Voice Protection Against Malicious Speech Synthesis
par: Zhang, Zhisheng, et autres
Publié: (2025)
par: Zhang, Zhisheng, et autres
Publié: (2025)
Documents similaires
-
WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation
par: Della Libera, Luca, et autres
Publié: (2026) -
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026) -
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025) -
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025) -
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
par: Della Libera, Luca, et autres
Publié: (2025)