LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Fei, Ni, Xuanfan, Yang, Renyi, Geng, Jiahui, Li, Qing, Lyu, Chenyang, Du, Yichao, Wang, Longyue, Luo, Weihua, Zhang, Kaifu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models
par: Sun, Haoqin, et autres
Publié: (2026)
par: Sun, Haoqin, et autres
Publié: (2026)
Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
The Affective Bridge: Preserving Speech Representations while Enhancing Deepfake Detection vian emotional Constraints
par: Li, Yupei, et autres
Publié: (2025)
par: Li, Yupei, et autres
Publié: (2025)
Marco-Voice Technical Report
par: Tian, Fengping, et autres
Publié: (2025)
par: Tian, Fengping, et autres
Publié: (2025)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
An Investigation Into Various Approaches For Bengali Long-Form Speech Transcription and Bengali Speaker Diarization
par: Jahan, Epshita, et autres
Publié: (2026)
par: Jahan, Epshita, et autres
Publié: (2026)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec
par: Liu, Fei, et autres
Publié: (2026)
par: Liu, Fei, et autres
Publié: (2026)
NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages
par: Maltais, Marie, et autres
Publié: (2026)
par: Maltais, Marie, et autres
Publié: (2026)
HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
Universal Discrete-Domain Speech Enhancement
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions
par: Jing, Xin, et autres
Publié: (2026)
par: Jing, Xin, et autres
Publié: (2026)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
SpeechT: Findings of the First Mentorship in Speech Translation
par: Moslem, Yasmin, et autres
Publié: (2025)
par: Moslem, Yasmin, et autres
Publié: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Borderless Long Speech Synthesis
par: Song, Xingchen, et autres
Publié: (2026)
par: Song, Xingchen, et autres
Publié: (2026)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
Prompting Whisper for Joint Speech Transcription and Diarization
par: Zamyrova, Mariia, et autres
Publié: (2026)
par: Zamyrova, Mariia, et autres
Publié: (2026)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
par: Hirschkind, Nameer, et autres
Publié: (2024)
par: Hirschkind, Nameer, et autres
Publié: (2024)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
par: Polák, Peter, et autres
Publié: (2023)
par: Polák, Peter, et autres
Publié: (2023)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
par: Le, Chenyang, et autres
Publié: (2024)
par: Le, Chenyang, et autres
Publié: (2024)
Long-Context Speech Synthesis with Context-Aware Memory
par: Li, Zhipeng, et autres
Publié: (2025)
par: Li, Zhipeng, et autres
Publié: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
par: Cheng, Sitong, et autres
Publié: (2025)
par: Cheng, Sitong, et autres
Publié: (2025)
A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
par: Ye, Runchuan, et autres
Publié: (2025)
par: Ye, Runchuan, et autres
Publié: (2025)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs
par: Papi, Sara, et autres
Publié: (2026)
par: Papi, Sara, et autres
Publié: (2026)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
par: Wang, Dingdong, et autres
Publié: (2025)
par: Wang, Dingdong, et autres
Publié: (2025)
High-Fidelity Simultaneous Speech-To-Speech Translation
par: Labiausse, Tom, et autres
Publié: (2025)
par: Labiausse, Tom, et autres
Publié: (2025)
Direct Speech to Speech Translation: A Review
par: Sarim, Mohammad, et autres
Publié: (2025)
par: Sarim, Mohammad, et autres
Publié: (2025)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
par: Kim, June-Woo, et autres
Publié: (2026)
par: Kim, June-Woo, et autres
Publié: (2026)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Listening or Reading? Evaluating Speech Awareness in Chain-of-Thought Speech-to-Text Translation
par: Romero-Díaz, Jacobo, et autres
Publié: (2025)
par: Romero-Díaz, Jacobo, et autres
Publié: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025)
par: Li, Xuanchen, et autres
Publié: (2025)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
par: Chen, Peikun, et autres
Publié: (2024)
par: Chen, Peikun, et autres
Publié: (2024)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Documents similaires
-
Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models
par: Sun, Haoqin, et autres
Publié: (2026) -
Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation
par: Ni, Xuanfan, et autres
Publié: (2025) -
The Affective Bridge: Preserving Speech Representations while Enhancing Deepfake Detection vian emotional Constraints
par: Li, Yupei, et autres
Publié: (2025) -
Marco-Voice Technical Report
par: Tian, Fengping, et autres
Publié: (2025) -
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
par: Le, Khanh, et autres
Publié: (2025)