Whisper-UT: A Unified Translation Framework for Speech and Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Cihan, Wiesner, Matthew, Chakraborty, Debashish, Kriz, Reno, Cunningham, Keith, Murray, Kenton, Duh, Kevin, Tavarez-Arce, Luis, McNamee, Paul, Khudanpur, Sanjeev |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
Exploring Representational Disparities Between Multilingual and Bilingual Translation Models
par: Verma, Neha, et autres
Publié: (2023)
par: Verma, Neha, et autres
Publié: (2023)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Unified Multimodal Uncertain Inference
par: Zhang, Dengjia, et autres
Publié: (2026)
par: Zhang, Dengjia, et autres
Publié: (2026)
DOTResize: Reducing LLM Width via Discrete Optimal Transport-based Neuron Merging
par: Verma, Neha, et autres
Publié: (2025)
par: Verma, Neha, et autres
Publié: (2025)
Merging Feed-Forward Sublayers for Compressed Transformers
par: Verma, Neha, et autres
Publié: (2025)
par: Verma, Neha, et autres
Publié: (2025)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
par: Garg, Ashi, et autres
Publié: (2025)
par: Garg, Ashi, et autres
Publié: (2025)
Rapidly Adapting to New Voice Spoofing: Few-Shot Detection of Synthesized Speech Under Distribution Shifts
par: Garg, Ashi, et autres
Publié: (2025)
par: Garg, Ashi, et autres
Publié: (2025)
SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Contemporary Trends in Information Delivery. Program for a Workshop. December 11 and 12, 1974, San Francisco Public Library.
par: McNamee, Gil
Publié: (1974)
par: McNamee, Gil
Publié: (1974)
The Mentally Retarded: Challenge for Librarians
par: McNamee, Marian
Publié: (1975)
par: McNamee, Marian
Publié: (1975)
BARC and the Consumer
par: McNamee, Gil
Publié: (1971)
par: McNamee, Gil
Publié: (1971)
Reimagining Theories as Conversational Resources: Implications for Family Therapy
par: Sheila McNamee
Publié: (2025)
par: Sheila McNamee
Publié: (2025)
Research as Social Construction: Transformative Inquiry
par: Sheila McNamee
Publié: (2010)
par: Sheila McNamee
Publié: (2010)
Modeling Overlapped Speech with Shuffles
par: Wiesner, Matthew, et autres
Publié: (2026)
par: Wiesner, Matthew, et autres
Publié: (2026)
GenVC: Self-Supervised Zero-Shot Voice Conversion
par: Cai, Zexin, et autres
Publié: (2025)
par: Cai, Zexin, et autres
Publié: (2025)
Scalable Controllable Accented TTS
par: Xinyuan, Henry Li, et autres
Publié: (2025)
par: Xinyuan, Henry Li, et autres
Publié: (2025)
Privacy versus Emotion Preservation Trade-offs in Emotion-Preserving Speaker Anonymization
par: Cai, Zexin, et autres
Publié: (2024)
par: Cai, Zexin, et autres
Publié: (2024)
HLTCOE JHU Submission to the Voice Privacy Challenge 2024
par: Xinyuan, Henry Li, et autres
Publié: (2024)
par: Xinyuan, Henry Li, et autres
Publié: (2024)
SpeechQE: Estimating the Quality of Direct Speech Translation
par: Han, HyoJung, et autres
Publié: (2024)
par: Han, HyoJung, et autres
Publié: (2024)
Principled Context Engineering for RAG: Statistical Guarantees via Conformal Prediction
par: Chakraborty, Debashish, et autres
Publié: (2025)
par: Chakraborty, Debashish, et autres
Publié: (2025)
Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
par: Huang, Ruizhe, et autres
Publié: (2024)
par: Huang, Ruizhe, et autres
Publié: (2024)
Fire and Rescue Service Preparedness for Natural Hazards
par: Johan Björck, et autres
Publié: (2026)
par: Johan Björck, et autres
Publié: (2026)
WST: Weakly Supervised Transducer for Automatic Speech Recognition
par: Gao, Dongji, et autres
Publié: (2025)
par: Gao, Dongji, et autres
Publié: (2025)
Extending Translate-Train for ColBERT-X to African Language CLIR
par: Yang, Eugene, et autres
Publié: (2024)
par: Yang, Eugene, et autres
Publié: (2024)
Emergent Causal-Geometric Dynamics Across Depth in Large Language Models
par: Haim, Shahar, et autres
Publié: (2026)
par: Haim, Shahar, et autres
Publié: (2026)
World Models as Reference Trajectories for Rapid Motor Adaptation
par: Brito, Carlos Stein, et autres
Publié: (2025)
par: Brito, Carlos Stein, et autres
Publié: (2025)
Adaptive Extremum Seeking Control via the RMSprop Optimizer
par: McNamee, Patrick, et autres
Publié: (2024)
par: McNamee, Patrick, et autres
Publié: (2024)
Unsupervised Speech Enhancement using Data-defined Priors
par: Klement, Dominik, et autres
Publié: (2025)
par: Klement, Dominik, et autres
Publié: (2025)
Universal Speech Content Factorization
par: Xinyuan, Henry Li, et autres
Publié: (2026)
par: Xinyuan, Henry Li, et autres
Publié: (2026)
Hopfield-Fenchel-Young Networks: A Unified Framework for Associative Memory Retrieval
par: Santos, Saul, et autres
Publié: (2024)
par: Santos, Saul, et autres
Publié: (2024)
Can LLMs Help Localize Fake Words in Partially Fake Speech?
par: Zhang, Lin, et autres
Publié: (2026)
par: Zhang, Lin, et autres
Publié: (2026)
On Speaker Attribution with SURT
par: Raj, Desh, et autres
Publié: (2024)
par: Raj, Desh, et autres
Publié: (2024)
Open Science in Impact Evaluation: What Impact Evaluators Can Learn From the Replication Crisis in Social Psychology
par: Ben McNamee, et autres
Publié: (2024)
par: Ben McNamee, et autres
Publié: (2024)
Data Kernel Perspective Space Performance Guarantees for Synthetic Data from Transformer Models
par: Browder, Michael, et autres
Publié: (2026)
par: Browder, Michael, et autres
Publié: (2026)
HLTCOE Evaluation Team at TREC 2025: VQA Track
par: Zhang, Dengjia, et autres
Publié: (2025)
par: Zhang, Dengjia, et autres
Publié: (2025)
Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval
par: Reddy, Arun, et autres
Publié: (2025)
par: Reddy, Arun, et autres
Publié: (2025)
Building Corpora for Single-Channel Speech Separation Across Multiple Domains
par: Maciejewski, Matthew, et autres
Publié: (2018)
par: Maciejewski, Matthew, et autres
Publié: (2018)
Documents similaires
-
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025) -
Exploring Representational Disparities Between Multilingual and Bilingual Translation Models
par: Verma, Neha, et autres
Publié: (2023) -
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024) -
Unified Multimodal Uncertain Inference
par: Zhang, Dengjia, et autres
Publié: (2026) -
DOTResize: Reducing LLM Width via Discrete Optimal Transport-based Neuron Merging
par: Verma, Neha, et autres
Publié: (2025)