ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Yichen, Dai, Wei, Liu, Jiaen, Kwok, Ching Wing, Wu, Zongheng, Xiao, Xudong, Sun, Ao, Fu, Sheng, Zhan, Jianyuan, Wang, Yian, Saito, Takatomo, Lai, Sicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Applying LLMs for Rescoring N-best ASR Hypotheses of Casual Conversations: Effects of Domain Adaptation and Context Carry-over
por: Ogawa, Atsunori, et al.
Publicado: (2024)
por: Ogawa, Atsunori, et al.
Publicado: (2024)
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
por: Mei, Yuxiang, et al.
Publicado: (2026)
por: Mei, Yuxiang, et al.
Publicado: (2026)
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025)
por: Li, Zhipeng, et al.
Publicado: (2025)
Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training
por: Feng, Jianyuan, et al.
Publicado: (2025)
por: Feng, Jianyuan, et al.
Publicado: (2025)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
por: Leung, Wing-Zin, et al.
Publicado: (2024)
por: Leung, Wing-Zin, et al.
Publicado: (2024)
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation
por: Matsuura, Kohei, et al.
Publicado: (2024)
por: Matsuura, Kohei, et al.
Publicado: (2024)
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
RAG-Boost: Retrieval-Augmented Generation Enhanced LLM-based Speech Recognition
por: Wang, Pengcheng, et al.
Publicado: (2025)
por: Wang, Pengcheng, et al.
Publicado: (2025)
XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection
por: Ng, Kwok-Ho, et al.
Publicado: (2026)
por: Ng, Kwok-Ho, et al.
Publicado: (2026)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
ViSAGe: Video-to-Spatial Audio Generation
por: Kim, Jaeyeon, et al.
Publicado: (2025)
por: Kim, Jaeyeon, et al.
Publicado: (2025)
Two-sided Acoustic Metascreen for Broadband and Individual Reflection and Transmission Control
por: Chen, Ao, et al.
Publicado: (2024)
por: Chen, Ao, et al.
Publicado: (2024)
Neural Network-Based Time-Frequency-Bin-Wise Linear Combination of Beamformers for Underdetermined Target Source Extraction
por: Chen, Changda, et al.
Publicado: (2026)
por: Chen, Changda, et al.
Publicado: (2026)
Lend a Hand: Semi Training-Free Cued Speech Recognition via MLLM-Driven Hand Modeling for Barrier-free Communication
por: Huang, Guanjie, et al.
Publicado: (2025)
por: Huang, Guanjie, et al.
Publicado: (2025)
Speech Separation using Neural Audio Codecs with Embedding Loss
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
por: Gállego, Gerard I., et al.
Publicado: (2025)
por: Gállego, Gerard I., et al.
Publicado: (2025)
A Kalman Filter model for synchronization in musical ensembles
por: Carvalho, Hugo T., et al.
Publicado: (2024)
por: Carvalho, Hugo T., et al.
Publicado: (2024)
Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context
por: Ao, Junyi, et al.
Publicado: (2025)
por: Ao, Junyi, et al.
Publicado: (2025)
Aligning Text-to-Music Evaluation with Human Preferences
por: Huang, Yichen, et al.
Publicado: (2025)
por: Huang, Yichen, et al.
Publicado: (2025)
NTT Multi-Speaker ASR System for the DASR Task of CHiME-8 Challenge
por: Kamo, Naoyuki, et al.
Publicado: (2024)
por: Kamo, Naoyuki, et al.
Publicado: (2024)
Low algorithmic delay implementation of convolutional beamformer for online joint source separation and dereverberation
por: Mo, Kaien, et al.
Publicado: (2024)
por: Mo, Kaien, et al.
Publicado: (2024)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
por: Yang, Jianing, et al.
Publicado: (2025)
por: Yang, Jianing, et al.
Publicado: (2025)
Advancing Continual Learning for Robust Deepfake Audio Classification
por: Dong, Feiyi, et al.
Publicado: (2024)
por: Dong, Feiyi, et al.
Publicado: (2024)
Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
por: Moritz, Niko, et al.
Publicado: (2024)
por: Moritz, Niko, et al.
Publicado: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
por: Xiao, Feiyang, et al.
Publicado: (2024)
por: Xiao, Feiyang, et al.
Publicado: (2024)
Data Augmentation for Pathological Speech Enhancement
por: Hou, Mingchi, et al.
Publicado: (2026)
por: Hou, Mingchi, et al.
Publicado: (2026)
Open-Source System for Multilingual Translation and Cloned Speech Synthesis
por: Cámara, Mateo, et al.
Publicado: (2025)
por: Cámara, Mateo, et al.
Publicado: (2025)
TTA: Transcribe, Translate and Alignment for Cross-lingual Speech Representation
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)
por: Mei, Xinhao, et al.
Publicado: (2022)
SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data
por: Lu, Yichen, et al.
Publicado: (2024)
por: Lu, Yichen, et al.
Publicado: (2024)
Contrastive Augmentation: An Unsupervised Learning Approach for Keyword Spotting in Speech Technology
por: Dai, Weinan, et al.
Publicado: (2024)
por: Dai, Weinan, et al.
Publicado: (2024)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
por: Zhao, Jinzheng, et al.
Publicado: (2024)
por: Zhao, Jinzheng, et al.
Publicado: (2024)
EffortNet: A Deep Learning Framework for Objective Assessment of Speech Enhancement Technologies Using EEG-Based Alpha Oscillations
por: Sung, Ching-Chih, et al.
Publicado: (2025)
por: Sung, Ching-Chih, et al.
Publicado: (2025)
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
por: Ma, Duo, et al.
Publicado: (2024)
por: Ma, Duo, et al.
Publicado: (2024)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
por: Lin, Jingru, et al.
Publicado: (2024)
por: Lin, Jingru, et al.
Publicado: (2024)
ChildAugment: Data Augmentation Methods for Zero-Resource Children's Speaker Verification
por: Singh, Vishwanath Pratap, et al.
Publicado: (2024)
por: Singh, Vishwanath Pratap, et al.
Publicado: (2024)
Evaluating the Expressive Appropriateness of Speech in Rich Contexts
por: Wang, Tianrui, et al.
Publicado: (2026)
por: Wang, Tianrui, et al.
Publicado: (2026)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
por: Luong, Justin, et al.
Publicado: (2025)
por: Luong, Justin, et al.
Publicado: (2025)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
por: Geng, Haopeng, et al.
Publicado: (2025)
por: Geng, Haopeng, et al.
Publicado: (2025)
Ejemplares similares
-
Applying LLMs for Rescoring N-best ASR Hypotheses of Casual Conversations: Effects of Domain Adaptation and Context Carry-over
por: Ogawa, Atsunori, et al.
Publicado: (2024) -
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
por: Mei, Yuxiang, et al.
Publicado: (2026) -
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025) -
Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training
por: Feng, Jianyuan, et al.
Publicado: (2025) -
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
por: Leung, Wing-Zin, et al.
Publicado: (2024)