Guardado en:
| Autores principales: | Eyiokur, Fevziye Irem, Huber, Christian, Nguyen, Thai-Binh, Nguyen, Tuan-Nam, Retkowski, Fabian, Ugan, Enes Yavuz, Yaman, Dogucan, Waibel, Alexander |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2410.11434 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis
por: Yaman, Dogucan, et al.
Publicado: (2025)
por: Yaman, Dogucan, et al.
Publicado: (2025)
CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding
por: Eyiokur, Fevziye Irem, et al.
Publicado: (2025)
por: Eyiokur, Fevziye Irem, et al.
Publicado: (2025)
Assessing Identity Leakage in Talking Face Generation: Metrics and Evaluation Framework
por: Yaman, Dogucan, et al.
Publicado: (2025)
por: Yaman, Dogucan, et al.
Publicado: (2025)
A Multimodal Depth-Aware Method For Embodied Reference Understanding
por: Eyiokur, Fevziye Irem, et al.
Publicado: (2025)
por: Eyiokur, Fevziye Irem, et al.
Publicado: (2025)
Audio-driven Talking Face Generation with Stabilized Synchronization Loss
por: Yaman, Dogucan, et al.
Publicado: (2023)
por: Yaman, Dogucan, et al.
Publicado: (2023)
Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation
por: Yaman, Dogucan, et al.
Publicado: (2025)
por: Yaman, Dogucan, et al.
Publicado: (2025)
Audio-Visual Speech Representation Expert for Enhanced Talking Face Video Generation and Evaluation
por: Yaman, Dogucan, et al.
Publicado: (2024)
por: Yaman, Dogucan, et al.
Publicado: (2024)
Bayesian Low-Rank Factorization for Robust Model Adaptation
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion
por: Koneru, Sai, et al.
Publicado: (2025)
por: Koneru, Sai, et al.
Publicado: (2025)
Beyond Transcripts: A Renewed Perspective on Audio Chaptering
por: Retkowski, Fabian, et al.
Publicado: (2026)
por: Retkowski, Fabian, et al.
Publicado: (2026)
End-to-End Evaluation for Low-Latency Simultaneous Speech Translation
por: Huber, Christian, et al.
Publicado: (2023)
por: Huber, Christian, et al.
Publicado: (2023)
MUSCAT: MUltilingual, SCientific ConversATion Benchmark
por: Sinhamahapatra, Supriti, et al.
Publicado: (2026)
por: Sinhamahapatra, Supriti, et al.
Publicado: (2026)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
Adapting Language Balance in Code-Switching Speech
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
From Text Segmentation to Smart Chaptering: A Novel Benchmark for Structuring Video Transcriptions
por: Retkowski, Fabian, et al.
Publicado: (2024)
por: Retkowski, Fabian, et al.
Publicado: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
Convoifilter: A case study of doing cocktail party speech recognition
por: Nguyen, Thai-Binh, et al.
Publicado: (2023)
por: Nguyen, Thai-Binh, et al.
Publicado: (2023)
Paragraph Segmentation Revisited: Towards a Standard Task for Structuring Speech
por: Retkowski, Fabian, et al.
Publicado: (2025)
por: Retkowski, Fabian, et al.
Publicado: (2025)
Zero-Shot Strategies for Length-Controllable Summarization
por: Retkowski, Fabian, et al.
Publicado: (2024)
por: Retkowski, Fabian, et al.
Publicado: (2024)
KIT's Low-resource Speech Translation Systems for IWSLT2025: System Enhancement with Synthetic Data and Model Regularization
por: Li, Zhaolin, et al.
Publicado: (2025)
por: Li, Zhaolin, et al.
Publicado: (2025)
PIER: A Novel Metric for Evaluating What Matters in Code-Switching
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
The AI Co-Ethnographer: How Far Can Automation Take Qualitative Research?
por: Retkowski, Fabian, et al.
Publicado: (2025)
por: Retkowski, Fabian, et al.
Publicado: (2025)
Cocktail-Party Audio-Visual Speech Recognition
por: Nguyen, Thai-Binh, et al.
Publicado: (2025)
por: Nguyen, Thai-Binh, et al.
Publicado: (2025)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
Accent conversion using discrete units with parallel data synthesized from controllable accented TTS
por: Nguyen, Tuan Nam, et al.
Publicado: (2024)
por: Nguyen, Tuan Nam, et al.
Publicado: (2024)
Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS
por: Nguyen, Tuan Nam, et al.
Publicado: (2024)
por: Nguyen, Tuan Nam, et al.
Publicado: (2024)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
por: Nguyen, Tuan-Nam, et al.
Publicado: (2025)
por: Nguyen, Tuan-Nam, et al.
Publicado: (2025)
KIT's Offline Speech Translation and Instruction Following Submission for IWSLT 2025
por: Koneru, Sai, et al.
Publicado: (2025)
por: Koneru, Sai, et al.
Publicado: (2025)
A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results
por: Nguyen, Thai-Binh, et al.
Publicado: (2025)
por: Nguyen, Thai-Binh, et al.
Publicado: (2025)
The Titan
Publicado: (2025)
Publicado: (2025)
Titanic=Titanic [VHS - video] // James Cameron
por: Cameron, Janes
por: Cameron, Janes
Modeling Low-Temperature Plasmas Simulating Titan's Atmosphere
por: Dubois, David, et al.
Publicado: (2025)
por: Dubois, David, et al.
Publicado: (2025)
Epilogue for Titanic
Publicado: (1987)
Publicado: (1987)
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
por: Koneru, Sai, et al.
Publicado: (2024)
por: Koneru, Sai, et al.
Publicado: (2024)
Titan's Fluvial and Lacustrine Landscapes
por: Birch, Samuel P. D., et al.
Publicado: (2025)
por: Birch, Samuel P. D., et al.
Publicado: (2025)
Summarizing Speech: A Comprehensive Survey
por: Retkowski, Fabian, et al.
Publicado: (2025)
por: Retkowski, Fabian, et al.
Publicado: (2025)
admaue/TitanRadarTrends: TitanRadarTrends_v1
por: Maue, Anthony David
Publicado: (2025)
por: Maue, Anthony David
Publicado: (2025)
Before They Were Titans
Publicado: (2018)
Publicado: (2018)
SARA: Stress Test Reasoning in Audio Deepfake Detection
por: Nguyen, Binh, et al.
Publicado: (2026)
por: Nguyen, Binh, et al.
Publicado: (2026)
Handling Numeric Expressions in Automatic Speech Recognition
por: Huber, Christian, et al.
Publicado: (2024)
por: Huber, Christian, et al.
Publicado: (2024)
Ejemplares similares
-
Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis
por: Yaman, Dogucan, et al.
Publicado: (2025) -
CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding
por: Eyiokur, Fevziye Irem, et al.
Publicado: (2025) -
Assessing Identity Leakage in Talking Face Generation: Metrics and Evaluation Framework
por: Yaman, Dogucan, et al.
Publicado: (2025) -
A Multimodal Depth-Aware Method For Embodied Reference Understanding
por: Eyiokur, Fevziye Irem, et al.
Publicado: (2025) -
Audio-driven Talking Face Generation with Stabilized Synchronization Loss
por: Yaman, Dogucan, et al.
Publicado: (2023)