SparQLe: Speech Queries to Text Translation Through LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Djanibekov, Amirbek, Aldarmaki, Hanan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SimulU: Training-free Policy for Long-form Simultaneous Speech-to-Speech Translation
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026)
Dialectal Coverage And Generalization in Arabic Speech Recognition
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
Spoken Word2Vec: Learning Skipgram Embeddings from Speech
di: Sayeed, Mohammad Amaan, et al.
Pubblicazione: (2023)
di: Sayeed, Mohammad Amaan, et al.
Pubblicazione: (2023)
Are LLMs Good Text Diacritizers? An Arabic and Yoruba Case Study
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
Morphemes Without Borders: Evaluating Root-Pattern Morphology in Arabic Tokenizers and LLMs
di: Alakeel, Yara, et al.
Pubblicazione: (2026)
di: Alakeel, Yara, et al.
Pubblicazione: (2026)
Personal Attribute Leakage in Federated Speech Models
di: Al-Ali, Hamdan, et al.
Pubblicazione: (2025)
di: Al-Ali, Hamdan, et al.
Pubblicazione: (2025)
Linear Semantic Segmentation for Low-Resource Spoken Dialects
di: Chirkunov, Kirill, et al.
Pubblicazione: (2026)
di: Chirkunov, Kirill, et al.
Pubblicazione: (2026)
Music for All: Representational Bias and Cross-Cultural Adaptability of Music Generation Models
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
SPIRIT: Patching Speech Language Models against Jailbreak Attacks
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2025)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2025)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024
di: Koneru, Sai, et al.
Pubblicazione: (2024)
di: Koneru, Sai, et al.
Pubblicazione: (2024)
Mixat: A Data Set of Bilingual Emirati-English Speech
di: Ali, Maryam Al, et al.
Pubblicazione: (2024)
di: Ali, Maryam Al, et al.
Pubblicazione: (2024)
NADI 2025: The First Multidialectal Arabic Speech Processing Shared Task
di: Talafha, Bashar, et al.
Pubblicazione: (2025)
di: Talafha, Bashar, et al.
Pubblicazione: (2025)
Automatic Restoration of Diacritics for Speech Data Sets
di: Shatnawi, Sara, et al.
Pubblicazione: (2023)
di: Shatnawi, Sara, et al.
Pubblicazione: (2023)
Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs
di: Papi, Sara, et al.
Pubblicazione: (2025)
di: Papi, Sara, et al.
Pubblicazione: (2025)
Streaming Speech-to-Text Translation with a SpeechLLM
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
Soundwave: Less is More for Speech-Text Alignment in LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
JEEM: Vision-Language Understanding in Four Arabic Dialects
di: Kadaoui, Karima, et al.
Pubblicazione: (2025)
di: Kadaoui, Karima, et al.
Pubblicazione: (2025)
Better Late Than Never: Meta-Evaluation of Latency Metrics for Simultaneous Speech-to-Text Translation
di: Polák, Peter, et al.
Pubblicazione: (2025)
di: Polák, Peter, et al.
Pubblicazione: (2025)
Clinical Annotations for Automatic Stuttering Severity Assessment
di: Valente, Ana Rita, et al.
Pubblicazione: (2025)
di: Valente, Ana Rita, et al.
Pubblicazione: (2025)
Automating SPARQL Query Translations between DBpedia and Wikidata
di: Bartels, Malte Christian, et al.
Pubblicazione: (2025)
di: Bartels, Malte Christian, et al.
Pubblicazione: (2025)
Speech to Speech Translation with Translatotron: A State of the Art Review
di: Kala, Jules R., et al.
Pubblicazione: (2025)
di: Kala, Jules R., et al.
Pubblicazione: (2025)
Small LLMs Do Not Learn a Generalizable Theory of Mind via Reinforcement Learning
di: Sarangi, Sneheel, et al.
Pubblicazione: (2025)
di: Sarangi, Sneheel, et al.
Pubblicazione: (2025)
Transformer-Encoder Trees for Efficient Multilingual Machine Translation and Speech Translation
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
di: Guan, Yiwen, et al.
Pubblicazione: (2025)
How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMs
di: Zhang, Ran, et al.
Pubblicazione: (2024)
di: Zhang, Ran, et al.
Pubblicazione: (2024)
StressTransfer: Stress-Aware Speech-to-Speech Translation with Emphasis Preservation
di: Chen, Xi, et al.
Pubblicazione: (2025)
di: Chen, Xi, et al.
Pubblicazione: (2025)
Enhancing Long Context Performance in LLMs Through Inner Loop Query Mechanism
di: Tang, Yimin, et al.
Pubblicazione: (2024)
di: Tang, Yimin, et al.
Pubblicazione: (2024)
RAG-based EEG-to-Text Translation Using Deep Learning and LLMs
di: Collautti, Enrico, et al.
Pubblicazione: (2026)
di: Collautti, Enrico, et al.
Pubblicazione: (2026)
Unrequited Emotions: Investigating the Gaps in Motivation and Practice in Speech Emotion Recognition Research
di: Wong, Taryn, et al.
Pubblicazione: (2026)
di: Wong, Taryn, et al.
Pubblicazione: (2026)
Task Arithmetic for Language Expansion in Speech Translation
di: Cheng, Yao-Fei, et al.
Pubblicazione: (2024)
di: Cheng, Yao-Fei, et al.
Pubblicazione: (2024)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
di: Zhao, Xingjian, et al.
Pubblicazione: (2025)
di: Zhao, Xingjian, et al.
Pubblicazione: (2025)
Closing the Gap Between Text and Speech Understanding in LLMs
di: Cuervo, Santiago, et al.
Pubblicazione: (2025)
di: Cuervo, Santiago, et al.
Pubblicazione: (2025)
An LLM Maturity Model for Reliable and Transparent Text-to-Query
di: Yu, Lei, et al.
Pubblicazione: (2024)
di: Yu, Lei, et al.
Pubblicazione: (2024)
DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs
di: Papi, Sara, et al.
Pubblicazione: (2026)
di: Papi, Sara, et al.
Pubblicazione: (2026)
How do Hyenas deal with Human Speech? Speech Recognition and Translation with ConfHyena
di: Gaido, Marco, et al.
Pubblicazione: (2024)
di: Gaido, Marco, et al.
Pubblicazione: (2024)
FASST: Fast LLM-based Simultaneous Speech Translation
di: Ouyang, Siqi, et al.
Pubblicazione: (2024)
di: Ouyang, Siqi, et al.
Pubblicazione: (2024)
CMU's IWSLT 2024 Simultaneous Speech Translation System
di: Xu, Xi, et al.
Pubblicazione: (2024)
di: Xu, Xi, et al.
Pubblicazione: (2024)
Text-to-SQL Oriented to the Process Mining Domain: A PT-EN Dataset for Query Translation
di: Yamate, Bruno Yui, et al.
Pubblicazione: (2025)
di: Yamate, Bruno Yui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SimulU: Training-free Policy for Long-form Simultaneous Speech-to-Speech Translation
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2026) -
Dialectal Coverage And Generalization in Arabic Speech Recognition
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024) -
Spoken Word2Vec: Learning Skipgram Embeddings from Speech
di: Sayeed, Mohammad Amaan, et al.
Pubblicazione: (2023) -
Are LLMs Good Text Diacritizers? An Arabic and Yoruba Case Study
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025) -
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)