iPhoneme: Brain-to-Text Communication for ALS Using ConformerXL Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Cha, Yoonmin, Chun, Dawit, Park, Sung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CIPHER: Conformer-based Inference of Phonemes from High-density EEG
por: Madishetty, Varshith
Publicado: (2026)
por: Madishetty, Varshith
Publicado: (2026)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
por: He, Jiajun, et al.
Publicado: (2025)
por: He, Jiajun, et al.
Publicado: (2025)
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation
por: Li, Jilong, et al.
Publicado: (2024)
por: Li, Jilong, et al.
Publicado: (2024)
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
por: He, Jiajun, et al.
Publicado: (2025)
por: He, Jiajun, et al.
Publicado: (2025)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
por: Weise, Tobias, et al.
Publicado: (2024)
por: Weise, Tobias, et al.
Publicado: (2024)
Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR
por: Lee, Jaeyoung, et al.
Publicado: (2026)
por: Lee, Jaeyoung, et al.
Publicado: (2026)
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
por: Pan, Jianan, et al.
Publicado: (2026)
por: Pan, Jianan, et al.
Publicado: (2026)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
por: Azad, Asif, et al.
Publicado: (2026)
por: Azad, Asif, et al.
Publicado: (2026)
TSPC: A Two-Stage Phoneme-Centric Architecture for code-switching Vietnamese-English Speech Recognition
por: Anh, Tran Nguyen, et al.
Publicado: (2025)
por: Anh, Tran Nguyen, et al.
Publicado: (2025)
DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs
por: Papi, Sara, et al.
Publicado: (2026)
por: Papi, Sara, et al.
Publicado: (2026)
MOSS-TTSD: Text to Spoken Dialogue Generation
por: Zhang, Yuqian, et al.
Publicado: (2026)
por: Zhang, Yuqian, et al.
Publicado: (2026)
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
por: Ginjala, Srishti, et al.
Publicado: (2026)
por: Ginjala, Srishti, et al.
Publicado: (2026)
Cross-Attention is Half Explanation in Speech-to-Text Models
por: Papi, Sara, et al.
Publicado: (2025)
por: Papi, Sara, et al.
Publicado: (2025)
Soundwave: Less is More for Speech-Text Alignment in LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
Beyond Modality Limitations: A Unified MLLM Approach to Automated Speaking Assessment with Effective Curriculum Learning
por: Fang, Yu-Hsuan, et al.
Publicado: (2025)
por: Fang, Yu-Hsuan, et al.
Publicado: (2025)
Story2MIDI: Emotionally Aligned Music Generation from Text
por: Shokri, Mohammad, et al.
Publicado: (2025)
por: Shokri, Mohammad, et al.
Publicado: (2025)
Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
por: Kotoge, Rikuto, et al.
Publicado: (2025)
por: Kotoge, Rikuto, et al.
Publicado: (2025)
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition
por: Lee, Junseok, et al.
Publicado: (2026)
por: Lee, Junseok, et al.
Publicado: (2026)
MEBM-Phoneme: Multi-scale Enhanced BrainMagic for End-to-End MEG Phoneme Classification
por: Jinghua, Liang, et al.
Publicado: (2026)
por: Jinghua, Liang, et al.
Publicado: (2026)
Multi-class Decoding of Attended Speaker Direction Using Electroencephalogram and Audio Spatial Spectrum
por: Zhang, Yuanming, et al.
Publicado: (2024)
por: Zhang, Yuanming, et al.
Publicado: (2024)
Raon-Speech Technical Report
por: Kim, Beomsoo, et al.
Publicado: (2026)
por: Kim, Beomsoo, et al.
Publicado: (2026)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
por: Ye, Zongli, et al.
Publicado: (2025)
por: Ye, Zongli, et al.
Publicado: (2025)
MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
A Penny for Your Thoughts: Decoding Speech from Inexpensive Brain Signals
por: Auster, Quentin, et al.
Publicado: (2025)
por: Auster, Quentin, et al.
Publicado: (2025)
Unveiling Audio Deepfake Origins: A Deep Metric learning And Conformer Network Approach With Ensemble Fusion
por: Kulkarni, Ajinkya, et al.
Publicado: (2025)
por: Kulkarni, Ajinkya, et al.
Publicado: (2025)
Breaking Through the Spike: Spike Window Decoding for Accelerated and Precise Automatic Speech Recognition
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
Neural networks for Text-to-Speech evaluation
por: Trofimenko, Ilya, et al.
Publicado: (2026)
por: Trofimenko, Ilya, et al.
Publicado: (2026)
Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features
por: Le, Chenqian, et al.
Publicado: (2026)
por: Le, Chenqian, et al.
Publicado: (2026)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
por: Chou, Cheng-Kang, et al.
Publicado: (2025)
por: Chou, Cheng-Kang, et al.
Publicado: (2025)
Abusive music and song transformation using GenAI and LLMs
por: Choi, Jiyang, et al.
Publicado: (2026)
por: Choi, Jiyang, et al.
Publicado: (2026)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
por: Yang, Chenchen, et al.
Publicado: (2026)
por: Yang, Chenchen, et al.
Publicado: (2026)
A novel LSTM music generator based on the fractional time-frequency feature extraction
por: Ya, Li, et al.
Publicado: (2026)
por: Ya, Li, et al.
Publicado: (2026)
Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition
por: Wang, Peng, et al.
Publicado: (2026)
por: Wang, Peng, et al.
Publicado: (2026)
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
por: Rajgarhia, Harshit, et al.
Publicado: (2026)
por: Rajgarhia, Harshit, et al.
Publicado: (2026)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
por: Feng, Bo-Han, et al.
Publicado: (2026)
por: Feng, Bo-Han, et al.
Publicado: (2026)
Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum
por: Al-Radhi, Mohammed Salah, et al.
Publicado: (2026)
por: Al-Radhi, Mohammed Salah, et al.
Publicado: (2026)
Ejemplares similares
-
CIPHER: Conformer-based Inference of Phonemes from High-density EEG
por: Madishetty, Varshith
Publicado: (2026) -
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
por: He, Jiajun, et al.
Publicado: (2025) -
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation
por: Li, Jilong, et al.
Publicado: (2024) -
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
por: He, Jiajun, et al.
Publicado: (2025) -
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
por: Weise, Tobias, et al.
Publicado: (2024)