Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Chih-Kai, Fu, Yu-Kuan, Li, Chen-An, Lin, Yi-Cheng, Lin, Yu-Xiang, Chen, Wei-Chih, Chung, Ho Lam, Kuan, Chun-Yi, Huang, Wei-Ping, Lu, Ke-Han, Lin, Tzu-Quan, Wang, Hsiu-Hsuan, Hu, En-Pei, Hsu, Chan-Jan, Tseng, Liang-Hsuan, Chiu, I-Hsiang, Sanga, Ulin, Chen, Xuanjun, Hsu, Po-chun, Yang, Shu-wen, Lee, Hung-yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Age Aware Scheduling for Differentially-Private Federated Learning
por: Lin, Kuan-Yu, et al.
Publicado: (2024)
por: Lin, Kuan-Yu, et al.
Publicado: (2024)
Impact of violence on work morale on Taiwanese nurses: The moderator of perceived organizational support
por: Kuan‐Yang Chen, et al.
Publicado: (2025)
por: Kuan‐Yang Chen, et al.
Publicado: (2025)
BreezyVoice: Adapting TTS for Taiwanese Mandarin with Enhanced Polyphone Disambiguation -- Challenges and Insights
por: Hsu, Chan-Jan, et al.
Publicado: (2025)
por: Hsu, Chan-Jan, et al.
Publicado: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
FROAV: A Framework for RAG Observation and Agent Verification -- Lowering the Barrier to LLM Agent Research
por: Lin, Tzu-Hsuan, et al.
Publicado: (2026)
por: Lin, Tzu-Hsuan, et al.
Publicado: (2026)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Measuring Taiwanese Mandarin Language Understanding
por: Chen, Po-Heng, et al.
Publicado: (2024)
por: Chen, Po-Heng, et al.
Publicado: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
por: Fu, Yu-Kuan, et al.
Publicado: (2024)
por: Fu, Yu-Kuan, et al.
Publicado: (2024)
Timely Information Updating for Mobile Devices Without and With ML Advice
por: Hsu, Yu-Pin, et al.
Publicado: (2025)
por: Hsu, Yu-Pin, et al.
Publicado: (2025)
PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object Detection
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
por: Huang, Kuan-Chih, et al.
Publicado: (2023)
AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing
por: Chang, Chih-Heng, et al.
Publicado: (2026)
por: Chang, Chih-Heng, et al.
Publicado: (2026)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
por: Chang, Kai-Wei, et al.
Publicado: (2025)
por: Chang, Kai-Wei, et al.
Publicado: (2025)
Randomized Scheduling for Periodic Multi-Source Systems with PAoI Violation Guarantees
por: Lin, Kuan-Yu, et al.
Publicado: (2025)
por: Lin, Kuan-Yu, et al.
Publicado: (2025)
A Preliminary Exploration with GPT-4o Voice Mode
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
Ranking-aware adapter for text-driven image ordering with CLIP
por: Yu, Wei-Hsiang, et al.
Publicado: (2024)
por: Yu, Wei-Hsiang, et al.
Publicado: (2024)
Self‐Transforming Bioadhesive Patch with Topological and Ionic Crosslinking for Adaptive Mucoadhesion and Enhanced Wound Healing
por: Shih‐Yung Liao, et al.
Publicado: (2026)
por: Shih‐Yung Liao, et al.
Publicado: (2026)
Training-Efficient Text-to-Music Generation with State-Space Modeling
por: Lee, Wei-Jaw, et al.
Publicado: (2026)
por: Lee, Wei-Jaw, et al.
Publicado: (2026)
Exploring State-Space-Model based Language Model in Music Generation
por: Lee, Wei-Jaw, et al.
Publicado: (2025)
por: Lee, Wei-Jaw, et al.
Publicado: (2025)
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
por: Hsu, Chan-Jan, et al.
Publicado: (2026)
por: Hsu, Chan-Jan, et al.
Publicado: (2026)
Recent Advances in Soil Stabilization and Reinforcement: A Comprehensive Review of Emerging Technologies
por: Ching Hung, et al.
Publicado: (2026)
por: Ching Hung, et al.
Publicado: (2026)
Factors influencing students' listening learning performance in mobile vocabulary‐assisted listening learning: An extended technology acceptance model
por: Hui‐Tzu Hsu, et al.
Publicado: (2024)
por: Hui‐Tzu Hsu, et al.
Publicado: (2024)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision
por: Yang, Chih-Kai, et al.
Publicado: (2023)
por: Yang, Chih-Kai, et al.
Publicado: (2023)
Conditional Semi-Supervised Data Augmentation for Spam Message Detection with Low Resource Data
por: Nuha, Ulin, et al.
Publicado: (2024)
por: Nuha, Ulin, et al.
Publicado: (2024)
Curriculum leadership in a rural indigenous high school in Taiwan implementing the 108 Curriculum Guidelines
por: Kuan‐Pei Lin, et al.
Publicado: (2024)
por: Kuan‐Pei Lin, et al.
Publicado: (2024)
Néel Tensor Torque in Polycrystalline Antiferromagnets (Adv. Mater. 9/2026)
por: Chao‐Yao Yang, et al.
Publicado: (2026)
por: Chao‐Yao Yang, et al.
Publicado: (2026)
Néel Tensor Torque in Polycrystalline Antiferromagnets
por: Chao‐Yao Yang, et al.
Publicado: (2025)
por: Chao‐Yao Yang, et al.
Publicado: (2025)
TiCo: Time-Controllable Spoken Dialogue Model
por: Chang, Kai-Wei, et al.
Publicado: (2026)
por: Chang, Kai-Wei, et al.
Publicado: (2026)
Higher tumor mutational burden is associated with inferior outcomes among pediatric patients with neuroblastoma
por: Ya‐Hsuan Chang, et al.
Publicado: (2024)
por: Ya‐Hsuan Chang, et al.
Publicado: (2024)
Precision‐Targeted Injection Laryngoplasty and Longitudinal Biomaterial Effects Evaluation Using High‐resolution Ultrasonography in a Rat Model
por: Wen‐Hsuan Tseng, et al.
Publicado: (2024)
por: Wen‐Hsuan Tseng, et al.
Publicado: (2024)
Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Singer separation for karaoke content generation
por: Lin, Hsuan-Yu, et al.
Publicado: (2021)
por: Lin, Hsuan-Yu, et al.
Publicado: (2021)
Pharmacogenomic Calling From Whole‐Exome Sequencing in the Taiwanese Population—A Real‐World Experience
por: Hsu‐Heng Lin, et al.
Publicado: (2026)
por: Hsu‐Heng Lin, et al.
Publicado: (2026)
Quantum-Train with Tensor Network Mapping Model and Distributed Circuit Ansatz
por: Liu, Chen-Yu, et al.
Publicado: (2024)
por: Liu, Chen-Yu, et al.
Publicado: (2024)
Quantum-Train Long Short-Term Memory: Application on Flood Prediction Problem
por: Lin, Chu-Hsuan Abraham, et al.
Publicado: (2024)
por: Lin, Chu-Hsuan Abraham, et al.
Publicado: (2024)
TTC7B Activates the AKT–JKAMP Signaling Axis to Promote Tumor Progression in Head and Neck Cancer
por: Yu‐Hsuan Lin, et al.
Publicado: (2025)
por: Yu‐Hsuan Lin, et al.
Publicado: (2025)
Creativity in LLM-based Multi-Agent Systems: A Survey
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Ejemplares similares
-
Age Aware Scheduling for Differentially-Private Federated Learning
por: Lin, Kuan-Yu, et al.
Publicado: (2024) -
Impact of violence on work morale on Taiwanese nurses: The moderator of perceived organizational support
por: Kuan‐Yang Chen, et al.
Publicado: (2025) -
BreezyVoice: Adapting TTS for Taiwanese Mandarin with Enhanced Polyphone Disambiguation -- Challenges and Insights
por: Hsu, Chan-Jan, et al.
Publicado: (2025) -
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025) -
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)