Context-Aware Dynamic Chunking for Streaming Tibetan Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chao, Cai, Yuqing, Duojie, Renzeng, Zhang, Jin, Liu, Yutong, Tashi, Nyima |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
TiSpell: A Semi-Masked Methodology for Tibetan Spelling Correction covering Multi-Level Error with Data Augmentation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation
par: He, Jiaxu, et autres
Publié: (2026)
par: He, Jiaxu, et autres
Publié: (2026)
TLUE: A Tibetan Language Understanding Evaluation Benchmark
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling
par: Huang, Cheng, et autres
Publié: (2025)
par: Huang, Cheng, et autres
Publié: (2025)
TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity
par: Cao, Xi, et autres
Publié: (2024)
par: Cao, Xi, et autres
Publié: (2024)
Tibetan Language and AI: A Comprehensive Survey of Resources, Methods and Challenges
par: Huang, Cheng, et autres
Publié: (2025)
par: Huang, Cheng, et autres
Publié: (2025)
Human-in-the-Loop Generation of Adversarial Texts: A Case Study on Tibetan Script
par: Cao, Xi, et autres
Publié: (2024)
par: Cao, Xi, et autres
Publié: (2024)
RetrieveAll: A Multilingual Named Entity Recognition Framework with Large Language Models
par: Zhang, Jin, et autres
Publié: (2025)
par: Zhang, Jin, et autres
Publié: (2025)
TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025)
par: Li, Xuanchen, et autres
Publié: (2025)
When Modalities Remember: Continual Learning for Multimodal Knowledge Graphs
par: Li, Linyu, et autres
Publié: (2026)
par: Li, Linyu, et autres
Publié: (2026)
Speech-Aware Long Context Pruning and Integration for Contextualized Automatic Speech Recognition
par: Rong, Yiming, et autres
Publié: (2025)
par: Rong, Yiming, et autres
Publié: (2025)
Pay Attention to the Robustness of Chinese Minority Language Models! Syllable-level Textual Adversarial Attack on Tibetan Script
par: Cao, Xi, et autres
Publié: (2024)
par: Cao, Xi, et autres
Publié: (2024)
LaSR: Context-Aware Speech Recognition via Latent Reasoning
par: Liu, Heyang, et autres
Publié: (2026)
par: Liu, Heyang, et autres
Publié: (2026)
Multi-Granularity Tibetan Textual Adversarial Attack Method Based on Masked Language Model
par: Cao, Xi, et autres
Publié: (2024)
par: Cao, Xi, et autres
Publié: (2024)
SASST: Leveraging Syntax-Aware Chunking and LLMs for Simultaneous Speech Translation
par: Yang, Zeyu, et autres
Publié: (2025)
par: Yang, Zeyu, et autres
Publié: (2025)
Listening, Imagining & Refining: A Heuristic Optimized ASR Correction Framework with LLMs
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language Models
par: Sheng, Boheng, et autres
Publié: (2025)
par: Sheng, Boheng, et autres
Publié: (2025)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
par: Wang, Fangyuan, et autres
Publié: (2022)
par: Wang, Fangyuan, et autres
Publié: (2022)
Streaming Speech-to-Confusion Network Speech Recognition
par: Filimonov, Denis, et autres
Publié: (2023)
par: Filimonov, Denis, et autres
Publié: (2023)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
TopoChunker: Topology-Aware Agentic Document Chunking Framework
par: Liu, Xiaoyu
Publié: (2026)
par: Liu, Xiaoyu
Publié: (2026)
LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV Indexing
par: Li, Dongfang, et autres
Publié: (2026)
par: Li, Dongfang, et autres
Publié: (2026)
Dynamic Chunking for Diffusion Language Models
par: Zhu, Yichen, et autres
Publié: (2026)
par: Zhu, Yichen, et autres
Publié: (2026)
U-Fold: Dynamic Intent-Aware Context Folding for User-Centric Agents
par: Su, Jin, et autres
Publié: (2026)
par: Su, Jin, et autres
Publié: (2026)
ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning
par: Liu, Yongkang, et autres
Publié: (2026)
par: Liu, Yongkang, et autres
Publié: (2026)
Efficient RAG with Intent-Aware Retrieval and Semantics-Preserving Chunking
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2026)
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2026)
Cocktail: Chunk-Adaptive Mixed-Precision Quantization for Long-Context LLM Inference
par: Tao, Wei, et autres
Publié: (2025)
par: Tao, Wei, et autres
Publié: (2025)
Efficient Streaming LLM for Speech Recognition
par: Jia, Junteng, et autres
Publié: (2024)
par: Jia, Junteng, et autres
Publié: (2024)
Uni-ASR: Unified LLM-Based Architecture for Non-Streaming and Streaming Automatic Speech Recognition
par: Xia, Yinfeng, et autres
Publié: (2026)
par: Xia, Yinfeng, et autres
Publié: (2026)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models
par: Günther, Michael, et autres
Publié: (2024)
par: Günther, Michael, et autres
Publié: (2024)
Grounding Language Model with Chunking-Free In-Context Retrieval
par: Qian, Hongjin, et autres
Publié: (2024)
par: Qian, Hongjin, et autres
Publié: (2024)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
Stuttering-Aware Automatic Speech Recognition for Indonesian Language
par: Muhammad, Fadhil, et autres
Publié: (2026)
par: Muhammad, Fadhil, et autres
Publié: (2026)
SmartChunk Retrieval: Query-Aware Chunk Compression with Planning for Efficient Document RAG
par: Zhang, Xuechen, et autres
Publié: (2025)
par: Zhang, Xuechen, et autres
Publié: (2025)
Beyond Chunk-Local Extraction: Cross-Chunk Graph Augmentation for GraphRAG
par: Zhang, Jiaming, et autres
Publié: (2026)
par: Zhang, Jiaming, et autres
Publié: (2026)
Decoder-only Architecture for Streaming End-to-end Speech Recognition
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Documents similaires
-
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025) -
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025) -
TiSpell: A Semi-Masked Methodology for Tibetan Spelling Correction covering Multi-Level Error with Data Augmentation
par: Liu, Yutong, et autres
Publié: (2025) -
Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation
par: He, Jiaxu, et autres
Publié: (2026) -
TLUE: A Tibetan Language Understanding Evaluation Benchmark
par: Gao, Fan, et autres
Publié: (2025)