SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation
Fuente:
arXiv
Salvato in:
| Autore principale: | Pattnayak, Priyaranjan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026)
WER We Stand: Benchmarking Urdu ASR Models
di: Arif, Samee, et al.
Pubblicazione: (2024)
di: Arif, Samee, et al.
Pubblicazione: (2024)
Tokenization Matters: Improving Zero-Shot NER for Indic Languages
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2025)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2025)
WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue
di: Ellis, Zachary, et al.
Pubblicazione: (2025)
di: Ellis, Zachary, et al.
Pubblicazione: (2025)
Beyond WER: Probing Whisper's Sub-token Decoder Across Diverse Language Resource Levels
di: Liang, Siyu, et al.
Pubblicazione: (2025)
di: Liang, Siyu, et al.
Pubblicazione: (2025)
Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2026)
di: Mudi, Prasenjit K, et al.
Pubblicazione: (2026)
LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
di: Rahman, Hanif
Pubblicazione: (2026)
di: Rahman, Hanif
Pubblicazione: (2026)
Unknown Script: Impact of Script on Cross-Lingual Transfer
di: Tufa, Wondimagegnhue Tsegaye, et al.
Pubblicazione: (2024)
di: Tufa, Wondimagegnhue Tsegaye, et al.
Pubblicazione: (2024)
SkyScript-100M: 1,000,000,000 Pairs of Scripts and Shooting Scripts for Short Drama
di: Tang, Jing, et al.
Pubblicazione: (2024)
di: Tang, Jing, et al.
Pubblicazione: (2024)
Graphemic Normalization of the Perso-Arabic Script
di: Doctor, Raiomond, et al.
Pubblicazione: (2022)
di: Doctor, Raiomond, et al.
Pubblicazione: (2022)
One Language, Two Scripts: Probing Script-Invariance in LLM Concept Representations
di: Karne, Sripad
Pubblicazione: (2026)
di: Karne, Sripad
Pubblicazione: (2026)
Evaluating Shortest Edit Script Methods for Contextual Lemmatization
di: Toporkov, Olia, et al.
Pubblicazione: (2024)
di: Toporkov, Olia, et al.
Pubblicazione: (2024)
Script-Agnostic Language Identification
di: Agarwal, Milind, et al.
Pubblicazione: (2024)
di: Agarwal, Milind, et al.
Pubblicazione: (2024)
Script Sensitivity: Benchmarking Language Models on Unicode, Romanized and Mixed-Script Sinhala
di: Rajapakse, Minuri, et al.
Pubblicazione: (2026)
di: Rajapakse, Minuri, et al.
Pubblicazione: (2026)
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2025)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2025)
THEY SAY WE'R GETTING A DEMOCRACY
Pubblicazione: (2003)
Pubblicazione: (2003)
Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting
di: Khullar, Manurag, et al.
Pubblicazione: (2025)
di: Khullar, Manurag, et al.
Pubblicazione: (2025)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product Association
di: Wang, Weiqi, et al.
Pubblicazione: (2025)
di: Wang, Weiqi, et al.
Pubblicazione: (2025)
LLM for Barcodes: Generating Diverse Synthetic Data for Identity Documents
di: Patel, Hitesh Laxmichand, et al.
Pubblicazione: (2024)
di: Patel, Hitesh Laxmichand, et al.
Pubblicazione: (2024)
The Effect of Scripts and Formats on LLM Numeracy
di: Reddy, Varshini, et al.
Pubblicazione: (2026)
di: Reddy, Varshini, et al.
Pubblicazione: (2026)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
di: Zheng, Xiuwen, et al.
Pubblicazione: (2026)
di: Zheng, Xiuwen, et al.
Pubblicazione: (2026)
Multi-class Regret Detection in Hindi Devanagari Script
di: Sharma, Renuka, et al.
Pubblicazione: (2024)
di: Sharma, Renuka, et al.
Pubblicazione: (2024)
Unicode Normalization and Grapheme Parsing of Indic Languages
di: Ansary, Nazmuddoha, et al.
Pubblicazione: (2023)
di: Ansary, Nazmuddoha, et al.
Pubblicazione: (2023)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
Aligned Multi-View Scripts for Universal Chart-to-Code Generation
di: Zhang, Zhihan, et al.
Pubblicazione: (2026)
di: Zhang, Zhihan, et al.
Pubblicazione: (2026)
IITR-CIOL@NLU of Devanagari Script Languages 2025: Multilingual Hate Speech Detection and Target Identification in Devanagari-Scripted Languages
di: Gupta, Siddhant, et al.
Pubblicazione: (2024)
di: Gupta, Siddhant, et al.
Pubblicazione: (2024)
DramaBench: A Six-Dimensional Evaluation Framework for Drama Script Continuation
di: Ma, Shijian, et al.
Pubblicazione: (2025)
di: Ma, Shijian, et al.
Pubblicazione: (2025)
Machine-Assisted Script Curation
di: Ciosici, Manuel R., et al.
Pubblicazione: (2021)
di: Ciosici, Manuel R., et al.
Pubblicazione: (2021)
Konkani LLM: Multi-Script Instruction Tuning and Evaluation for a Low-Resource Indian Language
di: Fernandes, Reuben Chagas, et al.
Pubblicazione: (2026)
di: Fernandes, Reuben Chagas, et al.
Pubblicazione: (2026)
Select and Summarize: Scene Saliency for Movie Script Summarization
di: Saxena, Rohit, et al.
Pubblicazione: (2024)
di: Saxena, Rohit, et al.
Pubblicazione: (2024)
LangSAMP: Language-Script Aware Multilingual Pretraining
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
ScEdit: Script-based Assessment of Knowledge Editing
di: Li, Xinye, et al.
Pubblicazione: (2025)
di: Li, Xinye, et al.
Pubblicazione: (2025)
Multilingual Dialogue Generation and Localization with Dialogue Act Scripting
di: Vasselli, Justin, et al.
Pubblicazione: (2025)
di: Vasselli, Justin, et al.
Pubblicazione: (2025)
ILID: Native Script Language Identification for Indian Languages
di: Ingle, Yash, et al.
Pubblicazione: (2025)
di: Ingle, Yash, et al.
Pubblicazione: (2025)
On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation
di: Shang, Wenbo, et al.
Pubblicazione: (2026)
di: Shang, Wenbo, et al.
Pubblicazione: (2026)
A Case Against Implicit Standards: Homophone Normalization in Machine Translation for Languages that use the Ge'ez Script
di: Nigatu, Hellina Hailu, et al.
Pubblicazione: (2025)
di: Nigatu, Hellina Hailu, et al.
Pubblicazione: (2025)
Bolbosh: Script-Aware Flow Matching for Kashmiri Text-to-Speech
di: Ashraf, Tajamul, et al.
Pubblicazione: (2026)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2026)
Documenti analoghi
-
IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026) -
IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2026) -
WER We Stand: Benchmarking Urdu ASR Models
di: Arif, Samee, et al.
Pubblicazione: (2024) -
Tokenization Matters: Improving Zero-Shot NER for Indic Languages
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2025) -
WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue
di: Ellis, Zachary, et al.
Pubblicazione: (2025)