NormEval: A Unified Multi-Metric Framework for Evaluating Semantic Fidelity in Text Normalization
Fuente:
arXiv
Saved in:
| Main Authors: | Kafi, Md Abdullah Al, Moni, Raka, Hussain, Walayat |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems
by: Kafi, Md Abdullah Al, et al.
Published: (2026)
by: Kafi, Md Abdullah Al, et al.
Published: (2026)
Less Is More: An Explainable AI Framework for Lightweight Malaria Classification
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
Code vs. Context: STEM Students' Resistance to Non-STEM Coursework
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
FastPOS: Language-Agnostic Scalable POS Tagging Framework Low-Resource Use Case
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
Tau-Eval: A Unified Evaluation Framework for Useful and Private Text Anonymization
by: Loiseau, Gabriel, et al.
Published: (2025)
by: Loiseau, Gabriel, et al.
Published: (2025)
FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution
by: Raiyan, Syed Rifat, et al.
Published: (2025)
by: Raiyan, Syed Rifat, et al.
Published: (2025)
BOISHOMMO: Holistic Approach for Bangla Hate Speech
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
FourierKAN outperforms MLP on Text Classification Head Fine-tuning
by: Imran, Abdullah Al, et al.
Published: (2024)
by: Imran, Abdullah Al, et al.
Published: (2024)
MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages
by: Buaphet, Weerayut, et al.
Published: (2026)
by: Buaphet, Weerayut, et al.
Published: (2026)
ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
by: Liu, Tianjian, et al.
Published: (2025)
by: Liu, Tianjian, et al.
Published: (2025)
PolyNorm: Few-Shot LLM-Based Text Normalization for Text-to-Speech
by: Wong, Michel, et al.
Published: (2025)
by: Wong, Michel, et al.
Published: (2025)
ViLexNorm: A Lexical Normalization Corpus for Vietnamese Social Media Text
by: Nguyen, Thanh-Nhi, et al.
Published: (2024)
by: Nguyen, Thanh-Nhi, et al.
Published: (2024)
UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
by: Jia, Qi, et al.
Published: (2026)
by: Jia, Qi, et al.
Published: (2026)
A Unified Framework with Novel Metrics for Evaluating the Effectiveness of XAI Techniques in LLMs
by: Mersha, Melkamu Abay, et al.
Published: (2025)
by: Mersha, Melkamu Abay, et al.
Published: (2025)
MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models
by: Dihan, Mahir Labib, et al.
Published: (2024)
by: Dihan, Mahir Labib, et al.
Published: (2024)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
by: Adib, Shefayat E Shams, et al.
Published: (2026)
by: Adib, Shefayat E Shams, et al.
Published: (2026)
BatchEval: Towards Human-like Text Evaluation
by: Yuan, Peiwen, et al.
Published: (2023)
by: Yuan, Peiwen, et al.
Published: (2023)
RepEval: Effective Text Evaluation with LLM Representation
by: Sheng, Shuqian, et al.
Published: (2024)
by: Sheng, Shuqian, et al.
Published: (2024)
MasonTigers at SemEval-2024 Task 1: An Ensemble Approach for Semantic Textual Relatedness
by: Goswami, Dhiman, et al.
Published: (2024)
by: Goswami, Dhiman, et al.
Published: (2024)
SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation
by: Jiang, Lai, et al.
Published: (2025)
by: Jiang, Lai, et al.
Published: (2025)
VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites
by: Islam, Md. Adnanul, et al.
Published: (2025)
by: Islam, Md. Adnanul, et al.
Published: (2025)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
by: Jubair, Sheikh, et al.
Published: (2025)
by: Jubair, Sheikh, et al.
Published: (2025)
SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains
by: Ramesh, Krithika, et al.
Published: (2025)
by: Ramesh, Krithika, et al.
Published: (2025)
Eval4Sim: An Evaluation Framework for Persona Simulation
by: Bao, Eliseo, et al.
Published: (2026)
by: Bao, Eliseo, et al.
Published: (2026)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
by: Lee, Yuho, et al.
Published: (2024)
by: Lee, Yuho, et al.
Published: (2024)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
by: Zhou, Yixi, et al.
Published: (2026)
by: Zhou, Yixi, et al.
Published: (2026)
EvalCards: A Framework for Standardized Evaluation Reporting
by: Dhar, Ruchira, et al.
Published: (2025)
by: Dhar, Ruchira, et al.
Published: (2025)
GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization
by: Zheng, Chuanyang, et al.
Published: (2026)
by: Zheng, Chuanyang, et al.
Published: (2026)
SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs
by: Shil, Avijit, et al.
Published: (2026)
by: Shil, Avijit, et al.
Published: (2026)
MasonTigers at SemEval-2024 Task 8: Performance Analysis of Transformer-based Models on Machine-Generated Text Detection
by: Puspo, Sadiya Sayara Chowdhury, et al.
Published: (2024)
by: Puspo, Sadiya Sayara Chowdhury, et al.
Published: (2024)
UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
by: Yang, Zhi, et al.
Published: (2026)
by: Yang, Zhi, et al.
Published: (2026)
NormTab: Improving Symbolic Reasoning in LLMs Through Tabular Data Normalization
by: Nahid, Md Mahadi Hasan, et al.
Published: (2024)
by: Nahid, Md Mahadi Hasan, et al.
Published: (2024)
EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation
by: Dejl, Adam, et al.
Published: (2026)
by: Dejl, Adam, et al.
Published: (2026)
Evaluating the Evaluator: Problems with SemEval-2020 Task 1 for Lexical Semantic Change Detection
by: Phan-Tat, Bach, et al.
Published: (2026)
by: Phan-Tat, Bach, et al.
Published: (2026)
Check-Eval: A Checklist-based Approach for Evaluating Text Quality
by: Pereira, Jayr, et al.
Published: (2024)
by: Pereira, Jayr, et al.
Published: (2024)
EmoBang: Detecting Emotion From Bengali Texts
by: Maruf, Abdullah Al, et al.
Published: (2025)
by: Maruf, Abdullah Al, et al.
Published: (2025)
A Semantic Parsing Framework for End-to-End Time Normalization
by: Su, Xin, et al.
Published: (2025)
by: Su, Xin, et al.
Published: (2025)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
by: Afzal, Anum, et al.
Published: (2024)
by: Afzal, Anum, et al.
Published: (2024)
MILE-RefHumEval: A Reference-Free, Multi-Independent LLM Framework for Human-Aligned Evaluation
by: Srun, Nalin, et al.
Published: (2026)
by: Srun, Nalin, et al.
Published: (2026)
LSC-Eval: A General Framework to Evaluate Methods for Assessing Dimensions of Lexical Semantic Change Using LLM-Generated Synthetic Data
by: Baes, Naomi, et al.
Published: (2025)
by: Baes, Naomi, et al.
Published: (2025)
Similar Items
-
Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems
by: Kafi, Md Abdullah Al, et al.
Published: (2026) -
Less Is More: An Explainable AI Framework for Lightweight Malaria Classification
by: Kafi, Md Abdullah Al, et al.
Published: (2025) -
Code vs. Context: STEM Students' Resistance to Non-STEM Coursework
by: Kafi, Md Abdullah Al, et al.
Published: (2025) -
FastPOS: Language-Agnostic Scalable POS Tagging Framework Low-Resource Use Case
by: Kafi, Md Abdullah Al, et al.
Published: (2025) -
Tau-Eval: A Unified Evaluation Framework for Useful and Private Text Anonymization
by: Loiseau, Gabriel, et al.
Published: (2025)