FinNuE: Exposing the Risks of Using BERTScore for Numerical Semantic Evaluation in Finance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yu-Shiang, Lee, Yun-Yu, Chou, Tzu-Hsin, Lin, Che, Wang, Chuan-Ju |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decision-Oriented Text Evaluation
par: Huang, Yu-Shiang, et autres
Publié: (2025)
par: Huang, Yu-Shiang, et autres
Publié: (2025)
BERTScoreVisualizer: A Web Tool for Understanding Simplified Text Evaluation with BERTScore
par: Jaskowski, Sebastian, et autres
Publié: (2024)
par: Jaskowski, Sebastian, et autres
Publié: (2024)
Financial Risk Relation Identification through Dual-view Adaptation
par: Chiu, Wei-Ning, et autres
Publié: (2025)
par: Chiu, Wei-Ning, et autres
Publié: (2025)
Heritage identity and Indigenous language learning motivation: A case of Indigenous Taiwanese high school students
par: Hung Tzu Huang, et autres
Publié: (2024)
par: Hung Tzu Huang, et autres
Publié: (2024)
'Finance Wizard' at the FinLLM Challenge Task: Financial Text Summarization
par: Lee, Meisin, et autres
Publié: (2024)
par: Lee, Meisin, et autres
Publié: (2024)
Enhancing Medication Recommendation with LLM Text Representation
par: Lee, Yu-Tzu
Publié: (2024)
par: Lee, Yu-Tzu
Publié: (2024)
FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
par: Hu, Tiansheng, et autres
Publié: (2025)
par: Hu, Tiansheng, et autres
Publié: (2025)
A Survey of Large Language Models in Finance (FinLLMs)
par: Lee, Jean, et autres
Publié: (2024)
par: Lee, Jean, et autres
Publié: (2024)
FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents
par: Jia, Haoxuan, et autres
Publié: (2026)
par: Jia, Haoxuan, et autres
Publié: (2026)
CmdCaliper: A Semantic-Aware Command-Line Embedding Model and Dataset for Security Research
par: Huang, Sian-Yao, et autres
Publié: (2024)
par: Huang, Sian-Yao, et autres
Publié: (2024)
Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain
par: Hu, Xiaoyu, et autres
Publié: (2026)
par: Hu, Xiaoyu, et autres
Publié: (2026)
Clinical BERTScore: An Improved Measure of Automatic Speech Recognition Performance in Clinical Settings
par: Shor, Joel, et autres
Publié: (2023)
par: Shor, Joel, et autres
Publié: (2023)
Resolving Regular Polysemy in Named Entities
par: Hsieh, Shu-Kai, et autres
Publié: (2024)
par: Hsieh, Shu-Kai, et autres
Publié: (2024)
FinGen: A Dataset for Argument Generation in Finance
par: Chen, Chung-Chi, et autres
Publié: (2024)
par: Chen, Chung-Chi, et autres
Publié: (2024)
FinMTEB: Finance Massive Text Embedding Benchmark
par: Tang, Yixuan, et autres
Publié: (2025)
par: Tang, Yixuan, et autres
Publié: (2025)
The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation
par: Tsai, Yun-Shao, et autres
Publié: (2026)
par: Tsai, Yun-Shao, et autres
Publié: (2026)
NumLLM: Numeric-Sensitive Large Language Model for Chinese Finance
par: Su, Huan-Yi, et autres
Publié: (2024)
par: Su, Huan-Yi, et autres
Publié: (2024)
FinXABSA: Explainable Finance through Aspect-Based Sentiment Analysis
par: Ong, Keane, et autres
Publié: (2023)
par: Ong, Keane, et autres
Publié: (2023)
Semantic Similarity Matching for Patent Documents Using Ensemble BERT-related Model and Novel Text Processing Method
par: Yu, Liqiang, et autres
Publié: (2024)
par: Yu, Liqiang, et autres
Publié: (2024)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
par: Hou, Yutao, et autres
Publié: (2026)
par: Hou, Yutao, et autres
Publié: (2026)
Evaluating AI for Finance: Is AI Credible at Assessing Investment Risk?
par: Chawla, Divij, et autres
Publié: (2025)
par: Chawla, Divij, et autres
Publié: (2025)
SemanticShield: LLM-Powered Audits Expose Shilling Attacks in Recommender Systems
par: Li, Kaihong, et autres
Publié: (2025)
par: Li, Kaihong, et autres
Publié: (2025)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
par: Lin, Tzu-Han, et autres
Publié: (2025)
par: Lin, Tzu-Han, et autres
Publié: (2025)
FinBERT2: A Specialized Bidirectional Encoder for Bridging the Gap in Finance-Specific Deployment of Large Language Models
par: Xu, Xuan, et autres
Publié: (2025)
par: Xu, Xuan, et autres
Publié: (2025)
From Simulation to Strategy: Automating Personalized Interaction Planning for Conversational Agents
par: Chang, Wen-Yu, et autres
Publié: (2025)
par: Chang, Wen-Yu, et autres
Publié: (2025)
Evaluating Large Language Models as Expert Annotators
par: Tseng, Yu-Min, et autres
Publié: (2025)
par: Tseng, Yu-Min, et autres
Publié: (2025)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
par: Lin, Tzu-Han, et autres
Publié: (2024)
par: Lin, Tzu-Han, et autres
Publié: (2024)
TriBench-Ko: Evaluating LLM Risks in Judicial Workflows
par: Lee, Haesung, et autres
Publié: (2026)
par: Lee, Haesung, et autres
Publié: (2026)
LLMs Meet Finance: Fine-Tuning Foundation Models for the Open FinLLM Leaderboard
par: Rao, Varun, et autres
Publié: (2025)
par: Rao, Varun, et autres
Publié: (2025)
How Small Transformation Expose the Weakness of Semantic Similarity Measures
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
par: Gan, Ziliang, et autres
Publié: (2024)
par: Gan, Ziliang, et autres
Publié: (2024)
NuBE
Publié: (2023)
Publié: (2023)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
par: Guo, Xin, et autres
Publié: (2023)
par: Guo, Xin, et autres
Publié: (2023)
CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition
par: Tsai, Yun-Shao, et autres
Publié: (2025)
par: Tsai, Yun-Shao, et autres
Publié: (2025)
FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation
par: Luo, Junyu, et autres
Publié: (2025)
par: Luo, Junyu, et autres
Publié: (2025)
Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Models
par: Hsueh, Cheng-Hsun, et autres
Publié: (2024)
par: Hsueh, Cheng-Hsun, et autres
Publié: (2024)
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
par: Zhu, Fengbin, et autres
Publié: (2025)
par: Zhu, Fengbin, et autres
Publié: (2025)
A Survey of Generative Information Retrieval
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
Documents similaires
-
Decision-Oriented Text Evaluation
par: Huang, Yu-Shiang, et autres
Publié: (2025) -
BERTScoreVisualizer: A Web Tool for Understanding Simplified Text Evaluation with BERTScore
par: Jaskowski, Sebastian, et autres
Publié: (2024) -
Financial Risk Relation Identification through Dual-view Adaptation
par: Chiu, Wei-Ning, et autres
Publié: (2025) -
Heritage identity and Indigenous language learning motivation: A case of Indigenous Taiwanese high school students
par: Hung Tzu Huang, et autres
Publié: (2024) -
'Finance Wizard' at the FinLLM Challenge Task: Financial Text Summarization
par: Lee, Meisin, et autres
Publié: (2024)