The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Zhuohan, Elbadry, Rania, Zhang, Fan, Georgiev, Georgi, Peng, Xueqing, Qian, Lingfei, Huang, Jimin, Dimitrov, Dimitar, Jani, Vanshikaa, Dai, Yuyang, Geng, Jiahui, Wang, Yuxia, Koychev, Ivan, Stoyanov, Veselin, Nakov, Preslav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
di: Gull, Ayesha, et al.
Pubblicazione: (2025)
di: Gull, Ayesha, et al.
Pubblicazione: (2025)
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
di: Xie, Zhuohan, et al.
Pubblicazione: (2025)
di: Xie, Zhuohan, et al.
Pubblicazione: (2025)
The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations
di: Elbadry, Rania, et al.
Pubblicazione: (2026)
di: Elbadry, Rania, et al.
Pubblicazione: (2026)
FMI_SU_Yotkova_Kastreva at SemEval-2026 Task 13: Lightweight Detection of LLM-Generated Code via Stylometric Signals
di: Yotkova, Elitsa, et al.
Pubblicazione: (2026)
di: Yotkova, Elitsa, et al.
Pubblicazione: (2026)
SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning
di: Elbadry, Rania, et al.
Pubblicazione: (2026)
di: Elbadry, Rania, et al.
Pubblicazione: (2026)
OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
Post-OCR Text Correction for Bulgarian Historical Documents
di: Beshirov, Angel, et al.
Pubblicazione: (2024)
di: Beshirov, Angel, et al.
Pubblicazione: (2024)
FinReporting: An Agentic Workflow for Localized Reporting of Cross-Jurisdiction Financial Disclosures
di: Zhang, Fan, et al.
Pubblicazione: (2026)
di: Zhang, Fan, et al.
Pubblicazione: (2026)
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
di: Iqbal, Hasan, et al.
Pubblicazione: (2024)
di: Iqbal, Hasan, et al.
Pubblicazione: (2024)
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2024)
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2024)
Detecting Check-Worthy Claims in Political Debates, Speeches, and Interviews Using Audio Data
di: Ivanov, Petar, et al.
Pubblicazione: (2023)
di: Ivanov, Petar, et al.
Pubblicazione: (2023)
RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?
di: Dai, Yuyang, et al.
Pubblicazione: (2026)
di: Dai, Yuyang, et al.
Pubblicazione: (2026)
FinCARDS: Card-Based Analyst Reranking for Financial Document Question Answering
di: Zhou, Yixi, et al.
Pubblicazione: (2026)
di: Zhou, Yixi, et al.
Pubblicazione: (2026)
The CLEF-2026 CheckThat! Lab: Advancing Multilingual Fact-Checking
di: Struß, Julia Maria, et al.
Pubblicazione: (2026)
di: Struß, Julia Maria, et al.
Pubblicazione: (2026)
Factuality of Large Language Models: A Survey
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation
di: Bounhar, Abdelaziz, et al.
Pubblicazione: (2026)
di: Bounhar, Abdelaziz, et al.
Pubblicazione: (2026)
Rethinking STS and NLI in Large Language Models
di: Wang, Yuxia, et al.
Pubblicazione: (2023)
di: Wang, Yuxia, et al.
Pubblicazione: (2023)
FIRE: Fact-checking with Iterative Retrieval and Verification
di: Xie, Zhuohan, et al.
Pubblicazione: (2024)
di: Xie, Zhuohan, et al.
Pubblicazione: (2024)
The CLEF-2025 CheckThat! Lab: Subjectivity, Fact-Checking, Claim Normalization, and Retrieval
di: Alam, Firoj, et al.
Pubblicazione: (2025)
di: Alam, Firoj, et al.
Pubblicazione: (2025)
UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases
di: Tomar, Raj Vardhan, et al.
Pubblicazione: (2025)
di: Tomar, Raj Vardhan, et al.
Pubblicazione: (2025)
How Does Prefix Matter in Reasoning Model Tuning?
di: Tomar, Raj Vardhan, et al.
Pubblicazione: (2026)
di: Tomar, Raj Vardhan, et al.
Pubblicazione: (2026)
Instruction-Guided Poetry Generation in Arabic and Its Dialects
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2026)
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2026)
MuDRiC: Multi-Dialect Reasoning for Arabic Commonsense Validation
di: Elozeiri, Kareem, et al.
Pubblicazione: (2025)
di: Elozeiri, Kareem, et al.
Pubblicazione: (2025)
A Survey of Confidence Estimation and Calibration in Large Language Models
di: Geng, Jiahui, et al.
Pubblicazione: (2023)
di: Geng, Jiahui, et al.
Pubblicazione: (2023)
Exponential fo recasting of the monthly volume of the tourism receipts in Bulgaria
di: Preslav Dimitrov
Pubblicazione: (2015)
di: Preslav Dimitrov
Pubblicazione: (2015)
Long-run forecasting of the number of the ecotourism arrivals in the municipality of Stambolovo, Bulgaria
di: Preslav Dimitrov
Pubblicazione: (2013)
di: Preslav Dimitrov
Pubblicazione: (2013)
LONG-TERM FORECASTING OF THE SPA AND WELLNESS SUBSECTOR OF THE BULGAR IAN TOURISM INDUSTRY
di: Preslav Dimitrov
Pubblicazione: (2011)
di: Preslav Dimitrov
Pubblicazione: (2011)
A record of Achaearanea tabulata from the Balkan Peninsula (Araneae: Theridiidae)
di: Dimitrov, Dimitar
Pubblicazione: (1994)
di: Dimitrov, Dimitar
Pubblicazione: (1994)
VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
A deconvolution based signal reconstruction capable of piled-up pulse separation
di: Georgiev, Georgi
Pubblicazione: (2024)
di: Georgiev, Georgi
Pubblicazione: (2024)
Can Machines Resonate with Humans? Evaluating the Emotional and Empathic Comprehension of LMs
di: Manzoor, Muhammad Arslan, et al.
Pubblicazione: (2024)
di: Manzoor, Muhammad Arslan, et al.
Pubblicazione: (2024)
HALF: Harm-Aware LLM Fairness Evaluation Aligned with Deployment
di: Mekky, Ali, et al.
Pubblicazione: (2025)
di: Mekky, Ali, et al.
Pubblicazione: (2025)
íFrente popular en todo el mundo! : discursos íntegros de Dimitrof en el VII Congreso de la Internacional Comunista / Georgi Dimitrov
di: Dimitrov, Georgi
di: Dimitrov, Georgi
Increasing attractiveness and image recognition of Bulgaria as a tourism destination
di: Preslav Mihaylov Dimitrov
Pubblicazione: (2017)
di: Preslav Mihaylov Dimitrov
Pubblicazione: (2017)
Arabic Dataset for LLM Safeguard Evaluation
di: Ashraf, Yasser, et al.
Pubblicazione: (2024)
di: Ashraf, Yasser, et al.
Pubblicazione: (2024)
Multimodal Large Language Models to Support Real-World Fact-Checking
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
FRaN-X: FRaming and Narratives-eXplorer
di: Muratov, Artur, et al.
Pubblicazione: (2025)
di: Muratov, Artur, et al.
Pubblicazione: (2025)
Exact Evolution Law for Canonical Path Ensembles with a Variance Controlled Precision Regime for Self-Organization
di: Georgiev, Georgi Yordanov
Pubblicazione: (2025)
di: Georgiev, Georgi Yordanov
Pubblicazione: (2025)
MemeLens: Multilingual Multitask VLMs for Memes
di: Shahroor, Ali Ezzat, et al.
Pubblicazione: (2026)
di: Shahroor, Ali Ezzat, et al.
Pubblicazione: (2026)
Entity Framing and Role Portrayal in the News
di: Mahmoud, Tarek, et al.
Pubblicazione: (2025)
di: Mahmoud, Tarek, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
di: Gull, Ayesha, et al.
Pubblicazione: (2025) -
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
di: Xie, Zhuohan, et al.
Pubblicazione: (2025) -
The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations
di: Elbadry, Rania, et al.
Pubblicazione: (2026) -
FMI_SU_Yotkova_Kastreva at SemEval-2026 Task 13: Lightweight Detection of LLM-Generated Code via Stylometric Signals
di: Yotkova, Elitsa, et al.
Pubblicazione: (2026) -
SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning
di: Elbadry, Rania, et al.
Pubblicazione: (2026)