OpenHuEval: Evaluating Large Language Model on Hungarian Specifics
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Haote, Wei, Xingjian, Wu, Jiang, Ligeti-Nagy, Noémi, Sun, Jiaxing, Wang, Yinfan, Yang, Zijian Győző, Gao, Junyuan, Wang, Jingchao, Jiang, Bowen, Wang, Shasha, Yu, Nanjun, Zhang, Zihao, Hong, Shixin, Liu, Hongwei, Li, Wei, Zhang, Songyang, Lin, Dahua, Wu, Lijun, Prószéky, Gábor, He, Conghui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
by: Gao, Junyuan, et al.
Published: (2025)
by: Gao, Junyuan, et al.
Published: (2025)
Evaluating Large Language Model with Knowledge Oriented Language Specific Simple Question Answering
by: Jiang, Bowen, et al.
Published: (2025)
by: Jiang, Bowen, et al.
Published: (2025)
GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition
by: Wang, Jingchao, et al.
Published: (2025)
by: Wang, Jingchao, et al.
Published: (2025)
Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
by: Song, Jiahe, et al.
Published: (2026)
by: Song, Jiahe, et al.
Published: (2026)
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
by: Song, Jiahe, et al.
Published: (2025)
by: Song, Jiahe, et al.
Published: (2025)
Utilize the Flow before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction Tuning
by: Zhu, Runchuan, et al.
Published: (2024)
by: Zhu, Runchuan, et al.
Published: (2024)
Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations
by: Sun, Jiaxing, et al.
Published: (2024)
by: Sun, Jiaxing, et al.
Published: (2024)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
by: Zhou, Baichuan, et al.
Published: (2024)
by: Zhou, Baichuan, et al.
Published: (2024)
MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition
by: Yang, Haote, et al.
Published: (2026)
by: Yang, Haote, et al.
Published: (2026)
The equivariant Milnor-Witt motive of $\overline{\mathcal{M}}_{1,2}$
by: Yang, Nanjun
Published: (2026)
by: Yang, Nanjun
Published: (2026)
Witt Group of Nondyadic Curves
by: Yang, Nanjun
Published: (2024)
by: Yang, Nanjun
Published: (2024)
NMRTrans: Structure Elucidation from Experimental NMR Spectra via Set Transformers
by: Yang, Liujia, et al.
Published: (2026)
by: Yang, Liujia, et al.
Published: (2026)
Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
by: Zhuang, Xinlin, et al.
Published: (2025)
by: Zhuang, Xinlin, et al.
Published: (2025)
HuAMR: A Hungarian AMR Parser and Dataset
by: Barta, Botond, et al.
Published: (2025)
by: Barta, Botond, et al.
Published: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
Private International Law: A Hungarian Perspective
by: Nagy, Csongor
Published: (2024)
by: Nagy, Csongor
Published: (2024)
The migratory impact of COVID‐19: The role of time and distances in the migration decisions of Hungarians during the COVID‐19 pandemic
by: László Zoltán Zöldi, et al.
Published: (2024)
by: László Zoltán Zöldi, et al.
Published: (2024)
On Tate Milnor-Witt Motives
by: Fasel, Jean, et al.
Published: (2023)
by: Fasel, Jean, et al.
Published: (2023)
Finite size effects on the phase diagram and the baryon fluctuations via momentum space constraints
by: Kovács, Győző
Published: (2024)
by: Kovács, Győző
Published: (2024)
A prognostic signature of fatty acid metabolism‐related genes for predicting survival of gastric cancer patients
by: Bochao Zhao, et al.
Published: (2024)
by: Bochao Zhao, et al.
Published: (2024)
OpenDataLab: Empowering General Artificial Intelligence with Open Datasets
by: He, Conghui, et al.
Published: (2024)
by: He, Conghui, et al.
Published: (2024)
Associations of BMI, sleep quality, and sleep duration trajectories with new‐onset diabetes mellitus in the elderly
by: Shanshan Li, et al.
Published: (2025)
by: Shanshan Li, et al.
Published: (2025)
3D Building Reconstruction from Monocular Remote Sensing Images with Multi-level Supervisions
by: Li, Weijia, et al.
Published: (2024)
by: Li, Weijia, et al.
Published: (2024)
On magnitudes of some CKM matrix elements
by: Ligeti, Zoltan
Published: (2024)
by: Ligeti, Zoltan
Published: (2024)
GRAIT: Gradient-Driven Refusal-Aware Instruction Tuning for Effective Hallucination Mitigation
by: Zhu, Runchuan, et al.
Published: (2025)
by: Zhu, Runchuan, et al.
Published: (2025)
Cross-view image geo-localization with Panorama-BEV Co-Retrieval Network
by: Ye, Junyan, et al.
Published: (2024)
by: Ye, Junyan, et al.
Published: (2024)
Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarks
by: Wang, Chonghua, et al.
Published: (2024)
by: Wang, Chonghua, et al.
Published: (2024)
VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
by: Wang, Weizhe, et al.
Published: (2025)
by: Wang, Weizhe, et al.
Published: (2025)
MapEval: Towards Unified, Robust and Efficient SLAM Map Evaluation Framework
by: Hu, Xiangcheng, et al.
Published: (2024)
by: Hu, Xiangcheng, et al.
Published: (2024)
Multi-Item Screening with a Maximin-Ratio Objective
by: Wang, Shixin
Published: (2024)
by: Wang, Shixin
Published: (2024)
The Power of Simple Menus in Robust Selling Mechanisms
by: Wang, Shixin
Published: (2023)
by: Wang, Shixin
Published: (2023)
PEGNet: A Physics-Embedded Graph Network for Long-Term Stable Multiphysics Simulation
by: Yang, Can, et al.
Published: (2025)
by: Yang, Can, et al.
Published: (2025)
LSP-YOLO: A Lightweight Single-Stage Network for Sitting Posture Recognition on Embedded Devices
by: Li, Nanjun, et al.
Published: (2025)
by: Li, Nanjun, et al.
Published: (2025)
OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
by: Wu, Zijian, et al.
Published: (2025)
by: Wu, Zijian, et al.
Published: (2025)
Acoustic Model Optimization over Multiple Data Sources: Merging and Valuation
by: Wei, Victor Junqiu, et al.
Published: (2024)
by: Wei, Victor Junqiu, et al.
Published: (2024)
Unsourced Random Access in MIMO Quasi-Static Rayleigh Fading Channels with Finite Blocklength
by: Gao, Junyuan, et al.
Published: (2024)
by: Gao, Junyuan, et al.
Published: (2024)
Protein Language Model‐Guided Engineering of a 2,3‐Butanediol Dehydrogenase for the Enantioselective Synthesis of Cyclic α ‐Hydroxy Ketones
by: Haote Ding, et al.
Published: (2026)
by: Haote Ding, et al.
Published: (2026)
Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis
by: Ye, Junyan, et al.
Published: (2024)
by: Ye, Junyan, et al.
Published: (2024)
Microstructural White Matter Alterations in Angelman Syndrome: A Fixel‐Based Analysis
by: Lei Wei, et al.
Published: (2025)
by: Lei Wei, et al.
Published: (2025)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
by: Chen, Zehui, et al.
Published: (2023)
by: Chen, Zehui, et al.
Published: (2023)
Similar Items
-
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
by: Gao, Junyuan, et al.
Published: (2025) -
Evaluating Large Language Model with Knowledge Oriented Language Specific Simple Question Answering
by: Jiang, Bowen, et al.
Published: (2025) -
GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition
by: Wang, Jingchao, et al.
Published: (2025) -
Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
by: Song, Jiahe, et al.
Published: (2026) -
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
by: Song, Jiahe, et al.
Published: (2025)