DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yifan, Li, Qin, Zhang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
di: Wei, Shou'ang, et al.
Pubblicazione: (2025)
di: Wei, Shou'ang, et al.
Pubblicazione: (2025)
A Markov Categorical Framework for Language Modeling
di: Zhang, Yifan
Pubblicazione: (2025)
di: Zhang, Yifan
Pubblicazione: (2025)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025)
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
di: Li, Linyi, et al.
Pubblicazione: (2024)
di: Li, Linyi, et al.
Pubblicazione: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
di: Dong, Yihong, et al.
Pubblicazione: (2026)
di: Dong, Yihong, et al.
Pubblicazione: (2026)
Zero-to-Strong Generalization: Eliciting Strong Capabilities of Large Language Models Iteratively without Gold Labels
di: Liu, Chaoqun, et al.
Pubblicazione: (2024)
di: Liu, Chaoqun, et al.
Pubblicazione: (2024)
CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
di: Wan, Shengye, et al.
Pubblicazione: (2024)
di: Wan, Shengye, et al.
Pubblicazione: (2024)
Training and Evaluating Language Models with Template-based Data Generation
di: Zhang, Yifan
Pubblicazione: (2024)
di: Zhang, Yifan
Pubblicazione: (2024)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
di: Wang, Siqi, et al.
Pubblicazione: (2024)
di: Wang, Siqi, et al.
Pubblicazione: (2024)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
The Illusionist's Prompt: Exposing the Factual Vulnerabilities of Large Language Models with Linguistic Nuances
di: Wang, Yining, et al.
Pubblicazione: (2025)
di: Wang, Yining, et al.
Pubblicazione: (2025)
A Knowledge-Informed Large Language Model Framework for U.S. Nuclear Power Plant Shutdown Initiating Event Classification for Probabilistic Risk Assessment
di: Xian, Min, et al.
Pubblicazione: (2024)
di: Xian, Min, et al.
Pubblicazione: (2024)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
di: Yang, Rem, et al.
Pubblicazione: (2025)
di: Yang, Rem, et al.
Pubblicazione: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
di: Zhang, Fuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Fuxiang, et al.
Pubblicazione: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
di: Mateega, Spencer, et al.
Pubblicazione: (2025)
di: Mateega, Spencer, et al.
Pubblicazione: (2025)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
di: Li, Tenghui, et al.
Pubblicazione: (2024)
di: Li, Tenghui, et al.
Pubblicazione: (2024)
Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
di: Zhang, Andy K., et al.
Pubblicazione: (2024)
di: Zhang, Andy K., et al.
Pubblicazione: (2024)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
di: Wang, Yizhi, et al.
Pubblicazione: (2025)
di: Wang, Yizhi, et al.
Pubblicazione: (2025)
Monotonic Learning in the PAC Framework: A New Perspective
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
Evaluating the Progression of Large Language Model Capabilities for Small-Molecule Drug Design
di: Chennakesavalu, Shriram, et al.
Pubblicazione: (2026)
di: Chennakesavalu, Shriram, et al.
Pubblicazione: (2026)
ChipLingo: A Systematic Training Framework for Large Language Models in EDA
di: Li, Lei, et al.
Pubblicazione: (2026)
di: Li, Lei, et al.
Pubblicazione: (2026)
Beware of Calibration Data for Pruning Large Language Models
di: Ji, Yixin, et al.
Pubblicazione: (2024)
di: Ji, Yixin, et al.
Pubblicazione: (2024)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
di: Li, Jianling, et al.
Pubblicazione: (2025)
di: Li, Jianling, et al.
Pubblicazione: (2025)
Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models
di: Chua, Lynn, et al.
Pubblicazione: (2024)
di: Chua, Lynn, et al.
Pubblicazione: (2024)
Met$^2$Net: A Decoupled Two-Stage Spatio-Temporal Forecasting Model for Complex Meteorological Systems
di: Li, Shaohan, et al.
Pubblicazione: (2025)
di: Li, Shaohan, et al.
Pubblicazione: (2025)
Biology-Instructions: A Dataset and Benchmark for Multi-Omics Sequence Understanding Capability of Large Language Models
di: He, Haonan, et al.
Pubblicazione: (2024)
di: He, Haonan, et al.
Pubblicazione: (2024)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
di: Syed, Usman, et al.
Pubblicazione: (2024)
di: Syed, Usman, et al.
Pubblicazione: (2024)
Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models
di: Song, Yuda, et al.
Pubblicazione: (2024)
di: Song, Yuda, et al.
Pubblicazione: (2024)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
di: Liu, Jincheng, et al.
Pubblicazione: (2025)
di: Liu, Jincheng, et al.
Pubblicazione: (2025)
Evaluating Large Language Model Capabilities in Assessing Spatial Econometrics Research
di: Arbia, Giuseppe, et al.
Pubblicazione: (2025)
di: Arbia, Giuseppe, et al.
Pubblicazione: (2025)
Investigating Symbolic Capabilities of Large Language Models
di: Dave, Neisarg, et al.
Pubblicazione: (2024)
di: Dave, Neisarg, et al.
Pubblicazione: (2024)
Exploring the Adversarial Capabilities of Large Language Models
di: Struppek, Lukas, et al.
Pubblicazione: (2024)
di: Struppek, Lukas, et al.
Pubblicazione: (2024)
LLM4DyG: Can Large Language Models Solve Spatial-Temporal Problems on Dynamic Graphs?
di: Zhang, Zeyang, et al.
Pubblicazione: (2023)
di: Zhang, Zeyang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024) -
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
di: Wei, Shou'ang, et al.
Pubblicazione: (2025) -
A Markov Categorical Framework for Language Modeling
di: Zhang, Yifan
Pubblicazione: (2025) -
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
di: Zhuang, Yuchen, et al.
Pubblicazione: (2025) -
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
di: Tu, Ruibo, et al.
Pubblicazione: (2024)