DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yifan, Li, Qin, Zhang, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
por: Feng, Jie, et al.
Publicado: (2024)
por: Feng, Jie, et al.
Publicado: (2024)
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
por: Wei, Shou'ang, et al.
Publicado: (2025)
por: Wei, Shou'ang, et al.
Publicado: (2025)
A Markov Categorical Framework for Language Modeling
por: Zhang, Yifan
Publicado: (2025)
por: Zhang, Yifan
Publicado: (2025)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
por: Zhuang, Yuchen, et al.
Publicado: (2025)
por: Zhuang, Yuchen, et al.
Publicado: (2025)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
por: Tu, Ruibo, et al.
Publicado: (2024)
por: Tu, Ruibo, et al.
Publicado: (2024)
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
por: Li, Linyi, et al.
Publicado: (2024)
por: Li, Linyi, et al.
Publicado: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
por: Dong, Yihong, et al.
Publicado: (2026)
por: Dong, Yihong, et al.
Publicado: (2026)
Zero-to-Strong Generalization: Eliciting Strong Capabilities of Large Language Models Iteratively without Gold Labels
por: Liu, Chaoqun, et al.
Publicado: (2024)
por: Liu, Chaoqun, et al.
Publicado: (2024)
CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
por: Wan, Shengye, et al.
Publicado: (2024)
por: Wan, Shengye, et al.
Publicado: (2024)
Training and Evaluating Language Models with Template-based Data Generation
por: Zhang, Yifan
Publicado: (2024)
por: Zhang, Yifan
Publicado: (2024)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
por: Wang, Siqi, et al.
Publicado: (2024)
por: Wang, Siqi, et al.
Publicado: (2024)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
por: Dong, Guanting, et al.
Publicado: (2024)
por: Dong, Guanting, et al.
Publicado: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
por: Kasetty, Tejas, et al.
Publicado: (2024)
por: Kasetty, Tejas, et al.
Publicado: (2024)
The Illusionist's Prompt: Exposing the Factual Vulnerabilities of Large Language Models with Linguistic Nuances
por: Wang, Yining, et al.
Publicado: (2025)
por: Wang, Yining, et al.
Publicado: (2025)
A Knowledge-Informed Large Language Model Framework for U.S. Nuclear Power Plant Shutdown Initiating Event Classification for Probabilistic Risk Assessment
por: Xian, Min, et al.
Publicado: (2024)
por: Xian, Min, et al.
Publicado: (2024)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
por: Hua, Wenyue, et al.
Publicado: (2024)
por: Hua, Wenyue, et al.
Publicado: (2024)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
por: Yang, Rem, et al.
Publicado: (2025)
por: Yang, Rem, et al.
Publicado: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
por: Zhang, Fuxiang, et al.
Publicado: (2024)
por: Zhang, Fuxiang, et al.
Publicado: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)
por: Guo, Jiawei, et al.
Publicado: (2024)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
por: Mateega, Spencer, et al.
Publicado: (2025)
por: Mateega, Spencer, et al.
Publicado: (2025)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
por: Li, Tenghui, et al.
Publicado: (2024)
por: Li, Tenghui, et al.
Publicado: (2024)
Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
por: Zhang, Andy K., et al.
Publicado: (2024)
por: Zhang, Andy K., et al.
Publicado: (2024)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
por: Zhang, Mingyuan, et al.
Publicado: (2025)
por: Zhang, Mingyuan, et al.
Publicado: (2025)
Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
por: Wang, Yizhi, et al.
Publicado: (2025)
por: Wang, Yizhi, et al.
Publicado: (2025)
Monotonic Learning in the PAC Framework: A New Perspective
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
por: Liu, Yixin, et al.
Publicado: (2023)
por: Liu, Yixin, et al.
Publicado: (2023)
Evaluating the Progression of Large Language Model Capabilities for Small-Molecule Drug Design
por: Chennakesavalu, Shriram, et al.
Publicado: (2026)
por: Chennakesavalu, Shriram, et al.
Publicado: (2026)
ChipLingo: A Systematic Training Framework for Large Language Models in EDA
por: Li, Lei, et al.
Publicado: (2026)
por: Li, Lei, et al.
Publicado: (2026)
Beware of Calibration Data for Pruning Large Language Models
por: Ji, Yixin, et al.
Publicado: (2024)
por: Ji, Yixin, et al.
Publicado: (2024)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
por: Li, Jianling, et al.
Publicado: (2025)
por: Li, Jianling, et al.
Publicado: (2025)
Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models
por: Chua, Lynn, et al.
Publicado: (2024)
por: Chua, Lynn, et al.
Publicado: (2024)
Met$^2$Net: A Decoupled Two-Stage Spatio-Temporal Forecasting Model for Complex Meteorological Systems
por: Li, Shaohan, et al.
Publicado: (2025)
por: Li, Shaohan, et al.
Publicado: (2025)
Biology-Instructions: A Dataset and Benchmark for Multi-Omics Sequence Understanding Capability of Large Language Models
por: He, Haonan, et al.
Publicado: (2024)
por: He, Haonan, et al.
Publicado: (2024)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
por: Syed, Usman, et al.
Publicado: (2024)
por: Syed, Usman, et al.
Publicado: (2024)
Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
por: Liu, Jincheng, et al.
Publicado: (2025)
por: Liu, Jincheng, et al.
Publicado: (2025)
Evaluating Large Language Model Capabilities in Assessing Spatial Econometrics Research
por: Arbia, Giuseppe, et al.
Publicado: (2025)
por: Arbia, Giuseppe, et al.
Publicado: (2025)
Investigating Symbolic Capabilities of Large Language Models
por: Dave, Neisarg, et al.
Publicado: (2024)
por: Dave, Neisarg, et al.
Publicado: (2024)
Exploring the Adversarial Capabilities of Large Language Models
por: Struppek, Lukas, et al.
Publicado: (2024)
por: Struppek, Lukas, et al.
Publicado: (2024)
LLM4DyG: Can Large Language Models Solve Spatial-Temporal Problems on Dynamic Graphs?
por: Zhang, Zeyang, et al.
Publicado: (2023)
por: Zhang, Zeyang, et al.
Publicado: (2023)
Ejemplares similares
-
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
por: Feng, Jie, et al.
Publicado: (2024) -
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
por: Wei, Shou'ang, et al.
Publicado: (2025) -
A Markov Categorical Framework for Language Modeling
por: Zhang, Yifan
Publicado: (2025) -
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
por: Zhuang, Yuchen, et al.
Publicado: (2025) -
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
por: Tu, Ruibo, et al.
Publicado: (2024)