F-Eval: Assessing Fundamental Abilities with Refined Evaluation Methods
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Yu, Chen, Keyu, Wang, Shujie, Li, Peiji, Guo, Qipeng, Yan, Hang, Qiu, Xipeng, Huang, Xuanjing, Lin, Dahua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Data-free Weight Compress and Denoise for Large Language Models
von: Peng, Runyu, et al.
Veröffentlicht: (2024)
von: Peng, Runyu, et al.
Veröffentlicht: (2024)
LongWanjuan: Towards Systematic Measurement for Long Text Quality
von: Lv, Kai, et al.
Veröffentlicht: (2024)
von: Lv, Kai, et al.
Veröffentlicht: (2024)
Case2Code: Scalable Synthetic Data for Code Generation
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
Identifying Semantic Induction Heads to Understand In-Context Learning
von: Ren, Jie, et al.
Veröffentlicht: (2024)
von: Ren, Jie, et al.
Veröffentlicht: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
von: Zhu, Qin, et al.
Veröffentlicht: (2025)
von: Zhu, Qin, et al.
Veröffentlicht: (2025)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
von: Lv, Kai, et al.
Veröffentlicht: (2023)
von: Lv, Kai, et al.
Veröffentlicht: (2023)
Unearthing Large Scale Domain-Specific Knowledge from Public Corpora
von: Fei, Zhaoye, et al.
Veröffentlicht: (2024)
von: Fei, Zhaoye, et al.
Veröffentlicht: (2024)
Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
von: Ma, Yichuan, et al.
Veröffentlicht: (2026)
von: Ma, Yichuan, et al.
Veröffentlicht: (2026)
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance
von: Ma, Yichuan, et al.
Veröffentlicht: (2025)
von: Ma, Yichuan, et al.
Veröffentlicht: (2025)
FastMCTS: A Simple Sampling Strategy for Data Synthesis
von: Li, Peiji, et al.
Veröffentlicht: (2025)
von: Li, Peiji, et al.
Veröffentlicht: (2025)
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
Scaling Laws of RoPE-based Extrapolation
von: Liu, Xiaoran, et al.
Veröffentlicht: (2023)
von: Liu, Xiaoran, et al.
Veröffentlicht: (2023)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
von: Lv, Kai, et al.
Veröffentlicht: (2025)
von: Lv, Kai, et al.
Veröffentlicht: (2025)
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
von: Ma, Yichuan, et al.
Veröffentlicht: (2026)
von: Ma, Yichuan, et al.
Veröffentlicht: (2026)
Code Needs Comments: Enhancing Code LLMs with Comment Augmentation
von: Song, Demin, et al.
Veröffentlicht: (2024)
von: Song, Demin, et al.
Veröffentlicht: (2024)
DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels
von: Xu, Zhe, et al.
Veröffentlicht: (2024)
von: Xu, Zhe, et al.
Veröffentlicht: (2024)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
von: Wang, Weiyi, et al.
Veröffentlicht: (2026)
von: Wang, Weiyi, et al.
Veröffentlicht: (2026)
Balanced Data Sampling for Language Model Training with Clustering
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
von: Sun, Yuhong, et al.
Veröffentlicht: (2025)
von: Sun, Yuhong, et al.
Veröffentlicht: (2025)
Teach2Eval: An Indirect Evaluation Method for LLM by Judging How It Teaches
von: Zhou, Yuhang, et al.
Veröffentlicht: (2025)
von: Zhou, Yuhang, et al.
Veröffentlicht: (2025)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
von: Xu, Ningyu, et al.
Veröffentlicht: (2026)
von: Xu, Ningyu, et al.
Veröffentlicht: (2026)
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
von: Cao, Yixin, et al.
Veröffentlicht: (2025)
von: Cao, Yixin, et al.
Veröffentlicht: (2025)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
von: Liu, Peiju, et al.
Veröffentlicht: (2026)
von: Liu, Peiju, et al.
Veröffentlicht: (2026)
CriticEval: Evaluating Large Language Model as Critic
von: Lan, Tian, et al.
Veröffentlicht: (2024)
von: Lan, Tian, et al.
Veröffentlicht: (2024)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
von: Sun, Yuhong, et al.
Veröffentlicht: (2024)
von: Sun, Yuhong, et al.
Veröffentlicht: (2024)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
von: Li, Peiji, et al.
Veröffentlicht: (2026)
von: Li, Peiji, et al.
Veröffentlicht: (2026)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
Dynamic and Generalizable Process Reward Modeling
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
von: Wang, Bo, et al.
Veröffentlicht: (2025)
von: Wang, Bo, et al.
Veröffentlicht: (2025)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
von: Peng, Runyu, et al.
Veröffentlicht: (2026)
von: Peng, Runyu, et al.
Veröffentlicht: (2026)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
von: Lv, Kai, et al.
Veröffentlicht: (2023)
von: Lv, Kai, et al.
Veröffentlicht: (2023)
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
von: Liu, Xiaoran, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoran, et al.
Veröffentlicht: (2025)
Scaling Laws for Fact Memorization of Large Language Models
von: Lu, Xingyu, et al.
Veröffentlicht: (2024)
von: Lu, Xingyu, et al.
Veröffentlicht: (2024)
Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders
von: He, Zhengfu, et al.
Veröffentlicht: (2024)
von: He, Zhengfu, et al.
Veröffentlicht: (2024)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
von: Zhu, Qin, et al.
Veröffentlicht: (2024)
von: Zhu, Qin, et al.
Veröffentlicht: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best Practices
von: Chen, Zhi, et al.
Veröffentlicht: (2024)
von: Chen, Zhi, et al.
Veröffentlicht: (2024)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
von: Li, Bowen, et al.
Veröffentlicht: (2026)
von: Li, Bowen, et al.
Veröffentlicht: (2026)
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
von: Song, Yuerong, et al.
Veröffentlicht: (2025)
von: Song, Yuerong, et al.
Veröffentlicht: (2025)
Can Language Models Learn to Skip Steps?
von: Liu, Tengxiao, et al.
Veröffentlicht: (2024)
von: Liu, Tengxiao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Data-free Weight Compress and Denoise for Large Language Models
von: Peng, Runyu, et al.
Veröffentlicht: (2024) -
LongWanjuan: Towards Systematic Measurement for Long Text Quality
von: Lv, Kai, et al.
Veröffentlicht: (2024) -
Case2Code: Scalable Synthetic Data for Code Generation
von: Shao, Yunfan, et al.
Veröffentlicht: (2024) -
Identifying Semantic Induction Heads to Understand In-Context Learning
von: Ren, Jie, et al.
Veröffentlicht: (2024) -
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
von: Zhu, Qin, et al.
Veröffentlicht: (2025)