Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data?
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Shaobo, Wang, Cong, Fu, Wenjie, Min, Yue, Feng, Mingquan, Guan, Isabel, Hu, Xuming, He, Conghui, Wang, Cunxiang, Yang, Kexin, Ren, Xingzhang, Huang, Fei, Liu, Dayiheng, Zhang, Linfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates
por: Wang, Shaobo, et al.
Publicado: (2026)
por: Wang, Shaobo, et al.
Publicado: (2026)
Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs
por: Zhou, Yufa, et al.
Publicado: (2025)
por: Zhou, Yufa, et al.
Publicado: (2025)
Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
por: Wang, Shaobo, et al.
Publicado: (2026)
por: Wang, Shaobo, et al.
Publicado: (2026)
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
por: Wang, Shaobo, et al.
Publicado: (2026)
por: Wang, Shaobo, et al.
Publicado: (2026)
Dataset Distillation with Neural Characteristic Function: A Minmax Perspective
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
por: Liao, Chenfei, et al.
Publicado: (2025)
por: Liao, Chenfei, et al.
Publicado: (2025)
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
por: Zou, Chang, et al.
Publicado: (2024)
por: Zou, Chang, et al.
Publicado: (2024)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
por: Li, Ruihang, et al.
Publicado: (2026)
por: Li, Ruihang, et al.
Publicado: (2026)
Rethinking Backdoor Detection Evaluation for Language Models
por: Yan, Jun, et al.
Publicado: (2024)
por: Yan, Jun, et al.
Publicado: (2024)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
por: Tian, Yuxin, et al.
Publicado: (2024)
por: Tian, Yuxin, et al.
Publicado: (2024)
IndustryCode: A Benchmark for Industry Code Generation
por: Zeng, Puyu, et al.
Publicado: (2026)
por: Zeng, Puyu, et al.
Publicado: (2026)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
por: Chen, Kexin, et al.
Publicado: (2024)
por: Chen, Kexin, et al.
Publicado: (2024)
DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation
por: Liang, Renzhao, et al.
Publicado: (2026)
por: Liang, Renzhao, et al.
Publicado: (2026)
How Likely Do LLMs with CoT Mimic Human Reasoning?
por: Bao, Guangsheng, et al.
Publicado: (2024)
por: Bao, Guangsheng, et al.
Publicado: (2024)
Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users
por: Kempermann, Manon, et al.
Publicado: (2025)
por: Kempermann, Manon, et al.
Publicado: (2025)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
Gnothi Seauton: Empowering Faithful Self-Interpretability in Black-Box Transformers
por: Wang, Shaobo, et al.
Publicado: (2024)
por: Wang, Shaobo, et al.
Publicado: (2024)
Knowledge Conflicts for LLMs: A Survey
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
KO: Kinetics-inspired Neural Optimizer with PDE Simulation Approaches
por: Feng, Mingquan, et al.
Publicado: (2025)
por: Feng, Mingquan, et al.
Publicado: (2025)
Towards Real-world Debiasing: Rethinking Evaluation, Challenge, and Solution
por: Kuang, Peng, et al.
Publicado: (2024)
por: Kuang, Peng, et al.
Publicado: (2024)
Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity
por: Zhang, Hangfan, et al.
Publicado: (2025)
por: Zhang, Hangfan, et al.
Publicado: (2025)
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs
por: Bi, Baolong, et al.
Publicado: (2025)
por: Bi, Baolong, et al.
Publicado: (2025)
DRUPI: Dataset Reduction Using Privileged Information
por: Wang, Shaobo, et al.
Publicado: (2024)
por: Wang, Shaobo, et al.
Publicado: (2024)
CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
On Predicting the Post-training Potential of Pre-trained LLMs
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
Debias Can be Unreliable: Mitigating Bias Issue in Evaluating Debiasing Recommendation
por: Wang, Chengbing, et al.
Publicado: (2024)
por: Wang, Chengbing, et al.
Publicado: (2024)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
por: He, Peize, et al.
Publicado: (2025)
por: He, Peize, et al.
Publicado: (2025)
DD-Ranking: Rethinking the Evaluation of Dataset Distillation
por: Li, Zekai, et al.
Publicado: (2025)
por: Li, Zekai, et al.
Publicado: (2025)
Can We Evaluate Domain Adaptation Models Without Target-Domain Labels?
por: Yang, Jianfei, et al.
Publicado: (2023)
por: Yang, Jianfei, et al.
Publicado: (2023)
Diffusion LLM with Native Variable Generation Lengths: Let [EOS] Lead the Way
por: Yang, Yicun, et al.
Publicado: (2025)
por: Yang, Yicun, et al.
Publicado: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
por: Han, Yuhang, et al.
Publicado: (2026)
por: Han, Yuhang, et al.
Publicado: (2026)
SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text Generation
por: Liu, Xiaoze, et al.
Publicado: (2024)
por: Liu, Xiaoze, et al.
Publicado: (2024)
Ejemplares similares
-
The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates
por: Wang, Shaobo, et al.
Publicado: (2026) -
Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs
por: Zhou, Yufa, et al.
Publicado: (2025) -
Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
por: Wang, Shaobo, et al.
Publicado: (2025) -
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
por: Wang, Shaobo, et al.
Publicado: (2026) -
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
por: Wang, Shaobo, et al.
Publicado: (2026)