Guardado en:
| Autores principales: | Li, Dawei, Sun, Renliang, Huang, Yue, Zhong, Ming, Jiang, Bohan, Han, Jiawei, Zhang, Xiangliang, Wang, Wei, Liu, Huan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.01534 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge
por: Li, Dawei, et al.
Publicado: (2024)
por: Li, Dawei, et al.
Publicado: (2024)
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024)
por: Jiang, Minhao, et al.
Publicado: (2024)
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
por: Sun, Yifan, et al.
Publicado: (2025)
por: Sun, Yifan, et al.
Publicado: (2025)
Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era
por: Li, Dawei, et al.
Publicado: (2025)
por: Li, Dawei, et al.
Publicado: (2025)
From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks
por: Stephan, Andreas, et al.
Publicado: (2024)
por: Stephan, Andreas, et al.
Publicado: (2024)
Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
por: Zhao, Chengshuai, et al.
Publicado: (2025)
por: Zhao, Chengshuai, et al.
Publicado: (2025)
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
por: Choi, Hyeong Kyu, et al.
Publicado: (2025)
por: Choi, Hyeong Kyu, et al.
Publicado: (2025)
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
por: Liao, Zeyi, et al.
Publicado: (2024)
por: Liao, Zeyi, et al.
Publicado: (2024)
Vibe Checker: Aligning Code Evaluation with Human Preference
por: Zhong, Ming, et al.
Publicado: (2025)
por: Zhong, Ming, et al.
Publicado: (2025)
Less is More: Improving LLM Alignment via Preference Data Selection
por: Deng, Xun, et al.
Publicado: (2025)
por: Deng, Xun, et al.
Publicado: (2025)
Seeking Neural Nuggets: Knowledge Transfer in Large Language Models from a Parametric Perspective
por: Zhong, Ming, et al.
Publicado: (2023)
por: Zhong, Ming, et al.
Publicado: (2023)
Are Today's LLMs Ready to Explain Well-Being Concepts?
por: Jiang, Bohan, et al.
Publicado: (2025)
por: Jiang, Bohan, et al.
Publicado: (2025)
Causally-Enhanced Reinforcement Policy Optimization
por: Wang, Xiangqi, et al.
Publicado: (2025)
por: Wang, Xiangqi, et al.
Publicado: (2025)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
por: Guo, Taicheng, et al.
Publicado: (2026)
por: Guo, Taicheng, et al.
Publicado: (2026)
Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks
por: Song, Yiliang, et al.
Publicado: (2026)
por: Song, Yiliang, et al.
Publicado: (2026)
Dual Optimal: Make Your LLM Peer-like with Dignity
por: Wang, Xiangqi, et al.
Publicado: (2026)
por: Wang, Xiangqi, et al.
Publicado: (2026)
Advancing LLM Reasoning Generalists with Preference Trees
por: Yuan, Lifan, et al.
Publicado: (2024)
por: Yuan, Lifan, et al.
Publicado: (2024)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
por: Mahdavi, Sadegh, et al.
Publicado: (2025)
por: Mahdavi, Sadegh, et al.
Publicado: (2025)
From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization
por: Zhou, Chenxi, et al.
Publicado: (2026)
por: Zhou, Chenxi, et al.
Publicado: (2026)
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
por: Chen, Guoxuan, et al.
Publicado: (2024)
por: Chen, Guoxuan, et al.
Publicado: (2024)
LiveBench: A Challenging, Contamination-Limited LLM Benchmark
por: White, Colin, et al.
Publicado: (2024)
por: White, Colin, et al.
Publicado: (2024)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
por: Han, Pengrui, et al.
Publicado: (2026)
por: Han, Pengrui, et al.
Publicado: (2026)
Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
por: Gao, Binxin, et al.
Publicado: (2025)
por: Gao, Binxin, et al.
Publicado: (2025)
LLMAP: LLM-Assisted Multi-Objective Route Planning with User Preferences
por: Yuan, Liangqi, et al.
Publicado: (2025)
por: Yuan, Liangqi, et al.
Publicado: (2025)
When Wording Steers the Evaluation: Framing Bias in LLM judges
por: Hwang, Yerin, et al.
Publicado: (2026)
por: Hwang, Yerin, et al.
Publicado: (2026)
On the Role of Preference Variance in Preference Optimization
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
por: Hu, Lingxiang, et al.
Publicado: (2026)
por: Hu, Lingxiang, et al.
Publicado: (2026)
RouteLLM: Learning to Route LLMs with Preference Data
por: Ong, Isaac, et al.
Publicado: (2024)
por: Ong, Isaac, et al.
Publicado: (2024)
Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
por: Fan, Chongyu, et al.
Publicado: (2024)
por: Fan, Chongyu, et al.
Publicado: (2024)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
por: Kim, Dongyoung, et al.
Publicado: (2024)
por: Kim, Dongyoung, et al.
Publicado: (2024)
Catching Chameleons: Detecting Evolving Disinformation Generated using Large Language Models
por: Jiang, Bohan, et al.
Publicado: (2024)
por: Jiang, Bohan, et al.
Publicado: (2024)
Benchmarking Benchmark Leakage in Large Language Models
por: Xu, Ruijie, et al.
Publicado: (2024)
por: Xu, Ruijie, et al.
Publicado: (2024)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
AttributionBench: How Hard is Automatic Attribution Evaluation?
por: Li, Yifei, et al.
Publicado: (2024)
por: Li, Yifei, et al.
Publicado: (2024)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
por: Zhao, Qihao, et al.
Publicado: (2024)
por: Zhao, Qihao, et al.
Publicado: (2024)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
por: Liu, Jie, et al.
Publicado: (2024)
por: Liu, Jie, et al.
Publicado: (2024)
Joint Detection of Fraud and Concept Drift inOnline Conversations with LLM-Assisted Judgment
por: Senol, Ali, et al.
Publicado: (2025)
por: Senol, Ali, et al.
Publicado: (2025)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
por: Wu, Mingqi, et al.
Publicado: (2025)
por: Wu, Mingqi, et al.
Publicado: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
Ejemplares similares
-
From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge
por: Li, Dawei, et al.
Publicado: (2024) -
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024) -
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
por: Sun, Yifan, et al.
Publicado: (2025) -
Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era
por: Li, Dawei, et al.
Publicado: (2025) -
From Calculation to Adjudication: Examining LLM judges on Mathematical Reasoning Tasks
por: Stephan, Andreas, et al.
Publicado: (2024)