Interactive Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yue, Baoqing, Zhu, Zihan, Han, Yutong, Fan, Brian, Sun, Qian, Feng, Jichen, Yang, Hufei, Zhang, Yifan, Wang, Mengdi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
di: Sun, Yifan, et al.
Pubblicazione: (2025)
di: Sun, Yifan, et al.
Pubblicazione: (2025)
Higher-order Linear Attention
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
di: Yuan, Hui, et al.
Pubblicazione: (2024)
di: Yuan, Hui, et al.
Pubblicazione: (2024)
Relative-Based Scaling Law for Neural Language Models
di: Yue, Baoqing, et al.
Pubblicazione: (2025)
di: Yue, Baoqing, et al.
Pubblicazione: (2025)
FlashSampling: Fast and Memory-Efficient Exact Sampling
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
di: Qiu, Jiahao, et al.
Pubblicazione: (2024)
di: Qiu, Jiahao, et al.
Pubblicazione: (2024)
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
Text-ADBench: Text Anomaly Detection Benchmark based on LLMs Embedding
di: Xiao, Feng, et al.
Pubblicazione: (2025)
di: Xiao, Feng, et al.
Pubblicazione: (2025)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
AcademicEval: Live Long-Context LLM Benchmark
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Temporal Consistency for LLM Reasoning Process Error Identification
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
Deep Delta Learning
di: Zhang, Yifan, et al.
Pubblicazione: (2026)
di: Zhang, Yifan, et al.
Pubblicazione: (2026)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
A Dual-View Approach to Classifying Radiology Reports by Co-Training
di: Han, Yutong, et al.
Pubblicazione: (2024)
di: Han, Yutong, et al.
Pubblicazione: (2024)
CP-Prompt: Composition-Based Cross-modal Prompting for Domain-Incremental Continual Learning
di: Feng, Yu, et al.
Pubblicazione: (2024)
di: Feng, Yu, et al.
Pubblicazione: (2024)
Benchmarking Benchmark Leakage in Large Language Models
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities
di: Lu, Jiarui, et al.
Pubblicazione: (2024)
di: Lu, Jiarui, et al.
Pubblicazione: (2024)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
di: Yang, Siwei, et al.
Pubblicazione: (2024)
di: Yang, Siwei, et al.
Pubblicazione: (2024)
Are Transformers Able to Reason by Connecting Separated Knowledge in Training Data?
di: Yin, Yutong, et al.
Pubblicazione: (2025)
di: Yin, Yutong, et al.
Pubblicazione: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
LLMScan: Causal Scan for LLM Misbehavior Detection
di: Zhang, Mengdi, et al.
Pubblicazione: (2024)
di: Zhang, Mengdi, et al.
Pubblicazione: (2024)
MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback
di: Wang, Xingyao, et al.
Pubblicazione: (2023)
di: Wang, Xingyao, et al.
Pubblicazione: (2023)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
di: Ji, Xiang, et al.
Pubblicazione: (2024)
di: Ji, Xiang, et al.
Pubblicazione: (2024)
A Theoretical Perspective for Speculative Decoding Algorithm
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Text Diffusion with Reinforced Conditioning
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
di: Guan, Zihan, et al.
Pubblicazione: (2026)
di: Guan, Zihan, et al.
Pubblicazione: (2026)
Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical Texts
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
DataSciBench: An LLM Agent Benchmark for Data Science
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
di: Zhang, Yifan, et al.
Pubblicazione: (2024)
Training and Evaluating Language Models with Template-based Data Generation
di: Zhang, Yifan
Pubblicazione: (2024)
di: Zhang, Yifan
Pubblicazione: (2024)
Residual Stream Duality in Modern Transformer Architectures
di: Zhang, Yifan
Pubblicazione: (2026)
di: Zhang, Yifan
Pubblicazione: (2026)
A Markov Categorical Framework for Language Modeling
di: Zhang, Yifan
Pubblicazione: (2025)
di: Zhang, Yifan
Pubblicazione: (2025)
Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?
di: Zhang, Pingyue, et al.
Pubblicazione: (2026)
di: Zhang, Pingyue, et al.
Pubblicazione: (2026)
KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
SVIP: Towards Verifiable Inference of Open-source Large Language Models
di: Sun, Yifan, et al.
Pubblicazione: (2024)
di: Sun, Yifan, et al.
Pubblicazione: (2024)
Web World Models
di: Feng, Jichen, et al.
Pubblicazione: (2025)
di: Feng, Jichen, et al.
Pubblicazione: (2025)
Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
di: Chen, Yingfa, et al.
Pubblicazione: (2026)
di: Chen, Yingfa, et al.
Pubblicazione: (2026)
Prism: Symbolic Superoptimization of Tensor Programs
di: Wu, Mengdi, et al.
Pubblicazione: (2026)
di: Wu, Mengdi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
di: Sun, Yifan, et al.
Pubblicazione: (2025) -
Higher-order Linear Attention
di: Zhang, Yifan, et al.
Pubblicazione: (2025) -
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
di: Yuan, Hui, et al.
Pubblicazione: (2024) -
Relative-Based Scaling Law for Neural Language Models
di: Yue, Baoqing, et al.
Pubblicazione: (2025) -
FlashSampling: Fast and Memory-Efficient Exact Sampling
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)