LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ivanov, Igor, Africa, David Demitri |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Steering Awareness: Detecting Activation Steering from Within
par: Rivera, Joshua Fonseca, et autres
Publié: (2025)
par: Rivera, Joshua Fonseca, et autres
Publié: (2025)
Consistency Training while Mitigating Obfuscation via Rate Matching
par: Imran, Sohaib, et autres
Publié: (2026)
par: Imran, Sohaib, et autres
Publié: (2026)
Learning Dynamics of Meta-Learning in Small Model Pretraining
par: Africa, David Demitri, et autres
Publié: (2025)
par: Africa, David Demitri, et autres
Publié: (2025)
Investigating ReLoRA: Effects on the Learning Dynamics of Small Language Models
par: Weiss, Yuval, et autres
Publié: (2025)
par: Weiss, Yuval, et autres
Publié: (2025)
Meta-Pretraining for Zero-Shot Cross-Lingual Named Entity Recognition in Low-Resource Philippine Languages
par: Africa, David Demitri, et autres
Publié: (2025)
par: Africa, David Demitri, et autres
Publié: (2025)
Does Self-Evaluation Enable Wireheading in Language Models?
par: Africa, David Demitri, et autres
Publié: (2025)
par: Africa, David Demitri, et autres
Publié: (2025)
Pico: A Modular Framework for Hypothesis-Driven Small Language Model Research
par: Martinez, Richard Diehl, et autres
Publié: (2025)
par: Martinez, Richard Diehl, et autres
Publié: (2025)
No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes
par: Cencerrado, Iván Vicente Moreno, et autres
Publié: (2025)
par: Cencerrado, Iván Vicente Moreno, et autres
Publié: (2025)
Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
par: Tan, Daniel, et autres
Publié: (2025)
par: Tan, Daniel, et autres
Publié: (2025)
Identifying a Circuit for Verb Conjugation in GPT-2
par: Africa, David Demitri
Publié: (2025)
par: Africa, David Demitri
Publié: (2025)
FutureSim: Replaying World Events to Evaluate Adaptive Agents
par: Goel, Shashwat, et autres
Publié: (2026)
par: Goel, Shashwat, et autres
Publié: (2026)
Batayan: A Filipino NLP benchmark for evaluating Large Language Models
par: Montalan, Jann Railey, et autres
Publié: (2025)
par: Montalan, Jann Railey, et autres
Publié: (2025)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
par: Ning, Kangyun, et autres
Publié: (2024)
par: Ning, Kangyun, et autres
Publié: (2024)
GameArena: Evaluating LLM Reasoning through Live Computer Games
par: Hu, Lanxiang, et autres
Publié: (2024)
par: Hu, Lanxiang, et autres
Publié: (2024)
MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning
par: Lu, Yiyang, et autres
Publié: (2026)
par: Lu, Yiyang, et autres
Publié: (2026)
Probing and Steering Evaluation Awareness of Language Models
par: Nguyen, Jord, et autres
Publié: (2025)
par: Nguyen, Jord, et autres
Publié: (2025)
LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs
par: Guo, Pei-Fu, et autres
Publié: (2025)
par: Guo, Pei-Fu, et autres
Publié: (2025)
DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis
par: Patel, Liana, et autres
Publié: (2025)
par: Patel, Liana, et autres
Publié: (2025)
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
par: Zhang, Hongbin, et autres
Publié: (2025)
par: Zhang, Hongbin, et autres
Publié: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
par: Hua, Tim Tian, et autres
Publié: (2025)
par: Hua, Tim Tian, et autres
Publié: (2025)
Towards Evaluating Proactive Risk Awareness of Multimodal Language Models
par: Yuan, Youliang, et autres
Publié: (2025)
par: Yuan, Youliang, et autres
Publié: (2025)
HALF: Harm-Aware LLM Fairness Evaluation Aligned with Deployment
par: Mekky, Ali, et autres
Publié: (2025)
par: Mekky, Ali, et autres
Publié: (2025)
Syntactic Evolution in Language Usage
par: Kumar, Surbhit
Publié: (2025)
par: Kumar, Surbhit
Publié: (2025)
Decomposing and Measuring Evaluation Awareness
par: Li, Changling, et autres
Publié: (2026)
par: Li, Changling, et autres
Publié: (2026)
FineSurE: Fine-grained Summarization Evaluation using LLMs
par: Song, Hwanjun, et autres
Publié: (2024)
par: Song, Hwanjun, et autres
Publié: (2024)
CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law
par: Jung, JiHyeok, et autres
Publié: (2026)
par: Jung, JiHyeok, et autres
Publié: (2026)
PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization
par: Pang, Tsz Fung, et autres
Publié: (2025)
par: Pang, Tsz Fung, et autres
Publié: (2025)
How to Evaluate Speech Translation with Source-Aware Neural MT Metrics
par: Cettolo, Mauro, et autres
Publié: (2025)
par: Cettolo, Mauro, et autres
Publié: (2025)
SiLVERScore: Semantically-Aware Embeddings for Sign Language Generation Evaluation
par: Imai, Saki, et autres
Publié: (2025)
par: Imai, Saki, et autres
Publié: (2025)
Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks
par: Luo, Zhimeng, et autres
Publié: (2025)
par: Luo, Zhimeng, et autres
Publié: (2025)
Socio-Culturally Aware Evaluation Framework for LLM-Based Content Moderation
par: Kumar, Shanu, et autres
Publié: (2024)
par: Kumar, Shanu, et autres
Publié: (2024)
Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX
par: Martynov, Nikita, et autres
Publié: (2025)
par: Martynov, Nikita, et autres
Publié: (2025)
Evaluating Cultural Awareness of LLMs for Yoruba, Malayalam, and English
par: Dawson, Fiifi, et autres
Publié: (2024)
par: Dawson, Fiifi, et autres
Publié: (2024)
AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems
par: Chhabra, Mukul, et autres
Publié: (2026)
par: Chhabra, Mukul, et autres
Publié: (2026)
CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech Translation
par: Xu, Xi, et autres
Publié: (2024)
par: Xu, Xi, et autres
Publié: (2024)
Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
Prioritized Replay for RL Post-training
par: Fatemi, Mehdi
Publié: (2026)
par: Fatemi, Mehdi
Publié: (2026)
LLMs as Function Approximators: Terminology, Taxonomy, and Questions for Evaluation
par: Schlangen, David
Publié: (2024)
par: Schlangen, David
Publié: (2024)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
Documents similaires
-
Steering Awareness: Detecting Activation Steering from Within
par: Rivera, Joshua Fonseca, et autres
Publié: (2025) -
Consistency Training while Mitigating Obfuscation via Rate Matching
par: Imran, Sohaib, et autres
Publié: (2026) -
Learning Dynamics of Meta-Learning in Small Model Pretraining
par: Africa, David Demitri, et autres
Publié: (2025) -
Investigating ReLoRA: Effects on the Learning Dynamics of Small Language Models
par: Weiss, Yuval, et autres
Publié: (2025) -
Meta-Pretraining for Zero-Shot Cross-Lingual Named Entity Recognition in Low-Resource Philippine Languages
par: Africa, David Demitri, et autres
Publié: (2025)