Becoming Experienced Judges: Selective Test-Time Learning for Evaluators
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jwa, Seungyeon, Ahn, Daechul, Kim, Reokyoung, Kang, Dongyeop, Choi, Jonghyun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models
par: Choi, Hyeonbeom, et autres
Publié: (2026)
par: Choi, Hyeonbeom, et autres
Publié: (2026)
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
par: Ahn, Daechul, et autres
Publié: (2025)
par: Ahn, Daechul, et autres
Publié: (2025)
The Amazing Agent Race: Strong Tool Users, Weak Navigators
par: Kim, Zae Myung, et autres
Publié: (2026)
par: Kim, Zae Myung, et autres
Publié: (2026)
A2P-Vis: an Analyzer-to-Presenter Agentic Pipeline for Visual Insights Generation and Reporting
par: Gan, Shuyu, et autres
Publié: (2025)
par: Gan, Shuyu, et autres
Publié: (2025)
When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs
par: Jeong, Soyeong, et autres
Publié: (2025)
par: Jeong, Soyeong, et autres
Publié: (2025)
Align to Structure: Aligning Large Language Models with Structural Information
par: Kim, Zae Myung, et autres
Publié: (2025)
par: Kim, Zae Myung, et autres
Publié: (2025)
Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation
par: Park, Jong Inn, et autres
Publié: (2025)
par: Park, Jong Inn, et autres
Publié: (2025)
Adaptive Selection of LoRA Components in Privacy-Preserving Federated Learning
par: Kim, Myoungjun, et autres
Publié: (2026)
par: Kim, Myoungjun, et autres
Publié: (2026)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
What Happens When: Learning Temporal Orders of Events in Videos
par: Ahn, Daechul, et autres
Publié: (2025)
par: Ahn, Daechul, et autres
Publié: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
Benchmarking Cognitive Biases in Large Language Models as Evaluators
par: Koo, Ryan, et autres
Publié: (2023)
par: Koo, Ryan, et autres
Publié: (2023)
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning
par: Akyürek, Ekin, et autres
Publié: (2024)
par: Akyürek, Ekin, et autres
Publié: (2024)
Scaling Unverifiable Rewards: A Case Study on Visual Insights
par: Gan, Shuyu, et autres
Publié: (2025)
par: Gan, Shuyu, et autres
Publié: (2025)
QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference
par: Kim, Taesu, et autres
Publié: (2024)
par: Kim, Taesu, et autres
Publié: (2024)
Titans: Learning to Memorize at Test Time
par: Behrouz, Ali, et autres
Publié: (2024)
par: Behrouz, Ali, et autres
Publié: (2024)
Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback
par: Ahn, Daechul, et autres
Publié: (2024)
par: Ahn, Daechul, et autres
Publié: (2024)
Context Over Content: Exposing Evaluation Faking in Automated Judges
par: Gupta, Manan, et autres
Publié: (2026)
par: Gupta, Manan, et autres
Publié: (2026)
Do LLMs Recognize Your Latent Preferences? A Benchmark for Latent Information Discovery in Personalized Interaction
par: Tsaknakis, Ioannis, et autres
Publié: (2025)
par: Tsaknakis, Ioannis, et autres
Publié: (2025)
Test-Time Learning for Large Language Models
par: Hu, Jinwu, et autres
Publié: (2025)
par: Hu, Jinwu, et autres
Publié: (2025)
Learning to Reason from Feedback at Test-Time
par: Li, Yanyang, et autres
Publié: (2025)
par: Li, Yanyang, et autres
Publié: (2025)
Reinforcement Learning Teachers of Test Time Scaling
par: Cetin, Edoardo, et autres
Publié: (2025)
par: Cetin, Edoardo, et autres
Publié: (2025)
Query-Conditioned Test-Time Self-Training for Large Language Models
par: Song, Chaehee, et autres
Publié: (2026)
par: Song, Chaehee, et autres
Publié: (2026)
Learning to (Learn at Test Time): RNNs with Expressive Hidden States
par: Sun, Yu, et autres
Publié: (2024)
par: Sun, Yu, et autres
Publié: (2024)
Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation
par: Mooney, James, et autres
Publié: (2025)
par: Mooney, James, et autres
Publié: (2025)
Test-Time Detoxification without Training or Learning Anything
par: Saglam, Baturay, et autres
Publié: (2026)
par: Saglam, Baturay, et autres
Publié: (2026)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
par: Duo, Jiangshan, et autres
Publié: (2026)
par: Duo, Jiangshan, et autres
Publié: (2026)
Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?
par: Kim, Jane Paik
Publié: (2026)
par: Kim, Jane Paik
Publié: (2026)
From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges
par: Hong, Yihan, et autres
Publié: (2026)
par: Hong, Yihan, et autres
Publié: (2026)
Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation
par: Alam, Firoj, et autres
Publié: (2026)
par: Alam, Firoj, et autres
Publié: (2026)
Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States
par: Choi, Yunho, et autres
Publié: (2026)
par: Choi, Yunho, et autres
Publié: (2026)
TTA-DAME: Test-Time Adaptation with Domain Augmentation and Model Ensemble for Dynamic Driving Conditions
par: Jeon, Dongjae, et autres
Publié: (2025)
par: Jeon, Dongjae, et autres
Publié: (2025)
Culinary Class Wars: Evaluating LLMs using ASH in Cuisine Transfer Task
par: Lee, Hoonick, et autres
Publié: (2024)
par: Lee, Hoonick, et autres
Publié: (2024)
CCRS: A Zero-Shot LLM-as-a-Judge Framework for Comprehensive RAG Evaluation
par: Muhamed, Aashiq
Publié: (2025)
par: Muhamed, Aashiq
Publié: (2025)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Approximating Human Preferences Using a Multi-Judge Learned System
par: Sprejer, Eitán, et autres
Publié: (2025)
par: Sprejer, Eitán, et autres
Publié: (2025)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
par: Xu, Ruiyao, et autres
Publié: (2026)
par: Xu, Ruiyao, et autres
Publié: (2026)
Strategic Scaling of Test-Time Compute: A Bandit Learning Approach
par: Zuo, Bowen, et autres
Publié: (2025)
par: Zuo, Bowen, et autres
Publié: (2025)
Documents similaires
-
SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models
par: Choi, Hyeonbeom, et autres
Publié: (2026) -
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
par: Ahn, Daechul, et autres
Publié: (2025) -
The Amazing Agent Race: Strong Tool Users, Weak Navigators
par: Kim, Zae Myung, et autres
Publié: (2026) -
A2P-Vis: an Analyzer-to-Presenter Agentic Pipeline for Visual Insights Generation and Reporting
par: Gan, Shuyu, et autres
Publié: (2025) -
When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs
par: Jeong, Soyeong, et autres
Publié: (2025)