J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge
Fuente:
arXiv
Saved in:
| Main Authors: | Chan, Chi-Min, Xu, Chunpu, Ji, Jiaming, Ye, Zhen, Wen, Pengcheng, Jiang, Chunyang, Yang, Yaodong, Xue, Wei, Han, Sirui, Guo, Yike |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
by: Wen, Pengcheng, et al.
Published: (2025)
by: Wen, Pengcheng, et al.
Published: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
by: Zhu, Han, et al.
Published: (2025)
by: Zhu, Han, et al.
Published: (2025)
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
by: Fang, Sitong, et al.
Published: (2025)
by: Fang, Sitong, et al.
Published: (2025)
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
by: Wen, Pengcheng, et al.
Published: (2026)
by: Wen, Pengcheng, et al.
Published: (2026)
RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation
by: Chan, Chi-Min, et al.
Published: (2024)
by: Chan, Chi-Min, et al.
Published: (2024)
Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning
by: Bai, Hongbo, et al.
Published: (2026)
by: Bai, Hongbo, et al.
Published: (2026)
What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning
by: Zhou, Yujin, et al.
Published: (2026)
by: Zhou, Yujin, et al.
Published: (2026)
Importance Weighting Can Help Large Language Models Self-Improve
by: Jiang, Chunyang, et al.
Published: (2024)
by: Jiang, Chunyang, et al.
Published: (2024)
Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
by: Jiang, Chunyang, et al.
Published: (2025)
by: Jiang, Chunyang, et al.
Published: (2025)
MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation
by: Wang, Yutong, et al.
Published: (2025)
by: Wang, Yutong, et al.
Published: (2025)
Graceful Forgetting in Generative Language Models
by: Jiang, Chunyang, et al.
Published: (2025)
by: Jiang, Chunyang, et al.
Published: (2025)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
by: Zhou, Jiayi, et al.
Published: (2025)
by: Zhou, Jiayi, et al.
Published: (2025)
SafeLawBench: Towards Safe Alignment of Large Language Models
by: Cao, Chuxue, et al.
Published: (2025)
by: Cao, Chuxue, et al.
Published: (2025)
AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs
by: Zhu, Han, et al.
Published: (2026)
by: Zhu, Han, et al.
Published: (2026)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
by: Zhou, Yilun, et al.
Published: (2025)
by: Zhou, Yilun, et al.
Published: (2025)
RW-TTT: Batched Serving for Request-Owned Test-Time Training State
by: Yang, Jian, et al.
Published: (2026)
by: Yang, Jian, et al.
Published: (2026)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
by: Ji, Jiaming, et al.
Published: (2025)
by: Ji, Jiaming, et al.
Published: (2025)
AgentMonitor: A Plug-and-Play Framework for Predictive and Secure Multi-Agent Systems
by: Chan, Chi-Min, et al.
Published: (2024)
by: Chan, Chi-Min, et al.
Published: (2024)
Benchmarking Multi-National Value Alignment for Large Language Models
by: Shi, Weijie, et al.
Published: (2025)
by: Shi, Weijie, et al.
Published: (2025)
Mitigating Deceptive Alignment via Self-Monitoring
by: Ji, Jiaming, et al.
Published: (2025)
by: Ji, Jiaming, et al.
Published: (2025)
It's Not That Simple. An Analysis of Simple Test-Time Scaling
by: Wu, Guojun
Published: (2025)
by: Wu, Guojun
Published: (2025)
DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation
by: Qin, Peijia, et al.
Published: (2026)
by: Qin, Peijia, et al.
Published: (2026)
DC-W2S: Dual-Consensus Weak-to-Strong Training for Reliable Process Reward Modeling in Biological Reasoning
by: Chan, Chi-Min, et al.
Published: (2026)
by: Chan, Chi-Min, et al.
Published: (2026)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
by: Wang, Lichao, et al.
Published: (2026)
by: Wang, Lichao, et al.
Published: (2026)
Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
by: Ye, Zhen, et al.
Published: (2025)
by: Ye, Zhen, et al.
Published: (2025)
MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis
by: Chi, Xiaowei, et al.
Published: (2025)
by: Chi, Xiaowei, et al.
Published: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
by: Ji, Jiaming, et al.
Published: (2024)
by: Ji, Jiaming, et al.
Published: (2024)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
by: Chen, Jiawei, et al.
Published: (2026)
by: Chen, Jiawei, et al.
Published: (2026)
ABFS: Natural Robustness Testing for LLM-based NLP Software
by: Xiao, Mingxuan, et al.
Published: (2025)
by: Xiao, Mingxuan, et al.
Published: (2025)
HKGAI-V1: Towards Regional Sovereign Large Language Model for Hong Kong
by: Han, Sirui, et al.
Published: (2025)
by: Han, Sirui, et al.
Published: (2025)
Assessing the Robustness of LLM-based NLP Software via Automated Testing
by: Xiao, Mingxuan, et al.
Published: (2024)
by: Xiao, Mingxuan, et al.
Published: (2024)
SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
by: Xiao, Yang, et al.
Published: (2025)
by: Xiao, Yang, et al.
Published: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
by: Lou, Hantao, et al.
Published: (2025)
by: Lou, Hantao, et al.
Published: (2025)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
by: Lou, Hantao, et al.
Published: (2025)
by: Lou, Hantao, et al.
Published: (2025)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
by: Xiao, Yang, et al.
Published: (2025)
by: Xiao, Yang, et al.
Published: (2025)
LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning
by: Shi, Weijie, et al.
Published: (2025)
by: Shi, Weijie, et al.
Published: (2025)
Inference-time Scaling for Diffusion-based Audio Super-resolution
by: Jin, Yizhu, et al.
Published: (2025)
by: Jin, Yizhu, et al.
Published: (2025)
Foundation Cures Personalization: Improving Personalized Models' Prompt Consistency via Hidden Foundation Knowledge
by: Cai, Yiyang, et al.
Published: (2024)
by: Cai, Yiyang, et al.
Published: (2024)
Judge Reliability Harness: Stress Testing the Reliability of LLM Judges
by: Dev, Sunishchal, et al.
Published: (2026)
by: Dev, Sunishchal, et al.
Published: (2026)
Scaling LLM Test-Time Compute with Mobile NPU on Smartphones
by: Hao, Zixu, et al.
Published: (2025)
by: Hao, Zixu, et al.
Published: (2025)
Similar Items
-
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
by: Wen, Pengcheng, et al.
Published: (2025) -
SafeMT: Multi-turn Safety for Multimodal Language Models
by: Zhu, Han, et al.
Published: (2025) -
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
by: Fang, Sitong, et al.
Published: (2025) -
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
by: Wen, Pengcheng, et al.
Published: (2026) -
RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation
by: Chan, Chi-Min, et al.
Published: (2024)