A Survey on LLM-as-a-Judge
Fuente:
arXiv
Saved in:
| Main Authors: | Gu, Jiawei, Jiang, Xuhui, Shi, Zhichao, Tan, Hexiang, Zhai, Xuehao, Xu, Chengjin, Li, Wei, Shen, Yinghan, Ma, Shengjie, Liu, Honghao, Wang, Saizhuo, Zhang, Kun, Wang, Yuanzhuo, Gao, Wen, Ni, Lionel, Guo, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
by: Shi, Zhichao, et al.
Published: (2025)
by: Shi, Zhichao, et al.
Published: (2025)
On the Evolution of Knowledge Graphs: A Survey and Perspective
by: Jiang, Xuhui, et al.
Published: (2023)
by: Jiang, Xuhui, et al.
Published: (2023)
Unlocking the Power of Large Language Models for Entity Alignment
by: Jiang, Xuhui, et al.
Published: (2024)
by: Jiang, Xuhui, et al.
Published: (2024)
Toward Practical Entity Alignment Method Design: Insights from New Highly Heterogeneous Knowledge Graph Datasets
by: Jiang, Xuhui, et al.
Published: (2023)
by: Jiang, Xuhui, et al.
Published: (2023)
A Survey on Large Language Model Hallucination via a Creativity Perspective
by: Jiang, Xuhui, et al.
Published: (2024)
by: Jiang, Xuhui, et al.
Published: (2024)
Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs
by: Liu, Honghao, et al.
Published: (2026)
by: Liu, Honghao, et al.
Published: (2026)
Fractal Graph Contrastive Learning
by: Li, Nero Z., et al.
Published: (2025)
by: Li, Nero Z., et al.
Published: (2025)
DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis
by: Shi, Zhichao, et al.
Published: (2026)
by: Shi, Zhichao, et al.
Published: (2026)
Conflicts Make Large Reasoning Models Vulnerable to Attacks
by: Liu, Honghao, et al.
Published: (2026)
by: Liu, Honghao, et al.
Published: (2026)
QuantAgent: Seeking Holy Grail in Trading by Self-Improving Large Language Model
by: Wang, Saizhuo, et al.
Published: (2024)
by: Wang, Saizhuo, et al.
Published: (2024)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
by: Sun, Jiashuo, et al.
Published: (2023)
by: Sun, Jiashuo, et al.
Published: (2023)
Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
by: Ma, Shengjie, et al.
Published: (2025)
by: Ma, Shengjie, et al.
Published: (2025)
Blinded by Generated Contexts: How Language Models Merge Generated and Retrieved Contexts When Knowledge Conflicts?
by: Tan, Hexiang, et al.
Published: (2024)
by: Tan, Hexiang, et al.
Published: (2024)
Alpha-GPT: Human-AI Interactive Alpha Mining for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2023)
by: Wang, Saizhuo, et al.
Published: (2023)
From Deep Learning to LLMs: A survey of AI in Quantitative Investment
by: Cao, Bokai, et al.
Published: (2025)
by: Cao, Bokai, et al.
Published: (2025)
Alpha-GPT 2.0: Human-in-the-Loop AI for Quantitative Investment
by: Yuan, Hang, et al.
Published: (2024)
by: Yuan, Hang, et al.
Published: (2024)
Guided Learning: Lubricating End-to-End Modeling for Multi-stage Decision-making
by: Guo, Jian, et al.
Published: (2024)
by: Guo, Jian, et al.
Published: (2024)
CardioRAG: A Retrieval-Augmented Generation Framework for Multimodal Chagas Disease Detection
by: Shen, Zhengyang, et al.
Published: (2025)
by: Shen, Zhengyang, et al.
Published: (2025)
Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning
by: Yang, Cehao, et al.
Published: (2025)
by: Yang, Cehao, et al.
Published: (2025)
Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented Generation
by: Ma, Shengjie, et al.
Published: (2024)
by: Ma, Shengjie, et al.
Published: (2024)
LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data
by: Yang, Cehao, et al.
Published: (2025)
by: Yang, Cehao, et al.
Published: (2025)
Structured Safety Auditing for Balancing Code Correctness and Content Safety in LLM-Generated Code
by: Tan, Honghao, et al.
Published: (2026)
by: Tan, Honghao, et al.
Published: (2026)
Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs
by: Tan, Hexiang, et al.
Published: (2025)
by: Tan, Hexiang, et al.
Published: (2025)
QuantBench: Benchmarking AI Methods for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2025)
by: Wang, Saizhuo, et al.
Published: (2025)
DSPO: An End-to-End Framework for Direct Sorted Portfolio Construction
by: Zhong, Jianyuan, et al.
Published: (2024)
by: Zhong, Jianyuan, et al.
Published: (2024)
BaseCal: Unsupervised Confidence Calibration via Base Model Signals
by: Tan, Hexiang, et al.
Published: (2026)
by: Tan, Hexiang, et al.
Published: (2026)
RuleRAG: Rule-Guided Retrieval-Augmented Generation with Language Models for Question Answering
by: Chen, Zhongwu, et al.
Published: (2024)
by: Chen, Zhongwu, et al.
Published: (2024)
SQL-R1: Training Natural Language to SQL Reasoning Model By Reinforcement Learning
by: Ma, Peixian, et al.
Published: (2025)
by: Ma, Peixian, et al.
Published: (2025)
PPP2R1A Mutation: A Critical Amplifier for Immune Checkpoint Blockade Therapy Efficacy
by: Yuanzhuo Gu, et al.
Published: (2025)
by: Yuanzhuo Gu, et al.
Published: (2025)
Survey Data on Beginning-End-of-Term Changes in Values of Junior Students Nationally in the Autumn Semester of the Academic Year 2024-2025
by: Wang, Qiong, et al.
Published: (2025)
by: Wang, Qiong, et al.
Published: (2025)
Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
by: Wu, Xiaojun, et al.
Published: (2025)
by: Wu, Xiaojun, et al.
Published: (2025)
Comment on: Prevalence and Determinants of Sarcopenia Among Older Adults in India: Insights From the Longitudinal Aging Study in India
by: Xuehao Huang
Published: (2025)
by: Xuehao Huang
Published: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
by: Tan, Sijun, et al.
Published: (2024)
by: Tan, Sijun, et al.
Published: (2024)
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
by: Shen, Yiyang, et al.
Published: (2026)
by: Shen, Yiyang, et al.
Published: (2026)
Context Graph
by: Xu, Chengjin, et al.
Published: (2024)
by: Xu, Chengjin, et al.
Published: (2024)
LLM-Guided Issue Generation from Uncovered Code Segments
by: Pressato, Diany, et al.
Published: (2026)
by: Pressato, Diany, et al.
Published: (2026)
Chinese Painting Generation With a Stroke‐By‐Stroke Renderer and a Semantic Loss
by: Yuan Ma, et al.
Published: (2025)
by: Yuan Ma, et al.
Published: (2025)
Enhancing Travel Choice Modeling with Large Language Models: A Prompt-Learning Approach
by: Zhai, Xuehao, et al.
Published: (2024)
by: Zhai, Xuehao, et al.
Published: (2024)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
by: Wu, Xiaojun, et al.
Published: (2024)
by: Wu, Xiaojun, et al.
Published: (2024)
Unleashing Expert Opinion from Social Media for Stock Prediction
by: Zhou, Wanyun, et al.
Published: (2025)
by: Zhou, Wanyun, et al.
Published: (2025)
Similar Items
-
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
by: Shi, Zhichao, et al.
Published: (2025) -
On the Evolution of Knowledge Graphs: A Survey and Perspective
by: Jiang, Xuhui, et al.
Published: (2023) -
Unlocking the Power of Large Language Models for Entity Alignment
by: Jiang, Xuhui, et al.
Published: (2024) -
Toward Practical Entity Alignment Method Design: Insights from New Highly Heterogeneous Knowledge Graph Datasets
by: Jiang, Xuhui, et al.
Published: (2023) -
A Survey on Large Language Model Hallucination via a Creativity Perspective
by: Jiang, Xuhui, et al.
Published: (2024)