Halu-J: Critique-Based Hallucination Judge
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Binjie, Chern, Steffi, Chern, Ethan, Liu, Pengfei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
por: Chern, Steffi, et al.
Publicado: (2024)
por: Chern, Steffi, et al.
Publicado: (2024)
BeHonest: Benchmarking Honesty in Large Language Models
por: Chern, Steffi, et al.
Publicado: (2024)
por: Chern, Steffi, et al.
Publicado: (2024)
Combating Adversarial Attacks with Multi-Agent Debate
por: Chern, Steffi, et al.
Publicado: (2024)
por: Chern, Steffi, et al.
Publicado: (2024)
Thinking with Generated Images
por: Chern, Ethan, et al.
Publicado: (2025)
por: Chern, Ethan, et al.
Publicado: (2025)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
por: Chern, Ethan, et al.
Publicado: (2024)
por: Chern, Ethan, et al.
Publicado: (2024)
Alignment for Honesty
por: Yang, Yuqing, et al.
Publicado: (2023)
por: Yang, Yuqing, et al.
Publicado: (2023)
LIMO: Less is More for Reasoning
por: Ye, Yixin, et al.
Publicado: (2025)
por: Ye, Yixin, et al.
Publicado: (2025)
MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models
por: Agarwal, Vibhor, et al.
Publicado: (2024)
por: Agarwal, Vibhor, et al.
Publicado: (2024)
SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
por: Lamba, Naveen, et al.
Publicado: (2025)
por: Lamba, Naveen, et al.
Publicado: (2025)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
por: Chen, Kedi, et al.
Publicado: (2024)
por: Chen, Kedi, et al.
Publicado: (2024)
Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA
por: Lamba, Naveen, et al.
Publicado: (2025)
por: Lamba, Naveen, et al.
Publicado: (2025)
KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual Checking
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
The Critique of Critique
por: Sun, Shichao, et al.
Publicado: (2024)
por: Sun, Shichao, et al.
Publicado: (2024)
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI
por: Huang, Zhen, et al.
Publicado: (2024)
por: Huang, Zhen, et al.
Publicado: (2024)
O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?
por: Huang, Zhen, et al.
Publicado: (2024)
por: Huang, Zhen, et al.
Publicado: (2024)
Reformatted Alignment
por: Fan, Run-Ze, et al.
Publicado: (2024)
por: Fan, Run-Ze, et al.
Publicado: (2024)
Generative AI Act II: Test Time Scaling Drives Cognition Engineering
por: Xia, Shijie, et al.
Publicado: (2025)
por: Xia, Shijie, et al.
Publicado: (2025)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
por: Ma, Yan, et al.
Publicado: (2025)
por: Ma, Yan, et al.
Publicado: (2025)
Detecting Prefix Bias in LLM-based Reward Models
por: Kumar, Ashwin, et al.
Publicado: (2025)
por: Kumar, Ashwin, et al.
Publicado: (2025)
No Need for Explanations: LLMs can implicitly learn from mistakes in-context
por: Alazraki, Lisa, et al.
Publicado: (2025)
por: Alazraki, Lisa, et al.
Publicado: (2025)
Think-J: Learning to Think for Generative LLM-as-a-Judge
por: Huang, Hui, et al.
Publicado: (2025)
por: Huang, Hui, et al.
Publicado: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
por: Liu, Yixin, et al.
Publicado: (2025)
por: Liu, Yixin, et al.
Publicado: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
por: Ke, Pei, et al.
Publicado: (2023)
por: Ke, Pei, et al.
Publicado: (2023)
LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation
por: Chern, Ethan, et al.
Publicado: (2025)
por: Chern, Ethan, et al.
Publicado: (2025)
If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs
por: Khalifa, Muhammad, et al.
Publicado: (2024)
por: Khalifa, Muhammad, et al.
Publicado: (2024)
HaluMem: Evaluating Hallucinations in Memory Systems of Agents
por: Chen, Ding, et al.
Publicado: (2025)
por: Chen, Ding, et al.
Publicado: (2025)
Debate Helps Weak Judges Reward Stronger Models
por: Elasky, Ethan, et al.
Publicado: (2026)
por: Elasky, Ethan, et al.
Publicado: (2026)
Negotiating with LLMS: Prompt Hacks, Skill Gaps, and Reasoning Deficits
por: Schneider, Johannes, et al.
Publicado: (2023)
por: Schneider, Johannes, et al.
Publicado: (2023)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Hallucination Detection and Hallucination Mitigation: An Investigation
por: Luo, Junliang, et al.
Publicado: (2024)
por: Luo, Junliang, et al.
Publicado: (2024)
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
por: Zhu, Lianghui, et al.
Publicado: (2023)
por: Zhu, Lianghui, et al.
Publicado: (2023)
Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges
por: Thakur, Aman Singh, et al.
Publicado: (2024)
por: Thakur, Aman Singh, et al.
Publicado: (2024)
Neural Probe-Based Hallucination Detection for Large Language Models
por: Liang, Shize, et al.
Publicado: (2025)
por: Liang, Shize, et al.
Publicado: (2025)
JudgeLRM: Large Reasoning Models as a Judge
por: Chen, Nuo, et al.
Publicado: (2025)
por: Chen, Nuo, et al.
Publicado: (2025)
RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning
por: Morandi, Andrea
Publicado: (2026)
por: Morandi, Andrea
Publicado: (2026)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
por: Wang, Yidong, et al.
Publicado: (2025)
por: Wang, Yidong, et al.
Publicado: (2025)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
por: Shi, Lin, et al.
Publicado: (2024)
por: Shi, Lin, et al.
Publicado: (2024)
Agent-as-a-Judge
por: You, Runyang, et al.
Publicado: (2026)
por: You, Runyang, et al.
Publicado: (2026)
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
por: Zhu, Zhiying, et al.
Publicado: (2024)
por: Zhu, Zhiying, et al.
Publicado: (2024)
Ejemplares similares
-
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
por: Chern, Steffi, et al.
Publicado: (2024) -
BeHonest: Benchmarking Honesty in Large Language Models
por: Chern, Steffi, et al.
Publicado: (2024) -
Combating Adversarial Attacks with Multi-Agent Debate
por: Chern, Steffi, et al.
Publicado: (2024) -
Thinking with Generated Images
por: Chern, Ethan, et al.
Publicado: (2025) -
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
por: Chern, Ethan, et al.
Publicado: (2024)