Direct Judgement Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Peifeng, Xu, Austin, Zhou, Yilun, Xiong, Caiming, Joty, Shafiq |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
di: Zhou, Yilun, et al.
Pubblicazione: (2025)
di: Zhou, Yilun, et al.
Pubblicazione: (2025)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
di: Zhou, Yefan, et al.
Pubblicazione: (2025)
di: Zhou, Yefan, et al.
Pubblicazione: (2025)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
di: Zhou, Yefan, et al.
Pubblicazione: (2026)
di: Zhou, Yefan, et al.
Pubblicazione: (2026)
On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
di: Singh, Janvijay, et al.
Pubblicazione: (2025)
di: Singh, Janvijay, et al.
Pubblicazione: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
di: Li, Chuyuan, et al.
Pubblicazione: (2025)
di: Li, Chuyuan, et al.
Pubblicazione: (2025)
MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2025)
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2025)
Preference Optimization for Reasoning with Pseudo Feedback
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)
Demystifying Domain-adaptive Post-training for Financial LLMs
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
ReIFE: Re-evaluating Instruction-Following Evaluation
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
ChatGPT's One-year Anniversary: Are Open-Source Large Language Models Catching up?
di: Chen, Hailin, et al.
Pubblicazione: (2023)
di: Chen, Hailin, et al.
Pubblicazione: (2023)
References Improve LLM Alignment in Non-Verifiable Domains
di: Shi, Kejian, et al.
Pubblicazione: (2026)
di: Shi, Kejian, et al.
Pubblicazione: (2026)
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks
di: Ke, Zixuan, et al.
Pubblicazione: (2026)
di: Ke, Zixuan, et al.
Pubblicazione: (2026)
Unsupervised Summarization Re-ranking
di: Ravaut, Mathieu, et al.
Pubblicazione: (2022)
di: Ravaut, Mathieu, et al.
Pubblicazione: (2022)
Shared Imagination: LLMs Hallucinate Alike
di: Zhou, Yilun, et al.
Pubblicazione: (2024)
di: Zhou, Yilun, et al.
Pubblicazione: (2024)
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
di: Ming, Yifei, et al.
Pubblicazione: (2024)
di: Ming, Yifei, et al.
Pubblicazione: (2024)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
di: Ravaut, Mathieu, et al.
Pubblicazione: (2024)
di: Ravaut, Mathieu, et al.
Pubblicazione: (2024)
Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2023)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2023)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
di: Kendre, Shrikant, et al.
Pubblicazione: (2025)
di: Kendre, Shrikant, et al.
Pubblicazione: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
NAACL2025 Tutorial: Adaptation of Large Language Models
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
SFR-RAG: Towards Contextually Faithful LLMs
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2024)
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2024)
On Positional Bias of Faithfulness for Long-form Summarization
di: Wan, David, et al.
Pubblicazione: (2024)
di: Wan, David, et al.
Pubblicazione: (2024)
Investigating Factuality in Long-Form Text Generation: The Roles of Self-Known and Self-Unknown
di: Tu, Lifu, et al.
Pubblicazione: (2024)
di: Tu, Lifu, et al.
Pubblicazione: (2024)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
di: Panagopoulou, Artemis, et al.
Pubblicazione: (2023)
di: Panagopoulou, Artemis, et al.
Pubblicazione: (2023)
StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs
di: Chen, Hailin, et al.
Pubblicazione: (2024)
di: Chen, Hailin, et al.
Pubblicazione: (2024)
ParaICL: Towards Parallel In-Context Learning
di: Li, Xingxuan, et al.
Pubblicazione: (2024)
di: Li, Xingxuan, et al.
Pubblicazione: (2024)
On Context Utilization in Summarization with Large Language Models
di: Ravaut, Mathieu, et al.
Pubblicazione: (2023)
di: Ravaut, Mathieu, et al.
Pubblicazione: (2023)
Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation
di: Chen, Hailin, et al.
Pubblicazione: (2023)
di: Chen, Hailin, et al.
Pubblicazione: (2023)
Preference-grounded Token-level Guidance for Language Model Fine-tuning
di: Yang, Shentao, et al.
Pubblicazione: (2023)
di: Yang, Shentao, et al.
Pubblicazione: (2023)
P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
di: Han, Simeng, et al.
Pubblicazione: (2024)
di: Han, Simeng, et al.
Pubblicazione: (2024)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
di: Li, Xingxuan, et al.
Pubblicazione: (2024)
di: Li, Xingxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
di: Zhou, Yilun, et al.
Pubblicazione: (2025) -
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
di: Xu, Austin, et al.
Pubblicazione: (2025) -
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
di: Xu, Austin, et al.
Pubblicazione: (2025) -
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
di: Pandit, Shrey, et al.
Pubblicazione: (2025) -
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
di: Pandit, Shrey, et al.
Pubblicazione: (2025)