Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Kaishuai, Yu, Tiezheng, Hou, Wenjun, Cheng, Yi, Li, Liangyou, Jiang, Xin, Shang, Lifeng, Liu, Qun, Li, Wenjie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
par: Xu, Kaishuai, et autres
Publié: (2024)
par: Xu, Kaishuai, et autres
Publié: (2024)
RAR$^2$: Retrieval-Augmented Medical Reasoning via Thought-Driven Retrieval
par: Xu, Kaishuai, et autres
Publié: (2025)
par: Xu, Kaishuai, et autres
Publié: (2025)
Medical Dialogue Generation via Intuitive-then-Analytical Differential Diagnosis
par: Xu, Kaishuai, et autres
Publié: (2024)
par: Xu, Kaishuai, et autres
Publié: (2024)
Reasoning Like a Doctor: Improving Medical Dialogue Systems via Diagnostic Reasoning Process Alignment
par: Xu, Kaishuai, et autres
Publié: (2024)
par: Xu, Kaishuai, et autres
Publié: (2024)
ICON: Improving Inter-Report Consistency in Radiology Report Generation via Lesion-aware Mixup Augmentation
par: Hou, Wenjun, et autres
Publié: (2024)
par: Hou, Wenjun, et autres
Publié: (2024)
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry
par: Hou, Wenjun, et autres
Publié: (2024)
par: Hou, Wenjun, et autres
Publié: (2024)
Learning to Edit: Aligning LLMs with Knowledge Editing
par: Jiang, Yuxin, et autres
Publié: (2024)
par: Jiang, Yuxin, et autres
Publié: (2024)
RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge Injection
par: Hou, Wenjun, et autres
Publié: (2025)
par: Hou, Wenjun, et autres
Publié: (2025)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2024)
par: Kwan, Wai-Chung, et autres
Publié: (2024)
M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2023)
par: Kwan, Wai-Chung, et autres
Publié: (2023)
ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation
par: Zeng, Xingshan, et autres
Publié: (2026)
par: Zeng, Xingshan, et autres
Publié: (2026)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
par: Jiang, Yuxin, et autres
Publié: (2023)
par: Jiang, Yuxin, et autres
Publié: (2023)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
par: Zeng, Xingshan, et autres
Publié: (2025)
par: Zeng, Xingshan, et autres
Publié: (2025)
ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
par: Wang, Zezhong, et autres
Publié: (2024)
par: Wang, Zezhong, et autres
Publié: (2024)
AutoPal: Autonomous Adaptation to Users for Personal AI Companionship
par: Cheng, Yi, et autres
Publié: (2024)
par: Cheng, Yi, et autres
Publié: (2024)
RevisEval: Improving LLM-as-a-Judge via Response-Adapted References
par: Zhang, Qiyuan, et autres
Publié: (2024)
par: Zhang, Qiyuan, et autres
Publié: (2024)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
par: Zeng, Xingshan, et autres
Publié: (2025)
par: Zeng, Xingshan, et autres
Publié: (2025)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
par: Wang, Zezhong, et autres
Publié: (2025)
par: Wang, Zezhong, et autres
Publié: (2025)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
par: Wang, Zezhong, et autres
Publié: (2024)
par: Wang, Zezhong, et autres
Publié: (2024)
Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
par: Zhang, Qiyuan, et autres
Publié: (2025)
par: Zhang, Qiyuan, et autres
Publié: (2025)
No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks
par: Leong, Chak Tou, et autres
Publié: (2024)
par: Leong, Chak Tou, et autres
Publié: (2024)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
par: Zhou, Jiawei, et autres
Publié: (2022)
par: Zhou, Jiawei, et autres
Publié: (2022)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
par: Jiang, Yuxin, et autres
Publié: (2024)
par: Jiang, Yuxin, et autres
Publié: (2024)
Prompt-Based Length Controlled Generation with Multiple Control Types
par: Jie, Renlong, et autres
Publié: (2024)
par: Jie, Renlong, et autres
Publié: (2024)
TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
Multi-Faceted Evaluation of Tool-Augmented Dialogue Systems
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
par: Chen, Jierun, et autres
Publié: (2025)
par: Chen, Jierun, et autres
Publié: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
Gradually Excavating External Knowledge for Implicit Complex Question Answering
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Integrative Decoding: Improve Factuality via Implicit Self-consistency
par: Cheng, Yi, et autres
Publié: (2024)
par: Cheng, Yi, et autres
Publié: (2024)
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
par: Cai, Hongru, et autres
Publié: (2026)
par: Cai, Hongru, et autres
Publié: (2026)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models
par: Tan, Haochen, et autres
Publié: (2024)
par: Tan, Haochen, et autres
Publié: (2024)
UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
par: Jia, Qi, et autres
Publié: (2026)
par: Jia, Qi, et autres
Publié: (2026)
A Multi-Faceted Evaluation Framework for Assessing Synthetic Data Generated by Large Language Models
par: Yuan, Yefeng, et autres
Publié: (2024)
par: Yuan, Yefeng, et autres
Publié: (2024)
PeeriScope: A Multi-Faceted Framework for Evaluating Peer Review Quality
par: Ebrahimi, Sajad, et autres
Publié: (2026)
par: Ebrahimi, Sajad, et autres
Publié: (2026)
Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
par: Chen, Kai, et autres
Publié: (2023)
par: Chen, Kai, et autres
Publié: (2023)
Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment
par: Wang, Haowen, et autres
Publié: (2025)
par: Wang, Haowen, et autres
Publié: (2025)
Documents similaires
-
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
par: Xu, Kaishuai, et autres
Publié: (2024) -
RAR$^2$: Retrieval-Augmented Medical Reasoning via Thought-Driven Retrieval
par: Xu, Kaishuai, et autres
Publié: (2025) -
Medical Dialogue Generation via Intuitive-then-Analytical Differential Diagnosis
par: Xu, Kaishuai, et autres
Publié: (2024) -
Reasoning Like a Doctor: Improving Medical Dialogue Systems via Diagnostic Reasoning Process Alignment
par: Xu, Kaishuai, et autres
Publié: (2024) -
ICON: Improving Inter-Report Consistency in Radiology Report Generation via Lesion-aware Mixup Augmentation
par: Hou, Wenjun, et autres
Publié: (2024)