HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Huo, Yifu, Wang, Chenglong, Zhu, Qiren, Xing, Shunjie, Xiao, Tong, Zhang, Chunliang, Liu, Tongran, Zhu, Jinbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LRHP: Learning Representations for Human Preferences via Preference Pairs
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination
di: Zhu, Ziming, et al.
Pubblicazione: (2025)
di: Zhu, Ziming, et al.
Pubblicazione: (2025)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
di: Huo, Yifu, et al.
Pubblicazione: (2026)
di: Huo, Yifu, et al.
Pubblicazione: (2026)
GRAM: A Generative Foundation Reward Model for Reward Generalization
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
Learning Evaluation Models from Large Language Models for Sequence Generation
di: Wang, Chenglong, et al.
Pubblicazione: (2023)
di: Wang, Chenglong, et al.
Pubblicazione: (2023)
Revealing the Parallel Multilingual Learning within Large Language Models
di: Mu, Yongyu, et al.
Pubblicazione: (2024)
di: Mu, Yongyu, et al.
Pubblicazione: (2024)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
di: Zhou, Hang, et al.
Pubblicazione: (2024)
di: Zhou, Hang, et al.
Pubblicazione: (2024)
Hybrid Alignment Training for Large Language Models
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
di: Wang, Chenglong, et al.
Pubblicazione: (2024)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
di: Chang, Kaiyan, et al.
Pubblicazione: (2026)
di: Chang, Kaiyan, et al.
Pubblicazione: (2026)
LoRA-LiteE: A Computationally Efficient Framework for Chatbot Preference-Tuning
di: Yang, Yahe, et al.
Pubblicazione: (2024)
di: Yang, Yahe, et al.
Pubblicazione: (2024)
SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
di: Wang, Chenglong, et al.
Pubblicazione: (2026)
di: Wang, Chenglong, et al.
Pubblicazione: (2026)
Med-HEAL: Analyzing and Mitigating Hallucinations in Medical LLMs with Hallucination-Aware In-Context Learning
di: Liao, Yiming, et al.
Pubblicazione: (2026)
di: Liao, Yiming, et al.
Pubblicazione: (2026)
Efficient Prompting Methods for Large Language Models: A Survey
di: Chang, Kaiyan, et al.
Pubblicazione: (2024)
di: Chang, Kaiyan, et al.
Pubblicazione: (2024)
Harnessing LLMs for API Interactions: A Framework for Classification and Synthetic Data Generation
di: Tao, Chunliang, et al.
Pubblicazione: (2024)
di: Tao, Chunliang, et al.
Pubblicazione: (2024)
Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework
di: Jin, Jiandong, et al.
Pubblicazione: (2024)
di: Jin, Jiandong, et al.
Pubblicazione: (2024)
GHI: Graphormer over Conditioned Hypergraph Incidence for Aspect-Based Sentiment Analysis
di: Du, Yu, et al.
Pubblicazione: (2026)
di: Du, Yu, et al.
Pubblicazione: (2026)
Towards Resilient and Efficient LLMs: A Comparative Study of Efficiency, Performance, and Adversarial Robustness
di: Fan, Xiaojing, et al.
Pubblicazione: (2024)
di: Fan, Xiaojing, et al.
Pubblicazione: (2024)
Revisiting Interpolation Augmentation for Speech-to-Text Generation
di: Xu, Chen, et al.
Pubblicazione: (2024)
di: Xu, Chen, et al.
Pubblicazione: (2024)
A Hypothesis-Driven Framework for the Analysis of Self-Rationalising Models
di: Braun, Marc, et al.
Pubblicazione: (2024)
di: Braun, Marc, et al.
Pubblicazione: (2024)
Enhancing the Preference Extractor in Multi-turn Dialogues: From Annotating Disasters to Accurate Preference Extraction
di: Wang, Cheng, et al.
Pubblicazione: (2025)
di: Wang, Cheng, et al.
Pubblicazione: (2025)
RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment
di: Luo, Yingfeng, et al.
Pubblicazione: (2026)
di: Luo, Yingfeng, et al.
Pubblicazione: (2026)
Think While You Write: Hypothesis Verification Promotes Faithful Knowledge-to-Text Generation
di: Qiu, Yifu, et al.
Pubblicazione: (2023)
di: Qiu, Yifu, et al.
Pubblicazione: (2023)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
di: Zhang, Hanning, et al.
Pubblicazione: (2025)
di: Zhang, Hanning, et al.
Pubblicazione: (2025)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
KRAIL: A Knowledge-Driven Framework for Base Human Reliability Analysis Integrating IDHEAS and Large Language Models
di: Xiao, Xingyu, et al.
Pubblicazione: (2024)
di: Xiao, Xingyu, et al.
Pubblicazione: (2024)
Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
di: Chang, Kaiyan, et al.
Pubblicazione: (2025)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
di: Wang, Yilin, et al.
Pubblicazione: (2026)
di: Wang, Yilin, et al.
Pubblicazione: (2026)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
ChronoPlay: A Framework for Modeling Dual Dynamics and Authenticity in Game RAG Benchmarks
di: He, Liyang, et al.
Pubblicazione: (2025)
di: He, Liyang, et al.
Pubblicazione: (2025)
On the Emotion Understanding of Synthesized Speech
di: Ge, Yuan, et al.
Pubblicazione: (2026)
di: Ge, Yuan, et al.
Pubblicazione: (2026)
SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
di: Ge, Yuan, et al.
Pubblicazione: (2025)
di: Ge, Yuan, et al.
Pubblicazione: (2025)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
di: Mu, Yongyu, et al.
Pubblicazione: (2026)
di: Mu, Yongyu, et al.
Pubblicazione: (2026)
FormulaReasoning: A Dataset for Formula-Based Numerical Reasoning
di: Li, Xiao, et al.
Pubblicazione: (2024)
di: Li, Xiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LRHP: Learning Representations for Human Preferences via Preference Pairs
di: Wang, Chenglong, et al.
Pubblicazione: (2024) -
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
di: Wang, Chenglong, et al.
Pubblicazione: (2025) -
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
di: Wang, Chenglong, et al.
Pubblicazione: (2024) -
LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination
di: Zhu, Ziming, et al.
Pubblicazione: (2025) -
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
di: Huo, Yifu, et al.
Pubblicazione: (2026)