Scalable Valuation of Human Feedback through Provably Robust Model Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fujisawa, Masahiro, Adachi, Masaki, Osborne, Michael A. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Fixing the Pitfalls of Probabilistic Time-Series Forecasting Evaluation by Kernel Quadrature
von: Adachi, Masaki, et al.
Veröffentlicht: (2025)
von: Adachi, Masaki, et al.
Veröffentlicht: (2025)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
von: Ji, Xiang, et al.
Veröffentlicht: (2024)
von: Ji, Xiang, et al.
Veröffentlicht: (2024)
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
von: Zhong, Huiying, et al.
Veröffentlicht: (2024)
von: Zhong, Huiying, et al.
Veröffentlicht: (2024)
Scalable, Explainable and Provably Robust Anomaly Detection with One-Step Flow Matching
von: Li, Zhong, et al.
Veröffentlicht: (2025)
von: Li, Zhong, et al.
Veröffentlicht: (2025)
Scalable Property Valuation Models via Graph-based Deep Learning
von: Riveros, Enrique, et al.
Veröffentlicht: (2024)
von: Riveros, Enrique, et al.
Veröffentlicht: (2024)
Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles
von: Tang, Zhiwei, et al.
Veröffentlicht: (2023)
von: Tang, Zhiwei, et al.
Veröffentlicht: (2023)
Understanding the Learning Dynamics of Alignment with Human Feedback
von: Im, Shawn, et al.
Veröffentlicht: (2024)
von: Im, Shawn, et al.
Veröffentlicht: (2024)
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
von: Chen, Tiejin, et al.
Veröffentlicht: (2026)
von: Chen, Tiejin, et al.
Veröffentlicht: (2026)
Provably Robust Adaptation for Language-Empowered Foundation Models
von: Lai, Yuni, et al.
Veröffentlicht: (2025)
von: Lai, Yuni, et al.
Veröffentlicht: (2025)
Provably Robust Bayesian Counterfactual Explanations under Model Changes
von: Duell, Jamie, et al.
Veröffentlicht: (2026)
von: Duell, Jamie, et al.
Veröffentlicht: (2026)
Provable Robust Saliency-based Explanations
von: Chen, Chao, et al.
Veröffentlicht: (2022)
von: Chen, Chao, et al.
Veröffentlicht: (2022)
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
RLTHF: Targeted Human Feedback for LLM Alignment
von: Xu, Yifei, et al.
Veröffentlicht: (2025)
von: Xu, Yifei, et al.
Veröffentlicht: (2025)
Human Alignment of Large Language Models through Online Preference Optimisation
von: Calandriello, Daniele, et al.
Veröffentlicht: (2024)
von: Calandriello, Daniele, et al.
Veröffentlicht: (2024)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
von: Ye, Kai, et al.
Veröffentlicht: (2025)
von: Ye, Kai, et al.
Veröffentlicht: (2025)
Provable Interactive Learning with Hindsight Instruction Feedback
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
Test-time Adaptation for Regression by Subspace Alignment
von: Adachi, Kazuki, et al.
Veröffentlicht: (2024)
von: Adachi, Kazuki, et al.
Veröffentlicht: (2024)
DeRDaVa: Deletion-Robust Data Valuation for Machine Learning
von: Tian, Xiao, et al.
Veröffentlicht: (2023)
von: Tian, Xiao, et al.
Veröffentlicht: (2023)
Adaptive Scoring and Thresholding with Human Feedback for Robust Out-of-Distribution Detection
von: Yamada, Daisuke, et al.
Veröffentlicht: (2025)
von: Yamada, Daisuke, et al.
Veröffentlicht: (2025)
Provably Robust and Plausible Counterfactual Explanations for Neural Networks via Robust Optimisation
von: Jiang, Junqi, et al.
Veröffentlicht: (2023)
von: Jiang, Junqi, et al.
Veröffentlicht: (2023)
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
von: Yang, Zhiqin, et al.
Veröffentlicht: (2026)
von: Yang, Zhiqin, et al.
Veröffentlicht: (2026)
Distributionally Robust Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
Measuring How LLMs Internalize Human Psychological Concepts: A preliminary analysis
von: Hamada, Hiro Taiyo, et al.
Veröffentlicht: (2025)
von: Hamada, Hiro Taiyo, et al.
Veröffentlicht: (2025)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
von: Sun, Zhiqing, et al.
Veröffentlicht: (2024)
von: Sun, Zhiqing, et al.
Veröffentlicht: (2024)
Eigen-Value: Efficient Domain-Robust Data Valuation via Eigenvalue-Based Approach
von: Choi, Youngjun, et al.
Veröffentlicht: (2025)
von: Choi, Youngjun, et al.
Veröffentlicht: (2025)
Axioms for AI Alignment from Human Feedback
von: Ge, Luise, et al.
Veröffentlicht: (2024)
von: Ge, Luise, et al.
Veröffentlicht: (2024)
Signs Beat Floats: Low-Rank Double-Binary Adaptation for On-Device Fine-Tuning
von: Fujisawa, Yoshihiko, et al.
Veröffentlicht: (2026)
von: Fujisawa, Yoshihiko, et al.
Veröffentlicht: (2026)
Data Valuation and Selection in a Federated Model Marketplace
von: Li, Wenqian, et al.
Veröffentlicht: (2025)
von: Li, Wenqian, et al.
Veröffentlicht: (2025)
Provably Robust Pre-Trained Ensembles for Biomarker-Based Cancer Classification
von: Lee, Chongmin, et al.
Veröffentlicht: (2024)
von: Lee, Chongmin, et al.
Veröffentlicht: (2024)
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback
von: Xiong, Guojun, et al.
Veröffentlicht: (2024)
von: Xiong, Guojun, et al.
Veröffentlicht: (2024)
Doubly Robust Alignment for Large Language Models
von: Xu, Erhan, et al.
Veröffentlicht: (2025)
von: Xu, Erhan, et al.
Veröffentlicht: (2025)
Is Data Valuation Learnable and Interpretable?
von: Wu, Ou, et al.
Veröffentlicht: (2024)
von: Wu, Ou, et al.
Veröffentlicht: (2024)
Provable Robust Overfitting Mitigation in Wasserstein Distributionally Robust Optimization
von: Liu, Shuang, et al.
Veröffentlicht: (2025)
von: Liu, Shuang, et al.
Veröffentlicht: (2025)
Fast-DataShapley: Neural Modeling for Training Data Valuation
von: Sun, Haifeng, et al.
Veröffentlicht: (2025)
von: Sun, Haifeng, et al.
Veröffentlicht: (2025)
Beyond Models! Explainable Data Valuation and Metric Adaption for Recommendation
von: Jia, Renqi, et al.
Veröffentlicht: (2025)
von: Jia, Renqi, et al.
Veröffentlicht: (2025)
Triadic-OCD: Asynchronous Online Change Detection with Provable Robustness, Optimality, and Convergence
von: Huang, Yancheng, et al.
Veröffentlicht: (2024)
von: Huang, Yancheng, et al.
Veröffentlicht: (2024)
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
von: Li, Yining, et al.
Veröffentlicht: (2026)
von: Li, Yining, et al.
Veröffentlicht: (2026)
Prompt Optimization with Human Feedback
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024)
Norm Anchors Make Model Edits Last
von: Liu, Mingda, et al.
Veröffentlicht: (2026)
von: Liu, Mingda, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Fixing the Pitfalls of Probabilistic Time-Series Forecasting Evaluation by Kernel Quadrature
von: Adachi, Masaki, et al.
Veröffentlicht: (2025) -
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
von: Ji, Xiang, et al.
Veröffentlicht: (2024) -
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
von: Zhong, Huiying, et al.
Veröffentlicht: (2024) -
Scalable, Explainable and Provably Robust Anomaly Detection with One-Step Flow Matching
von: Li, Zhong, et al.
Veröffentlicht: (2025) -
Scalable Property Valuation Models via Graph-based Deep Learning
von: Riveros, Enrique, et al.
Veröffentlicht: (2024)