Scalable Valuation of Human Feedback through Provably Robust Model Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Fujisawa, Masahiro, Adachi, Masaki, Osborne, Michael A. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fixing the Pitfalls of Probabilistic Time-Series Forecasting Evaluation by Kernel Quadrature
di: Adachi, Masaki, et al.
Pubblicazione: (2025)
di: Adachi, Masaki, et al.
Pubblicazione: (2025)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
di: Ji, Xiang, et al.
Pubblicazione: (2024)
di: Ji, Xiang, et al.
Pubblicazione: (2024)
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
di: Zhong, Huiying, et al.
Pubblicazione: (2024)
di: Zhong, Huiying, et al.
Pubblicazione: (2024)
Scalable, Explainable and Provably Robust Anomaly Detection with One-Step Flow Matching
di: Li, Zhong, et al.
Pubblicazione: (2025)
di: Li, Zhong, et al.
Pubblicazione: (2025)
Scalable Property Valuation Models via Graph-based Deep Learning
di: Riveros, Enrique, et al.
Pubblicazione: (2024)
di: Riveros, Enrique, et al.
Pubblicazione: (2024)
Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles
di: Tang, Zhiwei, et al.
Pubblicazione: (2023)
di: Tang, Zhiwei, et al.
Pubblicazione: (2023)
Understanding the Learning Dynamics of Alignment with Human Feedback
di: Im, Shawn, et al.
Pubblicazione: (2024)
di: Im, Shawn, et al.
Pubblicazione: (2024)
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
di: Chen, Tiejin, et al.
Pubblicazione: (2026)
di: Chen, Tiejin, et al.
Pubblicazione: (2026)
Provably Robust Adaptation for Language-Empowered Foundation Models
di: Lai, Yuni, et al.
Pubblicazione: (2025)
di: Lai, Yuni, et al.
Pubblicazione: (2025)
Provably Robust Bayesian Counterfactual Explanations under Model Changes
di: Duell, Jamie, et al.
Pubblicazione: (2026)
di: Duell, Jamie, et al.
Pubblicazione: (2026)
Provable Robust Saliency-based Explanations
di: Chen, Chao, et al.
Pubblicazione: (2022)
di: Chen, Chao, et al.
Pubblicazione: (2022)
Corruption Robust Offline Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
RLTHF: Targeted Human Feedback for LLM Alignment
di: Xu, Yifei, et al.
Pubblicazione: (2025)
di: Xu, Yifei, et al.
Pubblicazione: (2025)
Human Alignment of Large Language Models through Online Preference Optimisation
di: Calandriello, Daniele, et al.
Pubblicazione: (2024)
di: Calandriello, Daniele, et al.
Pubblicazione: (2024)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025)
di: Ye, Kai, et al.
Pubblicazione: (2025)
Provable Interactive Learning with Hindsight Instruction Feedback
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
di: Misra, Dipendra, et al.
Pubblicazione: (2024)
Test-time Adaptation for Regression by Subspace Alignment
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
DeRDaVa: Deletion-Robust Data Valuation for Machine Learning
di: Tian, Xiao, et al.
Pubblicazione: (2023)
di: Tian, Xiao, et al.
Pubblicazione: (2023)
Adaptive Scoring and Thresholding with Human Feedback for Robust Out-of-Distribution Detection
di: Yamada, Daisuke, et al.
Pubblicazione: (2025)
di: Yamada, Daisuke, et al.
Pubblicazione: (2025)
Provably Robust and Plausible Counterfactual Explanations for Neural Networks via Robust Optimisation
di: Jiang, Junqi, et al.
Pubblicazione: (2023)
di: Jiang, Junqi, et al.
Pubblicazione: (2023)
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
di: Yang, Zhiqin, et al.
Pubblicazione: (2026)
di: Yang, Zhiqin, et al.
Pubblicazione: (2026)
Distributionally Robust Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2025)
di: Mandal, Debmalya, et al.
Pubblicazione: (2025)
Measuring How LLMs Internalize Human Psychological Concepts: A preliminary analysis
di: Hamada, Hiro Taiyo, et al.
Pubblicazione: (2025)
di: Hamada, Hiro Taiyo, et al.
Pubblicazione: (2025)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
di: Sun, Zhiqing, et al.
Pubblicazione: (2024)
di: Sun, Zhiqing, et al.
Pubblicazione: (2024)
Eigen-Value: Efficient Domain-Robust Data Valuation via Eigenvalue-Based Approach
di: Choi, Youngjun, et al.
Pubblicazione: (2025)
di: Choi, Youngjun, et al.
Pubblicazione: (2025)
Axioms for AI Alignment from Human Feedback
di: Ge, Luise, et al.
Pubblicazione: (2024)
di: Ge, Luise, et al.
Pubblicazione: (2024)
Signs Beat Floats: Low-Rank Double-Binary Adaptation for On-Device Fine-Tuning
di: Fujisawa, Yoshihiko, et al.
Pubblicazione: (2026)
di: Fujisawa, Yoshihiko, et al.
Pubblicazione: (2026)
Data Valuation and Selection in a Federated Model Marketplace
di: Li, Wenqian, et al.
Pubblicazione: (2025)
di: Li, Wenqian, et al.
Pubblicazione: (2025)
Provably Robust Pre-Trained Ensembles for Biomarker-Based Cancer Classification
di: Lee, Chongmin, et al.
Pubblicazione: (2024)
di: Lee, Chongmin, et al.
Pubblicazione: (2024)
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback
di: Xiong, Guojun, et al.
Pubblicazione: (2024)
di: Xiong, Guojun, et al.
Pubblicazione: (2024)
Doubly Robust Alignment for Large Language Models
di: Xu, Erhan, et al.
Pubblicazione: (2025)
di: Xu, Erhan, et al.
Pubblicazione: (2025)
Is Data Valuation Learnable and Interpretable?
di: Wu, Ou, et al.
Pubblicazione: (2024)
di: Wu, Ou, et al.
Pubblicazione: (2024)
Provable Robust Overfitting Mitigation in Wasserstein Distributionally Robust Optimization
di: Liu, Shuang, et al.
Pubblicazione: (2025)
di: Liu, Shuang, et al.
Pubblicazione: (2025)
Fast-DataShapley: Neural Modeling for Training Data Valuation
di: Sun, Haifeng, et al.
Pubblicazione: (2025)
di: Sun, Haifeng, et al.
Pubblicazione: (2025)
Beyond Models! Explainable Data Valuation and Metric Adaption for Recommendation
di: Jia, Renqi, et al.
Pubblicazione: (2025)
di: Jia, Renqi, et al.
Pubblicazione: (2025)
Triadic-OCD: Asynchronous Online Change Detection with Provable Robustness, Optimality, and Convergence
di: Huang, Yancheng, et al.
Pubblicazione: (2024)
di: Huang, Yancheng, et al.
Pubblicazione: (2024)
Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual
di: Li, Yining, et al.
Pubblicazione: (2026)
di: Li, Yining, et al.
Pubblicazione: (2026)
Prompt Optimization with Human Feedback
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2024)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2024)
Norm Anchors Make Model Edits Last
di: Liu, Mingda, et al.
Pubblicazione: (2026)
di: Liu, Mingda, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Fixing the Pitfalls of Probabilistic Time-Series Forecasting Evaluation by Kernel Quadrature
di: Adachi, Masaki, et al.
Pubblicazione: (2025) -
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
di: Ji, Xiang, et al.
Pubblicazione: (2024) -
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
di: Zhong, Huiying, et al.
Pubblicazione: (2024) -
Scalable, Explainable and Provably Robust Anomaly Detection with One-Step Flow Matching
di: Li, Zhong, et al.
Pubblicazione: (2025) -
Scalable Property Valuation Models via Graph-based Deep Learning
di: Riveros, Enrique, et al.
Pubblicazione: (2024)