Learning Personalized Agents from Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Kaiqu, Kruk, Julia, Qian, Shengyi, Yang, Xianjun, Bi, Shengjie, Yao, Yuanshun, Nie, Shaoliang, Zhang, Mingyang, Liu, Lijuan, Fisac, Jaime Fernández, Zhou, Shuyan, Hosseini, Saghar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Your thoughts tell who you are: Characterize the reasoning patterns of LRMs
di: Chen, Yida, et al.
Pubblicazione: (2025)
di: Chen, Yida, et al.
Pubblicazione: (2025)
Introspective Planning: Aligning Robots' Uncertainty with Inherent Task Ambiguity
di: Liang, Kaiqu, et al.
Pubblicazione: (2024)
di: Liang, Kaiqu, et al.
Pubblicazione: (2024)
RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
Who Plays First? Optimizing the Order of Play in Stackelberg Games with Many Robots
di: Hu, Haimin, et al.
Pubblicazione: (2024)
di: Hu, Haimin, et al.
Pubblicazione: (2024)
Some aspects of symmetry descent
di: Etxebarria, Iñaki García, et al.
Pubblicazione: (2024)
di: Etxebarria, Iñaki García, et al.
Pubblicazione: (2024)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
di: Shen, Wei, et al.
Pubblicazione: (2024)
di: Shen, Wei, et al.
Pubblicazione: (2024)
Human-AI Safety: A Descendant of Generative AI and Control Systems Safety
di: Bajcsy, Andrea, et al.
Pubblicazione: (2024)
di: Bajcsy, Andrea, et al.
Pubblicazione: (2024)
Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Models
di: Phan, Hoang, et al.
Pubblicazione: (2025)
di: Phan, Hoang, et al.
Pubblicazione: (2025)
Dr. Zero: Self-Evolving Search Agents without Training Data
di: Yue, Zhenrui, et al.
Pubblicazione: (2026)
di: Yue, Zhenrui, et al.
Pubblicazione: (2026)
Type I anomaly cancellation revisited
di: Hosseini, Saghar S., et al.
Pubblicazione: (2025)
di: Hosseini, Saghar S., et al.
Pubblicazione: (2025)
On the Cause of Unfairness: A Training Sample Perspective
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
Resistance of an epoxy coating with an organic inhibitor to cathodic disbondment in sea water
di: Nabavian, Saghar
Pubblicazione: (2015)
di: Nabavian, Saghar
Pubblicazione: (2015)
Viscosity CBFs: Bridging the Control Barrier Function and Hamilton-Jacobi Reachability Frameworks in Safe Control Theory
di: Hirsch, Dylan, et al.
Pubblicazione: (2025)
di: Hirsch, Dylan, et al.
Pubblicazione: (2025)
Human Creativity and AI
di: Xie, Shengyi
Pubblicazione: (2025)
di: Xie, Shengyi
Pubblicazione: (2025)
ACC-Collab: An Actor-Critic Approach to Multi-Agent LLM Collaboration
di: Estornell, Andrew, et al.
Pubblicazione: (2024)
di: Estornell, Andrew, et al.
Pubblicazione: (2024)
Nonlinearity, Feedback and Uniform Consistency in Causal Structural Learning
di: Wang, Shuyan
Pubblicazione: (2023)
di: Wang, Shuyan
Pubblicazione: (2023)
Learning to Watermark LLM-generated Text via Reinforcement Learning
di: Xu, Xiaojun, et al.
Pubblicazione: (2024)
di: Xu, Xiaojun, et al.
Pubblicazione: (2024)
Large Language Model Unlearning
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
Versatile Behavior Diffusion for Generalized Traffic Agent Simulation
di: Huang, Zhiyu, et al.
Pubblicazione: (2024)
di: Huang, Zhiyu, et al.
Pubblicazione: (2024)
Markov's Conjecture on integral necklaces
di: Fisac, David
Pubblicazione: (2025)
di: Fisac, David
Pubblicazione: (2025)
Revolución, política y propaganda en la China contemporánea
di: Taciana Fisac
Pubblicazione: (2016)
di: Taciana Fisac
Pubblicazione: (2016)
Markov's conjecture on integral necklaces
di: David Fisac
Pubblicazione: (2025)
di: David Fisac
Pubblicazione: (2025)
¿Traición o innovación? La influencia europea en la creación literaria del escritor chino contemporáneo Yan Lianke
di: Taciana Fisac
Pubblicazione: (2018)
di: Taciana Fisac
Pubblicazione: (2018)
ISAACS: Iterative Soft Adversarial Actor-Critic for Safety
di: Hsu, Kai-Chieh, et al.
Pubblicazione: (2022)
di: Hsu, Kai-Chieh, et al.
Pubblicazione: (2022)
Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space
di: Adler, Saghar, et al.
Pubblicazione: (2023)
di: Adler, Saghar, et al.
Pubblicazione: (2023)
A Minimal Nonlocal Theory of Thixotropic Flow
di: Zolfaghari, Saghar, et al.
Pubblicazione: (2026)
di: Zolfaghari, Saghar, et al.
Pubblicazione: (2026)
Non-local physics-informed neural networks for forward and inverse solutions of granular flows
di: Zolfaghari, Saghar, et al.
Pubblicazione: (2026)
di: Zolfaghari, Saghar, et al.
Pubblicazione: (2026)
MAGICS: Adversarial RL with Minimax Actors Guided by Implicit Critic Stackelberg for Convergent Neural Synthesis of Robot Safety
di: Wang, Justin, et al.
Pubblicazione: (2024)
di: Wang, Justin, et al.
Pubblicazione: (2024)
RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation
di: Park, Chanwoo, et al.
Pubblicazione: (2024)
di: Park, Chanwoo, et al.
Pubblicazione: (2024)
Melancolía, vulnerabilidad y “promesa política”. Campo político y campo psíquico en J. Butler
di: Jesús González Fisac
Pubblicazione: (2022)
di: Jesús González Fisac
Pubblicazione: (2022)
Nuria Sánchez Madrid, Elogio de la razón mundana. Antropología y política en Kant, prólogo de José Luis Villacañas Berlanga, epílogo de Pablo Oyarzun R., Ediciones La Cebra, Madrid/Buenos Aires, 2018, 299 pp.
di: Jesús González Fisac
Pubblicazione: (2022)
di: Jesús González Fisac
Pubblicazione: (2022)
SARDINHA, Diogo. Ordre et temps dans la Philosophie de Foucault. Paris: L’harmattan, 2011
di: Jesús González Fisac
Pubblicazione: (2012)
di: Jesús González Fisac
Pubblicazione: (2012)
Comentário ao artigo "Pensamientos caminados para caminar"
di: Jesús González Fisac
Pubblicazione: (2020)
di: Jesús González Fisac
Pubblicazione: (2020)
La minoría de edad como despotismo de las facultades. Antropología y política en respuesta a la pregunta: ¿qué es ilustración?
di: Jesús González Fisac
Pubblicazione: (2016)
di: Jesús González Fisac
Pubblicazione: (2016)
Personalized Language Modeling from Personalized Human Feedback
di: Li, Xinyu, et al.
Pubblicazione: (2024)
di: Li, Xinyu, et al.
Pubblicazione: (2024)
Fairness Without Harm: An Influence-Guided Active Sampling Approach
di: Pang, Jinlong, et al.
Pubblicazione: (2024)
di: Pang, Jinlong, et al.
Pubblicazione: (2024)
Human-Instruction-Free LLM Self-Alignment with Limited Samples
di: Guo, Hongyi, et al.
Pubblicazione: (2024)
di: Guo, Hongyi, et al.
Pubblicazione: (2024)
An Evaluation Framework for Product Images Background Inpainting based on Human Feedback and Product Consistency
di: Liang, Yuqi, et al.
Pubblicazione: (2024)
di: Liang, Yuqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Your thoughts tell who you are: Characterize the reasoning patterns of LRMs
di: Chen, Yida, et al.
Pubblicazione: (2025) -
Introspective Planning: Aligning Robots' Uncertainty with Inherent Task Ambiguity
di: Liang, Kaiqu, et al.
Pubblicazione: (2024) -
RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation
di: Liang, Kaiqu, et al.
Pubblicazione: (2025) -
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
di: Liang, Kaiqu, et al.
Pubblicazione: (2025) -
Who Plays First? Optimizing the Order of Play in Stackelberg Games with Many Robots
di: Hu, Haimin, et al.
Pubblicazione: (2024)