Enhancing RLHF with Human Gaze Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Galliamov, Karim, Titov, Ivan, Pershin, Ilya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Knowledge Offloading: Decomposing LLMs into Sparse Backbones and Memory Modules
por: Galliamov, Karim, et al.
Publicado: (2026)
por: Galliamov, Karim, et al.
Publicado: (2026)
Refining Joint Text and Source Code Embeddings for Retrieval Task with Parameter-Efficient Fine-Tuning
por: Galliamov, Karim, et al.
Publicado: (2024)
por: Galliamov, Karim, et al.
Publicado: (2024)
[Re] FairDICE: A Fair Tradeoff in Multi-objective Offline RL
por: Adema, Peter, et al.
Publicado: (2026)
por: Adema, Peter, et al.
Publicado: (2026)
Concepts' Information Bottleneck Models
por: Galliamov, Karim, et al.
Publicado: (2026)
por: Galliamov, Karim, et al.
Publicado: (2026)
Influencing Humans to Conform to Preference Models for RLHF
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)
Calibration-Gated LLM Pseudo-Observations for Online Contextual Bandits
por: Pershin, Maksim, et al.
Publicado: (2026)
por: Pershin, Maksim, et al.
Publicado: (2026)
Awareness of uncertainty in classification using a multivariate model and multi-views
por: Kornaev, Alexey, et al.
Publicado: (2024)
por: Kornaev, Alexey, et al.
Publicado: (2024)
Optimal Design for Reward Modeling in RLHF
por: Scheid, Antoine, et al.
Publicado: (2024)
por: Scheid, Antoine, et al.
Publicado: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)
por: Dong, Hanze, et al.
Publicado: (2024)
What's New in My Data? Novelty Exploration via Contrastive Generation
por: Isonuma, Masaru, et al.
Publicado: (2024)
por: Isonuma, Masaru, et al.
Publicado: (2024)
A Descriptive and Normative Theory of Human Beliefs in RLHF
por: Dandekar, Sylee, et al.
Publicado: (2025)
por: Dandekar, Sylee, et al.
Publicado: (2025)
Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models
por: Kyriakou, Athina, et al.
Publicado: (2026)
por: Kyriakou, Athina, et al.
Publicado: (2026)
Learning a Pessimistic Reward Model in RLHF
por: Xu, Yinglun, et al.
Publicado: (2025)
por: Xu, Yinglun, et al.
Publicado: (2025)
SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences
por: Mukherjee, Arpan, et al.
Publicado: (2025)
por: Mukherjee, Arpan, et al.
Publicado: (2025)
Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models
por: Ali, Ameen, et al.
Publicado: (2025)
por: Ali, Ameen, et al.
Publicado: (2025)
Cache & Distil: Optimising API Calls to Large Language Models
por: Ramírez, Guillem, et al.
Publicado: (2023)
por: Ramírez, Guillem, et al.
Publicado: (2023)
Zero-Shot Gaze-based Volumetric Medical Image Segmentation
por: Shmykova, Tatyana, et al.
Publicado: (2025)
por: Shmykova, Tatyana, et al.
Publicado: (2025)
Autoencoding Conditional Neural Processes for Representation Learning
por: Prokhorov, Victor, et al.
Publicado: (2023)
por: Prokhorov, Victor, et al.
Publicado: (2023)
Mitigating Copy Bias in In-Context Learning through Neuron Pruning
por: Ali, Ameen, et al.
Publicado: (2024)
por: Ali, Ameen, et al.
Publicado: (2024)
WPO: Enhancing RLHF with Weighted Preference Optimization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
Mitigating the Alignment Tax of RLHF
por: Lin, Yong, et al.
Publicado: (2023)
por: Lin, Yong, et al.
Publicado: (2023)
Provably Efficient Online RLHF with One-Pass Reward Modeling
por: Li, Long-Fei, et al.
Publicado: (2025)
por: Li, Long-Fei, et al.
Publicado: (2025)
Factored Causal Representation Learning for Robust Reward Modeling in RLHF
por: Yang, Yupei, et al.
Publicado: (2026)
por: Yang, Yupei, et al.
Publicado: (2026)
Finding Culture-Sensitive Neurons in Vision-Language Models
por: Zhao, Xiutian, et al.
Publicado: (2025)
por: Zhao, Xiutian, et al.
Publicado: (2025)
Gaze-Assisted Medical Image Segmentation
por: Khaertdinova, Leila, et al.
Publicado: (2024)
por: Khaertdinova, Leila, et al.
Publicado: (2024)
MaxMin-RLHF: Alignment with Diverse Human Preferences
por: Chakraborty, Souradip, et al.
Publicado: (2024)
por: Chakraborty, Souradip, et al.
Publicado: (2024)
Joint Localization and Activation Editing for Low-Resource Fine-Tuning
por: Lai, Wen, et al.
Publicado: (2025)
por: Lai, Wen, et al.
Publicado: (2025)
Value Imprint: A Technique for Auditing the Human Values Embedded in RLHF Datasets
por: Obi, Ike, et al.
Publicado: (2024)
por: Obi, Ike, et al.
Publicado: (2024)
Towards true discovery of the differential equations
por: Hvatov, Alexander, et al.
Publicado: (2023)
por: Hvatov, Alexander, et al.
Publicado: (2023)
Reward Model Overoptimisation in Iterated RLHF
por: Wolf, Lorenz, et al.
Publicado: (2025)
por: Wolf, Lorenz, et al.
Publicado: (2025)
How to Evaluate Reward Models for RLHF
por: Frick, Evan, et al.
Publicado: (2024)
por: Frick, Evan, et al.
Publicado: (2024)
Policy Filtration for RLHF to Mitigate Noise in Reward Models
por: Zhang, Chuheng, et al.
Publicado: (2024)
por: Zhang, Chuheng, et al.
Publicado: (2024)
ACE-RLHF: Automated Code Evaluation and Socratic Feedback Generation Tool using Large Language Models and Reinforcement Learning with Human Feedback
por: Rahman, Tasnia, et al.
Publicado: (2025)
por: Rahman, Tasnia, et al.
Publicado: (2025)
On a Connection Between Imitation Learning and RLHF
por: Xiao, Teng, et al.
Publicado: (2025)
por: Xiao, Teng, et al.
Publicado: (2025)
Explaining and Preventing Alignment Collapse in Iterative RLHF
por: Gauthier, Etienne, et al.
Publicado: (2026)
por: Gauthier, Etienne, et al.
Publicado: (2026)
Offline Constrained RLHF with Multiple Preference Oracles
por: Latham, Brenden, et al.
Publicado: (2026)
por: Latham, Brenden, et al.
Publicado: (2026)
Understanding and Alleviating Memory Consumption in RLHF for LLMs
por: Zhou, Jin, et al.
Publicado: (2024)
por: Zhou, Jin, et al.
Publicado: (2024)
On The Global Convergence Of Online RLHF With Neural Parametrization
por: Gaur, Mudit, et al.
Publicado: (2024)
por: Gaur, Mudit, et al.
Publicado: (2024)
Unifying Stable Optimization and Reference Regularization in RLHF
por: He, Li, et al.
Publicado: (2026)
por: He, Li, et al.
Publicado: (2026)
Towards a Theoretical Understanding to the Generalization of RLHF
por: Li, Zhaochun, et al.
Publicado: (2026)
por: Li, Zhaochun, et al.
Publicado: (2026)
Ejemplares similares
-
Knowledge Offloading: Decomposing LLMs into Sparse Backbones and Memory Modules
por: Galliamov, Karim, et al.
Publicado: (2026) -
Refining Joint Text and Source Code Embeddings for Retrieval Task with Parameter-Efficient Fine-Tuning
por: Galliamov, Karim, et al.
Publicado: (2024) -
[Re] FairDICE: A Fair Tradeoff in Multi-objective Offline RL
por: Adema, Peter, et al.
Publicado: (2026) -
Concepts' Information Bottleneck Models
por: Galliamov, Karim, et al.
Publicado: (2026) -
Influencing Humans to Conform to Preference Models for RLHF
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2025)