Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Oprea, Simona-Vasilica, Bâra, Adela |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A phenotype-driven and evidence-governed framework for knowledge graph enrichment and hypotheses discovery in population data
par: Bâra, Adela, et autres
Publié: (2026)
par: Bâra, Adela, et autres
Publié: (2026)
Generative-AI and the transformation of workforce. A job postings-driven analysis
par: Popa, Diana Maria, et autres
Publié: (2026)
par: Popa, Diana Maria, et autres
Publié: (2026)
CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing
par: Dobrita, Gabriela, et autres
Publié: (2026)
par: Dobrita, Gabriela, et autres
Publié: (2026)
Think it, Run it: Autonomous ML pipeline generation via self-healing multi-agent AI
par: Bara, Adela, et autres
Publié: (2026)
par: Bara, Adela, et autres
Publié: (2026)
Measuring the Fragility of Trust: Devising Credibility Index via Explanation Stability (CIES) for Business Decision Support Systems
par: Vaduva, Alin-Gabriel, et autres
Publié: (2026)
par: Vaduva, Alin-Gabriel, et autres
Publié: (2026)
Are we still able to recognize pearls? Machine-driven peer review and the risk to creativity: An explainable RAG-XAI detection framework with markers extraction
par: Văduva, Alin-Gabriel, et autres
Publié: (2026)
par: Văduva, Alin-Gabriel, et autres
Publié: (2026)
Embedding the weather prediction errors (WPE) into the photovoltaic (PV) forecasting method using deep learning
par: Adela Bâra, et autres
Publié: (2024)
par: Adela Bâra, et autres
Publié: (2024)
Is Reading an Upstream Predictor of Science and Mathematics Achievements in PISA? A Bayesian Network Analysis for Policy Educational Interventions on Socio‐Economic Dispersion and Gender Gaps
par: Simona‐Vasilica Oprea, et autres
Publié: (2026)
par: Simona‐Vasilica Oprea, et autres
Publié: (2026)
Trading Strategies on Local Electricity Markets Using Agent‐Based Modelling and Reinforcement Learning: Vectors to Expand Energy Communities
par: Adela Bâra, et autres
Publié: (2026)
par: Adela Bâra, et autres
Publié: (2026)
AI-Augmented Bibliometric Framework: A Paradigm Shift with Agentic AI for Dynamic, Snippet-Based Research Analysis
par: Bara, Adela, et autres
Publié: (2025)
par: Bara, Adela, et autres
Publié: (2025)
A conceptual meta‐level digital twin architecture for energy communities in Romania and other ex‐communist countries
par: Simona‐Vasilica Oprea, et autres
Publié: (2025)
par: Simona‐Vasilica Oprea, et autres
Publié: (2025)
Charting the course: America's energy crossroads and the quest for a sustainable future
par: Simona‐Vasilica Oprea, et autres
Publié: (2024)
par: Simona‐Vasilica Oprea, et autres
Publié: (2024)
MOSLIM:Align with diverse preferences in prompts through reward classification
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Generative-AI and the transformation of workforce. A job postings-driven analysis
par: Popa, Diana Maria, et autres
Publié: (2026)
par: Popa, Diana Maria, et autres
Publié: (2026)
A density estimation perspective on learning from pairwise human preferences
par: Dumoulin, Vincent, et autres
Publié: (2023)
par: Dumoulin, Vincent, et autres
Publié: (2023)
Mitigating LLM biases toward spurious social contexts using direct preference optimization
par: Nam, Hyunji, et autres
Publié: (2026)
par: Nam, Hyunji, et autres
Publié: (2026)
Basis Vector Metric: A Method for Robust Open-Ended State Change Detection
par: Oprea, David, et autres
Publié: (2025)
par: Oprea, David, et autres
Publié: (2025)
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
par: Aggarwal, Pranjal, et autres
Publié: (2026)
par: Aggarwal, Pranjal, et autres
Publié: (2026)
Everyone prefers human writers, including AI
par: Haverals, Wouter, et autres
Publié: (2025)
par: Haverals, Wouter, et autres
Publié: (2025)
A closer look at how large language models trust humans: patterns and biases
par: Lerman, Valeria, et autres
Publié: (2025)
par: Lerman, Valeria, et autres
Publié: (2025)
Are skepticism and moderation dominating attitudes toward AI‐based technologies?
par: Simona‐Vasilica Oprea, et autres
Publié: (2024)
par: Simona‐Vasilica Oprea, et autres
Publié: (2024)
Self-supervised Attribute-aware Dynamic Preference Ranking Alignment
par: Yang, Hongyu, et autres
Publié: (2025)
par: Yang, Hongyu, et autres
Publié: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
par: Liu, Shih-Yang, et autres
Publié: (2026)
par: Liu, Shih-Yang, et autres
Publié: (2026)
A word association network methodology for evaluating implicit biases in LLMs compared to humans
par: Abramski, Katherine, et autres
Publié: (2025)
par: Abramski, Katherine, et autres
Publié: (2025)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
par: Shen, Jingyan, et autres
Publié: (2025)
par: Shen, Jingyan, et autres
Publié: (2025)
What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data
par: Movva, Rajiv, et autres
Publié: (2025)
par: Movva, Rajiv, et autres
Publié: (2025)
Multilingual transformer and BERTopic for short text topic modeling: The case of Serbian
par: Medvecki, Darija, et autres
Publié: (2024)
par: Medvecki, Darija, et autres
Publié: (2024)
HelpSteer2: Open-source dataset for training top-performing reward models
par: Wang, Zhilin, et autres
Publié: (2024)
par: Wang, Zhilin, et autres
Publié: (2024)
Defining bias in AI-systems: Biased models are fair models
par: Lindloff, Chiara, et autres
Publié: (2025)
par: Lindloff, Chiara, et autres
Publié: (2025)
TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
par: Qu, Yincen, et autres
Publié: (2025)
par: Qu, Yincen, et autres
Publié: (2025)
RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering
par: Um, Kaehyun, et autres
Publié: (2026)
par: Um, Kaehyun, et autres
Publié: (2026)
KnowPO: Knowledge-aware Preference Optimization for Controllable Knowledge Selection in Retrieval-Augmented Language Models
par: Zhang, Ruizhe, et autres
Publié: (2024)
par: Zhang, Ruizhe, et autres
Publié: (2024)
Comparative Analysis of ChatGPT, GPT-4, and Microsoft Bing Chatbots for GRE Test
par: Abu-Haifa, Mohammad, et autres
Publié: (2023)
par: Abu-Haifa, Mohammad, et autres
Publié: (2023)
Social preferences with unstable interactive reasoning: Large language models in economic trust games
par: Jiamin, Ou, et autres
Publié: (2025)
par: Jiamin, Ou, et autres
Publié: (2025)
Are they human? Detecting large language models by probing human memory constraints
par: Schug, Simon, et autres
Publié: (2026)
par: Schug, Simon, et autres
Publié: (2026)
Meaningless is better: hashing bias-inducing words in LLM prompts improves performance in logical reasoning and statistical learning
par: Chadimová, Milena, et autres
Publié: (2024)
par: Chadimová, Milena, et autres
Publié: (2024)
BLEUBERI: BLEU is a surprisingly effective reward for instruction following
par: Chang, Yapei, et autres
Publié: (2025)
par: Chang, Yapei, et autres
Publié: (2025)
MindScope: Exploring cognitive biases in large language models through Multi-Agent Systems
par: Xie, Zhentao, et autres
Publié: (2024)
par: Xie, Zhentao, et autres
Publié: (2024)
When the LM misunderstood the human chuckled: Analyzing garden path effects in humans and language models
par: Amouyal, Samuel Joseph, et autres
Publié: (2025)
par: Amouyal, Samuel Joseph, et autres
Publié: (2025)
To Bias or Not to Bias: Detecting bias in News with bias-detector
par: Ghosh, Himel, et autres
Publié: (2025)
par: Ghosh, Himel, et autres
Publié: (2025)
Documents similaires
-
A phenotype-driven and evidence-governed framework for knowledge graph enrichment and hypotheses discovery in population data
par: Bâra, Adela, et autres
Publié: (2026) -
Generative-AI and the transformation of workforce. A job postings-driven analysis
par: Popa, Diana Maria, et autres
Publié: (2026) -
CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing
par: Dobrita, Gabriela, et autres
Publié: (2026) -
Think it, Run it: Autonomous ML pipeline generation via self-healing multi-agent AI
par: Bara, Adela, et autres
Publié: (2026) -
Measuring the Fragility of Trust: Devising Credibility Index via Explanation Stability (CIES) for Business Decision Support Systems
par: Vaduva, Alin-Gabriel, et autres
Publié: (2026)