Democratic Preference Alignment via Sortition-Weighted RLHF
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sana, Suvadip, Wu, Jinzhou, Wells, Martin T. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deep Memory Search: A Metaheuristic Approach for Optimizing Heuristic Search
par: Hedar, Abdel-Rahman, et autres
Publié: (2024)
par: Hedar, Abdel-Rahman, et autres
Publié: (2024)
Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings
par: Rathva, Harsh, et autres
Publié: (2025)
par: Rathva, Harsh, et autres
Publié: (2025)
Safe Reinforcement Learning with Preference-based Constraint Inference
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
Market-Alignment Risk in Pricing Agents: Trace Diagnostics and Trace-Prior RL under Hidden Competitor State
par: Zhu, Peiying, et autres
Publié: (2026)
par: Zhu, Peiying, et autres
Publié: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
par: Fadli, Samih
Publié: (2025)
par: Fadli, Samih
Publié: (2025)
Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels
par: Rath, Plawan Kumar, et autres
Publié: (2026)
par: Rath, Plawan Kumar, et autres
Publié: (2026)
Fusing Rewards and Preferences in Reinforcement Learning
par: Khorasani, Sadegh, et autres
Publié: (2025)
par: Khorasani, Sadegh, et autres
Publié: (2025)
Scaling Offline RL via Efficient and Expressive Shortcut Models
par: Espinosa-Dice, Nicolas, et autres
Publié: (2025)
par: Espinosa-Dice, Nicolas, et autres
Publié: (2025)
Axiomatic Characterisations of Sample-based Explainers
par: Amgoud, Leila, et autres
Publié: (2024)
par: Amgoud, Leila, et autres
Publié: (2024)
Mapping representations in Reinforcement Learning via Semantic Alignment for Zero-Shot Stitching
par: Ricciardi, Antonio Pio, et autres
Publié: (2025)
par: Ricciardi, Antonio Pio, et autres
Publié: (2025)
FastForward Pruning: Efficient LLM Pruning via Single-Step Reinforcement Learning
par: Yuan, Xin, et autres
Publié: (2025)
par: Yuan, Xin, et autres
Publié: (2025)
Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction
par: Kohlberger, Björn Roman
Publié: (2026)
par: Kohlberger, Björn Roman
Publié: (2026)
Manipulating Predictions over Discrete Inputs in Machine Teaching
par: Wu, Xiaodong, et autres
Publié: (2024)
par: Wu, Xiaodong, et autres
Publié: (2024)
Model Fusion via Retrofitting
par: Luenam, Phoomraphee, et autres
Publié: (2025)
par: Luenam, Phoomraphee, et autres
Publié: (2025)
Scaling Value Iteration Networks to 5000 Layers for Extreme Long-Term Planning
par: Wang, Yuhui, et autres
Publié: (2024)
par: Wang, Yuhui, et autres
Publié: (2024)
AI Benchmark Democratization and Carpentry
par: von Laszewski, Gregor, et autres
Publié: (2025)
par: von Laszewski, Gregor, et autres
Publié: (2025)
BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking
par: Ustaomeroglu, Muhammed, et autres
Publié: (2026)
par: Ustaomeroglu, Muhammed, et autres
Publié: (2026)
MEReQ: Max-Ent Residual-Q Inverse RL for Sample-Efficient Alignment from Intervention
par: Chen, Yuxin, et autres
Publié: (2024)
par: Chen, Yuxin, et autres
Publié: (2024)
Reducing the Sensitivity of Neural Physics Simulators to Mesh Topology via Pretraining
par: Vaska, Nathan, et autres
Publié: (2025)
par: Vaska, Nathan, et autres
Publié: (2025)
GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control
par: Hiremath, Prakul Sunil
Publié: (2026)
par: Hiremath, Prakul Sunil
Publié: (2026)
CircuitProbe: Predicting Reasoning Circuits in Transformers via Stability Zone Detection
par: Panuganti, Rajkiran
Publié: (2026)
par: Panuganti, Rajkiran
Publié: (2026)
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
par: Zhang, Mingda, et autres
Publié: (2026)
par: Zhang, Mingda, et autres
Publié: (2026)
FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing
par: Kadu, Ankush, et autres
Publié: (2025)
par: Kadu, Ankush, et autres
Publié: (2025)
MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge
par: Lan, Guangchen, et autres
Publié: (2025)
par: Lan, Guangchen, et autres
Publié: (2025)
Fusion-Based Neural Generalization for Predicting Temperature Fields in Industrial PET Preform Heating
par: Alsheikh, Ahmad, et autres
Publié: (2025)
par: Alsheikh, Ahmad, et autres
Publié: (2025)
Fast and Precise: Adjusting Planning Horizon with Adaptive Subgoal Search
par: Zawalski, Michał, et autres
Publié: (2022)
par: Zawalski, Michał, et autres
Publié: (2022)
ParalESN: Enabling parallel information processing in Reservoir Computing
par: Pinna, Matteo, et autres
Publié: (2026)
par: Pinna, Matteo, et autres
Publié: (2026)
Understanding Goal Generalisation in Sequential Reinforcement Learning
par: Brown, Jason Ross, et autres
Publié: (2026)
par: Brown, Jason Ross, et autres
Publié: (2026)
What changes after deployment? A survey on On-device Learning in TinyML
par: Pavan, Massimo, et autres
Publié: (2026)
par: Pavan, Massimo, et autres
Publié: (2026)
Bounded Ratio Reinforcement Learning
par: Ao, Yunke, et autres
Publié: (2026)
par: Ao, Yunke, et autres
Publié: (2026)
Dynamics Reveals Structure: Challenging the Linear Propagation Assumption
par: Chang, Hoyeon, et autres
Publié: (2026)
par: Chang, Hoyeon, et autres
Publié: (2026)
Low-Dimensional Execution Manifolds in Transformer Learning Dynamics: Evidence from Modular Arithmetic Tasks
par: Xu, Yongzhong
Publié: (2026)
par: Xu, Yongzhong
Publié: (2026)
Extending Differential Temporal Difference Methods for Episodic Problems
par: De Asis, Kris, et autres
Publié: (2026)
par: De Asis, Kris, et autres
Publié: (2026)
Architectural Proprioception in State Space Models: Thermodynamic Training Induces Anticipatory Halt Detection
par: Noon, Jay
Publié: (2026)
par: Noon, Jay
Publié: (2026)
Interestingness as an Inductive Heuristic for Future Compression Progress
par: Herrmann, Vincent, et autres
Publié: (2026)
par: Herrmann, Vincent, et autres
Publié: (2026)
Behavior Learning (BL): Learning Hierarchical Optimization Structures from Data
par: Ma, Zhenyao, et autres
Publié: (2026)
par: Ma, Zhenyao, et autres
Publié: (2026)
Superposition Is Not Necessary: A Mechanistic Interpretability Analysis of Transformer Representations for Time Series Forecasting
par: Yıldırım, Alper
Publié: (2026)
par: Yıldırım, Alper
Publié: (2026)
Path-Coupled Bellman Flows for Distributional Reinforcement Learning
par: Xu, Boyang, et autres
Publié: (2026)
par: Xu, Boyang, et autres
Publié: (2026)
TACO: Tackling Over-correction in Federated Learning with Tailored Adaptive Correction
par: Liu, Weijie, et autres
Publié: (2025)
par: Liu, Weijie, et autres
Publié: (2025)
Documents similaires
-
Deep Memory Search: A Metaheuristic Approach for Optimizing Heuristic Search
par: Hedar, Abdel-Rahman, et autres
Publié: (2024) -
Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings
par: Rathva, Harsh, et autres
Publié: (2025) -
Safe Reinforcement Learning with Preference-based Constraint Inference
par: Li, Chenglin, et autres
Publié: (2026) -
Market-Alignment Risk in Pricing Agents: Trace Diagnostics and Trace-Prior RL under Hidden Competitor State
par: Zhu, Peiying, et autres
Publié: (2026) -
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
par: Fadli, Samih
Publié: (2025)