Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gao, Songyang, Ge, Qiming, Shen, Wei, Dou, Shihan, Ye, Junjie, Wang, Xiao, Zheng, Rui, Zou, Yicheng, Chen, Zhi, Yan, Hang, Zhang, Qi, Lin, Dahua |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
von: Ge, Qiming, et al.
Veröffentlicht: (2025)
von: Ge, Qiming, et al.
Veröffentlicht: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
von: Xia, Han, et al.
Veröffentlicht: (2024)
von: Xia, Han, et al.
Veröffentlicht: (2024)
CombAlign: Enhancing Model Expressiveness in Unsupervised Graph Alignment
von: Chen, Songyang, et al.
Veröffentlicht: (2024)
von: Chen, Songyang, et al.
Veröffentlicht: (2024)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
von: Liao, Huan, et al.
Veröffentlicht: (2024)
von: Liao, Huan, et al.
Veröffentlicht: (2024)
Towards Effective and Efficient Graph Alignment without Supervision
von: Chen, Songyang, et al.
Veröffentlicht: (2026)
von: Chen, Songyang, et al.
Veröffentlicht: (2026)
AlignSurvey: A Comprehensive Benchmark for Human Preferences Alignment in Social Surveys
von: Lin, Chenxi, et al.
Veröffentlicht: (2025)
von: Lin, Chenxi, et al.
Veröffentlicht: (2025)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
von: Bao, Rong, et al.
Veröffentlicht: (2024)
von: Bao, Rong, et al.
Veröffentlicht: (2024)
HPS: Hard Preference Sampling for Human Preference Alignment
von: Zou, Xiandong, et al.
Veröffentlicht: (2025)
von: Zou, Xiandong, et al.
Veröffentlicht: (2025)
Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management
von: Wang, Yanan, et al.
Veröffentlicht: (2026)
von: Wang, Yanan, et al.
Veröffentlicht: (2026)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2025)
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2025)
Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction
von: Chen, Xu, et al.
Veröffentlicht: (2026)
von: Chen, Xu, et al.
Veröffentlicht: (2026)
Contrastive Preference Learning: Learning from Human Feedback without RL
von: Hejna, Joey, et al.
Veröffentlicht: (2023)
von: Hejna, Joey, et al.
Veröffentlicht: (2023)
Model-based Preference Optimization in Abstractive Summarization without Human Feedback
von: Choi, Jaepill, et al.
Veröffentlicht: (2024)
von: Choi, Jaepill, et al.
Veröffentlicht: (2024)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
von: Chen, Boyuan, et al.
Veröffentlicht: (2025)
von: Chen, Boyuan, et al.
Veröffentlicht: (2025)
Beyond Ordinal Preferences: Why Alignment Needs Cardinal Human Feedback
von: Whitfill, Parker, et al.
Veröffentlicht: (2025)
von: Whitfill, Parker, et al.
Veröffentlicht: (2025)
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
von: Zhang, Yecheng, et al.
Veröffentlicht: (2026)
von: Zhang, Yecheng, et al.
Veröffentlicht: (2026)
MetaRM: Shifted Distributions Alignment via Meta-Learning
von: Dou, Shihan, et al.
Veröffentlicht: (2024)
von: Dou, Shihan, et al.
Veröffentlicht: (2024)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
von: Xu, Nuo, et al.
Veröffentlicht: (2024)
von: Xu, Nuo, et al.
Veröffentlicht: (2024)
ClinAlign: Scaling Healthcare Alignment from Clinician Preference
von: Lyu, Shiwei, et al.
Veröffentlicht: (2026)
von: Lyu, Shiwei, et al.
Veröffentlicht: (2026)
Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering
von: Yang, Hongyu, et al.
Veröffentlicht: (2024)
von: Yang, Hongyu, et al.
Veröffentlicht: (2024)
Aligning MLLM Benchmark With Human Preferences via Structural Equation Modeling
von: Xiong, Shengwu., et al.
Veröffentlicht: (2025)
von: Xiong, Shengwu., et al.
Veröffentlicht: (2025)
AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference
von: Han, Yang, et al.
Veröffentlicht: (2024)
von: Han, Yang, et al.
Veröffentlicht: (2024)
SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
von: Xia, Wei, et al.
Veröffentlicht: (2025)
von: Xia, Wei, et al.
Veröffentlicht: (2025)
Axioms for AI Alignment from Human Feedback
von: Ge, Luise, et al.
Veröffentlicht: (2024)
von: Ge, Luise, et al.
Veröffentlicht: (2024)
Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey
von: Winata, Genta Indra, et al.
Veröffentlicht: (2024)
von: Winata, Genta Indra, et al.
Veröffentlicht: (2024)
Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences
von: Bahng, Hyojin, et al.
Veröffentlicht: (2025)
von: Bahng, Hyojin, et al.
Veröffentlicht: (2025)
SpeechAlign: Aligning Speech Generation to Human Preferences
von: Zhang, Dong, et al.
Veröffentlicht: (2024)
von: Zhang, Dong, et al.
Veröffentlicht: (2024)
Navigating the OverKill in Large Language Models
von: Shi, Chenyu, et al.
Veröffentlicht: (2024)
von: Shi, Chenyu, et al.
Veröffentlicht: (2024)
Fake Alignment: Are LLMs Really Aligned Well?
von: Wang, Yixu, et al.
Veröffentlicht: (2023)
von: Wang, Yixu, et al.
Veröffentlicht: (2023)
Learning to Align Human Code Preferences
von: Yin, Xin, et al.
Veröffentlicht: (2025)
von: Yin, Xin, et al.
Veröffentlicht: (2025)
Aligning Audio Captions with Human Preferences
von: Hegde, Kartik, et al.
Veröffentlicht: (2025)
von: Hegde, Kartik, et al.
Veröffentlicht: (2025)
DPO-F+: Aligning Code Repair Feedback with Developers' Preferences
von: Fang, Zihan, et al.
Veröffentlicht: (2025)
von: Fang, Zihan, et al.
Veröffentlicht: (2025)
Aligning Crowd Feedback via Distributional Preference Reward Modeling
von: Li, Dexun, et al.
Veröffentlicht: (2024)
von: Li, Dexun, et al.
Veröffentlicht: (2024)
A Neural Network Framework for Discovering Closed-form Solutions to Quadratic Programs with Linear Constraints
von: Beylunioglu, Fuat Can, et al.
Veröffentlicht: (2025)
von: Beylunioglu, Fuat Can, et al.
Veröffentlicht: (2025)
Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
von: Yang, Kai, et al.
Veröffentlicht: (2023)
von: Yang, Kai, et al.
Veröffentlicht: (2023)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
von: Liang, Ziqi, et al.
Veröffentlicht: (2024)
von: Liang, Ziqi, et al.
Veröffentlicht: (2024)
Integrating Physician Diagnostic Logic into Large Language Models: Preference Learning from Process Feedback
von: Dou, Chengfeng, et al.
Veröffentlicht: (2024)
von: Dou, Chengfeng, et al.
Veröffentlicht: (2024)
RefAlign: Representation Alignment for Reference-to-Video Generation
von: Wang, Lei, et al.
Veröffentlicht: (2026)
von: Wang, Lei, et al.
Veröffentlicht: (2026)
Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment
von: Ye, Hua, et al.
Veröffentlicht: (2025)
von: Ye, Hua, et al.
Veröffentlicht: (2025)
Aligning Multimodal LLM with Human Preference: A Survey
von: Yu, Tao, et al.
Veröffentlicht: (2025)
von: Yu, Tao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
von: Ge, Qiming, et al.
Veröffentlicht: (2025) -
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
von: Xia, Han, et al.
Veröffentlicht: (2024) -
CombAlign: Enhancing Model Expressiveness in Unsupervised Graph Alignment
von: Chen, Songyang, et al.
Veröffentlicht: (2024) -
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
von: Liao, Huan, et al.
Veröffentlicht: (2024) -
Towards Effective and Efficient Graph Alignment without Supervision
von: Chen, Songyang, et al.
Veröffentlicht: (2026)