Binary Classifier Optimization for Large Language Model Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Jung, Seungjae, Han, Gunsoo, Nam, Daniel Wontae, On, Kyoung-Woon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hexa: Self-Improving for Knowledge-Grounded Dialogue System
di: Jo, Daejin, et al.
Pubblicazione: (2023)
di: Jo, Daejin, et al.
Pubblicazione: (2023)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2023)
di: Zhao, Siyan, et al.
Pubblicazione: (2023)
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)
di: Li, Chengao, et al.
Pubblicazione: (2025)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
Large Language Models in the Task of Automatic Validation of Text Classifier Predictions
di: Tsymbalov, Aleksandr, et al.
Pubblicazione: (2025)
di: Tsymbalov, Aleksandr, et al.
Pubblicazione: (2025)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
di: Li, Junsong, et al.
Pubblicazione: (2025)
di: Li, Junsong, et al.
Pubblicazione: (2025)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
Stepwise Alignment for Constrained Language Model Policy Optimization
di: Wachi, Akifumi, et al.
Pubblicazione: (2024)
di: Wachi, Akifumi, et al.
Pubblicazione: (2024)
Spectral Editing of Activations for Large Language Model Alignment
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
di: Qiu, Yifu, et al.
Pubblicazione: (2024)
Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
Large Language Models as Optimizers
di: Yang, Chengrun, et al.
Pubblicazione: (2023)
di: Yang, Chengrun, et al.
Pubblicazione: (2023)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
di: Shen, Yunyi, et al.
Pubblicazione: (2025)
di: Shen, Yunyi, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
di: Lee, Gihun, et al.
Pubblicazione: (2024)
di: Lee, Gihun, et al.
Pubblicazione: (2024)
Value Augmented Sampling for Language Model Alignment and Personalization
di: Han, Seungwook, et al.
Pubblicazione: (2024)
di: Han, Seungwook, et al.
Pubblicazione: (2024)
Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
di: Achintalwar, Swapnaja, et al.
Pubblicazione: (2024)
di: Achintalwar, Swapnaja, et al.
Pubblicazione: (2024)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models
di: Kumar, Abhishek, et al.
Pubblicazione: (2024)
di: Kumar, Abhishek, et al.
Pubblicazione: (2024)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
di: Kazemi, Hamid, et al.
Pubblicazione: (2026)
di: Kazemi, Hamid, et al.
Pubblicazione: (2026)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
Large Visual-Language Models Are Also Good Classifiers: A Study of In-Context Multimodal Fake News Detection
di: Jiang, Ye, et al.
Pubblicazione: (2024)
di: Jiang, Ye, et al.
Pubblicazione: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
BinaryPPO: Efficient Policy Optimization for Binary Classification
di: Pandey, Punya Syon, et al.
Pubblicazione: (2026)
di: Pandey, Punya Syon, et al.
Pubblicazione: (2026)
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Large Language Model Reasoning Failures
di: Song, Peiyang, et al.
Pubblicazione: (2026)
di: Song, Peiyang, et al.
Pubblicazione: (2026)
LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models
di: Nguyen, Nam V., et al.
Pubblicazione: (2024)
di: Nguyen, Nam V., et al.
Pubblicazione: (2024)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
di: Jin, Haoran, et al.
Pubblicazione: (2025)
di: Jin, Haoran, et al.
Pubblicazione: (2025)
ROPO: Robust Preference Optimization for Large Language Models
di: Liang, Xize, et al.
Pubblicazione: (2024)
di: Liang, Xize, et al.
Pubblicazione: (2024)
Large Language Models for Travel Behavior Prediction
di: Mo, Baichuan, et al.
Pubblicazione: (2023)
di: Mo, Baichuan, et al.
Pubblicazione: (2023)
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
M2Lingual: Enhancing Multilingual, Multi-Turn Instruction Alignment in Large Language Models
di: Maheshwary, Rishabh, et al.
Pubblicazione: (2024)
di: Maheshwary, Rishabh, et al.
Pubblicazione: (2024)
Sequential Large Language Model-Based Hyper-parameter Optimization
di: Mahammadli, Kanan, et al.
Pubblicazione: (2024)
di: Mahammadli, Kanan, et al.
Pubblicazione: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
di: Lu, Shiyin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hexa: Self-Improving for Knowledge-Grounded Dialogue System
di: Jo, Daejin, et al.
Pubblicazione: (2023) -
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024) -
Group Preference Optimization: Few-Shot Alignment of Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2023) -
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025) -
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)