Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xia, Han, Gao, Songyang, Ge, Qiming, Xi, Zhiheng, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023)
par: Xi, Zhiheng, et autres
Publié: (2023)
Navigating the OverKill in Large Language Models
par: Shi, Chenyu, et autres
Publié: (2024)
par: Shi, Chenyu, et autres
Publié: (2024)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
par: Zhang, Yuansen, et autres
Publié: (2024)
par: Zhang, Yuansen, et autres
Publié: (2024)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Aligning Large Language Models with Human Preferences through Representation Engineering
par: Liu, Wenhao, et autres
Publié: (2023)
par: Liu, Wenhao, et autres
Publié: (2023)
Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
par: Gao, Songyang, et autres
Publié: (2024)
par: Gao, Songyang, et autres
Publié: (2024)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?
par: Qi, Xuan, et autres
Publié: (2025)
par: Qi, Xuan, et autres
Publié: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement
par: Wang, Xiaohua, et autres
Publié: (2024)
par: Wang, Xiaohua, et autres
Publié: (2024)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
par: Dou, Shihan, et autres
Publié: (2023)
par: Dou, Shihan, et autres
Publié: (2023)
Aligning Large Language Models with Searcher Preferences
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time
par: Zhang, Mozhi, et autres
Publié: (2024)
par: Zhang, Mozhi, et autres
Publié: (2024)
Unveiling Linguistic Regions in Large Language Models
par: Zhang, Zhihao, et autres
Publié: (2024)
par: Zhang, Zhihao, et autres
Publié: (2024)
CritiQ: Mining Data Quality Criteria from Human Preferences
par: Guo, Honglin, et autres
Publié: (2025)
par: Guo, Honglin, et autres
Publié: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
AgentGym: Evolving Large Language Model-based Agents across Diverse Environments
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Aligning Large Language Models with Implicit Preferences from User-Generated Content
par: Tan, Zhaoxuan, et autres
Publié: (2025)
par: Tan, Zhaoxuan, et autres
Publié: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
par: Lai, Yuhang, et autres
Publié: (2024)
par: Lai, Yuhang, et autres
Publié: (2024)
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Mixed Preference Optimization: Reinforcement Learning with Data Selection and Better Reference Model
par: Gou, Qi, et autres
Publié: (2024)
par: Gou, Qi, et autres
Publié: (2024)
Aligning Large Language Model Behavior with Human Citation Preferences
par: Ando, Kenichiro, et autres
Publié: (2026)
par: Ando, Kenichiro, et autres
Publié: (2026)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
par: Wu, Mingqi, et autres
Publié: (2025)
par: Wu, Mingqi, et autres
Publié: (2025)
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
par: Ge, Qiming, et autres
Publié: (2025)
par: Ge, Qiming, et autres
Publié: (2025)
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
par: Gu, Yanggan, et autres
Publié: (2025)
par: Gu, Yanggan, et autres
Publié: (2025)
Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management
par: Wang, Yanan, et autres
Publié: (2026)
par: Wang, Yanan, et autres
Publié: (2026)
Token-Level Privacy in Large Language Models
par: Harel, Re'em, et autres
Publié: (2025)
par: Harel, Re'em, et autres
Publié: (2025)
Rethinking Personalization in Large Language Models at the Token Level
par: Zhang, Chenheng, et autres
Publié: (2026)
par: Zhang, Chenheng, et autres
Publié: (2026)
Safer-Instruct: Aligning Language Models with Automated Preference Data
par: Shi, Taiwei, et autres
Publié: (2023)
par: Shi, Taiwei, et autres
Publié: (2023)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
LLaST: Improved End-to-end Speech Translation System Leveraged by Large Language Models
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Pre-Trained Policy Discriminators are General Reward Models
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Documents similaires
-
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023) -
Navigating the OverKill in Large Language Models
par: Shi, Chenyu, et autres
Publié: (2024) -
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
par: Zhang, Yuansen, et autres
Publié: (2024) -
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
par: Ye, Junjie, et autres
Publié: (2024) -
Aligning Large Language Models with Human Preferences through Representation Engineering
par: Liu, Wenhao, et autres
Publié: (2023)