Aligning Large Language Models via Fine-grained Supervision
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Dehong, Qiu, Liang, Kim, Minseok, Ladhak, Faisal, Do, Jaeyoung |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Query-Conditioned Test-Time Self-Training for Large Language Models
von: Song, Chaehee, et al.
Veröffentlicht: (2026)
von: Song, Chaehee, et al.
Veröffentlicht: (2026)
Align to Structure: Aligning Large Language Models with Structural Information
von: Kim, Zae Myung, et al.
Veröffentlicht: (2025)
von: Kim, Zae Myung, et al.
Veröffentlicht: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
Aligning Large Language Models by On-Policy Self-Judgment
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024)
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024)
Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
von: Kim, Woojin, et al.
Veröffentlicht: (2025)
von: Kim, Woojin, et al.
Veröffentlicht: (2025)
How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
von: Dong, Guanting, et al.
Veröffentlicht: (2023)
von: Dong, Guanting, et al.
Veröffentlicht: (2023)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
von: Hong, Joey, et al.
Veröffentlicht: (2024)
von: Hong, Joey, et al.
Veröffentlicht: (2024)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
von: Weng, Jiaqi, et al.
Veröffentlicht: (2025)
von: Weng, Jiaqi, et al.
Veröffentlicht: (2025)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
von: Chen, Kai, et al.
Veröffentlicht: (2023)
von: Chen, Kai, et al.
Veröffentlicht: (2023)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
GUNDAM: Aligning Large Language Models with Graph Understanding
von: Ouyang, Sheng, et al.
Veröffentlicht: (2024)
von: Ouyang, Sheng, et al.
Veröffentlicht: (2024)
DEMO: Reframing Dialogue Interaction with Fine-grained Element Modeling
von: Wang, Minzheng, et al.
Veröffentlicht: (2024)
von: Wang, Minzheng, et al.
Veröffentlicht: (2024)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
von: Jiang, Eric Hanchen, et al.
Veröffentlicht: (2025)
von: Jiang, Eric Hanchen, et al.
Veröffentlicht: (2025)
MathBridge: A Large Corpus Dataset for Translating Spoken Mathematical Expressions into $LaTeX$ Formulas for Improved Readability
von: Jung, Kyudan, et al.
Veröffentlicht: (2024)
von: Jung, Kyudan, et al.
Veröffentlicht: (2024)
Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning
von: Krishnan, Ranganath, et al.
Veröffentlicht: (2024)
von: Krishnan, Ranganath, et al.
Veröffentlicht: (2024)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
von: Li, Junsong, et al.
Veröffentlicht: (2025)
von: Li, Junsong, et al.
Veröffentlicht: (2025)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
von: Bansal, Hritik, et al.
Veröffentlicht: (2024)
Packing Analysis: Packing Is More Appropriate for Large Models or Datasets in Supervised Fine-tuning
von: Wang, Shuhe, et al.
Veröffentlicht: (2024)
von: Wang, Shuhe, et al.
Veröffentlicht: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
von: Achintalwar, Swapnaja, et al.
Veröffentlicht: (2024)
von: Achintalwar, Swapnaja, et al.
Veröffentlicht: (2024)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
von: Kabir, Muhammad Rafsan, et al.
Veröffentlicht: (2024)
von: Kabir, Muhammad Rafsan, et al.
Veröffentlicht: (2024)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
von: Lai, Yuhang, et al.
Veröffentlicht: (2024)
von: Lai, Yuhang, et al.
Veröffentlicht: (2024)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing
von: Tran, Thien Q., et al.
Veröffentlicht: (2025)
von: Tran, Thien Q., et al.
Veröffentlicht: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
Boosting Large Language Models with Mask Fine-Tuning
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
von: Chuang, Yung-Sung, et al.
Veröffentlicht: (2025)
von: Chuang, Yung-Sung, et al.
Veröffentlicht: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
von: Kim, Woojin, et al.
Veröffentlicht: (2026)
von: Kim, Woojin, et al.
Veröffentlicht: (2026)
Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning
von: Qian, Livia, et al.
Veröffentlicht: (2026)
von: Qian, Livia, et al.
Veröffentlicht: (2026)
CodecLM: Aligning Language Models with Tailored Synthetic Data
von: Wang, Zifeng, et al.
Veröffentlicht: (2024)
von: Wang, Zifeng, et al.
Veröffentlicht: (2024)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
Fine-Grained Interpretation of Political Opinions in Large Language Models
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
Correcting Large Language Model Behavior via Influence Function
von: Zhang, Han, et al.
Veröffentlicht: (2024)
von: Zhang, Han, et al.
Veröffentlicht: (2024)
Health-LLM: Large Language Models for Health Prediction via Wearable Sensor Data
von: Kim, Yubin, et al.
Veröffentlicht: (2024)
von: Kim, Yubin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Query-Conditioned Test-Time Self-Training for Large Language Models
von: Song, Chaehee, et al.
Veröffentlicht: (2026) -
Align to Structure: Aligning Large Language Models with Structural Information
von: Kim, Zae Myung, et al.
Veröffentlicht: (2025) -
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025) -
Aligning Large Language Models by On-Policy Self-Judgment
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024) -
Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
von: Kim, Woojin, et al.
Veröffentlicht: (2025)