Guardado en:
| Autores principales: | Tao, Leitian, Li, Yixuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2409.08813 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Challenges and Future Directions of Data-Centric AI Alignment
por: Yeh, Min-Hsuan, et al.
Publicado: (2024)
por: Yeh, Min-Hsuan, et al.
Publicado: (2024)
CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement
por: Tao, Leitian, et al.
Publicado: (2024)
por: Tao, Leitian, et al.
Publicado: (2024)
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
por: Tao, Leitian, et al.
Publicado: (2025)
por: Tao, Leitian, et al.
Publicado: (2025)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
por: Li, Ziyue, et al.
Publicado: (2024)
por: Li, Ziyue, et al.
Publicado: (2024)
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
por: Guo, Yue, et al.
Publicado: (2024)
por: Guo, Yue, et al.
Publicado: (2024)
Alice: Proactive Learning with Teacher's Demonstrations for Weak-to-Strong Generalization
por: Wu, Shujin, et al.
Publicado: (2025)
por: Wu, Shujin, et al.
Publicado: (2025)
ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation
por: Dong, Weilong, et al.
Publicado: (2024)
por: Dong, Weilong, et al.
Publicado: (2024)
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
por: Ni, Bolin, et al.
Publicado: (2024)
por: Ni, Bolin, et al.
Publicado: (2024)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
por: Uzunoglu, Arda, et al.
Publicado: (2026)
por: Uzunoglu, Arda, et al.
Publicado: (2026)
Your Transformer is Secretly Linear
por: Razzhigaev, Anton, et al.
Publicado: (2024)
por: Razzhigaev, Anton, et al.
Publicado: (2024)
It Takes Two: Your GRPO Is Secretly DPO
por: Wu, Yihong, et al.
Publicado: (2025)
por: Wu, Yihong, et al.
Publicado: (2025)
Strong Teacher Not Needed? On Distillation in LLM Pretraining
por: Lu, Taiming, et al.
Publicado: (2026)
por: Lu, Taiming, et al.
Publicado: (2026)
IPO: Your Language Model is Secretly a Preference Classifier
por: Garg, Shivank, et al.
Publicado: (2025)
por: Garg, Shivank, et al.
Publicado: (2025)
Your Language Model Secretly Contains Personality Subnetworks
por: Ye, Ruimeng, et al.
Publicado: (2026)
por: Ye, Ruimeng, et al.
Publicado: (2026)
Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
por: Fang, Hao, et al.
Publicado: (2025)
por: Fang, Hao, et al.
Publicado: (2025)
Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark
por: Xu, Shuhang, et al.
Publicado: (2025)
por: Xu, Shuhang, et al.
Publicado: (2025)
Check Your LLM's Secret Dictionary! Five Lines of Code Reveal What Your LLM Learned (Including What It Shouldn't Have)
por: Miyashita, Hisashi
Publicado: (2026)
por: Miyashita, Hisashi
Publicado: (2026)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
por: Zhang, Xuan, et al.
Publicado: (2024)
por: Zhang, Xuan, et al.
Publicado: (2024)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
por: Lyu, Yougang, et al.
Publicado: (2024)
por: Lyu, Yougang, et al.
Publicado: (2024)
Selective Weak-to-Strong Generalization
por: Lang, Hao, et al.
Publicado: (2025)
por: Lang, Hao, et al.
Publicado: (2025)
Incentivizing Strong Reasoning from Weak Supervision
por: Yuan, Yige, et al.
Publicado: (2025)
por: Yuan, Yige, et al.
Publicado: (2025)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
por: Tao, Leitian, et al.
Publicado: (2025)
por: Tao, Leitian, et al.
Publicado: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
por: Ou, Jingyang, et al.
Publicado: (2024)
por: Ou, Jingyang, et al.
Publicado: (2024)
Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
por: Song, Feifan, et al.
Publicado: (2025)
por: Song, Feifan, et al.
Publicado: (2025)
Your Extreme Multi-label Classifier is Secretly a Hierarchical Text Classifier for Free
por: Bertalis, Nerijus, et al.
Publicado: (2024)
por: Bertalis, Nerijus, et al.
Publicado: (2024)
LargePiG: Your Large Language Model is Secretly a Pointer Generator
por: Sun, Zhongxiang, et al.
Publicado: (2024)
por: Sun, Zhongxiang, et al.
Publicado: (2024)
Weak-to-Strong Reasoning
por: Yang, Yuqing, et al.
Publicado: (2024)
por: Yang, Yuqing, et al.
Publicado: (2024)
Debate Helps Weak-to-Strong Generalization
por: Lang, Hao, et al.
Publicado: (2025)
por: Lang, Hao, et al.
Publicado: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
por: Zhao, Xuandong, et al.
Publicado: (2024)
por: Zhao, Xuandong, et al.
Publicado: (2024)
RedacBench: Can AI Erase Your Secrets?
por: Jeon, Hyunjun, et al.
Publicado: (2026)
por: Jeon, Hyunjun, et al.
Publicado: (2026)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
por: Cheng, Pengyu, et al.
Publicado: (2023)
por: Cheng, Pengyu, et al.
Publicado: (2023)
Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data Annotation
por: Xia, Mingxuan, et al.
Publicado: (2025)
por: Xia, Mingxuan, et al.
Publicado: (2025)
GAPrune: Gradient-Alignment Pruning for Domain-Aware Embeddings
por: Tang, Yixuan, et al.
Publicado: (2025)
por: Tang, Yixuan, et al.
Publicado: (2025)
Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations
por: Zheng, Brian Siyuan, et al.
Publicado: (2025)
por: Zheng, Brian Siyuan, et al.
Publicado: (2025)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
por: Yang, Wenkai, et al.
Publicado: (2024)
por: Yang, Wenkai, et al.
Publicado: (2024)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
por: Doyle, Cooper
Publicado: (2025)
por: Doyle, Cooper
Publicado: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
por: Zhu, Wenhong, et al.
Publicado: (2024)
por: Zhu, Wenhong, et al.
Publicado: (2024)
Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation
por: Zhang, Hengyuan, et al.
Publicado: (2025)
por: Zhang, Hengyuan, et al.
Publicado: (2025)
The Era of Real-World Human Interaction: RL from User Conversations
por: Jin, Chuanyang, et al.
Publicado: (2025)
por: Jin, Chuanyang, et al.
Publicado: (2025)
Ejemplares similares
-
Challenges and Future Directions of Data-Centric AI Alignment
por: Yeh, Min-Hsuan, et al.
Publicado: (2024) -
CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement
por: Tao, Leitian, et al.
Publicado: (2024) -
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
por: Tao, Leitian, et al.
Publicado: (2025) -
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
por: Li, Ziyue, et al.
Publicado: (2024) -
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
por: Guo, Yue, et al.
Publicado: (2024)