Salvato in:
| Autori principali: | Tao, Leitian, Li, Yixuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2409.08813 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Challenges and Future Directions of Data-Centric AI Alignment
di: Yeh, Min-Hsuan, et al.
Pubblicazione: (2024)
di: Yeh, Min-Hsuan, et al.
Pubblicazione: (2024)
CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement
di: Tao, Leitian, et al.
Pubblicazione: (2024)
di: Tao, Leitian, et al.
Pubblicazione: (2024)
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
di: Tao, Leitian, et al.
Pubblicazione: (2025)
di: Tao, Leitian, et al.
Pubblicazione: (2025)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
di: Li, Ziyue, et al.
Pubblicazione: (2024)
di: Li, Ziyue, et al.
Pubblicazione: (2024)
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
di: Guo, Yue, et al.
Pubblicazione: (2024)
di: Guo, Yue, et al.
Pubblicazione: (2024)
Alice: Proactive Learning with Teacher's Demonstrations for Weak-to-Strong Generalization
di: Wu, Shujin, et al.
Pubblicazione: (2025)
di: Wu, Shujin, et al.
Pubblicazione: (2025)
ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation
di: Dong, Weilong, et al.
Pubblicazione: (2024)
di: Dong, Weilong, et al.
Pubblicazione: (2024)
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
di: Ni, Bolin, et al.
Pubblicazione: (2024)
di: Ni, Bolin, et al.
Pubblicazione: (2024)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
di: Uzunoglu, Arda, et al.
Pubblicazione: (2026)
di: Uzunoglu, Arda, et al.
Pubblicazione: (2026)
Your Transformer is Secretly Linear
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
It Takes Two: Your GRPO Is Secretly DPO
di: Wu, Yihong, et al.
Pubblicazione: (2025)
di: Wu, Yihong, et al.
Pubblicazione: (2025)
Strong Teacher Not Needed? On Distillation in LLM Pretraining
di: Lu, Taiming, et al.
Pubblicazione: (2026)
di: Lu, Taiming, et al.
Pubblicazione: (2026)
IPO: Your Language Model is Secretly a Preference Classifier
di: Garg, Shivank, et al.
Pubblicazione: (2025)
di: Garg, Shivank, et al.
Pubblicazione: (2025)
Your Language Model Secretly Contains Personality Subnetworks
di: Ye, Ruimeng, et al.
Pubblicazione: (2026)
di: Ye, Ruimeng, et al.
Pubblicazione: (2026)
Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
di: Fang, Hao, et al.
Pubblicazione: (2025)
di: Fang, Hao, et al.
Pubblicazione: (2025)
Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark
di: Xu, Shuhang, et al.
Pubblicazione: (2025)
di: Xu, Shuhang, et al.
Pubblicazione: (2025)
Check Your LLM's Secret Dictionary! Five Lines of Code Reveal What Your LLM Learned (Including What It Shouldn't Have)
di: Miyashita, Hisashi
Pubblicazione: (2026)
di: Miyashita, Hisashi
Pubblicazione: (2026)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
di: Lyu, Yougang, et al.
Pubblicazione: (2024)
di: Lyu, Yougang, et al.
Pubblicazione: (2024)
Selective Weak-to-Strong Generalization
di: Lang, Hao, et al.
Pubblicazione: (2025)
di: Lang, Hao, et al.
Pubblicazione: (2025)
Incentivizing Strong Reasoning from Weak Supervision
di: Yuan, Yige, et al.
Pubblicazione: (2025)
di: Yuan, Yige, et al.
Pubblicazione: (2025)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
di: Tao, Leitian, et al.
Pubblicazione: (2025)
di: Tao, Leitian, et al.
Pubblicazione: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
di: Ou, Jingyang, et al.
Pubblicazione: (2024)
Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
di: Song, Feifan, et al.
Pubblicazione: (2025)
di: Song, Feifan, et al.
Pubblicazione: (2025)
Your Extreme Multi-label Classifier is Secretly a Hierarchical Text Classifier for Free
di: Bertalis, Nerijus, et al.
Pubblicazione: (2024)
di: Bertalis, Nerijus, et al.
Pubblicazione: (2024)
LargePiG: Your Large Language Model is Secretly a Pointer Generator
di: Sun, Zhongxiang, et al.
Pubblicazione: (2024)
di: Sun, Zhongxiang, et al.
Pubblicazione: (2024)
Weak-to-Strong Reasoning
di: Yang, Yuqing, et al.
Pubblicazione: (2024)
di: Yang, Yuqing, et al.
Pubblicazione: (2024)
Debate Helps Weak-to-Strong Generalization
di: Lang, Hao, et al.
Pubblicazione: (2025)
di: Lang, Hao, et al.
Pubblicazione: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
RedacBench: Can AI Erase Your Secrets?
di: Jeon, Hyunjun, et al.
Pubblicazione: (2026)
di: Jeon, Hyunjun, et al.
Pubblicazione: (2026)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
di: Cheng, Pengyu, et al.
Pubblicazione: (2023)
di: Cheng, Pengyu, et al.
Pubblicazione: (2023)
Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data Annotation
di: Xia, Mingxuan, et al.
Pubblicazione: (2025)
di: Xia, Mingxuan, et al.
Pubblicazione: (2025)
GAPrune: Gradient-Alignment Pruning for Domain-Aware Embeddings
di: Tang, Yixuan, et al.
Pubblicazione: (2025)
di: Tang, Yixuan, et al.
Pubblicazione: (2025)
Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations
di: Zheng, Brian Siyuan, et al.
Pubblicazione: (2025)
di: Zheng, Brian Siyuan, et al.
Pubblicazione: (2025)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
di: Doyle, Cooper
Pubblicazione: (2025)
di: Doyle, Cooper
Pubblicazione: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation
di: Zhang, Hengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Hengyuan, et al.
Pubblicazione: (2025)
The Era of Real-World Human Interaction: RL from User Conversations
di: Jin, Chuanyang, et al.
Pubblicazione: (2025)
di: Jin, Chuanyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Challenges and Future Directions of Data-Centric AI Alignment
di: Yeh, Min-Hsuan, et al.
Pubblicazione: (2024) -
CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement
di: Tao, Leitian, et al.
Pubblicazione: (2024) -
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
di: Tao, Leitian, et al.
Pubblicazione: (2025) -
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
di: Li, Ziyue, et al.
Pubblicazione: (2024) -
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
di: Guo, Yue, et al.
Pubblicazione: (2024)