Learning from Language Feedback via Variational Policy Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yang, Nijkamp, Erik, Yavuz, Semih, Joty, Shafiq |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation
par: Chen, Hailin, et autres
Publié: (2023)
par: Chen, Hailin, et autres
Publié: (2023)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
par: Zhou, Yefan, et autres
Publié: (2025)
par: Zhou, Yefan, et autres
Publié: (2025)
SkillOrchestra: Learning to Route Agents via Skill Transfer
par: Wang, Jiayu, et autres
Publié: (2026)
par: Wang, Jiayu, et autres
Publié: (2026)
CEMTM: Contextual Embedding-based Multimodal Topic Modeling
par: Abaskohi, Amirhossein, et autres
Publié: (2025)
par: Abaskohi, Amirhossein, et autres
Publié: (2025)
Investigating Factuality in Long-Form Text Generation: The Roles of Self-Known and Self-Unknown
par: Tu, Lifu, et autres
Publié: (2024)
par: Tu, Lifu, et autres
Publié: (2024)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
par: Niu, Tong, et autres
Publié: (2024)
par: Niu, Tong, et autres
Publié: (2024)
Recurrent Natural Policy Gradient for POMDPs
par: Cayci, Semih, et autres
Publié: (2024)
par: Cayci, Semih, et autres
Publié: (2024)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
par: Zhou, Yilun, et autres
Publié: (2025)
par: Zhou, Yilun, et autres
Publié: (2025)
Variational Self-Supervised Learning
par: Yavuz, Mehmet Can, et autres
Publié: (2025)
par: Yavuz, Mehmet Can, et autres
Publié: (2025)
Variational Distillation of Diffusion Policies into Mixture of Experts
par: Zhou, Hongyi, et autres
Publié: (2024)
par: Zhou, Hongyi, et autres
Publié: (2024)
Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation
par: Zhang, Yuwei, et autres
Publié: (2026)
par: Zhang, Yuwei, et autres
Publié: (2026)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
par: Zhou, Yefan, et autres
Publié: (2026)
par: Zhou, Yefan, et autres
Publié: (2026)
Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
Multivariate Variational Autoencoder
par: Yavuz, Mehmet Can
Publié: (2025)
par: Yavuz, Mehmet Can
Publié: (2025)
Variational Self-Supervised Contrastive Learning Using Beta Divergence
par: Yavuz, Mehmet Can, et autres
Publié: (2023)
par: Yavuz, Mehmet Can, et autres
Publié: (2023)
VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?
par: Bansal, Srijan, et autres
Publié: (2026)
par: Bansal, Srijan, et autres
Publié: (2026)
Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog
par: Zhao, Yiran, et autres
Publié: (2026)
par: Zhao, Yiran, et autres
Publié: (2026)
Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction
par: Shi, Zhenmei, et autres
Publié: (2024)
par: Shi, Zhenmei, et autres
Publié: (2024)
Continual Policy Distillation from Distributed Reinforcement Learning Teachers
par: Li, Yuxuan, et autres
Publié: (2026)
par: Li, Yuxuan, et autres
Publié: (2026)
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
par: Ming, Yifei, et autres
Publié: (2024)
par: Ming, Yifei, et autres
Publié: (2024)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
par: Cayci, Semih, et autres
Publié: (2021)
par: Cayci, Semih, et autres
Publié: (2021)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
par: Tu, Lifu, et autres
Publié: (2023)
par: Tu, Lifu, et autres
Publié: (2023)
RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning
par: Xu, Charles, et autres
Publié: (2024)
par: Xu, Charles, et autres
Publié: (2024)
Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
par: Yang, Xuewei, et autres
Publié: (2026)
par: Yang, Xuewei, et autres
Publié: (2026)
Best Policy Learning from Trajectory Preference Feedback
par: Agnihotri, Akhil, et autres
Publié: (2025)
par: Agnihotri, Akhil, et autres
Publié: (2025)
Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification
par: Liang, Zhenwen, et autres
Publié: (2024)
par: Liang, Zhenwen, et autres
Publié: (2024)
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
par: Luu, Tung M., et autres
Publié: (2025)
par: Luu, Tung M., et autres
Publié: (2025)
Non-Asymptotic Optimization and Generalization Bounds for Stochastic Gauss-Newton in Overparameterized Models
par: Cayci, Semih
Publié: (2025)
par: Cayci, Semih
Publié: (2025)
Self-Supervised On-Policy Distillation for Reasoning Language Models
par: Tan, Zhiquan, et autres
Publié: (2026)
par: Tan, Zhiquan, et autres
Publié: (2026)
Open-RAG: Enhanced Retrieval-Augmented Reasoning with Open-Source Large Language Models
par: Islam, Shayekh Bin, et autres
Publié: (2024)
par: Islam, Shayekh Bin, et autres
Publié: (2024)
Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback
par: Li, Zitian, et autres
Publié: (2026)
par: Li, Zitian, et autres
Publié: (2026)
References Improve LLM Alignment in Non-Verifiable Domains
par: Shi, Kejian, et autres
Publié: (2026)
par: Shi, Kejian, et autres
Publié: (2026)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
par: Singh, Janvijay, et autres
Publié: (2025)
par: Singh, Janvijay, et autres
Publié: (2025)
KL for a KL: On-Policy Distillation with Control Variate Baseline
par: Oh, Minjae, et autres
Publié: (2026)
par: Oh, Minjae, et autres
Publié: (2026)
Co-Evolving Policy Distillation
par: Gu, Naibin, et autres
Publié: (2026)
par: Gu, Naibin, et autres
Publié: (2026)
On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
par: Agarwal, Rishabh, et autres
Publié: (2023)
par: Agarwal, Rishabh, et autres
Publié: (2023)
Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
par: Wei, Wang, et autres
Publié: (2025)
par: Wei, Wang, et autres
Publié: (2025)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
par: Zhao, Siyan, et autres
Publié: (2026)
par: Zhao, Siyan, et autres
Publié: (2026)
Documents similaires
-
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
par: Xu, Austin, et autres
Publié: (2025) -
Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation
par: Chen, Hailin, et autres
Publié: (2023) -
Variation in Verification: Understanding Verification Dynamics in Large Language Models
par: Zhou, Yefan, et autres
Publié: (2025) -
SkillOrchestra: Learning to Route Agents via Skill Transfer
par: Wang, Jiayu, et autres
Publié: (2026) -
CEMTM: Contextual Embedding-based Multimodal Topic Modeling
par: Abaskohi, Amirhossein, et autres
Publié: (2025)