When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Sanxing, Chen, Xiaoyin, Huang, Yukun, Xie, Roy, Dhingra, Bhuwan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
Real-time Factuality Assessment from Adversarial Feedback
par: Chen, Sanxing, et autres
Publié: (2024)
par: Chen, Sanxing, et autres
Publié: (2024)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Calibrating Long-form Generations from Large Language Models
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Hierarchical Multi-Label Classification of Online Vaccine Concerns
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
Adversarial Math Word Problem Generation
par: Xie, Roy, et autres
Publié: (2024)
par: Xie, Roy, et autres
Publié: (2024)
ChatShop: Interactive Information Seeking with Language Agents
par: Chen, Sanxing, et autres
Publié: (2024)
par: Chen, Sanxing, et autres
Publié: (2024)
ToolACE: Winning the Points of LLM Function Calling
par: Liu, Weiwen, et autres
Publié: (2024)
par: Liu, Weiwen, et autres
Publié: (2024)
Mini-Giants: "Small" Language Models and Open Source Win-Win
par: Zhou, Zhengping, et autres
Publié: (2023)
par: Zhou, Zhengping, et autres
Publié: (2023)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
When Two LLMs Debate, Both Think They'll Win
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025)
par: Prasad, Pradyumna Shyama, et autres
Publié: (2025)
CDQuant: Greedy Coordinate Descent for Accurate LLM Quantization
par: Nair, Pranav Ajit, et autres
Publié: (2024)
par: Nair, Pranav Ajit, et autres
Publié: (2024)
Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments
par: Zhang, Ziyuan, et autres
Publié: (2025)
par: Zhang, Ziyuan, et autres
Publié: (2025)
When Shallow Wins: Silent Failures and the Depth-Accuracy Paradox in Latent Reasoning
par: Sahoo, Subramanyam, et autres
Publié: (2026)
par: Sahoo, Subramanyam, et autres
Publié: (2026)
Inference and Verbalization Functions During In-Context Learning
par: Tao, Junyi, et autres
Publié: (2024)
par: Tao, Junyi, et autres
Publié: (2024)
A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement
par: Tang, Shengji, et autres
Publié: (2025)
par: Tang, Shengji, et autres
Publié: (2025)
When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models
par: Xie, Tong, et autres
Publié: (2025)
par: Xie, Tong, et autres
Publié: (2025)
Unveiling LLM Mechanisms Through Neural ODEs and Control Theory
par: Zhang, Yukun, et autres
Publié: (2024)
par: Zhang, Yukun, et autres
Publié: (2024)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
Jump Starting Bandits with LLM-Generated Prior Knowledge
par: Alamdari, Parand A., et autres
Publié: (2024)
par: Alamdari, Parand A., et autres
Publié: (2024)
RVPO: Risk-Sensitive Alignment via Variance Regularization
par: Montero, Ivan, et autres
Publié: (2026)
par: Montero, Ivan, et autres
Publié: (2026)
Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents
par: Shao, Shuai, et autres
Publié: (2025)
par: Shao, Shuai, et autres
Publié: (2025)
When is Tree Search Useful for LLM Planning? It Depends on the Discriminator
par: Chen, Ziru, et autres
Publié: (2024)
par: Chen, Ziru, et autres
Publié: (2024)
A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits
par: Zhang, Yuyang, et autres
Publié: (2026)
par: Zhang, Yuyang, et autres
Publié: (2026)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
par: Xia, Fanzeng, et autres
Publié: (2024)
par: Xia, Fanzeng, et autres
Publié: (2024)
Online Personalizing White-box LLMs Generation with Neural Bandits
par: Chen, Zekai, et autres
Publié: (2024)
par: Chen, Zekai, et autres
Publié: (2024)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
par: Yuan, Yurun, et autres
Publié: (2026)
par: Yuan, Yurun, et autres
Publié: (2026)
Winning Amazon KDD Cup'24
par: Deotte, Chris, et autres
Publié: (2024)
par: Deotte, Chris, et autres
Publié: (2024)
Winning Big with Small Models: Knowledge Distillation vs. Self-Training for Reducing Hallucination in Product QA Agents
par: Lewis, Ashley, et autres
Publié: (2025)
par: Lewis, Ashley, et autres
Publié: (2025)
Memory-Efficient LLM Training with Online Subspace Descent
par: Liang, Kaizhao, et autres
Publié: (2024)
par: Liang, Kaizhao, et autres
Publié: (2024)
Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
par: Li, Miaomiao, et autres
Publié: (2025)
par: Li, Miaomiao, et autres
Publié: (2025)
Emergent Representations of Program Semantics in Language Models Trained on Programs
par: Jin, Charles, et autres
Publié: (2023)
par: Jin, Charles, et autres
Publié: (2023)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
par: Chen, Jianhui, et autres
Publié: (2026)
par: Chen, Jianhui, et autres
Publié: (2026)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode Stage
par: Hu, Junhao, et autres
Publié: (2026)
par: Hu, Junhao, et autres
Publié: (2026)
Unraveling Text Generation in LLMs: A Stochastic Differential Equation Approach
par: Zhang, Yukun
Publié: (2024)
par: Zhang, Yukun
Publié: (2024)
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
par: Cai, Hongyi James, et autres
Publié: (2025)
par: Cai, Hongyi James, et autres
Publié: (2025)
KALAVAI: Predicting When Independent Specialist Fusion Works -- A Quantitative Model for Post-Hoc Cooperative LLM Training
par: Kumaresan, Ramchand
Publié: (2026)
par: Kumaresan, Ramchand
Publié: (2026)
HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
Documents similaires
-
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
par: Huang, Yukun, et autres
Publié: (2025) -
Real-time Factuality Assessment from Adversarial Feedback
par: Chen, Sanxing, et autres
Publié: (2024) -
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024) -
Calibrating Long-form Generations from Large Language Models
par: Huang, Yukun, et autres
Publié: (2024) -
Hierarchical Multi-Label Classification of Online Vaccine Concerns
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)