Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Lei, Cheng, Xiang, Zhao, Chenxiao, Shen, Guobin, Yang, Junjie, Feng, Xiaocheng, Gu, Yuxuan, Yu, Xing, Qin, Bing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?
por: Gu, Yuxuan, et al.
Publicado: (2026)
por: Gu, Yuxuan, et al.
Publicado: (2026)
Context-Aware Hierarchical Taxonomy Generation for Scientific Papers via LLM-Guided Multi-Aspect Clustering
por: Zhu, Kun, et al.
Publicado: (2025)
por: Zhu, Kun, et al.
Publicado: (2025)
Unveiling Entity-Level Unlearning for Large Language Models: A Comprehensive Analysis
por: Ma, Weitao, et al.
Publicado: (2024)
por: Ma, Weitao, et al.
Publicado: (2024)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
por: Zhong, Weihong, et al.
Publicado: (2024)
por: Zhong, Weihong, et al.
Publicado: (2024)
PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra
por: Feng, Xiachong, et al.
Publicado: (2026)
por: Feng, Xiachong, et al.
Publicado: (2026)
Learning Fine-Grained Grounded Citations for Attributed Large Language Models
por: Huang, Lei, et al.
Publicado: (2024)
por: Huang, Lei, et al.
Publicado: (2024)
Discrete Modeling via Boundary Conditional Diffusion Processes
por: Gu, Yuxuan, et al.
Publicado: (2024)
por: Gu, Yuxuan, et al.
Publicado: (2024)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
por: Han, Bing, et al.
Publicado: (2025)
por: Han, Bing, et al.
Publicado: (2025)
Length Controlled Generation for Black-box LLMs
por: Gu, Yuxuan, et al.
Publicado: (2024)
por: Gu, Yuxuan, et al.
Publicado: (2024)
Extending Context Window of Large Language Models from a Distributional Perspective
por: Wu, Yingsheng, et al.
Publicado: (2024)
por: Wu, Yingsheng, et al.
Publicado: (2024)
Ensemble Learning for Heterogeneous Large Language Models with Deep Parallel Collaboration
por: Huang, Yichong, et al.
Publicado: (2024)
por: Huang, Yichong, et al.
Publicado: (2024)
Improving Contextual Faithfulness of Large Language Models via Retrieval Heads-Induced Optimization
por: Huang, Lei, et al.
Publicado: (2025)
por: Huang, Lei, et al.
Publicado: (2025)
LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
por: Li, Ang, et al.
Publicado: (2025)
por: Li, Ang, et al.
Publicado: (2025)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
por: Ma, Weitao, et al.
Publicado: (2026)
por: Ma, Weitao, et al.
Publicado: (2026)
Adaptive Backtracking for Privacy Protection in Large Language Models
por: Yao, Zhihao, et al.
Publicado: (2025)
por: Yao, Zhihao, et al.
Publicado: (2025)
SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution
por: Feng, Xiachong, et al.
Publicado: (2026)
por: Feng, Xiachong, et al.
Publicado: (2026)
Bootstrapping Code Translation with Weighted Multilanguage Exploration
por: Wu, Yuhan, et al.
Publicado: (2026)
por: Wu, Yuhan, et al.
Publicado: (2026)
Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
por: Feng, Xiachong, et al.
Publicado: (2026)
por: Feng, Xiachong, et al.
Publicado: (2026)
System-Level Natural Language Feedback
por: Yuan, Weizhe, et al.
Publicado: (2023)
por: Yuan, Weizhe, et al.
Publicado: (2023)
Trends in Integration of Knowledge and Large Language Models: A Survey and Taxonomy of Methods, Benchmarks, and Applications
por: Feng, Zhangyin, et al.
Publicado: (2023)
por: Feng, Zhangyin, et al.
Publicado: (2023)
Aligning Translation-Specific Understanding to General Understanding in Large Language Models
por: Huang, Yichong, et al.
Publicado: (2024)
por: Huang, Yichong, et al.
Publicado: (2024)
Ultrathin porous cation exchange membranes for high‐performance diffusion dialysis alkali recovery
por: Xiaoda Wang, et al.
Publicado: (2025)
por: Xiaoda Wang, et al.
Publicado: (2025)
Advancing Large Language Model Attribution through Self-Improving
por: Huang, Lei, et al.
Publicado: (2024)
por: Huang, Lei, et al.
Publicado: (2024)
Developmental Plasticity-inspired Adaptive Pruning for Deep Spiking and Artificial Neural Networks
por: Han, Bing, et al.
Publicado: (2022)
por: Han, Bing, et al.
Publicado: (2022)
Text2Grad: Reinforcement Learning from Natural Language Feedback
por: Wang, Hanyang, et al.
Publicado: (2025)
por: Wang, Hanyang, et al.
Publicado: (2025)
BAGEL: Bootstrapping Agents by Guiding Exploration with Language
por: Murty, Shikhar, et al.
Publicado: (2024)
por: Murty, Shikhar, et al.
Publicado: (2024)
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
por: Xing, Shangyu, et al.
Publicado: (2025)
por: Xing, Shangyu, et al.
Publicado: (2025)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
por: Dong, Yiting, et al.
Publicado: (2024)
por: Dong, Yiting, et al.
Publicado: (2024)
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
por: Zheng, Ziwei, et al.
Publicado: (2025)
por: Zheng, Ziwei, et al.
Publicado: (2025)
An Information Bottleneck Perspective for Effective Noise Filtering on Retrieval-Augmented Generation
por: Zhu, Kun, et al.
Publicado: (2024)
por: Zhu, Kun, et al.
Publicado: (2024)
A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions
por: Huang, Lei, et al.
Publicado: (2023)
por: Huang, Lei, et al.
Publicado: (2023)
x1: Learning to Think Adaptively Across Languages and Cultures
por: Ye, Yangfan, et al.
Publicado: (2026)
por: Ye, Yangfan, et al.
Publicado: (2026)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
por: Shen, Guobin, et al.
Publicado: (2024)
por: Shen, Guobin, et al.
Publicado: (2024)
LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning
por: Ye, Yangfan, et al.
Publicado: (2025)
por: Ye, Yangfan, et al.
Publicado: (2025)
From Hypothesis to Publication: A Comprehensive Survey of AI-Driven Research Support Systems
por: Zhou, Zekun, et al.
Publicado: (2025)
por: Zhou, Zekun, et al.
Publicado: (2025)
Adapter-based Selective Knowledge Distillation for Federated Multi-domain Meeting Summarization
por: Feng, Xiachong, et al.
Publicado: (2023)
por: Feng, Xiachong, et al.
Publicado: (2023)
FroM: Frobenius Norm-Based Data-Free Adaptive Model Merging
por: Li, Zijian, et al.
Publicado: (2025)
por: Li, Zijian, et al.
Publicado: (2025)
Ejemplares similares
-
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
por: Shen, Guobin, et al.
Publicado: (2026) -
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
por: Shen, Guobin, et al.
Publicado: (2026) -
From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation
por: Shen, Guobin, et al.
Publicado: (2026) -
Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?
por: Gu, Yuxuan, et al.
Publicado: (2026) -
Context-Aware Hierarchical Taxonomy Generation for Scientific Papers via LLM-Guided Multi-Aspect Clustering
por: Zhu, Kun, et al.
Publicado: (2025)