HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Weiqi, Liu, Xin, Huang, Binxuan, Cui, Hejie, Zhang, Rongzhi, Yu, Changlong, Jin, Shuowei, Yang, Jingfeng, Yin, Qingyu, Wang, Zhengyang, Li, Zheng, Gao, Yifan, Nigam, Priyanka, Yin, Bing, Li, Lihong, Song, Yangqiu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
POPI: Personalizing LLMs via Optimized Natural Language Preference Inference
by: Chen, Yizhuo, et al.
Published: (2025)
by: Chen, Yizhuo, et al.
Published: (2025)
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
by: Zhuang, Yuchen, et al.
Published: (2025)
by: Zhuang, Yuchen, et al.
Published: (2025)
Scaling Laws for Predicting Downstream Performance in LLMs
by: Chen, Yangyi, et al.
Published: (2024)
by: Chen, Yangyi, et al.
Published: (2024)
Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
by: Zhang, Yuheng, et al.
Published: (2025)
by: Zhang, Yuheng, et al.
Published: (2025)
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
by: Jiayang, Cheng, et al.
Published: (2026)
by: Jiayang, Cheng, et al.
Published: (2026)
Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs
by: Cheng, Kewei, et al.
Published: (2024)
by: Cheng, Kewei, et al.
Published: (2024)
Can Language Models Follow Multiple Turns of Entangled Instructions?
by: Han, Chi, et al.
Published: (2025)
by: Han, Chi, et al.
Published: (2025)
Meta Operator for Complex Query Answering on Knowledge Graphs
by: Yin, Hang, et al.
Published: (2024)
by: Yin, Hang, et al.
Published: (2024)
Rethinking Complex Queries on Knowledge Graphs with Neural Link Predictors
by: Yin, Hang, et al.
Published: (2023)
by: Yin, Hang, et al.
Published: (2023)
SessionIntentBench: A Multi-task Inter-session Intention-shift Modeling Benchmark for E-commerce Customer Behavior Understanding
by: Yang, Yuqi, et al.
Published: (2025)
by: Yang, Yuqi, et al.
Published: (2025)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
by: Wang, Weiqi, et al.
Published: (2024)
by: Wang, Weiqi, et al.
Published: (2024)
MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding
by: Xu, Baixuan, et al.
Published: (2024)
by: Xu, Baixuan, et al.
Published: (2024)
IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commerce
by: Ding, Wenxuan, et al.
Published: (2024)
by: Ding, Wenxuan, et al.
Published: (2024)
END: Early Noise Dropping for Efficient and Effective Context Denoising
by: Jin, Hongye, et al.
Published: (2025)
by: Jin, Hongye, et al.
Published: (2025)
ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning
by: Zhang, Liyu, et al.
Published: (2024)
by: Zhang, Liyu, et al.
Published: (2024)
Understanding Inter-Session Intentions via Complex Logical Reasoning
by: Bai, Jiaxin, et al.
Published: (2023)
by: Bai, Jiaxin, et al.
Published: (2023)
CoMem: Context Management with A Decoupled Long-Context Model
by: Zhang, Yuwei, et al.
Published: (2026)
by: Zhang, Yuwei, et al.
Published: (2026)
Shopping MMLU: A Massive Multi-Task Online Shopping Benchmark for Large Language Models
by: Jin, Yilun, et al.
Published: (2024)
by: Jin, Yilun, et al.
Published: (2024)
Extending Complex Logical Queries on Uncertain Knowledge Graphs
by: Fei, Weizhi, et al.
Published: (2024)
by: Fei, Weizhi, et al.
Published: (2024)
Patterns Over Principles: The Fragility of Inductive Reasoning in LLMs under Noisy Observations
by: Li, Chunyang, et al.
Published: (2025)
by: Li, Chunyang, et al.
Published: (2025)
MEMORYLLM: Towards Self-Updatable Large Language Models
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping
by: Fan, Wei, et al.
Published: (2025)
by: Fan, Wei, et al.
Published: (2025)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
by: Li, Xintong, et al.
Published: (2026)
by: Li, Xintong, et al.
Published: (2026)
Data Diversity Matters for Robust Instruction Tuning
by: Bukharin, Alexander, et al.
Published: (2023)
by: Bukharin, Alexander, et al.
Published: (2023)
Efficient and Scalable Neural Symbolic Search for Knowledge Graph Complex Query Answering
by: Fei, Weizhi, et al.
Published: (2025)
by: Fei, Weizhi, et al.
Published: (2025)
Large Language Models in the Clinic: A Comprehensive Benchmark
by: Liu, Fenglin, et al.
Published: (2024)
by: Liu, Fenglin, et al.
Published: (2024)
KnowShiftQA: How Robust are RAG Systems when Textbook Knowledge Shifts in K-12 Education?
by: Zheng, Tianshi, et al.
Published: (2024)
by: Zheng, Tianshi, et al.
Published: (2024)
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
by: Fan, Wei, et al.
Published: (2024)
by: Fan, Wei, et al.
Published: (2024)
The local existence and uniqueness of strong solutions for Cauchy problem of three-dimensional inhomogeneous incompressible Navier-Stokes-Vlasov equations
by: Ru, Binxuan
Published: (2025)
by: Ru, Binxuan
Published: (2025)
Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation
by: Zhang, Yuwei, et al.
Published: (2026)
by: Zhang, Yuwei, et al.
Published: (2026)
BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models
by: Liu, Liming, et al.
Published: (2026)
by: Liu, Liming, et al.
Published: (2026)
Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts
by: Dwivedi, Chaitanya, et al.
Published: (2026)
by: Dwivedi, Chaitanya, et al.
Published: (2026)
RNR: Teaching Large Language Models to Follow Roles and Rules
by: Wang, Kuan, et al.
Published: (2024)
by: Wang, Kuan, et al.
Published: (2024)
Acquiring and Modelling Abstract Commonsense Knowledge via Conceptualization
by: He, Mutian, et al.
Published: (2022)
by: He, Mutian, et al.
Published: (2022)
Towards Subgraph Isomorphism Counting with Graph Kernels
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models' Uncertainty?
by: Liu, Jiayu, et al.
Published: (2025)
by: Liu, Jiayu, et al.
Published: (2025)
SimdQuickHeap: The QuickHeap Reconsidered
by: Breitling, Johannes, et al.
Published: (2026)
by: Breitling, Johannes, et al.
Published: (2026)
Evolutionary Contrastive Distillation for Language Model Alignment
by: Katz-Samuels, Julian, et al.
Published: (2024)
by: Katz-Samuels, Julian, et al.
Published: (2024)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
by: Wu, Yin, et al.
Published: (2025)
by: Wu, Yin, et al.
Published: (2025)
Transformers for Complex Query Answering over Knowledge Hypergraphs
by: Tsang, Hong Ting, et al.
Published: (2025)
by: Tsang, Hong Ting, et al.
Published: (2025)
Similar Items
-
POPI: Personalizing LLMs via Optimized Natural Language Preference Inference
by: Chen, Yizhuo, et al.
Published: (2025) -
Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-Training
by: Zhuang, Yuchen, et al.
Published: (2025) -
Scaling Laws for Predicting Downstream Performance in LLMs
by: Chen, Yangyi, et al.
Published: (2024) -
Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
by: Zhang, Yuheng, et al.
Published: (2025) -
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
by: Jiayang, Cheng, et al.
Published: (2026)