DARO: Difficulty-Aware Reweighting Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Jingyu, Ma, Lu, Liang, Hao, Shen, Chengyu, Cui, Bin, Zhang, Wentao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Data Proportion Detection for Optimized Data Management for Large Language Models
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature
por: Liu, Zheng, et al.
Publicado: (2025)
por: Liu, Zheng, et al.
Publicado: (2025)
Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL
por: Cai, Qifeng, et al.
Publicado: (2025)
por: Cai, Qifeng, et al.
Publicado: (2025)
AdaTIR: Adaptive Tool-Integrated Reasoning via Difficulty-Aware Policy Optimization
por: Fang, Zhaiyu, et al.
Publicado: (2026)
por: Fang, Zhaiyu, et al.
Publicado: (2026)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)
por: Huang, Chengyu, et al.
Publicado: (2025)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
por: Zhao, Zhengyang, et al.
Publicado: (2026)
por: Zhao, Zhengyang, et al.
Publicado: (2026)
Dynamic Token Reweighting for Robust Vision-Language Models
por: Jiang, Tanqiu, et al.
Publicado: (2025)
por: Jiang, Tanqiu, et al.
Publicado: (2025)
COPO: Consistency-Aware Policy Optimization
por: Han, Jinghang, et al.
Publicado: (2025)
por: Han, Jinghang, et al.
Publicado: (2025)
Let's Verify Math Questions Step by Step
por: Shen, Chengyu, et al.
Publicado: (2025)
por: Shen, Chengyu, et al.
Publicado: (2025)
Tackling the Inherent Difficulty of Noise Filtering in RAG
por: Liu, Jingyu, et al.
Publicado: (2026)
por: Liu, Jingyu, et al.
Publicado: (2026)
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
por: Wang, Weiqi, et al.
Publicado: (2026)
por: Wang, Weiqi, et al.
Publicado: (2026)
PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning
por: Feng, Ruixiang, et al.
Publicado: (2026)
por: Feng, Ruixiang, et al.
Publicado: (2026)
VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
por: Gong, Xuan, et al.
Publicado: (2025)
por: Gong, Xuan, et al.
Publicado: (2025)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
por: Wang, Shiqi, et al.
Publicado: (2024)
por: Wang, Shiqi, et al.
Publicado: (2024)
CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning
por: Wu, Siye, et al.
Publicado: (2026)
por: Wu, Siye, et al.
Publicado: (2026)
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
por: Shen, Chengyu, et al.
Publicado: (2026)
por: Shen, Chengyu, et al.
Publicado: (2026)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
por: Liu, Zheng, et al.
Publicado: (2024)
por: Liu, Zheng, et al.
Publicado: (2024)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
por: Sun, Linzhuang, et al.
Publicado: (2024)
por: Sun, Linzhuang, et al.
Publicado: (2024)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
por: Chen, Mingyang, et al.
Publicado: (2024)
por: Chen, Mingyang, et al.
Publicado: (2024)
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware Neurons
por: Shi, Dan, et al.
Publicado: (2024)
por: Shi, Dan, et al.
Publicado: (2024)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
por: Zhang, Xinnan, et al.
Publicado: (2025)
por: Zhang, Xinnan, et al.
Publicado: (2025)
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
por: Zhang, Wenzheng, et al.
Publicado: (2026)
por: Zhang, Wenzheng, et al.
Publicado: (2026)
Optimizing Class-Level Probability Reweighting Coefficients for Equitable Prompting Accuracy
por: Lin, Ruixi, et al.
Publicado: (2024)
por: Lin, Ruixi, et al.
Publicado: (2024)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
por: Xia, Yinan, et al.
Publicado: (2026)
por: Xia, Yinan, et al.
Publicado: (2026)
Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting
por: Wang, Cheng, et al.
Publicado: (2026)
por: Wang, Cheng, et al.
Publicado: (2026)
Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
por: Cai, Wenrui, et al.
Publicado: (2025)
por: Cai, Wenrui, et al.
Publicado: (2025)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
por: Lu, Keer, et al.
Publicado: (2025)
por: Lu, Keer, et al.
Publicado: (2025)
MathClean: A Benchmark for Synthetic Mathematical Data Cleaning
por: Liang, Hao, et al.
Publicado: (2025)
por: Liang, Hao, et al.
Publicado: (2025)
EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
por: Liu, Xiaoqian, et al.
Publicado: (2025)
por: Liu, Xiaoqian, et al.
Publicado: (2025)
ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
por: Zhu, Xiaoxuan, et al.
Publicado: (2025)
por: Zhu, Xiaoxuan, et al.
Publicado: (2025)
Enhancing Unsupervised Sentence Embeddings via Knowledge-Driven Data Augmentation and Gaussian-Decayed Contrastive Learning
por: Lai, Peichao, et al.
Publicado: (2024)
por: Lai, Peichao, et al.
Publicado: (2024)
DAST: Difficulty-Aware Self-Training on Large Language Models
por: Xue, Boyang, et al.
Publicado: (2025)
por: Xue, Boyang, et al.
Publicado: (2025)
Med-R$^2$: Crafting Trustworthy LLM Physicians via Retrieval and Reasoning of Evidence-Based Medicine
por: Lu, Keer, et al.
Publicado: (2025)
por: Lu, Keer, et al.
Publicado: (2025)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
por: Guo, Tianyu, et al.
Publicado: (2025)
por: Guo, Tianyu, et al.
Publicado: (2025)
Perception-Aware Policy Optimization for Multimodal Reasoning
por: Wang, Zhenhailong, et al.
Publicado: (2025)
por: Wang, Zhenhailong, et al.
Publicado: (2025)
CFBench: A Comprehensive Constraints-Following Benchmark for LLMs
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
por: Dai, Yanqi, et al.
Publicado: (2026)
por: Dai, Yanqi, et al.
Publicado: (2026)
DataSculpt: Crafting Data Landscapes for Long-Context LLMs through Multi-Objective Partitioning
por: Lu, Keer, et al.
Publicado: (2024)
por: Lu, Keer, et al.
Publicado: (2024)
Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization
por: Zhang, Zheyuan, et al.
Publicado: (2026)
por: Zhang, Zheyuan, et al.
Publicado: (2026)
Geometric-Mean Policy Optimization
por: Zhao, Yuzhong, et al.
Publicado: (2025)
por: Zhao, Yuzhong, et al.
Publicado: (2025)
Ejemplares similares
-
Data Proportion Detection for Optimized Data Management for Large Language Models
por: Liang, Hao, et al.
Publicado: (2024) -
Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature
por: Liu, Zheng, et al.
Publicado: (2025) -
Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL
por: Cai, Qifeng, et al.
Publicado: (2025) -
AdaTIR: Adaptive Tool-Integrated Reasoning via Difficulty-Aware Policy Optimization
por: Fang, Zhaiyu, et al.
Publicado: (2026) -
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
por: Huang, Chengyu, et al.
Publicado: (2025)