Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zheng, Liu, Mengjie, Wen, Siwei, Cai, Mengzhang, Cui, Bin, He, Conghui, Zhang, Wentao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
por: Tang, Zinan, et al.
Publicado: (2025)
por: Tang, Zinan, et al.
Publicado: (2025)
DARO: Difficulty-Aware Reweighting Policy Optimization
por: Zhou, Jingyu, et al.
Publicado: (2025)
por: Zhou, Jingyu, et al.
Publicado: (2025)
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
por: Gao, Xin, et al.
Publicado: (2025)
por: Gao, Xin, et al.
Publicado: (2025)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
por: Liu, Zheng, et al.
Publicado: (2024)
por: Liu, Zheng, et al.
Publicado: (2024)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
por: Li, Chen, et al.
Publicado: (2025)
por: Li, Chen, et al.
Publicado: (2025)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
por: Sun, Linzhuang, et al.
Publicado: (2024)
por: Sun, Linzhuang, et al.
Publicado: (2024)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
por: Yao, Dingyu, et al.
Publicado: (2025)
por: Yao, Dingyu, et al.
Publicado: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
por: Lin, Xingyu, et al.
Publicado: (2025)
por: Lin, Xingyu, et al.
Publicado: (2025)
Gradual Learning: Optimizing Fine-Tuning with Partially Mastered Knowledge in Large Language Models
por: Li, Bozhou, et al.
Publicado: (2024)
por: Li, Bozhou, et al.
Publicado: (2024)
Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM
por: Liu, Mengjie, et al.
Publicado: (2025)
por: Liu, Mengjie, et al.
Publicado: (2025)
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
por: Lin, Honglin, et al.
Publicado: (2025)
por: Lin, Honglin, et al.
Publicado: (2025)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
por: He, Yinhan, et al.
Publicado: (2026)
por: He, Yinhan, et al.
Publicado: (2026)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
por: Lin, Xingyu, et al.
Publicado: (2026)
por: Lin, Xingyu, et al.
Publicado: (2026)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
por: Liu, Zheng, et al.
Publicado: (2025)
por: Liu, Zheng, et al.
Publicado: (2025)
Soft Adaptive Policy Optimization
por: Gao, Chang, et al.
Publicado: (2025)
por: Gao, Chang, et al.
Publicado: (2025)
Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding
por: Pan, Lehan, et al.
Publicado: (2026)
por: Pan, Lehan, et al.
Publicado: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Discriminative Policy Optimization for Token-Level Reward Models
por: Chen, Hongzhan, et al.
Publicado: (2025)
por: Chen, Hongzhan, et al.
Publicado: (2025)
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
por: Ren, Mengjie, et al.
Publicado: (2026)
por: Ren, Mengjie, et al.
Publicado: (2026)
Geometric-Mean Policy Optimization
por: Zhao, Yuzhong, et al.
Publicado: (2025)
por: Zhao, Yuzhong, et al.
Publicado: (2025)
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
por: Zhao, Zhiyuan, et al.
Publicado: (2023)
por: Zhao, Zhiyuan, et al.
Publicado: (2023)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
por: Bai, Tianyi, et al.
Publicado: (2025)
por: Bai, Tianyi, et al.
Publicado: (2025)
Data Proportion Detection for Optimized Data Management for Large Language Models
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
Every Little Helps: Building Knowledge Graph Foundation Model with Fine-grained Transferable Multi-modal Tokens
por: Zhang, Yichi, et al.
Publicado: (2026)
por: Zhang, Yichi, et al.
Publicado: (2026)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
por: Zeng, Xia, et al.
Publicado: (2025)
por: Zeng, Xia, et al.
Publicado: (2025)
IGOT: Information Gain Optimized Tokenizer on Domain Adaptive Pretraining
por: Feng, Dawei, et al.
Publicado: (2024)
por: Feng, Dawei, et al.
Publicado: (2024)
EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
por: Liu, Xiaoqian, et al.
Publicado: (2025)
por: Liu, Xiaoqian, et al.
Publicado: (2025)
Token-level Direct Preference Optimization
por: Zeng, Yongcheng, et al.
Publicado: (2024)
por: Zeng, Yongcheng, et al.
Publicado: (2024)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
por: Fodeh, Samah, et al.
Publicado: (2026)
por: Fodeh, Samah, et al.
Publicado: (2026)
Authorship Style Transfer with Policy Optimization
por: Liu, Shuai, et al.
Publicado: (2024)
por: Liu, Shuai, et al.
Publicado: (2024)
More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration
por: Yuan, Xiaoyang, et al.
Publicado: (2025)
por: Yuan, Xiaoyang, et al.
Publicado: (2025)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
por: Wang, Zhengren, et al.
Publicado: (2026)
por: Wang, Zhengren, et al.
Publicado: (2026)
HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs
por: Deng, Ken, et al.
Publicado: (2025)
por: Deng, Ken, et al.
Publicado: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
por: Liu, Yuhang, et al.
Publicado: (2025)
por: Liu, Yuhang, et al.
Publicado: (2025)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
por: Lyu, Shangke, et al.
Publicado: (2025)
por: Lyu, Shangke, et al.
Publicado: (2025)
Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization
por: Zhu, Yutao, et al.
Publicado: (2025)
por: Zhu, Yutao, et al.
Publicado: (2025)
Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing
por: Jiang, Jie, et al.
Publicado: (2026)
por: Jiang, Jie, et al.
Publicado: (2026)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
por: Shao, Ruichen, et al.
Publicado: (2025)
por: Shao, Ruichen, et al.
Publicado: (2025)
Ejemplares similares
-
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
por: Tang, Zinan, et al.
Publicado: (2025) -
DARO: Difficulty-Aware Reweighting Policy Optimization
por: Zhou, Jingyu, et al.
Publicado: (2025) -
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
por: Gao, Xin, et al.
Publicado: (2025) -
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
por: Liu, Zheng, et al.
Publicado: (2024) -
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
por: Li, Chen, et al.
Publicado: (2025)