IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Yinhan, Zhu, Yaochen, Shi, Mingjia, Zheng, Wendy, Su, Lin, Wang, Xiaoqing, Guo, Qi, Li, Jundong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning
par: Shi, Mingjia, et autres
Publié: (2026)
par: Shi, Mingjia, et autres
Publié: (2026)
SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
par: He, Yinhan, et autres
Publié: (2025)
par: He, Yinhan, et autres
Publié: (2025)
Global Graph Counterfactual Explanation: A Subgraph Mapping Approach
par: He, Yinhan, et autres
Publié: (2024)
par: He, Yinhan, et autres
Publié: (2024)
Explaining Graph Neural Networks with Large Language Models: A Counterfactual Perspective for Molecular Property Prediction
par: He, Yinhan, et autres
Publié: (2024)
par: He, Yinhan, et autres
Publié: (2024)
Causal Inference with Latent Variables: Recent Advances and Future Prospectives
par: Zhu, Yaochen, et autres
Publié: (2024)
par: Zhu, Yaochen, et autres
Publié: (2024)
MolEdit: Knowledge Editing for Multimodal Molecule Language Models
par: Lei, Zhenyu, et autres
Publié: (2025)
par: Lei, Zhenyu, et autres
Publié: (2025)
Edge Prompt Tuning for Graph Neural Networks
par: Fu, Xingbo, et autres
Publié: (2025)
par: Fu, Xingbo, et autres
Publié: (2025)
DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
par: Liu, Hanbing, et autres
Publié: (2025)
par: Liu, Hanbing, et autres
Publié: (2025)
Efficient Prompt Optimization Through the Lens of Best Arm Identification
par: Shi, Chengshuai, et autres
Publié: (2024)
par: Shi, Chengshuai, et autres
Publié: (2024)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025)
par: Qi, Penghui, et autres
Publié: (2025)
Spectral Greedy Coresets for Graph Neural Networks
par: Ding, Mucong, et autres
Publié: (2024)
par: Ding, Mucong, et autres
Publié: (2024)
PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling
par: Venkatesh, Kavana, et autres
Publié: (2026)
par: Venkatesh, Kavana, et autres
Publié: (2026)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
par: Wu, Feijie, et autres
Publié: (2025)
par: Wu, Feijie, et autres
Publié: (2025)
Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
par: He, Haoyu, et autres
Publié: (2025)
par: He, Haoyu, et autres
Publié: (2025)
Token-Budget-Aware LLM Reasoning
par: Han, Tingxu, et autres
Publié: (2024)
par: Han, Tingxu, et autres
Publié: (2024)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
par: Guo, Zhenyuan, et autres
Publié: (2026)
par: Guo, Zhenyuan, et autres
Publié: (2026)
APOLLO: An Optimized Training Approach for Long-form Numerical Reasoning
par: Sun, Jiashuo, et autres
Publié: (2022)
par: Sun, Jiashuo, et autres
Publié: (2022)
RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
par: He, Haoyu, et autres
Publié: (2025)
par: He, Haoyu, et autres
Publié: (2025)
Few-shot Knowledge Graph Relational Reasoning via Subgraph Adaptation
par: Liu, Haochen, et autres
Publié: (2024)
par: Liu, Haochen, et autres
Publié: (2024)
Question-Aware Knowledge Graph Prompting for Enhancing Large Language Models
par: Liu, Haochen, et autres
Publié: (2025)
par: Liu, Haochen, et autres
Publié: (2025)
Energy-Based Models for Predicting Mutational Effects on Proteins
par: Soga, Patrick, et autres
Publié: (2025)
par: Soga, Patrick, et autres
Publié: (2025)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
par: Su, DiJia, et autres
Publié: (2025)
par: Su, DiJia, et autres
Publié: (2025)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
par: Chen, Yuhan, et autres
Publié: (2025)
par: Chen, Yuhan, et autres
Publié: (2025)
Reasoning Bias of Next Token Prediction Training
par: Lin, Pengxiao, et autres
Publié: (2025)
par: Lin, Pengxiao, et autres
Publié: (2025)
COPO: Consistency-Aware Policy Optimization
par: Han, Jinghang, et autres
Publié: (2025)
par: Han, Jinghang, et autres
Publié: (2025)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
par: Zhu, Mingcheng, et autres
Publié: (2026)
par: Zhu, Mingcheng, et autres
Publié: (2026)
Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization
par: Zhang, Zheyuan, et autres
Publié: (2026)
par: Zhang, Zheyuan, et autres
Publié: (2026)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
Graph Neural Networks Are More Than Filters: Revisiting and Benchmarking from A Spectral Perspective
par: Dong, Yushun, et autres
Publié: (2024)
par: Dong, Yushun, et autres
Publié: (2024)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
par: Xia, Yinan, et autres
Publié: (2026)
par: Xia, Yinan, et autres
Publié: (2026)
HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
par: Huang, Chengyu, et autres
Publié: (2025)
par: Huang, Chengyu, et autres
Publié: (2025)
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
par: Ko, Jongwoo, et autres
Publié: (2026)
par: Ko, Jongwoo, et autres
Publié: (2026)
Usable XAI: 10 Strategies Towards Exploiting Explainability in the LLM Era
par: Wu, Xuansheng, et autres
Publié: (2024)
par: Wu, Xuansheng, et autres
Publié: (2024)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
par: Huo, Mingjia, et autres
Publié: (2024)
par: Huo, Mingjia, et autres
Publié: (2024)
FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
par: Ding, Yuyang, et autres
Publié: (2025)
par: Ding, Yuyang, et autres
Publié: (2025)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
Documents similaires
-
Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning
par: Shi, Mingjia, et autres
Publié: (2026) -
SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
par: He, Yinhan, et autres
Publié: (2025) -
Global Graph Counterfactual Explanation: A Subgraph Mapping Approach
par: He, Yinhan, et autres
Publié: (2024) -
Explaining Graph Neural Networks with Large Language Models: A Counterfactual Perspective for Molecular Property Prediction
par: He, Yinhan, et autres
Publié: (2024) -
Causal Inference with Latent Variables: Recent Advances and Future Prospectives
par: Zhu, Yaochen, et autres
Publié: (2024)