Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yiming, Shi, Zhenbo, Gao, Shuzheng, Gao, Cuiyun, Han, Peiyi, Liu, Chuanyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
par: Huang, Yiming, et autres
Publié: (2026)
par: Huang, Yiming, et autres
Publié: (2026)
Combinatorial Reasoning: Selecting Reasons in Generative AI Pipelines via Combinatorial Optimization
par: Esencan, Mert, et autres
Publié: (2024)
par: Esencan, Mert, et autres
Publié: (2024)
Large Language models for Time Series Analysis: Techniques, Applications, and Challenges
par: Shi, Feifei, et autres
Publié: (2025)
par: Shi, Feifei, et autres
Publié: (2025)
InvestAlign: Overcoming Data Scarcity in Aligning Large Language Models with Investor Decision-Making Processes under Herd Behavior
par: Wang, Huisheng, et autres
Publié: (2025)
par: Wang, Huisheng, et autres
Publié: (2025)
AgriLLM: Harnessing Transformers for Farmer Queries
par: Didwania, Krish, et autres
Publié: (2024)
par: Didwania, Krish, et autres
Publié: (2024)
TraceLLM: Security Diagnosis Through Traces and Smart Contracts in Ethereum
par: Wang, Shuzheng, et autres
Publié: (2025)
par: Wang, Shuzheng, et autres
Publié: (2025)
Bentō: Optimizing Persistent Memory Programs
par: Amaro, Sebastião, et autres
Publié: (2026)
par: Amaro, Sebastião, et autres
Publié: (2026)
Machine Translation with Large Language Models: Decoder Only vs. Encoder-Decoder
par: M., Abhinav P., et autres
Publié: (2024)
par: M., Abhinav P., et autres
Publié: (2024)
Forgetting That Sticks: Quantization-Permanent Unlearning via Circuit Attribution
par: Sadhu, Saisab, et autres
Publié: (2026)
par: Sadhu, Saisab, et autres
Publié: (2026)
When to Reason: Semantic Router for vLLM
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
par: Huang, Chengsong, et autres
Publié: (2026)
par: Huang, Chengsong, et autres
Publié: (2026)
Learning Personalized Utility Functions for Drivers in Ride-hailing Systems Using Ensemble Hypernetworks
par: Mai, Weiming, et autres
Publié: (2025)
par: Mai, Weiming, et autres
Publié: (2025)
Beyond the Mean: Modelling Annotation Distributions in Continuous Affect Prediction
par: Pinitas, Kosmas, et autres
Publié: (2026)
par: Pinitas, Kosmas, et autres
Publié: (2026)
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
par: Zidan, Arif Hassan, et autres
Publié: (2026)
par: Zidan, Arif Hassan, et autres
Publié: (2026)
MiTa: A Hierarchical Multi-Agent Collaboration Framework with Memory-integrated and Task Allocation
par: Zhang, XiaoJie, et autres
Publié: (2026)
par: Zhang, XiaoJie, et autres
Publié: (2026)
Machine Intelligence on Wireless Edge Networks
par: Vadlamani, Sri Krishna, et autres
Publié: (2025)
par: Vadlamani, Sri Krishna, et autres
Publié: (2025)
Effects of Prompt Length on Domain-specific Tasks for Large Language Models
par: Liu, Qibang, et autres
Publié: (2025)
par: Liu, Qibang, et autres
Publié: (2025)
A Dual Power Grid Cascading Failure Model for the Vulnerability Analysis
par: Zhou, Tianxin, et autres
Publié: (2024)
par: Zhou, Tianxin, et autres
Publié: (2024)
Adaptive Semantic Token Communication for Transformer-based Edge Inference
par: Devoto, Alessio, et autres
Publié: (2025)
par: Devoto, Alessio, et autres
Publié: (2025)
LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems
par: Moia, Vitor Hugo Galhardo, et autres
Publié: (2025)
par: Moia, Vitor Hugo Galhardo, et autres
Publié: (2025)
Effect of Selection Format on LLM Performance
par: Han, Yuchen, et autres
Publié: (2025)
par: Han, Yuchen, et autres
Publié: (2025)
Robust Reasoning and Learning with Brain-Inspired Representations under Hardware-Induced Nonlinearities
par: Chung, William Youngwoo, et autres
Publié: (2026)
par: Chung, William Youngwoo, et autres
Publié: (2026)
On Optimizing Hyperparameters for Quantum Neural Networks
par: Herbst, Sabrina, et autres
Publié: (2024)
par: Herbst, Sabrina, et autres
Publié: (2024)
Scalable Thermodynamic Second-order Optimization
par: Donatella, Kaelan, et autres
Publié: (2025)
par: Donatella, Kaelan, et autres
Publié: (2025)
Pruning for Improved ADC Efficiency in Crossbar-based Analog In-memory Accelerators
par: Ibrayev, Timur, et autres
Publié: (2024)
par: Ibrayev, Timur, et autres
Publié: (2024)
AutoGMap: Learning to Map Large-scale Sparse Graphs on Memristive Crossbars
par: Lyu, Bo, et autres
Publié: (2021)
par: Lyu, Bo, et autres
Publié: (2021)
Improving Performance Prediction of Electrolyte Formulations with Transformer-based Molecular Representation Model
par: Priyadarsini, Indra, et autres
Publié: (2024)
par: Priyadarsini, Indra, et autres
Publié: (2024)
Trustworthy Tree-based Machine Learning by $MoS_2$ Flash-based Analog CAM with Inherent Soft Boundaries
par: Wen, Bo, et autres
Publié: (2025)
par: Wen, Bo, et autres
Publié: (2025)
Unleashing the Expressive Power of Pulse-Based Quantum Neural Networks
par: Tao, Han-Xiao, et autres
Publié: (2024)
par: Tao, Han-Xiao, et autres
Publié: (2024)
SAIL: Scene-aware Adaptive Iterative Learning for Long-Tail Trajectory Prediction in Autonomous Vehicles
par: Rao, Bin, et autres
Publié: (2026)
par: Rao, Bin, et autres
Publié: (2026)
Struggling or Thriving With Technology at Work: A Mixed‐Method Analysis of Personal and Organizational ICT Resources
par: Rita Jakstiene, et autres
Publié: (2025)
par: Rita Jakstiene, et autres
Publié: (2025)
NVCiM-PT: An NVCiM-assisted Prompt Tuning Framework for Edge LLMs
par: Qin, Ruiyang, et autres
Publié: (2024)
par: Qin, Ruiyang, et autres
Publié: (2024)
Can Large Language Models Act as Symbolic Reasoners?
par: Sullivan, Rob, et autres
Publié: (2024)
par: Sullivan, Rob, et autres
Publié: (2024)
Self-Adaptive Ising Machines for Constrained Optimization
par: Delacour, Corentin
Publié: (2025)
par: Delacour, Corentin
Publié: (2025)
Generation of Optimized Solidity Code for Machine Learning Models using LLMs
par: Sham, Nikumbh Sarthak, et autres
Publié: (2025)
par: Sham, Nikumbh Sarthak, et autres
Publié: (2025)
LLM-Aided Customizable Profiling of Code Data Based On Programming Language Concepts
par: Thorat, Pankaj, et autres
Publié: (2025)
par: Thorat, Pankaj, et autres
Publié: (2025)
Affordable Precision Agriculture: A Deployment-Oriented Review of Low-Cost, Low-Power Edge AI and TinyML for Resource-Constrained Farming Systems
par: Samanta, Riya, et autres
Publié: (2026)
par: Samanta, Riya, et autres
Publié: (2026)
Optimizing Binary and Ternary Neural Network Inference on RRAM Crossbars using CIM-Explorer
par: Pelke, Rebecca, et autres
Publié: (2025)
par: Pelke, Rebecca, et autres
Publié: (2025)
A Hybrid Tucker-LSTM Tensor Network Model for SOC Prediction in Electric Vehicles
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
Machine Learning-assisted High-speed Combinatorial Optimization with Ising Machines for Dynamically Changing Problems
par: Hamakawa, Yohei, et autres
Publié: (2025)
par: Hamakawa, Yohei, et autres
Publié: (2025)
Documents similaires
-
Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
par: Huang, Yiming, et autres
Publié: (2026) -
Combinatorial Reasoning: Selecting Reasons in Generative AI Pipelines via Combinatorial Optimization
par: Esencan, Mert, et autres
Publié: (2024) -
Large Language models for Time Series Analysis: Techniques, Applications, and Challenges
par: Shi, Feifei, et autres
Publié: (2025) -
InvestAlign: Overcoming Data Scarcity in Aligning Large Language Models with Investor Decision-Making Processes under Herd Behavior
par: Wang, Huisheng, et autres
Publié: (2025) -
AgriLLM: Harnessing Transformers for Farmer Queries
par: Didwania, Krish, et autres
Publié: (2024)