Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yunjian, Wang, Sudong, Li, Yang, Xu, Peiran, Zhou, Conghao, Ma, Xiaoyue, Li, Jianing, Zhu, Yao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
di: Xu, Peiran, et al.
Pubblicazione: (2025)
di: Xu, Peiran, et al.
Pubblicazione: (2025)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
di: Wang, Sudong, et al.
Pubblicazione: (2025)
di: Wang, Sudong, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
di: Zhou, Yixiao, et al.
Pubblicazione: (2026)
di: Zhou, Yixiao, et al.
Pubblicazione: (2026)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
di: Wang, Sudong, et al.
Pubblicazione: (2026)
di: Wang, Sudong, et al.
Pubblicazione: (2026)
LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models
di: Wei, Songtao, et al.
Pubblicazione: (2026)
di: Wei, Songtao, et al.
Pubblicazione: (2026)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
Can Graph-Based Microservice Performance Detection Be Used for Microservice Intrusion Detection?
di: Ma, Yunjian
Pubblicazione: (2026)
di: Ma, Yunjian
Pubblicazione: (2026)
Elastic Motion Policy: An Adaptive Dynamical System for Robust and Efficient One-Shot Imitation Learning
di: Li, Tianyu, et al.
Pubblicazione: (2025)
di: Li, Tianyu, et al.
Pubblicazione: (2025)
Question Answering for Decisionmaking in Green Building Design: A Multimodal Data Reasoning Method Driven by Large Language Models
di: Li, Yihui, et al.
Pubblicazione: (2024)
di: Li, Yihui, et al.
Pubblicazione: (2024)
EventFlash: Towards Efficient MLLMs for Event-Based Vision
di: Liu, Shaoyu, et al.
Pubblicazione: (2026)
di: Liu, Shaoyu, et al.
Pubblicazione: (2026)
Unsupervised Domain Adaptive Lane Detection via Contextual Contrast and Aggregation
di: Zhou, Kunyang, et al.
Pubblicazione: (2024)
di: Zhou, Kunyang, et al.
Pubblicazione: (2024)
Efficient Deployment of Large Language Models on Resource-constrained Devices
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
di: Li, Xuan, et al.
Pubblicazione: (2023)
di: Li, Xuan, et al.
Pubblicazione: (2023)
Hawkeye:Efficient Reasoning with Model Collaboration
di: She, Jianshu, et al.
Pubblicazione: (2025)
di: She, Jianshu, et al.
Pubblicazione: (2025)
Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
di: Zhang, Zizhuo, et al.
Pubblicazione: (2025)
di: Zhang, Zizhuo, et al.
Pubblicazione: (2025)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
di: Ma, Chuang, et al.
Pubblicazione: (2026)
di: Ma, Chuang, et al.
Pubblicazione: (2026)
Zero-Shot Human Mobility Forecasting via Large Language Model with Hierarchical Reasoning
di: Li, Wenyao, et al.
Pubblicazione: (2025)
di: Li, Wenyao, et al.
Pubblicazione: (2025)
OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models
di: Liang, Haijian, et al.
Pubblicazione: (2026)
di: Liang, Haijian, et al.
Pubblicazione: (2026)
Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling
di: Zhou, Xubin, et al.
Pubblicazione: (2026)
di: Zhou, Xubin, et al.
Pubblicazione: (2026)
Agglomeration Economies and Intergovernmental Cooperation in Productive Disaster Management Expenditure
di: Sudong Kim
Pubblicazione: (2026)
di: Sudong Kim
Pubblicazione: (2026)
Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
di: Yang, Yujiao, et al.
Pubblicazione: (2025)
di: Yang, Yujiao, et al.
Pubblicazione: (2025)
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
di: Li, Ling, et al.
Pubblicazione: (2025)
di: Li, Ling, et al.
Pubblicazione: (2025)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
di: Huang, Xinmeng, et al.
Pubblicazione: (2024)
di: Huang, Xinmeng, et al.
Pubblicazione: (2024)
One-Shot Learning as Instruction Data Prospector for Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2023)
di: Li, Yunshui, et al.
Pubblicazione: (2023)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models
di: Ding, Xuan, et al.
Pubblicazione: (2026)
di: Ding, Xuan, et al.
Pubblicazione: (2026)
Training Large Language Models to Reason via EM Policy Gradient
di: Xu, Tianbing
Pubblicazione: (2025)
di: Xu, Tianbing
Pubblicazione: (2025)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
di: Wang, Xinyuan, et al.
Pubblicazione: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2026)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2026)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
di: Xi, Zhiheng, et al.
Pubblicazione: (2023)
DRARL: Disengagement-Reason-Augmented Reinforcement Learning for Efficient Improvement of Autonomous Driving Policy
di: Zhou, Weitao, et al.
Pubblicazione: (2025)
di: Zhou, Weitao, et al.
Pubblicazione: (2025)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning
di: Qi, Zhuang, et al.
Pubblicazione: (2025)
di: Qi, Zhuang, et al.
Pubblicazione: (2025)
Dynamic Containerized Modular Capacity Planning and Resource Allocation in Hyperconnected Supply Chain Ecosystems
di: Liu, Xiaoyue, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyue, et al.
Pubblicazione: (2025)
Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization
di: He, Junlin, et al.
Pubblicazione: (2026)
di: He, Junlin, et al.
Pubblicazione: (2026)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
di: Xu, Peiran, et al.
Pubblicazione: (2025) -
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
di: Wang, Sudong, et al.
Pubblicazione: (2025) -
Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the Key
di: Yang, Zhihe, et al.
Pubblicazione: (2025) -
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
di: Zhou, Yixiao, et al.
Pubblicazione: (2026) -
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
di: Wang, Sudong, et al.
Pubblicazione: (2026)