Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chao, Yang, Tao, Tian, Hongtao, Shi, Yunsheng, Ma, Qiyao, Liu, Xiaotao, Yao, Ting, Ding, Wenbo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Faithfulness to Correctness: Generative Reward Models that Think Critically
par: Ma, Qiyao, et autres
Publié: (2025)
par: Ma, Qiyao, et autres
Publié: (2025)
Discriminative Policy Optimization for Token-Level Reward Models
par: Chen, Hongzhan, et autres
Publié: (2025)
par: Chen, Hongzhan, et autres
Publié: (2025)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
par: Xie, Guofu, et autres
Publié: (2025)
par: Xie, Guofu, et autres
Publié: (2025)
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
par: Shrivastava, Vaishnavi, et autres
Publié: (2025)
par: Shrivastava, Vaishnavi, et autres
Publié: (2025)
WeChat-YATT: A Scalable, Simple, Efficient, and Production Ready Training Library
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
G-Core: A Simple, Scalable and Balanced RLHF Trainer
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
Learning More With Less: Sample Efficient Model-Based RL for Loco-Manipulation
par: Hoffman, Benjamin, et autres
Publié: (2025)
par: Hoffman, Benjamin, et autres
Publié: (2025)
Less is More: Resource-Efficient Low-Rank Adaptation
par: Tian, Chunlin, et autres
Publié: (2025)
par: Tian, Chunlin, et autres
Publié: (2025)
More with Less: An Empirical Study of Turn-Control Strategies for Efficient Coding Agents
par: Gao, Pengfei, et autres
Publié: (2025)
par: Gao, Pengfei, et autres
Publié: (2025)
Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning
par: Zhang, Zhi, et autres
Publié: (2026)
par: Zhang, Zhi, et autres
Publié: (2026)
Less is More: Efficient Brain-Inspired Learning for Autonomous Driving Trajectory Prediction
par: Liao, Haicheng, et autres
Publié: (2024)
par: Liao, Haicheng, et autres
Publié: (2024)
Constrained Dynamics Simulation: More With Less
par: Sathya, Ajay Suresha
Publié: (2024)
par: Sathya, Ajay Suresha
Publié: (2024)
Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers
par: Lou, Chao, et autres
Publié: (2024)
par: Lou, Chao, et autres
Publié: (2024)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025)
par: Tian, Xinyu, et autres
Publié: (2025)
SAC Flow: Sample-Efficient Reinforcement Learning of Flow-Based Policies via Velocity-Reparameterized Sequential Modeling
par: Zhang, Yixian, et autres
Publié: (2025)
par: Zhang, Yixian, et autres
Publié: (2025)
Less is More: Efficient Weight Farcasting with 1-Layer Neural Network
par: Shou, Xiao, et autres
Publié: (2025)
par: Shou, Xiao, et autres
Publié: (2025)
Less is More: Towards Simple Graph Contrastive Learning
par: Zhao, Yanan, et autres
Publié: (2025)
par: Zhao, Yanan, et autres
Publié: (2025)
Bone Soups: A Seek-and-Soup Model Merging Approach for Controllable Multi-Objective Generation
par: Xie, Guofu, et autres
Publié: (2025)
par: Xie, Guofu, et autres
Publié: (2025)
Less-to-More Generalization: Unlocking More Controllability by In-Context Generation
par: Wu, Shaojin, et autres
Publié: (2025)
par: Wu, Shaojin, et autres
Publié: (2025)
Less is More: Parameter-Efficient Selection of Intermediate Tasks for Transfer Learning
par: Schulte, David, et autres
Publié: (2024)
par: Schulte, David, et autres
Publié: (2024)
Learning More from Less: Unlocking Internal Representations for Benchmark Compression
par: Zhang, Yueqi, et autres
Publié: (2026)
par: Zhang, Yueqi, et autres
Publié: (2026)
Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs
par: Banayeeanzade, Amin, et autres
Publié: (2026)
par: Banayeeanzade, Amin, et autres
Publié: (2026)
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
par: Yi, Hao, et autres
Publié: (2026)
par: Yi, Hao, et autres
Publié: (2026)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
par: Liu, Zongkai, et autres
Publié: (2024)
par: Liu, Zongkai, et autres
Publié: (2024)
Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
par: Yang, Zhen, et autres
Publié: (2025)
par: Yang, Zhen, et autres
Publié: (2025)
Less is More, More or Less... Finding the Optimal Threshold for Lexicalization in Chunking
par: Balázs Indig
Publié: (2017)
par: Balázs Indig
Publié: (2017)
Less is More: A Stealthy and Efficient Adversarial Attack Method for DRL-based Autonomous Driving Policies
par: Fan, Junchao, et autres
Publié: (2024)
par: Fan, Junchao, et autres
Publié: (2024)
Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding
par: Bao, Jianzhu, et autres
Publié: (2026)
par: Bao, Jianzhu, et autres
Publié: (2026)
Less is More: Decoder-Free Masked Modeling for Efficient Skeleton Representation Learning
par: Do, Jeonghyeok, et autres
Publié: (2026)
par: Do, Jeonghyeok, et autres
Publié: (2026)
Human-assisted Robotic Policy Refinement via Action Preference Optimization
par: Xia, Wenke, et autres
Publié: (2025)
par: Xia, Wenke, et autres
Publié: (2025)
Less is More: Contextual Sampling for Nonlinear Data-Driven Predictive Control
par: Beerwerth, Julius, et autres
Publié: (2025)
par: Beerwerth, Julius, et autres
Publié: (2025)
When Less Is More.
par: Lettis, Lucy
Publié: (1998)
par: Lettis, Lucy
Publié: (1998)
Doing More with Less.
par: Wagenveld, Linda M.
Publié: (1987)
par: Wagenveld, Linda M.
Publié: (1987)
Less is More: Multimodal Region Representation via Pairwise Inter-view Learning
par: Namgung, Min, et autres
Publié: (2025)
par: Namgung, Min, et autres
Publié: (2025)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
par: Wang, Haoxu, et autres
Publié: (2025)
par: Wang, Haoxu, et autres
Publié: (2025)
Less is More: Adaptive Program Repair with Bug Localization and Preference Learning
par: Dai, Zhenlong, et autres
Publié: (2025)
par: Dai, Zhenlong, et autres
Publié: (2025)
Get More for Less in Decentralized Learning Systems
par: Dhasade, Akash, et autres
Publié: (2023)
par: Dhasade, Akash, et autres
Publié: (2023)
Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior
par: Li, Yulin, et autres
Publié: (2025)
par: Li, Yulin, et autres
Publié: (2025)
Doing More With Less: Towards More Data-Efficient Syndrome-Based Neural Decoders
par: Ismail, Ahmad, et autres
Publié: (2025)
par: Ismail, Ahmad, et autres
Publié: (2025)
When Less is More: The LLM Scaling Paradox in Context Compression
par: Guo, Ruishan, et autres
Publié: (2026)
par: Guo, Ruishan, et autres
Publié: (2026)
Documents similaires
-
From Faithfulness to Correctness: Generative Reward Models that Think Critically
par: Ma, Qiyao, et autres
Publié: (2025) -
Discriminative Policy Optimization for Token-Level Reward Models
par: Chen, Hongzhan, et autres
Publié: (2025) -
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
par: Xie, Guofu, et autres
Publié: (2025) -
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
par: Shrivastava, Vaishnavi, et autres
Publié: (2025) -
WeChat-YATT: A Scalable, Simple, Efficient, and Production Ready Training Library
par: Wu, Junyu, et autres
Publié: (2025)