UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Yang, Xiong, Kai, Ding, Xiao, Du, Li, YangouOuyang, Sun, Zhouhao, Guan, Jiannan, Zhang, Wenbin, Liu, Bin, Hu, Dong, Qin, Bing, Liu, Ting |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
by: Zhao, Yang, et al.
Published: (2026)
by: Zhao, Yang, et al.
Published: (2026)
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
by: Zhao, Yang, et al.
Published: (2026)
by: Zhao, Yang, et al.
Published: (2026)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
by: Zhao, Yang, et al.
Published: (2025)
by: Zhao, Yang, et al.
Published: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
by: He, Yang, et al.
Published: (2026)
by: He, Yang, et al.
Published: (2026)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
by: He, Yang, et al.
Published: (2025)
by: He, Yang, et al.
Published: (2025)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
by: Sun, Zhouhao, et al.
Published: (2024)
by: Sun, Zhouhao, et al.
Published: (2024)
Large Language Models Are Still Misled by Simple Bias Ensembles
by: Sun, Zhouhao, et al.
Published: (2025)
by: Sun, Zhouhao, et al.
Published: (2025)
Causal-Guided Active Learning for Debiasing Large Language Models
by: Du, Li, et al.
Published: (2024)
by: Du, Li, et al.
Published: (2024)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
by: Sun, Zhouhao, et al.
Published: (2025)
by: Sun, Zhouhao, et al.
Published: (2025)
UFO: A UI-Focused Agent for Windows OS Interaction
by: Zhang, Chaoyun, et al.
Published: (2024)
by: Zhang, Chaoyun, et al.
Published: (2024)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate
by: Xiong, Kai, et al.
Published: (2023)
by: Xiong, Kai, et al.
Published: (2023)
UFO: Unlocking Ultra-Efficient Quantized Private Inference with Protocol and Algorithm Co-Optimization
by: Zeng, Wenxuan, et al.
Published: (2026)
by: Zeng, Wenxuan, et al.
Published: (2026)
Diagnosing and Remedying Knowledge Deficiencies in LLMs via Label-free Curricular Meaningful Learning
by: Xiong, Kai, et al.
Published: (2024)
by: Xiong, Kai, et al.
Published: (2024)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
by: Sun, Zhouhao, et al.
Published: (2026)
by: Sun, Zhouhao, et al.
Published: (2026)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
by: Hu, Zhengding, et al.
Published: (2026)
by: Hu, Zhengding, et al.
Published: (2026)
UFO2: The Desktop AgentOS
by: Zhang, Chaoyun, et al.
Published: (2025)
by: Zhang, Chaoyun, et al.
Published: (2025)
UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling
by: Tan, Kaiyuan, et al.
Published: (2026)
by: Tan, Kaiyuan, et al.
Published: (2026)
VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation
by: Wang, Wenhao, et al.
Published: (2025)
by: Wang, Wenhao, et al.
Published: (2025)
Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratch
by: Zeng, Yirong, et al.
Published: (2025)
by: Zeng, Yirong, et al.
Published: (2025)
Text Difficulty Study: Do machines behave the same as humans regarding text difficulty?
by: Chen, Bowen, et al.
Published: (2022)
by: Chen, Bowen, et al.
Published: (2022)
UFO3: Weaving the Digital Agent Galaxy
by: Zhang, Chaoyun, et al.
Published: (2025)
by: Zhang, Chaoyun, et al.
Published: (2025)
Selective Uncertainty Propagation in Offline RL
by: Krishnamurthy, Sanath Kumar, et al.
Published: (2023)
by: Krishnamurthy, Sanath Kumar, et al.
Published: (2023)
UFO: Three Theoretical Papers
by: chang, binggong
Published: (2026)
by: chang, binggong
Published: (2026)
UFO Literature for the Serious Ufologist.
by: Eberhart, George M.
Published: (1980)
by: Eberhart, George M.
Published: (1980)
Meaningful Learning: Enhancing Abstract Reasoning in Large Language Models via Generic Fact Guidance
by: Xiong, Kai, et al.
Published: (2024)
by: Xiong, Kai, et al.
Published: (2024)
History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL
by: He, Jingkai, et al.
Published: (2025)
by: He, Jingkai, et al.
Published: (2025)
AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
by: Zeng, Yirong, et al.
Published: (2026)
by: Zeng, Yirong, et al.
Published: (2026)
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
by: Yi, Hao, et al.
Published: (2026)
by: Yi, Hao, et al.
Published: (2026)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
by: Xiong, Kai, et al.
Published: (2025)
by: Xiong, Kai, et al.
Published: (2025)
UFO Trees: Practical and Provably-Efficient Parallel Batch-Dynamic Trees
by: De Man, Quinten, et al.
Published: (2026)
by: De Man, Quinten, et al.
Published: (2026)
Racing to Release: Priority, Congestion, and Community Recognition in Open-Source LLM Ecosystems
by: Liu, Bin, et al.
Published: (2026)
by: Liu, Bin, et al.
Published: (2026)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
by: Li, Yuhang, et al.
Published: (2026)
by: Li, Yuhang, et al.
Published: (2026)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
by: Liu, Shulin, et al.
Published: (2025)
by: Liu, Shulin, et al.
Published: (2025)
RL-MUL 2.0: Multiplier Design Optimization with Parallel Deep Reinforcement Learning and Space Reduction
by: Zuo, Dongsheng, et al.
Published: (2024)
by: Zuo, Dongsheng, et al.
Published: (2024)
An Efficient Aerial Image Detection with Variable Receptive Fields
by: Wenbin, Liu
Published: (2025)
by: Wenbin, Liu
Published: (2025)
UFO: Uncertainty-aware LiDAR-image Fusion for Off-road Semantic Terrain Map Estimation
by: Kim, Ohn, et al.
Published: (2024)
by: Kim, Ohn, et al.
Published: (2024)
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
by: Zhu, Linghao, et al.
Published: (2025)
by: Zhu, Linghao, et al.
Published: (2025)
SAPO-RL: Sequential Actuator Placement Optimization for Fuselage Assembly via Reinforcement Learning
by: Ye, Peng, et al.
Published: (2025)
by: Ye, Peng, et al.
Published: (2025)
Similar Items
-
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
by: Zhao, Yang, et al.
Published: (2026) -
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
by: Zhao, Yang, et al.
Published: (2026) -
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
by: Zhao, Yang, et al.
Published: (2025) -
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
by: He, Yang, et al.
Published: (2026) -
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
by: He, Yang, et al.
Published: (2025)