Enregistré dans:
| Auteurs principaux: | Wu, Haoze, Wang, Cheng, Zhao, Wenshuo, He, Junxian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.21188 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Internalizing World Models via Self-Play Finetuning for Agentic RL
par: Chen, Shiqi, et autres
Publié: (2025)
par: Chen, Shiqi, et autres
Publié: (2025)
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
par: Zeng, Weihao, et autres
Publié: (2025)
par: Zeng, Weihao, et autres
Publié: (2025)
Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?
par: Chi, Haoang, et autres
Publié: (2025)
par: Chi, Haoang, et autres
Publié: (2025)
What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning
par: Liu, Wei, et autres
Publié: (2023)
par: Liu, Wei, et autres
Publié: (2023)
ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning
par: Feng, Zihao, et autres
Publié: (2025)
par: Feng, Zihao, et autres
Publié: (2025)
Objective Metrics for Evaluating Large Language Models Using External Data Sources
par: Du, Haoze, et autres
Publié: (2025)
par: Du, Haoze, et autres
Publié: (2025)
Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
par: Zhao, Chengshuai, et autres
Publié: (2025)
par: Zhao, Chengshuai, et autres
Publié: (2025)
Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
par: Kulkarni, Atharva, et autres
Publié: (2025)
par: Kulkarni, Atharva, et autres
Publié: (2025)
TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learning
par: Shandilya, Shivam, et autres
Publié: (2024)
par: Shandilya, Shivam, et autres
Publié: (2024)
Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning
par: He, Haoze, et autres
Publié: (2026)
par: He, Haoze, et autres
Publié: (2026)
Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs
par: Cheng, Xinhao, et autres
Publié: (2025)
par: Cheng, Xinhao, et autres
Publié: (2025)
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
par: Sun, Yiyou, et autres
Publié: (2025)
par: Sun, Yiyou, et autres
Publié: (2025)
DBR: Divergence-Based Regularization for Debiasing Natural Language Understanding Models
par: Li, Zihao, et autres
Publié: (2025)
par: Li, Zihao, et autres
Publié: (2025)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
par: Hu, Zhiyuan, et autres
Publié: (2026)
par: Hu, Zhiyuan, et autres
Publié: (2026)
Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning
par: Xu, Fangzhi, et autres
Publié: (2025)
par: Xu, Fangzhi, et autres
Publié: (2025)
From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
par: Huang, Yuzhen, et autres
Publié: (2025)
par: Huang, Yuzhen, et autres
Publié: (2025)
Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size
par: Kukreja, Dikshant, et autres
Publié: (2026)
par: Kukreja, Dikshant, et autres
Publié: (2026)
HAL: Inducing Human-likeness in LLMs with Alignment
par: Hasan, Masum, et autres
Publié: (2026)
par: Hasan, Masum, et autres
Publié: (2026)
Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
par: Sun, Shaoning, et autres
Publié: (2026)
par: Sun, Shaoning, et autres
Publié: (2026)
Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL
par: Patel, Nyal, et autres
Publié: (2025)
par: Patel, Nyal, et autres
Publié: (2025)
Synthetic Data RL: Task Definition Is All You Need
par: Guo, Yiduo, et autres
Publié: (2025)
par: Guo, Yiduo, et autres
Publié: (2025)
From Lists to Emojis: How Format Bias Affects Model Alignment
par: Zhang, Xuanchang, et autres
Publié: (2024)
par: Zhang, Xuanchang, et autres
Publié: (2024)
CodeMirage: A Multi-Lingual Benchmark for Detecting AI-Generated and Paraphrased Source Code from Production-Level LLMs
par: Guo, Hanxi, et autres
Publié: (2025)
par: Guo, Hanxi, et autres
Publié: (2025)
Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis
par: Wei, Anjiang, et autres
Publié: (2025)
par: Wei, Anjiang, et autres
Publié: (2025)
Lemur: Integrating Large Language Models in Automated Program Verification
par: Wu, Haoze, et autres
Publié: (2023)
par: Wu, Haoze, et autres
Publié: (2023)
Capability-Oriented Training Induced Alignment Risk
par: Zhou, Yujun, et autres
Publié: (2026)
par: Zhou, Yujun, et autres
Publié: (2026)
From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment
par: Chen, Hao, et autres
Publié: (2026)
par: Chen, Hao, et autres
Publié: (2026)
Mirage: A Multi-Level Superoptimizer for Tensor Programs
par: Wu, Mengdi, et autres
Publié: (2024)
par: Wu, Mengdi, et autres
Publié: (2024)
Weight-Inherited Distillation for Task-Agnostic BERT Compression
par: Wu, Taiqiang, et autres
Publié: (2023)
par: Wu, Taiqiang, et autres
Publié: (2023)
Baichuan Alignment Technical Report
par: Lin, Mingan, et autres
Publié: (2024)
par: Lin, Mingan, et autres
Publié: (2024)
How Does Code Pretraining Affect Language Model Task Performance?
par: Petty, Jackson, et autres
Publié: (2024)
par: Petty, Jackson, et autres
Publié: (2024)
ToolRL: Reward is All Tool Learning Needs
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Optimizing Mixture of Block Attention
par: Xiao, Guangxuan, et autres
Publié: (2025)
par: Xiao, Guangxuan, et autres
Publié: (2025)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
par: Liu, Runze, et autres
Publié: (2025)
par: Liu, Runze, et autres
Publié: (2025)
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
par: Choi, Hyeong Kyu, et autres
Publié: (2025)
par: Choi, Hyeong Kyu, et autres
Publié: (2025)
On-Policy RL with Optimal Reward Baseline
par: Hao, Yaru, et autres
Publié: (2025)
par: Hao, Yaru, et autres
Publié: (2025)
Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals?
par: He, Yufei, et autres
Publié: (2025)
par: He, Yufei, et autres
Publié: (2025)
Prompt Optimization via Adversarial In-Context Learning
par: Do, Xuan Long, et autres
Publié: (2023)
par: Do, Xuan Long, et autres
Publié: (2023)
Mortgage Language Model: Domain-Adaptive Pretraining with Residual Instruction, Alignment Tuning, and Task-Specific Routing
par: Jain, Manish, et autres
Publié: (2025)
par: Jain, Manish, et autres
Publié: (2025)
Documents similaires
-
Internalizing World Models via Self-Play Finetuning for Agentic RL
par: Chen, Shiqi, et autres
Publié: (2025) -
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
par: Zeng, Weihao, et autres
Publié: (2025) -
Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?
par: Chi, Haoang, et autres
Publié: (2025) -
What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning
par: Liu, Wei, et autres
Publié: (2023) -
ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning
par: Feng, Zihao, et autres
Publié: (2025)