Salvato in:
| Autori principali: | Han, Xinchen, Afifi, Hossam, Marot, Michel, Wang, Xilu, Yin, Lu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.10048 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement Learning
di: Han, Xinchen, et al.
Pubblicazione: (2026)
di: Han, Xinchen, et al.
Pubblicazione: (2026)
PIQL: Projective Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning
di: Han, Xinchen, et al.
Pubblicazione: (2025)
di: Han, Xinchen, et al.
Pubblicazione: (2025)
Activation Steering for Chain-of-Thought Compression
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2025)
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2025)
Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs
di: Liang, Zhuowen, et al.
Pubblicazione: (2026)
di: Liang, Zhuowen, et al.
Pubblicazione: (2026)
Long Chain-of-Thought Reasoning Across Languages
di: Barua, Josh, et al.
Pubblicazione: (2025)
di: Barua, Josh, et al.
Pubblicazione: (2025)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
An Amortized Efficiency Threshold for Comparing Neural and Heuristic Solvers in Combinatorial Optimization
di: Afifi, Sohaib
Pubblicazione: (2026)
di: Afifi, Sohaib
Pubblicazione: (2026)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2026)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2026)
Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers
di: Huang, Xingyue, et al.
Pubblicazione: (2025)
di: Huang, Xingyue, et al.
Pubblicazione: (2025)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026)
di: Zixian, Wang
Pubblicazione: (2026)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
di: He, Shuo, et al.
Pubblicazione: (2026)
di: He, Shuo, et al.
Pubblicazione: (2026)
Towards impactful challenges: post-challenge paper, benchmarks and other dissemination actions
di: Marot, Antoine, et al.
Pubblicazione: (2023)
di: Marot, Antoine, et al.
Pubblicazione: (2023)
From Offline to Online Memory-Free and Task-Free Continual Learning via Fine-Grained Hypergradients
di: Michel, Nicolas, et al.
Pubblicazione: (2025)
di: Michel, Nicolas, et al.
Pubblicazione: (2025)
Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation
di: Wang, Xinyuan, et al.
Pubblicazione: (2026)
di: Wang, Xinyuan, et al.
Pubblicazione: (2026)
Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
di: Wang, Yizhi, et al.
Pubblicazione: (2025)
di: Wang, Yizhi, et al.
Pubblicazione: (2025)
Optimizing Chain-of-Thought Confidence via Topological and Dirichlet Risk Analysis
di: More, Abhishek, et al.
Pubblicazione: (2025)
di: More, Abhishek, et al.
Pubblicazione: (2025)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
di: Li, Hanyu, et al.
Pubblicazione: (2025)
di: Li, Hanyu, et al.
Pubblicazione: (2025)
NGRPO: Negative-enhanced Group Relative Policy Optimization
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
PA3: Policy-Aware Agent Alignment through Chain-of-Thought
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2026)
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2026)
Scalable Chain of Thoughts via Elastic Reasoning
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
di: Yin, Maxwell J., et al.
Pubblicazione: (2025)
di: Yin, Maxwell J., et al.
Pubblicazione: (2025)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
di: Li, Xuan, et al.
Pubblicazione: (2026)
di: Li, Xuan, et al.
Pubblicazione: (2026)
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
di: Luo, Yu, et al.
Pubblicazione: (2026)
di: Luo, Yu, et al.
Pubblicazione: (2026)
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Linear Chain Transformation: Expanding Optimization Dynamics for Fine-Tuning Large Language Models
di: Wang, Yulong, et al.
Pubblicazione: (2024)
di: Wang, Yulong, et al.
Pubblicazione: (2024)
Dynamic Chain-of-Thought: Towards Adaptive Deep Reasoning
di: Wang, Libo
Pubblicazione: (2025)
di: Wang, Libo
Pubblicazione: (2025)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
di: Ye, Jiacheng, et al.
Pubblicazione: (2024)
di: Ye, Jiacheng, et al.
Pubblicazione: (2024)
Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO
di: Yu, Bowen, et al.
Pubblicazione: (2026)
di: Yu, Bowen, et al.
Pubblicazione: (2026)
PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillation
di: Fan, Tao, et al.
Pubblicazione: (2025)
di: Fan, Tao, et al.
Pubblicazione: (2025)
Output Scaling: YingLong-Delayed Chain of Thought in a Large Pretrained Time Series Forecasting Model
di: Wang, Xue, et al.
Pubblicazione: (2025)
di: Wang, Xue, et al.
Pubblicazione: (2025)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
di: Yao, Jiarui, et al.
Pubblicazione: (2025)
di: Yao, Jiarui, et al.
Pubblicazione: (2025)
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
di: Li, Miao, et al.
Pubblicazione: (2026)
di: Li, Miao, et al.
Pubblicazione: (2026)
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
Ehrenfeucht-Haussler Rank and Chain of Thought
di: Barceló, Pablo, et al.
Pubblicazione: (2025)
di: Barceló, Pablo, et al.
Pubblicazione: (2025)
Improving Chain-of-Thought for Logical Reasoning via Attention-Aware Intervention
di: Phuong, Nguyen Minh, et al.
Pubblicazione: (2026)
di: Phuong, Nguyen Minh, et al.
Pubblicazione: (2026)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
di: Huang, Sili, et al.
Pubblicazione: (2024)
di: Huang, Sili, et al.
Pubblicazione: (2024)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
Chain-of-Thought Predictive Control
di: Jia, Zhiwei, et al.
Pubblicazione: (2023)
di: Jia, Zhiwei, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Automatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement Learning
di: Han, Xinchen, et al.
Pubblicazione: (2026) -
PIQL: Projective Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning
di: Han, Xinchen, et al.
Pubblicazione: (2025) -
Activation Steering for Chain-of-Thought Compression
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2025) -
Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs
di: Liang, Zhuowen, et al.
Pubblicazione: (2026) -
Long Chain-of-Thought Reasoning Across Languages
di: Barua, Josh, et al.
Pubblicazione: (2025)