Your Language Model May Think Too Rigidly: Achieving Reasoning Consistency with Symmetry-Enhanced Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yao, Yihang, Cen, Zhepeng, Li, Miao, Han, William, Zhang, Yuyou, Liu, Emerson, Liu, Zuxin, Gan, Chuang, Zhao, Ding |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
Feasibility Consistent Representation Learning for Safe Reinforcement Learning
par: Cen, Zhepeng, et autres
Publié: (2024)
par: Cen, Zhepeng, et autres
Publié: (2024)
Behavior Injection: Preparing Language Models for Reinforcement Learning
par: Cen, Zhepeng, et autres
Publié: (2025)
par: Cen, Zhepeng, et autres
Publié: (2025)
Learning from Sparse Offline Datasets via Conservative Density Estimation
par: Cen, Zhepeng, et autres
Publié: (2024)
par: Cen, Zhepeng, et autres
Publié: (2024)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2023)
par: Yao, Yihang, et autres
Publié: (2023)
Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization
par: Yao, Yihang, et autres
Publié: (2026)
par: Yao, Yihang, et autres
Publié: (2026)
CrashAgent: Crash Scenario Generation via Multi-modal Reasoning
par: Li, Miao, et autres
Publié: (2025)
par: Li, Miao, et autres
Publié: (2025)
Signal, Image, or Symbolic: Exploring the Best Input Representation for Electrocardiogram-Language Models Through a Unified Framework
par: Han, William, et autres
Publié: (2025)
par: Han, William, et autres
Publié: (2025)
OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2024)
par: Yao, Yihang, et autres
Publié: (2024)
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
par: Cen, Zhepeng, et autres
Publié: (2025)
par: Cen, Zhepeng, et autres
Publié: (2025)
Bridging the Training-Inference Gap in LLMs by Leveraging Self-Generated Tokens
par: Cen, Zhepeng, et autres
Publié: (2024)
par: Cen, Zhepeng, et autres
Publié: (2024)
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
par: Gan, Siyuan, et autres
Publié: (2026)
par: Gan, Siyuan, et autres
Publié: (2026)
Exceptional Enhancement of Optical Anisotropy Achieved via the Strategy of Combining Rigid Groups with High Symmetry and π‐Conjugated Organic Groups in Hybrid Fluorides
par: Ru‐Ling Tang, et autres
Publié: (2025)
par: Ru‐Ling Tang, et autres
Publié: (2025)
We May Have Come Too Far, Too Fast
SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers
par: Barron, Joshua, et autres
Publié: (2025)
par: Barron, Joshua, et autres
Publié: (2025)
Bipedalism for Quadrupedal Robots: Versatile Loco-Manipulation through Risk-Adaptive Reinforcement Learning
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter
par: Hu, Qinghao, et autres
Publié: (2025)
par: Hu, Qinghao, et autres
Publié: (2025)
Rethinking External Slow-Thinking: From Snowball Errors to Probability of Correct Reasoning
par: Gan, Zeyu, et autres
Publié: (2025)
par: Gan, Zeyu, et autres
Publié: (2025)
QuietPaw: Learning Quadrupedal Locomotion with Versatile Noise Preference Alignment
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
par: Zhang, Xue, et autres
Publié: (2025)
par: Zhang, Xue, et autres
Publié: (2025)
Steering LLM Thinking with Budget Guidance
par: Li, Junyan, et autres
Publié: (2025)
par: Li, Junyan, et autres
Publié: (2025)
Reverse Thinking Enhances Missing Information Detection in Large Language Models
par: Liu, Yuxin, et autres
Publié: (2025)
par: Liu, Yuxin, et autres
Publié: (2025)
Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs
par: Tan, Hexiang, et autres
Publié: (2025)
par: Tan, Hexiang, et autres
Publié: (2025)
Achieving binary weight and activation for LLMs using Post-Training Quantization
par: Song, Siqing, et autres
Publié: (2025)
par: Song, Siqing, et autres
Publié: (2025)
Wishful Thinking is Risky Thinking
par: Burgh, Jarrod, et autres
Publié: (2023)
par: Burgh, Jarrod, et autres
Publié: (2023)
Tailored Primitive Initialization is the Secret Key to Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2025)
par: Yao, Yihang, et autres
Publié: (2025)
ELF: A Family of Encoder-Free ECG-Language Models
par: Han, William, et autres
Publié: (2026)
par: Han, William, et autres
Publié: (2026)
A Remeshing Method via Adaptive Multiple Original-Facet-Clipping and Centroidal Voronoi Tessellation
par: Fei, Yue, et autres
Publié: (2025)
par: Fei, Yue, et autres
Publié: (2025)
As We May Think, Information Systems Do Not.
par: Paisley, William J.
Publié: (1968)
par: Paisley, William J.
Publié: (1968)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
par: Zhong, Qihuang, et autres
Publié: (2026)
par: Zhong, Qihuang, et autres
Publié: (2026)
Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor
par: Ma, Guoxin, et autres
Publié: (2026)
par: Ma, Guoxin, et autres
Publié: (2026)
Think How Your Teammates Think: Active Inference Can Benefit Decentralized Execution
par: Wu, Hao, et autres
Publié: (2025)
par: Wu, Hao, et autres
Publié: (2025)
Breaking Symmetries Leads to Diverse Quadrupedal Gaits
par: Ding, Jiayu, et autres
Publié: (2023)
par: Ding, Jiayu, et autres
Publié: (2023)
SQLFixAgent: Towards Semantic-Accurate Text-to-SQL Parsing via Consistency-Enhanced Multi-Agent Collaboration
par: Cen, Jipeng, et autres
Publié: (2024)
par: Cen, Jipeng, et autres
Publié: (2024)
Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
par: Yang, Dayu, et autres
Publié: (2025)
par: Yang, Dayu, et autres
Publié: (2025)
It's Never Too Late to Promote Your Library Services
par: Labiak, Beth
Publié: (2007)
par: Labiak, Beth
Publié: (2007)
Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks
par: Wang, Xinhe, et autres
Publié: (2025)
par: Wang, Xinhe, et autres
Publié: (2025)
BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning
par: Zhong, Han, et autres
Publié: (2025)
par: Zhong, Han, et autres
Publié: (2025)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
par: Huang, Zhidian, et autres
Publié: (2026)
par: Huang, Zhidian, et autres
Publié: (2026)
Documents similaires
-
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
par: Zhang, Yuyou, et autres
Publié: (2025) -
Feasibility Consistent Representation Learning for Safe Reinforcement Learning
par: Cen, Zhepeng, et autres
Publié: (2024) -
Behavior Injection: Preparing Language Models for Reinforcement Learning
par: Cen, Zhepeng, et autres
Publié: (2025) -
Learning from Sparse Offline Datasets via Conservative Density Estimation
par: Cen, Zhepeng, et autres
Publié: (2024) -
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2023)