Is Long-to-Short a Free Lunch? Investigating Inconsistency and Reasoning Efficiency in LRMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Shu, Wu, Junchao, Wu, Xuansheng, Wong, Derek, Liu, Ninhao, Wang, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Investigating CoT Monitorability in Large Reasoning Models
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models
par: Zhang, Jiayi, et autres
Publié: (2025)
par: Zhang, Jiayi, et autres
Publié: (2025)
Understanding Aha Moments: from External Observations to Internal Mechanisms
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
Rethinking Prompt-based Debiasing in Large Language Models
par: Yang, Xinyi, et autres
Publié: (2025)
par: Yang, Xinyi, et autres
Publié: (2025)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
par: Yang, Junxiao, et autres
Publié: (2025)
par: Yang, Junxiao, et autres
Publié: (2025)
Who Wrote This? The Key to Zero-Shot LLM-Generated Text Detection Is GECScore
par: Wu, Junchao, et autres
Publié: (2024)
par: Wu, Junchao, et autres
Publié: (2024)
Asking LLMs to Verify First is Almost Free Lunch
par: Wu, Shiguang, et autres
Publié: (2025)
par: Wu, Shiguang, et autres
Publié: (2025)
Fraud-R1 : A Multi-Round Benchmark for Assessing the Robustness of LLM Against Augmented Fraud and Phishing Inducements
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions
par: Wu, Junchao, et autres
Publié: (2023)
par: Wu, Junchao, et autres
Publié: (2023)
Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
RepreGuard: Detecting LLM-Generated Text by Revealing Hidden Representation Patterns
par: Chen, Xin, et autres
Publié: (2025)
par: Chen, Xin, et autres
Publié: (2025)
Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation
par: Li, Tong, et autres
Publié: (2025)
par: Li, Tong, et autres
Publié: (2025)
DetectRL: Benchmarking LLM-Generated Text Detection in Real-World Scenarios
par: Wu, Junchao, et autres
Publié: (2024)
par: Wu, Junchao, et autres
Publié: (2024)
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
par: Li, Siyi, et autres
Publié: (2026)
par: Li, Siyi, et autres
Publié: (2026)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
par: Chen, Xin, et autres
Publié: (2026)
par: Chen, Xin, et autres
Publié: (2026)
Let LRMs Break Free from Overthinking via Self-Braking Tuning
par: Zhao, Haoran, et autres
Publié: (2025)
par: Zhao, Haoran, et autres
Publié: (2025)
Self-Regularization with Sparse Autoencoders for Controllable LLM-based Classification
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning
par: Dang, Renfei, et autres
Publié: (2026)
par: Dang, Renfei, et autres
Publié: (2026)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
par: Puerto, Haritz, et autres
Publié: (2026)
par: Puerto, Haritz, et autres
Publié: (2026)
Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs
par: Zhang, Xuan, et autres
Publié: (2025)
par: Zhang, Xuan, et autres
Publié: (2025)
Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty
par: Yu, Zewei, et autres
Publié: (2026)
par: Yu, Zewei, et autres
Publié: (2026)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization
par: Wang, Yun, et autres
Publié: (2026)
par: Wang, Yun, et autres
Publié: (2026)
Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging
par: Wu, Han, et autres
Publié: (2025)
par: Wu, Han, et autres
Publié: (2025)
Benchmarking the Detection of LLMs-Generated Modern Chinese Poetry
par: Wang, Shanshan, et autres
Publié: (2025)
par: Wang, Shanshan, et autres
Publié: (2025)
BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
par: Gu, Jia-Chen, et autres
Publié: (2025)
par: Gu, Jia-Chen, et autres
Publié: (2025)
Is It a Free Lunch for Removing Outliers during Pretraining?
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
Here's a Free Lunch: Sanitizing Backdoored Models with Model Merge
par: Arora, Ansh, et autres
Publié: (2024)
par: Arora, Ansh, et autres
Publié: (2024)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs
par: Li, Haoran, et autres
Publié: (2026)
par: Li, Haoran, et autres
Publié: (2026)
Short Chains, Deep Thoughts: Balancing Reasoning Efficiency and Intra-Segment Capability via Split-Merge Optimization
par: Gui, Runquan, et autres
Publié: (2026)
par: Gui, Runquan, et autres
Publié: (2026)
No Free Lunch: Retrieval-Augmented Generation Undermines Fairness in LLMs, Even for Vigilant Users
par: Hu, Mengxuan, et autres
Publié: (2024)
par: Hu, Mengxuan, et autres
Publié: (2024)
Your thoughts tell who you are: Characterize the reasoning patterns of LRMs
par: Chen, Yida, et autres
Publié: (2025)
par: Chen, Yida, et autres
Publié: (2025)
OCR Error Post-Correction with LLMs in Historical Documents: No Free Lunches
par: Kanerva, Jenna, et autres
Publié: (2025)
par: Kanerva, Jenna, et autres
Publié: (2025)
Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch
par: Douillard, Arthur, et autres
Publié: (2025)
par: Douillard, Arthur, et autres
Publié: (2025)
BRIDGE the Gap: Mitigating Bias Amplification in Automated Scoring of English Language Learners via Inter-group Data Augmentation
par: Wang, Yun, et autres
Publié: (2026)
par: Wang, Yun, et autres
Publié: (2026)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
par: Zhao, Haiyan, et autres
Publié: (2025)
par: Zhao, Haiyan, et autres
Publié: (2025)
DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
par: Wu, Junchao, et autres
Publié: (2026)
par: Wu, Junchao, et autres
Publié: (2026)
Prune&Comp: Free Lunch for Layer-Pruned LLMs via Iterative Pruning with Magnitude Compensation
par: Chen, Xinrui, et autres
Publié: (2025)
par: Chen, Xinrui, et autres
Publié: (2025)
Is Factuality Enhancement a Free Lunch For LLMs? Better Factuality Can Lead to Worse Context-Faithfulness
par: Bi, Baolong, et autres
Publié: (2024)
par: Bi, Baolong, et autres
Publié: (2024)
Documents similaires
-
Investigating CoT Monitorability in Large Reasoning Models
par: Yang, Shu, et autres
Publié: (2025) -
Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models
par: Zhang, Jiayi, et autres
Publié: (2025) -
Understanding Aha Moments: from External Observations to Internal Mechanisms
par: Yang, Shu, et autres
Publié: (2025) -
Rethinking Prompt-based Debiasing in Large Language Models
par: Yang, Xinyi, et autres
Publié: (2025) -
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
par: Yang, Junxiao, et autres
Publié: (2025)